WorksheetsDiagnóstico Preprocesamiento de datos 2025-2
Total questions: 15
Worksheet time: 18mins
¿Qué es el preprocesamiento de datos?
El entrenamiento de un modelo
El análisis estadístico de los datos
El conjunto de técnicas para limpiar y preparar datos para su análisis
La visualización de los resultados
¿Cuál de los siguientes no es un tipo de dato común en ciencia de datos?
Numérico
Categórico
Fotográfico
Fecha
¿Qué función de pandas se utiliza para detectar valores nulos?
dropna()
isnull()
replace()
astype()
¿Cuál de las siguientes bibliotecas se usa principalmente para manipulación de datos en Python?
matplotlib
seaborn
pandas
sklearn
¿Qué significa normalizar los datos?
Agrupar los datos por categorías
Escalar los datos a un mismo rango
Eliminar los valores nulos
Mezclar datos de distintas fuentes
¿Qué técnica convierte variables categóricas en variables numéricas?
Agrupamiento
One-hot encoding
Reducción de dimensionalidad
Normalización
¿Qué función se usa para rellenar valores nulos en pandas?
fillna()
groupby()
join()
drop()
¿Cuál es una forma de escalar datos entre 0 y 1?
Z-score
MinMaxScaler
RobustScaler
Log transformation
¿Qué es un outlier?
Un valor normal
Un valor extremo o atípico
Un valor repetido
Un valor categórico
¿Qué hace drop_duplicates() en pandas?
Elimina filas duplicadas
Elimina columnas
Elimina valores nulos
Agrupa los datos
Estás analizando un dataset con más de 50 variables numéricas para predecir la tasa de abandono de clientes. Al revisar las correlaciones, observas que muchas variables están fuertemente correlacionadas entre sí. ¿Qué deberías considerar hacer antes de entrenar un modelo lineal?
Normalizar todas las variables
Eliminar outliers
Aplicar técnicas para reducir la multicolinealidad (como PCA o eliminación de variables)
Codificar las variables categóricas
Te entregan un conjunto de datos que contiene ingresos de personas, pero ves que la escala varía entre millones y cientos. Quieres usar un modelo de redes neuronales. ¿Qué técnica aplicarías antes de entrenar el modelo?
Imputación por mediana
Codificación ordinal
Escalado de variables (StandardScaler o MinMaxScaler)
Agrupamiento por rangos
Estás trabajando en un proyecto de clasificación con un dataset que incluye varias variables categóricas con más de 30 categorías cada una. ¿Cuál es el principal riesgo de aplicar one-hot encoding directamente sobre estas variables?
El modelo ignorará esas variables
Se creará una matriz dispersa con demasiadas columnas, lo que puede afectar el rendimiento
Los datos quedarán desordenados
No se podrán usar modelos lineales
Un cliente te entrega un dataset con más de 200 columnas y te pide que construyas un modelo predictivo sin perder mucha información. ¿Qué técnica usarías para reducir la dimensionalidad sin eliminar información clave?
Eliminar las columnas con valores nulos
Codificar todas las variables como texto
Aplicar PCA o métodos similares para conservar varianza
Eliminar todas las variables categóricas
Después de un preprocesamiento completo, tu modelo de regresión lineal tiene una baja precisión. Sospechas que la normalización afectó el modelo. ¿Qué deberías revisar?
Si hay valores duplicados
Si el método de escalado fue adecuado para el tipo de modelo
Si se aplicó one-hot encoding
Si el dataset está balanceado
