WorksheetsPreprocesamiento de Datos
Total questions: 37
Worksheet time: 21mins
El preprocesamiento de datos es un paso opcional antes del modelado de machine learning.
Verdadero
Falso
¿Cuál de los siguientes NO es un objetivo del preprocesamiento de datos?
Mejorar la calidad de los datos
Aumentar los valores faltantes
Reducir el ruido en los datos
Hacer comparables las variables
El preprocesamiento busca convertir datos crudos en datos listos para análisis.
Verdadero
Falso
¿En qué etapa del ciclo de ciencia de datos se aplica normalmente el preprocesamiento?
Después de entrenar el modelo
Antes del análisis exploratorio
Durante la limpieza y preparación de datos
Solo en el despliegue del modelo
Una de las etapas del preprocesamiento incluye detección de outliers.
Verdadero
Falso
¿Por qué es importante el preprocesamiento?
Reduce sesgos y mejora la precisión de los modelos
Solo sirve para visualizar datos
Se usa únicamente con datos numéricos
Sustituye a la validación de modelos
El preprocesamiento puede incluir:
Escalado de variables
Detección de valores atípicos
Codificación de categorías
Todas las anteriores
La estandarización y normalización forman parte del preprocesamiento.
Verdadero
Falso
Los datos categóricos siempre representan cantidades numéricas.
Verdadero
Falso
¿Cuál de los siguientes es un ejemplo de variable numérica continua?
Número de hijos
Altura en metros
País de residencia
Código postal
El formato fecha puede analizarse como variable numérica o categórica según el contexto.
Verdadero
Falso
¿Qué tipo de variable es “color de ojos”?
Numérica
Categórica nominal
Categórica ordinal
Texto sin estructurar
Una variable ordinal representa categorías con un orden implícito.
Ejemplo: Bajo, Medio, Alto
Ejemplo: Rojo, Verde, Azul
El salario expresado en dólares corresponde a un tipo de dato:
Categórico nominal
Numérico continuo
Numérico discreto
Texto
Una variable discreta toma valores contables como enteros.
Verdadero
Falso
El borrado de filas con valores faltantes es siempre la mejor estrategia.
Verdadero
Falso
¿Cuál de las siguientes es una técnica de imputación simple?
Promedio (media)
Árboles de decisión
KNN Imputer
Red neuronal
La imputación con la moda es útil para variables categóricas.
Verdadero
Falso
Cuando los datos faltan completamente al azar (MCAR), la eliminación de filas suele ser menos riesgosa.
Verdadero
Falso
¿Qué desventaja tiene la imputación con la media?
Distorsiona la varianza
Funciona solo con texto
Aumenta valores faltantes
Reduce outliers
La técnica de imputación más adecuada para datos categóricos ordinales es:
Moda
Media
KNN
Mediana
Rellenar valores faltantes con un valor constante (ej. -999) puede introducir sesgos.
Verdadero
Falso
La imputación con modelos predictivos se considera más avanzada que la imputación simple.
Verdadero
Falso
Los outliers siempre deben eliminarse.
Verdadero
Falso
¿Cuál es un método estadístico común para detectar outliers?
Gráfico de barras
Rainclouds
Histogramas
Treemap
¿Qué representa un valor superior a Q3 + 1.5*IQR?
¿Cuál es un método estadístico común para detectar outliers?
Gráfico de barras
Rainclouds
Histogramas
Treemap
¿Qué representa un valor superior a Q3 + 1.5*IQR?
Un dato central
Un outlier potencial
Un valor categórico
Una imputación
¿Qué gráfico es más usado para visualizar outliers?
Circular
Boxplot
Barras
Área
Los outliers deben tratarse considerando el contexto del negocio y no solo los métodos estadísticos.
Verdadero
Falso
Un banco construye un modelo de scoring crediticio. La variable ingresos declarados presenta 15% de valores faltantes, distribuidos de manera no aleatoria (los clientes con mayor deuda suelen omitirlos). ¿Cuál técnica de imputación sería más adecuada?
Eliminar las filas con valores faltantes
Imputar con la media de ingresos
Imputar con un modelo predictivo (ej. regresión)
Sustituir por un valor constante (ej. -999)
En un dataset de ventas globales, la variable continente tiene 6 categorías. El modelo a utilizar es una regresión logística. ¿Cuál técnica de codificación minimizaría el riesgo de relaciones numéricas falsas y mantendría la interpretabilidad?
Label encoding
One-hot encoding
Ordinal encoding
Escalado min-max
En una variable numérica de tiempo de entrega (en días), el boxplot muestra un grupo de valores extremos (más de 90 días) correspondientes a pedidos internacionales. ¿Cuál sería la mejor decisión de tratamiento?
Eliminar esos registros como outliers
Tratar como outliers solo los superiores a 60 días
Mantenerlos, ya que reflejan un fenómeno real del negocio
Imputarlos con la mediana
Un dataset de pacientes tiene la variable nivel de dolor: bajo, medio, alto. El equipo aplica label encoding directo (bajo=0, medio=1, alto=2) y entrena un modelo de regresión lineal. ¿Cuál riesgo se introduce?
Se pierde interpretabilidad
El modelo puede interpretar una falsa relación lineal entre categorías
Se aumenta la dimensionalidad innecesariamente
El modelo ignora la variable
La variable salario anual tiene outliers en el top 1% (ej. ejecutivos con salarios muy altos). El modelo a aplicar es un KNN. ¿Qué estrategia sería más recomendable?
Eliminar los outliers directamente
Escalar con min-max
Usar escalado robusto (Robust Scaler)
Imputar con la media
Un dataset de clima registra temperatura diaria durante 5 años en un país que presenta (primavera, verano, otoño e invierno). Se decide imputar los valores faltantes con la media global. ¿Cuál es el principal riesgo de esta decisión?
La imputación reducirá la varianza y eliminará patrones estacionales
La imputación introducirá más valores faltantes
Se perderá el orden temporal
El modelo ignorará los valores imputados
Un científico de datos aplica IQR (rango intercuartílico) para detectar outliers en la variable ventas diarias. Encuentra que más del 30% de los datos caen fuera de los límites. ¿Qué interpretación es más adecuada?
Esos datos deben eliminarse sin dudar
El método IQR no es apropiado por la distribución de la variable
La base de datos está corrupta
Todos esos registros son errores de captura
