Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Preprocesamiento de Datos

Total questions: 37

Worksheet time: 21mins

Name
Class
Date
1.

El preprocesamiento de datos es un paso opcional antes del modelado de machine learning.

a)

Verdadero

b)

Falso

2.

¿Cuál de los siguientes NO es un objetivo del preprocesamiento de datos?

a)

Mejorar la calidad de los datos

b)

Aumentar los valores faltantes

c)

Reducir el ruido en los datos

d)

Hacer comparables las variables

3.

El preprocesamiento busca convertir datos crudos en datos listos para análisis.

a)

Verdadero

b)

Falso

4.

¿En qué etapa del ciclo de ciencia de datos se aplica normalmente el preprocesamiento?

a)

Después de entrenar el modelo

b)

Antes del análisis exploratorio

c)

Durante la limpieza y preparación de datos

d)

Solo en el despliegue del modelo

5.

Una de las etapas del preprocesamiento incluye detección de outliers.

a)

Verdadero

b)

Falso

6.

¿Por qué es importante el preprocesamiento?

a)

Reduce sesgos y mejora la precisión de los modelos

b)

Solo sirve para visualizar datos

c)

Se usa únicamente con datos numéricos

d)

Sustituye a la validación de modelos

7.

El preprocesamiento puede incluir:

a)

Escalado de variables

b)

Detección de valores atípicos

c)

Codificación de categorías

d)

Todas las anteriores

8.

La estandarización y normalización forman parte del preprocesamiento.

a)

Verdadero

b)

Falso

9.

Los datos categóricos siempre representan cantidades numéricas.

a)

Verdadero

b)

Falso

10.

¿Cuál de los siguientes es un ejemplo de variable numérica continua?

a)

Número de hijos

b)

Altura en metros

c)

País de residencia

d)

Código postal

11.

El formato fecha puede analizarse como variable numérica o categórica según el contexto.

a)

Verdadero

b)

Falso

12.

¿Qué tipo de variable es “color de ojos”?

a)

Numérica

b)

Categórica nominal

c)

Categórica ordinal

d)

Texto sin estructurar

13.

Una variable ordinal representa categorías con un orden implícito.

a)

Ejemplo: Bajo, Medio, Alto

b)

Ejemplo: Rojo, Verde, Azul

14.

El salario expresado en dólares corresponde a un tipo de dato:

a)

Categórico nominal

b)

Numérico continuo

c)

Numérico discreto

d)

Texto

15.

Una variable discreta toma valores contables como enteros.

a)

Verdadero

b)

Falso

16.

El borrado de filas con valores faltantes es siempre la mejor estrategia.

a)

Verdadero

b)

Falso

17.

¿Cuál de las siguientes es una técnica de imputación simple?

a)

Promedio (media)

b)

Árboles de decisión

c)

KNN Imputer

d)

Red neuronal

18.

La imputación con la moda es útil para variables categóricas.

a)

Verdadero

b)

Falso

19.

Cuando los datos faltan completamente al azar (MCAR), la eliminación de filas suele ser menos riesgosa.

a)

Verdadero

b)

Falso

20.

¿Qué desventaja tiene la imputación con la media?

a)

Distorsiona la varianza

b)

Funciona solo con texto

c)

Aumenta valores faltantes

d)

Reduce outliers

21.

La técnica de imputación más adecuada para datos categóricos ordinales es:

a)

Moda

b)

Media

c)

KNN

d)

Mediana

22.

Rellenar valores faltantes con un valor constante (ej. -999) puede introducir sesgos.

a)

Verdadero

b)

Falso

23.

La imputación con modelos predictivos se considera más avanzada que la imputación simple.

a)

Verdadero

b)

Falso

24.

Los outliers siempre deben eliminarse.

a)

Verdadero

b)

Falso

25.

¿Cuál es un método estadístico común para detectar outliers?

a)

Gráfico de barras

b)

Rainclouds

c)

Histogramas

d)

Treemap

26.

¿Qué representa un valor superior a Q3 + 1.5*IQR?

4 lines
27.

¿Cuál es un método estadístico común para detectar outliers?

a)

Gráfico de barras

b)

Rainclouds

c)

Histogramas

d)

Treemap

28.

¿Qué representa un valor superior a Q3 + 1.5*IQR?

a)

Un dato central

b)

Un outlier potencial

c)

Un valor categórico

d)

Una imputación

29.

¿Qué gráfico es más usado para visualizar outliers?

a)

Circular

b)

Boxplot

c)

Barras

d)

Área

30.

Los outliers deben tratarse considerando el contexto del negocio y no solo los métodos estadísticos.

a)

Verdadero

b)

Falso

31.

Un banco construye un modelo de scoring crediticio. La variable ingresos declarados presenta 15% de valores faltantes, distribuidos de manera no aleatoria (los clientes con mayor deuda suelen omitirlos). ¿Cuál técnica de imputación sería más adecuada?

a)

Eliminar las filas con valores faltantes

b)

Imputar con la media de ingresos

c)

Imputar con un modelo predictivo (ej. regresión)

d)

Sustituir por un valor constante (ej. -999)

32.

En un dataset de ventas globales, la variable continente tiene 6 categorías. El modelo a utilizar es una regresión logística. ¿Cuál técnica de codificación minimizaría el riesgo de relaciones numéricas falsas y mantendría la interpretabilidad?

a)

Label encoding

b)

One-hot encoding

c)

Ordinal encoding

d)

Escalado min-max

33.

En una variable numérica de tiempo de entrega (en días), el boxplot muestra un grupo de valores extremos (más de 90 días) correspondientes a pedidos internacionales. ¿Cuál sería la mejor decisión de tratamiento?

a)

Eliminar esos registros como outliers

b)

Tratar como outliers solo los superiores a 60 días

c)

Mantenerlos, ya que reflejan un fenómeno real del negocio

d)

Imputarlos con la mediana

34.

Un dataset de pacientes tiene la variable nivel de dolor: bajo, medio, alto. El equipo aplica label encoding directo (bajo=0, medio=1, alto=2) y entrena un modelo de regresión lineal. ¿Cuál riesgo se introduce?

a)

Se pierde interpretabilidad

b)

El modelo puede interpretar una falsa relación lineal entre categorías

c)

Se aumenta la dimensionalidad innecesariamente

d)

El modelo ignora la variable

35.

La variable salario anual tiene outliers en el top 1% (ej. ejecutivos con salarios muy altos). El modelo a aplicar es un KNN. ¿Qué estrategia sería más recomendable?

a)

Eliminar los outliers directamente

b)

Escalar con min-max

c)

Usar escalado robusto (Robust Scaler)

d)

Imputar con la media

36.

Un dataset de clima registra temperatura diaria durante 5 años en un país que presenta (primavera, verano, otoño e invierno). Se decide imputar los valores faltantes con la media global. ¿Cuál es el principal riesgo de esta decisión?

a)

La imputación reducirá la varianza y eliminará patrones estacionales

b)

La imputación introducirá más valores faltantes

c)

Se perderá el orden temporal

d)

El modelo ignorará los valores imputados

37.

Un científico de datos aplica IQR (rango intercuartílico) para detectar outliers en la variable ventas diarias. Encuentra que más del 30% de los datos caen fuera de los límites. ¿Qué interpretación es más adecuada?

a)

Esos datos deben eliminarse sin dudar

b)

El método IQR no es apropiado por la distribución de la variable

c)

La base de datos está corrupta

d)

Todos esos registros son errores de captura