Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Diagnóstico Preprocesamiento de datos 2025-2

Total questions: 15

Worksheet time: 18mins

Name
Class
Date
1.

¿Qué es el preprocesamiento de datos?

a)

El entrenamiento de un modelo

b)

El análisis estadístico de los datos

c)

El conjunto de técnicas para limpiar y preparar datos para su análisis

d)

La visualización de los resultados

2.

¿Cuál de los siguientes no es un tipo de dato común en ciencia de datos?

a)

Numérico

b)

Categórico

c)

Fotográfico

d)

Fecha

3.

¿Qué función de pandas se utiliza para detectar valores nulos?

a)

dropna()

b)

isnull()

c)

replace()

d)

astype()

4.

¿Cuál de las siguientes bibliotecas se usa principalmente para manipulación de datos en Python?

a)

matplotlib

b)

seaborn

c)

pandas

d)

sklearn

5.

¿Qué significa normalizar los datos?

a)

Agrupar los datos por categorías

b)

Escalar los datos a un mismo rango

c)

Eliminar los valores nulos

d)

Mezclar datos de distintas fuentes

6.

¿Qué técnica convierte variables categóricas en variables numéricas?

a)

Agrupamiento

b)

One-hot encoding

c)

Reducción de dimensionalidad

d)

Normalización

7.

¿Qué función se usa para rellenar valores nulos en pandas?

a)

fillna()

b)

groupby()

c)

join()

d)

drop()

8.

¿Cuál es una forma de escalar datos entre 0 y 1?

a)

Z-score

b)

MinMaxScaler

c)

RobustScaler

d)

Log transformation

9.

¿Qué es un outlier?

a)

Un valor normal

b)

Un valor extremo o atípico

c)

Un valor repetido

d)

Un valor categórico

10.

¿Qué hace drop_duplicates() en pandas?

a)

Elimina filas duplicadas

b)

Elimina columnas

c)

Elimina valores nulos

d)

Agrupa los datos

11.

Estás analizando un dataset con más de 50 variables numéricas para predecir la tasa de abandono de clientes. Al revisar las correlaciones, observas que muchas variables están fuertemente correlacionadas entre sí. ¿Qué deberías considerar hacer antes de entrenar un modelo lineal?

a)

Normalizar todas las variables

b)

Eliminar outliers

c)

Aplicar técnicas para reducir la multicolinealidad (como PCA o eliminación de variables)

d)

Codificar las variables categóricas

12.

Te entregan un conjunto de datos que contiene ingresos de personas, pero ves que la escala varía entre millones y cientos. Quieres usar un modelo de redes neuronales. ¿Qué técnica aplicarías antes de entrenar el modelo?

a)

Imputación por mediana

b)

Codificación ordinal

c)

Escalado de variables (StandardScaler o MinMaxScaler)

d)

Agrupamiento por rangos

13.

Estás trabajando en un proyecto de clasificación con un dataset que incluye varias variables categóricas con más de 30 categorías cada una. ¿Cuál es el principal riesgo de aplicar one-hot encoding directamente sobre estas variables?

a)

El modelo ignorará esas variables

b)

Se creará una matriz dispersa con demasiadas columnas, lo que puede afectar el rendimiento

c)

Los datos quedarán desordenados

d)

No se podrán usar modelos lineales

14.

Un cliente te entrega un dataset con más de 200 columnas y te pide que construyas un modelo predictivo sin perder mucha información. ¿Qué técnica usarías para reducir la dimensionalidad sin eliminar información clave?

a)

Eliminar las columnas con valores nulos

b)

Codificar todas las variables como texto

c)

Aplicar PCA o métodos similares para conservar varianza

d)

Eliminar todas las variables categóricas

15.

Después de un preprocesamiento completo, tu modelo de regresión lineal tiene una baja precisión. Sospechas que la normalización afectó el modelo. ¿Qué deberías revisar?

a)

Si hay valores duplicados

b)

Si el método de escalado fue adecuado para el tipo de modelo

c)

Si se aplicó one-hot encoding

d)

Si el dataset está balanceado