wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

¿Qué tanto sabes de Limpieza de Datos con Pandas?

Total questions: 10

Worksheet time: 5mins

Name
Class
Date
1.

¿Cuál es la principal ventaja de que Pandas esté construido sobre NumPy para el procesamiento de grandes volúmenes de datos?

a)

Permite trabajar solo con datos categóricos

b)

Reduce la necesidad de usar tipos numéricos

c)

Aprovecha arreglos optimizados para operaciones vectorizadas eficientes

d)

Limita el uso de memoria para cada DataFrame

2.

¿Cuál de las siguientes afirmaciones describe mejor el rol de las Series dentro de un DataFrame en Pandas?

a)

Son solo índices sin datos asociados

b)

Son columnas individuales con datos y etiquetas que facilitan filtrado y asignación

c)

Son estructuras solo para datos numéricos

d)

Son equivalentes a una hoja de Excel completa

3.

Al cargar un archivo CSV con datos empresariales, ¿para qué sirve el parámetro “na_values” en pd.read_csv según lo descrito en tu documento?

a)

Para cambiar el delimitador del archivo

b)

Para especificar la fila que contiene los nombres de columnas

c)

Para identificar cadenas específicas que deben tratarse como valores nulos

d)

Para limitar el número de filas leídas

4.

En la fase de exploración inicial, ¿qué combinación de métodos es más adecuada para detectar simultáneamente problemas de tipos de datos, valores faltantes y distribución básica de las variables?

a)

head(), tail(), drop_duplicates()

b)

info(), describe(), value_counts()

c)

to_excel(), astype(), melt()

d)

concat(), merge(), join()

5.

¿Por qué la exploración inicial con métodos como info(), describe() y shape se considera parte del Análisis Exploratorio de Datos (EDA) en tu trabajo?

a)

Porque genera automáticamente modelos predictivos

b)

Porque permite entender estructura, calidad y patrones antes del modelado

c)

Porque elimina valores atípicos por defecto

d)

Porque transforma los datos a formato largo

6.

¿Cuál es un riesgo estadístico directo de no eliminar duplicados antes de entrenar un modelo de Machine Learning, según el enfoque de calidad de datos descrito en el documento?

a)

Reducción del tamaño muestral efectivo

b)

Sobre-representación de ciertos registros

c)

Imposibilidad de convertir tipos de datos

d)

Imposibilidad de guardar el archivo limpio

7.

¿En qué situación se recomienda preferir la mediana frente a la media para imputar valores faltantes en variables numéricas?

a)

Cuando no existen valores faltantes

b)

Cuando la variable es categórica y nominal

c)

Cuando la distribución presenta valores atípicos que sesgan la media

d)

Cuando la variable está normalizada entre 0 y 1

8.

En el caso práctico de la base “BD CURSOS.xlsx”, ¿cuál es la razón principal para convertir columnas textuales repetitivas al tipo “category”?

a)

Mejorar la precisión de los gráficos

b)

Permitir aplicar describe() sobre columnas numéricas

c)

Forzar la imputación automática de valores faltantes

d)

Reducir el uso de memoria y optimizar el almacenamiento interno

9.

En una empresa que afirma ser “data-driven”, el equipo directivo decide construir un data lake corporativo en la nube para centralizar toda la información en su formato crudo: logs de aplicaciones, transacciones, encuestas, redes sociales e IoT. Tras un año, el data lake almacena petabytes de datos, pero las decisiones estratégicas se siguen tomando principalmente por intuición de los gerentes, usando solo algunos reportes estáticos del ERP.​

Si se compara el concepto de “data-driven” con “data lake” en este contexto, ¿cuál afirmación describe mejor el problema de fondo?

a)

La empresa es verdaderamente data-driven porque un data lake es suficiente para garantizar decisiones basadas en datos, aunque no existan procesos analíticos maduros.

b)

El data lake convierte automáticamente a la organización en data-driven, ya que almacenar datos crudos en grandes volúmenes implica que todas las decisiones usan evidencia empírica.

c)

El data lake es solo una infraestructura para almacenar datos en bruto a gran escala, mientras que ser data-driven implica una cultura y procesos que transforman esos datos en decisiones sistemáticamente guiadas por evidencia.

d)

Ser data-driven depende únicamente de tener dashboards visuales atractivos conectados al data lake, sin necesidad de cambios organizacionales o analíticos.

10.

Un hospital quiere entrenar un modelo para predecir riesgo de infarto usando historias clínicas. En el dataset, un 20% de los pacientes aparece duplicado porque fueron atendidos en varias sedes y sus registros se fusionaron mal. Además, el equipo médico decidió “no perder datos”, por lo que imputó los valores faltantes de colesterol usando la media, a pesar de que la distribución tiene outliers extremos.
Si piensas en el proceso de data cleaning como si fuera una “cirugía de precisión” sobre el paciente (el dataset), ¿cuál de las siguientes descripciones representa mejor el efecto conjunto de NO eliminar duplicados y usar media en vez de mediana para imputar?

a)

Es como operar al paciente solo una vez: se reduce el costo, aunque quede algo de “tejido dañado”.

b)

Es como pesar al paciente varias veces con la misma balanza defectuosa y promediar los resultados: se refuerza el sesgo y el diagnóstico se vuelve engañosamente estable.

c)

Es como medir la temperatura con dos termómetros y elegir el más alto: el riesgo se sobredimensiona pero no afecta el modelo.

d)

Es como aumentar el tamaño de la muestra sin cambiar nada: las métricas seguirán siendo imparciales.