NEW
Font size
Worksheets¿Qué tanto sabes de Limpieza de Datos con Pandas?
Total questions: 10
Worksheet time: 5mins
¿Cuál es la principal ventaja de que Pandas esté construido sobre NumPy para el procesamiento de grandes volúmenes de datos?
Permite trabajar solo con datos categóricos
Reduce la necesidad de usar tipos numéricos
Aprovecha arreglos optimizados para operaciones vectorizadas eficientes
Limita el uso de memoria para cada DataFrame
¿Cuál de las siguientes afirmaciones describe mejor el rol de las Series dentro de un DataFrame en Pandas?
Son solo índices sin datos asociados
Son columnas individuales con datos y etiquetas que facilitan filtrado y asignación
Son estructuras solo para datos numéricos
Son equivalentes a una hoja de Excel completa
Al cargar un archivo CSV con datos empresariales, ¿para qué sirve el parámetro “na_values” en pd.read_csv según lo descrito en tu documento?
Para cambiar el delimitador del archivo
Para especificar la fila que contiene los nombres de columnas
Para identificar cadenas específicas que deben tratarse como valores nulos
Para limitar el número de filas leídas
En la fase de exploración inicial, ¿qué combinación de métodos es más adecuada para detectar simultáneamente problemas de tipos de datos, valores faltantes y distribución básica de las variables?
head(), tail(), drop_duplicates()
info(), describe(), value_counts()
to_excel(), astype(), melt()
concat(), merge(), join()
¿Por qué la exploración inicial con métodos como info(), describe() y shape se considera parte del Análisis Exploratorio de Datos (EDA) en tu trabajo?
Porque genera automáticamente modelos predictivos
Porque permite entender estructura, calidad y patrones antes del modelado
Porque elimina valores atípicos por defecto
Porque transforma los datos a formato largo
¿Cuál es un riesgo estadístico directo de no eliminar duplicados antes de entrenar un modelo de Machine Learning, según el enfoque de calidad de datos descrito en el documento?
Reducción del tamaño muestral efectivo
Sobre-representación de ciertos registros
Imposibilidad de convertir tipos de datos
Imposibilidad de guardar el archivo limpio
¿En qué situación se recomienda preferir la mediana frente a la media para imputar valores faltantes en variables numéricas?
Cuando no existen valores faltantes
Cuando la variable es categórica y nominal
Cuando la distribución presenta valores atípicos que sesgan la media
Cuando la variable está normalizada entre 0 y 1
En el caso práctico de la base “BD CURSOS.xlsx”, ¿cuál es la razón principal para convertir columnas textuales repetitivas al tipo “category”?
Mejorar la precisión de los gráficos
Permitir aplicar describe() sobre columnas numéricas
Forzar la imputación automática de valores faltantes
Reducir el uso de memoria y optimizar el almacenamiento interno
En una empresa que afirma ser “data-driven”, el equipo directivo decide construir un data lake corporativo en la nube para centralizar toda la información en su formato crudo: logs de aplicaciones, transacciones, encuestas, redes sociales e IoT. Tras un año, el data lake almacena petabytes de datos, pero las decisiones estratégicas se siguen tomando principalmente por intuición de los gerentes, usando solo algunos reportes estáticos del ERP.
Si se compara el concepto de “data-driven” con “data lake” en este contexto, ¿cuál afirmación describe mejor el problema de fondo?
La empresa es verdaderamente data-driven porque un data lake es suficiente para garantizar decisiones basadas en datos, aunque no existan procesos analíticos maduros.
El data lake convierte automáticamente a la organización en data-driven, ya que almacenar datos crudos en grandes volúmenes implica que todas las decisiones usan evidencia empírica.
El data lake es solo una infraestructura para almacenar datos en bruto a gran escala, mientras que ser data-driven implica una cultura y procesos que transforman esos datos en decisiones sistemáticamente guiadas por evidencia.
Ser data-driven depende únicamente de tener dashboards visuales atractivos conectados al data lake, sin necesidad de cambios organizacionales o analíticos.
Un hospital quiere entrenar un modelo para predecir riesgo de infarto usando historias clínicas. En el dataset, un 20% de los pacientes aparece duplicado porque fueron atendidos en varias sedes y sus registros se fusionaron mal. Además, el equipo médico decidió “no perder datos”, por lo que imputó los valores faltantes de colesterol usando la media, a pesar de que la distribución tiene outliers extremos.
Si piensas en el proceso de data cleaning como si fuera una “cirugía de precisión” sobre el paciente (el dataset), ¿cuál de las siguientes descripciones representa mejor el efecto conjunto de NO eliminar duplicados y usar media en vez de mediana para imputar?
Es como operar al paciente solo una vez: se reduce el costo, aunque quede algo de “tejido dañado”.
Es como pesar al paciente varias veces con la misma balanza defectuosa y promediar los resultados: se refuerza el sesgo y el diagnóstico se vuelve engañosamente estable.
Es como medir la temperatura con dos termómetros y elegir el más alto: el riesgo se sobredimensiona pero no afecta el modelo.
Es como aumentar el tamaño de la muestra sin cambiar nada: las métricas seguirán siendo imparciales.
