Font size
WorksheetsCiencia de Datos
Total questions: 100
Worksheet time: 2hrs 53mins
Define un datawarehouse.
Es un repositorio centralizado para almacenar y analizar grandes volúmenes de datos de varias fuentes.
Es una herramienta para crear sitios web
Es un tipo de bases de datos para negocios pequeños
Se utiliza para procesamiento de transacciones en tiempo real
¿Qué diferencia hay entre OLTP y OLAP?
OLTP se utiliza para transacciones en tiempo real, mientras que OLAP se utiliza para análisis de datos.
OLTP se utiliza solo para análisis de datos, mientras que OLAP se utiliza para transacciones en tiempo real.
OLTP y OLAP son lo mismo y se utilizan para el mismo propósito.
OLTP se utiliza para almacenamiento de datos, mientras que OLAP se utiliza para transacciones en tiempo real.
¿Qué son las bases de datos relacionales?
Son bases de datos que solo permiten datos no estructurados.
Son sistemas de gestión de datos que organizan la información en tablas interrelacionadas.
Son sistemas que organizan la información en gráficos y diagramas.
Son sistemas de almacenamiento de datos en archivos de texto.
¿Qué es la integración de datos?
La integración de datos es solo la recopilación de datos.
La integración de datos es el proceso de combinar datos de diferentes fuentes en una vista unificada.
La integración de datos implica eliminar datos duplicados.
La integración de datos se refiere a la creación de bases de datos nuevas.
¿Por qué es importante la limpieza de datos?
La limpieza de datos es solo una formalidad.
Es importante porque garantiza la calidad y precisión de los datos, lo que mejora la toma de decisiones.
No afecta la calidad de los análisis.
Es un proceso que consume mucho tiempo sin beneficios.
¿Cuáles son los métodos de selección de características?
Métodos de regresión
Métodos de filtrado, métodos de envoltura, métodos integrados.
Métodos de normalización
Métodos de agrupamiento
¿Qué es la analítica descriptiva?
La analítica descriptiva se utiliza exclusivamente para la toma de decisiones empresariales.
La analítica descriptiva es el análisis de datos en tiempo real.
La analítica descriptiva es el análisis de datos históricos para entender eventos pasados.
La analítica descriptiva se centra en predecir eventos futuros.
¿Cómo se identifican los outliers?
Los outliers se identifican utilizando el rango intercuartílico (IQR) o puntuaciones Z.
Los outliers se identifican solo con la desviación estándar.
Los outliers se identifican utilizando gráficos de barras.
Los outliers se identifican mediante la media aritmética.
¿Qué es el overfitting?
El overfitting es el ajuste excesivo de un modelo a los datos de entrenamiento.
El overfitting es la mejora del rendimiento del modelo en datos de prueba.
El overfitting es el proceso de simplificar un modelo para que sea más general.
El overfitting es la técnica de aumentar la cantidad de datos de entrenamiento.
¿Qué es la validación cruzada en el aprendizaje automático?
La validación cruzada es una técnica para eliminar datos duplicados.
La validación cruzada se utiliza para aumentar el tamaño del conjunto de datos.
La validación cruzada es un proceso de normalización de datos.
La validación cruzada es un método para evaluar la capacidad de generalización de un modelo dividiendo los datos en múltiples subconjuntos.
¿Qué son los datos no estructurados?
Los datos no estructurados son datos que solo se utilizan en aplicaciones de tiempo real.
Los datos no estructurados son datos que se pueden analizar fácilmente con herramientas de análisis de datos.
Los datos no estructurados son datos que se almacenan en tablas.
Los datos no estructurados son datos que no tienen un formato predefinido o no se organizan en una base de datos.
¿Qué es el aprendizaje supervisado en el contexto del aprendizaje automático?
El aprendizaje supervisado es un método donde el modelo se entrena con datos etiquetados.
El aprendizaje supervisado es un tipo de análisis de datos en tiempo real.
El aprendizaje supervisado se refiere a la creación de datos no estructurados.
El aprendizaje supervisado es un proceso de normalización de datos sin etiquetas.
¿Qué es un modelo de regresión?
Un modelo de regresión es una técnica utilizada para clasificar datos en categorías.
Un modelo de regresión es un método para predecir valores continuos a partir de variables independientes.
Un modelo de regresión se utiliza exclusivamente para datos no estructurados.
Un modelo de regresión es un tipo de algoritmo de agrupamiento.
¿Qué son los datos estructurados?
Los datos estructurados son datos que no se pueden analizar.
Los datos estructurados son datos que no tienen un formato específico.
Los datos estructurados son datos que se organizan en un formato predefinido, como tablas.
Los datos estructurados son datos que solo se utilizan en aplicaciones de tiempo real.
¿Qué es el análisis predictivo?
El análisis predictivo es un proceso de limpieza de datos.
El análisis predictivo es el uso de datos históricos para predecir eventos futuros.
El análisis predictivo se centra únicamente en datos no estructurados.
El análisis predictivo es un método para clasificar datos en categorías.
¿Qué es un algoritmo de agrupamiento?
Un algoritmo de agrupamiento es una técnica para clasificar datos en grupos basados en similitudes.
Un algoritmo de agrupamiento es un método para predecir valores continuos.
Un algoritmo de agrupamiento es un proceso de normalización de datos.
Un algoritmo de agrupamiento se utiliza exclusivamente para datos estructurados.
¿Qué es el aprendizaje no supervisado?
El aprendizaje no supervisado es un proceso de normalización de datos.
El aprendizaje no supervisado se utiliza exclusivamente para datos estructurados.
El aprendizaje no supervisado es un enfoque para encontrar patrones en datos sin etiquetas.
El aprendizaje no supervisado es un método donde el modelo se entrena con datos etiquetados.
¿Qué es la minería de datos?
La minería de datos se refiere únicamente a la recopilación de datos.
La minería de datos es un proceso de limpieza de datos.
La minería de datos es el proceso de extraer patrones y conocimiento de grandes volúmenes de datos.
La minería de datos es un método para almacenar datos en bases de datos.
¿Qué es un JOIN en SQL?
Un JOIN es un comando que se utiliza para eliminar datos de una tabla.
Un JOIN es una operación que combina filas de dos o más tablas basándose en una relación entre ellas.
Un JOIN es una técnica para almacenar datos en formato JSON.
Un JOIN es un tipo de función que se utiliza para crear índices en una base de datos.
¿Cuál es la diferencia entre INNER JOIN y LEFT JOIN?
INNER JOIN devuelve todas las filas de ambas tablas, mientras que LEFT JOIN devuelve solo las filas de la tabla derecha.
INNER JOIN devuelve solo las filas que tienen coincidencias en ambas tablas, mientras que LEFT JOIN devuelve todas las filas de la tabla izquierda y las coincidencias de la tabla derecha.
INNER JOIN y LEFT JOIN son lo mismo y se utilizan indistintamente.
INNER JOIN se utiliza para unir tablas en la misma base de datos, mientras que LEFT JOIN se utiliza para unir tablas en bases de datos diferentes.
¿Qué son las variables independientes en un modelo de regresión?
Las variables independientes son aquellas que se predicen en el modelo.
Las variables independientes son las que se utilizan para predecir el valor de la variable dependiente.
Las variables independientes son irrelevantes para el análisis.
Las variables independientes son siempre numéricas.
¿Cuál de las siguientes técnicas se utiliza comúnmente en el análisis prescriptivo?
Optimización y simulación
Tablas de frecuencia y gráficos
Correlaciones y regresiones
Series temporales y media
NO es un algoritmo de aprendizaje supervisado:
Árboles de decisión
K-Means
KNN
SVM
Dadas 2 o más clases de datos etiquetadas, actúa como un clasificador discriminativo, definido formalmente por un hiperplano óptimo que separa todas las clases.
Decision Tree
Maquina Vector de Soporte
Regresión lineal
¿Cuál es la diferencia entre el machine learning supervisado y no supervisado?
No existe diferencia
El supervisado necesita de entrenamiento de datos etiquetados.
El no supervisado necesita de entrenamiento de datos etiquetados.
El no supervisado necesita de prueba de datos etiquetados.
¿Qué es la curva ROC?
La curva ROC es una representación gráfica del contraste entre tasas de verdaderos positivos y tasa de falsos positivos en diferentes umbrales.
La curva ROC es una representación gráfica de la curva de Gini
La curva ROC es una representación gráfica del mal ajuste del modelo
La curva ROC es una representación gráfica del R-cuadrado
La regresión logística es un modelo de análisis
No supervisado para clasificación
Supervisado para clasificación
Supervisado para predicción
No supervisado para predicción
¿Cómo evaluarías un modelo de regresión logística?
A través del R^2, REMSEA y Alpha
A través de la precisión, recall, y el F1-Score
No se puede evaluar
A través del uso de éxitos y fracasos como en el caso binomial
¿Cómo se maneja los datos faltantes o dañados en un conjunto de datos?
Se eliminan
Se dejan tal cuál como están
Se analiza su posible origen y se emplea un método de imputación adecuado
Se separan de los datos originales para luego emplear métodos diferentes sobre los mismos, ya qué son anómalos
¿Cuáles de las siguientes técnicas corresponden a aprendizaje no supervisado?
Regresion
Clustering
Clasifcacion
Ninguna
Para un algoritmo supervisado, ¿Qué pasos son necesarios antes de llevar a cabo el entrenamiento de un modelo?
Dividir el dataset en Train y Test
Mezclar los datos
Predecir con el subset de Test
Separar la variable objetivo o target del dataset original
La unión entre 1) CIENCIAS DE LA COMPUTACIÓN; 2) MATEMÁTICAS Y ESTADÍSTICA y 3) CONOCIMIENTO DEL DOMINIO. Estamos hablando de...
Machine Learning
Desarrollo de Software
Inteligencia Artificial
Ciencia de Datos
¿Cuál es la etapa que mayor tiempo implica?
Visualización de los datos
Búsqueda de patrones
Procesamiento y limpieza de los datos
Ninguna es correcta
La Big Data está caracterizada por:
Un gran volumen de datos
La gran velocidad de generación y transmisión de datos
La gran variedad de datos
Todas son correctas
Si tengo una tabla en Excel de 50 alumnos con Nombre, Edad, Género y Ciudad de nacimiento, se trata de...
Datos estructurados
Datos no estructurados
Big Data
Inteligencia Artificial
¿Qué es el análisis de datos en el contexto de la ciencia de datos?
El análisis de datos implica solo la visualización de datos sin realizar ningún procesamiento adicional
El análisis de datos en la ciencia de datos se enfoca únicamente en la interpretación subjetiva de los datos
El análisis de datos en la ciencia de datos es el proceso de inspeccionar, limpiar, transformar y modelar datos con el objetivo de descubrir información útil y tomar decisiones informadas.
El análisis de datos es el proceso de recolectar datos sin ningún propósito específico
¿Qué es un almacén de datos o Data Warehouse (DW)?
Un sistema para gestionar transacciones en tiempo real.
Un repositorio central de datos para análisis e informes.
Una base de datos para almacenar datos temporales.
Un sistema de información basado en documentos.
Tiene una tabla llamada Empleados con las columnas Id y Nombre.¿Qué instrucción debe utilizar para devolver el número de filas de la tabla?
SELECT COUNT(rows) FROM Empleados
SELECT * FROM Empleados
SELECT SUM(*) FROM Empleados
SELECT COUNT(*) FROM Empleados
¿Cuál es el papel de las llaves foráneas en un modelo entidad-relación?
Modificar la estructura de una tabla
Crear nuevas tablas
Establecer relaciones entre diferentes tablas
Eliminar registros de una tabla
¿Cuál es la diferencia entre una llave primaria y una llave foránea en una base de datos?
La llave primaria no tiene restricciones, mientras que la llave foránea sí las tiene
La llave primaria identifica de forma única cada registro en una tabla, mientras que la llave foránea establece una relación entre dos tablas.
La llave primaria no puede ser modificada, mientras que la llave foránea sí puede ser modificada
La llave primaria solo puede ser numérica, mientras que la llave foránea puede ser de cualquier tipo de dato
Si se desea filtrar los datos de empleados con un salario mayor a 5,000 y ordenarlos de forma descendente, ¿cuál sería la sentencia correcta?
SELECT * FROM empleados WHERE salario > 5000 ORDER BY salario DESC
SELECT * FROM empleados ORDER BY salario DESC WHERE salario > 5000
SELECT * FROM empleados GROUP BY salario > 5000 ORDER BY salario DESC
SELECT * FROM empleados WHERE salario > 5000 GROUP BY salario DESC
¿Cuál es la relación entre Data Mining y Data Warehouse?
Data Mining utiliza datos históricos almacenados en el Data Warehouse
Data Warehouse es una herramienta de visualización para Data Mining
Data Warehouse no es compatible con las técnicas de Data Mining
Data Mining es independiente del Data Warehouse
¿Qué tipo de aplicaciones se encargan de analizar datos del negocio para generar información táctica y estratégica?
OLAP
Middleware
Data Marts
OLTP
¿Cuál es la función esencial del Data Warehouse?
Realizar transacciones en línea
Generar informes financieros
Integrar información de distintas fuentes
Almacenar datos operativos
¿Qué hace el algoritmo Gradient Boosting en cada nueva iteración?
Reduce el tamaño de los datos
Corrige los errores cometidos por los modelos anteriores
Aumenta la regularización del modelo
Genera nuevos ejemplos sintéticos
¿Cuál es el objetivo principal del modelo de regresión logística?
Predecir valores continuos
Clasificación multiclase
Clasificación binaria
Reducir la dimensionalidad de los datos
¿Qué técnica modifica el umbral de decisión en modelos supervisados para mejorar el rendimiento en la clase minoritaria?
Submuestreo
Ajuste de clase mayoritaria
Cambio de umbral de decisión
Ensamblaje de modelos
¿Qué caracteriza a un modelo no supervisado?
Se entrena con datos etiquetados
Se entrena con datos no etiquetados
Se utiliza para hacer predicciones futuras
Requiere grandes cantidades de datos de salida
¿Qué métrica combina precisión y recall para ofrecer una evaluación equilibrada en problemas de clasificación?
AUC-ROC
F1-Score
Accuracy
Log Loss
¿Cómo evaluarías un modelo de regresión logística?
A través del R^2, REMSEA y Alpha
A través de la precisión, recall, y el F1-Score
No se puede evaluar
A través del uso de éxitos y fracasos como en el caso binomial
Símbolo para representar las entidades en un diagrama E-R
En el diagrama ¿cuál es el nombre de la entidad?
Id_cliente
Clientes
Nombre
Edad
Género
En el diagrama ¿cuál es la llave primaria?
Id_cliente
Clientes
Nombre
Edad
Género
Un grupo puede contener diversas asignaturas y una asignatura puede estar en varios grupos. ¿Cuál es la cardinalidad?
1:1
1:N
N:N
Comentarios en redes sociales son ...
Datos estructurados
Datos no estructurados
Datos semi-estructurados
Datos de los clientes en formato xml
Datos estructurados
Datos no estructurados
Datos semi-estructurados
Datos de geolocalización de los contenedores de basura en formato json
Datos estructurados
Datos no estructurados
Datos semi-estructurados
El vídeo de Shakira
Datos estructurados
Datos no estructurados
Datos semi-estructurados
¿Qué método se utiliza para desplegar información básica de un DataFrame en Pandas?
display()
show()
info()
head()
¿Cómo se puede verificar la presencia de valores NaN en un DataFrame de Pandas?
df.checknull()
df.isnan()
df.empty()
df.isnull()
¿Cuál es la función de seaborn en relación con Pandas?
Se encarga de la limpieza de datos en DataFrames de Pandas
Permite la manipulación de datos en DataFrames de Pandas
Proporciona funciones de machine learning en DataFrames de Pandas
Facilita la creación de gráficos estadísticos a partir de DataFrames de Pandas.
¿Cómo se puede visualizar la distribución de datos en un DataFrame de Pandas?
df.plot()
df.describe()
df.hist()
df.scatter()
¿Cuál de las siguientes es una ventaja y una desventaja de Grid Search, respectivamente?
Ventaja: alto costo computacional; Desventaja: encuentra valores óptimos de hiperparámetros.
Ventaja: rápido en grandes espacios de búsqueda; Desventaja: no garantiza hallar la mejor combinación.
Ventaja: revisa todas las combinaciones de la cuadrícula; Desventaja: puede ser costoso computacionalmente en espacios grandes.
Ventaja: realiza muestreo aleatorio; Desventaja: no explora todas las combinaciones.
¿Cómo funciona la validación cruzada (Cross Validation) en el contexto de Grid Search?
Usa una base de datos independiente para entrenar cada hiperparámetro y no realiza validación.
Divide los datos en varios pliegues, entrena en un pliegue y valida en los otros, promediando el rendimiento para cada combinación de hiperparámetros.
Solo entrena el modelo una vez por cada combinación de hiperparámetros, sin división alguna.
Aplica aleatoriamente diferentes tipos de modelos en cada pliegue para comparar sus resultados.
Logistic regression is ...
Supervised machine learning algorithm
Unsupervised machine learning algorithm
Both
Indica cuál de las siguientes es una métrica para Clasificación
Veracity
Area Over the ROC Curve (AOC)
Association
Under the ROC Curve (AUC)
¿Qué metrica no se utiliza para evaluar modelos de clasificación?
AUC ROC score
Accuracy
Mean absolute error
Precision
¿Cómo se define un modelo de Regresión Logística en python?
LogisticRegression()
LR( )
LRM( )
None of these
¿Cuál de las siguientes métricas puede utilizarse para evaluar modelos de regresión?
Variance
Standard Deviation
Statistics
RMSE
Among the following functions, which one can be used to combine dataframes when they have similar structure.
combine_first
concat()
merge()
Among the following functions, which one can be used to combine dataframes when they have similar structure.
combine_first
concat()
merge()
Which function can be used to combine dataframes based on common fields?
merge()
combine_first()
concat()
¿Cuál es el propósito de la selección de características en el diseño de un modelo de aprendizaje automático?
Eliminar datos inconsistentes
Seleccionar las columnas que mejor ayudan a predecir la variable objetivo
Entrenar al modelo con menos datos
Aplicar hiperparámetros más eficientes
¿Qué describe mejor un problema de regresión en el aprendizaje automático?
Asignar entradas a categorías predefinidas
Predecir un valor continuo como el precio de una acción
Agrupar datos sin conocer las etiquetas
Optimizar la ruta de un robot basado en recompensas
¿Qué tipo de aprendizaje automático se utiliza cuando no hay datos etiquetados disponibles?
Aprendizaje supervisado
Aprendizaje por refuerzo
Aprendizaje no supervisado
Aprendizaje profundo
La validación cruzada nos ayuda a saber el desempeño real de un modelo antes de aplicarlo, usando la base de entrenamiento para entrenar y para probar el modelo al mismo tiempo.
Verdadero
Falso
El One hot Encoding es el proceso que se aplica a datos categóricos, para convertirlos en una representación de vector binario para su uso en algoritmos de aprendizaje automático.
Verdadero
Falso
Dadas 2 o más clases de datos etiquetadas, actúa como un clasificador discriminativo, definido formalmente por un hiperplano óptimo que separa todas las clases.
Decision Tree
Maquina Vector de Soporte
Regresión lineal
¿Qué es la curva ROC?
La curva ROC es una representación gráfica del contraste entre tasas de verdaderos positivos y tasa de falsos positivos en diferentes umbrales.
La curva ROC es una representación gráfica de la curva de Gini
La curva ROC es una representación gráfica del mal ajuste del modelo
La curva ROC es una representación gráfica del R-cuadrado
¿Cómo evaluarías un modelo de regresión logística?
A través del R^2, REMSEA y Alpha
A través de la precisión, recall, y el F1-Score
No se puede evaluar
A través del uso de éxitos y fracasos como en el caso binomial
¿Cómo se maneja los datos faltantes o dañados en un conjunto de datos?
Se eliminan
Se dejan tal cuál como están
Se analiza su posible origen y se emplea un método de imputación adecuado
Se separan de los datos originales para luego emplear métodos diferentes sobre los mismos, ya qué son anómalos
¿Cuáles de las siguientes técnicas corresponden a aprendizaje no supervisado?
Regresion
Clustering
Clasifcacion
Ninguna
Para un algoritmo supervisado, ¿Qué pasos son necesarios antes de llevar a cabo el entrenamiento de un modelo?
Dividir el dataset en Train y Test
Mezclar los datos
Predecir con el subset de Test
Separar la variable objetivo o target del dataset original
¿Cuál es la medida de impureza utilizada en los árboles de decisión?
Entropía
Coeficiente de Gini
Ambas opciones son correctas
Ninguna de las opciones es correcta
¿Cuál es una ventaja de los árboles de decisión?
Son interpretables y representables gráficamente
No requieren transformar variables
Son robustos a outliers
Todas las opciones son correctas
¿Qué tipo de problemas pueden resolver los árboles de decisión en el aprendizaje supervisado?
Solo regresión
Solo clasificación
Clasificación y regresión
Ninguno de los anteriores
¿Qué representa el nodo raíz en un árbol de decisión?
El primer nodo que contiene el conjunto de datos completo
Un nodo sin hijos
Un nodo que se divide en subnodos
El último nodo del árbol
¿En qué consiste el primer paso en el proceso CRISP-DM?
Evaluar el modelo
Crear el modelo
Limpiar los datos
Comprender el problema
¿Qué técnica NO es comúnmente usada para tratar valores nulos?
Codificación One-Hot
Imputación media
Uso de modelos predictivos
Eliminación de filas
¿Qué método es efectivo para detectar outliers?
Codificación binaria
Transformación logarítmica
Graficar un diagrama de caja (boxplot)
Normalización min-max
¿En qué consiste el problema de la multicolinealidad?
Es una situación donde dos o más variables predictoras de un modelo están correlacionadas
Ocurre cuando las variables de entrada no mantienen una relación lineal con la variable objetivo
Es la situación en la que las variables de entrada son demasiado independientes entre sí
Ocurre cuando el modelo utilizado se encuentra sobreajustado a los datos de entrenamiento
¿Qué describe mejor el método de selección de variables sequential forward selection?
Se adhieren secuencialmente características hasta que el rendimiento no mejora substancialmente.
Se seleccionan todas las variables candidatas simultáneamente.
Se eliminan secuencialmente variables hasta que el rendimiento no mejora substancialmente.
Ninguna de las anteriores
En el contexto de un modelo de clasificación donde es crítico evitar falsos negativos, ¿qué métrica sería más importante para evaluar la eficacia del modelo?
Accuracy
Precision
Recall
F1-Score
¿Qué parámetro es crucial ajustar en el algoritmo de KNN para obtener buenos resultados?
La tasa de aprendizaje
El número de vecinos
La profundidad de las ramas en la red del algoritmo
El número de iteraciones
¿Qué criterio de impureza se utiliza para maximizar la ganancia de información?
Entropía
Coeficiente de Gini
Error cuadrático medio
Ninguno de los anteriores
¿Cuál de las siguientes afirmaciones es verdadera acerca de la normalización de datos?
La normalización convierte todas las características en valores binarios.
La normalización ajusta los valores de las características a un rango específico, como [0, 1].
La normalización es útil para características categóricas no ordinales.
La normalización siempre mejora el rendimiento del modelo.
La selección de características puede ayudar a mejorar la eficiencia de un modelo de machine learning al reducir la dimensionalidad del conjunto de datos.
Verdadero
Falso
¿En qué consiste el ajuste de hiperparámetros en un modelo de Machine Learning?
Es el proceso de recolectar datos sin etiquetar para entrenar un modelo.
Es el proceso de corregir errores de programación en el código del modelo.
Es el proceso de encontrar los valores adecuados de los parámetros internos del modelo durante su entrenamiento.
Es el proceso de encontrar los valores óptimos de los parámetros externos (configuraciones) que controlan cómo aprende el modelo.
¿Cuál es la principal diferencia entre Grid Search y Randomized Search?
Grid Search y Randomized Search se basan únicamente en validación cruzada.
Grid Search realiza combinaciones aleatorias de hiperparámetros, mientras que Randomized Search prueba todas las combinaciones posibles.
Grid Search explora todas las combinaciones de una cuadrícula de valores; Randomized Search extrae combinaciones al azar de un espacio de parámetros.
Grid Search optimiza un solo hiperparámetro, mientras que Randomized Search optimiza múltiples hiperparámetros simultáneamente.
