wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Ciencia de Datos

Total questions: 100

Worksheet time: 2hrs 53mins

Name
Class
Date
1.

Define un datawarehouse.

a)

Es un repositorio centralizado para almacenar y analizar grandes volúmenes de datos de varias fuentes.

b)

Es una herramienta para crear sitios web

c)

Es un tipo de bases de datos para negocios pequeños

d)

Se utiliza para procesamiento de transacciones en tiempo real

2.

¿Qué diferencia hay entre OLTP y OLAP?

a)

OLTP se utiliza para transacciones en tiempo real, mientras que OLAP se utiliza para análisis de datos.

b)

OLTP se utiliza solo para análisis de datos, mientras que OLAP se utiliza para transacciones en tiempo real.

c)

OLTP y OLAP son lo mismo y se utilizan para el mismo propósito.

d)

OLTP se utiliza para almacenamiento de datos, mientras que OLAP se utiliza para transacciones en tiempo real.

3.

¿Qué son las bases de datos relacionales?

a)

Son bases de datos que solo permiten datos no estructurados.

b)

Son sistemas de gestión de datos que organizan la información en tablas interrelacionadas.

c)

Son sistemas que organizan la información en gráficos y diagramas.

d)

Son sistemas de almacenamiento de datos en archivos de texto.

4.

¿Qué es la integración de datos?

a)

La integración de datos es solo la recopilación de datos.

b)

La integración de datos es el proceso de combinar datos de diferentes fuentes en una vista unificada.

c)

La integración de datos implica eliminar datos duplicados.

d)

La integración de datos se refiere a la creación de bases de datos nuevas.

5.

¿Por qué es importante la limpieza de datos?

a)

La limpieza de datos es solo una formalidad.

b)

Es importante porque garantiza la calidad y precisión de los datos, lo que mejora la toma de decisiones.

c)

No afecta la calidad de los análisis.

d)

Es un proceso que consume mucho tiempo sin beneficios.

6.

¿Cuáles son los métodos de selección de características?

a)

Métodos de regresión

b)

Métodos de filtrado, métodos de envoltura, métodos integrados.

c)

Métodos de normalización

d)

Métodos de agrupamiento

7.

¿Qué es la analítica descriptiva?

a)

La analítica descriptiva se utiliza exclusivamente para la toma de decisiones empresariales.

b)

La analítica descriptiva es el análisis de datos en tiempo real.

c)

La analítica descriptiva es el análisis de datos históricos para entender eventos pasados.

d)

La analítica descriptiva se centra en predecir eventos futuros.

8.

¿Cómo se identifican los outliers?

a)

Los outliers se identifican utilizando el rango intercuartílico (IQR) o puntuaciones Z.

b)

Los outliers se identifican solo con la desviación estándar.

c)

Los outliers se identifican utilizando gráficos de barras.

d)

Los outliers se identifican mediante la media aritmética.

9.

¿Qué es el overfitting?

a)

El overfitting es el ajuste excesivo de un modelo a los datos de entrenamiento.

b)

El overfitting es la mejora del rendimiento del modelo en datos de prueba.

c)

El overfitting es el proceso de simplificar un modelo para que sea más general.

d)

El overfitting es la técnica de aumentar la cantidad de datos de entrenamiento.

10.

¿Qué es la validación cruzada en el aprendizaje automático?

a)

La validación cruzada es una técnica para eliminar datos duplicados.

b)

La validación cruzada se utiliza para aumentar el tamaño del conjunto de datos.

c)

La validación cruzada es un proceso de normalización de datos.

d)

La validación cruzada es un método para evaluar la capacidad de generalización de un modelo dividiendo los datos en múltiples subconjuntos.

11.

¿Qué son los datos no estructurados?

a)

Los datos no estructurados son datos que solo se utilizan en aplicaciones de tiempo real.

b)

Los datos no estructurados son datos que se pueden analizar fácilmente con herramientas de análisis de datos.

c)

Los datos no estructurados son datos que se almacenan en tablas.

d)

Los datos no estructurados son datos que no tienen un formato predefinido o no se organizan en una base de datos.

12.

¿Qué es el aprendizaje supervisado en el contexto del aprendizaje automático?

a)

El aprendizaje supervisado es un método donde el modelo se entrena con datos etiquetados.

b)

El aprendizaje supervisado es un tipo de análisis de datos en tiempo real.

c)

El aprendizaje supervisado se refiere a la creación de datos no estructurados.

d)

El aprendizaje supervisado es un proceso de normalización de datos sin etiquetas.

13.

¿Qué es un modelo de regresión?

a)

Un modelo de regresión es una técnica utilizada para clasificar datos en categorías.

b)

Un modelo de regresión es un método para predecir valores continuos a partir de variables independientes.

c)

Un modelo de regresión se utiliza exclusivamente para datos no estructurados.

d)

Un modelo de regresión es un tipo de algoritmo de agrupamiento.

14.

¿Qué son los datos estructurados?

a)

Los datos estructurados son datos que no se pueden analizar.

b)

Los datos estructurados son datos que no tienen un formato específico.

c)

Los datos estructurados son datos que se organizan en un formato predefinido, como tablas.

d)

Los datos estructurados son datos que solo se utilizan en aplicaciones de tiempo real.

15.

¿Qué es el análisis predictivo?

a)

El análisis predictivo es un proceso de limpieza de datos.

b)

El análisis predictivo es el uso de datos históricos para predecir eventos futuros.

c)

El análisis predictivo se centra únicamente en datos no estructurados.

d)

El análisis predictivo es un método para clasificar datos en categorías.

16.

¿Qué es un algoritmo de agrupamiento?

a)

Un algoritmo de agrupamiento es una técnica para clasificar datos en grupos basados en similitudes.

b)

Un algoritmo de agrupamiento es un método para predecir valores continuos.

c)

Un algoritmo de agrupamiento es un proceso de normalización de datos.

d)

Un algoritmo de agrupamiento se utiliza exclusivamente para datos estructurados.

17.

¿Qué es el aprendizaje no supervisado?

a)

El aprendizaje no supervisado es un proceso de normalización de datos.

b)

El aprendizaje no supervisado se utiliza exclusivamente para datos estructurados.

c)

El aprendizaje no supervisado es un enfoque para encontrar patrones en datos sin etiquetas.

d)

El aprendizaje no supervisado es un método donde el modelo se entrena con datos etiquetados.

18.

¿Qué es la minería de datos?

a)

La minería de datos se refiere únicamente a la recopilación de datos.

b)

La minería de datos es un proceso de limpieza de datos.

c)

La minería de datos es el proceso de extraer patrones y conocimiento de grandes volúmenes de datos.

d)

La minería de datos es un método para almacenar datos en bases de datos.

19.

¿Qué es un JOIN en SQL?

a)

Un JOIN es un comando que se utiliza para eliminar datos de una tabla.

b)

Un JOIN es una operación que combina filas de dos o más tablas basándose en una relación entre ellas.

c)

Un JOIN es una técnica para almacenar datos en formato JSON.

d)

Un JOIN es un tipo de función que se utiliza para crear índices en una base de datos.

20.

¿Cuál es la diferencia entre INNER JOIN y LEFT JOIN?

a)

INNER JOIN devuelve todas las filas de ambas tablas, mientras que LEFT JOIN devuelve solo las filas de la tabla derecha.

b)

INNER JOIN devuelve solo las filas que tienen coincidencias en ambas tablas, mientras que LEFT JOIN devuelve todas las filas de la tabla izquierda y las coincidencias de la tabla derecha.

c)

INNER JOIN y LEFT JOIN son lo mismo y se utilizan indistintamente.

d)

INNER JOIN se utiliza para unir tablas en la misma base de datos, mientras que LEFT JOIN se utiliza para unir tablas en bases de datos diferentes.

21.

¿Qué son las variables independientes en un modelo de regresión?

a)

Las variables independientes son aquellas que se predicen en el modelo.

b)

Las variables independientes son las que se utilizan para predecir el valor de la variable dependiente.

c)

Las variables independientes son irrelevantes para el análisis.

d)

Las variables independientes son siempre numéricas.

22.

¿Cuál de las siguientes técnicas se utiliza comúnmente en el análisis prescriptivo?

a)

Optimización y simulación

b)

Tablas de frecuencia y gráficos

c)

Correlaciones y regresiones

d)

Series temporales y media

23.

NO es un algoritmo de aprendizaje supervisado:

a)

Árboles de decisión

b)

K-Means

c)

KNN

d)

SVM

24.

Dadas 2 o más clases de datos etiquetadas, actúa como un clasificador discriminativo, definido formalmente por un hiperplano óptimo que separa todas las clases.

a)

Decision Tree

b)

Maquina Vector de Soporte

c)

Regresión lineal

25.

¿Cuál es la diferencia entre el machine learning supervisado y no supervisado?

a)

No existe diferencia

b)

El supervisado necesita de entrenamiento de datos etiquetados.

c)

El no supervisado necesita de entrenamiento de datos etiquetados.

d)

El no supervisado necesita de prueba de datos etiquetados.

26.

¿Qué es la curva ROC?

a)

La curva ROC es una representación gráfica del contraste entre tasas de verdaderos positivos y tasa de falsos positivos en diferentes umbrales.

b)

La curva ROC es una representación gráfica de la curva de Gini

c)

La curva ROC es una representación gráfica del mal ajuste del modelo

d)

La curva ROC es una representación gráfica del R-cuadrado

27.

La regresión logística es un modelo de análisis

a)

No supervisado para clasificación

b)

Supervisado para clasificación

c)

Supervisado para predicción

d)

No supervisado para predicción

28.

¿Cómo evaluarías un modelo de regresión logística?

a)

A través del R^2, REMSEA y Alpha

b)

A través de la precisión, recall, y el F1-Score

c)

No se puede evaluar

d)

A través del uso de éxitos y fracasos como en el caso binomial

29.

¿Cómo se maneja los datos faltantes o dañados en un conjunto de datos?

a)

Se eliminan

b)

Se dejan tal cuál como están

c)

Se analiza su posible origen y se emplea un método de imputación adecuado

d)

Se separan de los datos originales para luego emplear métodos diferentes sobre los mismos, ya qué son anómalos

30.

¿Cuáles de las siguientes técnicas corresponden a aprendizaje no supervisado?

a)

Regresion

b)

Clustering

c)

Clasifcacion

d)

Ninguna

31.

Para un algoritmo supervisado, ¿Qué pasos son necesarios antes de llevar a cabo el entrenamiento de un modelo?

a)

Dividir el dataset en Train y Test

b)

Mezclar los datos

c)

Predecir con el subset de Test

d)

Separar la variable objetivo o target del dataset original

32.

La unión entre 1) CIENCIAS DE LA COMPUTACIÓN; 2) MATEMÁTICAS Y ESTADÍSTICA y 3) CONOCIMIENTO DEL DOMINIO. Estamos hablando de...

a)

Machine Learning

b)

Desarrollo de Software

c)

Inteligencia Artificial

d)

Ciencia de Datos

33.

¿Cuál es la etapa que mayor tiempo implica?

a)

Visualización de los datos

b)

Búsqueda de patrones

c)

Procesamiento y limpieza de los datos

d)

Ninguna es correcta

34.

La Big Data está caracterizada por:

a)

Un gran volumen de datos

b)

La gran velocidad de generación y transmisión de datos

c)

La gran variedad de datos

d)

Todas son correctas

35.

Si tengo una tabla en Excel de 50 alumnos con Nombre, Edad, Género y Ciudad de nacimiento, se trata de...

a)

Datos estructurados

b)

Datos no estructurados

c)

Big Data

d)

Inteligencia Artificial

36.

¿Qué es el análisis de datos en el contexto de la ciencia de datos?

a)

El análisis de datos implica solo la visualización de datos sin realizar ningún procesamiento adicional

b)

El análisis de datos en la ciencia de datos se enfoca únicamente en la interpretación subjetiva de los datos

c)

El análisis de datos en la ciencia de datos es el proceso de inspeccionar, limpiar, transformar y modelar datos con el objetivo de descubrir información útil y tomar decisiones informadas.

d)

El análisis de datos es el proceso de recolectar datos sin ningún propósito específico

37.

¿Qué es un almacén de datos o Data Warehouse (DW)?

a)

Un sistema para gestionar transacciones en tiempo real.

b)

Un repositorio central de datos para análisis e informes.

c)

Una base de datos para almacenar datos temporales.

d)

Un sistema de información basado en documentos.

38.
¿Que sentencia permite consultar todos los datos de una tabla 'Persons' donde el valor de la columna 'FirstName' sea 'Peter'?
a)
SELECT [all] FROM Persons WHERE FirstName='Peter'
b)
SELECT [all] FROM Persons WHERE FirstName LIKE 'Peter'
c)
SELECT * FROM Persons WHERE FirstName='Peter'
d)
SELECT * FROM Persons WHERE FirstName<>'Peter'
39.

Tiene una tabla llamada Empleados con las columnas Id y Nombre.¿Qué instrucción  debe utilizar para devolver el número de filas de la tabla?

a)

SELECT COUNT(rows) FROM Empleados

b)

SELECT * FROM Empleados

c)

SELECT SUM(*) FROM Empleados

d)

SELECT COUNT(*) FROM Empleados

40.

¿Cuál es el papel de las llaves foráneas en un modelo entidad-relación?

a)

Modificar la estructura de una tabla

b)

Crear nuevas tablas

c)

Establecer relaciones entre diferentes tablas

d)

Eliminar registros de una tabla

41.

¿Cuál es la diferencia entre una llave primaria y una llave foránea en una base de datos?

a)

La llave primaria no tiene restricciones, mientras que la llave foránea sí las tiene

b)

La llave primaria identifica de forma única cada registro en una tabla, mientras que la llave foránea establece una relación entre dos tablas.

c)

La llave primaria no puede ser modificada, mientras que la llave foránea sí puede ser modificada

d)

La llave primaria solo puede ser numérica, mientras que la llave foránea puede ser de cualquier tipo de dato

42.

Si se desea filtrar los datos de empleados con un salario mayor a 5,000 y ordenarlos de forma descendente, ¿cuál sería la sentencia correcta?

a)

SELECT * FROM empleados WHERE salario > 5000 ORDER BY salario DESC

b)

SELECT * FROM empleados ORDER BY salario DESC WHERE salario > 5000

c)

SELECT * FROM empleados GROUP BY salario > 5000 ORDER BY salario DESC

d)

SELECT * FROM empleados WHERE salario > 5000 GROUP BY salario DESC

43.

¿Cuál es la relación entre Data Mining y Data Warehouse?

a)

Data Mining utiliza datos históricos almacenados en el Data Warehouse

b)

Data Warehouse es una herramienta de visualización para Data Mining

c)

Data Warehouse no es compatible con las técnicas de Data Mining

d)

Data Mining es independiente del Data Warehouse

44.

¿Qué tipo de aplicaciones se encargan de analizar datos del negocio para generar información táctica y estratégica?

a)

OLAP

b)

Middleware

c)

Data Marts

d)

OLTP

45.

¿Cuál es la función esencial del Data Warehouse?

a)

Realizar transacciones en línea

b)

Generar informes financieros

c)

Integrar información de distintas fuentes

d)

Almacenar datos operativos

46.

¿Qué hace el algoritmo Gradient Boosting en cada nueva iteración?

a)

Reduce el tamaño de los datos

b)

Corrige los errores cometidos por los modelos anteriores

c)

Aumenta la regularización del modelo

d)

Genera nuevos ejemplos sintéticos

47.

¿Cuál es el objetivo principal del modelo de regresión logística?

a)

Predecir valores continuos

b)

Clasificación multiclase

c)

Clasificación binaria

d)

Reducir la dimensionalidad de los datos

48.

¿Qué técnica modifica el umbral de decisión en modelos supervisados para mejorar el rendimiento en la clase minoritaria?

a)

Submuestreo

b)

Ajuste de clase mayoritaria

c)

Cambio de umbral de decisión

d)

Ensamblaje de modelos

49.

¿Qué caracteriza a un modelo no supervisado?

a)

Se entrena con datos etiquetados

b)

Se entrena con datos no etiquetados

c)

Se utiliza para hacer predicciones futuras

d)

Requiere grandes cantidades de datos de salida

50.

¿Qué métrica combina precisión y recall para ofrecer una evaluación equilibrada en problemas de clasificación?

a)

AUC-ROC

b)

F1-Score

c)

Accuracy

d)

Log Loss

51.

¿Cómo evaluarías un modelo de regresión logística?

a)

A través del R^2, REMSEA y Alpha

b)

A través de la precisión, recall, y el F1-Score

c)

No se puede evaluar

d)

A través del uso de éxitos y fracasos como en el caso binomial

52.

Símbolo para representar las entidades en un diagrama E-R

a)
b)
c)
d)
e)
53.

En el diagrama ¿cuál es el nombre de la entidad?

a)

Id_cliente

b)

Clientes

c)

Nombre

d)

Edad

e)

Género

54.

En el diagrama ¿cuál es la llave primaria?

a)

Id_cliente

b)

Clientes

c)

Nombre

d)

Edad

e)

Género

55.

Un grupo puede contener diversas asignaturas y una asignatura puede estar en varios grupos. ¿Cuál es la cardinalidad?

a)

1:1

b)

1:N

c)

N:N

56.

Comentarios en redes sociales son ...

a)

Datos estructurados

b)

Datos no estructurados

c)

Datos semi-estructurados

57.

Datos de los clientes en formato xml

a)

Datos estructurados

b)

Datos no estructurados

c)

Datos semi-estructurados

58.

Datos de geolocalización de los contenedores de basura en formato json

a)

Datos estructurados

b)

Datos no estructurados

c)

Datos semi-estructurados

59.

El vídeo de Shakira

a)

Datos estructurados

b)

Datos no estructurados

c)

Datos semi-estructurados

60.

¿Qué método se utiliza para desplegar información básica de un DataFrame en Pandas?

a)

display()

b)

show()

c)

info()

d)

head()

61.

¿Cómo se puede verificar la presencia de valores NaN en un DataFrame de Pandas?

a)

df.checknull()

b)

df.isnan()

c)

df.empty()

d)

df.isnull()

62.

¿Cuál es la función de seaborn en relación con Pandas?

a)

Se encarga de la limpieza de datos en DataFrames de Pandas

b)

Permite la manipulación de datos en DataFrames de Pandas

c)

Proporciona funciones de machine learning en DataFrames de Pandas

d)

Facilita la creación de gráficos estadísticos a partir de DataFrames de Pandas.

63.

¿Cómo se puede visualizar la distribución de datos en un DataFrame de Pandas?

a)

df.plot()

b)

df.describe()

c)

df.hist()

d)

df.scatter()

64.

¿Cuál de las siguientes es una ventaja y una desventaja de Grid Search, respectivamente?

a)

Ventaja: alto costo computacional; Desventaja: encuentra valores óptimos de hiperparámetros.

b)

Ventaja: rápido en grandes espacios de búsqueda; Desventaja: no garantiza hallar la mejor combinación.

c)

Ventaja: revisa todas las combinaciones de la cuadrícula; Desventaja: puede ser costoso computacionalmente en espacios grandes.

d)

Ventaja: realiza muestreo aleatorio; Desventaja: no explora todas las combinaciones.

65.

¿Cómo funciona la validación cruzada (Cross Validation) en el contexto de Grid Search?

a)

Usa una base de datos independiente para entrenar cada hiperparámetro y no realiza validación.

b)

Divide los datos en varios pliegues, entrena en un pliegue y valida en los otros, promediando el rendimiento para cada combinación de hiperparámetros.

c)

Solo entrena el modelo una vez por cada combinación de hiperparámetros, sin división alguna.

d)

Aplica aleatoriamente diferentes tipos de modelos en cada pliegue para comparar sus resultados.

66.

Logistic regression is ...

a)

Supervised machine learning algorithm

b)

Unsupervised machine learning algorithm

c)

Both

67.

Indica cuál de las siguientes es una métrica para Clasificación

a)

Veracity

b)

Area Over the ROC Curve (AOC)

c)

Association

d)

Under the ROC Curve (AUC)

68.

¿Qué metrica no se utiliza para evaluar modelos de clasificación?

a)

AUC ROC score

b)

Accuracy

c)

Mean absolute error

d)

Precision

69.

¿Cómo se define un modelo de Regresión Logística en python?

a)

LogisticRegression()

b)

LR( )

c)

LRM( )

d)

None of these

70.

¿Cuál de las siguientes métricas puede utilizarse para evaluar modelos de regresión?

a)

Variance

b)

Standard Deviation

c)

Statistics

d)

RMSE

71.

Among the following functions, which one can be used to combine dataframes when they have similar structure.

a)

combine_first

b)

concat()

c)

merge()

72.

Among the following functions, which one can be used to combine dataframes when they have similar structure.

a)

combine_first

b)

concat()

c)

merge()

73.

Which function can be used to combine dataframes based on common fields?

a)

merge()

b)

combine_first()

c)

concat()

74.

¿Cuál es el propósito de la selección de características en el diseño de un modelo de aprendizaje automático?

a)

Eliminar datos inconsistentes

b)

Seleccionar las columnas que mejor ayudan a predecir la variable objetivo

c)

Entrenar al modelo con menos datos

d)

Aplicar hiperparámetros más eficientes

75.

¿Qué describe mejor un problema de regresión en el aprendizaje automático?

a)

Asignar entradas a categorías predefinidas

b)

Predecir un valor continuo como el precio de una acción

c)

Agrupar datos sin conocer las etiquetas

d)

Optimizar la ruta de un robot basado en recompensas

76.

¿Qué tipo de aprendizaje automático se utiliza cuando no hay datos etiquetados disponibles?

a)

Aprendizaje supervisado

b)

Aprendizaje por refuerzo

c)

Aprendizaje no supervisado

d)

Aprendizaje profundo

77.

La validación cruzada nos ayuda a saber el desempeño real de un modelo antes de aplicarlo, usando la base de entrenamiento para entrenar y para probar el modelo al mismo tiempo.

a)

Verdadero

b)

Falso

78.

El One hot Encoding es el proceso que se aplica a datos categóricos, para convertirlos en una representación de vector binario para su uso en algoritmos de aprendizaje automático.

a)

Verdadero

b)

Falso

79.

Dadas 2 o más clases de datos etiquetadas, actúa como un clasificador discriminativo, definido formalmente por un hiperplano óptimo que separa todas las clases.

a)

Decision Tree

b)

Maquina Vector de Soporte

c)

Regresión lineal

80.

¿Qué es la curva ROC?

a)

La curva ROC es una representación gráfica del contraste entre tasas de verdaderos positivos y tasa de falsos positivos en diferentes umbrales.

b)

La curva ROC es una representación gráfica de la curva de Gini

c)

La curva ROC es una representación gráfica del mal ajuste del modelo

d)

La curva ROC es una representación gráfica del R-cuadrado

81.

¿Cómo evaluarías un modelo de regresión logística?

a)

A través del R^2, REMSEA y Alpha

b)

A través de la precisión, recall, y el F1-Score

c)

No se puede evaluar

d)

A través del uso de éxitos y fracasos como en el caso binomial

82.

¿Cómo se maneja los datos faltantes o dañados en un conjunto de datos?

a)

Se eliminan

b)

Se dejan tal cuál como están

c)

Se analiza su posible origen y se emplea un método de imputación adecuado

d)

Se separan de los datos originales para luego emplear métodos diferentes sobre los mismos, ya qué son anómalos

83.

¿Cuáles de las siguientes técnicas corresponden a aprendizaje no supervisado?

a)

Regresion

b)

Clustering

c)

Clasifcacion

d)

Ninguna

84.

Para un algoritmo supervisado, ¿Qué pasos son necesarios antes de llevar a cabo el entrenamiento de un modelo?

a)

Dividir el dataset en Train y Test

b)

Mezclar los datos

c)

Predecir con el subset de Test

d)

Separar la variable objetivo o target del dataset original

85.

¿Cuál es la medida de impureza utilizada en los árboles de decisión?

a)

Entropía

b)

Coeficiente de Gini

c)

Ambas opciones son correctas

d)

Ninguna de las opciones es correcta

86.

¿Cuál es una ventaja de los árboles de decisión?

a)

Son interpretables y representables gráficamente

b)

No requieren transformar variables

c)

Son robustos a outliers

d)

Todas las opciones son correctas

87.

¿Qué tipo de problemas pueden resolver los árboles de decisión en el aprendizaje supervisado?

a)

Solo regresión

b)

Solo clasificación

c)

Clasificación y regresión

d)

Ninguno de los anteriores

88.

¿Qué representa el nodo raíz en un árbol de decisión?

a)

El primer nodo que contiene el conjunto de datos completo

b)

Un nodo sin hijos

c)

Un nodo que se divide en subnodos

d)

El último nodo del árbol

89.

¿En qué consiste el primer paso en el proceso CRISP-DM?

a)

Evaluar el modelo

b)

Crear el modelo

c)

Limpiar los datos

d)

Comprender el problema

90.

¿Qué técnica NO es comúnmente usada para tratar valores nulos?

a)

Codificación One-Hot

b)

Imputación media

c)

Uso de modelos predictivos

d)

Eliminación de filas

91.

¿Qué método es efectivo para detectar outliers?

a)

Codificación binaria

b)

Transformación logarítmica

c)

Graficar un diagrama de caja (boxplot)

d)

Normalización min-max

92.

¿En qué consiste el problema de la multicolinealidad?

a)

Es una situación donde dos o más variables predictoras de un modelo están correlacionadas

b)

Ocurre cuando las variables de entrada no mantienen una relación lineal con la variable objetivo

c)

Es la situación en la que las variables de entrada son demasiado independientes entre sí

d)

Ocurre cuando el modelo utilizado se encuentra sobreajustado a los datos de entrenamiento

93.

¿Qué describe mejor el método de selección de variables sequential forward selection?

a)

Se adhieren secuencialmente características hasta que el rendimiento no mejora substancialmente.

b)

Se seleccionan todas las variables candidatas simultáneamente.

c)

Se eliminan secuencialmente variables hasta que el rendimiento no mejora substancialmente.

d)

Ninguna de las anteriores

94.

En el contexto de un modelo de clasificación donde es crítico evitar falsos negativos, ¿qué métrica sería más importante para evaluar la eficacia del modelo?

a)

Accuracy

b)

Precision

c)

Recall

d)

F1-Score

95.

¿Qué parámetro es crucial ajustar en el algoritmo de KNN para obtener buenos resultados?

a)

La tasa de aprendizaje

b)

El número de vecinos

c)

La profundidad de las ramas en la red del algoritmo

d)

El número de iteraciones

96.

¿Qué criterio de impureza se utiliza para maximizar la ganancia de información?

a)

Entropía

b)

Coeficiente de Gini

c)

Error cuadrático medio

d)

Ninguno de los anteriores

97.

¿Cuál de las siguientes afirmaciones es verdadera acerca de la normalización de datos?

a)

La normalización convierte todas las características en valores binarios.

b)

La normalización ajusta los valores de las características a un rango específico, como [0, 1].

c)

La normalización es útil para características categóricas no ordinales.

d)

La normalización siempre mejora el rendimiento del modelo.

98.

La selección de características puede ayudar a mejorar la eficiencia de un modelo de machine learning al reducir la dimensionalidad del conjunto de datos.

a)

Verdadero

b)

Falso

99.

¿En qué consiste el ajuste de hiperparámetros en un modelo de Machine Learning?

a)

Es el proceso de recolectar datos sin etiquetar para entrenar un modelo.

b)

Es el proceso de corregir errores de programación en el código del modelo.

c)

Es el proceso de encontrar los valores adecuados de los parámetros internos del modelo durante su entrenamiento.

d)

Es el proceso de encontrar los valores óptimos de los parámetros externos (configuraciones) que controlan cómo aprende el modelo.

100.

¿Cuál es la principal diferencia entre Grid Search y Randomized Search?

a)

Grid Search y Randomized Search se basan únicamente en validación cruzada.

b)

Grid Search realiza combinaciones aleatorias de hiperparámetros, mientras que Randomized Search prueba todas las combinaciones posibles.

c)

Grid Search explora todas las combinaciones de una cuadrícula de valores; Randomized Search extrae combinaciones al azar de un espacio de parámetros.

d)

Grid Search optimiza un solo hiperparámetro, mientras que Randomized Search optimiza múltiples hiperparámetros simultáneamente.