wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Evaluación Módulo 6 - Ciencia de Datos

Total questions: 60

Worksheet time: 2hrs 0mins

Name
Class
Date
1.
¿Qué es un dataset de entrenamiento?
a)
Conjunto de datos para evaluar el modelo
b)
Conjunto de datos para ajustar los parámetros del modelo
c)
Conjunto de datos para hacer predicciones finales
d)
Conjunto de datos para comparar algoritmos
2.
¿Qué diferencia principal existe entre clasificación y regresión?
a)
La clasificación predice categorías y la regresión valores continuos
b)
La clasificación predice valores continuos y la regresión categorías
c)
Ambas hacen lo mismo
d)
La regresión no usa variables independientes
3.
¿Qué es el sobreajuste (overfitting)?
a)
Cuando el modelo generaliza bien
b)
Cuando el modelo se ajusta demasiado a los datos de entrenamiento y no generaliza bien
c)
Cuando el modelo tiene sesgo alto
d)
Cuando el modelo solo funciona en clasificación
4.
¿Qué es el aprendizaje por refuerzo?
a)
Un modelo entrenado con recompensas y penalizaciones
b)
Un modelo entrenado con datos numéricos
c)
Un modelo basado en reglas lógicas
d)
Un modelo para normalización
5.
¿Qué es la validación cruzada?
a)
Un método para reducir la dimensionalidad
b)
Una técnica para evaluar el rendimiento de un modelo dividiendo los datos en subconjuntos
c)
Un método de normalización de datos
d)
Un algoritmo de clustering
6.
¿Qué es el subajuste (underfitting)?
a)
Cuando el modelo no aprende lo suficiente de los datos
b)
Cuando el modelo aprende demasiado
c)
Cuando el modelo generaliza correctamente
d)
Cuando el modelo tiene demasiados parámetros
7.
¿Qué significa K en K-Fold Cross Validation?
a)
Número de variables predictoras
b)
Número de veces que se repite el entrenamiento con diferentes particiones
c)
Número de clases en el dataset
d)
Número de parámetros del modelo
8.
¿Qué ventaja tiene la validación cruzada frente a un simple train-test split?
a)
Evita tener que usar test set
b)
Permite evaluar el modelo en múltiples particiones de datos
c)
Hace el modelo más rápido
d)
Siempre mejora la precisión
9.
¿Qué problema ocurre si solo evaluamos en el set de entrenamiento?
a)
Podemos sobreestimar el rendimiento del modelo
b)
El modelo será más rápido
c)
El modelo será siempre más preciso
d)
No habrá problema
10.
¿Qué métrica usamos para evaluar modelos de regresión?
a)
MAE, MSE, RMSE y R²
b)
Precisión y recall
c)
Accuracy y AUC
d)
F1 Score y entropía cruzada
11.
¿Qué métrica se usa típicamente en clasificación binaria?
a)
MAE
b)
MSE
c)
Accuracy
d)
12.
¿Qué se busca con la regularización?
a)
Reducir el error en los datos de test
b)
Evitar el sobreajuste penalizando la complejidad del modelo
c)
Aumentar el número de parámetros
d)
Eliminar outliers
13.
¿Qué significa normalizar datos?
a)
Llevar todos los valores a un rango común
b)
Eliminar valores atípicos
c)
Reemplazar valores nulos
d)
Transformar variables categóricas
14.
¿Qué técnica convierte variables categóricas en variables binarias?
a)
Escalamiento estándar
b)
One-Hot Encoding
c)
Normalización min-max
d)
Regularización
15.
¿Qué función de sklearn aplica StandardScaler()?
a)
Convierte categorías en números
b)
Escala las variables a media 0 y desviación 1
c)
Escala entre 0 y 1
d)
Genera variables polinómicas
16.
¿Qué es imputación de datos?
a)
Eliminar columnas
b)
Reemplazar valores faltantes por algún criterio
c)
Dividir dataset en train y test
d)
Escalar variables
17.
¿Qué ventaja tiene normalizar variables antes de usar KNN?
a)
Evita que variables con escalas diferentes dominen la distancia
b)
Hace el algoritmo más rápido
c)
Elimina la dimensionalidad
d)
Evita el subajuste
18.
¿Qué significa PCA en machine learning?
a)
Principal Component Analysis
b)
Probabilistic Category Approximation
c)
Predictive Classification Algorithm
d)
Partial Correlation Adjustment
19.
¿Qué se busca con PCA?
a)
Reducir la dimensionalidad conservando la varianza
b)
Eliminar filas duplicadas
c)
Reemplazar valores nulos
d)
Aumentar el número de variables
20.
¿Qué método permite dividir datos en entrenamiento y prueba en sklearn?
a)
train_test_split()
b)
StandardScaler()
c)
fit_transform()
d)
GridSearchCV()
21.
¿Qué diferencia principal hay entre regresión lineal simple y múltiple?
a)
La simple tiene una variable independiente, la múltiple varias
b)
La simple usa clasificación, la múltiple regresión
c)
La múltiple usa datos categóricos, la simple numéricos
d)
No existe diferencia
22.
¿Qué representa el coeficiente β1 en regresión lineal?
a)
El error del modelo
b)
La pendiente que indica el cambio en Y por cada unidad en X
c)
La media de la variable dependiente
d)
El intercepto del modelo
23.
¿Qué librería de Python usamos para regresión lineal?
a)
Matplotlib
b)
Scikit-learn
c)
TensorFlow
d)
Keras
24.
¿Qué mide el R² en una regresión?
a)
La media de Y
b)
La proporción de varianza explicada por el modelo
c)
El error cuadrático medio
d)
El error estándar
25.
¿Qué significa un coeficiente negativo en regresión lineal?
a)
Que la relación entre X y Y es inversa
b)
Que el modelo es inválido
c)
Que no hay relación
d)
Que Y siempre es 0
26.
¿Qué es la regresión polinómica?
a)
Una extensión de la lineal que incluye potencias de X
b)
Un modelo no paramétrico
c)
Un modelo para datos categóricos
d)
Un tipo de red neuronal
27.
¿Qué librería de Python incluye OLS para regresión?
a)
Seaborn
b)
Statsmodels
c)
Matplotlib
d)
Numpy
28.
¿Qué problema puede ocurrir si dos variables independientes están muy correlacionadas?
a)
Multicolinealidad
b)
Sobreajuste
c)
Subajuste
d)
Normalidad
29.
¿Qué función de sklearn entrena una regresión logística?
a)
LogisticRegression()
b)
LinearRegression()
c)
fit_logistic()
d)
ClassificationModel()
30.
¿Qué mide K en KNN?
a)
El número de vecinos a considerar
b)
El número de variables
c)
El número de clases
d)
El número de clusters
31.
¿Qué criterio usa un árbol de decisión para dividir nodos?
a)
Media
b)
Varianza
c)
Entropía o Gini
d)
Chi-cuadrado
32.
¿Qué característica tiene un Random Forest?
a)
Un solo árbol de decisión
b)
Conjunto de árboles entrenados en subconjuntos de datos
c)
Una red neuronal
d)
Un PCA
33.
¿Qué es un SVM?
a)
Un modelo de clustering
b)
Un modelo de regresión no lineal
c)
Un modelo que busca el hiperplano que separa clases
d)
Un PCA
34.
¿Qué ventaja tiene KNN?
a)
Es sencillo y no requiere entrenamiento complejo
b)
Siempre predice mejor que SVM
c)
No necesita normalización
d)
Funciona solo con regresión
35.
¿Qué problema puede tener un árbol de decisión?
a)
Sobreajuste si el árbol es muy profundo
b)
Subajuste siempre
c)
Solo funciona con variables categóricas
d)
No maneja datos numéricos
36.
¿Qué función de sklearn se usa para dividir datasets?
a)
split_dataset()
b)
train_test_split()
c)
fit_split()
d)
divide_data()
37.
¿Qué significa MAE?
a)
Error absoluto medio
b)
Error cuadrático medio
c)
Precisión del modelo
d)
Coeficiente de determinación
38.
¿Qué métrica penaliza más los errores grandes?
a)
MAE
b)
MSE
c)
Accuracy
d)
Recall
39.
¿Qué significa R²?
a)
Proporción de varianza explicada por el modelo
b)
Error medio
c)
Error absoluto medio
d)
Precisión del modelo
40.
¿Qué significa una matriz de confusión?
a)
Un gráfico de dispersión
b)
Un resumen de predicciones correctas e incorrectas
c)
Un histograma
d)
Un gráfico de barras
41.
¿Qué mide el Recall?
a)
Proporción de verdaderos positivos respecto a todos los positivos reales
b)
Precisión del modelo
c)
Error absoluto medio
d)
Varianza
42.
¿Qué significa AUC en una curva ROC?
a)
Área bajo la curva
b)
Altura de la curva
c)
Análisis de clasificación unitaria
d)
Accuracy universal
43.
¿Qué métrica es más adecuada para un dataset desbalanceado?
a)
Accuracy
b)
Precision
c)
Recall
d)
AUC
44.
¿Qué significa RMSE?
a)
Raíz del error cuadrático medio
b)
Error absoluto medio
c)
Coeficiente de determinación
d)
Área bajo la curva
45.
¿Qué es Feature Engineering?
a)
Proceso de crear o transformar variables para mejorar el modelo
b)
Proceso de dividir datasets
c)
Proceso de graficar datos
d)
Proceso de eliminar filas
46.
¿Qué es la búsqueda en grilla (GridSearchCV)?
a)
Un método para dividir datasets
b)
Un método para seleccionar hiperparámetros óptimos
c)
Un método de normalización
d)
Un algoritmo de clustering
47.
¿Qué es regularización Lasso?
a)
Penalización de la suma de los valores absolutos de los coeficientes
b)
Penalización de los coeficientes al cuadrado
c)
Eliminar variables correlacionadas
d)
Reducir dimensionalidad
48.
¿Qué es regularización Ridge?
a)
Penalización de la suma de los valores absolutos de los coeficientes
b)
Penalización de los coeficientes al cuadrado
c)
Reducir dimensionalidad
d)
Eliminar variables duplicadas
49.
¿Qué significa hiperparámetro?
a)
Un parámetro ajustado automáticamente durante el entrenamiento
b)
Un parámetro configurado antes del entrenamiento del modelo
c)
Un valor calculado a partir de la muestra
d)
Un parámetro siempre fijo
50.
¿Qué técnica permite seleccionar las variables más importantes?
a)
Selección de características
b)
Normalización
c)
Imputación
d)
One-hot encoding
51.
¿Qué es validación cruzada anidada?
a)
Un método para dividir variables categóricas
b)
Un método para evaluar y ajustar hiperparámetros de forma robusta
c)
Un método para crear árboles de decisión
d)
Un método de clustering
52.
¿Qué librería de Python se usa comúnmente para GridSearchCV?
a)
numpy
b)
scikit-learn
c)
seaborn
d)
matplotlib
53.
¿Qué es el método de boosting?
a)
Un conjunto de modelos entrenados secuencialmente para mejorar el desempeño
b)
Un único modelo de regresión
c)
Un algoritmo de clustering
d)
Un método de normalización
54.
¿Qué es AdaBoost?
a)
Adaptive Boosting
b)
Advanced Bootstrapping
c)
Adjusted Bagging
d)
Average Boost
55.
¿Qué es Gradient Boosting?
a)
Un método que entrena modelos secuenciales optimizando el gradiente del error
b)
Un algoritmo de clustering
c)
Un PCA
d)
Un método de normalización
56.
¿Qué diferencia tiene Bagging respecto a Boosting?
a)
Bagging entrena modelos en paralelo, Boosting de forma secuencial
b)
Bagging siempre es más preciso
c)
Boosting usa un único modelo
d)
Bagging no usa árboles
57.
¿Qué modelo es una implementación eficiente de Gradient Boosting?
a)
KNN
b)
Random Forest
c)
XGBoost
d)
SVM
58.
¿Qué significa 'peso' en AdaBoost?
a)
Importancia asignada a cada observación
b)
Número de vecinos
c)
Número de árboles
d)
Número de clases
59.
¿Qué ventaja tiene XGBoost frente a otros algoritmos?
a)
Mayor velocidad y regularización integrada
b)
Siempre mejor precisión
c)
No requiere datos de entrenamiento
d)
Funciona sin hiperparámetros
60.
¿Qué librería de Python implementa XGBoost?
a)
xgboost
b)
sklearn
c)
keras
d)
matplotlib