WorksheetsEvaluación Final Inteligencia Artificial
Total questions: 22
Worksheet time: 33mins
Una empresa de mensajería registra información de sus envíos: ciudad de origen, ciudad de destino, peso del paquete, tipo de servicio, distancia recorrida, día de la semana y condiciones climáticas.
Con estos datos quiere construir un modelo que estime cuánto tiempo tardará un nuevo envío en ser entregado, expresado en horas.
Clasificación binaria
Clasificación multiclase
Regresión
Aprendizaje por refuerzo
Regresión multiclase
Una plataforma de música quiere analizar los hábitos de sus usuarios: géneros escuchados, tiempo promedio de reproducción, artistas favoritos, frecuencia de uso y canciones guardadas.
La empresa no tiene categorías definidas previamente para los usuarios, pero quiere encontrar grupos con comportamientos parecidos para personalizar recomendaciones.
¿Qué tipo de enfoque de aprendizaje automático sería el más adecuado?
Regresión
Clasificación supervisada
Aprendizaje por refuerzo
Análisis de series de tiempo
Aprendizaje no supervisado (clustering)
¿Cuál de las siguientes situaciones describe mejor un problema de aprendizaje supervisado?
Agrupar documentos según su contenido sin etiquetas previas.
Predecir la probabilidad de que un cliente cancele un servicio, usando un histórico donde se sabe quién canceló y quién no.
Reducir la dimensionalidad de un conjunto de datos muy grande.
Encontrar patrones de anomalías sin saber antes cuáles son.
Generar imágenes realistas a partir de ruido.
¿Cuál de los siguientes algoritmos se utiliza principalmente para clasificación?
Regresión lineal
Regresión polinómica
K-Means
Regresión logística
DBSCAN
¿Cuál de los siguientes algoritmos es más adecuado para predecir un valor numérico continuo?
Regresión lineal
Naive Bayes
Árbol de decisión solo con salidas “sí/no”
K-Means
DBSCAN
¿Cuál de las siguientes opciones es un ejemplo claro de algoritmo no supervisado?
Regresión logística
Naive Bayes
Árbol de decisión
Random Forest
K-Means
¿Qué busca hacer un modelo de regresión lineal simple?
Separar datos en grupos distintos sin etiquetas.
Encontrar una línea (o recta) que relacione una variable de entrada con una salida numérica.
Clasificar datos en categorías usando probabilidades.
Generar nuevas características a partir de las existentes.
Aumentar el número de clases en un problema.
En un problema de clasificación binaria (por ejemplo, “fraude” / “no fraude”), la regresión logística es útil porque:
Produce siempre un número entero como salida.
Produce una probabilidad entre 0 y 1 que puede interpretarse como “riesgo” o “confianza”.
No necesita datos etiquetados.
Solo funciona con datos de texto.
Genera automáticamente nuevas variables.
Una ventaja importante de los árboles de decisión frente a otros modelos más “caja negra” es:
Siempre son más precisos que cualquier otro modelo.
Son fáciles de interpretar y explicar, porque se basan en preguntas tipo “si-entonces”.
No requieren datos para entrenarse.
No pueden sobreajustar nunca.
No necesitan parámetros ni configuración.
¿Qué idea general hay detrás de un Random Forest?
Entrenar un único árbol perfecto y podarlo al máximo.
Entrenar muchos árboles distintos y combinar sus predicciones para obtener un resultado más estable.
Entrenar redes neuronales y árboles al mismo tiempo.
Reemplazar los datos originales por datos sintéticos.
Usar solo un árbol muy pequeño para evitar errores.
¿Qué función cumplen los pesos en una red neuronal?
Determinan la importancia de las entradas en el cálculo de la salida
Sirven para guardar imágenes dentro del modelo
Indican cuántas capas debe tener la red
Definen el lenguaje de programación usado
Eliminan automáticamente los datos incorrectos
¿Cuál es la función principal de una capa oculta en una red neuronal?
Mostrar los resultados al usuario
Guardar los datos originales sin modificarlos
Extraer patrones intermedios a partir de los datos de entrada
Reemplazar la base de datos del sistema
Evitar que el modelo use funciones matemáticas
¿Qué hace principalmente el algoritmo K-Means?
Predice un valor numérico continuo para cada punto.
Clasifica puntos en dos clases (0 o 1).
Agrupa puntos en K grupos, intentando que los puntos de un mismo grupo estén cercanos entre sí.
Ordena los puntos de menor a mayor.
Elimina los outliers automáticamente.
En un pipeline típico de Machine Learning supervisado, ¿cuál de las siguientes secuencias tiene un orden más razonable?
Entrenar modelo → Dividir datos → Limpiar datos → Evaluar modelo
Limpiar y preparar datos → Dividir en train/test → Entrenar modelo → Evaluar modelo
Dividir en train/test → Evaluar modelo → Entrenar modelo → Limpiar datos
Evaluar modelo → Limpiar datos → Entrenar modelo → Dividir datos
Entrenar modelo → Evaluar modelo → Limpiar datos → Dividir datos
¿Por qué se dividen los datos en entrenamiento y prueba?
Para reducir el tamaño del archivo.
Para que el modelo aprenda y se evalúe en datos diferentes, evitando engañarnos con un rendimiento inflado.
Para poder borrar la mitad de los datos.
Para que el modelo sólo vea ejemplos fáciles.
Para poder usar algoritmos no supervisados.
En un pipeline de ML, el preprocesamiento de datos (limpieza, escalado, tratamiento de valores faltantes) es importante porque:
Solo sirve para que el dataset se vea más bonito.
No afecta en nada el desempeño del modelo.
Reemplaza la necesidad de dividir en train/test.
Hace que todos los modelos tengan la misma precisión.
Puede mejorar la calidad de la información que ve el modelo y hacer que algunos algoritmos funcionen mejor.
En la matriz, ¿Cuál valor corresponde a Falsos Positivos (FP)?
70
20
100
200
10
En la imagen, la letra b representa:
Verdaderos positivos
Verdaderos negativos
Falsos positivos
Falsos negativos
Casos totales
¿Cuáles letras representan predicciones correctas del clasificador?
a y b
a y c
b y d
a y d
b y c
La accuracy mide:
Qué proporción de positivos reales encuentra el modelo
Qué proporción de predicciones positivas son correctas
Qué proporción total de predicciones son correctas
El balance entre precisión y recall
La capacidad de detectar negativos
Si en fraude es peor dejar pasar un fraude que alertar por error, ¿qué métrica es más importante mejorar?
Accuracy
Precisión
Recall / Sensibilidad
Especificidad
Error cuadrático medio
El error en el que el modelo marca positivo algo que no era de la clase corresponde a:
a
b
c
d
a + d
