Font size
WorksheetsPreguntas sobre Aprendizaje Automático
Total questions: 25
Worksheet time: 51mins
¿Cuál es la tarea principal del aprendizaje supervisado, tal como se describe en el texto?
Agrupar elementos sin etiquetas predefinidas.
Encontrar patrones ocultos en los datos.
Aprender de los datos especificando una variable objetivo.
Optimizar algoritmos sin una salida deseada.
En el contexto del aprendizaje automático, ¿cómo se denominan las mediciones individuales que, al combinarse, forman un ejemplo de entrenamiento (usualmente columnas en un conjunto de datos)?
Clases.
Variables objetivo.
Características (Features).
Conjuntos de prueba.
Si la variable objetivo puede tomar un número infinito de valores numéricos (por ejemplo, 0.100, 42.001), la tarea de aprendizaje supervisado se conoce como:
Clasificación.
Agrupamiento (Clustering).
Regresión.
Análisis de asociación.
¿Cuál de las siguientes es una aplicación de aprendizaje automático?
Predicción de los movimientos del mercado de valores.
Filtrado de spam en el correo electrónico.
Diseño de robots industriales.
Creación de efectos visuales para películas.
Según la metodología de desarrollo de aplicaciones de aprendizaje automático, ¿qué paso se realiza después de 'Analizar los datos de entrada' y antes de 'Probar el algoritmo'?
Recopilar datos.
Usar el sistema.
Entrenar el algoritmo.
Elegir el algoritmo correcto.
¿Cuál es una de las razones principales por las que se elige Python para implementar aplicaciones de aprendizaje automático en este libro?
Es el lenguaje de programación más antiguo y establecido.
Tiene bibliotecas excelentes para operaciones matriciales y una comunidad activa de desarrolladores.
Es el único lenguaje que soporta el aprendizaje supervisado.
Es inherentemente más rápido que otros lenguajes interpretados.
¿Qué es un 'conjunto de entrenamiento' (training set) en el contexto del aprendizaje automático?
El conjunto de datos que se utiliza para evaluar la precisión final del algoritmo.
El conjunto de ejemplos de calidad conocidos que se utiliza para que el algoritmo aprenda.
Cualquier dato de entrada que no tiene una variable objetivo.
Un conjunto de datos que se usa para ajustar los parámetros del modelo.
¿Cuál es la idea principal detrás del algoritmo k-Nearest Neighbors (kNN) para la clasificación?
Crear un árbol de decisiones para categorizar elementos.
Utilizar la teoría de la probabilidad para asignar clases.
Clasificar elementos basándose en la distancia a sus vecinos más cercanos en el conjunto de entrenamiento.
Encontrar una línea de mejor ajuste para separar los datos.
Para calcular la distancia entre dos vectores, xA y xB, en el algoritmo kNN, ¿qué fórmula de distancia se presenta en el texto?
La suma de los valores absolutos de las diferencias.
La distancia euclidiana, que implica la raíz cuadrada de la suma de los cuadrados de las diferencias.
El producto punto entre los vectores.
La correlación de Pearson.
¿Cuál es una de las desventajas del algoritmo k-Nearest Neighbors (kNN) mencionada en el texto?
Es propenso al sobreajuste.
Es computacionalmente costoso y requiere mucha memoria.
No funciona con valores nominales.
Es difícil de entender para los humanos.
¿Cómo se calcula la tasa de error de un clasificador?
Sumando el número de predicciones correctas y dividiendo por el total de pruebas.
Dividiendo el número de piezas de datos mal clasificadas por el número total de puntos de datos.
¿Cómo se realiza un ejemplo de clasificador? A) Sumando el número de predicciones correctas y dividiendo por el total de pruebas. B) Dividiendo el número de piezas de datos mal clasificadas por el número total de puntos de datos probados. C) Multiplicando el número de errores por la precisión del clasificador. D) Restando la precisión del 1.0.
Sumando el número de predicciones correctas y dividiendo por el total de pruebas.
Dividiendo el número de piezas de datos mal clasificadas por el número total de puntos de datos probados.
Multiplicando el número de errores por la precisión del clasificador.
Restando la precisión del 1.0.
En el ejemplo del sitio de citas usando kNN, ¿por qué fue necesario normalizar las características numéricas, como las millas de viajero frecuente?
Para reducir la cantidad de datos.
Para asegurar que una característica con valores más grandes no domine la medida de distancia.
Para convertir todos los datos a valores binarios.
Para hacer que el algoritmo sea más lento pero más preciso.
Además de mejorar las coincidencias en un sitio de citas, ¿qué otra aplicación del mundo real se explora con kNN?
Clasificación de correos electrónicos no deseados.
Detección de fraude con tarjetas de crédito.
Un sistema de reconocimiento de escritura a mano.
Pronóstico de precios de LEGO.
¿Qué limitación del algoritmo kNN se menciona como una razón para explorar otros métodos de clasificación, como los árboles de decisión?
No puede manejar valores atípicos (outliers).
Es demasiado rápido y eficiente para conjuntos de datos grandes.
No da ninguna idea de la estructura subyacente de los datos (por ejemplo, qué es una instancia 'promedio' de cada clase).
Solo funciona con datos linealmente separables.
¿Con qué juego se compara el funcionamiento de un árbol de decisión para ayudar a comprender su concepto?
Sudoku.
Adivina quién.
Veinte preguntas.
Búsqueda de tesoros.
En la construcción de un árbol de decisión, ¿qué métrica se utiliza para cuantificar la 'desorganización' o 'mezcla' de un conjunto de datos antes de una división, y cómo se relaciona con la ganancia de información?
La precisión, una mayor precisión indica mayor desorden.
La entropía de Shannon; un valor más alto indica mayor desorden, y se busca la división con la mayor ganancia de información.
La impureza de Gini; un valor más bajo indica mayor desorden.
La varianza, un valor más bajo indica mayor desorden.
El algoritmo ID3, utilizado en el texto para la construcción de árboles de decisión, ¿cómo maneja la división de los datos cuando una característica tiene múltiples valores posibles?
Siempre realiza una división binaria (sí/no).
Crea una rama separada para cada uno de los valores posibles de esa característica.
Promedia los valores de la característica para una sola división.
Elimina la característica si tiene demasiados valores.
¿Qué biblioteca de Python se utiliza para graficar árboles de decisión?
NumPy.
SciPy.
Matplotlib.
Pandas.
¿Qué técnica se describe para reducir la complejidad de un árbol de decisión y evitar el sobreajuste (overfitting), a menudo usando un conjunto de prueba?
Normalización.
Reducción de dimensionalidad.
Poda (Pruning).
Aumento de datos (Data augmentation).
¿Qué ejemplo práctico se utiliza para ilustrar cómo los árboles de decisión pueden predecir una categoría específica para un individuo?
Clasificar mensajes de spam.
Predecir la edad de un abalone.
Estimar la mortalidad de caballos por cólico.
Predecir el tipo de lentes de contacto que una persona necesita.
Explica el desarrollo de la estructura, funcionamiento y funcionalidad de un algoritmo de fuerza bruta.
¿Cómo funciona la analítica descriptiva y predictiva en python?
¿Qué pasos involucra el desarrollo de un algoritmo desde su idea hasta su implementación?
¿Cuáles son las falsedades y verdades descubiertas en los últimos 2 años respecto a la inteligencia artificial?
