WorksheetsML - Tema 4 (knn)
Total questions: 12
Worksheet time: 12mins
En la imagen anexa, suponiendo que se ha obtenido de un algoritmo tipo K-Nearest Neighbour, ¿cual sería el mejor valor de k?
50
10
1
20
¿Cuales de las siguientes afirmaciones son ciertas?
k-NN funciona mejor cuando todos los datos tienen la misma escala
k-NN trabaja mejor con un pequeño número de features (Xs)
k-NN no presupone el número de k
Todas son ciertas
¿Cual es la distancia Euclídea entre los siguientes puntos?
a(1,3)
b(3,3)
0
1
2
3
Deloitte ha construido un clasificador kNN que obtiene una precisión del 100% en los datos de entrenamiento. Cuando implementaron este modelo en su propia compañia para predecir la rotación, se descubrió que el modelo no es del todo preciso. ¿Cuál podría ser el motivo?
Es un modelo con underfitting probablemente
Es un modelo con overfitting probablemente
No había datos suficientes
Ninguna de éstas
¿que afirmaciones son falsas?
kNN es sensible a la escala de los datos
kNN no es adecuado para problemas multi-clase
kNN resuelve problemas de regresión y clasificación
kNN no funciona bien cuando cuando hay más de 5 variables independientes
El residuo es la diferencia entre ...
El valor real de y y el valor estimado de x
El valor real de y y el valor estimado de y
El valor real de x y el valor estimado de y
El valor real de x y el valor estimado de x
En un modelo de regresion, el performance lo podemos medir a través de
Error absoluto medio
F1
Recall
RMSE (Root Mean Square Error)
En un modelo de clasificación, las variables objetivo son
categoricas o discretas
numericas o continuas
ambas son ciertas
Si aumentamos el valor de k,
en el modelo se produce overfitting
en el modelo se produce underfitting
La distancia más corta entre dos puntos es casi siempre
la euclídea
la manhattan
Ninguna de las dos
La bondad de un modelo clasificatorio se puede medir, por ejemplo, mediante ...
Accuracy, Matriz de confusión y curva AUC
Accuracy, Matriz de confusión
Matriz de confusión y curva AUC
Ninguna es cierta
De manera genérica, ¿que % se reserva para el test data durante el split de datos?
40%
50%-70%
15% - 30%
Depende de la situación
