wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

ML - Tema 4 (knn)

Total questions: 12

Worksheet time: 12mins

Name
Class
Date
1.

En la imagen anexa, suponiendo que se ha obtenido de un algoritmo tipo K-Nearest Neighbour, ¿cual sería el mejor valor de k?

a)

50

b)

10

c)

1

d)

20

2.

¿Cuales de las siguientes afirmaciones son ciertas?

a)

k-NN funciona mejor cuando todos los datos tienen la misma escala

b)

k-NN trabaja mejor con un pequeño número de features (Xs)

c)

k-NN no presupone el número de k

d)

Todas son ciertas

3.

¿Cual es la distancia Euclídea entre los siguientes puntos?

a(1,3)

b(3,3)

a)

0

b)

1

c)

2

d)

3

4.

Deloitte ha construido un clasificador kNN que obtiene una precisión del 100% en los datos de entrenamiento. Cuando implementaron este modelo en su propia compañia para predecir la rotación, se descubrió que el modelo no es del todo preciso. ¿Cuál podría ser el motivo?

a)

Es un modelo con underfitting probablemente

b)

Es un modelo con overfitting probablemente

c)

No había datos suficientes

d)

Ninguna de éstas

5.

¿que afirmaciones son falsas?

a)

kNN es sensible a la escala de los datos

b)

kNN no es adecuado para problemas multi-clase

c)

kNN resuelve problemas de regresión y clasificación

d)

kNN no funciona bien cuando cuando hay más de 5 variables independientes

6.

El residuo es la diferencia entre ...

a)

El valor real de y y el valor estimado de x

b)

El valor real de y y el valor estimado de y

c)

El valor real de x y el valor estimado de y

d)

El valor real de x y el valor estimado de x

7.

En un modelo de regresion, el performance lo podemos medir a través de

a)

Error absoluto medio

b)

F1

c)

Recall

d)

RMSE (Root Mean Square Error)

8.

En un modelo de clasificación, las variables objetivo son

a)

categoricas o discretas

b)

numericas o continuas

c)

ambas son ciertas

9.

Si aumentamos el valor de k,

a)

en el modelo se produce overfitting

b)

en el modelo se produce underfitting

10.

La distancia más corta entre dos puntos es casi siempre

a)

la euclídea

b)

la manhattan

c)

Ninguna de las dos

11.

La bondad de un modelo clasificatorio se puede medir, por ejemplo, mediante ...

a)

Accuracy, Matriz de confusión y curva AUC

b)

Accuracy, Matriz de confusión

c)

Matriz de confusión y curva AUC

d)

Ninguna es cierta

12.

De manera genérica, ¿que % se reserva para el test data durante el split de datos?

a)

40%

b)

50%-70%

c)

15% - 30%

d)

Depende de la situación