wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Quiz sur le Data Mining

Total questions: 24

Worksheet time: 12mins

Name
Class
Date
1.

Lequel des éléments suivants est un exemple de méthode prédictive ?

a)

K-means

b)

Forêt aléatoire

c)

Règles d'association

d)
  • Clustering hiérarchique

2.

Lequel de ces algorithmes est non supervisé ?

a)
  • Arbre de décision

b)

Régression linéaire

c)

K-means

d)

Forêt aléatoire

3.

Les méthodes de clustering sont des techniques de data mining prédictif.

a)

Vrai

b)

Faux

4.

Qu’est-ce qui caractérise une méthode prédictive ?

a)

Elle cherche à regrouper les données selon leur similarité

b)

Elle tente de prédire une variable cible

c)

Elle ne nécessite pas de données étiquetées

d)
  • Elle utilise des arbres de clustering

5.

La forêt aléatoire est une méthode basée sur plusieurs arbres de décision.

a)

Vrai

b)

Faux

6.

Une mauvaise préparation des données n’impacte pas les résultats du data mining.

a)

Vrai

b)

Faux

7.

Quelle est la première étape dans une analyse exploratoire des données (EDA) ?

a)

Construire un modèle de machine learning

b)

Nettoyer les données

c)

Visualiser et comprendre la structure des données

d)

Supprimer les outliers

8.

Quel type de graphique est le plus adapté pour visualiser la distribution d'une variable continue ?

a)

Carte thermique (heatmap)

b)
  • Diagrammes en secteur (pie chart)

c)

Diagramme de Pareto

d)

Boîte à moustaches (boxplot)

9.

L’objectif principal de l’EDA est de...

a)

Réduire la taille des données

b)

Créer des dashboards

c)

Comprendre les relations et anomalies dans les données

d)

Encoder les variables catégorielles

10.

L’EDA permet d’identifier les valeurs manquantes dans un jeu de données.

a)

Vrai

b)

Faux

11.

Les corrélations entre variables sont inutiles dans une analyse exploratoire.

a)

Vrai

b)

Faux

12.

Les outliers doivent toujours être supprimés automatiquement.

a)

Vrai

b)

Faux

13.

Associez l’outil à sa fonction en EDA : Heatmap

a)

Identifier les valeurs extrêmes

b)

Voir la distribution d’une variable

c)

Visualiser les corrélations entre variables

d)

Résumer les valeurs d’une variable catégorielle

14.

Associez l’outil à sa fonction en EDA : Tableau de fréquence

a)

Identifier les valeurs extrêmes

b)

Voir la distribution d’une variable

c)

Visualiser les corrélations entre variables

d)

Résumer les valeurs d’une variable catégorielle

15.

Associez l’outil à sa fonction en EDA : Histogramme

a)

Identifier les valeurs extrêmes

b)

Voir la distribution d’une variable

c)

Visualiser les corrélations entre variables

d)

Résumer les valeurs d’une variable catégorielle

16.

Associez l’outil à sa fonction en EDA : Boxplot

a)

Identifier les valeurs extrêmes

b)

Voir la distribution d’une variable

c)

Visualiser les corrélations entre variables

d)

Résumer les valeurs d’une variable catégorielle

17.

Quand vous recevez un nouveau dataset, quelle est votre première réaction ?

a)

Je le charge dans un notebook et je le regarde rapidement

b)

J’essaie directement un algorithme pour voir ce que ça donne

c)

Je commence par lire la documentation ou le dictionnaire des données

d)

Je nettoie tout ce qui est vide ou étrange avant d'explorer

18.

Quelle erreur fréquente peut fausser complètement une analyse ?

a)

Oublier d’ajouter un titre à un graphique

b)

Utiliser une variable cible sans la comprendre

c)

Appliquer un modèle avant d’avoir encodé les données

19.

Il faut toujours supprimer les lignes contenant des valeurs manquantes.

a)

Vrai

b)

Faux

20.

Toutes les colonnes numériques peuvent être utilisées sans transformation.

a)

Vrai

b)

Faux

21.

L’analyse du dictionnaire de données est facultative.

a)

Vrai

b)

Faux

22.

Associez ce problème courant à sa cause probable : Mauvais résultats du modèle

a)

Données mal nettoyées ou non représentatives

b)

Types de données incorrects

c)

Mauvais choix de variables ou de graphiqes

23.

Associez ce problème courant à sa cause probable : Graphiques non parlants

a)

Données mal nettoyées ou non représentatives

b)

Types de données incorrects

c)

Mauvais choix de variables ou de graphiqes

24.

Associez l’outil à sa fonction en EDA : Nuage de points (scatter plot)

a)

Visualiser la distribution d'une variable

b)

Identifier les relations entre deux variables

c)

Résumer les valeurs d’une variable catégorielle