WorksheetsQuiz sur le Data Mining
Total questions: 24
Worksheet time: 12mins
Lequel des éléments suivants est un exemple de méthode prédictive ?
K-means
Forêt aléatoire
Règles d'association
Clustering hiérarchique
Lequel de ces algorithmes est non supervisé ?
Arbre de décision
Régression linéaire
K-means
Forêt aléatoire
Les méthodes de clustering sont des techniques de data mining prédictif.
Vrai
Faux
Qu’est-ce qui caractérise une méthode prédictive ?
Elle cherche à regrouper les données selon leur similarité
Elle tente de prédire une variable cible
Elle ne nécessite pas de données étiquetées
Elle utilise des arbres de clustering
La forêt aléatoire est une méthode basée sur plusieurs arbres de décision.
Vrai
Faux
Une mauvaise préparation des données n’impacte pas les résultats du data mining.
Vrai
Faux
Quelle est la première étape dans une analyse exploratoire des données (EDA) ?
Construire un modèle de machine learning
Nettoyer les données
Visualiser et comprendre la structure des données
Supprimer les outliers
Quel type de graphique est le plus adapté pour visualiser la distribution d'une variable continue ?
Carte thermique (heatmap)
Diagrammes en secteur (pie chart)
Diagramme de Pareto
Boîte à moustaches (boxplot)
L’objectif principal de l’EDA est de...
Réduire la taille des données
Créer des dashboards
Comprendre les relations et anomalies dans les données
Encoder les variables catégorielles
L’EDA permet d’identifier les valeurs manquantes dans un jeu de données.
Vrai
Faux
Les corrélations entre variables sont inutiles dans une analyse exploratoire.
Vrai
Faux
Les outliers doivent toujours être supprimés automatiquement.
Vrai
Faux
Associez l’outil à sa fonction en EDA : Heatmap
Identifier les valeurs extrêmes
Voir la distribution d’une variable
Visualiser les corrélations entre variables
Résumer les valeurs d’une variable catégorielle
Associez l’outil à sa fonction en EDA : Tableau de fréquence
Identifier les valeurs extrêmes
Voir la distribution d’une variable
Visualiser les corrélations entre variables
Résumer les valeurs d’une variable catégorielle
Associez l’outil à sa fonction en EDA : Histogramme
Identifier les valeurs extrêmes
Voir la distribution d’une variable
Visualiser les corrélations entre variables
Résumer les valeurs d’une variable catégorielle
Associez l’outil à sa fonction en EDA : Boxplot
Identifier les valeurs extrêmes
Voir la distribution d’une variable
Visualiser les corrélations entre variables
Résumer les valeurs d’une variable catégorielle
Quand vous recevez un nouveau dataset, quelle est votre première réaction ?
Je le charge dans un notebook et je le regarde rapidement
J’essaie directement un algorithme pour voir ce que ça donne
Je commence par lire la documentation ou le dictionnaire des données
Je nettoie tout ce qui est vide ou étrange avant d'explorer
Quelle erreur fréquente peut fausser complètement une analyse ?
Oublier d’ajouter un titre à un graphique
Utiliser une variable cible sans la comprendre
Appliquer un modèle avant d’avoir encodé les données
Il faut toujours supprimer les lignes contenant des valeurs manquantes.
Vrai
Faux
Toutes les colonnes numériques peuvent être utilisées sans transformation.
Vrai
Faux
L’analyse du dictionnaire de données est facultative.
Vrai
Faux
Associez ce problème courant à sa cause probable : Mauvais résultats du modèle
Données mal nettoyées ou non représentatives
Types de données incorrects
Mauvais choix de variables ou de graphiqes
Associez ce problème courant à sa cause probable : Graphiques non parlants
Données mal nettoyées ou non représentatives
Types de données incorrects
Mauvais choix de variables ou de graphiqes
Associez l’outil à sa fonction en EDA : Nuage de points (scatter plot)
Visualiser la distribution d'une variable
Identifier les relations entre deux variables
Résumer les valeurs d’une variable catégorielle
