wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Test d'Évaluation : Data Science & Machine Learning

Total questions: 50

Worksheet time: 25mins

Name
Class
Date
1.

Quelle est la différence entre la Moyenne (Mean) et la Médiane (Median) ?

a)

Aucune.

b)

La moyenne est la somme divisée par le nombre ; la médiane est la valeur centrale qui sépare l'ensemble en deux moitiés égales (moins sensible aux valeurs aberrantes/outliers).

c)

La médiane est toujours plus grande.

d)

La moyenne est pour les textes.

2.

En Python, quelle bibliothèque est le standard pour la manipulation de données tabulaires (DataFrames) ?

a)

NumPy

b)

Pandas

c)

Matplotlib

d)

Scikit-learn

3.

Qu'est-ce que l'apprentissage supervisé (Supervised Learning) ?

a)

L'algorithme apprend sans aide.

b)

L'algorithme apprend à partir d'un jeu de données étiqueté (input + output attendu) pour prédire des résultats futurs.

c)

L'algorithme regroupe des données similaires.

d)

C'est de la magie.

4.

Qu'est-ce qu'une variable catégorielle ?

a)

Un nombre infini.

b)

Une variable qui peut prendre une valeur parmi un ensemble limité et fixe de catégories (ex: Couleur: Rouge, Bleu, Vert).

c)

Une date.

d)

Une image.

5.

Qu'est-ce que la Corrélation ?

a)

Une relation de cause à effet prouvée.

b)

Une mesure statistique exprimant la mesure dans laquelle deux variables sont linéairement liées.

c)

Une erreur de calcul.

d)

Une fonction Python.

6.

Qu'est-ce qu'un "Outlier" (Valeur aberrante) ?

a)

Une valeur très proche de la moyenne.

b)

Une donnée qui s'écarte considérablement des autres observations.

c)

Une donnée manquante.

d)

Une donnée parfaite.

7.

Quelle bibliothèque Python est utilisée pour la visualisation de données de base ?

a)

Pandas

b)

Matplotlib (ou Seaborn)

c)

TensorFlow

d)

Requests

8.

Qu'est-ce que la Régression (vs Classification) ?

a)

La régression prédit une valeur continue (ex: prix d'une maison) ; la classification prédit une classe/catégorie discrète (ex: Spam/Non-Spam).

b)

C'est l'inverse.

c)

La régression c'est pour le passé.

d)

La classification c'est pour les chiffres.

9.

Qu'est-ce que le "Training Set" vs "Test Set" ?

a)

On utilise le Test Set pour entraîner.

b)

Le Training Set sert à entraîner le modèle ; le Test Set (jamais vu par le modèle) sert à évaluer sa performance finale.

c)

C'est la même chose.

d)

On n'a pas besoin de Test Set.

10.

Qu'est-ce que "NaN" en Pandas ?

a)

Not a Number (valeur manquante).

b)

Une grand-mère.

c)

Un nombre négatif.

d)

Une erreur fatale.

11.

Qu'est-ce qu'un Histogramme ?

a)

Un diagramme circulaire.

b)

Une représentation graphique de la distribution d'une variable numérique (fréquence par intervalles).

c)

Une carte géographique.

d)

Une liste d'histoire.

12.

En apprentissage non supervisé, quel est le but du "Clustering" ?

a)

Prédire le futur.

b)

Regrouper des objets similaires dans des ensembles (clusters) sans avoir d'étiquettes prédéfinies.

c)

Trier par ordre alphabétique.

d)

Calculer la moyenne.

13.

Qu'est-ce que NumPy ?

a)

Une base de données.

b)

Une bibliothèque Python fondamentale pour le calcul scientifique (tableaux multidimensionnels, matrices).

c)

Un outil web.

d)

Un jeu.

14.

Qu'est-ce que la Variance ?

a)

La différence entre deux nombres.

b)

Une mesure de la dispersion des valeurs par rapport à la moyenne.

c)

La racine carrée de la moyenne.

d)

Une variable Python.

15.

Comment gérer les données manquantes (Missing Values) ?

a)

Toujours tout supprimer.

b)

Imputation (remplacer par moyenne/médiane) ou suppression des lignes/colonnes, selon le contexte.

c)

Les laisser telles quelles (la plupart des modèles plantent).

d)

Mettre zéro partout.

16.

Qu'est-ce que l'Overfitting (Surapprentissage) ?

a)

Le modèle est trop simple.

b)

Le modèle apprend "par coeur" les données d'entraînement (y compris le bruit) et ne généralise pas bien sur de nouvelles données (Variance élevée).

c)

Le modèle est parfait.

d)

Le modèle ne s'entraîne pas.

17.

Qu'est-ce que la Cross-Validation (Validation Croisée) ?

a)

Vérifier deux fois.

b)

Une technique pour évaluer la performance d'un modèle en divisant les données en plusieurs sous-ensembles (folds) tour à tour utilisés pour l'entraînement et la validation.

c)

Valider avec un ami.

d)

Utiliser deux ordinateurs.

18.

Quelle métrique utiliser pour évaluer un modèle de classification avec des classes très déséquilibrées (ex: Fraude 1%, Non-Fraude 99%) ?

a)

L'Accuracy (Exactitude).

b)

Precision, Recall, ou F1-Score (et matrice de confusion).

c)

La moyenne.

d)

Le temps de calcul.

19.

Qu'est-ce que "Feature Scaling" (Standardisation/Normalisation) ?

a)

Changer la taille de l'image.

b)

Mettre les variables numériques à la même échelle (ex: entre 0 et 1 ou moyenne 0 variance 1) pour aider les algorithmes basés sur la distance (KNN, SVM, Gradient Descent).

c)

Supprimer des features.

d)

Ajouter des features.

20.

Qu'est-ce que l'algorithme "Random Forest" ?

a)

Planter des arbres aléatoirement.

b)

Une méthode d'ensemble (Ensemble Learning) construisant de nombreux arbres de décision lors de l'entraînement et retournant la classe modèle (classification) ou la prédiction moyenne (régression).

c)

Un algorithme de clustering.

d)

Un réseau de neurones.

21.

Qu'est-ce que la "Matrice de Confusion" ?

a)

Un tableau résumant les performances d'un modèle de classification (Vrais Positifs, Faux Positifs, Vrais Négatifs, Faux Négatifs).

b)

Une matrice mathématique complexe.

c)

Un film.

d)

Une erreur de code.

22.

Qu'est-ce que le "Recall" (Rappel) ?

a)

La capacité à se souvenir.

b)

Le taux de Vrais Positifs parmi tous les positifs réels (TP / (TP + FN)). Important si on veut ne rater aucun cas positif (ex: cancer).

c)

L'exactitude globale.

d)

Le taux de Faux Positifs.

23.

Qu'est-ce que "One-Hot Encoding" ?

a)

Chauffer les données.

b)

Une technique pour convertir des variables catégorielles en vecteurs binaires (0 ou 1) pour les algorithmes de ML.

c)

Encoder des vidéos.

d)

Une méthode de compression.

24.

Qu'est-ce que le "Biais" (Bias) vs "Variance" ?

a)

Biais = erreur due à des hypothèses trop simples (Underfitting) ; Variance = erreur due à une trop grande sensibilité aux fluctuations du training set (Overfitting).

b)

C'est pareil.

c)

Le biais est bon, la variance est mauvaise.

d)

Le biais est une erreur de code.

25.

Qu'est-ce que l'algorithme K-Means ?

a)

Un algorithme de classification supervisé.

b)

Un algorithme de clustering non supervisé qui partitionne les données en K clusters en minimisant la distance intra-cluster.

c)

Un calcul de moyenne.

d)

Un algorithme de tri.

26.

Qu'est-ce que la régularisation (L1 Lasso / L2 Ridge) ?

a)

Une règle administrative.

b)

Une technique pour réduire l'overfitting en ajoutant une pénalité à la fonction de coût basée sur la taille des coefficients du modèle.

c)

Nettoyer les données régulières.

d)

Accélérer le modèle.

27.

Qu'est-ce que Scikit-learn ?

a)

Un langage.

b)

La bibliothèque Python la plus populaire pour le Machine Learning classique (non-deep).

c)

Un outil de visualisation.

d)

Une base de données.

28.

Qu'est-ce que "Feature Engineering" ?

a)

Construire des robots.

b)

L'art de créer de nouvelles variables explicatives pertinentes à partir des données brutes pour améliorer la performance des modèles.

c)

Supprimer des données.

d)

Réparer le code.

29.

Qu'est-ce que le ROC-AUC ?

a)

Un groupe de rock.

b)

Receiver Operating Characteristic - Area Under Curve : une mesure de performance pour les problèmes de classification binaire, indépendante du seuil de décision.

c)

Une fonction de perte.

d)

Un algorithme.

30.

Qu'est-ce que l'algorithme "Gradient Descent" ?

a)

Une descente de ski.

b)

Un algorithme d'optimisation itératif utilisé pour minimiser une fonction de coût (trouver les meilleurs paramètres du modèle).

c)

Un algorithme de tri.

d)

Un arbre de décision.

31.

Qu'est-ce qu'un Réseau de Neurones Artificiels (ANN) ?

a)

Un cerveau humain.

b)

Un modèle informatique inspiré du cerveau biologique, composé de couches de nœuds connectés, capable d'apprendre des motifs complexes.

c)

Un réseau internet.

d)

Un robot.

32.

Qu'est-ce que le "Backpropagation" (Rétropropagation) ?

a)

Revenir en arrière.

b)

L'algorithme clé pour entraîner les réseaux de neurones : il calcule le gradient de la fonction de perte par rapport aux poids en remontant de la sortie vers l'entrée pour mettre à jour les poids.

c)

Une erreur de réseau.

d)

Une propagation de virus.

33.

Qu'est-ce qu'un CNN (Convolutional Neural Network) ?

a)

Une chaîne TV.

b)

Un type de réseau de neurones spécialisé dans le traitement de données ayant une structure de grille, comme les images (vision par ordinateur).

c)

Un réseau pour le texte.

d)

Un algorithme de clustering.

34.

Qu'est-ce qu'un RNN (Recurrent Neural Network) ?

a)

Un réseau aléatoire.

b)

Un réseau de neurones conçu pour traiter des séquences de données (séries temporelles, texte) où l'ordre compte, grâce à une mémoire interne.

c)

Un réseau d'images.

d)

Un réseau simple.

35.

Qu'est-ce que le "Transfer Learning" ?

a)

Transférer de l'argent.

b)

Réutiliser un modèle pré-entraîné sur une tâche massive (ex: ImageNet) comme point de départ pour une nouvelle tâche connexe, économisant temps et données.

c)

Copier des fichiers.

d)

Apprendre deux fois.

36.

Qu'est-ce que l'Activation Function (ex: ReLU, Sigmoid) ?

a)

Un bouton marche/arrêt.

b)

Une fonction mathématique appliquée à la sortie d'un neurone pour introduire de la non-linéarité dans le réseau, lui permettant d'apprendre des relations complexes.

c)

Une fonction de tri.

d)

Une fonction de perte.

37.

Qu'est-ce que 'Dropout' en Deep Learning ?

a)

Abandonner l'école.

b)

Une technique de régularisation consistant à ignorer aléatoirement certains neurones durant l'entraînement pour éviter l'overfitting.

c)

Une erreur de connexion.

d)

Supprimer des données.

38.

Qu'est-ce que le NLP (Natural Language Processing) ?

a)

Une thérapie.

b)

Le domaine de l'IA consacré à l'interaction entre les ordinateurs et le langage humain (analyse de sentiment, traduction, chatbots).

c)

Le traitement d'images.

d)

La programmation neurolinguistique.

39.

Qu'est-ce que 'Word Embedding' (ex: Word2Vec) ?

a)

Écrire des mots.

b)

Une technique de représentation des mots sous forme de vecteurs de nombres réels, où les mots sémantiquement proches ont des vecteurs proches.

c)

Un dictionnaire.

d)

Une police d'écriture.

40.

Qu'est-ce que 'Hyperparameter Tuning' ?

a)

Accorder une guitare.

b)

Le processus de recherche des valeurs optimales pour les paramètres qui ne sont pas appris par le modèle (ex: learning rate, nombre d'arbres) pour maximiser la performance.

c)

Changer les données.

d)

Écrire du code rapide.

41.

Qu'est-ce que XGBoost / LightGBM ?

a)

Des boissons énergisantes.

b)

Des implémentations optimisées et très performantes de 'Gradient Boosting' sur des arbres de décision, gagnant souvent les compétitions Kaggle sur données tabulaires.

c)

Des réseaux de neurones.

d)

Des outils de nettoyage.

42.

Qu'est-ce que MLOps ?

a)

ML Operations : l'application des pratiques DevOps aux systèmes de Machine Learning (CI/CD, monitoring de modèles, gestion du cycle de vie).

b)

Un système d'exploitation.

c)

Une équipe de maintenance.

d)

Un algorithme.

43.

Qu'est-ce que 'Data Drift' (Dérive des données) ?

a)

Une voiture qui dérape.

b)

Le changement des propriétés statistiques des données d'entrée au fil du temps, ce qui peut dégrader la performance d'un modèle en production.

c)

Une perte de données.

d)

Un bug.

44.

Qu'est-ce que PCA (Principal Component Analysis) ?

a)

Un type de plastique.

b)

Une technique de réduction de dimensionnalité non supervisée qui projette les données sur de nouveaux axes (composantes principales) maximisant la variance.

c)

Un algorithme de classification.

d)

Une analyse chimique.

45.

Qu'est-ce que BERT (Bidirectional Encoder Representations from Transformers) ?

a)

Un prénom.

b)

Un modèle de langage (Transformer) pré-entraîné par Google qui a révolutionné le NLP en comprenant le contexte des mots de manière bidirectionnelle.

c)

Une image.

d)

Un robot.

46.

Qu'est-ce que 'Batch Normalization' ?

a)

Normaliser les gens.

b)

Une technique pour stabiliser et accélérer l'entraînement des réseaux profonds en normalisant les entrées de chaque couche pour chaque mini-batch.

c)

Nettoyer les données.

d)

Une erreur.

47.

Qu'est-ce que la 'Loss Function' (Fonction de perte) ?

a)

Perdre ses clés.

b)

Une fonction qui quantifie l'écart entre la prédiction du modèle et la valeur réelle (ex: MSE, Cross-Entropy), que l'algorithme cherche à minimiser.

c)

Une fonction de gain.

d)

Une fonction Python.

48.

Qu'est-ce que l'apprentissage par renforcement (Reinforcement Learning) ?

a)

Apprendre avec un tuteur.

b)

Un agent apprend à prendre des décisions séquentielles dans un environnement pour maximiser une récompense cumulée (ex: échecs, jeux vidéo, robotique).

c)

Apprendre par cœur.

d)

Apprendre sans données.

49.

Qu'est-ce que TensorFlow / PyTorch ?

a)

Des jeux vidéo.

b)

Les deux frameworks open-source les plus populaires pour le Deep Learning (développés par Google et Facebook respectivement).

c)

Des langages de programmation.

d)

Des bases de données.

50.

Qu'est-ce que "A/B Testing" en Data Science ?

a)

Tester l'alphabet.

b)

Une expérience contrôlée comparant deux versions (A et B) d'une variable (ex: modèle, interface) pour déterminer laquelle est la plus performante sur une métrique donnée.

c)

Un test sanguin.

d)

Un test unitaire.