Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Test d'Évaluation : Data Engineering & Analytics

Total questions: 50

Worksheet time: 25mins

Name
Class
Date
1.

Que signifie SQL ?

a)

Simple Query Language

b)

Structured Query Language

c)

Strong Question List

d)

Standard Query Logic

2.

Quelle commande SQL est utilisée pour récupérer des données d'une table ?

a)

GET

b)

EXTRACT

c)

SELECT

d)

OPEN

3.

Qu'est-ce qu'une jointure "INNER JOIN" ?

a)

Elle retourne toutes les lignes des deux tables.

b)

Elle retourne uniquement les lignes qui ont une correspondance dans les deux tables.

c)

Elle retourne toutes les lignes de la table de gauche.

d)

Elle retourne toutes les lignes de la table de droite.

4.

Qu'est-ce qu'un schéma en étoile (Star Schema) en Data Warehousing ?

a)

Un schéma en forme d'étoile physique.

b)

Un modèle de données composé d'une table de faits centrale entourée de tables de dimensions dénormalisées.

c)

Un schéma complexe inutilisable.

d)

Un schéma pour les données astronomiques.

5.

Quelle est la différence entre OLTP et OLAP ?

a)

OLTP (Online Transaction Processing) est pour les transactions opérationnelles rapides (écritures/lectures unitaires) ; OLAP (Online Analytical Processing) est pour l'analyse complexe sur de gros volumes (lectures agrégées).

b)

C'est la même chose.

c)

OLTP est plus lent.

d)

OLAP est pour les petites bases de données.

6.

Qu'est-ce qu'un fichier CSV ?

a)

Comma Separated Values (format texte simple pour données tabulaires).

b)

Computer System Video.

c)

Un format binaire compressé.

d)

Un virus.

7.

Quelle fonction d'agrégation SQL permet de compter le nombre de lignes ?

a)

SUM()

b)

AVG()

c)

COUNT()

d)

MAX()

8.

Qu'est-ce que l'intégrité référentielle ?

a)

La politesse des données.

b)

Une règle qui garantit que les relations entre les tables restent cohérentes (ex: pas de clé étrangère pointant vers rien).

c)

La sauvegarde des données.

d)

La vitesse de la base.

9.

Qu'est-ce qu'une base de données NoSQL ?

a)

Une base qui interdit le SQL.

b)

Not Only SQL : des bases conçues pour des modèles de données spécifiques (document, clé-valeur, graphe, colonnes) et souvent pour la scalabilité horizontale.

c)

Une base de données sans données.

d)

Une base de données Microsoft.

10.

Qu'est-ce que JSON ?

a)

JavaScript Object Notation (format d'échange de données léger et lisible par l'homme).

b)

Java Source Object Network.

c)

Un prénom.

d)

Un langage de programmation.

11.

Qu'est-ce qu'un index sur une table ?

a)

Une table des matières.

b)

Une structure de données qui améliore la vitesse des opérations de recherche (SELECT) au prix d'un ralentissement des écritures (INSERT/UPDATE) et d'espace disque.

c)

Une erreur de base de données.

d)

Un identifiant unique.

12.

Dans un processus ETL, que signifie le "T" ?

a)

Transfer

b)

Transform (Nettoyage, agrégation, formatage des données).

c)

Test

d)

Table

13.

Qu'est-ce qu'un Data Warehouse (Entrepôt de données) ?

a)

Un stockage physique de disques durs.

b)

Un système centralisé qui consolide les données de différentes sources pour l'analyse et le reporting.

c)

Une base de données de production.

d)

Un logiciel de visualisation.

14.

Qu'est-ce que le type de données "BOOLEAN" ?

a)

Du texte.

b)

Une date.

c)

Une valeur Vrai/Faux (True/False).

d)

Un nombre décimal.

15.

Quelle commande SQL supprime toutes les données d'une table mais garde la structure ?

a)

DROP TABLE

b)

DELETE TABLE

c)

TRUNCATE TABLE

d)

REMOVE ALL

16.

Qu'est-ce que Apache Spark ?

a)

Une étincelle électrique.

b)

Un moteur de traitement de données unifié et ultra-rapide pour le Big Data et le Machine Learning (traitement en mémoire).

c)

Une base de données.

d)

Un système de fichiers.

17.

Quelle est la différence entre un RDD et un DataFrame dans Spark ?

a)

RDD est l'API de bas niveau (objets Java/Python) ; DataFrame est une abstraction de plus haut niveau organisée en colonnes nommées, offrant de meilleures performances via l'optimiseur Catalyst.

b)

RDD est plus rapide.

c)

DataFrame est obsolète.

d)

Aucune.

18.

Qu'est-ce que le format de fichier Parquet ?

a)

Un type de sol.

b)

Un format de stockage en colonnes, compressé et efficace, optimisé pour les requêtes analytiques Big Data.

c)

Un fichier texte simple.

d)

Un format d'image.

19.

Qu'est-ce que Apache Kafka ?

a)

Un écrivain.

b)

Une plateforme de streaming d'événements distribuée à haut débit (Message Broker / Log distribué).

c)

Une base de données SQL.

d)

Un outil ETL graphique.

20.

Dans Kafka, qu'est-ce qu'un "Topic" ?

a)

Un sujet de discussion.

b)

Une catégorie ou un nom de flux dans lequel les enregistrements sont publiés.

c)

Un serveur.

d)

Un utilisateur.

21.

Qu'est-ce que le partitionnement des données (Partitioning) ?

a)

Couper le disque dur.

b)

Diviser une grande table ou un dataset en parties plus petites et gérables (souvent par date ou clé) pour améliorer les performances des requêtes.

c)

Supprimer des données.

d)

Copier des données.

22.

Qu'est-ce que "Lazy Evaluation" dans Spark ?

a)

Spark est paresseux et lent.

b)

Spark n'exécute pas les transformations immédiatement ; il construit un plan d'exécution (DAG) et ne lance le calcul que lorsqu'une "Action" (ex: count, write) est appelée.

c)

Une erreur de code.

d)

Un mode économie d'énergie.

23.

Qu'est-ce qu'un Data Lake ?

a)

Un lac numérique.

b)

Un référentiel de stockage centralisé qui contient une grande quantité de données brutes dans leur format natif (structuré ou non).

c)

Une base de données très propre.

d)

Un outil de BI.

24.

Quelle est la différence entre "Batch Processing" et "Stream Processing" ?

a)

Batch traite des lots de données finis périodiquement ; Stream traite les données en continu dès qu'elles arrivent.

b)

Batch est plus moderne.

c)

Stream est plus lent.

d)

C'est pareil.

25.

Qu'est-ce que Hadoop HDFS ?

a)

Hadoop Distributed File System (système de fichiers distribué pour stocker de gros volumes de données sur du matériel standard).

b)

Une base de données.

c)

Un langage de programmation.

d)

Un outil de visualisation.

26.

Qu'est-ce que la clause "GROUP BY" en SQL ?

a)

Elle trie les résultats.

b)

Elle regroupe les lignes ayant les mêmes valeurs dans les colonnes spécifiées, souvent utilisée avec des fonctions d'agrégation.

c)

Elle filtre les groupes.

d)

Elle joint des tables.

27.

Qu'est-ce que Apache Airflow ?

a)

Un ventilateur.

b)

Une plateforme pour créer, planifier et surveiller des workflows de données (orchestrateur ETL).

c)

Un outil de streaming.

d)

Une base de données.

28.

Qu'est-ce que la "SCD Type 2" (Slowly Changing Dimension) ?

a)

Une dimension qui ne change jamais.

b)

Une méthode pour gérer l'historique des changements dans une dimension en ajoutant une nouvelle ligne pour chaque changement (avec dates de début/fin).

c)

Écraser l'ancienne valeur.

d)

Une erreur ETL.

29.

Qu'est-ce qu'une vue (View) SQL ?

a)

Une photo de la base.

b)

Une table virtuelle basée sur le résultat d'une requête SQL préenregistrée.

c)

Une copie physique des données.

d)

Un index.

30.

Qu'est-ce que "Data Staging Area" ?

a)

Une zone de mise en scène.

b)

Une zone de stockage intermédiaire utilisée pour le traitement des données pendant le processus ETL avant le chargement dans le Data Warehouse.

c)

La poubelle.

d)

Le dossier final.

31.

Qu'est-ce que le concept de "Data Mesh" ?

a)

Un filet de pêche.

b)

Une approche architecturale décentralisée orientée domaine, où les données sont traitées comme un produit ("Data as a Product") géré par des équipes autonomes.

c)

Une architecture monolithique.

d)

Un logiciel Microsoft.

32.

Qu'est-ce que le "Shuffle" dans Spark et pourquoi est-ce coûteux ?

a)

Une danse.

b)

La redistribution physique des données à travers le réseau entre les différentes partitions/noeuds (nécessaire pour les groupByKey, join), coûteuse en I/O disque et réseau.

c)

Un mélange aléatoire inutile.

d)

Une compression.

33.

Qu'est-ce que le format "Delta Lake" (ou Apache Hudi / Iceberg) ?

a)

Un format d'image.

b)

Une couche de stockage open-source qui apporte les transactions ACID, le versioning (Time Travel) et la fiabilité aux Data Lakes.

c)

Un lac en forme de delta.

d)

Un type de CSV.

34.

Qu'est-ce que l'optimisation "Predicate Pushdown" ?

a)

Pousser fort.

b)

Une technique d'optimisation où le moteur de requête pousse les filtres (WHERE) le plus près possible de la source de données pour réduire la quantité de données lues/transférées.

c)

Une erreur de requête.

d)

Une méthode de tri.

35.

Qu'est-ce que le théorème CAP s'applique-t-il aux bases distribuées ?

a)

On ne peut avoir que 2 des 3 propriétés : Cohérence (Consistency), Disponibilité (Availability), Tolérance au partitionnement (Partition tolerance).

b)

Tout est possible.

c)

C'est pour le SQL uniquement.

d)

C'est pour les petits systèmes.

36.

Dans Kafka, que signifie "Consumer Group" ?

a)

Un groupe de clients.

b)

Un mécanisme permettant à un groupe de consommateurs de coopérer pour consommer un topic, chaque partition étant consommée par un seul membre du groupe.

c)

Un type de topic.

d)

Un cluster de brokers.

37.

Qu'est-ce que le "Skew" de données (Data Skew) dans un traitement distribué ?

a)

Une répartition inégale des données entre les partitions, causant une surcharge sur certains nœuds ("stragglers") et ralentissant tout le job.

b)

Une perte de données.

c)

Une donnée corrompue.

d)

Une optimisation.

38.

Qu'est-ce que la "Normalisation" de base de données (1NF, 2NF, 3NF) ?

a)

Rendre tout normal.

b)

Le processus d'organisation des données pour réduire la redondance et améliorer l'intégrité des données.

c)

Dénormaliser pour la performance.

d)

Supprimer les tables.

39.

Qu'est-ce que "Columnar Storage" (Stockage en colonnes) est mieux pour l'analytique ?

a)

Parce qu'on lit souvent quelques colonnes sur beaucoup de lignes (agrégations), ce qui minimise les I/O en ne lisant que les données nécessaires.

b)

Parce que c'est plus joli.

c)

C'est mieux pour les insertions transactionnelles.

d)

Ce n'est pas mieux.

40.

Qu'est-ce que "Backpressure" dans le streaming ?

a)

Une pression dans le dos.

b)

Un mécanisme de rétroaction où le consommateur signale au producteur de ralentir car il ne peut pas traiter les données assez vite, évitant le crash (OOM).

c)

Une méthode de compression.

d)

Une erreur réseau.

41.

Qu'est-ce que Snowflake ?

a)

Un flocon de neige.

b)

Une plateforme de Data Warehouse Cloud native, séparant le stockage du calcul (Compute) pour une scalabilité indépendante.

c)

Un outil ETL on-premise.

d)

Un langage SQL.

42.

Qu'est-ce que dbt (data build tool) ?

a)

Un outil de construction.

b)

Un outil de transformation de données qui permet aux analystes d'écrire du code SQL modulaire pour transformer les données DANS l'entrepôt (approche ELT).

c)

Une base de données.

d)

Un outil de visualisation.

43.

Qu'est-ce que le "Broadcast Join" dans Spark ?

a)

Une émission TV.

b)

Une stratégie de jointure où la plus petite table est envoyée à tous les nœuds pour éviter un Shuffle coûteux de la grande table.

c)

Une jointure lente.

d)

Une jointure impossible.

44.

Qu'est-ce que "Idempotency" dans un pipeline de données ?

a)

Une erreur.

b)

La capacité de relancer le pipeline plusieurs fois avec les mêmes données d'entrée sans créer de doublons ou corrompre l'état final.

c)

La vitesse du pipeline.

d)

La sécurité du pipeline.

45.

Qu'est-ce que Redis ?

a)

Une couleur.

b)

Un magasin de structure de données en mémoire (In-memory), utilisé comme base de données, cache et courtier de messages.

c)

Un disque dur lent.

d)

Un système d'exploitation.

46.

Qu'est-ce que le format Avro ?

a)

Un avion.

b)

Un format de sérialisation de données binaire orienté ligne, avec le schéma stocké dans le fichier (très utilisé avec Kafka).

c)

Un format texte.

d)

Un format vidéo.

47.

Qu'est-ce que l'architecture Lambda (Big Data) ?

a)

Une lettre grecque.

b)

Une architecture combinant une couche Batch (pour la précision historique) et une couche Speed (pour le temps réel) pour fournir des vues unifiées.

c)

Une architecture serveur.

d)

Une architecture sans serveurs.

48.

Qu'est-ce que "Data Lineage" ?

a)

L'arbre généalogique des données.

b)

Le cycle de vie des données qui retrace leur origine, leurs mouvements, leurs transformations et leur destination.

c)

La taille des données.

d)

Le prix des données.

49.

Qu'est-ce que "Materialized View" ?

a)

Une vue stockée physiquement sur le disque (pré-calculée) pour améliorer les performances de lecture, qui doit être rafraîchie.

b)

Une vue logique simple.

c)

Une vue en tissu.

d)

Une table temporaire.

50.

Qu'est-ce que Cassandra ?

a)

Une prophétesse.

b)

Une base de données NoSQL distribuée large-column, conçue pour gérer de grandes quantités de données sur de nombreux serveurs bon marché, sans point de défaillance unique (haute dispo écriture).

c)

Un outil ETL.

d)

Un langage SQL.