wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Tutoriel Apache Spark

Total questions: 89

Worksheet time: 45mins

Name
Class
Date
1.

Quel module de Spark permet l'analyse de graphes ?

a)

Spark SQL

b)

Spark Streaming

c)

GraphX

d)

MLlib

2.

Complétez : Le module de Spark utilisé pour le Machine Learning est _______.

a)

MLlib

b)

GraphX

c)

SparkSQL

d)

SparkR

3.

Quels langages de programmation sont supportés par Spark ?

a)

Scala, Java, Python, R

b)

C++, Ruby, PHP, Perl

c)

Go, Swift, Kotlin, Lua

d)

JavaScript, TypeScript, Objective-C, Haskell

4.

Complétez : Le module de Spark qui permet le traitement de flux de données en temps réel est _______.

a)

Spark Streaming

b)

Spark SQL

c)

Spark MLlib

d)

Spark GraphX

5.

Laquelle des sources de données suivantes n'est PAS mentionnée dans le schéma ?

a)

Cassandra

b)

MongoDB

c)

MySQL

d)

Elasticsearch

6.

Quel matériel est requis pour commencer avec Databricks Cloud ?

a)

Un ordinateur portable avec wifi et navigateur

b)

Un téléphone portable

c)

Une tablette sans connexion internet

d)

Un ordinateur de bureau sans navigateur

7.

Vous pouvez exporter votre travail en tant que modules source dans Python, Scala, SQL ou R.

a)

Vrai

b)

Faux

8.

Les colonnes à droite montrent des dossiers. Faites défiler vers le bas et cliquez sur _________.

a)

databricks_guide

b)

settings

c)

user_profile

d)

dashboard

9.

Que devez-vous faire selon l'étape 4 ?

a)

Ouvrir le carnet 01 Quick Start et suivre la discussion

b)

Fermer le carnet 01 Quick Start

c)

Ignorer la discussion

d)

Créer un nouveau carnet

10.

Complétez : Une des fonctionnalités clés de Databricks est ________ / Dossier / Notebook.

a)

Workspace

b)

Cluster

c)

Table

d)

Job

11.

Complétez : Une des fonctionnalités clés de Databricks est les cellules de code, exécuter/éditer/déplacer/commenter, soit ________.

a)

Code Cells

b)

Data Frames

c)

Notebooks

d)

Dashboards

12.

Complétez : Une des fonctionnalités clés de Databricks est ________ (en bleu dans l'image).

a)

Markdown

b)

SQL Analytics

c)

Data Lake

d)

Machine Learning

13.

Complétez : Une des fonctionnalités clés de Databricks est ________ (affichage des résultats).

a)

Results

b)

Tables

c)

Graphs

d)

Scripts

14.

Complétez : Une des fonctionnalités clés de Databricks est ________ (importation/exportation de données).

a)

Import/Export

b)

Analyse de texte

c)

Création de graphiques

d)

Gestion des utilisateurs

e)

Développement web

15.

Étape 1 : Complétez la ligne de code pour créer une collection d'entiers dans la plage de 1 à 10000 en Python : data = ________

a)

xrange(1, 10001)

b)

range(1, 10000)

c)

list(1, 10001)

d)

xrange(0, 10000)

16.

Étape 2 : Complétez la ligne de code pour utiliser cette collection afin de créer un RDD de base : distData = ________

a)

sc.parallelize(data)

b)

sc.createRDD(data)

c)

sc.makeRDD(data)

d)

sc.dataToRDD(data)

17.

Étape 3 : Quelle fonction applique-t-on au RDD pour définir un workflow et garder les valeurs inférieures à 10 ?

a)

filter()

b)

map()

c)

reduceByKey()

d)

flatMap()

18.

D'après le tableau 'Aperçu de Spark', quelle est la taille des données pour le record Hadoop MR ?

a)

102.5 TB

b)

50 TB

c)

200 TB

d)

10 TB

19.

D'après le tableau 'Aperçu de Spark', combien de temps a duré le record Spark ?

a)

23 mins

b)

15 mins

c)

45 mins

d)

1 heure

20.

D'après le tableau 'Aperçu de Spark', combien de nœuds ont été utilisés pour le record Spark 1 PB ?

a)

190

b)

50

c)

500

d)

1000

21.

D'après le tableau 'Aperçu de Spark', combien de cœurs ont été virtualisés pour le record Spark ?

a)

6592 virtualized

b)

2048 virtualized

c)

8192 virtualized

d)

4096 virtualized

22.

D'après le tableau 'Aperçu de Spark', quel est le débit du disque du cluster pour le record Hadoop MR ?

a)

3150 GB/s (est.)

b)

1200 GB/s (est.)

c)

5000 GB/s (est.)

d)

800 GB/s (est.)

23.

D'après le tableau 'Aperçu de Spark', le benchmark Daytona Rules a-t-il été utilisé pour le record Spark 1 PB ?

a)

True

b)

False

24.

D'après le tableau 'Aperçu de Spark', quel est le taux de tri pour le record Spark ?

a)

4.27 TB/min

b)

2.15 TB/min

c)

6.89 TB/min

d)

3.50 TB/min

25.

D'après le tableau 'Aperçu de Spark', le réseau utilisé pour le record Spark 1 PB était-il virtualisé (EC2) 10Gbps ?

a)

True

b)

False

26.

D'après le tableau 'Aperçu de Spark', quel est le taux de tri par nœud pour le record Hadoop MR ?

a)

0.67 GB/min

b)

1.2 GB/min

c)

0.45 GB/min

d)

2.0 GB/min

27.

À la fin des années 1990, quelle croissance explosive a impliqué que les charges de travail ne pouvaient plus tenir sur un seul ordinateur ?

a)

Croissance du commerce électronique et des données machine

b)

Croissance de l'agriculture

c)

Croissance de la population

d)

Croissance du secteur automobile

28.

Complétez la phrase : Des entreprises notables ont mené la transition vers ________ sur des grappes de matériel standard, notamment pour des cas d'utilisation d'apprentissage automatique à grande échelle.

a)

l'évolutivité horizontale

b)

la virtualisation complète

c)

le stockage en cloud privé

d)

l'automatisation des tâches bureautiques

29.

Parmi les entreprises suivantes, lesquelles ont mené la transition vers l'évolutivité horizontale à la fin des années 1990 ?

a)

Google et Amazon

b)

IBM et Microsoft

c)

Apple et Facebook

d)

Yahoo et Oracle

30.

En 2002, quel était le risque que MapReduce cherchait à atténuer dans les grandes charges de travail distribuées ?

a)

la perte de données due à des pannes de disque sur du matériel standard

b)

la lenteur des réseaux sans fil

c)

le manque de mémoire vive dans les ordinateurs portables

d)

l'obsolescence rapide des logiciels propriétaires

31.

Complétez : En 1979, les opérations de set/list en LISP, Prolog, etc., pour le traitement parallèle ont été développées à _________

a)

Stanford, MIT, CMU

b)

Harvard, Yale, Princeton

c)

Oxford, Cambridge, UCL

d)

Sorbonne, Polytechnique, ENS

32.

En 2004, quelle entreprise a publié 'MapReduce: Simplified Data Processing on Large Clusters'?

a)

Yahoo

b)

Google

c)

Amazon AWS

d)

Apache

33.

Complétez : En 2006, le projet ________, originaire du projet Nutch, a été développé par Doug Cutting.

a)

Apache Hadoop

b)

Apache Spark

c)

Apache Cassandra

d)

Apache Storm

34.

En 2008, Yahoo a utilisé Hadoop pour ________.

a)

l'indexation de recherche à grande échelle

b)

le traitement de données simplifié

c)

le stockage cloud

d)

le calcul parallèle

35.

Complétez : En 2009, Amazon AWS a lancé ________, une version modifiée de Hadoop pour EC2/S3.

a)

Elastic MapReduce

b)

Redshift

c)

DynamoDB

d)

Glue

36.

Selon la frise chronologique, en quelle année le papier MapReduce a-t-il été publié ?

a)

2004

b)

2001

c)

2007

d)

2010

37.

Quel événement est associé à l'année 2002 dans la frise chronologique ?

a)

Hadoop Summit

b)

MapReduce @ Google

c)

Spark paper

d)

Apache Spark top-level

38.

En quelle année le papier Spark a-t-il été publié selon la frise chronologique ?

a)

2010

b)

2012

c)

2014

d)

2008

39.

Quel événement est associé à l'année 2006 dans la frise chronologique ?

a)

Hadoop @ Yahoo!

b)

Lancement de Google Search

c)

Création de Facebook

d)

Sortie de Windows 7

40.

Quel événement a eu lieu en 2008 selon la frise chronologique ?

a)

Hadoop Summit

b)

Lancement de Spark

c)

Création de TensorFlow

d)

Sortie de Python 3.0

41.

En quelle année Apache Spark est-il devenu top-level selon la frise chronologique ?

a)

2014

b)

2012

c)

2016

d)

2018

42.

Depuis 2002, lequel des éléments suivants est un changement majeur dans les technologies des centres de données ?

a)

Virtualisation accrue des serveurs

b)

Utilisation exclusive de bandes magnétiques

c)

Abandon total de la sécurité physique

d)

Réduction de la connectivité réseau

43.

Selon le schéma 'SCM in a large System', quel composant de mémoire active a été ajouté en 2008 par rapport à 1980 ?

a)

RAM

b)

FLASH SSD

c)

DISK

d)

TAPE

44.

D'après le graphique sur les lois technologiques, laquelle de ces lois est associée à la puissance de traitement ?

a)

Moore's Law

b)

Kryder's Law

c)

Nielson's Law

d)

Newton's Law

45.

Complétez la phrase : Selon le schéma, la bande passante Internet suit la loi de _________.

a)

Nielson

b)

Moore

c)

Shannon

d)

Ohm

46.

Vrai ou Faux : Selon l'image, les disques durs traditionnels ('spinny disks') ont beaucoup évolué au fil du temps.

a)

Vrai

b)

Faux

47.

Quel est le principal sujet abordé dans l'aperçu Spark : MapReduce ?

a)

L'évolution des systèmes de stockage

b)

Les lois technologiques

c)

Les tendances de la bande passante

d)

Toutes les réponses ci-dessus

48.

Selon l'aperçu de Spark : MapReduce, quelles sont les deux principales limitations de MapReduce ?

a)

1. difficulté de programmer directement en MR 2. goulots d'étranglement de performance, ou le batch ne correspondant pas aux cas d'utilisation

b)

1. manque de support pour les bases de données relationnelles 2. absence de compatibilité avec le cloud

c)

1. faible sécurité des données 2. impossibilité de traiter des données structurées

d)

1. coût élevé de déploiement 2. absence de documentation officielle

49.

Selon l'aperçu de Spark : MapReduce, MR se compose-t-il bien pour les grandes applications ?

a)

Oui

b)

Non

50.

Selon l'aperçu de Spark : MapReduce, que construisent les gens comme solution de contournement aux limitations de MR ?

a)

des systèmes spécialisés

b)

des bases de données relationnelles

c)

des réseaux de neurones

d)

des systèmes d'exploitation

51.

Complétez la phrase suivante : Le système général de traitement par lots mentionné dans l'image est _________.

a)

MapReduce

b)

Hadoop Distributed File System

c)

Spark Streaming

d)

NoSQL

52.

Quels sont des exemples de systèmes spécialisés selon l'image ?

a)

GraphLab

b)

Drill

c)

Dremel

d)

Giraph

e)

Pregel

53.

Selon l'image, les systèmes spécialisés ont émergé parce que :

a)

ils répondaient à des besoins spécifiques non couverts par les systèmes généraux.

b)

ils étaient plus faciles à utiliser que les systèmes généraux.

c)

ils étaient moins coûteux à développer.

d)

ils étaient plus populaires auprès du grand public.

54.

Vrai ou Faux : MapReduce est un système spécialisé pour le traitement interactif et le streaming.

a)

Vrai

b)

Faux

55.

D'après le document, en quelle année environ Spark a-t-il été créé ?

a)

circa 2010

b)

circa 2005

c)

circa 2015

d)

circa 2020

56.

Quel laboratoire de l'UC Berkeley est mentionné comme étant à l'origine de Spark ?

a)

amplab

b)

datalab

c)

techlab

d)

cloudlab

57.

Complétez : Spark est un moteur unifié pour les workflows de données d'entreprise, basé sur ________ une décennie plus tard.

a)

le matériel standard (commodity hardware)

b)

le cloud computing

c)

les bases de données relationnelles

d)

l'intelligence artificielle

58.

Quel langage de programmation n'est PAS mentionné comme compatible avec Spark dans le schéma ?

a)

Scala

b)

Java

c)

Python

d)

C++

e)

R

59.

Complétez : Le module de Spark utilisé pour le traitement de flux en temps réel s'appelle _________.

a)

Spark Streaming

b)

Spark SQL

c)

Spark MLlib

d)

Spark GraphX

60.

Lequel des éléments suivants n'est PAS un module principal de Spark selon le schéma ?

a)

Spark SQL

b)

Spark Streaming

c)

MLlib

d)

GraphX

e)

TensorFlow

61.

Le schéma montre que Spark peut utiliser JSON comme source de données.

a)

Vrai

b)

Faux

62.

Complétez : L'API qui permet de manipuler des ensembles de données structurées dans Spark s'appelle _________

a)

DataFrame API

b)

RDD API

c)

GraphX API

d)

MLlib API

63.

Quel module Spark est principalement utilisé pour l'apprentissage automatique ?

a)

Spark SQL

b)

MLlib

c)

GraphX

d)

Packages

64.

À quelle catégorie appartient la technologie 'Hadoop' ?

a)

Applications

b)

Environnements

c)

Sources de données

65.

À quelle catégorie appartient la technologie 'Hive' ?

a)

Applications

b)

Environnements

c)

Sources de données

66.

À quelle catégorie appartient la technologie 'Mahout' ?

a)

Applications

b)

Environnements

c)

Sources de données

67.

À quelle catégorie appartient la technologie 'Kubernetes' ?

a)

Applications

b)

Environnements

c)

Sources de données

68.

À quelle catégorie appartient la technologie 'MESOS' ?

a)

Applications

b)

Environnements

c)

Sources de données

69.

À quelle catégorie appartient la technologie 'Docker' ?

a)

Applications

b)

Environnements

c)

Sources de données

70.

À quelle catégorie appartient la technologie 'Spring' ?

a)

Applications

b)

Environnements

c)

Sources de données

71.

À quelle catégorie appartient la technologie 'OpenStack' ?

a)

Applications

b)

Environnements

c)

Sources de données

72.

À quelle catégorie appartient la technologie 'Sparkling' ?

a)

Applications

b)

Environnements

c)

Sources de données

73.

À quelle catégorie appartient la technologie 'H2O' ?

a)

Applications

b)

Environnements

c)

Sources de données

74.

À quelle catégorie appartient la technologie 'Thunder' ?

a)

Applications

b)

Environnements

c)

Sources de données

75.

À quelle catégorie appartient la technologie 'IP[y]' ?

a)

Applications

b)

Environnements

c)

Sources de données

76.

À quelle catégorie appartient la technologie 'Apache Ambari' ?

a)

Applications

b)

Environnements

c)

Sources de données

77.

À quelle catégorie appartient la technologie 'MySQL' ?

a)

Applications

b)

Environnements

c)

Sources de données

78.

À quelle catégorie appartient la technologie 'PostgreSQL' ?

a)

Applications

b)

Environnements

c)

Sources de données

79.

À quelle catégorie appartient la technologie 'HDFS' ?

a)

Applications

b)

Environnements

c)

Sources de données

80.

À quelle catégorie appartient la technologie 'Cassandra' ?

a)

A) Applications

b)

B) Environnements

c)

C) Sources de données

81.

À quelle catégorie appartient la technologie 'Apache HBase' ?

a)

Applications

b)

Environnements

c)

Sources de données

82.

À quelle catégorie appartient la technologie 'SequoiaDB' ?

a)

Applications

b)

Environnements

c)

Sources de données

83.

À quelle catégorie appartient la technologie 'Kafka' ?

a)

Applications

b)

Environnements

c)

Sources de données

84.

À quelle catégorie appartient la technologie 'MongoDB' ?

a)

Applications

b)

Environnements

c)

Sources de données

85.

À quelle catégorie appartient la technologie 'Tachyon' ?

a)

Applications

b)

Environnements

c)

Sources de données

86.

À quelle catégorie appartient la technologie 'Elasticsearch' ?

a)

Applications

b)

Environnements

c)

Sources de données

87.

À quelle catégorie appartient la technologie 'Parquet' ?

a)

Applications

b)

Environnements

c)

Sources de données

88.

Selon le graphique 'Contributeurs par mois à Spark', en quelle année le nombre de contributeurs commence-t-il à augmenter de façon exponentielle ?

a)

2011

b)

2012

c)

2013

d)

2014

89.

Complétez la phrase : Spark est le projet le plus actif chez ________, avec plus de 500 déploiements connus en production.

a)

Apache

b)

Google

c)

Microsoft

d)

IBM