WorksheetsTutoriel Apache Spark
Total questions: 89
Worksheet time: 45mins
Quel module de Spark permet l'analyse de graphes ?
Spark SQL
Spark Streaming
GraphX
MLlib
Complétez : Le module de Spark utilisé pour le Machine Learning est _______.
MLlib
GraphX
SparkSQL
SparkR
Quels langages de programmation sont supportés par Spark ?
Scala, Java, Python, R
C++, Ruby, PHP, Perl
Go, Swift, Kotlin, Lua
JavaScript, TypeScript, Objective-C, Haskell
Complétez : Le module de Spark qui permet le traitement de flux de données en temps réel est _______.
Spark Streaming
Spark SQL
Spark MLlib
Spark GraphX
Laquelle des sources de données suivantes n'est PAS mentionnée dans le schéma ?
Cassandra
MongoDB
MySQL
Elasticsearch
Quel matériel est requis pour commencer avec Databricks Cloud ?
Un ordinateur portable avec wifi et navigateur
Un téléphone portable
Une tablette sans connexion internet
Un ordinateur de bureau sans navigateur
Vous pouvez exporter votre travail en tant que modules source dans Python, Scala, SQL ou R.
Vrai
Faux
Les colonnes à droite montrent des dossiers. Faites défiler vers le bas et cliquez sur _________.
databricks_guide
settings
user_profile
dashboard
Que devez-vous faire selon l'étape 4 ?
Ouvrir le carnet 01 Quick Start et suivre la discussion
Fermer le carnet 01 Quick Start
Ignorer la discussion
Créer un nouveau carnet
Complétez : Une des fonctionnalités clés de Databricks est ________ / Dossier / Notebook.
Workspace
Cluster
Table
Job
Complétez : Une des fonctionnalités clés de Databricks est les cellules de code, exécuter/éditer/déplacer/commenter, soit ________.
Code Cells
Data Frames
Notebooks
Dashboards
Complétez : Une des fonctionnalités clés de Databricks est ________ (en bleu dans l'image).
Markdown
SQL Analytics
Data Lake
Machine Learning
Complétez : Une des fonctionnalités clés de Databricks est ________ (affichage des résultats).
Results
Tables
Graphs
Scripts
Complétez : Une des fonctionnalités clés de Databricks est ________ (importation/exportation de données).
Import/Export
Analyse de texte
Création de graphiques
Gestion des utilisateurs
Développement web
Étape 1 : Complétez la ligne de code pour créer une collection d'entiers dans la plage de 1 à 10000 en Python : data = ________
xrange(1, 10001)
range(1, 10000)
list(1, 10001)
xrange(0, 10000)
Étape 2 : Complétez la ligne de code pour utiliser cette collection afin de créer un RDD de base : distData = ________
sc.parallelize(data)
sc.createRDD(data)
sc.makeRDD(data)
sc.dataToRDD(data)
Étape 3 : Quelle fonction applique-t-on au RDD pour définir un workflow et garder les valeurs inférieures à 10 ?
filter()
map()
reduceByKey()
flatMap()
D'après le tableau 'Aperçu de Spark', quelle est la taille des données pour le record Hadoop MR ?
102.5 TB
50 TB
200 TB
10 TB
D'après le tableau 'Aperçu de Spark', combien de temps a duré le record Spark ?
23 mins
15 mins
45 mins
1 heure
D'après le tableau 'Aperçu de Spark', combien de nœuds ont été utilisés pour le record Spark 1 PB ?
190
50
500
1000
D'après le tableau 'Aperçu de Spark', combien de cœurs ont été virtualisés pour le record Spark ?
6592 virtualized
2048 virtualized
8192 virtualized
4096 virtualized
D'après le tableau 'Aperçu de Spark', quel est le débit du disque du cluster pour le record Hadoop MR ?
3150 GB/s (est.)
1200 GB/s (est.)
5000 GB/s (est.)
800 GB/s (est.)
D'après le tableau 'Aperçu de Spark', le benchmark Daytona Rules a-t-il été utilisé pour le record Spark 1 PB ?
True
False
D'après le tableau 'Aperçu de Spark', quel est le taux de tri pour le record Spark ?
4.27 TB/min
2.15 TB/min
6.89 TB/min
3.50 TB/min
D'après le tableau 'Aperçu de Spark', le réseau utilisé pour le record Spark 1 PB était-il virtualisé (EC2) 10Gbps ?
True
False
D'après le tableau 'Aperçu de Spark', quel est le taux de tri par nœud pour le record Hadoop MR ?
0.67 GB/min
1.2 GB/min
0.45 GB/min
2.0 GB/min
À la fin des années 1990, quelle croissance explosive a impliqué que les charges de travail ne pouvaient plus tenir sur un seul ordinateur ?
Croissance du commerce électronique et des données machine
Croissance de l'agriculture
Croissance de la population
Croissance du secteur automobile
Complétez la phrase : Des entreprises notables ont mené la transition vers ________ sur des grappes de matériel standard, notamment pour des cas d'utilisation d'apprentissage automatique à grande échelle.
l'évolutivité horizontale
la virtualisation complète
le stockage en cloud privé
l'automatisation des tâches bureautiques
Parmi les entreprises suivantes, lesquelles ont mené la transition vers l'évolutivité horizontale à la fin des années 1990 ?
Google et Amazon
IBM et Microsoft
Apple et Facebook
Yahoo et Oracle
En 2002, quel était le risque que MapReduce cherchait à atténuer dans les grandes charges de travail distribuées ?
la perte de données due à des pannes de disque sur du matériel standard
la lenteur des réseaux sans fil
le manque de mémoire vive dans les ordinateurs portables
l'obsolescence rapide des logiciels propriétaires
Complétez : En 1979, les opérations de set/list en LISP, Prolog, etc., pour le traitement parallèle ont été développées à _________
Stanford, MIT, CMU
Harvard, Yale, Princeton
Oxford, Cambridge, UCL
Sorbonne, Polytechnique, ENS
En 2004, quelle entreprise a publié 'MapReduce: Simplified Data Processing on Large Clusters'?
Yahoo
Amazon AWS
Apache
Complétez : En 2006, le projet ________, originaire du projet Nutch, a été développé par Doug Cutting.
Apache Hadoop
Apache Spark
Apache Cassandra
Apache Storm
En 2008, Yahoo a utilisé Hadoop pour ________.
l'indexation de recherche à grande échelle
le traitement de données simplifié
le stockage cloud
le calcul parallèle
Complétez : En 2009, Amazon AWS a lancé ________, une version modifiée de Hadoop pour EC2/S3.
Elastic MapReduce
Redshift
DynamoDB
Glue
Selon la frise chronologique, en quelle année le papier MapReduce a-t-il été publié ?
2004
2001
2007
2010
Quel événement est associé à l'année 2002 dans la frise chronologique ?
Hadoop Summit
MapReduce @ Google
Spark paper
Apache Spark top-level
En quelle année le papier Spark a-t-il été publié selon la frise chronologique ?
2010
2012
2014
2008
Quel événement est associé à l'année 2006 dans la frise chronologique ?
Hadoop @ Yahoo!
Lancement de Google Search
Création de Facebook
Sortie de Windows 7
Quel événement a eu lieu en 2008 selon la frise chronologique ?
Hadoop Summit
Lancement de Spark
Création de TensorFlow
Sortie de Python 3.0
En quelle année Apache Spark est-il devenu top-level selon la frise chronologique ?
2014
2012
2016
2018
Depuis 2002, lequel des éléments suivants est un changement majeur dans les technologies des centres de données ?
Virtualisation accrue des serveurs
Utilisation exclusive de bandes magnétiques
Abandon total de la sécurité physique
Réduction de la connectivité réseau
Selon le schéma 'SCM in a large System', quel composant de mémoire active a été ajouté en 2008 par rapport à 1980 ?
RAM
FLASH SSD
DISK
TAPE
D'après le graphique sur les lois technologiques, laquelle de ces lois est associée à la puissance de traitement ?
Moore's Law
Kryder's Law
Nielson's Law
Newton's Law
Complétez la phrase : Selon le schéma, la bande passante Internet suit la loi de _________.
Nielson
Moore
Shannon
Ohm
Vrai ou Faux : Selon l'image, les disques durs traditionnels ('spinny disks') ont beaucoup évolué au fil du temps.
Vrai
Faux
Quel est le principal sujet abordé dans l'aperçu Spark : MapReduce ?
L'évolution des systèmes de stockage
Les lois technologiques
Les tendances de la bande passante
Toutes les réponses ci-dessus
Selon l'aperçu de Spark : MapReduce, quelles sont les deux principales limitations de MapReduce ?
1. difficulté de programmer directement en MR 2. goulots d'étranglement de performance, ou le batch ne correspondant pas aux cas d'utilisation
1. manque de support pour les bases de données relationnelles 2. absence de compatibilité avec le cloud
1. faible sécurité des données 2. impossibilité de traiter des données structurées
1. coût élevé de déploiement 2. absence de documentation officielle
Selon l'aperçu de Spark : MapReduce, MR se compose-t-il bien pour les grandes applications ?
Oui
Non
Selon l'aperçu de Spark : MapReduce, que construisent les gens comme solution de contournement aux limitations de MR ?
des systèmes spécialisés
des bases de données relationnelles
des réseaux de neurones
des systèmes d'exploitation
Complétez la phrase suivante : Le système général de traitement par lots mentionné dans l'image est _________.
MapReduce
Hadoop Distributed File System
Spark Streaming
NoSQL
Quels sont des exemples de systèmes spécialisés selon l'image ?
GraphLab
Drill
Dremel
Giraph
Pregel
Selon l'image, les systèmes spécialisés ont émergé parce que :
ils répondaient à des besoins spécifiques non couverts par les systèmes généraux.
ils étaient plus faciles à utiliser que les systèmes généraux.
ils étaient moins coûteux à développer.
ils étaient plus populaires auprès du grand public.
Vrai ou Faux : MapReduce est un système spécialisé pour le traitement interactif et le streaming.
Vrai
Faux
D'après le document, en quelle année environ Spark a-t-il été créé ?
circa 2010
circa 2005
circa 2015
circa 2020
Quel laboratoire de l'UC Berkeley est mentionné comme étant à l'origine de Spark ?
amplab
datalab
techlab
cloudlab
Complétez : Spark est un moteur unifié pour les workflows de données d'entreprise, basé sur ________ une décennie plus tard.
le matériel standard (commodity hardware)
le cloud computing
les bases de données relationnelles
l'intelligence artificielle
Quel langage de programmation n'est PAS mentionné comme compatible avec Spark dans le schéma ?
Scala
Java
Python
C++
R
Complétez : Le module de Spark utilisé pour le traitement de flux en temps réel s'appelle _________.
Spark Streaming
Spark SQL
Spark MLlib
Spark GraphX
Lequel des éléments suivants n'est PAS un module principal de Spark selon le schéma ?
Spark SQL
Spark Streaming
MLlib
GraphX
TensorFlow
Le schéma montre que Spark peut utiliser JSON comme source de données.
Vrai
Faux
Complétez : L'API qui permet de manipuler des ensembles de données structurées dans Spark s'appelle _________
DataFrame API
RDD API
GraphX API
MLlib API
Quel module Spark est principalement utilisé pour l'apprentissage automatique ?
Spark SQL
MLlib
GraphX
Packages
À quelle catégorie appartient la technologie 'Hadoop' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Hive' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Mahout' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Kubernetes' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'MESOS' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Docker' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Spring' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'OpenStack' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Sparkling' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'H2O' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Thunder' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'IP[y]' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Apache Ambari' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'MySQL' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'PostgreSQL' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'HDFS' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Cassandra' ?
A) Applications
B) Environnements
C) Sources de données
À quelle catégorie appartient la technologie 'Apache HBase' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'SequoiaDB' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Kafka' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'MongoDB' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Tachyon' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Elasticsearch' ?
Applications
Environnements
Sources de données
À quelle catégorie appartient la technologie 'Parquet' ?
Applications
Environnements
Sources de données
Selon le graphique 'Contributeurs par mois à Spark', en quelle année le nombre de contributeurs commence-t-il à augmenter de façon exponentielle ?
2011
2012
2013
2014
Complétez la phrase : Spark est le projet le plus actif chez ________, avec plus de 500 déploiements connus en production.
Apache
Microsoft
IBM
