Font size
Worksheetsbig data
Total questions: 93
Worksheet time: 56mins
Caracteristicile unui datacenter pentru stocarea și procesarea volumelor mari de date sunt:
a. Scalabilitatea
b. Toleranța la defecte
c. Capacitatea fixă de procesare.
d. Eterogenitatea mediilor de stocare
e. Capacitatea mare de stocare
Pe măsură ce companiile trec de faza experimentală cu Hadoop, acestea simt necesitatea unor capabilități suplimentare, inclusiv:
a. Îmbunătățirea stocării datelor și a recuperării informațiilor
b. Caracteristici îmbunătățite de extragere, transformare și încărcare pentru integrarea datelor
c. Îmbunătățirea securității, gestionării volumului de lucru și suport SQL
d. Funcționalitate îmbunătățită de stocare a datelor
In paradigma Edge Computing:
a. datele sunt procesate local pe device-urile care produc date
b. datele sunt procesate in Cloud
c. datele sunt procesate la nivel local pe marginea retelei
Este adevarat ca in Apache Storm task-urile de tip “acker” daca tuplurile procesate nu sunt recunoscute memoria este reciclata?
true
false
Este adevarat ca metadatele pastrate de NameNode nu sunt stocate in totalitate in memoria principala?
true
false
Care sunt provocările datelor cu varietate mare?
a. Greu de efectuat o analiză a comportamentului emergent
b. Calitatea datelor este scăzută.
c. Greu de integrat.
d. Greu în utilizarea detectării evenimentelor de grup.
Limbajele de programare, instrumentele și bibliotecile sunt acceptate de furnizorul de servicii Cloud la nivelul:
a. sa se proceseze datele imediat de se produce un eveniment
b. evenimentele sa se produca intr-un mod determinist
c. sa se aplice o perioada de gratie inainte de a procesa datele produse de evenimente
Avem un set de date cu 312 valori distincte. Care este numărul minim de operații (în cazul ideal) pentru a sorta cele 312 valori?
(a)
Afirmația greșită este:
a. Capacitățile de procesare "hardtop" sunt imense, iar avantajul său real constă în capacitatea de a procesa TB și PB de date
b. Hadoop folosește un model de programare numit „MapReduce”, toate programele ar trebui să confirme acest model pentru a funcționa pe platforma Hadoop
c. Modelul de programare, MapReduce, utilizat de Hadoop este dificil de scris și testat
d.Toate cele menționate
Este adevărat că o problema pusă de caracteristica Velocity a aplicațiilor Big Data este stocarea datelor?
True
False
Este adevărat ca modelul de Cloud privat oferă o arhitectura multi-tennant?
True
False
Este adevarat ca, componenta BlockReport din cadrul unui DataNode distribuie date si metadate clientilor?
True
False
In arhitectura Lambda Serving layer are una din urmatoarele functionalitati:
a. foloseste algoritmi rapizi incrementali
b. proceseaza cererile care au ca cerinta o latenta mica
c. indexeaza functii arbitrare de interogre
Dorim să stocăm 17 MB de date într-o configurație standard de HDFS cu gradul de replicare 3. Câți MB de date sunt necesari în sistemul de fișiere?
(a)
Tranzacțiile în depozitul de dare la unei bănci se fac pe:
a. Data semi-structurate
b. Data structurate
c. "Raw data"
d. Data nestructurate
e. Serii temporale nestructurate
Care dintre următoarele sunt probleme de luat în considerare atunci când integrați proiectul cu Hadoop?
a. Paralelism la nivel de task
b. Acces aleatoriu la date
c. Paralelism la nivel de date
d. Înlocuirea infrastructurii
Un fișier ocupă 3 blocuri de date în HDFS. Factorul de replicare este 3. Numărul de DataNodes necesar este:
(a)
Un fișier ocupă 3 blocuri de date în HDFS. Factorul de replicare este 3. Numărul de DataNodes necesar este:
(a)
Este adevarat ca Apache Messos nu accepta mecanismul de negociere atunci cand face maparea task-urilor pe resurse?
true
false
Este adevarat ca HDFS asigura latente mici de acces la fisiere?
true
false
Arhitectura HDFS de bază conține:
Mesos
NameNode
DataNode
YARN
Zookeper
Hadoop are la baza implementarea open-source a:
a. Lustre File System
a. Lustre File System
c. Google File System
Este adevarat ca RDD-urile nu suporta partajare de date eficienta?
tRUE
False
Care este ordinea celor trei pași pentru Map Reduce?
a. Amestecă și sortează -> Reduce-> Map
b. Map -> Amestecare și sortare -> Reduce
c. Map-> Reduce-> Amestecare și Sortare
d. Amestecă și sortează -> Map-> Reduce
Este adevarat ca Spark este in framework de calcul pentru task-uri iterative bazat pe MPI?
True
False
Care sunt principalele componente ale platformelor de procesare Big Data?
MapReduce
HDFS
HTTP
YARN
NTFS
Ce se face cu datele în etapa de pregătire?
a. Înțelegerea naturii datelor și a analizei preliminare.
b. Selectarea tehnicilor analitice.
c. Construirea unor modele noi
d. Preluarea datelor
Unul dintre urmatorii algoritmi de invatare automata face parte din categoria celor supervizati:
a. Principal Component Analysis
b. Naive Bayes
c. SVD
Este adevărat ca pentru a transfera un fișier de 200 MB in HDFS trebuie sa scriem 4 block-uri de date pe disk folosind configuratia default?
True
False
Avantajele majore aduse de Big Data sunt:
a. reducerea numarului de device-uri mobile
b. reducerea numarului de salariati
c. reducerea costurilor
Este adevarat ca la Hadoop, TaskTracker planifica task-urile trimise de clienti?
true
False
Caracteristica Volume a Big Data pune urmatoarele probleme:
a. stocarea si analiza datelor
b. timpul de raspuns
c. maparea datelor pe resurse dedicate
Care este funcția principală a NameNode-ului din cadrul HDFS?
a. Ascultă de la DataNode pentru crearea, ștergerea și replicarea blocurilor.
b. Coordonează operațiunile și atribuie sarcini nodurilor DataNode
c. Pentru calculele de secvențiere a genelor.
Care dintre următoarele sunt motivele justifică faptul că datele generate de oameni sunt greu de procesat?
a. Ele nu pot fi modelate și stocate.
b. Date sunt foarte nestructurate
c. Viteza datelor este foarte mare.
d. Oamenii calificați pentru a analiza datele sunt greu de găsit.
Este adevarat ca principiile de etica in Big Data ar trebui sa maximize folosirea datelor pentru a promova analize de date durabile si mai putin riscante?
True
False
Care sunt provocările Big Data care au un volum mare?
a. Scalabilitate.
b. Cost
c. Performanță
d.Storage
Este adevarat ca Apache Storm nu garanteaza procesarea mesajelor?
true
false
Asigurarea cu resurse de calcul fundamentale: VM’s (CPU, stocare, rețea) se realizează la
PaaS
DaaS
HaaS
SaaS
IaaS
Un fișier se poate împărți în 4 block-uri care sunt stocate în HDFS, factorul de replicare fiind 3. Care este numărul minim de noduri pentru a asigura toleranța la defecte.
(a)
Algoritmii Spark de tipul broadcast everything:
a. la fiecare iteratie partajeaza modelele de calcul
b. la fiecare iteratie modele de calcul sunt difuzate de master
c. nu scaleaza datorita overhead-ul de comunicatie
Apache Spark are API-uri
SCALA
PYTHON
JAVA
R
In Hadoop JobTracker-ul:
a. ruleaza task-urile de map si reduce
b. trimite rapoarte catre TaskTracker
c. planifica job-urile trimise de clienti
Este adevarat ca in arhitectura Apache Storm Nimbus se ocupa de coordonarea clusterului?
tRUE
FAlse
Este adevarat ca Apache Flink este un framework de procesare paralela a fluxurilor de date care nu se bazeaza pe MapReduce
true
false
Este adevarat ca principalul scop al GDPR a fost sa ofere companiilor un control mai bun asupra datelor colectate?
true
false
In Spark algoritmii de tip fully parallel presupun ca:
a. nodurile de tip master incarca datele
b. nodurile de tip worker incarca datele
c. nodurile de tip worker incarca datele si instantiaza modelele
Este adevarat ca un client HDFS citeste block-urile de date direct de pe Data Node fara a trece prin Name Node?
true
false
Toleranța la defecte în cazul depozitelor de date este asigurată prin:
elasticitate
replicare
scalabilitate
granularitate cat mai mare
atomicitate
Unde sunt trimise datele pentru fiecare nod de lucru după ce este apelată o funcție de colectare?
a. Spark Streaming
b. Contextul Spark(Spark Context)
c. Rămân în același nod
d. Alte noduri de lucru
Modelul de Cloud privat:
a. permite un model de calcul pay-as-you-go
b. are o arhitectura multi-tenant
c. are o arhitectura single-tenant
Care dintre următoarele sunt exemple pentru utilizarea BigData în ziua de azi?
Social Media
Baze de date locale
Cloud Computing
Retele WIFI
Este adevarat ca procesarea de tip stream representa o serie de task-uri mici de tip batch computing nedeterministe
true
false
Dorim să scriem un set de date și avem la dispoziție 2 blocuri standard în HDFS. Ce volum maxim putem să scriem?
(a)
Este adevarat ca in procesarea stream-urilor de click-uri evenimentele sosesc intr-o ordine bine definita?
true
false
Este adevarat ca un nod de tip NameNode trimite un semnal de tip heartbeat pentru a detecta erori la nivelul datelor?
true
false
Unul dintre urmatorii algoritmi de invatare automata face parte din categoria celor nesupervizati:
a. K-means
b. Random Decision Forests
c. SVM
Care este fluxul de lucru pentru lucrul cu Big Data?
a. Modele mai bune ->Extrapolare->Precizie mai mare
b. Extrapolare -> Înțelegere -> Reproducere
c. Big Data -> Modele mai bune -> Precizie mai mare
d. Teorie ->Modele -> Sfaturi precise
Care dintre următoarele sunt obiectivele majore ale Hadoop?
a. Facilitarea unui mediu partajat
b. Sarcini sensibile la latență.
c. Asigură toleranța la defect
d. Asigură scalabilitate
Ce oferă IaaS?
a. Nici una dintre variante
b. Software la cerere (software on demand).
c. Resursele hardware
d. Mediul de calcul
Ce oferă PaaS?
a. Software la cerere (software on demand).
b. Resursele hardware
c. Nici una dintre variante
d. Mediul de calcul
Indicați afirmația corectă:
a. În Hadoop, fișierele de ieșire sunt împărțite în linii sau înregistrări
b. Niciunul dintre cele menționate
c. Hadoop 2.0 permite procesarea fluxurilor de date în timp real
d. Hadoop are nevoie de hardware specializat pentru procesarea datelor
Hadoop are la baza implementarea open-source a:
a. Lustre File System
b. Google File System
c. General Parallel File System
Care sunt componentele Apache Storm?
a. Nimbus
b Zookeper
c. Datanode
d. NameNode
e. Supervisor
Care dintre următoarele este NU sunt adevăratepentru RDD?
a. RDD este un model pentru bazele de date
b. O colecție de date gestionată în memorie
c. RDD este serviciu web
d. RDD este un framework pentru Machine Learning
Un RRD ocupă 23 MB în memorie. Cineva dorește să modifice 2 MB din acest RDD (write, nu append!). Ce spațiu de memorie va fi ocupat (teoretic) după această operație?
(a)
Este adevarat ca, companiile din afara UE nu trebuie sa respecte politica GDPR daca doresc sa faca afaceri cu, clienti din UE?
tRUE
FALSE
Este adevărat ca pe un cluster cu 15 noduri fiecare având 10TB spațiu pe disk, cu un factor de replicare de 4 se pot stoca 37,5TB de date?
true
false
Conceptul de Mobile computing este caracterizat de:
a. Mobile computation
b. Homomorphic encryption
c. Hadoop environment
d. NoSQL Databases
e. Mobile communication
Ce oferă SaaS?
a. Resurse hardware
b. Mediul de calcul
c. Nici una dintre variante
d. Software la cerere (software on demand).
Este adevarat ca in cazul algoritmului PageRank structura grafului nu poate fi exploatata pentru a obtine imbunatatiri semnificative de performanta?
true
false
Algoritmii Spark de tipul broadcast everything:
a. la fiecare iteratie partajeaza modelele de calcul
b. la fiecare iteratie modele de calcul sunt difuzate de master
c. nu scaleaza datorita overhead-ul de comunicatie
Amazon a colectat date privind recenziile pentru un anumit produs. Ei și-au dat seama că aproape 90% dintre recenzii au avut în mare parte o evaluare de 5/5. Totuși, dintre cei 90%, au realizat că 50% dintre aceștia erau clienți care nu aveau dovada de cumpărare sau clienți care nu au postat recenzii serioase despre produs. Dintre următoarele, care afirmație este adevărată privind datele de revizuire colectate în această situație?
a. Veracitate ridicată.
b. Veracitate scăzută
c. Volum ridicat.
d. Volum mic.
Este adevarat ca algoritmul de clusterizare K-Means atribuie puncte la un cluster lunad in calcul cea mai mare distanta euclidiana?
true
false
Care sunt modalitățile de abordare a problemelor de calitate a datelor?
a. Eliminarea înregistrărilor duplicat
b. Eliminarea valorilor aberante (outliers
c. Generarea cele mai bune estimări pentru valori nevalide.
Is it true that Pig is a high level language for data analysis?
true
false
Hybrid Cloud model
a. exposes sensitive data
b. offers increased capabilities
c.provides increased resources
c. limits the user to using a single provider
In a Hadoop application we have the following features: - search time: 10 msec, - file transfer rate: 100 MB / s, - additional cost (overhead, search time / block transfer time) is 1%. What is the block size in HDFS?
(a)
Is it true that Hadoop does not have rack awareness?
true
false
In Spark, fully parallel algorithms assume that:
a. worker nodes load data
b. master nodes load data
c. worker nodes load data and instantiate patterns
Is it true that Variety, a feature of Big Data applications, refers to the meaning of constantly changing data?
true
false
Is it true that in the LAMBDA architecture, Speed Layer processes the master data set using fast algorithms?
true
false
The Big Data Vicissitude feature refers to:
a. scaling complex processing flows
b. difficulty in data exploration
c. data volume and complexity;
We want to write a data set and we have 4 standard blocks in HDFS. What is the maximum volume we can write?
(a)
Error tolerance in RDD is achieved using:
a. Lazy-evaluation
b. None of the three
c. Immutable nature of RDD
d. DAG (Directed Acyclic Graph)
In HDFS the default replica placement strategy provides:
a. the second replica on the same node as the first replica
b. a replica on the local node
We want to store 35 MB of data in a standard HDFS configuration with degree of replication 3. How many MB of data are needed in the file system?
(a)
Is it true that a large number of small files stored in HDFS leads to an increase in performance?
true
false
Sistemul de fișiere HDFS este bazat pe:
tabele
tupluri
obiecte
blocuri
inregistrari json
Rdd-urile sunt folosite in Hdoop
true
false
Un senzor produce 4K date la fiecare 30 de minute. Câți K de date se produc zilnic?
(a)
Platforma Storm este folosită pentru:
a. managementul de resurse.
b. Procesarea fluxurilor multimedia.
c. managementul utilizatorilor.
d. crearea de mașini virtuale.
e. Procesarea fluxurilor de date.
Este adevărat ca paradigma HPC oferă performante înalte folosind commodity hardware? Select one:
true
false
What are the modes in which Hadoop can be run?
Standalone Mode
Pseudo-distributed Mode
Fully-Distributed Mode.
