wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

big data

Total questions: 93

Worksheet time: 56mins

Name
Class
Date
1.

Caracteristicile unui datacenter pentru stocarea și procesarea volumelor mari de date sunt:

a)

a. Scalabilitatea

b)

b. Toleranța la defecte

c)

c. Capacitatea fixă de procesare.

d)

d. Eterogenitatea mediilor de stocare

e)

e. Capacitatea mare de stocare

2.

Pe măsură ce companiile trec de faza experimentală cu Hadoop, acestea simt necesitatea unor capabilități suplimentare, inclusiv:

a)

a. Îmbunătățirea stocării datelor și a recuperării informațiilor

b)

b. Caracteristici îmbunătățite de extragere, transformare și încărcare pentru integrarea datelor

c)

c. Îmbunătățirea securității, gestionării volumului de lucru și suport SQL

d)

d. Funcționalitate îmbunătățită de stocare a datelor

3.

In paradigma Edge Computing:

a)

a. datele sunt procesate local pe device-urile care produc date

b)

b. datele sunt procesate in Cloud

c)

c. datele sunt procesate la nivel local pe marginea retelei

4.

Este adevarat ca in Apache Storm task-urile de tip “acker” daca tuplurile procesate nu sunt recunoscute memoria este reciclata?

a)

true

b)

false

5.

Este adevarat ca metadatele pastrate de NameNode nu sunt stocate in totalitate in memoria principala?

a)

true

b)

false

6.

Care sunt provocările datelor cu varietate mare?

a)

a. Greu de efectuat o analiză a comportamentului emergent

b)

b. Calitatea datelor este scăzută.

c)

c. Greu de integrat.

d)

d. Greu în utilizarea detectării evenimentelor de grup.

7.

Limbajele de programare, instrumentele și bibliotecile sunt acceptate de furnizorul de servicii Cloud la nivelul:

a)

a. sa se proceseze datele imediat de se produce un eveniment

b)

b. evenimentele sa se produca intr-un mod determinist

c)

c. sa se aplice o perioada de gratie inainte de a procesa datele produse de evenimente

8.

Avem un set de date cu 312 valori distincte. Care este numărul minim de operații (în cazul ideal) pentru a sorta cele 312 valori?

(a)  

9.

Afirmația greșită este:

a)

a. Capacitățile de procesare "hardtop" sunt imense, iar avantajul său real constă în capacitatea de a procesa TB și PB de date

b)

b. Hadoop folosește un model de programare numit „MapReduce”, toate programele ar trebui să confirme acest model pentru a funcționa pe platforma Hadoop

c)

c. Modelul de programare, MapReduce, utilizat de Hadoop este dificil de scris și testat

d)

d.Toate cele menționate

10.

Este adevărat că o problema pusă de caracteristica Velocity a aplicațiilor Big Data este stocarea datelor?

a)

True

b)

False

11.

Este adevărat ca modelul de Cloud privat oferă o arhitectura multi-tennant?

a)

True

b)

False

12.

Este adevarat ca, componenta BlockReport din cadrul unui DataNode distribuie date si metadate clientilor?

a)

True

b)

False

13.

In arhitectura Lambda Serving layer are una din urmatoarele functionalitati:

a)

a. foloseste algoritmi rapizi incrementali

b)

b. proceseaza cererile care au ca cerinta o latenta mica

c)

c. indexeaza functii arbitrare de interogre

14.

Dorim să stocăm 17 MB de date într-o configurație standard de HDFS cu gradul de replicare 3. Câți MB de date sunt necesari în sistemul de fișiere?

(a)  

15.

Tranzacțiile în depozitul de dare la unei bănci se fac pe:

a)

a. Data semi-structurate

b)

b. Data structurate

c)

c. "Raw data"

d)

d. Data nestructurate

e)

e. Serii temporale nestructurate

16.

Care dintre următoarele sunt probleme de luat în considerare atunci când integrați proiectul cu Hadoop?

a)

a. Paralelism la nivel de task

b)

b. Acces aleatoriu la date

c)

c. Paralelism la nivel de date

d)

d. Înlocuirea infrastructurii

17.

Un fișier ocupă 3 blocuri de date în HDFS. Factorul de replicare este 3. Numărul de DataNodes necesar este:

(a)  

18.

Un fișier ocupă 3 blocuri de date în HDFS. Factorul de replicare este 3. Numărul de DataNodes necesar este:

(a)  

19.

Este adevarat ca Apache Messos nu accepta mecanismul de negociere atunci cand face maparea task-urilor pe resurse?

a)

true

b)

false

20.

Este adevarat ca HDFS asigura latente mici de acces la fisiere?

a)

true

b)

false

21.

Arhitectura HDFS de bază conține:

a)

Mesos

b)

NameNode

c)

DataNode

d)

YARN

e)

Zookeper

22.

Hadoop are la baza implementarea open-source a:

a)

a. Lustre File System

b)

a. Lustre File System

c)

c. Google File System

23.

Este adevarat ca RDD-urile nu suporta partajare de date eficienta?

a)

tRUE

b)

False

24.

Care este ordinea celor trei pași pentru Map Reduce?

a)

a. Amestecă și sortează -> Reduce-> Map

b)

b. Map -> Amestecare și sortare -> Reduce

c)

c. Map-> Reduce-> Amestecare și Sortare

d)

d. Amestecă și sortează -> Map-> Reduce

25.

Este adevarat ca Spark este in framework de calcul pentru task-uri iterative bazat pe MPI?

a)

True

b)

False

26.

Care sunt principalele componente ale platformelor de procesare Big Data?

a)

MapReduce

b)

HDFS

c)

HTTP

d)

YARN

e)

NTFS

27.

Ce se face cu datele în etapa de pregătire?

a)

a. Înțelegerea naturii datelor și a analizei preliminare.

b)

b. Selectarea tehnicilor analitice.

c)

c. Construirea unor modele noi

d)

d. Preluarea datelor

28.

Unul dintre urmatorii algoritmi de invatare automata face parte din categoria celor supervizati:

a)

a. Principal Component Analysis

b)

b. Naive Bayes

c)

c. SVD

29.

Este adevărat ca pentru a transfera un fișier de 200 MB in HDFS trebuie sa scriem 4 block-uri de date pe disk folosind configuratia default?

a)

True

b)

False

30.

Avantajele majore aduse de Big Data sunt:

a)

a. reducerea numarului de device-uri mobile

b)

b. reducerea numarului de salariati

c)

c. reducerea costurilor

31.

 Este adevarat ca la Hadoop, TaskTracker planifica task-urile trimise de clienti?

a)

true

b)

False

32.

Caracteristica Volume a Big Data pune urmatoarele probleme:

a)

a. stocarea si analiza datelor

b)

b. timpul de raspuns

c)

c. maparea datelor pe resurse dedicate

33.

Care este funcția principală a NameNode-ului din cadrul HDFS?

a)

a. Ascultă de la DataNode pentru crearea, ștergerea și replicarea blocurilor.

b)

b. Coordonează operațiunile și atribuie sarcini nodurilor DataNode

c)

c. Pentru calculele de secvențiere a genelor.

34.

Care dintre următoarele sunt motivele justifică faptul că datele generate de oameni sunt greu de procesat?

a)

a. Ele nu pot fi modelate și stocate.

b)

b. Date sunt foarte nestructurate

c)

c. Viteza datelor este foarte mare.

d)

d. Oamenii calificați pentru a analiza datele sunt greu de găsit.

35.

Este adevarat ca principiile de etica in Big Data ar trebui sa maximize folosirea datelor pentru a promova analize de date durabile si mai putin riscante?

a)

True

b)

False

36.

Care sunt provocările Big Data care au un volum mare?

a)

a. Scalabilitate.

b)

b. Cost

c)

c. Performanță

d)

d.Storage

37.

Este adevarat ca Apache Storm nu garanteaza procesarea mesajelor?

a)

true

b)

false

38.

Asigurarea cu resurse de calcul fundamentale: VM’s (CPU, stocare, rețea) se realizează la

a)

PaaS

b)

DaaS

c)

HaaS

d)

SaaS

e)

IaaS

39.

Un fișier se poate împărți în 4 block-uri care sunt stocate în HDFS, factorul de replicare fiind 3. Care este numărul minim de noduri pentru a asigura toleranța la defecte.

(a)  

40.

Algoritmii Spark de tipul broadcast everything:

a)

a. la fiecare iteratie partajeaza modelele de calcul

b)

b. la fiecare iteratie modele de calcul sunt difuzate de master

c)

c. nu scaleaza datorita overhead-ul de comunicatie

41.

Apache Spark are API-uri

a)

SCALA

b)

PYTHON

c)

JAVA

d)

R

42.

In Hadoop JobTracker-ul:

a)

a. ruleaza task-urile de  map si reduce

b)

b. trimite rapoarte catre  TaskTracker

c)

c. planifica job-urile trimise de clienti

43.

Este adevarat ca in  arhitectura Apache Storm Nimbus se ocupa de coordonarea clusterului?

a)

tRUE

b)

FAlse

44.

Este adevarat ca Apache Flink este un framework de procesare paralela a fluxurilor de date care nu se bazeaza pe MapReduce

a)

true

b)

false

45.

Este adevarat ca principalul scop al GDPR a fost sa ofere companiilor un control mai bun asupra datelor colectate?

a)

true

b)

false

46.

In Spark algoritmii de tip fully parallel presupun ca:

a)

a. nodurile de tip master incarca datele

b)

b. nodurile de tip worker incarca datele

c)

c. nodurile de tip worker incarca datele si instantiaza modelele

47.

Este adevarat ca un client HDFS citeste block-urile de date direct de pe Data Node fara a trece prin Name Node? 

a)

true

b)

false

48.

Toleranța la defecte în cazul depozitelor de date este asigurată prin:

a)

elasticitate

b)

replicare

c)

scalabilitate

d)

granularitate cat mai mare

e)

atomicitate

49.

Unde sunt trimise datele pentru fiecare nod de lucru după ce este apelată o funcție de colectare?

a)

a. Spark Streaming

b)

b. Contextul Spark(Spark Context)

c)

c. Rămân în același nod

d)

d. Alte noduri de lucru

50.

Modelul de Cloud privat:

a)

a. permite un model de calcul pay-as-you-go

b)

b. are o arhitectura multi-tenant

c)

c. are o arhitectura single-tenant

51.

Care dintre următoarele sunt exemple pentru utilizarea BigData în ziua de azi? 

a)

Social Media

b)

Baze de date locale

c)

Cloud Computing

d)

Retele WIFI

52.

Este adevarat ca procesarea de tip stream representa o serie de task-uri mici de tip batch computing nedeterministe

a)

true

b)

false

53.

Dorim să scriem un set de date și avem la dispoziție 2 blocuri standard în HDFS. Ce volum maxim putem să scriem?

(a)  

54.

Este adevarat ca in procesarea stream-urilor de click-uri evenimentele sosesc intr-o ordine bine definita?

a)

true

b)

false

55.

Este adevarat ca un nod de tip NameNode trimite un semnal de tip heartbeat pentru a detecta erori la nivelul datelor?

a)

true

b)

false

56.

Unul dintre urmatorii algoritmi de invatare automata face parte din categoria celor nesupervizati:

a)

a. K-means

b)

b. Random Decision Forests

c)

c. SVM

57.

Care este fluxul de lucru pentru lucrul cu Big Data?

a)

a. Modele mai bune ->Extrapolare->Precizie mai mare

b)

b. Extrapolare -> Înțelegere -> Reproducere

c)

c. Big Data -> Modele mai bune -> Precizie mai mare

d)

d. Teorie ->Modele -> Sfaturi precise

58.

Care dintre următoarele sunt obiectivele majore ale Hadoop?

a)

a. Facilitarea unui mediu partajat

b)

b. Sarcini sensibile la latență.

c)

c. Asigură toleranța la defect

d)

d. Asigură scalabilitate

59.

Ce oferă IaaS?

a)

a. Nici una dintre variante

b)

b. Software la cerere (software on demand).

c)

c. Resursele hardware

d)

d. Mediul de calcul

60.

Ce oferă PaaS?

a)

a. Software la cerere (software on demand).

b)

b. Resursele hardware

c)

c. Nici una dintre variante

d)

d. Mediul de calcul

61.

Indicați afirmația corectă:

a)

a. În Hadoop, fișierele de ieșire sunt împărțite în linii sau înregistrări

b)

b. Niciunul dintre cele menționate

c)

c. Hadoop 2.0 permite procesarea fluxurilor de date în timp real

d)

d. Hadoop are nevoie de hardware specializat pentru procesarea datelor

62.

Hadoop are la baza implementarea open-source a:

a)

a. Lustre File System

b)

b. Google File System

c)

c. General Parallel File System

63.

Care sunt componentele Apache Storm?

a)

a. Nimbus

b)

b Zookeper

c)

c. Datanode

d)

d. NameNode

e)

e. Supervisor

64.

Care dintre următoarele este NU sunt adevăratepentru RDD?

a)

a. RDD este un model pentru bazele de date 

b)

b. O colecție de date gestionată în memorie

c)

c. RDD este serviciu web

d)

d. RDD este un framework pentru Machine Learning 

65.

Un RRD ocupă 23 MB în memorie. Cineva dorește să modifice 2 MB din acest RDD (write, nu append!). Ce spațiu de memorie va fi ocupat (teoretic) după această operație?

(a)  

66.

Este adevarat ca, companiile din afara UE nu trebuie sa respecte politica GDPR daca doresc sa faca afaceri cu, clienti din UE?

a)

tRUE

b)

FALSE

67.

Este adevărat ca pe un cluster cu 15 noduri fiecare având 10TB spațiu pe disk, cu un factor de replicare de 4 se pot stoca 37,5TB de date?

a)

true

b)

false

68.

Conceptul de Mobile computing este caracterizat de:

a)

a. Mobile computation

b)

b. Homomorphic encryption

c)

c. Hadoop environment

d)

d. NoSQL Databases

e)

e. Mobile communication

69.

Ce oferă SaaS?

a)

a. Resurse hardware

b)

b. Mediul de calcul

c)

c. Nici una dintre variante

d)

d. Software la cerere (software on demand).

70.

Este adevarat ca in cazul algoritmului PageRank structura grafului nu poate fi exploatata pentru a obtine imbunatatiri semnificative de performanta?

a)

true

b)

false

71.

Algoritmii Spark de tipul broadcast everything:

a)

a. la fiecare iteratie partajeaza modelele de calcul

b)

b. la fiecare iteratie modele de calcul sunt difuzate de master

c)

c. nu scaleaza datorita overhead-ul de comunicatie 

72.

Amazon a colectat date privind recenziile pentru un anumit produs. Ei și-au dat seama că aproape 90% dintre recenzii au avut în mare parte o evaluare de 5/5. Totuși, dintre cei 90%, au realizat că 50% dintre aceștia erau clienți care nu aveau dovada de cumpărare sau clienți care nu au postat recenzii serioase despre produs. Dintre următoarele, care afirmație este adevărată privind datele de revizuire colectate în această situație?

a)

a. Veracitate ridicată.

b)

b. Veracitate scăzută

c)

c. Volum ridicat.

d)

d. Volum mic.

73.

Este adevarat ca algoritmul de clusterizare K-Means  atribuie puncte la un cluster lunad in calcul cea mai mare distanta euclidiana?

a)

true

b)

false

74.

Care sunt modalitățile de abordare a problemelor de calitate a datelor?

a)

a. Eliminarea înregistrărilor duplicat

b)

b. Eliminarea valorilor aberante (outliers

c)

c. Generarea cele mai bune estimări pentru valori nevalide.

75.

Is it true that Pig is a high level language for data analysis?

a)

true

b)

false

76.

Hybrid Cloud model

a)

a. exposes sensitive data

b)

b. offers increased capabilities

c)

c.provides increased resources

d)

c. limits the user to using a single provider

77.

In a Hadoop application we have the following features: - search time: 10 msec, - file transfer rate: 100 MB / s, - additional cost (overhead, search time / block transfer time) is 1%. What is the block size in HDFS?

(a)  

78.

Is it true that Hadoop does not have rack awareness?

a)

true

b)

false

79.

In Spark, fully parallel algorithms assume that:

a)

a. worker nodes load data

b)

b. master nodes load data

c)

c. worker nodes load data and instantiate patterns

80.

Is it true that Variety, a feature of Big Data applications, refers to the meaning of constantly changing data?

a)

true

b)

false

81.

Is it true that in the LAMBDA architecture, Speed Layer processes the master data set using fast algorithms?

a)

true

b)

false

82.

The Big Data Vicissitude feature refers to:

a)

a. scaling complex processing flows 

b)

b. difficulty in data exploration

c)

c. data volume and complexity;

83.

We want to write a data set and we have 4 standard blocks in HDFS. What is the maximum volume we can write?

(a)  

84.

Error tolerance in RDD is achieved using:

a)

a. Lazy-evaluation 

b)

b. None of the three

c)

c. Immutable nature of RDD

d)

d. DAG (Directed Acyclic Graph)

85.

In HDFS the default replica placement strategy provides:

a)

a. the second replica on the same node as the first replica

b)

b. a replica on the local node

86.

We want to store 35 MB of data in a standard HDFS configuration with degree of replication 3. How many MB of data are needed in the file system?

(a)  

87.

Is it true that a large number of small files stored in HDFS leads to an increase in performance?

a)

true

b)

false

88.

Sistemul de fișiere HDFS este bazat pe:

a)

tabele

b)

tupluri

c)

obiecte

d)

blocuri

e)

inregistrari json

89.

Rdd-urile sunt folosite in Hdoop

a)

true

b)

false

90.

Un senzor produce 4K date la fiecare 30 de minute. Câți K de date se produc zilnic?

(a)  

91.

Platforma Storm este folosită pentru:

a)

a. managementul de resurse.

b)

b. Procesarea fluxurilor multimedia. 

c)

c. managementul utilizatorilor.

d)

d. crearea de mașini virtuale.

e)

e. Procesarea fluxurilor de date.

92.

Este adevărat ca paradigma HPC oferă performante înalte folosind commodity hardware? Select one:

a)

true

b)

false

93.

What are the modes in which Hadoop can be run?

a)

Standalone Mode

b)

Pseudo-distributed Mode

c)

Fully-Distributed Mode.