wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Data Mining Quiz

Total questions: 148

Worksheet time: 1hrs 14mins

Name
Class
Date
1.

Transaction set:{(1,2,3,5), (2,4,5), (2,3,4,5)}. The confidence of the rule (5)->(3) is:​

a)

66%

b)

33%

c)

50%

2.

Sequential covering is used for

a)

Building decision trees

b)

Obtaining rules

c)

Clustering

3.

When building a decision tree using C4.5, branching is made using the attribute that:

a)

Minimize the information gain

b)

Minimize the entropy

c)

Both a and b are true

4.

KNN algorithm is for:

a)

Clustering

b)

Regression

c)

Classification

5.

A decision tree can be converted in:

a)

A set of rules

b)

A single complex rule

c)

Both a and b are false

6.

Hierarchical clustering produces a sequence of embedded clusters called:

a)

Dendogram

b)

Dendrogram

c)

Dondegram

7.

Variance is:

a)

Square of σ

b)

Square root of σ

c)

Both a and b are false

8.

K-Means is sensitive to:

a)

Outliers

b)

Initial centroids

c)

Both a and b are true

9.

Fuzzy C-Means type is:

a)

Hard Clustering

b)

Soft clustering

c)

Mixed clustering

10.

The standard deviation of (1,1,1,1,1) is:

a)

1

b)

Between 1 and 2

c)

0

11.

In the case of SVM the algorithms tries to find the hyperplane that:

a)

Minimize the margin

b)

Maximize the margin

c)

Both a and b are false

12.

In a school 60% of the students are boys and 40% girls. Girls wear shorts and skirts in equal proportions, boys only shorts. A distant observer sees a person wearing shorts. What is the probability that the person is a boy?( Source: Wikipedia)

a)

80%

b)

75%

c)

40%

13.

K-Means is not suitable for finding clusters that:

a)

Are not hyper-ellipsoids(or hyper-spheres).

b)

Are hyper-ellipsoids(of hyper-spheres).

c)

Both a and b are false

14.

When we start with a set of labeled items (labels from a set of classes) we have:

a)

Association rules

b)

Supervised learning

c)

Unsupervised learning

15.

For 4 points in 1D (1,2,5,6), using K-Means with K=2 and initial centroids 1 and 6, the result is:

a)

(1,2) and (5,6)

b)

(1,5) and (2,6)

c)

(1) and (2,5,6)

16.

From Apriori principle, if the sets A and B are frequent itemsets, then also X is frequent itemset, with:

a)

X=A

b)

X=A

c)

X=AxB

17.

Eye color has values of type:

a)

Categorical

b)

Nominal

c)

Both a and b are true

18.

If for 200 items, all positive, 50 are not correctly classified, then the accuracy is:

a)

25%

b)

50%

c)

75%

19.

For 4 points in 1D ( 1,2,5,6), using k-Means with K=2 and initial centroids 1 and 2, the result is:

a)

(1,2) and (5,6)

b)

(1,5) and (2,6)

c)

(1) and (2,5,6)

20.

If A is a frequent itemset and s is the threshold then:

a)

Each item of A is in at least s% transactions

b)

A as a set is in at least s% transactions

c)

Both a and b are true

21.

Binning Methods for Data Smoothing is a bin contains 4,8,9,15, the result of smoothing boundaries is:

a)

9,9,9,9

b)

4,4,15,15

c)

4,4,4,15

22.

(1,3,5,7,1001,2002,9999) is:

a)

Unimodal

b)

Bimodal

c)

Without modal value

23.

Transaction set ((1,2,3), (2,3,4), (3,4,5)); s=50%. The number of frequent items is:

a)

3

b)

4

c)

5

24.

If P(A)=0.8%, P(B)=40%, P(B|A)=10%, then P(A|B) is:

a)

20%

b)

2%

c)

0,2%

25.

Having 10000 transactions with 10 items each and s=10 000, then the number of frequent items is at most:

a)

1

b)

10

c)

100

26.

The median value of (1,3,5,7,1001,2002,9999) is:

a)

7

b)

5000

c)

Other value

27.

Entropy(D)= . If D contains 100% positive examples the entropy of D is:

a)

1

b)

0

c)

-1

28.

Transaction set [(1,2,3,5), (2,3,4),(3,4,5)); s=50%. The number of frequent pair is:

a)

1

b)

2

c)

3

29.

It is not Data Mining:

a)

Computing summary functions(e.g. min, max) for a table

b)

Searching a person in a database

c)

Both a and b are true

30.

Five number summay contains:

a)

Mean and Median

b)

Quartiles and Quintiles

c)

Min and max values -- FNS = (Min, Q1, Median, Q3, Max), fără Mean. -> dar Q1 si Q3 sunt quartile, iar mediana si alte valori cred ca se numesc quintile → quintiles include quartiles (https://en.wikipedia.org/wiki/Quantile#Even-sized_population)

31.

If for 200 items, all positive, 50 are not correctly classified, then the F1-score is:

a)

85%

b)

55%

c)

25%

32.

If D has 50% positive and 50% negative examples the entropy of D is:

a)

1

b)

0

c)

-1

33.

Transaction set: {(1,2,3,5),(2,3,5,6),(3,4,6)}, s=50%. The frequent items are

a)

(1, 2, 3, 5)

b)

(2, 3, 5)

c)

(1, 2, 3, 5, 6)

34.

Transaction set: {(1,2,3,5),(2,3,4,5),(3,4,5)}. The support of the rule (3)->(5) is

a)

33%

b)

66%

c)

100%

35.

In the case of discretization using equi-width bining with width=10 for 0,4,12,16,16,18,24,26,38 we obtain

a)

3 bins

b)

4 bins

c)

5 bins

36.

Detecting outliers using 1,5*IQR:X is outlier if the value of X in {1,2,3,X} is:

a)

5

b)

-2.5

c)

5.9

37.

Using Min-Max normalization, the set {1,2,3,6} is transformed in:

a)

.(0.2, 0.4, 0.6, 0.9)

b)

(0.1, 0.2, 0.3, 0.6)

c)

(0.0, 0.2, 0.4, 1

38.

Using Decimal Scaling, the set {1,2,3,6} is transformed in:

a)

.(0.2, 0.4, 0.6, 0.9)

b)

(0.1, 0.2, 0.3, 0.6)

c)

.(0.2, 0.4, 0.6, 1)

39.

The distance in 1D between the clusters (1,2,3) and (4,5,6) using single link is:

a)

1

b)

3

c)

5

40.

For 4 points in 1D (1,2,5,6), using K-Means with K=2 and initial centroids 1 and 6, the result is:

a)

(1,2) and (5,6)

b)

(1,5) and (2,6)

c)

(1) and (2,5,6)

41.

Vocabulary: {eu, nu, sunt ,acasa. The cosine distance between “ eu sunt” and “ sunt acasa” is:

a)

1/3

b)

1/2

c)

1

42.

Se poate folosi o cheie surogat pentru o tabelă de fapte dacă:

a)

Există dimensiuni identice

b)

Există coloane identice

c)

Există linii identice

43.

În lucrările sale, Ralph Kimball a susținut o stocare a datelor într-un depozit de date folosind o abordare:

a)

Normată

b)

Dimensională

c)

Normalizată

44.

Algoritmii de clasificare sunt de tipul:

a)

Prescriptiv

b)

Descriptiv

c)

Predictiv

45.

Deviația (abaterea) standard a mulțimii {1, 1, 1, 1, 1} este:

a)

1

b)

intre 1 si 2

c)

0

46.

Distanta in 1D intre: (1, 2, 3) si (4, 5, 6) utilizând metoda “complete link” este:

a)

3

b)

5

c)

1

47.

Extragerea și integrarea datelor, informațiilor și cunoștințelor din paginile web fac obiectul:

a)

Mineritului conținutului paginilor web (Web content mining)

b)

Mineritului structurii paginilor web (Web structure mining)

c)

Mineritului utilizării paginilor web (Web usage mining)

48.

Cand etichetele de clasa pentru date nu sunt cunoscute avem:

a)

a. Invatare supervizata

b)

b. Reguli de asociere

c)

c. Invatare nesupervizata

49.

Formula entropiei este cea cunoscuta: Entropie(D) = -Sum [ Pr(c ) * log Pr (c )]. Daca D are 50% exemple pozitive si 50% exemple negative entropia este:

a)

1

b)

0

c)

-1

50.

O tabelă de dimensiuni reprezintă:

a)

Un proces de afaceri

b)

Entități ale lumii reale și nu procese de afaceri

c)

Numere operaționale de control (numar factură, număr comanda, etc.)

51.

În cazul în care studiem secvența de coșuri de cumpărături a unui client posesor de card de loialitate folosind GSP, daca L2 (secvențe frecvente de lungime 2) conține doar secvențele si , are sens să considerăm ca și candidat de lungime 3 secvența <(AB),C>?

a)

nu

b)

da

c)

depinde de restul datelor

52.

Pentru recunoașterea punctelor izolate (outliers) se folosește valoarea 1,5 * IQR. In acest caz, cât ar trebui sa fie X din mulțimea {0, 1, 2, X} pentru a fi considerat punct izolat:

a)

-1.5

b)

-2.5

c)

5.5

53.

În cazul în care studiem secvența de coșuri de cumpărături a unui client posesor de card de loialitate folosind GSP, daca L2 (secvențe frecvente de lungime 2) conține doar secvențele si , are sens să considerăm ca și candidat de lungime 3 secvența ?

a)

depinde de restul datelor

b)

nu

c)

da

54.

Dacă pentru datele unei rețele de magazine o linie a tabelei de fapte reprezintă un bon de cumpărături al unui client, atunci care dimensiune nu poate fi atașată schemei stea:

a)

. Data

b)

Produsul

c)

magazinul

55.

Sesionizarea înseamnă

a)

. Impunerea unor sesiuni

b)

b. Identificarea userilor

c)

c. Identificarea sesiunilor

56.

În cazul algoritmilor de tip Expectation-Maximization, etapa Maximization:

a)

Calculează noi estimări ale parametrilor

b)

Nu utilizează estimările curente ale parametrilor și nici nu calculează noi estimări ale lor

c)

Utilizează estimările curente ale parametrilor

57.

În cadrul cursului acoperirea secvențială (sequential covering) s-a folosit pentru:

a)

. Clustering

b)

b. Inducerea regulilor

c)

c. Construire arbori de decizie

58.

Discretizarea face parte din etapa de:

a)

Preprocesarea datelor

b)

b. Extragerea modelelor și descoperirea cunoștințelor

c)

Vizualizare

59.

Faptul ca într-un depozit de date datele sunt dependente de timp (time-variant) înseamnă că:

a)

Datele din depozit nu pot fi modificate

b)

Datele din depozit sunt actualizate periodic

c)

. Analiza depozitului de date ia în calcul modificările realizate în timp

60.

O tabelă de tipul Aggregated Fact Tables poate conține, pe lângă cheia primara și cheile străine:

a)

Mai multe coloane de fapte (măsuri)

b)

O singură coloană de fapte (măsuri)

c)

Doar date sumarizate (sume, medii, etc)

61.

In cazul SVM, algoritmii de acest tip pot fi folositi pentru un numar de clase:

a)

<2

b)

=2

c)

>2

62.

In cazul MCAR (MCAR = Missing Completely At Random):

a)

. P (labeled=1|x, y) <> P (labeled=0|x, y)

b)

. P (labeled=1| x, y) = P (labeled=1| x)

c)

P (labeled=1|x, y) = P (labeled=1)

63.

Tranzacții: {(1, 2, 3, 5), (2, 3, 5, 6), (1, 4, 6)} ; s = 50%. Atunci articolele frecvente sunt:

a)

{2, 3, 5}

b)

{1, 2, 3, 5}

c)

{1, 2, 3, 5, 6}

64.

O diferență dintre un depozit de date (DWH) și un magazin de date operaționale (Operational Data Store – ODS) este:

a)

Datele din DWH sunt orientate pe subiecte pe când cele din ODS pe activități

b)

Datele din ODS sunt datele curente pe când cele din DWH sunt istorice

c)

Datele din DWH sunt datele curente pe când cele din ODS sunt istorice

65.

In cazul SVM/separare non-liniara asa numitul „feature space” are de obicei:

a)

Mai putine dimensiuni

b)

Acelasi numar de dimensiuni

c)

Mai multe dimensiuni

66.

Fie vocabularul {eu, nu, sunt, acasa}. Distanta cosinus intre 'eu sunt acasa' si 'nu sunt acasa' este:

a)

1/3

b)

1

c)

2/3

67.

Fie o scoala avand 40% elevi si 60% eleve. Elevele poarta sort sau fusta in proportii egale iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand sort. Care este probabilitatea ca persoana respectiva sa fie o eleva?

a)

63%

b)

43%

c)

53%

68.

Faptul că un depozit de date este orientat (axat) pe subiecte înseamnă că:

a)

Datele pot fi actualizate sau șterse în funcție de subiectele conținute

b)

Datele sunt organizate considerând categoriile de informații stocate

c)

Datele sunt organizate considerând activitățile principale ale companiei

69.

Faptul că datele dintr-un depozit de date sunt non-volatile înseamnă că:

a)

Datele pot fi actualizate (UPDATE) dar nu mai pot fi șterse

b)

Datele pot fi actualizate sau șterse în funcție de subiectele conținute

c)

O data încărcate în depozit datele nu mai sunt modificate sau șterse

70.

In cazul MNAR (MNAR = Missing Not At Random):

a)

P (labeled=1| x, y) = P (labeled=1| x)

b)

P (labeled=1|x, y) = P (labeled=1)

c)

P (labeled=1|x, y) <> P (labeled=0|x, y)

71.

Distanta in 1D intre: (1, 2, 6) si (1, 5, 6) utilizând metoda centroizilor este:

a)

3

b)

5

c)

1

72.

O tabelă de fapte (măsuri) reprezintă:

a)

Entități ale lumii reale și nu procese de afaceri

b)

Numere operaționale de control (numar factură, număr comanda, etc.)

c)

Un proces de afaceri

73.

Fie în 1D doua clustere: (1 ,2) și (3, 4). Care este valoarea siluetei s(2) a punctului 2 din (1, 2):

a)

2/3

b)

3/5

c)

1/3

74.

(A, BC) este o subsecvență pentru:

a)

a. (B, AB, AC, BCD)

b)

b. (ABC)

c)

c. (A, B, C)

75.

In cazul algoritmului Co-training (versiunea Blum and Mitchel), tabela conținând setul de antrenament va fi fragmentată în vederea construirii de clasificatori:

a)

Pe verticală

b)

Nu se fragmentează

c)

Pe orizontală

76.

O schemă fulg-de-zăpadă (Snow-flake) se obține dintr-o schemă stea când:

a)

Normalizăm tabelele de dimensiuni

b)

Normalizăm tabela de fapte

c)

. Normalizăm atât tabela de fapte cât și tabelele de dimensiuni

77.

O tabelă de tipul Periodic snapshot fact table poate conține, pe lângă cheia primară și cheile străine:

a)

Doar o singură coloană de fapte (măsuri)

b)

Mai multe coloane de fapte (măsuri)

c)

Doar date agregate (sume, medii, etc)

78.

Relația între Common Logfile Format și Combined Log File Format este :

a)

Informațiile din Common Logfile Format includ pe cele din Combined Log File Format

b)

Common Logfile Format și Combined Log File Format sunt disjuncte

c)

Informațiile din Common Logfile Format sunt incluse în Combined Log File Format

79.

Fie patru puncte in plan, A(0, 0), B(4, 0), C(4, 2), D(0, 2). In contextul evaluarii clusterelor, pentru impartirea in doua clustere: (A, D) si (B, C), suma patratelor distantelor (SSD) este:

a)

40

b)

4

c)

16

80.

Cheile surogat sunt recomandate de R. Kimball pentru:

a)

Tabelele de fapte

b)

. Tabelele de dimensiuni

c)

Tabelele de evenimente

81.

In cazul SVM, o functie kernel liniara este de tipul:

a)

K(X, Y) = Power((a * + b), p)

b)

K(X, Y) = + b

c)

tanh(a * + b)

82.

Daca din 200 cazuri de test, toate pozitive, 50 sunt clasificate gresit, Recall este egal cu:

a)

50%

b)

75%

c)

0%

83.

În cazul normalizării Min-Max, mulțimea {1, 2, 3, 6} devine:

a)

{0.0, 0.2, 0.4, 1}

b)

{0.2, 0.4, 0.6, 0.9}

c)

. {0.1, 0.2, 0.3, 0.6}

84.

Tranzacții: {(1, 2, 3, 5), (2, 4, 5), (2, 3, 4, 5)}. Încrederea regulii {5} → {2} este aproximativ:

a)

50

b)

100

c)

66

85.

In cazul in care exemplele etichetate sunt toate din clasa pozitiva, pentru construirea multimii care va fi considerata continand exemple negative cursul prezinta algoritmi ca:

a)

CO-TRAINING

b)

ASSEMBLE

c)

ROCCHIO

86.

In contextul evaluarii clusterelor, o valoare pozitiva a siluetei pentru un punct asignat unui cluster arata ca punctul a fost corect asignat?

a)

adevarat

b)

fals

87.

Daca avem punctele A si B într-un spațiu cu 4 dimensiuni și distanta între ele pentru fiecare dimensiune este cea din tabelul de mai jos, care este distanța dintre A si B obținută prin combinarea acestora

a)

3

b)

null

c)

0.75

88.

O dimensiune degenerată reprezintă:

a)

Entități ale lumii reale și nu procese de afaceri

b)

Un proces de afaceri

c)

Numere operaționale de control (număr factură, număr comanda, etc.)

89.

Algoritmii de clustering sunt de tipul:

a)

. Descriptiv

b)

Prescriptiv

c)

Predictiv

90.

Ca dată despre o persoana, genul (masculin, feminin) este un atribut de tip:

a)

Interval

b)

Binar simetric

c)

Binar asimetric

91.

Daca din 200 cazuri de test  50 sunt clasificate gresit acuratetea este egala cu:

a)

25

b)

75

c)

50

92.

O dimensiune degenerată reprezintă:

a)

Entități ale lumii reale și nu procese de afaceri

b)

Numere operaționale de control (număr factură, număr comanda, etc.)

c)

Un proces de afaceri

93.

In cazul clusteringului ierarhic se obține o:

a)

. Drendograma

b)

Dendrograma

c)

Dendograma

94.

Utilizatorii obișnuiți ai unui depozit de date lucrează cu datele din:

a)

Data Staging Area

b)

Sistemele operaționale

c)

Data Presentation Area

95.

In cazul clusteringului ierarhic, pentru a obține un set de clustere se face:

a)

O tăiere neuniformă a ierarhiei obținute

b)

O tăiere pe orizontală a ierarhiei obținute

c)

O tăiere pe verticală a ierarhiei obținute

96.

Procesul ETL (Extract-Transform-Load) este mai dificil de efectuat în cazul abordării dimensionale decât în cazul celeilalte abordări prezentate în curs?

a)

adevarat

b)

fals

97.

În contextul cursului nostru, care afirmație este corectă

a)

Depozitele de date si Data Mart-urile nu au nimic în comun

b)

Un depozit de date conține de obicei date pe mai multe subiecte pe când un Data mart conține de obicei date despre un singur subiect

c)

Un Data Mart conține de obicei date pe mai multe subiecte pe când un depozit de date conține de obicei date despre un singur subiect

98.

Tabelele de dimensiuni au ca si cheie primară:

a)

O cheie surogat (generată de sistemul de gestiune)

b)

O cheie naturală (de exemplu codul de bare pentru produse)

c)

O cheie furnizată de utilizator

99.

Fie o scoala avand 80% elevi si 20% eleve. Elevele poarta la ora de sport sort sau fusta in proportii egale iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand sort. Care este probabilitatea ca persoana respectiva sa fie o eleva? 

a)

31

b)

21

c)

11

100.

Algoritmul K-Means :

a)

Nu este potrivit pentru a găsi clustere care nu sunt hiper-elipsoizi (sau hiper-sfere) 

b)

Nu este potrivit pentru a găsi clustere care  sunt hiper-elipsoizi (sau hiper-sfere)

c)

. Este potrivit pentru a găsi clustere care nu sunt hiper-elipsoizi (sau hiper-sfere) 

101.

In cazul MCAR (MCAR = Missing Completely At Random):

a)

P (labeled=1|x, y) <> P (labeled=0|x, y)

b)

(labeled=1|x, y) = P (labeled=1)

c)

P (labeled=1| x, y) = P (labeled=1| x)

102.

Încrederea unei reguli de asociere X → Y este dată de formula:

a)

Suport (X∪Y) / Suport (X)

b)

Suport (X∪Y)

c)

Suport (X∩Y)

103.

Faptul că un depozit de date este orientat (axat) pe subiecte înseamnă că:

a)

Datele sunt organizate considerând activitățile principale ale companiei

b)

Datele sunt organizate considerând categoriile de informații stocate

c)

Datele pot fi actualizate sau șterse în funcție de subiectele conținute

104.

Faptul că un depozit de date este orientat (axat) pe subiecte înseamnă că:

a)

Datele sunt organizate considerând activitățile principale ale companiei

b)

Datele sunt organizate considerând categoriile de informații stocate

c)

Datele pot fi actualizate sau șterse în funcție de subiectele conținute

105.

Tranzacții: {(1, 2, 3, 5), (2, 4, 5), (2, 3, 4, 5)}. Încrederea regulii {5} → {2} este aproximativ:

a)

50

b)

66

c)

100

106.

Pentru recunoașterea punctelor izolate (outliers) se folosește valoarea 1,5 * IQR. In acest caz, cât ar trebui sa fie X din mulțimea {0, 1, 2, X} pentru a fi considerat punct izolat:

a)

-2.5

b)

-1.5

c)

5.5

107.

In cazul MNAR (MNAR = Missing Not At Random):

a)

P (labeled=1| x, y) = P (labeled=1| x)

b)

P (labeled=1|x, y) <> P (labeled=0|x, y)

c)

. P (labeled=1|x, y) = P (labeled=1)

108.

În cazul în care studiem secvența de coșuri de cumpărături a unui client posesor de card de loialitate folosind GSP, daca L2 (secvențe frecvente de lungime 2) conține doar secvențele si , are sens să considerăm ca și candidat de lungime 3 secvența <(AB),C>?

a)

da

b)

nu

c)

depinde de restul datelor

109.

Daca A este o mulțime frecventă și s este pragul de suport (ca procent) atunci:

a)

Fiecare tranzacție care o conține pe A este de asemenea o mulțime frecventă

b)

Fiecare mulțime care conține un articol din A este de asemenea frecventă

c)

Fiecare articol din A este în cel puțin s% tranzacții

110.

Fie în 1D doua clustere: (1 ,2) și (3, 4). Care este valoarea siluetei s(1) a punctului 1 din (1, 2):

a)

3/5

b)

2/3

c)

1/3

111.

Care afirmatie e adevarata:

a)

K-Modes se poate folosi pentru date categorice

b)

. K-Modes este un algoritm de clasificare

c)

c. K-Modes este un algoritm de regresie

112.

O cheie străină care referă o anumită dimensiune:

a)

a. Poate referi o cheie unică diferită de cheia primară

b)

b. Poate sa aibă un nume diferit de cheia primară referită

c)

c. Trebuie sa aibă nume identic cu cheia primară referită

113.

Pentru evitarea fenomenului de overfitting la arbori de decizie se poate folosi:

a)

a. Doar Post-pruning

b)

b. Doar Pre-pruning

c)

c. Atât Pre-pruning cât și post-pruning

114.

Cheile surogat sunt recomandate de R. Kimball pentru:

a)

a. Tabelele de evenimente

b)

b. Tabelele de fapte

c)

c. Tabelele de dimensiuni

115.

În cazul unei reguli de asociere X → Y, X si Y sunt:

a)

a. Mulțimi de articole

b)

b. Mulțimi de clase

c)

c. Mulțimi frecvente de articole

116.

Un atribut non-aditiv:

a)

a. Poate fi agregat pe cel puțin o dimensiune

b)

b. Nu poate fi agregat pe nici a dimensiunilor

c)

c. Poate fi agregat pe toate dimensiunile

117.

Fie punctele A, B si C si distantele intre ele d(A,B)=3, d(A,C)=5, d(B,C)=4 (numere pitagoreice). In contextul algoritmului FastMap, coordonata punctului C pe axa AB (origine in A) este:

a)

3

b)

2

c)

5

118.

Fie patru puncte in plan, A(0, 0), B(4, 0), C(4, 2), D(0, 2). In contextul evaluarii clusterelor, pentru impartirea in doua clustere: (A, D) si (B, C), suma patratelor distantelor (SSD) este:

a)

40

b)

4

c)

16

119.

Folosirea teoriei grafurilor pentru analiza structurii si conexiunilor intre noduri (pagini web) fac obiectul:

a)

a. Mineritului utilizării paginilor web (Web usage mining)

b)

b. Mineritului conținutului paginilor web (Web content mining)

c)

c. Mineritului structurii paginilor web (Web structure mining)

120.

Din principiul Apriori rezultă că dacă avem doua mulțimi frecvente A si B atunci și X este frecventă, unde:

a)

a. X = Intersecție(A, B)

b)

b. X = Reuniune(A, B)

c)

c. X = Produs_Cartezian(A, B)

121.

Efectul Hughes arata ca:

a)

a. Pentru un număr dat de exemple de antrenament, puterea predictivă crește pe măsură ce dimensionalitatea crește

b)

b. Pentru un număr dat de exemple de antrenament, puterea predictivă scade pe măsură ce dimensionalitatea scade

c)

c. Pentru un număr dat de exemple de antrenament, puterea predictivă scade pe măsură ce dimensionalitatea crește

122.

În cazul în care studiem secvența de coșuri de cumpărături a unui client posesor de card de loialitate folosind GSP, daca L2 (secvențe frecvente de lungime 2) conține doar secvențele si , are sens să considerăm ca și candidat de lungime 3 secvența ?

a)

a. Nu

b)

b. Depinde de restul datelor

c)

c. Da

123.

In Common Logfile Format, statusul "Succes" este reprezentat prin codul numeric:

a)

a. 400

b)

b. 200

c)

c. 300

124.

În contextual cursului nostru, abrevierea ETL înseamnă:

a)

a. Endorsed Tools List

b)

b. Extract, Transform, Load

c)

c. Event Trace Log

125.

În cazul algoritmilor de tip Expectation-Maximization, etapa Expectation:

a)

a. Nu utilizează estimările curente ale parametrilor și nici nu calculează noi estimări ale lor

b)

b. Calculează noi estimări ale parametrilor

c)

c. Utilizează estimările curente ale parametrilor

126.

În cazul normalizării Min-Max, mulțimea {1, 2, 3, 6} devine:

a)

a. {0.1, 0.2, 0.3, 0.6}

b)

b. {0.2, 0.4, 0.6, 0.9}

c)

c. {0.0, 0.2, 0.4, 1}

127.

O tabelă de tipul Factless Fact Tables poate conține, pe lângă cheia primara și cheile străine:

a)

a. Mai multe coloane de fapte (măsuri)

b)

b. O singură coloană de fapte (măsuri)

c)

c. Nicio coloană de fapte (măsuri).

128.

Dacă pentru datele unei rețele de magazine o linie a tabelei de fapte reprezintă un bon de cumpărături al unui client, atunci care dimensiune nu poate fi atașată schemei stea:

a)

a. Magazinul

b)

b. Produsul

c)

c. Data

129.

În cazul Discretizării utilizând împărțirea în benzi egale (“equi-width binning”) cu lățime  = 10, pentru valorile 0, 4, 12, 16, 16, 18, 24, 26, 38 obținem:

a)

a. 3 benzi

b)

b. 5 benzi

c)

c. 4 benzi

130.

Fie o scoala avand 40% elevi si 60% eleve. Elevele poarta sort sau fusta in proportii egale iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand sort. Care este probabilitatea ca persoana respectiva sa fie o eleva?

a)

63

b)

53

c)

43

131.

In cazul algoritmului Co-training (versiunea Blum and Mitchel), tabela conținând setul de antrenament va fi fragmentată în vederea construirii de clasificatori:

a)

a. Pe verticală

b)

b. Nu se fragmentează

c)

c. Pe orizontală

132.

Formula entropiei este cea cunoscuta: Entropie(D) =  -Sum [ Pr(c ) * log Pr (c )]. Daca D are 100% exemple negative entropia este:

a)

-1

b)

1

c)

0

133.

Intr-ul spatiu 1D avem 2 puncte rosii (1 si 3) si 2 puncte albastre (10 si 11). Folosind kNN pentru k = 3, punctul 7 este:

a)

a. Nu i se poate asocia o culoare

b)

b. Rosu

c)

c. Albastru

134.

Pretul total al unei linii dintr o factura este un exemplu de atribut

a)

aditiv

b)

non-aditiv

c)

semi-aditiv

135.

In cazul algoritmul Co-training (versiunea Goldman and Zhou), tabela continand setul de antrenament va fi fragmentata in vederea construirii de clasificatori

a)

pe orizontala

b)

pe verticala

c)

nu se fragmenteaza

136.

Gradele militare sunt valori de tip

a)

ordinal

b)

nominal

c)

interval

137.

Dimensiunile conforme permit integrarea in acelasi raport a unor date din

a)

mai multe tabele de dimensiuni

b)

mai multe momente de timp

c)

mai multe tabele de fapte

138.

Care afirmatie e adevarata

a)

FastMap se poate folosi inainte de K-Means

b)

FastMap se poate folosi in loc de K-Means

c)

FastMap se poate folosi dupa K-Means

139.

Pretul unitar al unui articol dintr-o factura este un exemplu de atribut

a)

aditiv

b)

semi-aditiv

c)

non-aditiv

140.

in cazul Random Forest, numarul de atribute luate in calcul la fiecare ramificare este:

a)

mai mic decat numarul de atribute ale multimii de antrenare

b)

egal cu numarul de atribute ale multimii de antrenare

c)

mai mare decat numarul de atribute ale multimii de antrenare

141.

in cazul MAR (MAR = Missing at Random)

a)

P (labeled = 1| x, y) = P (labeled = 1| x)

b)

P (labeled = 1| x, y) = P (labeled = 1)

c)

P (labeled = 1| x, y) <> P (labeled = 0| x, y)

142.

Relatia dintre Data Staging Area si Data Presentation Area este:

a)

Datele provenind din Data Presentation Area sunt incarcate in Data Staging Area

b)

Datele provenind din Data Staging Area sunt incarcate in Data Presentation Area

c)

Intre cele doua zone sunt plasate uneltele de prelucrare (Data Access Tools)

143.

Care este valoarea de adevar a afirmatiei: "un punct intr-o zona libera (eng: hole) spune ca o anumita combinatie de valori de atribute e foarte posibila"

a)

adevarat

b)

false

144.

O schema stea are in centru:

a)

o tabela de dimensiune

b)

fie o tabela de fapte fie una de dimensiune

c)

o tabela de fapte (masuri)

145.

Varianta (eng. Variance) multimii {0,1,2,3,4} este:

a)

10

b)

2

c)

intre 3 si 4

146.

a)

3

b)

null

c)

4

147.

Termenul Bagging vine de la

a)

Baggels proofreading

b)

Bootstrap Agging

c)

Bootstrap Aggregating

148.

Care afirmatie este adevarata

a)

Tabelele de fapte si cele de dimensiuni contin cate o cheie straina pentru fiecare tabela de celalalt tip de care sunt legate intr-o schema stea

b)

o tabela de dimensiune contine cate o cheie straina pentru fiecare tabela de fapte de care este legata intr-o schema stea

c)

o tabela de fapte contine cate o cheie straina pentru fiecare dimensiune de care este legata intr-o schema stea