wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

mm33ffkk

Total questions: 206

Worksheet time: 2hrs 44mins

Name
Class
Date
1.

Nu este data mining:

a)

Calcularea unor date sumare (min, max)

b)

Cautarea unei persoane intr-o baza de date

c)

Ambele variante sunt adev

2.

In cazul algoritmilor de tip Expectation-Maximization, etapa Expectation:

a)

Calculeaza noi estimari ale parametrilor

b)

Nu utilizeaza estimarile curente ale parametrilor si nici nu calculeaza noi estimari ale lor

c)

Utilizeaza estimarile curente ale parametrilor

3.

In cazul algoritmului Co-training (Versiunea Goldman and Zhou), tabela continand setul de antrenament va fi fragmentata in vederea construirii de clasificatori:

a)

Pe orizontala

b)

Pe verticala

c)

Nu se fragmenteaza

4.

Dimensiunile conforme permit integrarea in acelasi raport a unor date din:

a)

Mai multe tabele de dimensiuni

b)

Mai multe momente de timp

c)

Mai multe tabele de fapte

5.

In lucrarile sale, Ralph Kimball a sustinut o stocare a datelor intr-un depozit de date folosind o abordare:

a)

Dimensionala

b)

Normalizata

c)

Normata

6.

Care afirmatie este adevarata

a)

K-modes est eun algoritm de clasificare

b)

K-modes se poate folosi pentr date categorice

c)

K-modes est eun algoritm de regresie

7.

In cazul in care studiem secventa de cosuri de cumparaturi a unui client posesor de card de loialitate folosind GSP, deca L2(secevente de lungime 2) contine doar secvente <A, B> si <A, C>, are sens sa consideram ca si candidat de lungime 3 secventa <A, (BC)> >

a)

Depinde de restul datelor

b)

Nu

c)

Da

8.

O tabela de tipul periodic snapshot fact table poate contine, pe langa cheia primara si cheile straine:

a)

Mai multe coloane de fapte (masuri)

b)

Doar date agregate (sume, medii, etc )

c)

Doar o singura coloana de fapte (masuri)

9.

Data reduction is perform at:

a)

Data collection

b)

Pattern extraction and discovery

c)

Data preprocessing

10.

Association rule discovery is of type:

a)

Description

b)

Prediction

c)

Prescription

11.

Regression is of type:

a)

Description

b)

Prediction

c)

Prescription

12.

From the A priori principle it results that if we have two frequent itemsets A and B then also X

is frequent, where:

a)

a.X = INTERSECT(A, B)

b)

b.X = UNION(A, B)

c)

c.X = CARTESIAN_PRODUCT(A, B)

13.

Entropy(D) = -Sum j[ Pr(cj) * log2 Pr (cj)]. If D contains 100% negative examples the entropy

of D is:

a)

-1

b)

1

c)

0

14.

Vizualizarea, asa cum a fost prezentata in curs:

a)

Este o etapa in procesul DM

b)

Este o etapa dupa procesul DM

c)

Este o etapa inainte de procesul de DM

15.

Algoritmii de clasificare sunt de tip:

a)

Predictiv

b)

Descriptiv

c)

Prescriptiv

16.

Algoritmii de clustering sunt de tip:

a)

Predictiv

b)

Descriptiv

c)

Prescriptiv

17.

Algoritmii de gasire a regulilor de asociere sunt de tip

a)

Predictiv

b)

Descriptiv

c)

Prescriptiv

18.

Entropy(D) = -Sum j[ Pr(cj) * log2 Pr (cj)]. If D has 50% positive and 50% negative examples

the entropy of D is:

a)

1

b)

-1

c)

0

19.

KNN:

a)

a.It's just a classification method that does not produce a classifier

b)

b.Produces a classifier then used in classification

20.

In our course ID3 stands for:

a)
Iterative Dichotomiser 3
b)

a. Tag Embedded In MPEG I Layer III Files

c)

c. International Direct Distance Dialing

21.

Gradele militare (ordinea maratoanelor) sunt valori de tip:

a)

Nominal

b)

Ordinal

c)

Interval

22.

Eye color has values of type:

a)

Categorical

b)

Nominal

c)

Both a and b are true

23.

Entropy(D) = -Sum j[ Pr(cj) * log2 Pr (cj)]. If D contains in equal proportions examples from 4

different classes, the entropy of D is:

a)

0

b)

2

c)

-2

24.

A decision tree can be converted in:

a)

a. A set of rules

b)

b. A single complex rule

c)

c. Both a and b are false

25.

In ensemble methods:

a)

a. These methods are not used in classification

b)

b. A classifier is divided into several components

c)

c. Multiple classifiers are aggregated into one

26.

Sequential covering is used for:

a)

a.Obtaining rules

b)

b.Building decision trees

c)

c.Clustering

27.

In the case of Sequential covering rules are obtained:

a)

a. One at a time

b)

b. All the rules in a single step

c)

c. The other two answers are wrong

28.

Ca data despre o persoana, genul (masculin, feminin) este un atribut de tip:

a)

Interval

b)

Binar asimetric

c)

Binar simetric

29.

Sumarul de 5 numere (five number summary) contine preintre altele:

a)

Media si mediana

b)

Cuartile si cvintilele

c)

Minimul si maximul

30.

Finding ordered rules means:

a)

a.Finding rules by first determining the class and then the associated condition

b)

b.Finding rules by first determining the conditions and then the class

31.

If for another "Play Tennis" type table Entropy (D) = 0.8, Entropy (D, Attribute1) = 0.4,

gain-ratio(D, Attribute1) is:

a)

.0.3

b)

0.6

c)

1

32.

If for another “Play Tennis” type table Entropy (D) = 0.8, Entropy(D,Attribute1) = 0.5,

gain-ratio(D, Attribute1) is:

a)

0.3

b)

1

c)

0.6

33.

If for another "Play Tennis" type table Entropy (D, Attribute1) = 0.8 and Entropy (D, Attribute2)

= 0.7, which of the two attributes will be used for branching?

a)

a.Attribute2

b)

b.Attribute1

34.

When adding new attributes to a training set using CARs, these attributes are always:

a)

a.Boolean

b)

b.Numerical

c)

c.Binary

35.

In the case of class association rules (CAR), using them for classification using the strongest

rule may means:

a)

a.Using the rule with the greatest support and / or confidence

b)

b.Using the rule with the strongest class on the right

c)

c.Using the rule with most items on the left

36.

In the case of class association rules (CAR), the input for building a classifier using a

subset of rules is:

a)

a. Only a set of CARs R

b)

b. Only the measure of the strength for each rule

c)

c. A training dataset D and a set of CARs R

37.

As entropy decreases so does:

a)

a. Disorder

b)

order

38.

Finding unordered rules means:

a)

a. Finding rules by first determining the conditions and then the class

b)

b. Finding rules by first determining the class and then the associated condition

39.

The algorithms based on Bayes theorem compute for each test example:

a)

a. Not a single class but a probability of each class in C

b)

b. Not a single class but a membership level for each class in C

c)

c. A single class

40.

In the case of SVM the margin is:

a)

The minimum orthogonal distance between a positive and negative point from the

validation set

b)

The minimum orthogonal distance between a positive and negative point from the training

set

c)

The minimum orthogonal distance between a positive and negative point from the test set

41.

With the points {1, 2, 3, 4, 5, 6} in 1D, if we apply K-Means for K = 3 and initial centroid 1, 2

and 3 we obtain the clusters:

a)

(1), (2, 3), (4, 5, 6)

b)

(1), (2, 3, 4), (5, 6)

c)

(1, 2), (3, 4), (5, 6)

42.

In the case of hierarchical clustering, to obtain a set of clusters, the following is done:

a)

a. A horizontal cut of the obtained hierarchy

b)

b. An uneven cut of the obtained hierarchy

c)

c. A vertical cut of the obtained hierarchy

43.

For two clusters in 1D: (1, 2) and (3, 4), what is the value of the silhouette s(1) of point 1 of

(1, 2):

a)

3/5

b)

1/3

c)

2/3

44.

Fuzzy C-Means is an algorithm of type:

a)

a. Close clustering

b)

b. Hard clustering

c)

c. Soft clustering

45.

In the context of the k-Modes algorithm, a mode value for the vectors {[1, 2], [1, 3], [3, 2], [2,

3]} is:

a)

[3, 2]

b)

[1, 2]

c)

[2 , 1]

46.

Let be in 1D two clusters: (1, 2) and (3, 4). Using the point silhouette, the measure of the

performance of the clustering process - the average of the silhouettes, is:

a)

Greater than 0.5

b)

Between 0.4 and 0.5

c)

Between 0 and 0.4

47.

In the case of SVM a classifier is:

a)

a. A hyperplane

b)

b. A line

c)

c. A curve

48.

Varianta (Variance) este:

a)

Patratul lui sigma mic

b)

Radical din sigma mic

c)

Altceva

49.

Varianta multimii (0, 1, 2, 3, 4) este:

a)

2

b)

10

c)

Intre 3 si 4

50.

Deviatia standard a multimii (1, 1, 1, 1, 1) este (deviatia = radical din varianta):

a)

1

b)

Intre 1 si 2

c)

0

51.

Binning methods for Data Smoothing: daca avem o cutie (“bin”) continand 4, 8, 9, 15 prin

netezirea folosind capetele intervalului (“using bin boundaries”) obtinem:

a)

9, 9, 9, 9

b)

4, 4, 15, 15

c)

4, 4, 4, 15

52.

In cazul Discretizarii utilizand impartirea in benzi egale (“equi-width binning”) cu latime =

10 printre valorile 0, 4, 12, 16, 16, 18, 24, 26, 38 obtinem:

a)

3 benzi

b)

4 benzi

c)

5 benzi

53.

Pentru recunoasterea punctelor izolate (outliers) se foloseste valoarea 1.5 * IQR. In

acest caz, cat ar trebui sa fie X din multimea {0, 1, 2, X} pentru a fi considerat punct

izolat:

a)

5.5

b)

-2.5

c)

-1.5

54.

Detecting outliers using 1,5 * IQR, X is outlier if the value of X in {1, 2, 3, X} is (cap.

Dispersion):

a)

5

b)

-2.5

c)

5.9

55.

In cazul normalizarii Min-Max, multimea {1, 2, 3, 6} devine:

a)

{0.2, 0.4, 0.6, 0.9}

b)

{0.1, 0.2, 0.3, 0.6}

c)

{0.0, 0.2, 0.4, 1}

56.

In cazul normalizarii de tip Decimal Scaling, multimea {1, 2, 3, 6} devine:

a)

{0.2, 0.4, 0.6, 0.9}

b)

{0.1, 0.2, 0.3, 0.6}

c)

{0.0, 0.2, 0.4, 1}

57.

In cazul gasirii multimelor frecvente in datele de vanzari ale unui supermarket, reducerea

dimensionalitatii {Dimensionality reduction} trebuie sa pastreze:

a)

Pretul

b)

Produsul

c)

furnizorul

58.

Daca A este o multime frecventa si s este pragul de suport atunci:

a)

Fiecare articol din A este in cel putin s% tranzactii

b)

A ca multime este in cel putin s% tranzactii

c)

Fiecare tranzactie care o contine pe A este de asemenea o multime frecventa

d)

Fiecare multime care contine un articol din A este de asemenea frecventa

59.

Tranzactii {(1, 2, 3, 5), (2, 3, 4), (3, 4, 5)}, s = 50%. Atunci numarul de perechi frecvente

este:

a)

1

b)

2

c)

3

60.

Tranzactii {(1, 2, 3), (2, 3, 4), (3, 4, 5)}, s = 50%. Atunci numarul de articole frecvente

este:

a)

3

b)

4

c)

5

61.

Tranzactii {(1, 2, 3, 5), (2, 3, 5), (1, 4, 6)}, s = 50%. Atunci articolele frecvente sunt:

a)

{1, 2, 3, 5}

b)

{2, 3, 5}

c)

{1, 2, 3, 5, 6}

62.

Tranzactii {(1, 2, 3, 5), (2, 3, 5, 6), (1, 4, 6)}, s = 50%. Atunci articolele frecvente sunt:

a)

{1, 2, 3, 5}

b)

{2, 3, 5}

c)

{1, 2, 3, 5, 6}

63.

Tranzactii: {(1, 2, 3, 5), (2, 3, 4, 5), (3, 4, 5)} Suportul regulii {5} -> {1} este

a)

100%

b)

33%

c)

66%

64.

Tranzactii: {(1, 2, 3, 5), (2, 3, 4, 5), (3, 4, 5)} Suportul regulii {3} -> {5} este

a)

100%

b)

33%

c)

66%

65.

Tranzactii: {(1, 2, 3, 5), (2, 3, 4, 5), (3, 4, 5)} Suportul regulii {3} -> {4} este

a)

100%

b)

33%

c)

66%

66.

Tranzactii: {(1, 2, 3, 5), (2, 4, 5), (2, 3, 4, 5)} Increderea regulii {5} -> {2} este

a)

100%

b)

20%

c)

66%

67.

Tranzactii: {(1, 2, 3, 5), (2, 4, 5), (2, 3, 4, 5)} Increderea regulii {3} -> {1} este

a)

33%

b)

50%

c)

66%

68.

Tranzactii: {(1, 2, 3, 5), (2, 4, 5), (2, 3, 4, 5)} Increderea regulii {5} -> {3} este

a)

100%

b)

66%

c)

20%

69.

Tranzactii: { (1, 2, 3, 5), (2, 4, 5), (3, 4, 5) } ; s = 50%. Increderea regulii {5} --> {3} este:

a)

100%

b)

66%

c)

20%

70.

Cand etichetele de clasa pentru date nu sunt cunoscute avem

a)

Reguli de asociere

b)

Invatare supervizata

c)

Invatare nesupervizata

71.

Cand datele (observatii, masuratori etc.) sunt etichetate cu clase predefinite avem:

a)

Reguli de asociere

b)

Invatare supervizata

c)

Invatare nesupervizata

72.

Increderea unei reguli de asociere X -> Y este data de formula:

a)

Suport(X U Y)/ Suport(X)

b)

remember

73.

Suportul unei reguli de asociere X -> Y este data de formula:

a)

Suport(X U Y)

b)

remember

74.

Daca din 200 de cazuri de test 50 sunt clasificate gresit acuratetea este egala cu:

a)

25%

b)

50%

c)

75%

75.

Daca din 200 de cazuri de test 50 sunt clasificate gresit rata de eroare este egala cu:

a)

25%

b)

50%

c)

75%

76.

Daca din 200 de cazuri de test, toate pozitive, 50 sunt clasificate gresit, precizia este

egala cu:

a)

25%

b)

100%

c)

75%

77.

Daca din 200 de cazuri de test, toate pozitive, 50 sunt clasificate gresit Recall este egal

cu:

a)

0%

b)

50%

c)

75%

78.

Daca din 200 de cazuri de test, toate pozitive, 50 sunt clasificate gresit, scorul F1 este

egal cu:

a)

85%

b)

55%

c)

25%

79.

Cand lucram doar cu exemple pozitive sau negative si avem un clasificator care

eticheteaza corect 50% din toate exemplele, pentru un set de 100 pozitive si 200

negative, precizia P va fi de:

a)

33%

b)

50%

c)

75%

80.

Cand lucram doar cu exemple pozitive sau negative si avem un clasificator care

eticheteaza corect 50% din toate exemplele, pentru un set de 100 pozitive si 200

negative, R (recall) este:

a)

33%

b)

50%

c)

40%

81.

Cand lucram doar cu exemple pozitive sau negative si avem un clasificator care

eticheteaza corect 50% din toate exemplele, pentru un set de 100 pozitive si 200

negative, F1 este:

a)

66%

b)

50%

c)

40%

82.

Fie o scoala avand 50% elevi si 50 % eleve. Elevele poarta sort sau fusta in proportii

egale, iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand

sort. Care este cu aproximatie probabilitatea ca persoana respectiva sa fie eleva ?

a)

33%

b)

66%

c)

50%

83.

Fie o scoala avand 40% elevi si 60 % eleve. Elevele poarta sort sau fusta in proportii

egale, iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand

sort. Care este cu aproximatie probabilitatea ca persoana respectiva sa fie eleva ?

a)

43%

b)

63%

c)

53%

84.

Fie o scoala avand 80% elevi si 20 % eleve. Elevele poarta sort sau fusta in proportii

egale, iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand

sort. Care este cu aproximatie probabilitatea ca persoana respectiva sa fie eleva ?

a)

11%

b)

21%

c)

31%

85.

In a school 60% of the student are boys and 40% are girls, Girls wear shorts and skirts

in equal proportions, boys only shorts. A distant observer sees a person wearing shorts.

What is the probability that the person is a boy ?

a)

80%

b)

75%

c)

40%

86.

In cazul SVM, algoritmii de acest tip:

a)

Pot fi folositi pentru nr. clase < 2

b)

Pot fi folositi pentru nr. clase > 2

c)

Ambele afirmatii sunt false (sunt fix 2)

87.

In the case of SVM the algorithm tries to the hyperplane that:

a)

Minimize the margin

b)

Maximize the margin

c)

Both a and b are false

88.

In cazul SVM/separare non-lineara asa numitul “feature space” are de obicei:

a)

Mai putine dimensiuni

b)

Acelasi numar de dimensiuni

c)

Mai multe dimensiuni

89.

In cazul SVM, o functie de kernel liniara este de tipul:

a)

K(X, Y) = <X*Y> + b

b)

K(X, Y) = Power((a*<X*Y>) + b), p)

c)

K(X, Y) = tanh(a*<X*Y> + b)

90.

In cazul SVM, o functie de kernel este de tipul:

a)

K(Xi, Yi) = fi(Xi) * fi(Xj)

b)

K(Xi, Yi) = fi(Xi) / fi(Xj)

c)

K(Xi, Yi) = fi(Xi) + fi(Xj)

91.

Algoritmul K-Means nu este potrivit pentru a gasi clustere care:

a)

Nu sunt hiper-elipsoizi (sau hiper-sfere)

b)

Sunt hiper-elipsoizi (sau hiper-sfere)

c)

Atat a cat si b sunt false

92.

Rezultatul algoritmul K-Means nu este influentat de:

a)

Centroizii initiali influenteaza rezultatele

b)

Centroizii initiali

c)

Punctele disparate (valori aberante, outliners)

93.

Rezultatul algoritmului K-Means sunt influentate de:

a)

Puncte disparate (Outliers)

b)

Centroizii intiali

c)

Atat a cat si b sunt adevarate

94.

Distanta 1D intre (1, 2, 3) si (4, 5, 6) utilizand metoda “single link” este:

a)

1

b)

3

c)

5

95.

Distanta 1D intre (1, 2, 3) si (4, 5, 6) utilizand metoda “complete link” este:

a)

1

b)

3

c)

5

96.

Distanta 1D intre (1, 2, 6) si (1, 5, 6) utilizand metoda centroizilor este:

a)

1

b)

3

c)

5

97.

Distanta 1D intre (1, 2, 3) si (4, 5, 6) utilizand metoda centroizilor este:

a)

1

b)

3

c)

5

98.

Fie punctele {1, 2, 5, 6}. Daca aplicam K-Means pentru k=2 si centroizii initiali 1 si 2

obtinem clustere

a)

(1, 2) si (5, 6)

b)

(1, 5) si (2, 6)

c)

(1) si (2, 5, 6)

99.

Fie vocabularul {eu, nu, sunt, acasa}. Distanta cosinus intre ‘eu sunt’ si ‘sunt acasa’ este

a)

b)

½

c)

1

100.

Fie vocabularul {eu, nu, sunt, acasa}. Distanta cosinus intre ‘eu sunt acasa’ si ‘nu sunt

acasa’ este

a)

b)

½

c)

1

101.

Care afirmatie este adevarata

a)

K-Modes se poate folosi pentru date categorice

b)

K-Modes este un algoritm de clasificare

c)

A si B sunt false

102.

In contextul algoritmului k-Modes, o valoare modala pentru vectorii {[1, 2], [1, 3], [3, 2],

[2, 3]} este:

a)

[1, 2]

b)

[3, 2]

c)

[2, 1]

d)

[1, 3]

103.

Care afirmatie este adevarata?

a)

FastMap se poate folosi dupa K-means

b)

FastMap se poate folosi in loc de K-Means

c)

FastMap se poate folosi inainte de K-Means

104.

Care afirmatie este adevarata:

a)

k-Means++ se poate folosi in loc de k-Means

b)

k-Means++ se poate folosi dupa de k-Means

c)

k-Means++ se poate folosi inainte de k-Means

105.

From Apriori principle, if the sets A and B are frequent itemsets, then also X is frequent

itemset, with:

a)

X = A intersectat B

b)

X = A reunit cu B

c)

X = A x B

106.

Having 10.000 transactions with 10 items each and s = 10.000, then the number of

frequent items is at most:

a)

1

b)

10

c)

100

107.

The median value of {1, 3, 5, 7, 1001, 2002, 9999} is:

a)

7

b)

5000

c)

Other value

108.

{1, 3, 5, 7, 1001, 2002, 9999} is

a)

Unimodal

b)

Bimodal

c)

Without modal value

109.

For 4 points in 1D {1, 2, 5, 6}, using K-Means with k=2 and initial centroids 1 and 6 the

result is

a)

(1, 2) and (5, 6)

b)

(1, 5) and (2, 6)

c)

(1) and (2, 5, 6)

110.

A decision tree can be converted in:

a)

A set of rules

b)

A single complex rule

c)

Un set de multimi frecvente

111.

Entropy (D) If D contains 100% positive examples the

entropy of D is:

a)

1

b)

0

c)

-1

112.

In teoria informatiei pe masura ce datele dintr-un set de date devin mai pure valoarea

entropiei

a)

devine mai mica

b)

devine mai mare

c)

uneori creste alteori scade

113.

Daca D are 50% exemple pozitive si 50% exemple negative atunci entropia este:

a)

1

b)

0

c)

-1

114.

When building a decision tree using C4.5, branching is made using the attribute that:

a)

Minimize the information gain

b)

Minimize the entropy

c)

Both a and b are true

115.

Sequential covering is used for

a)

Building decision trees

b)

Obtaining rules

c)

Clustering

116.

If P(A) = 0.8%, P(B) = 40% and P(B|A) = 10% (nu se intelege procentu) then P(A|B) is

a)

20%

b)

2%

c)

0.2%

117.

Hierarchical clustering produces a sequence of embadded clusters called:

a)

Dendogram

b)

Dendrogram

c)

Dondegram

118.

(A, BC) este o subsecventa pentru:

a)

(B, AB, AC, BCD)

b)

(ABC)

c)

(A, B, C)

119.

In cazul clusteringului ierarhic se obtine o:

a)

dendrograma

b)

remember

120.

Fuzzy C-Means type is:

a)

Hard Clustering

b)

Soft Clustering

c)

Mixed Clustering

121.

KNN algorithm is for:

a)

Clustering

b)

Regression

c)

Classification

122.

Pentru evitarea fenomenului de overfitting in clasificare putem folosi:

a)

Doar Pre-pruning

b)

Doar Post-pruning

c)

Atat a cat si b sunt adevarate

123.

Invatarea PU ("PU learning") vine de la:

a)

Positive and uncertain examples

b)

Positive and unlabeled examples

c)

Positive and unpositive examples

124.

Cand integram doua scheme trebuie ca mai inainte sa efectuam operatii ca:

a)

Implosion si Stemming

b)

Tokenization si Boosting

c)

Stemming si Expansion

125.

Sesionizarea inseamna:

a)

Impunerea unor sesiuni

b)

Identificarea userilor

c)

Identificarea sesiunilor

126.

Alegeti:

a)

a. Un Data warehouse contine Data marts

b)

b. b. Un Data mart contine Data Warehouse

c)

c. c. Atat a cat si b sunt false

127.

Alegeti:

a)

O tabela de fapte (Facts) poate fi asociata cu mai multe dimensiuni

b)

O tabela de dimensiuni poate fi asociata cu mai multe tabele de fapte

c)

Atat a cat si b sunt adevarate

128.

Alegeti:

a)

Putem obtine schema fulg-de-nea ("snow-flake") din schema star prin

denormalizare

b)

Putem obtine schema star din fulg-de-nea prin denormalizare

c)

Atat a cat si b sunt adevarate

129.

Declararea granulei ("grain") inseamna a specifica:

a)

Ce reprezinta o coloana din tabela de fapte

b)

Ce reprezinta o linie din tabela de fapte

c)

Atat a cat si b sunt false

130.

Abordari in Data Warehousing sunt:

a)

Abordarea dimensionala

b)

Abordarea relationala

c)

Atat a cat si b sunt adevarate

131.

A nearest neighbor approach is best used

a)

with large-sized datasets.

b)

when irrelevant attributes have been removed from the data.

c)

when a generalized model of the data is desireable

d)

when an explanation of what has been found is of primary importance

132.

Which statement about outliers is true?

a)

Outliers should be identified and removed from a dataset

b)

Outliers should be part of the training dataset but should not be present in the test

data.

c)

Outliers should be part of the test dataset but should not be present in the training

data.

d)

The nature of the problem determines how outliers are used.

e)

More than one of a,b,c or d is true.

133.

Assume that we have a dataset containing information about 200 individuals. One

hundred of these individuals have purchased life insurance. A supervised data mining

session has discovered the following rule:

IF age < 30 & credit card insurance = yes

THEN life insurance = yes

Rule Accuracy: 70%

Rule Coverage: 63%

How many individuals in the class life insurance= no have credit card insurance and are

less than 30 years old?

a)

63

b)

70

c)

30

d)

27

134.

Unlike traditional production rules, association rules

a)

allow the same variable to be an input attribute in one rule and an output attribute in

another rule.

b)

allow more than one input attribute in a single rule.

c)

require input attributes to take on numeric values

d)

require each rule to have exactly one categorical output attribute

135.

Which of the following is a common use of unsupervised clustering?

a)

a. detect outliers

b)

b. determine a best set of input attributes for supervised learning

c)

c. evaluate the likely performance of a supervised learner model

d)

d. determine if meaningful relationships can be found in a dataset

e)

e. All of a,b,c, and d are common uses of unsupervised clustering.

136.

The average positive difference between computed and desired outcome values

a)

root mean squared error

b)

mean squared error

c)

mean absolute error

d)

mean positive error

137.

Given a rule of the form IF X THEN Y, rule confidence is defined as the conditional

probability that

a)

a. Y is true when X is known to be true.

b)

b. X is true when Y is known to be true.

c)

c. Y is false when X is known to be false.

d)

d. X is false when Y is known to be false.

138.

Association rule support is defined as

a)

a. the percentage of instances that contain the antecendent conditional items listed in

the association rule.

b)

b. the percentage of instances that contain the consequent conditions listed in the

association rule.

c)

c. the percentage of instances that contain all items listed in the association rule.

d)

d. the percentage of instances in the database that contain at least one of the

antecendent conditional items listed in the association rule.

139.

Which statement is true about the K-Means algorithm?

a)

a. All attribute values must be categorical.

b)

b. The output attribute must be categorical.

c)

c. Attribute values may be either categorical or numeric.

d)

d. All attributes must be numeric.

140.

The K-Means algorithm terminates when

a)

a. a user-defined minimum value for the summation of squared error differences

between instances and their corresponding cluster center is seen.

b)

b. the cluster centers for the current iteration are identical to the cluster centers for the

previous iteration.

c)

c. the number of instances in each cluster for the current iteration is identical to the

number of instances in each cluster of the previous iteration.

d)

d. the number of clusters formed for the current iteration is identical to the number of

clusters formed in the previous iteration.

141.

A dataset of 1000 instances contains one attribute specifying the color of an object.

Suppose that 800 of the instances contain the value red for the color attribute. The

remaining 200 instances hold green as the value of the color attribute. What is the

domain predictability score for color = green?

a)

a. 0.80

b)

b. 0.20

c)

c. 0.60

d)

d. 0.40

142.

A common method used by some data mining techniques to deal with missing data

items during the learning process

a)

replace missing real-valued data items with class means

b)

discard records with missing data

c)

replace missing attribute values with the values found within other similar instances

d)

ignore missing attribute values

143.

This data transformation technique works well when minimum and maximum values

for a real-valued attribute are known.

a)

a. min-max normalization

b)

b. decimal scaling

c)

c. z-score normalization

d)

d. logarithmic normalization

144.

This technique uses mean and standard deviation scores to transform real-valued

attributes.

a)

a. decimal scaling

b)

b. min-max normalization

c)

c. z-score normalization

d)

d. logarithmic normalization

145.

A data normalization technique for real-valued attributes that divides each numerical

value by the same power of 10

a)

a. min-max normalization

b)

b. z-score normalization

c)

c. decimal scaling

d)

d. decimal smoothing

146.

A decision tree is built to determine individuals likely to default on an unsecured loan.

The null hypothesis states that an individual will not default on the loan. The decision

tree correctly classifies 80% of the instances in a test dataset. Fifteen percent of the

mistakes made by the model are type 1 errors. What can be said about the performance

of the model?

a)

a. The accuracy of the model for correctly determining those individuals who did not

default on their loan was at least 75%.

b)

b. The accuracy of the model for correctly determining those individuals who defaulted

on their loan was at least 75%.

c)

c. The majority of errors made by the model accepted individuals who defaulted.

d)

d. The majority of errors made by the model rejected individuals who did not default.

e)

e. More than one of a,b,c or d is correct.

147.

In cazul regulilor de asociere de clasa (CAR), folosirea lor pentru clasificarea folosind

cea mai puternica regula poate insemna:

a)

a. Folosirea regulii cu cele mai multe articole in partea stanga

b)

b. Folosirea regulii avand cea mai puternica clasa in partea dreapta

c)

c. Folosirea regulii cu cel mai mare suport si/sau incredere

148.

In cazul Random Forest, numarul de atribute luate in calcul la fiecare ramificatie este

a)

a. Mai mare decat numarul de atribute ale multimii de antrenare

b)

b. Egal cu numarul de atribute ale multimii de antrenare

c)

c. Mai mic de cat numarul de atribute ale multimii de antrenare

149.

Intr-un spatiu 1D avem 2 puncte rosii (1 si 3) si 2 puncte albastre (10 si 11). Folosind

kNN pentru k=3, punctul 7.5 este albastru?

a)

a. Adevarat

b)

b. Fals

150.

O functie de distanta trebuie sa indeplineasca si conditia:

a)

a. f(x, y) <= f(x,z) + f(z,y)

b)

b. f(x, y) >= f(x,z) + f(z,y)

c)

c. f(x, y) <> f(x,z) + f(z,y)

151.

In contextul evaluarii clusterelor, o valoarea pozitiva a siluetei pentru un punct

asignat unui cluster arata ca punctul a fost corect asignat?

a)

a. Adevarat

b)

b. Fals

152.

Fie punctele A, B si C si distantele intre ele d(A, B)=3, d(A, C)=5, d(B, C)=4 (numere

pitagorice). In contextul algoritmului FastMap, coordonata punctului C pe axa AB(origine

in A) este:

a)

3

b)

2

c)

5

153.

Care este valoarea de adevar a afirmatiei: “un punct intr-o zona libera (hole) spune

ca o anumita combinatie de valori de atribute e foarte posibila”:

a)

Adevarat

b)

Fals

154.

127. Care afirmatie e adevarata:

a)

a. PAM e de tip K-Medoids

b)

b. K-Medoids e de tip PAM

c)

c. PAM si k-Medoids nu sunt din aceasi familie de algoritmi

155.

Fie 4 puncte in plan A(0, 0), B(4, 0), C(4, 2), D(0, 2). In contextul evaluarii clusterelor,

pentru impartirea in 2 clustere (A, D) si (B, C) , suma patratelor distantelor(SSD) este:

a)

40

b)

16

c)

4

156.

129. Cheile surogat sunt recomandate de R. Kimball pentru:Tabelele de evenimente

a)

Tabelele de evenimente

b)

b. Tabelele de dimensiuni

c)

c. Tabelele de fapte

157.

Dimensiunile conforme se referă la dimensiuni care

a)

a. Sunt conectate între ele prin chei străine

b)

b. Sunt conectate la scheme stea diferite

c)

c. Sunt conectate la aceeași schemă stea

158.

132. O cheie străină care referă o anumită dimensiune:

a)

a. Trebuie sa aibă nume identic cu cheia primară referită

b)

b. Poate sa aibă un nume diferit de cheia primară referită

c)

c. Poate referi o cheie unică diferită de cheia primară

159.

O tabelă de tipul Aggregated Fact Tables poate conține, pe lângă cheia primara și

cheile străine:

a)

a. Mai multe coloane de fapte (măsuri)

b)

b. Doar date sumarizate (sume, medii, etc)

c)

c. O singură coloană de fapte (măsuri)

160.

134. O cheie surogata este de obicei:

a)

a. Un numar

b)

b. Un sir de caractere

c)

c. O data calendaristica

161.

O tabelă de tipul Factless Fact Tables poate conține, pe lângă cheia primara și cheile

străine:

a)

a. Nicio coloană de fapte (măsuri).

b)

b. Mai multe coloane de fapte (măsuri)

c)

c. O singură coloană de fapte (măsuri)

162.

Se poate folosi o cheie surogat pentru o tabelă de fapte dacă:

a)

a. Există linii identice

b)

b. Există dimensiuni identice

c)

c. Există coloane identice

163.

Faptul ca intr-un depozit de date datele sunt dependente de timp (time-variant)

inseamna ca:

a)

a. Datele din depozit nu pot fi modificate

b)

b. Analiza depozitului de date ia in calcul modificarile realizate in timp

c)

c. Datele din depozit sunt actualizate periodic

164.

In lucrarile sale, Ralph Kimball a sustinut o stocare a datelor intr un depozit de date

folosind o abordare:

a)

Normata

b)

Dimensionala

c)

Normalizata

165.

139. Faptul ca intr un depozit de date, datele sunt integrate inseamna ca:

a)

a. Sistemele operationale importa date din depozitul de date

b)

Depozitelele de date creeaza consecventa intre diverse tipuri de date si surse

diferite

c)

Datele din depozit sunt stocate impreuna cu datelee sistemelor operationale;

166.

140. Relatia dintre Data Staging Area si Data Presentation Area este:

a)

Datele provenite din Data Presentation Area sunt incarcate direct in Data Staging

Area

b)

Datele provenite din Data Staging Area sunt incarcate direct in Data Presentation

Area

c)

Intre cele doua zone sunt plasate uneltele de prelucrare (Data Access…)

167.

Faptul ca un depozit de date este orientat (axat) pe subiecte inseamna ca:

a)

Datele sunt organizate considerand activitatile principale ale companiei

b)

Datele sunt organizate considerand categoriile de informatii stocate

c)

Datele pot fi actualizate sau sterse in functie de subiectele continute

168.

142. In contextul cursului, care afirmatie este adevarata:

a)

Un depozit de date contine de obicei date pe mai multe subiecte pe cand un Data

Mart contine de obicei date despre un singur subiect

b)

Depozitele de date si Data Mart-urile nu au nimic in comun

c)

Un Data Mart contine de obicei date pe mai multe subiecte pe cand un depozit

de date contine de obicei date despre un singur subiect

169.

143. Care afirmatie e corecta

a)

a. Un depozit de date poate contine mai multe Data Marts

b)

b. Celelalte doua afirmatii sunt ambele false

c)

c. Un Data Mart poate contine mai multe depozite de date

170.

In lucrarile sale W.H.Inmon a sustinut o stocare a datelor intr-un depozit de date

folosind o abordare:

a)

a. Dimensionala

b)

b. Denormalizata

c)

c. Normalizata

171.

Faptul ca datele dintr-un depozit de date sunt non-volatile inseamna ca:

a)

a. Datele pot fi actualizate (Update) dar nu mai pot fi sterse

b)

b. O data incarcate in depozit datele nu mai sunt modificare sau sterse

c)

c. Datele pot fi actualizate sau sterse in functie de subiectele continute

172.

146. Un depozit de date este folosit :

a)

De toti angajatii companiei in activitatea de zi cu zi

b)

De personalul de conducere al companiei pentru a urmari activitatea

c)

De personalul de conducere al companiei pentru fundamentarea deciziilor

173.

O diferență dintre un depozit de date (DWH) și un magazin de date operaționale

(Operational Data Store – ODS) este:

a)

Datele din DWH sunt datele curente pe când cele din ODS sunt istorice

b)

Datele din DWH sunt orientate pe subiecte pe când cele din ODS pe activități

c)

Datele din ODS sunt datele curente pe când cele din DWH sunt istorice

174.

Utilizatorii obișnuiți ai unui depozit de date lucrează cu datele din:

a)

a. Sistemele operaționale

b)

b. Data Presentation Area

c)

c. Data Staging Area

175.

Procesul ETL (Extract-Transform-Load) este mai dificil de efectuat în cazul abordării

dimensionale decât în cazul celeilalte abordări prezentate în curs?

a)

a. True

b)

b. False

176.

Un flux ETL (Extract-Transform-Load) duce în final datele în:

a)

Sistemele operaționale

b)

Data Presentation Area

c)

Data Staging Area

177.

O tabelă de fapte (măsuri) reprezintă:

a)

Un proces de afaceri

b)

Entități ale lumii reale și nu procese de afaceri

c)

Numere operaționale de control (numar factură, număr comanda, etc.)

178.

În modelarea dimensională:

a)

a. Întâi se identifică atributele tabelei de fapte și apoi se aleg dimensiunile

corespunzătoare

b)

b. Întâi se aleg dimensiunile și apoi se identifică atributele tabelei de fapte

c)

c. Identificarea atributelor tabelei de fapte și alegerea dimensiunilor se pot executa în

orice ordine

179.

Un atribut non-aditiv:

a)

a. Poate fi agregat pe toate dimensiunile

b)

b. Poate fi agregat pe cel puțin o dimensiune

c)

c. Nu poate fi agregat pe nici a dimensiunilor

180.

Dacă pentru datele unei rețele de magazine o linie a tabelei de fapte reprezintă un

bon de cumpărături al unui client, atunci care dimensiune nu poate fi atașată schemei

stea:

a)

a. Data

b)

b. Magazinul

c)

c. Produsul

181.

155. Tabelele de dimensiuni au ca si cheie primară:

a)

a. O cheie naturală (de exemplu codul de bare pentru produse)

b)

b. O cheie surogat (generată de sistemul de gestiune)

c)

c. O cheie furnizată de utilizator

182.

156. O dimensiune degenerată reprezintă:

a)

a. Un proces de afaceri

b)

b. Numere operaționale de control (număr factură, număr comanda, etc.)

c)

c. Entități ale lumii reale și nu procese de afaceri

183.

157. O schemă fulg-de-zăpadă (Snow-flake) se obține dintr-o schemă stea când:

a)

a. Normalizăm tabela de fapte

b)

b. Normalizăm atât tabela de fapte cât și tabelele de dimensiuni

c)

c. Normalizăm tabelele de dimensiuni

184.

158. O schemă stea are în centru:

a)

a. O tabela de dimensiune

b)

b. Fie o tabelă de fapte fie una de dimensiune

c)

c. O tabelă de fapte (măsuri)

185.

159. Prețul total al unei linii dintr-o factura este un exemplu de atribut:

a)

a. Semi-aditiv

b)

b. Aditiv

c)

c. Non-aditiv

186.

160. Prețul unitar al unui articol dintr-o factura este un exemplu de atribut:

a)

a. Aditiv

b)

b. Semi-aditiv

c)

c. Non-aditiv

187.

161. O tabelă de dimensiuni reprezintă:

a)

a. Un proces de afaceri

b)

b. Entități ale lumii reale și nu procese de afaceri

c)

c. Numere operaționale de control (numar factură, număr comanda, etc.)

188.

162. Un atribut aditiv:

a)

a. Poate fi agregat pe toate dimensiunile

b)

b. Poate fi agregat pe o parte a dimensiunilor

c)

c. Poate fi agregat pe cel puțin o dimensiune

189.

163. Care afirmație este adevărată:

a)

O tabelă de fapte conține câte o cheie străină pentru fiecare dimensiune de care este

legată într-o schemă stea

b)

O tabelă de dimensiune conține câte o cheie străină pentru fiecare tabelă de fapte de

care este legată într-o schemă stea

c)

Tabelele de fapte și cele de dimensiuni conțin câte o cheie străină pentru fiecare

tabelă de celălalt tip de care sunt legate într-o schemă stea

190.

165. Algoritmul GSP se poate folosi pentru:

a)

a. Găsirea utilizatorilor frecvenți

b)

b. Găsirea de tipare secvențiale frecvente în sesiuni

c)

c. Găsirea sesiunilor unui utilizator

191.

Extragerea și integrarea datelor, informațiilor și cunoștințelor din paginile web fac

obiectul:

a)

Mineritului utilizării paginilor web (Web usage mining)

b)

Mineritului structurii paginilor web (Web structure mining)

c)

Mineritului conținutului paginilor web (Web content mining)

192.

Relația între Common Logfile Format și Combined Log File Format este :

a)

Informațiile din Common Logfile Format includ pe cele din Combined Log File Format

b)

b. Informațiile din Common Logfile Format sunt incluse în Combined Log File Format

c)

c. Common Logfile Format și Combined Log File Format sunt disjuncte

193.

Încercarea de a prezice comportamentul utilizatorului atunci când interacționează cu

Web-ul fac obiectul:

a)

a. Mineritului conținutului paginilor web (Web content mining)

b)

b. Mineritului structurii paginilor web (Web structure mining)

c)

c. Mineritului utilizării paginilor web (Web usage mining)

194.

O vizualizare de pagina (pagewiew) se reflectă în log-ul serverului ca:

a)

a. Mai multe linii din log

b)

b. O singură linie din log

c)

c. Una sau mai multe linii din log

195.

170. Completarea căii urmate de utilizator (Path competition) se face pentru că:

a)

a. Unele vizualizări de pagini nu sunt solicitate de la serverele web

b)

b. Fișierele conținând imagini sunt solicitate separat serverului web

c)

c. Limbajul HTML permite saltul de la o pagina web la alta

196.

173. Algoritmii de tip Page Rank sunt de tipul:

a)

a. Mineritului conținutului paginilor web (Web content mining)

b)

b. Mineritului structurii paginilor web (Web structure mining)

c)

c. Mineritului utilizării paginilor web (Web usage mining)

197.

Folosirea teoriei grafurilor pentru analiza structurii si conexiunilor intre noduri (pagini

web) fac obiectul:a.

a)

a. Mineritului structurii paginilor web (Web structure mining)

b)

b. Mineritului conținutului paginilor web (Web content mining)

c)

c. Mineritului utilizării paginilor web (Web usage mining)

198.

175. In cazul MAR (MAR = Missing At Random):

a)

a. P (labeled=1| x, y) = P (labeled=1| x)

b)

c. P (labeled=1|x, y) <> P (labeled=0|x, y)

c)

c. P (labeled=1|x, y) <> P (labeled=0|x, y)

199.

177. In cazul MCAR (MCAR = Missing Completely At Random):

a)

a. P (labeled=1|x, y) = P (labeled=1)

b)

b. P (labeled=1|x, y) <> P (labeled=0|x, y)

c)

c. P (labeled=1| x, y) = P (labeled=1| x)

200.

183. In cazul MNAR (MNAR = Missing Not At Random):

a)

a. P (labeled=1|x, y) = P (labeled=1)

b)

b. P (labeled=1| x, y) = P (labeled=1| x)

c)

c. P (labeled=1|x, y) <> P (labeled=0|x, y)

201.

In cazul in care exemplele etichetate sunt toate din clasa pozitiva, pentru construirea

multimii care va fi considerata continand exemple negative cursul prezinta algoritmi ca:

a)

a. ASSEMBLE

b)

b. ROCCHIO

c)

c. CO-TRAINING

202.

179. Efectul Hughes arata ca:

a)

a. Pentru un număr dat de exemple de antrenament, puterea predictivă scade pe

măsură ce dimensionalitatea crește

b)

b. Pentru un număr dat de exemple de antrenament, puterea predictivă scade pe

măsură ce dimensionalitatea scade

c)

c. Pentru un număr dat de exemple de antrenament, puterea predictivă crește pe măsură

ce dimensionalitatea crește

203.

In cazul algoritmului Re-weighting, daca pentru grupul cu scoruri intre 0.2 si 0.4

avem 20 de exemple neetichetate si 40 etichetate, atunci ponderea grupului (group

weight) este:

a)

a. 1.6

b)

b. 1.5

c)

2

204.

In cazul algoritmului Re-weighting, pentru grupul cu scoruri intre 0.2 si 0.4 avem 30

de exemple neetichetate si 50 etichetate. Din cele 50 de exemple etichetate 20 sunt din

clasa 0 (Bad) si 30 din clasa 1 (Good). In final, dupa repartizarea exemplelor

neetichetate, clasa 1 (Good) va avea un numar de exemple egal cu:

a)

48

b)

32

c)

44

205.

In cazul algoritmului Re-weighting, daca pentru grupul cu scoruri intre 0.2 si 0.4

avem 30 de exemple neetichetate si 50 etichetate, atunci ponderea grupului (group

weight) este:

a)

3

b)

1.5

c)

1.6

206.

In cazul algoritmului Re-weighting, pentru grupul cu scoruri intre 0.2 si 0.4 avem 30

de exemple neetichetate si 50 etichetate. Din cele 50 de exemple etichetate 20 sunt din

clasa 0 (Bad) si 30 din clasa 1 (Good). In final, dupa repartizarea exemplelor

neetichetate, clasa 0 (Bad) va avea un numar de exemple egal cu:

a)

44

b)

48

c)

32