Font size
Worksheetsmm33ffkk
Total questions: 206
Worksheet time: 2hrs 44mins
Nu este data mining:
Calcularea unor date sumare (min, max)
Cautarea unei persoane intr-o baza de date
Ambele variante sunt adev
In cazul algoritmilor de tip Expectation-Maximization, etapa Expectation:
Calculeaza noi estimari ale parametrilor
Nu utilizeaza estimarile curente ale parametrilor si nici nu calculeaza noi estimari ale lor
Utilizeaza estimarile curente ale parametrilor
In cazul algoritmului Co-training (Versiunea Goldman and Zhou), tabela continand setul de antrenament va fi fragmentata in vederea construirii de clasificatori:
Pe orizontala
Pe verticala
Nu se fragmenteaza
Dimensiunile conforme permit integrarea in acelasi raport a unor date din:
Mai multe tabele de dimensiuni
Mai multe momente de timp
Mai multe tabele de fapte
In lucrarile sale, Ralph Kimball a sustinut o stocare a datelor intr-un depozit de date folosind o abordare:
Dimensionala
Normalizata
Normata
Care afirmatie este adevarata
K-modes est eun algoritm de clasificare
K-modes se poate folosi pentr date categorice
K-modes est eun algoritm de regresie
In cazul in care studiem secventa de cosuri de cumparaturi a unui client posesor de card de loialitate folosind GSP, deca L2(secevente de lungime 2) contine doar secvente <A, B> si <A, C>, are sens sa consideram ca si candidat de lungime 3 secventa <A, (BC)> >
Depinde de restul datelor
Nu
Da
O tabela de tipul periodic snapshot fact table poate contine, pe langa cheia primara si cheile straine:
Mai multe coloane de fapte (masuri)
Doar date agregate (sume, medii, etc )
Doar o singura coloana de fapte (masuri)
Data reduction is perform at:
Data collection
Pattern extraction and discovery
Data preprocessing
Association rule discovery is of type:
Description
Prediction
Prescription
Regression is of type:
Description
Prediction
Prescription
From the A priori principle it results that if we have two frequent itemsets A and B then also X
is frequent, where:
a.X = INTERSECT(A, B)
b.X = UNION(A, B)
c.X = CARTESIAN_PRODUCT(A, B)
Entropy(D) = -Sum j[ Pr(cj) * log2 Pr (cj)]. If D contains 100% negative examples the entropy
of D is:
-1
1
0
Vizualizarea, asa cum a fost prezentata in curs:
Este o etapa in procesul DM
Este o etapa dupa procesul DM
Este o etapa inainte de procesul de DM
Algoritmii de clasificare sunt de tip:
Predictiv
Descriptiv
Prescriptiv
Algoritmii de clustering sunt de tip:
Predictiv
Descriptiv
Prescriptiv
Algoritmii de gasire a regulilor de asociere sunt de tip
Predictiv
Descriptiv
Prescriptiv
Entropy(D) = -Sum j[ Pr(cj) * log2 Pr (cj)]. If D has 50% positive and 50% negative examples
the entropy of D is:
1
-1
0
KNN:
a.It's just a classification method that does not produce a classifier
b.Produces a classifier then used in classification
In our course ID3 stands for:
a. Tag Embedded In MPEG I Layer III Files
c. International Direct Distance Dialing
Gradele militare (ordinea maratoanelor) sunt valori de tip:
Nominal
Ordinal
Interval
Eye color has values of type:
Categorical
Nominal
Both a and b are true
Entropy(D) = -Sum j[ Pr(cj) * log2 Pr (cj)]. If D contains in equal proportions examples from 4
different classes, the entropy of D is:
0
2
-2
A decision tree can be converted in:
a. A set of rules
b. A single complex rule
c. Both a and b are false
In ensemble methods:
a. These methods are not used in classification
b. A classifier is divided into several components
c. Multiple classifiers are aggregated into one
Sequential covering is used for:
a.Obtaining rules
b.Building decision trees
c.Clustering
In the case of Sequential covering rules are obtained:
a. One at a time
b. All the rules in a single step
c. The other two answers are wrong
Ca data despre o persoana, genul (masculin, feminin) este un atribut de tip:
Interval
Binar asimetric
Binar simetric
Sumarul de 5 numere (five number summary) contine preintre altele:
Media si mediana
Cuartile si cvintilele
Minimul si maximul
Finding ordered rules means:
a.Finding rules by first determining the class and then the associated condition
b.Finding rules by first determining the conditions and then the class
If for another "Play Tennis" type table Entropy (D) = 0.8, Entropy (D, Attribute1) = 0.4,
gain-ratio(D, Attribute1) is:
.0.3
0.6
1
If for another “Play Tennis” type table Entropy (D) = 0.8, Entropy(D,Attribute1) = 0.5,
gain-ratio(D, Attribute1) is:
0.3
1
0.6
If for another "Play Tennis" type table Entropy (D, Attribute1) = 0.8 and Entropy (D, Attribute2)
= 0.7, which of the two attributes will be used for branching?
a.Attribute2
b.Attribute1
When adding new attributes to a training set using CARs, these attributes are always:
a.Boolean
b.Numerical
c.Binary
In the case of class association rules (CAR), using them for classification using the strongest
rule may means:
a.Using the rule with the greatest support and / or confidence
b.Using the rule with the strongest class on the right
c.Using the rule with most items on the left
In the case of class association rules (CAR), the input for building a classifier using a
subset of rules is:
a. Only a set of CARs R
b. Only the measure of the strength for each rule
c. A training dataset D and a set of CARs R
As entropy decreases so does:
a. Disorder
order
Finding unordered rules means:
a. Finding rules by first determining the conditions and then the class
b. Finding rules by first determining the class and then the associated condition
The algorithms based on Bayes theorem compute for each test example:
a. Not a single class but a probability of each class in C
b. Not a single class but a membership level for each class in C
c. A single class
In the case of SVM the margin is:
The minimum orthogonal distance between a positive and negative point from the
validation set
The minimum orthogonal distance between a positive and negative point from the training
set
The minimum orthogonal distance between a positive and negative point from the test set
With the points {1, 2, 3, 4, 5, 6} in 1D, if we apply K-Means for K = 3 and initial centroid 1, 2
and 3 we obtain the clusters:
(1), (2, 3), (4, 5, 6)
(1), (2, 3, 4), (5, 6)
(1, 2), (3, 4), (5, 6)
In the case of hierarchical clustering, to obtain a set of clusters, the following is done:
a. A horizontal cut of the obtained hierarchy
b. An uneven cut of the obtained hierarchy
c. A vertical cut of the obtained hierarchy
For two clusters in 1D: (1, 2) and (3, 4), what is the value of the silhouette s(1) of point 1 of
(1, 2):
3/5
1/3
2/3
Fuzzy C-Means is an algorithm of type:
a. Close clustering
b. Hard clustering
c. Soft clustering
In the context of the k-Modes algorithm, a mode value for the vectors {[1, 2], [1, 3], [3, 2], [2,
3]} is:
[3, 2]
[1, 2]
[2 , 1]
Let be in 1D two clusters: (1, 2) and (3, 4). Using the point silhouette, the measure of the
performance of the clustering process - the average of the silhouettes, is:
Greater than 0.5
Between 0.4 and 0.5
Between 0 and 0.4
In the case of SVM a classifier is:
a. A hyperplane
b. A line
c. A curve
Varianta (Variance) este:
Patratul lui sigma mic
Radical din sigma mic
Altceva
Varianta multimii (0, 1, 2, 3, 4) este:
2
10
Intre 3 si 4
Deviatia standard a multimii (1, 1, 1, 1, 1) este (deviatia = radical din varianta):
1
Intre 1 si 2
0
Binning methods for Data Smoothing: daca avem o cutie (“bin”) continand 4, 8, 9, 15 prin
netezirea folosind capetele intervalului (“using bin boundaries”) obtinem:
9, 9, 9, 9
4, 4, 15, 15
4, 4, 4, 15
In cazul Discretizarii utilizand impartirea in benzi egale (“equi-width binning”) cu latime =
10 printre valorile 0, 4, 12, 16, 16, 18, 24, 26, 38 obtinem:
3 benzi
4 benzi
5 benzi
Pentru recunoasterea punctelor izolate (outliers) se foloseste valoarea 1.5 * IQR. In
acest caz, cat ar trebui sa fie X din multimea {0, 1, 2, X} pentru a fi considerat punct
izolat:
5.5
-2.5
-1.5
Detecting outliers using 1,5 * IQR, X is outlier if the value of X in {1, 2, 3, X} is (cap.
Dispersion):
5
-2.5
5.9
In cazul normalizarii Min-Max, multimea {1, 2, 3, 6} devine:
{0.2, 0.4, 0.6, 0.9}
{0.1, 0.2, 0.3, 0.6}
{0.0, 0.2, 0.4, 1}
In cazul normalizarii de tip Decimal Scaling, multimea {1, 2, 3, 6} devine:
{0.2, 0.4, 0.6, 0.9}
{0.1, 0.2, 0.3, 0.6}
{0.0, 0.2, 0.4, 1}
In cazul gasirii multimelor frecvente in datele de vanzari ale unui supermarket, reducerea
dimensionalitatii {Dimensionality reduction} trebuie sa pastreze:
Pretul
Produsul
furnizorul
Daca A este o multime frecventa si s este pragul de suport atunci:
Fiecare articol din A este in cel putin s% tranzactii
A ca multime este in cel putin s% tranzactii
Fiecare tranzactie care o contine pe A este de asemenea o multime frecventa
Fiecare multime care contine un articol din A este de asemenea frecventa
Tranzactii {(1, 2, 3, 5), (2, 3, 4), (3, 4, 5)}, s = 50%. Atunci numarul de perechi frecvente
este:
1
2
3
Tranzactii {(1, 2, 3), (2, 3, 4), (3, 4, 5)}, s = 50%. Atunci numarul de articole frecvente
este:
3
4
5
Tranzactii {(1, 2, 3, 5), (2, 3, 5), (1, 4, 6)}, s = 50%. Atunci articolele frecvente sunt:
{1, 2, 3, 5}
{2, 3, 5}
{1, 2, 3, 5, 6}
Tranzactii {(1, 2, 3, 5), (2, 3, 5, 6), (1, 4, 6)}, s = 50%. Atunci articolele frecvente sunt:
{1, 2, 3, 5}
{2, 3, 5}
{1, 2, 3, 5, 6}
Tranzactii: {(1, 2, 3, 5), (2, 3, 4, 5), (3, 4, 5)} Suportul regulii {5} -> {1} este
100%
33%
66%
Tranzactii: {(1, 2, 3, 5), (2, 3, 4, 5), (3, 4, 5)} Suportul regulii {3} -> {5} este
100%
33%
66%
Tranzactii: {(1, 2, 3, 5), (2, 3, 4, 5), (3, 4, 5)} Suportul regulii {3} -> {4} este
100%
33%
66%
Tranzactii: {(1, 2, 3, 5), (2, 4, 5), (2, 3, 4, 5)} Increderea regulii {5} -> {2} este
100%
20%
66%
Tranzactii: {(1, 2, 3, 5), (2, 4, 5), (2, 3, 4, 5)} Increderea regulii {3} -> {1} este
33%
50%
66%
Tranzactii: {(1, 2, 3, 5), (2, 4, 5), (2, 3, 4, 5)} Increderea regulii {5} -> {3} este
100%
66%
20%
Tranzactii: { (1, 2, 3, 5), (2, 4, 5), (3, 4, 5) } ; s = 50%. Increderea regulii {5} --> {3} este:
100%
66%
20%
Cand etichetele de clasa pentru date nu sunt cunoscute avem
Reguli de asociere
Invatare supervizata
Invatare nesupervizata
Cand datele (observatii, masuratori etc.) sunt etichetate cu clase predefinite avem:
Reguli de asociere
Invatare supervizata
Invatare nesupervizata
Increderea unei reguli de asociere X -> Y este data de formula:
Suport(X U Y)/ Suport(X)
remember
Suportul unei reguli de asociere X -> Y este data de formula:
Suport(X U Y)
remember
Daca din 200 de cazuri de test 50 sunt clasificate gresit acuratetea este egala cu:
25%
50%
75%
Daca din 200 de cazuri de test 50 sunt clasificate gresit rata de eroare este egala cu:
25%
50%
75%
Daca din 200 de cazuri de test, toate pozitive, 50 sunt clasificate gresit, precizia este
egala cu:
25%
100%
75%
Daca din 200 de cazuri de test, toate pozitive, 50 sunt clasificate gresit Recall este egal
cu:
0%
50%
75%
Daca din 200 de cazuri de test, toate pozitive, 50 sunt clasificate gresit, scorul F1 este
egal cu:
85%
55%
25%
Cand lucram doar cu exemple pozitive sau negative si avem un clasificator care
eticheteaza corect 50% din toate exemplele, pentru un set de 100 pozitive si 200
negative, precizia P va fi de:
33%
50%
75%
Cand lucram doar cu exemple pozitive sau negative si avem un clasificator care
eticheteaza corect 50% din toate exemplele, pentru un set de 100 pozitive si 200
negative, R (recall) este:
33%
50%
40%
Cand lucram doar cu exemple pozitive sau negative si avem un clasificator care
eticheteaza corect 50% din toate exemplele, pentru un set de 100 pozitive si 200
negative, F1 este:
66%
50%
40%
Fie o scoala avand 50% elevi si 50 % eleve. Elevele poarta sort sau fusta in proportii
egale, iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand
sort. Care este cu aproximatie probabilitatea ca persoana respectiva sa fie eleva ?
33%
66%
50%
Fie o scoala avand 40% elevi si 60 % eleve. Elevele poarta sort sau fusta in proportii
egale, iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand
sort. Care este cu aproximatie probabilitatea ca persoana respectiva sa fie eleva ?
43%
63%
53%
Fie o scoala avand 80% elevi si 20 % eleve. Elevele poarta sort sau fusta in proportii
egale, iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand
sort. Care este cu aproximatie probabilitatea ca persoana respectiva sa fie eleva ?
11%
21%
31%
In a school 60% of the student are boys and 40% are girls, Girls wear shorts and skirts
in equal proportions, boys only shorts. A distant observer sees a person wearing shorts.
What is the probability that the person is a boy ?
80%
75%
40%
In cazul SVM, algoritmii de acest tip:
Pot fi folositi pentru nr. clase < 2
Pot fi folositi pentru nr. clase > 2
Ambele afirmatii sunt false (sunt fix 2)
In the case of SVM the algorithm tries to the hyperplane that:
Minimize the margin
Maximize the margin
Both a and b are false
In cazul SVM/separare non-lineara asa numitul “feature space” are de obicei:
Mai putine dimensiuni
Acelasi numar de dimensiuni
Mai multe dimensiuni
In cazul SVM, o functie de kernel liniara este de tipul:
K(X, Y) = <X*Y> + b
K(X, Y) = Power((a*<X*Y>) + b), p)
K(X, Y) = tanh(a*<X*Y> + b)
In cazul SVM, o functie de kernel este de tipul:
K(Xi, Yi) = fi(Xi) * fi(Xj)
K(Xi, Yi) = fi(Xi) / fi(Xj)
K(Xi, Yi) = fi(Xi) + fi(Xj)
Algoritmul K-Means nu este potrivit pentru a gasi clustere care:
Nu sunt hiper-elipsoizi (sau hiper-sfere)
Sunt hiper-elipsoizi (sau hiper-sfere)
Atat a cat si b sunt false
Rezultatul algoritmul K-Means nu este influentat de:
Centroizii initiali influenteaza rezultatele
Centroizii initiali
Punctele disparate (valori aberante, outliners)
Rezultatul algoritmului K-Means sunt influentate de:
Puncte disparate (Outliers)
Centroizii intiali
Atat a cat si b sunt adevarate
Distanta 1D intre (1, 2, 3) si (4, 5, 6) utilizand metoda “single link” este:
1
3
5
Distanta 1D intre (1, 2, 3) si (4, 5, 6) utilizand metoda “complete link” este:
1
3
5
Distanta 1D intre (1, 2, 6) si (1, 5, 6) utilizand metoda centroizilor este:
1
3
5
Distanta 1D intre (1, 2, 3) si (4, 5, 6) utilizand metoda centroizilor este:
1
3
5
Fie punctele {1, 2, 5, 6}. Daca aplicam K-Means pentru k=2 si centroizii initiali 1 si 2
obtinem clustere
(1, 2) si (5, 6)
(1, 5) si (2, 6)
(1) si (2, 5, 6)
Fie vocabularul {eu, nu, sunt, acasa}. Distanta cosinus intre ‘eu sunt’ si ‘sunt acasa’ este
⅓
½
1
Fie vocabularul {eu, nu, sunt, acasa}. Distanta cosinus intre ‘eu sunt acasa’ si ‘nu sunt
acasa’ este
⅓
½
1
Care afirmatie este adevarata
K-Modes se poate folosi pentru date categorice
K-Modes este un algoritm de clasificare
A si B sunt false
In contextul algoritmului k-Modes, o valoare modala pentru vectorii {[1, 2], [1, 3], [3, 2],
[2, 3]} este:
[1, 2]
[3, 2]
[2, 1]
[1, 3]
Care afirmatie este adevarata?
FastMap se poate folosi dupa K-means
FastMap se poate folosi in loc de K-Means
FastMap se poate folosi inainte de K-Means
Care afirmatie este adevarata:
k-Means++ se poate folosi in loc de k-Means
k-Means++ se poate folosi dupa de k-Means
k-Means++ se poate folosi inainte de k-Means
From Apriori principle, if the sets A and B are frequent itemsets, then also X is frequent
itemset, with:
X = A intersectat B
X = A reunit cu B
X = A x B
Having 10.000 transactions with 10 items each and s = 10.000, then the number of
frequent items is at most:
1
10
100
The median value of {1, 3, 5, 7, 1001, 2002, 9999} is:
7
5000
Other value
{1, 3, 5, 7, 1001, 2002, 9999} is
Unimodal
Bimodal
Without modal value
For 4 points in 1D {1, 2, 5, 6}, using K-Means with k=2 and initial centroids 1 and 6 the
result is
(1, 2) and (5, 6)
(1, 5) and (2, 6)
(1) and (2, 5, 6)
A decision tree can be converted in:
A set of rules
A single complex rule
Un set de multimi frecvente
Entropy (D) If D contains 100% positive examples the
entropy of D is:
1
0
-1
In teoria informatiei pe masura ce datele dintr-un set de date devin mai pure valoarea
entropiei
devine mai mica
devine mai mare
uneori creste alteori scade
Daca D are 50% exemple pozitive si 50% exemple negative atunci entropia este:
1
0
-1
When building a decision tree using C4.5, branching is made using the attribute that:
Minimize the information gain
Minimize the entropy
Both a and b are true
Sequential covering is used for
Building decision trees
Obtaining rules
Clustering
If P(A) = 0.8%, P(B) = 40% and P(B|A) = 10% (nu se intelege procentu) then P(A|B) is
20%
2%
0.2%
Hierarchical clustering produces a sequence of embadded clusters called:
Dendogram
Dendrogram
Dondegram
(A, BC) este o subsecventa pentru:
(B, AB, AC, BCD)
(ABC)
(A, B, C)
In cazul clusteringului ierarhic se obtine o:
dendrograma
remember
Fuzzy C-Means type is:
Hard Clustering
Soft Clustering
Mixed Clustering
KNN algorithm is for:
Clustering
Regression
Classification
Pentru evitarea fenomenului de overfitting in clasificare putem folosi:
Doar Pre-pruning
Doar Post-pruning
Atat a cat si b sunt adevarate
Invatarea PU ("PU learning") vine de la:
Positive and uncertain examples
Positive and unlabeled examples
Positive and unpositive examples
Cand integram doua scheme trebuie ca mai inainte sa efectuam operatii ca:
Implosion si Stemming
Tokenization si Boosting
Stemming si Expansion
Sesionizarea inseamna:
Impunerea unor sesiuni
Identificarea userilor
Identificarea sesiunilor
Alegeti:
a. Un Data warehouse contine Data marts
b. b. Un Data mart contine Data Warehouse
c. c. Atat a cat si b sunt false
Alegeti:
O tabela de fapte (Facts) poate fi asociata cu mai multe dimensiuni
O tabela de dimensiuni poate fi asociata cu mai multe tabele de fapte
Atat a cat si b sunt adevarate
Alegeti:
Putem obtine schema fulg-de-nea ("snow-flake") din schema star prin
denormalizare
Putem obtine schema star din fulg-de-nea prin denormalizare
Atat a cat si b sunt adevarate
Declararea granulei ("grain") inseamna a specifica:
Ce reprezinta o coloana din tabela de fapte
Ce reprezinta o linie din tabela de fapte
Atat a cat si b sunt false
Abordari in Data Warehousing sunt:
Abordarea dimensionala
Abordarea relationala
Atat a cat si b sunt adevarate
A nearest neighbor approach is best used
with large-sized datasets.
when irrelevant attributes have been removed from the data.
when a generalized model of the data is desireable
when an explanation of what has been found is of primary importance
Which statement about outliers is true?
Outliers should be identified and removed from a dataset
Outliers should be part of the training dataset but should not be present in the test
data.
Outliers should be part of the test dataset but should not be present in the training
data.
The nature of the problem determines how outliers are used.
More than one of a,b,c or d is true.
Assume that we have a dataset containing information about 200 individuals. One
hundred of these individuals have purchased life insurance. A supervised data mining
session has discovered the following rule:
IF age < 30 & credit card insurance = yes
THEN life insurance = yes
Rule Accuracy: 70%
Rule Coverage: 63%
How many individuals in the class life insurance= no have credit card insurance and are
less than 30 years old?
63
70
30
27
Unlike traditional production rules, association rules
allow the same variable to be an input attribute in one rule and an output attribute in
another rule.
allow more than one input attribute in a single rule.
require input attributes to take on numeric values
require each rule to have exactly one categorical output attribute
Which of the following is a common use of unsupervised clustering?
a. detect outliers
b. determine a best set of input attributes for supervised learning
c. evaluate the likely performance of a supervised learner model
d. determine if meaningful relationships can be found in a dataset
e. All of a,b,c, and d are common uses of unsupervised clustering.
The average positive difference between computed and desired outcome values
root mean squared error
mean squared error
mean absolute error
mean positive error
Given a rule of the form IF X THEN Y, rule confidence is defined as the conditional
probability that
a. Y is true when X is known to be true.
b. X is true when Y is known to be true.
c. Y is false when X is known to be false.
d. X is false when Y is known to be false.
Association rule support is defined as
a. the percentage of instances that contain the antecendent conditional items listed in
the association rule.
b. the percentage of instances that contain the consequent conditions listed in the
association rule.
c. the percentage of instances that contain all items listed in the association rule.
d. the percentage of instances in the database that contain at least one of the
antecendent conditional items listed in the association rule.
Which statement is true about the K-Means algorithm?
a. All attribute values must be categorical.
b. The output attribute must be categorical.
c. Attribute values may be either categorical or numeric.
d. All attributes must be numeric.
The K-Means algorithm terminates when
a. a user-defined minimum value for the summation of squared error differences
between instances and their corresponding cluster center is seen.
b. the cluster centers for the current iteration are identical to the cluster centers for the
previous iteration.
c. the number of instances in each cluster for the current iteration is identical to the
number of instances in each cluster of the previous iteration.
d. the number of clusters formed for the current iteration is identical to the number of
clusters formed in the previous iteration.
A dataset of 1000 instances contains one attribute specifying the color of an object.
Suppose that 800 of the instances contain the value red for the color attribute. The
remaining 200 instances hold green as the value of the color attribute. What is the
domain predictability score for color = green?
a. 0.80
b. 0.20
c. 0.60
d. 0.40
A common method used by some data mining techniques to deal with missing data
items during the learning process
replace missing real-valued data items with class means
discard records with missing data
replace missing attribute values with the values found within other similar instances
ignore missing attribute values
This data transformation technique works well when minimum and maximum values
for a real-valued attribute are known.
a. min-max normalization
b. decimal scaling
c. z-score normalization
d. logarithmic normalization
This technique uses mean and standard deviation scores to transform real-valued
attributes.
a. decimal scaling
b. min-max normalization
c. z-score normalization
d. logarithmic normalization
A data normalization technique for real-valued attributes that divides each numerical
value by the same power of 10
a. min-max normalization
b. z-score normalization
c. decimal scaling
d. decimal smoothing
A decision tree is built to determine individuals likely to default on an unsecured loan.
The null hypothesis states that an individual will not default on the loan. The decision
tree correctly classifies 80% of the instances in a test dataset. Fifteen percent of the
mistakes made by the model are type 1 errors. What can be said about the performance
of the model?
a. The accuracy of the model for correctly determining those individuals who did not
default on their loan was at least 75%.
b. The accuracy of the model for correctly determining those individuals who defaulted
on their loan was at least 75%.
c. The majority of errors made by the model accepted individuals who defaulted.
d. The majority of errors made by the model rejected individuals who did not default.
e. More than one of a,b,c or d is correct.
In cazul regulilor de asociere de clasa (CAR), folosirea lor pentru clasificarea folosind
cea mai puternica regula poate insemna:
a. Folosirea regulii cu cele mai multe articole in partea stanga
b. Folosirea regulii avand cea mai puternica clasa in partea dreapta
c. Folosirea regulii cu cel mai mare suport si/sau incredere
In cazul Random Forest, numarul de atribute luate in calcul la fiecare ramificatie este
a. Mai mare decat numarul de atribute ale multimii de antrenare
b. Egal cu numarul de atribute ale multimii de antrenare
c. Mai mic de cat numarul de atribute ale multimii de antrenare
Intr-un spatiu 1D avem 2 puncte rosii (1 si 3) si 2 puncte albastre (10 si 11). Folosind
kNN pentru k=3, punctul 7.5 este albastru?
a. Adevarat
b. Fals
O functie de distanta trebuie sa indeplineasca si conditia:
a. f(x, y) <= f(x,z) + f(z,y)
b. f(x, y) >= f(x,z) + f(z,y)
c. f(x, y) <> f(x,z) + f(z,y)
In contextul evaluarii clusterelor, o valoarea pozitiva a siluetei pentru un punct
asignat unui cluster arata ca punctul a fost corect asignat?
a. Adevarat
b. Fals
Fie punctele A, B si C si distantele intre ele d(A, B)=3, d(A, C)=5, d(B, C)=4 (numere
pitagorice). In contextul algoritmului FastMap, coordonata punctului C pe axa AB(origine
in A) este:
3
2
5
Care este valoarea de adevar a afirmatiei: “un punct intr-o zona libera (hole) spune
ca o anumita combinatie de valori de atribute e foarte posibila”:
Adevarat
Fals
127. Care afirmatie e adevarata:
a. PAM e de tip K-Medoids
b. K-Medoids e de tip PAM
c. PAM si k-Medoids nu sunt din aceasi familie de algoritmi
Fie 4 puncte in plan A(0, 0), B(4, 0), C(4, 2), D(0, 2). In contextul evaluarii clusterelor,
pentru impartirea in 2 clustere (A, D) si (B, C) , suma patratelor distantelor(SSD) este:
40
16
4
129. Cheile surogat sunt recomandate de R. Kimball pentru:Tabelele de evenimente
Tabelele de evenimente
b. Tabelele de dimensiuni
c. Tabelele de fapte
Dimensiunile conforme se referă la dimensiuni care
a. Sunt conectate între ele prin chei străine
b. Sunt conectate la scheme stea diferite
c. Sunt conectate la aceeași schemă stea
132. O cheie străină care referă o anumită dimensiune:
a. Trebuie sa aibă nume identic cu cheia primară referită
b. Poate sa aibă un nume diferit de cheia primară referită
c. Poate referi o cheie unică diferită de cheia primară
O tabelă de tipul Aggregated Fact Tables poate conține, pe lângă cheia primara și
cheile străine:
a. Mai multe coloane de fapte (măsuri)
b. Doar date sumarizate (sume, medii, etc)
c. O singură coloană de fapte (măsuri)
134. O cheie surogata este de obicei:
a. Un numar
b. Un sir de caractere
c. O data calendaristica
O tabelă de tipul Factless Fact Tables poate conține, pe lângă cheia primara și cheile
străine:
a. Nicio coloană de fapte (măsuri).
b. Mai multe coloane de fapte (măsuri)
c. O singură coloană de fapte (măsuri)
Se poate folosi o cheie surogat pentru o tabelă de fapte dacă:
a. Există linii identice
b. Există dimensiuni identice
c. Există coloane identice
Faptul ca intr-un depozit de date datele sunt dependente de timp (time-variant)
inseamna ca:
a. Datele din depozit nu pot fi modificate
b. Analiza depozitului de date ia in calcul modificarile realizate in timp
c. Datele din depozit sunt actualizate periodic
In lucrarile sale, Ralph Kimball a sustinut o stocare a datelor intr un depozit de date
folosind o abordare:
Normata
Dimensionala
Normalizata
139. Faptul ca intr un depozit de date, datele sunt integrate inseamna ca:
a. Sistemele operationale importa date din depozitul de date
Depozitelele de date creeaza consecventa intre diverse tipuri de date si surse
diferite
Datele din depozit sunt stocate impreuna cu datelee sistemelor operationale;
140. Relatia dintre Data Staging Area si Data Presentation Area este:
Datele provenite din Data Presentation Area sunt incarcate direct in Data Staging
Area
Datele provenite din Data Staging Area sunt incarcate direct in Data Presentation
Area
Intre cele doua zone sunt plasate uneltele de prelucrare (Data Access…)
Faptul ca un depozit de date este orientat (axat) pe subiecte inseamna ca:
Datele sunt organizate considerand activitatile principale ale companiei
Datele sunt organizate considerand categoriile de informatii stocate
Datele pot fi actualizate sau sterse in functie de subiectele continute
142. In contextul cursului, care afirmatie este adevarata:
Un depozit de date contine de obicei date pe mai multe subiecte pe cand un Data
Mart contine de obicei date despre un singur subiect
Depozitele de date si Data Mart-urile nu au nimic in comun
Un Data Mart contine de obicei date pe mai multe subiecte pe cand un depozit
de date contine de obicei date despre un singur subiect
143. Care afirmatie e corecta
a. Un depozit de date poate contine mai multe Data Marts
b. Celelalte doua afirmatii sunt ambele false
c. Un Data Mart poate contine mai multe depozite de date
In lucrarile sale W.H.Inmon a sustinut o stocare a datelor intr-un depozit de date
folosind o abordare:
a. Dimensionala
b. Denormalizata
c. Normalizata
Faptul ca datele dintr-un depozit de date sunt non-volatile inseamna ca:
a. Datele pot fi actualizate (Update) dar nu mai pot fi sterse
b. O data incarcate in depozit datele nu mai sunt modificare sau sterse
c. Datele pot fi actualizate sau sterse in functie de subiectele continute
146. Un depozit de date este folosit :
De toti angajatii companiei in activitatea de zi cu zi
De personalul de conducere al companiei pentru a urmari activitatea
De personalul de conducere al companiei pentru fundamentarea deciziilor
O diferență dintre un depozit de date (DWH) și un magazin de date operaționale
(Operational Data Store – ODS) este:
Datele din DWH sunt datele curente pe când cele din ODS sunt istorice
Datele din DWH sunt orientate pe subiecte pe când cele din ODS pe activități
Datele din ODS sunt datele curente pe când cele din DWH sunt istorice
Utilizatorii obișnuiți ai unui depozit de date lucrează cu datele din:
a. Sistemele operaționale
b. Data Presentation Area
c. Data Staging Area
Procesul ETL (Extract-Transform-Load) este mai dificil de efectuat în cazul abordării
dimensionale decât în cazul celeilalte abordări prezentate în curs?
a. True
b. False
Un flux ETL (Extract-Transform-Load) duce în final datele în:
Sistemele operaționale
Data Presentation Area
Data Staging Area
O tabelă de fapte (măsuri) reprezintă:
Un proces de afaceri
Entități ale lumii reale și nu procese de afaceri
Numere operaționale de control (numar factură, număr comanda, etc.)
În modelarea dimensională:
a. Întâi se identifică atributele tabelei de fapte și apoi se aleg dimensiunile
corespunzătoare
b. Întâi se aleg dimensiunile și apoi se identifică atributele tabelei de fapte
c. Identificarea atributelor tabelei de fapte și alegerea dimensiunilor se pot executa în
orice ordine
Un atribut non-aditiv:
a. Poate fi agregat pe toate dimensiunile
b. Poate fi agregat pe cel puțin o dimensiune
c. Nu poate fi agregat pe nici a dimensiunilor
Dacă pentru datele unei rețele de magazine o linie a tabelei de fapte reprezintă un
bon de cumpărături al unui client, atunci care dimensiune nu poate fi atașată schemei
stea:
a. Data
b. Magazinul
c. Produsul
155. Tabelele de dimensiuni au ca si cheie primară:
a. O cheie naturală (de exemplu codul de bare pentru produse)
b. O cheie surogat (generată de sistemul de gestiune)
c. O cheie furnizată de utilizator
156. O dimensiune degenerată reprezintă:
a. Un proces de afaceri
b. Numere operaționale de control (număr factură, număr comanda, etc.)
c. Entități ale lumii reale și nu procese de afaceri
157. O schemă fulg-de-zăpadă (Snow-flake) se obține dintr-o schemă stea când:
a. Normalizăm tabela de fapte
b. Normalizăm atât tabela de fapte cât și tabelele de dimensiuni
c. Normalizăm tabelele de dimensiuni
158. O schemă stea are în centru:
a. O tabela de dimensiune
b. Fie o tabelă de fapte fie una de dimensiune
c. O tabelă de fapte (măsuri)
159. Prețul total al unei linii dintr-o factura este un exemplu de atribut:
a. Semi-aditiv
b. Aditiv
c. Non-aditiv
160. Prețul unitar al unui articol dintr-o factura este un exemplu de atribut:
a. Aditiv
b. Semi-aditiv
c. Non-aditiv
161. O tabelă de dimensiuni reprezintă:
a. Un proces de afaceri
b. Entități ale lumii reale și nu procese de afaceri
c. Numere operaționale de control (numar factură, număr comanda, etc.)
162. Un atribut aditiv:
a. Poate fi agregat pe toate dimensiunile
b. Poate fi agregat pe o parte a dimensiunilor
c. Poate fi agregat pe cel puțin o dimensiune
163. Care afirmație este adevărată:
O tabelă de fapte conține câte o cheie străină pentru fiecare dimensiune de care este
legată într-o schemă stea
O tabelă de dimensiune conține câte o cheie străină pentru fiecare tabelă de fapte de
care este legată într-o schemă stea
Tabelele de fapte și cele de dimensiuni conțin câte o cheie străină pentru fiecare
tabelă de celălalt tip de care sunt legate într-o schemă stea
165. Algoritmul GSP se poate folosi pentru:
a. Găsirea utilizatorilor frecvenți
b. Găsirea de tipare secvențiale frecvente în sesiuni
c. Găsirea sesiunilor unui utilizator
Extragerea și integrarea datelor, informațiilor și cunoștințelor din paginile web fac
obiectul:
Mineritului utilizării paginilor web (Web usage mining)
Mineritului structurii paginilor web (Web structure mining)
Mineritului conținutului paginilor web (Web content mining)
Relația între Common Logfile Format și Combined Log File Format este :
Informațiile din Common Logfile Format includ pe cele din Combined Log File Format
b. Informațiile din Common Logfile Format sunt incluse în Combined Log File Format
c. Common Logfile Format și Combined Log File Format sunt disjuncte
Încercarea de a prezice comportamentul utilizatorului atunci când interacționează cu
Web-ul fac obiectul:
a. Mineritului conținutului paginilor web (Web content mining)
b. Mineritului structurii paginilor web (Web structure mining)
c. Mineritului utilizării paginilor web (Web usage mining)
O vizualizare de pagina (pagewiew) se reflectă în log-ul serverului ca:
a. Mai multe linii din log
b. O singură linie din log
c. Una sau mai multe linii din log
170. Completarea căii urmate de utilizator (Path competition) se face pentru că:
a. Unele vizualizări de pagini nu sunt solicitate de la serverele web
b. Fișierele conținând imagini sunt solicitate separat serverului web
c. Limbajul HTML permite saltul de la o pagina web la alta
173. Algoritmii de tip Page Rank sunt de tipul:
a. Mineritului conținutului paginilor web (Web content mining)
b. Mineritului structurii paginilor web (Web structure mining)
c. Mineritului utilizării paginilor web (Web usage mining)
Folosirea teoriei grafurilor pentru analiza structurii si conexiunilor intre noduri (pagini
web) fac obiectul:a.
a. Mineritului structurii paginilor web (Web structure mining)
b. Mineritului conținutului paginilor web (Web content mining)
c. Mineritului utilizării paginilor web (Web usage mining)
175. In cazul MAR (MAR = Missing At Random):
a. P (labeled=1| x, y) = P (labeled=1| x)
c. P (labeled=1|x, y) <> P (labeled=0|x, y)
c. P (labeled=1|x, y) <> P (labeled=0|x, y)
177. In cazul MCAR (MCAR = Missing Completely At Random):
a. P (labeled=1|x, y) = P (labeled=1)
b. P (labeled=1|x, y) <> P (labeled=0|x, y)
c. P (labeled=1| x, y) = P (labeled=1| x)
183. In cazul MNAR (MNAR = Missing Not At Random):
a. P (labeled=1|x, y) = P (labeled=1)
b. P (labeled=1| x, y) = P (labeled=1| x)
c. P (labeled=1|x, y) <> P (labeled=0|x, y)
In cazul in care exemplele etichetate sunt toate din clasa pozitiva, pentru construirea
multimii care va fi considerata continand exemple negative cursul prezinta algoritmi ca:
a. ASSEMBLE
b. ROCCHIO
c. CO-TRAINING
179. Efectul Hughes arata ca:
a. Pentru un număr dat de exemple de antrenament, puterea predictivă scade pe
măsură ce dimensionalitatea crește
b. Pentru un număr dat de exemple de antrenament, puterea predictivă scade pe
măsură ce dimensionalitatea scade
c. Pentru un număr dat de exemple de antrenament, puterea predictivă crește pe măsură
ce dimensionalitatea crește
In cazul algoritmului Re-weighting, daca pentru grupul cu scoruri intre 0.2 si 0.4
avem 20 de exemple neetichetate si 40 etichetate, atunci ponderea grupului (group
weight) este:
a. 1.6
b. 1.5
2
In cazul algoritmului Re-weighting, pentru grupul cu scoruri intre 0.2 si 0.4 avem 30
de exemple neetichetate si 50 etichetate. Din cele 50 de exemple etichetate 20 sunt din
clasa 0 (Bad) si 30 din clasa 1 (Good). In final, dupa repartizarea exemplelor
neetichetate, clasa 1 (Good) va avea un numar de exemple egal cu:
48
32
44
In cazul algoritmului Re-weighting, daca pentru grupul cu scoruri intre 0.2 si 0.4
avem 30 de exemple neetichetate si 50 etichetate, atunci ponderea grupului (group
weight) este:
3
1.5
1.6
In cazul algoritmului Re-weighting, pentru grupul cu scoruri intre 0.2 si 0.4 avem 30
de exemple neetichetate si 50 etichetate. Din cele 50 de exemple etichetate 20 sunt din
clasa 0 (Bad) si 30 din clasa 1 (Good). In final, dupa repartizarea exemplelor
neetichetate, clasa 0 (Bad) va avea un numar de exemple egal cu:
44
48
32
