Font size
WorksheetsData Mining Quiz
Total questions: 148
Worksheet time: 1hrs 14mins
Transaction set:{(1,2,3,5), (2,4,5), (2,3,4,5)}. The confidence of the rule (5)->(3) is:
66%
33%
50%
Sequential covering is used for
Building decision trees
Obtaining rules
Clustering
When building a decision tree using C4.5, branching is made using the attribute that:
Minimize the information gain
Minimize the entropy
Both a and b are true
KNN algorithm is for:
Clustering
Regression
Classification
A decision tree can be converted in:
A set of rules
A single complex rule
Both a and b are false
Hierarchical clustering produces a sequence of embedded clusters called:
Dendogram
Dendrogram
Dondegram
Variance is:
Square of σ
Square root of σ
Both a and b are false
K-Means is sensitive to:
Outliers
Initial centroids
Both a and b are true
Fuzzy C-Means type is:
Hard Clustering
Soft clustering
Mixed clustering
The standard deviation of (1,1,1,1,1) is:
1
Between 1 and 2
0
In the case of SVM the algorithms tries to find the hyperplane that:
Minimize the margin
Maximize the margin
Both a and b are false
In a school 60% of the students are boys and 40% girls. Girls wear shorts and skirts in equal proportions, boys only shorts. A distant observer sees a person wearing shorts. What is the probability that the person is a boy?( Source: Wikipedia)
80%
75%
40%
K-Means is not suitable for finding clusters that:
Are not hyper-ellipsoids(or hyper-spheres).
Are hyper-ellipsoids(of hyper-spheres).
Both a and b are false
When we start with a set of labeled items (labels from a set of classes) we have:
Association rules
Supervised learning
Unsupervised learning
For 4 points in 1D (1,2,5,6), using K-Means with K=2 and initial centroids 1 and 6, the result is:
(1,2) and (5,6)
(1,5) and (2,6)
(1) and (2,5,6)
From Apriori principle, if the sets A and B are frequent itemsets, then also X is frequent itemset, with:
X=A
X=A
X=AxB
Eye color has values of type:
Categorical
Nominal
Both a and b are true
If for 200 items, all positive, 50 are not correctly classified, then the accuracy is:
25%
50%
75%
For 4 points in 1D ( 1,2,5,6), using k-Means with K=2 and initial centroids 1 and 2, the result is:
(1,2) and (5,6)
(1,5) and (2,6)
(1) and (2,5,6)
If A is a frequent itemset and s is the threshold then:
Each item of A is in at least s% transactions
A as a set is in at least s% transactions
Both a and b are true
Binning Methods for Data Smoothing is a bin contains 4,8,9,15, the result of smoothing boundaries is:
9,9,9,9
4,4,15,15
4,4,4,15
(1,3,5,7,1001,2002,9999) is:
Unimodal
Bimodal
Without modal value
Transaction set ((1,2,3), (2,3,4), (3,4,5)); s=50%. The number of frequent items is:
3
4
5
If P(A)=0.8%, P(B)=40%, P(B|A)=10%, then P(A|B) is:
20%
2%
0,2%
Having 10000 transactions with 10 items each and s=10 000, then the number of frequent items is at most:
1
10
100
The median value of (1,3,5,7,1001,2002,9999) is:
7
5000
Other value
Entropy(D)= . If D contains 100% positive examples the entropy of D is:
1
0
-1
Transaction set [(1,2,3,5), (2,3,4),(3,4,5)); s=50%. The number of frequent pair is:
1
2
3
It is not Data Mining:
Computing summary functions(e.g. min, max) for a table
Searching a person in a database
Both a and b are true
Five number summay contains:
Mean and Median
Quartiles and Quintiles
Min and max values -- FNS = (Min, Q1, Median, Q3, Max), fără Mean. -> dar Q1 si Q3 sunt quartile, iar mediana si alte valori cred ca se numesc quintile → quintiles include quartiles (https://en.wikipedia.org/wiki/Quantile#Even-sized_population)
If for 200 items, all positive, 50 are not correctly classified, then the F1-score is:
85%
55%
25%
If D has 50% positive and 50% negative examples the entropy of D is:
1
0
-1
Transaction set: {(1,2,3,5),(2,3,5,6),(3,4,6)}, s=50%. The frequent items are
(1, 2, 3, 5)
(2, 3, 5)
(1, 2, 3, 5, 6)
Transaction set: {(1,2,3,5),(2,3,4,5),(3,4,5)}. The support of the rule (3)->(5) is
33%
66%
100%
In the case of discretization using equi-width bining with width=10 for 0,4,12,16,16,18,24,26,38 we obtain
3 bins
4 bins
5 bins
Detecting outliers using 1,5*IQR:X is outlier if the value of X in {1,2,3,X} is:
5
-2.5
5.9
Using Min-Max normalization, the set {1,2,3,6} is transformed in:
.(0.2, 0.4, 0.6, 0.9)
(0.1, 0.2, 0.3, 0.6)
(0.0, 0.2, 0.4, 1
Using Decimal Scaling, the set {1,2,3,6} is transformed in:
.(0.2, 0.4, 0.6, 0.9)
(0.1, 0.2, 0.3, 0.6)
.(0.2, 0.4, 0.6, 1)
The distance in 1D between the clusters (1,2,3) and (4,5,6) using single link is:
1
3
5
For 4 points in 1D (1,2,5,6), using K-Means with K=2 and initial centroids 1 and 6, the result is:
(1,2) and (5,6)
(1,5) and (2,6)
(1) and (2,5,6)
Vocabulary: {eu, nu, sunt ,acasa. The cosine distance between “ eu sunt” and “ sunt acasa” is:
1/3
1/2
1
Se poate folosi o cheie surogat pentru o tabelă de fapte dacă:
Există dimensiuni identice
Există coloane identice
Există linii identice
În lucrările sale, Ralph Kimball a susținut o stocare a datelor într-un depozit de date folosind o abordare:
Normată
Dimensională
Normalizată
Algoritmii de clasificare sunt de tipul:
Prescriptiv
Descriptiv
Predictiv
Deviația (abaterea) standard a mulțimii {1, 1, 1, 1, 1} este:
1
intre 1 si 2
0
Distanta in 1D intre: (1, 2, 3) si (4, 5, 6) utilizând metoda “complete link” este:
3
5
1
Extragerea și integrarea datelor, informațiilor și cunoștințelor din paginile web fac obiectul:
Mineritului conținutului paginilor web (Web content mining)
Mineritului structurii paginilor web (Web structure mining)
Mineritului utilizării paginilor web (Web usage mining)
Cand etichetele de clasa pentru date nu sunt cunoscute avem:
a. Invatare supervizata
b. Reguli de asociere
c. Invatare nesupervizata
Formula entropiei este cea cunoscuta: Entropie(D) = -Sum [ Pr(c ) * log Pr (c )]. Daca D are 50% exemple pozitive si 50% exemple negative entropia este:
1
0
-1
O tabelă de dimensiuni reprezintă:
Un proces de afaceri
Entități ale lumii reale și nu procese de afaceri
Numere operaționale de control (numar factură, număr comanda, etc.)
În cazul în care studiem secvența de coșuri de cumpărături a unui client posesor de card de loialitate folosind GSP, daca L2 (secvențe frecvente de lungime 2) conține doar secvențele si , are sens să considerăm ca și candidat de lungime 3 secvența <(AB),C>?
nu
da
depinde de restul datelor
Pentru recunoașterea punctelor izolate (outliers) se folosește valoarea 1,5 * IQR. In acest caz, cât ar trebui sa fie X din mulțimea {0, 1, 2, X} pentru a fi considerat punct izolat:
-1.5
-2.5
5.5
În cazul în care studiem secvența de coșuri de cumpărături a unui client posesor de card de loialitate folosind GSP, daca L2 (secvențe frecvente de lungime 2) conține doar secvențele si , are sens să considerăm ca și candidat de lungime 3 secvența ?
depinde de restul datelor
nu
da
Dacă pentru datele unei rețele de magazine o linie a tabelei de fapte reprezintă un bon de cumpărături al unui client, atunci care dimensiune nu poate fi atașată schemei stea:
. Data
Produsul
magazinul
Sesionizarea înseamnă
. Impunerea unor sesiuni
b. Identificarea userilor
c. Identificarea sesiunilor
În cazul algoritmilor de tip Expectation-Maximization, etapa Maximization:
Calculează noi estimări ale parametrilor
Nu utilizează estimările curente ale parametrilor și nici nu calculează noi estimări ale lor
Utilizează estimările curente ale parametrilor
În cadrul cursului acoperirea secvențială (sequential covering) s-a folosit pentru:
. Clustering
b. Inducerea regulilor
c. Construire arbori de decizie
Discretizarea face parte din etapa de:
Preprocesarea datelor
b. Extragerea modelelor și descoperirea cunoștințelor
Vizualizare
Faptul ca într-un depozit de date datele sunt dependente de timp (time-variant) înseamnă că:
Datele din depozit nu pot fi modificate
Datele din depozit sunt actualizate periodic
. Analiza depozitului de date ia în calcul modificările realizate în timp
O tabelă de tipul Aggregated Fact Tables poate conține, pe lângă cheia primara și cheile străine:
Mai multe coloane de fapte (măsuri)
O singură coloană de fapte (măsuri)
Doar date sumarizate (sume, medii, etc)
In cazul SVM, algoritmii de acest tip pot fi folositi pentru un numar de clase:
<2
=2
>2
In cazul MCAR (MCAR = Missing Completely At Random):
. P (labeled=1|x, y) <> P (labeled=0|x, y)
. P (labeled=1| x, y) = P (labeled=1| x)
P (labeled=1|x, y) = P (labeled=1)
Tranzacții: {(1, 2, 3, 5), (2, 3, 5, 6), (1, 4, 6)} ; s = 50%. Atunci articolele frecvente sunt:
{2, 3, 5}
{1, 2, 3, 5}
{1, 2, 3, 5, 6}
O diferență dintre un depozit de date (DWH) și un magazin de date operaționale (Operational Data Store – ODS) este:
Datele din DWH sunt orientate pe subiecte pe când cele din ODS pe activități
Datele din ODS sunt datele curente pe când cele din DWH sunt istorice
Datele din DWH sunt datele curente pe când cele din ODS sunt istorice
In cazul SVM/separare non-liniara asa numitul „feature space” are de obicei:
Mai putine dimensiuni
Acelasi numar de dimensiuni
Mai multe dimensiuni
Fie vocabularul {eu, nu, sunt, acasa}. Distanta cosinus intre 'eu sunt acasa' si 'nu sunt acasa' este:
1/3
1
2/3
Fie o scoala avand 40% elevi si 60% eleve. Elevele poarta sort sau fusta in proportii egale iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand sort. Care este probabilitatea ca persoana respectiva sa fie o eleva?
63%
43%
53%
Faptul că un depozit de date este orientat (axat) pe subiecte înseamnă că:
Datele pot fi actualizate sau șterse în funcție de subiectele conținute
Datele sunt organizate considerând categoriile de informații stocate
Datele sunt organizate considerând activitățile principale ale companiei
Faptul că datele dintr-un depozit de date sunt non-volatile înseamnă că:
Datele pot fi actualizate (UPDATE) dar nu mai pot fi șterse
Datele pot fi actualizate sau șterse în funcție de subiectele conținute
O data încărcate în depozit datele nu mai sunt modificate sau șterse
In cazul MNAR (MNAR = Missing Not At Random):
P (labeled=1| x, y) = P (labeled=1| x)
P (labeled=1|x, y) = P (labeled=1)
P (labeled=1|x, y) <> P (labeled=0|x, y)
Distanta in 1D intre: (1, 2, 6) si (1, 5, 6) utilizând metoda centroizilor este:
3
5
1
O tabelă de fapte (măsuri) reprezintă:
Entități ale lumii reale și nu procese de afaceri
Numere operaționale de control (numar factură, număr comanda, etc.)
Un proces de afaceri
Fie în 1D doua clustere: (1 ,2) și (3, 4). Care este valoarea siluetei s(2) a punctului 2 din (1, 2):
2/3
3/5
1/3
(A, BC) este o subsecvență pentru:
a. (B, AB, AC, BCD)
b. (ABC)
c. (A, B, C)
In cazul algoritmului Co-training (versiunea Blum and Mitchel), tabela conținând setul de antrenament va fi fragmentată în vederea construirii de clasificatori:
Pe verticală
Nu se fragmentează
Pe orizontală
O schemă fulg-de-zăpadă (Snow-flake) se obține dintr-o schemă stea când:
Normalizăm tabelele de dimensiuni
Normalizăm tabela de fapte
. Normalizăm atât tabela de fapte cât și tabelele de dimensiuni
O tabelă de tipul Periodic snapshot fact table poate conține, pe lângă cheia primară și cheile străine:
Doar o singură coloană de fapte (măsuri)
Mai multe coloane de fapte (măsuri)
Doar date agregate (sume, medii, etc)
Relația între Common Logfile Format și Combined Log File Format este :
Informațiile din Common Logfile Format includ pe cele din Combined Log File Format
Common Logfile Format și Combined Log File Format sunt disjuncte
Informațiile din Common Logfile Format sunt incluse în Combined Log File Format
Fie patru puncte in plan, A(0, 0), B(4, 0), C(4, 2), D(0, 2). In contextul evaluarii clusterelor, pentru impartirea in doua clustere: (A, D) si (B, C), suma patratelor distantelor (SSD) este:
40
4
16
Cheile surogat sunt recomandate de R. Kimball pentru:
Tabelele de fapte
. Tabelele de dimensiuni
Tabelele de evenimente
In cazul SVM, o functie kernel liniara este de tipul:
K(X, Y) = Power((a * + b), p)
K(X, Y) = + b
tanh(a * + b)
Daca din 200 cazuri de test, toate pozitive, 50 sunt clasificate gresit, Recall este egal cu:
50%
75%
0%
În cazul normalizării Min-Max, mulțimea {1, 2, 3, 6} devine:
{0.0, 0.2, 0.4, 1}
{0.2, 0.4, 0.6, 0.9}
. {0.1, 0.2, 0.3, 0.6}
Tranzacții: {(1, 2, 3, 5), (2, 4, 5), (2, 3, 4, 5)}. Încrederea regulii {5} → {2} este aproximativ:
50
100
66
In cazul in care exemplele etichetate sunt toate din clasa pozitiva, pentru construirea multimii care va fi considerata continand exemple negative cursul prezinta algoritmi ca:
CO-TRAINING
ASSEMBLE
ROCCHIO
In contextul evaluarii clusterelor, o valoare pozitiva a siluetei pentru un punct asignat unui cluster arata ca punctul a fost corect asignat?
adevarat
fals
Daca avem punctele A si B într-un spațiu cu 4 dimensiuni și distanta între ele pentru fiecare dimensiune este cea din tabelul de mai jos, care este distanța dintre A si B obținută prin combinarea acestora
3
null
0.75
O dimensiune degenerată reprezintă:
Entități ale lumii reale și nu procese de afaceri
Un proces de afaceri
Numere operaționale de control (număr factură, număr comanda, etc.)
Algoritmii de clustering sunt de tipul:
. Descriptiv
Prescriptiv
Predictiv
Ca dată despre o persoana, genul (masculin, feminin) este un atribut de tip:
Interval
Binar simetric
Binar asimetric
Daca din 200 cazuri de test 50 sunt clasificate gresit acuratetea este egala cu:
25
75
50
O dimensiune degenerată reprezintă:
Entități ale lumii reale și nu procese de afaceri
Numere operaționale de control (număr factură, număr comanda, etc.)
Un proces de afaceri
In cazul clusteringului ierarhic se obține o:
. Drendograma
Dendrograma
Dendograma
Utilizatorii obișnuiți ai unui depozit de date lucrează cu datele din:
Data Staging Area
Sistemele operaționale
Data Presentation Area
In cazul clusteringului ierarhic, pentru a obține un set de clustere se face:
O tăiere neuniformă a ierarhiei obținute
O tăiere pe orizontală a ierarhiei obținute
O tăiere pe verticală a ierarhiei obținute
Procesul ETL (Extract-Transform-Load) este mai dificil de efectuat în cazul abordării dimensionale decât în cazul celeilalte abordări prezentate în curs?
adevarat
fals
În contextul cursului nostru, care afirmație este corectă
Depozitele de date si Data Mart-urile nu au nimic în comun
Un depozit de date conține de obicei date pe mai multe subiecte pe când un Data mart conține de obicei date despre un singur subiect
Un Data Mart conține de obicei date pe mai multe subiecte pe când un depozit de date conține de obicei date despre un singur subiect
Tabelele de dimensiuni au ca si cheie primară:
O cheie surogat (generată de sistemul de gestiune)
O cheie naturală (de exemplu codul de bare pentru produse)
O cheie furnizată de utilizator
Fie o scoala avand 80% elevi si 20% eleve. Elevele poarta la ora de sport sort sau fusta in proportii egale iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand sort. Care este probabilitatea ca persoana respectiva sa fie o eleva?
31
21
11
Algoritmul K-Means :
Nu este potrivit pentru a găsi clustere care nu sunt hiper-elipsoizi (sau hiper-sfere)
Nu este potrivit pentru a găsi clustere care sunt hiper-elipsoizi (sau hiper-sfere)
. Este potrivit pentru a găsi clustere care nu sunt hiper-elipsoizi (sau hiper-sfere)
In cazul MCAR (MCAR = Missing Completely At Random):
P (labeled=1|x, y) <> P (labeled=0|x, y)
(labeled=1|x, y) = P (labeled=1)
P (labeled=1| x, y) = P (labeled=1| x)
Încrederea unei reguli de asociere X → Y este dată de formula:
Suport (X∪Y) / Suport (X)
Suport (X∪Y)
Suport (X∩Y)
Faptul că un depozit de date este orientat (axat) pe subiecte înseamnă că:
Datele sunt organizate considerând activitățile principale ale companiei
Datele sunt organizate considerând categoriile de informații stocate
Datele pot fi actualizate sau șterse în funcție de subiectele conținute
Faptul că un depozit de date este orientat (axat) pe subiecte înseamnă că:
Datele sunt organizate considerând activitățile principale ale companiei
Datele sunt organizate considerând categoriile de informații stocate
Datele pot fi actualizate sau șterse în funcție de subiectele conținute
Tranzacții: {(1, 2, 3, 5), (2, 4, 5), (2, 3, 4, 5)}. Încrederea regulii {5} → {2} este aproximativ:
50
66
100
Pentru recunoașterea punctelor izolate (outliers) se folosește valoarea 1,5 * IQR. In acest caz, cât ar trebui sa fie X din mulțimea {0, 1, 2, X} pentru a fi considerat punct izolat:
-2.5
-1.5
5.5
In cazul MNAR (MNAR = Missing Not At Random):
P (labeled=1| x, y) = P (labeled=1| x)
P (labeled=1|x, y) <> P (labeled=0|x, y)
. P (labeled=1|x, y) = P (labeled=1)
În cazul în care studiem secvența de coșuri de cumpărături a unui client posesor de card de loialitate folosind GSP, daca L2 (secvențe frecvente de lungime 2) conține doar secvențele si , are sens să considerăm ca și candidat de lungime 3 secvența <(AB),C>?
da
nu
depinde de restul datelor
Daca A este o mulțime frecventă și s este pragul de suport (ca procent) atunci:
Fiecare tranzacție care o conține pe A este de asemenea o mulțime frecventă
Fiecare mulțime care conține un articol din A este de asemenea frecventă
Fiecare articol din A este în cel puțin s% tranzacții
Fie în 1D doua clustere: (1 ,2) și (3, 4). Care este valoarea siluetei s(1) a punctului 1 din (1, 2):
3/5
2/3
1/3
Care afirmatie e adevarata:
K-Modes se poate folosi pentru date categorice
. K-Modes este un algoritm de clasificare
c. K-Modes este un algoritm de regresie
O cheie străină care referă o anumită dimensiune:
a. Poate referi o cheie unică diferită de cheia primară
b. Poate sa aibă un nume diferit de cheia primară referită
c. Trebuie sa aibă nume identic cu cheia primară referită
Pentru evitarea fenomenului de overfitting la arbori de decizie se poate folosi:
a. Doar Post-pruning
b. Doar Pre-pruning
c. Atât Pre-pruning cât și post-pruning
Cheile surogat sunt recomandate de R. Kimball pentru:
a. Tabelele de evenimente
b. Tabelele de fapte
c. Tabelele de dimensiuni
În cazul unei reguli de asociere X → Y, X si Y sunt:
a. Mulțimi de articole
b. Mulțimi de clase
c. Mulțimi frecvente de articole
Un atribut non-aditiv:
a. Poate fi agregat pe cel puțin o dimensiune
b. Nu poate fi agregat pe nici a dimensiunilor
c. Poate fi agregat pe toate dimensiunile
Fie punctele A, B si C si distantele intre ele d(A,B)=3, d(A,C)=5, d(B,C)=4 (numere pitagoreice). In contextul algoritmului FastMap, coordonata punctului C pe axa AB (origine in A) este:
3
2
5
Fie patru puncte in plan, A(0, 0), B(4, 0), C(4, 2), D(0, 2). In contextul evaluarii clusterelor, pentru impartirea in doua clustere: (A, D) si (B, C), suma patratelor distantelor (SSD) este:
40
4
16
Folosirea teoriei grafurilor pentru analiza structurii si conexiunilor intre noduri (pagini web) fac obiectul:
a. Mineritului utilizării paginilor web (Web usage mining)
b. Mineritului conținutului paginilor web (Web content mining)
c. Mineritului structurii paginilor web (Web structure mining)
Din principiul Apriori rezultă că dacă avem doua mulțimi frecvente A si B atunci și X este frecventă, unde:
a. X = Intersecție(A, B)
b. X = Reuniune(A, B)
c. X = Produs_Cartezian(A, B)
Efectul Hughes arata ca:
a. Pentru un număr dat de exemple de antrenament, puterea predictivă crește pe măsură ce dimensionalitatea crește
b. Pentru un număr dat de exemple de antrenament, puterea predictivă scade pe măsură ce dimensionalitatea scade
c. Pentru un număr dat de exemple de antrenament, puterea predictivă scade pe măsură ce dimensionalitatea crește
În cazul în care studiem secvența de coșuri de cumpărături a unui client posesor de card de loialitate folosind GSP, daca L2 (secvențe frecvente de lungime 2) conține doar secvențele si , are sens să considerăm ca și candidat de lungime 3 secvența ?
a. Nu
b. Depinde de restul datelor
c. Da
In Common Logfile Format, statusul "Succes" este reprezentat prin codul numeric:
a. 400
b. 200
c. 300
În contextual cursului nostru, abrevierea ETL înseamnă:
a. Endorsed Tools List
b. Extract, Transform, Load
c. Event Trace Log
În cazul algoritmilor de tip Expectation-Maximization, etapa Expectation:
a. Nu utilizează estimările curente ale parametrilor și nici nu calculează noi estimări ale lor
b. Calculează noi estimări ale parametrilor
c. Utilizează estimările curente ale parametrilor
În cazul normalizării Min-Max, mulțimea {1, 2, 3, 6} devine:
a. {0.1, 0.2, 0.3, 0.6}
b. {0.2, 0.4, 0.6, 0.9}
c. {0.0, 0.2, 0.4, 1}
O tabelă de tipul Factless Fact Tables poate conține, pe lângă cheia primara și cheile străine:
a. Mai multe coloane de fapte (măsuri)
b. O singură coloană de fapte (măsuri)
c. Nicio coloană de fapte (măsuri).
Dacă pentru datele unei rețele de magazine o linie a tabelei de fapte reprezintă un bon de cumpărături al unui client, atunci care dimensiune nu poate fi atașată schemei stea:
a. Magazinul
b. Produsul
c. Data
În cazul Discretizării utilizând împărțirea în benzi egale (“equi-width binning”) cu lățime = 10, pentru valorile 0, 4, 12, 16, 16, 18, 24, 26, 38 obținem:
a. 3 benzi
b. 5 benzi
c. 4 benzi
Fie o scoala avand 40% elevi si 60% eleve. Elevele poarta sort sau fusta in proportii egale iar baietii doar sort. Un observator vede de la mare distanta o persoana purtand sort. Care este probabilitatea ca persoana respectiva sa fie o eleva?
63
53
43
In cazul algoritmului Co-training (versiunea Blum and Mitchel), tabela conținând setul de antrenament va fi fragmentată în vederea construirii de clasificatori:
a. Pe verticală
b. Nu se fragmentează
c. Pe orizontală
Formula entropiei este cea cunoscuta: Entropie(D) = -Sum [ Pr(c ) * log Pr (c )]. Daca D are 100% exemple negative entropia este:
-1
1
0
Intr-ul spatiu 1D avem 2 puncte rosii (1 si 3) si 2 puncte albastre (10 si 11). Folosind kNN pentru k = 3, punctul 7 este:
a. Nu i se poate asocia o culoare
b. Rosu
c. Albastru
Pretul total al unei linii dintr o factura este un exemplu de atribut
aditiv
non-aditiv
semi-aditiv
In cazul algoritmul Co-training (versiunea Goldman and Zhou), tabela continand setul de antrenament va fi fragmentata in vederea construirii de clasificatori
pe orizontala
pe verticala
nu se fragmenteaza
Gradele militare sunt valori de tip
ordinal
nominal
interval
Dimensiunile conforme permit integrarea in acelasi raport a unor date din
mai multe tabele de dimensiuni
mai multe momente de timp
mai multe tabele de fapte
Care afirmatie e adevarata
FastMap se poate folosi inainte de K-Means
FastMap se poate folosi in loc de K-Means
FastMap se poate folosi dupa K-Means
Pretul unitar al unui articol dintr-o factura este un exemplu de atribut
aditiv
semi-aditiv
non-aditiv
in cazul Random Forest, numarul de atribute luate in calcul la fiecare ramificare este:
mai mic decat numarul de atribute ale multimii de antrenare
egal cu numarul de atribute ale multimii de antrenare
mai mare decat numarul de atribute ale multimii de antrenare
in cazul MAR (MAR = Missing at Random)
P (labeled = 1| x, y) = P (labeled = 1| x)
P (labeled = 1| x, y) = P (labeled = 1)
P (labeled = 1| x, y) <> P (labeled = 0| x, y)
Relatia dintre Data Staging Area si Data Presentation Area este:
Datele provenind din Data Presentation Area sunt incarcate in Data Staging Area
Datele provenind din Data Staging Area sunt incarcate in Data Presentation Area
Intre cele doua zone sunt plasate uneltele de prelucrare (Data Access Tools)
Care este valoarea de adevar a afirmatiei: "un punct intr-o zona libera (eng: hole) spune ca o anumita combinatie de valori de atribute e foarte posibila"
adevarat
false
O schema stea are in centru:
o tabela de dimensiune
fie o tabela de fapte fie una de dimensiune
o tabela de fapte (masuri)
Varianta (eng. Variance) multimii {0,1,2,3,4} este:
10
2
intre 3 si 4
3
null
4
Termenul Bagging vine de la
Baggels proofreading
Bootstrap Agging
Bootstrap Aggregating
Care afirmatie este adevarata
Tabelele de fapte si cele de dimensiuni contin cate o cheie straina pentru fiecare tabela de celalalt tip de care sunt legate intr-o schema stea
o tabela de dimensiune contine cate o cheie straina pentru fiecare tabela de fapte de care este legata intr-o schema stea
o tabela de fapte contine cate o cheie straina pentru fiecare dimensiune de care este legata intr-o schema stea
