Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

260122 TARS

Total questions: 16

Worksheet time: 10mins

Name
Class
Date
1.

Dai un'occhiata al Q-Q plot in figura. Che tipo di distribuzione indica il grafico?

a)

Normale

b)

Platicurtica

c)

Asimmetrica

d)

Leptocurtica

2.

Uno studio ha raccolto dati su un campione di 100 studenti, misurando due variabili cardinali: età e probabilità di voto alle elezioni. Il coefficiente di correlazione di Pearson calcolato tra le due variabili è r = 0,81. Quale delle seguenti affermazioni è più corretta?

a)

Esiste una forte correlazione negativa tra le due variabili

b)

La probabilità di voto aumenta all’aumentare dell'età, ma non necessariamente in modo lineare

c)

Esiste una forte correlazione lineare positiva tra le due variabili

d)

Le due variabili sono indipendenti

3.

Una ricercatrice costruisce un modello di regressione lineare multipla per prevedere il numero di oggetti inseriti nel carrello della spesa (variabile dipendente) sulla base di due predittori: minuti trascorsi nel punto vendita e numero di passi effettuati. L’output semplificato è il seguente:

oggetti carrello = 18 + 0,7 × minuti − 0,5 × passi. Come si interpreta il coefficiente −0,5 davanti alla variabile "passi"?

a)

Ogni passo riduce la dimensione del carrello di 0,5 punti, mantenendo costanti i minuti trascorsi

b)

La dimensione del carrello aumenta di 0,5 punti per ogni passo in più

c)

Ogni passo influisce solo se accompagnato da meno di 5 minuti trascorsi nel punto vendita

d)

Il coefficiente non è interpretabile senza il valore di R²

4.

In un’analisi di regressione multipla con tre variabili indipendenti, un ricercatore ottiene i seguenti risultati: R² = 0,60, p-value dell’ANOVA del modello = 0,004. Cosa indica il p-value dell’ANOVA del modello in questo contesto?

a)

Che tutte le variabili indipendenti sono significative

b)

Che almeno una variabile indipendente spiega una quota significativa della varianza della dipendente

c)

Che il modello ha un buon adattamento ai dati

d)

Che R² è significativamente diverso da zero solo se supera 0,5

5.

Uno psicologo ha somministrato 10 test cognitivi a 200 partecipanti e ha eseguito una PCA (analisi delle componenti principali). La tabella mostra i loadings delle prime due componenti (PC1 e PC2) per 4 test. Quale interpretazione è CORRETTA?

a)
  1. PC1 rappresenta principalmente abilità motorie, mentre PC2 rappresenta abilità cognitive

b)
  1. Il test di memoria verbale contribuisce poco a entrambe le componenti

c)
  1. PC1 sembra rappresentare abilità cognitive generali, PC2 abilità motorie

d)
  1. Le due componenti sono fortemente correlate tra loro (r > 0.7)

6.

Un ricercatore ha somministrato un questionario composto da 10 item per misurare il concetto di "benessere emotivo". Dopo aver raccolto i dati, calcola l'Alpha di Cronbach e ottiene un valore di 0.53. Cosa indica questo valore di Alpha di Cronbach riguardo alla coerenza interna della scala?

a)

La scala ha una bassa coerenza interna e gli item probabilmente non misurano lo stesso costrutto

b)

La scala ha una buona coerenza interna e gli item mostrano una buona affidabilità nel misurare il benessere emotivo

c)

La scala ha una perfetta coerenza interna e gli item sono ridondanti

d)

L'Alpha di Cronbach non fornisce informazioni sull'attendibilità interna della scala.

7.

Una piattaforma di streaming video desidera segmentare i propri clienti in gruppi con comportamenti simili, per poter suggerire film e serie tv personalizzati. Ha a disposizione dati storici sugli stream dei clienti, ma non ha etichette predefinite che indichino a quale gruppo appartiene ciascun cliente. Quale delle seguenti tecniche di machine learning sarebbe più appropriata per questo compito?

a)

Regressione lineare

b)

Classificazione con Support Vector Machines (SVM)

c)

Clustering con k-means

d)

Alberi decisionali per la classificazione

8.

Quale delle seguenti affermazioni confronta correttamente un algoritmo di apprendimento supervisionato con uno non supervisionato?

a)

Entrambi gli algoritmi richiedono dati di input etichettati per l'addestramento

b)

Gli algoritmi di apprendimento supervisionato sono sempre più accurati degli algoritmi di apprendimento non supervisionato

c)

Gli algoritmi non supervisionati non necessitano di una fase di training, a differenza di quelli supervisionati

d)

Gli algoritmi supervisionati apprendono una funzione di "mapping" tra input e output basandosi su dati etichettati, mentre quelli non supervisionati cercano pattern intrinseci nei dati non etichettati

9.

In un'analisi TF-IDF (Term Frequency-Inverse Document Frequency) di un corpus di documenti, un termine ottiene un punteggio TF-IDF molto alto. Cosa indica questo?

a)

Il termine è una 'stop word' come 'il' o 'e'

b)

Il termine è molto frequente in un documento specifico ma raro nel resto del corpus

c)

Il termine è molto comune in tutti i documenti del corpus

d)

Il termine appare solo una volta in tutto il corpus

10.

Un team di ricerca ha sviluppato un modello di classificazione, per prevedere se un cliente abbandonerà o meno un servizio. Dopo aver addestrato il modello su un set di dati storico, lo valutano utilizzando lo stesso set di dati e ottengono un'accuratezza del 98%. Tuttavia, quando il modello viene messo in produzione e applicato a nuovi dati, le sue prestazioni scendono drasticamente a un'accuratezza del 70%. Quale dei seguenti problemi è la causa più probabile di questo calo di performance?

a)

Sottoutilizzo di risorse computazionali durante l'addestramento

b)

Eccessiva regolarizzazione applicata al modello

c)

Overfitting del modello sui dati di addestramento

d)

Insufficiente quantità di dati di addestramento

11.

Un analista utilizza l’algoritmo k-means (k-medie) per tipizzare gli utenti di un servizio di bike sharing in base a 10 variabili in suo possesso. Imposta k = 3. Cosa rappresentano i tre centroidi calcolati dall’algoritmo?

a)

Gli utenti più rappresentativi del dataset

b)

Le osservazioni più vicine alla media complessiva

c)

I centri geometrici dei tre gruppi di utenti identificati

d)

I punti massimi della funzione obiettivo

12.

Un ricercatore ha effettuato un’analisi fattoriale su un set di dati composto da 10 variabili psicologiche. Prima di procedere, ha eseguito il test di Bartlett e ha calcolato l’indice KMO (Kaiser-Meyer-Olkin), ottenendo i seguenti risultati:

  • KMO = 0,54

  • p-value del test di Bartlett < 0,001

Quale delle seguenti affermazioni è corretta?

a)

I dati sono adeguati all’analisi fattoriale perché il p-value è significativo

b)

Il valore di KMO indica che l’analisi fattoriale è appropriata

c)

I dati non sono adatti all’analisi fattoriale perché il valore di KMO è troppo basso

d)

Il test di Bartlett serve a verificare l’assunzione di normalità

13.

In un esperimento di tipo ANOVA within, ho calcolato il test di Mauchly per verificare il presupposto di sfericità. Il test di Mauchly è pari a 0,80 e il suo p-level è 0,02. Come devo procedere?

a)

Va bene così. La varianza non presenta "tridimensionalità"

b)

La varianza within è disomogenea e devo correggere le stime, riportando il p di Greenhouse-Gesser

c)

La varianza within è disomogenea e devo correggere le stime, riportando il p di Huynh-Feldt

d)

Devo procedere alla misurazione del test di Tukey

14.

Cosa si intende per "multicollinearità" in statistica?

a)

La presenza di correlazioni tra variabili indipendenti

b)

La presenza di relazioni non lineari (a collina, appunto) tra la variabile dipendente e le indipendenti

c)

La presenza di variabili indipendenti non correlate tra loro

d)

La presenza di più picchi di frequenza nel diagramma a dispersione

15.

Per una ricerca sociologica, hai bisogno di sapere in che misura la stampa associa le parole "Trump" e "democratura". Negli articoli che stai analizzando, le due parole si presentano ASSIEME, in totale, 10 volte. La parola "Trump" da sola, invece, compare 49 volte, mentre la parola "democratura" compare 25 volte. Quanto vale l'associazione tra queste due parole nel corpus analizzato?

a)

Circa 0,28

b)

Circa 0,53

c)

Circa 0,59

d)

Circa 0,06

16.

Un ricercatore studia la relazione tra: reddito (x) e spesa culturale (y), controllando per il livello di istruzione (z). L’analisi mostra che: la correlazione tra reddito e spesa culturale è positiva,

  • ma diventa nulla quando si controlla per l’istruzione. Quale interpretazione è corretta?

a)

Il reddito causa direttamente la spesa culturale

b)

L’istruzione è una variabile interveniente che spiega la relazione osservata

c)

La spesa culturale influenza il reddito

d)

La correlazione iniziale era dovuta a un errore di misurazione