Worksheets260122 TARS
Total questions: 16
Worksheet time: 10mins
Dai un'occhiata al Q-Q plot in figura. Che tipo di distribuzione indica il grafico?
Normale
Platicurtica
Asimmetrica
Leptocurtica
Uno studio ha raccolto dati su un campione di 100 studenti, misurando due variabili cardinali: età e probabilità di voto alle elezioni. Il coefficiente di correlazione di Pearson calcolato tra le due variabili è r = 0,81. Quale delle seguenti affermazioni è più corretta?
Esiste una forte correlazione negativa tra le due variabili
La probabilità di voto aumenta all’aumentare dell'età, ma non necessariamente in modo lineare
Esiste una forte correlazione lineare positiva tra le due variabili
Le due variabili sono indipendenti
Una ricercatrice costruisce un modello di regressione lineare multipla per prevedere il numero di oggetti inseriti nel carrello della spesa (variabile dipendente) sulla base di due predittori: minuti trascorsi nel punto vendita e numero di passi effettuati. L’output semplificato è il seguente:
oggetti carrello = 18 + 0,7 × minuti − 0,5 × passi. Come si interpreta il coefficiente −0,5 davanti alla variabile "passi"?
Ogni passo riduce la dimensione del carrello di 0,5 punti, mantenendo costanti i minuti trascorsi
La dimensione del carrello aumenta di 0,5 punti per ogni passo in più
Ogni passo influisce solo se accompagnato da meno di 5 minuti trascorsi nel punto vendita
Il coefficiente non è interpretabile senza il valore di R²
In un’analisi di regressione multipla con tre variabili indipendenti, un ricercatore ottiene i seguenti risultati: R² = 0,60, p-value dell’ANOVA del modello = 0,004. Cosa indica il p-value dell’ANOVA del modello in questo contesto?
Che tutte le variabili indipendenti sono significative
Che almeno una variabile indipendente spiega una quota significativa della varianza della dipendente
Che il modello ha un buon adattamento ai dati
Che R² è significativamente diverso da zero solo se supera 0,5
Uno psicologo ha somministrato 10 test cognitivi a 200 partecipanti e ha eseguito una PCA (analisi delle componenti principali). La tabella mostra i loadings delle prime due componenti (PC1 e PC2) per 4 test. Quale interpretazione è CORRETTA?
PC1 rappresenta principalmente abilità motorie, mentre PC2 rappresenta abilità cognitive
Il test di memoria verbale contribuisce poco a entrambe le componenti
PC1 sembra rappresentare abilità cognitive generali, PC2 abilità motorie
Le due componenti sono fortemente correlate tra loro (r > 0.7)
Un ricercatore ha somministrato un questionario composto da 10 item per misurare il concetto di "benessere emotivo". Dopo aver raccolto i dati, calcola l'Alpha di Cronbach e ottiene un valore di 0.53. Cosa indica questo valore di Alpha di Cronbach riguardo alla coerenza interna della scala?
La scala ha una bassa coerenza interna e gli item probabilmente non misurano lo stesso costrutto
La scala ha una buona coerenza interna e gli item mostrano una buona affidabilità nel misurare il benessere emotivo
La scala ha una perfetta coerenza interna e gli item sono ridondanti
L'Alpha di Cronbach non fornisce informazioni sull'attendibilità interna della scala.
Una piattaforma di streaming video desidera segmentare i propri clienti in gruppi con comportamenti simili, per poter suggerire film e serie tv personalizzati. Ha a disposizione dati storici sugli stream dei clienti, ma non ha etichette predefinite che indichino a quale gruppo appartiene ciascun cliente. Quale delle seguenti tecniche di machine learning sarebbe più appropriata per questo compito?
Regressione lineare
Classificazione con Support Vector Machines (SVM)
Clustering con k-means
Alberi decisionali per la classificazione
Quale delle seguenti affermazioni confronta correttamente un algoritmo di apprendimento supervisionato con uno non supervisionato?
Entrambi gli algoritmi richiedono dati di input etichettati per l'addestramento
Gli algoritmi di apprendimento supervisionato sono sempre più accurati degli algoritmi di apprendimento non supervisionato
Gli algoritmi non supervisionati non necessitano di una fase di training, a differenza di quelli supervisionati
Gli algoritmi supervisionati apprendono una funzione di "mapping" tra input e output basandosi su dati etichettati, mentre quelli non supervisionati cercano pattern intrinseci nei dati non etichettati
In un'analisi TF-IDF (Term Frequency-Inverse Document Frequency) di un corpus di documenti, un termine ottiene un punteggio TF-IDF molto alto. Cosa indica questo?
Il termine è una 'stop word' come 'il' o 'e'
Il termine è molto frequente in un documento specifico ma raro nel resto del corpus
Il termine è molto comune in tutti i documenti del corpus
Il termine appare solo una volta in tutto il corpus
Un team di ricerca ha sviluppato un modello di classificazione, per prevedere se un cliente abbandonerà o meno un servizio. Dopo aver addestrato il modello su un set di dati storico, lo valutano utilizzando lo stesso set di dati e ottengono un'accuratezza del 98%. Tuttavia, quando il modello viene messo in produzione e applicato a nuovi dati, le sue prestazioni scendono drasticamente a un'accuratezza del 70%. Quale dei seguenti problemi è la causa più probabile di questo calo di performance?
Sottoutilizzo di risorse computazionali durante l'addestramento
Eccessiva regolarizzazione applicata al modello
Overfitting del modello sui dati di addestramento
Insufficiente quantità di dati di addestramento
Un analista utilizza l’algoritmo k-means (k-medie) per tipizzare gli utenti di un servizio di bike sharing in base a 10 variabili in suo possesso. Imposta k = 3. Cosa rappresentano i tre centroidi calcolati dall’algoritmo?
Gli utenti più rappresentativi del dataset
Le osservazioni più vicine alla media complessiva
I centri geometrici dei tre gruppi di utenti identificati
I punti massimi della funzione obiettivo
Un ricercatore ha effettuato un’analisi fattoriale su un set di dati composto da 10 variabili psicologiche. Prima di procedere, ha eseguito il test di Bartlett e ha calcolato l’indice KMO (Kaiser-Meyer-Olkin), ottenendo i seguenti risultati:
KMO = 0,54
p-value del test di Bartlett < 0,001
Quale delle seguenti affermazioni è corretta?
I dati sono adeguati all’analisi fattoriale perché il p-value è significativo
Il valore di KMO indica che l’analisi fattoriale è appropriata
I dati non sono adatti all’analisi fattoriale perché il valore di KMO è troppo basso
Il test di Bartlett serve a verificare l’assunzione di normalità
In un esperimento di tipo ANOVA within, ho calcolato il test di Mauchly per verificare il presupposto di sfericità. Il test di Mauchly è pari a 0,80 e il suo p-level è 0,02. Come devo procedere?
Va bene così. La varianza non presenta "tridimensionalità"
La varianza within è disomogenea e devo correggere le stime, riportando il p di Greenhouse-Gesser
La varianza within è disomogenea e devo correggere le stime, riportando il p di Huynh-Feldt
Devo procedere alla misurazione del test di Tukey
Cosa si intende per "multicollinearità" in statistica?
La presenza di correlazioni tra variabili indipendenti
La presenza di relazioni non lineari (a collina, appunto) tra la variabile dipendente e le indipendenti
La presenza di variabili indipendenti non correlate tra loro
La presenza di più picchi di frequenza nel diagramma a dispersione
Per una ricerca sociologica, hai bisogno di sapere in che misura la stampa associa le parole "Trump" e "democratura". Negli articoli che stai analizzando, le due parole si presentano ASSIEME, in totale, 10 volte. La parola "Trump" da sola, invece, compare 49 volte, mentre la parola "democratura" compare 25 volte. Quanto vale l'associazione tra queste due parole nel corpus analizzato?
Circa 0,28
Circa 0,53
Circa 0,59
Circa 0,06
Un ricercatore studia la relazione tra: reddito (x) e spesa culturale (y), controllando per il livello di istruzione (z). L’analisi mostra che: la correlazione tra reddito e spesa culturale è positiva,
ma diventa nulla quando si controlla per l’istruzione. Quale interpretazione è corretta?
Il reddito causa direttamente la spesa culturale
L’istruzione è una variabile interveniente che spiega la relazione osservata
La spesa culturale influenza il reddito
La correlazione iniziale era dovuta a un errore di misurazione
