WorksheetsVectorSpaceModels
Total questions: 15
Worksheet time: 7mins
Qu’est-ce qu’un modèle d’espace vectoriel ?
Un modèle qui classe les documents par ordre alphabétique
Un modèle qui représente les mots ou phrases sous forme de vecteurs numériques
Un modèle qui traduit les textes en plusieurs langues
Un modèle qui analyse la grammaire des phrases
Quel est le principe de l’encodage One-Hot?
Chaque mot est représenté par une séquence de n mots
Chaque mot est représenté par sa fréquence dans le document
Chaque mot est représenté par un score TF-IDF
Chaque mot est représenté par un vecteur binaire avec un seul 1 à la position du mot
Quelle est une limite principale de l’encodage One-Hot ?
Il prend en compte la similarité sémantique
Il gère bien les nouveaux mots
Les vecteurs sont très longs et creux
Il réduit la dimensionnalité automatiquement
Dans le modèle Bag-of-Words, que représente chaque dimension du vecteur
Un document unique
Une phrase du texte
Un mot unique du vocabulaire
Un score TF-IDF
Quel est le principal inconvénient du Bag of N-Grams quand n augmente ?
La vectorisation devient plus rapide
La dimension du vecteur explose et la sparsité augmente
La similarité sémantique est mieux capturée
Le problème OOV disparaît
Que mesure le TF dans le modèle TF-IDF ?
La fréquence d’un mot dans un document
La fréquence d’un mot dans le corpus
La position d’un mot dans la phrase
La similarité entre deux mots
Dans le cadre du modèle TF-IDF, que se passe-t-il si un mot apparaît dans tous les documents du corpus ?
Son poids TF-IDF sera élevé
Son poids TF-IDF sera nul
Son poids TF-IDF sera négatif
Son poids TF-IDF sera identique à sa fréquence brute
Dans la construction d’une matrice de cooccurrence mot-par-mot, que représente chaque cellule de la matrice ?
La somme des fréquences des deux mots dans le corpus
La distance euclidienne entre les deux mots
Le nombre de fois où les deux mots apparaissent ensemble
Le produit scalaire des deux mots
Dans le calcul de la similarité cosinus, que se passe-t-il si deux vecteurs sont orthogonaux ?
Leur similarité cosinus est 1
Leur similarité cosinus est -1
Leur similarité cosinus est infinie
Leur similarité cosinus est 0
Quelle est la formule permettant de calculer le cosinus de l’angle β entre deux vecteurs A et B ?
(a)
Quel est le but principal de la réduction de dimension ?
Augmenter la taille des vecteurs
Ajouter plus de caractéristiques
Visualiser les données textuelles dans un espace plus petit
Supprimer les mots fréquents
Quelle méthode est utilisée pour projeter des vecteurs de grande dimension dans un espace 2D ?
Bag-of-Words
TF-IDF
Encodage One-Hot
PCA (Analyse en Composantes Principales)
Dans le PCA, que représentent les valeurs propres (eigenvalues) ?
La direction principale de variation
La variance expliquée dans chaque direction
Le nombre de dimensions conservées
La fréquence des mots
Lors de l’application du PCA sur des embeddings de mots, que représente le premier vecteur propre (eigenvector) ?
La direction de la variance maximale
La direction de la variance minimale
La moyenne des données
La somme des valeurs propres
Dans le processus de PCA, pourquoi est-il important de normaliser les données avant de calculer la matrice de covariance ?
Pour réduire la dimensionnalité
Pour que toutes les caractéristiques soient sur la même échelle
Pour augmenter la variance totale
Pour faciliter le calcul du produit scalaire
