wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

VectorSpaceModels

Total questions: 15

Worksheet time: 7mins

Name
Class
Date
1.

Qu’est-ce qu’un modèle d’espace vectoriel ?

a)

Un modèle qui classe les documents par ordre alphabétique

b)

Un modèle qui représente les mots ou phrases sous forme de vecteurs numériques

c)


Un modèle qui traduit les textes en plusieurs langues

d)


Un modèle qui analyse la grammaire des phrases

2.

Quel est le principe de l’encodage One-Hot?

a)


Chaque mot est représenté par une séquence de n mots

b)


Chaque mot est représenté par sa fréquence dans le document

c)

Chaque mot est représenté par un score TF-IDF

d)


Chaque mot est représenté par un vecteur binaire avec un seul 1 à la position du mot

3.

Quelle est une limite principale de l’encodage One-Hot ?

a)

Il prend en compte la similarité sémantique

b)

Il gère bien les nouveaux mots

c)


Les vecteurs sont très longs et creux

d)


Il réduit la dimensionnalité automatiquement

4.

Dans le modèle Bag-of-Words, que représente chaque dimension du vecteur

a)

Un document unique

b)


Une phrase du texte

c)


Un mot unique du vocabulaire

d)


Un score TF-IDF

5.

Quel est le principal inconvénient du Bag of N-Grams quand n augmente ?

a)


La vectorisation devient plus rapide

b)


La dimension du vecteur explose et la sparsité augmente

c)

La similarité sémantique est mieux capturée

d)

Le problème OOV disparaît

6.

Que mesure le TF dans le modèle TF-IDF ?

a)


La fréquence d’un mot dans un document

b)


La fréquence d’un mot dans le corpus

c)

La position d’un mot dans la phrase

d)

La similarité entre deux mots

7.

Dans le cadre du modèle TF-IDF, que se passe-t-il si un mot apparaît dans tous les documents du corpus ?

a)

Son poids TF-IDF sera élevé

b)

Son poids TF-IDF sera nul

c)
  • Son poids TF-IDF sera négatif

d)

Son poids TF-IDF sera identique à sa fréquence brute

8.

Dans la construction d’une matrice de cooccurrence mot-par-mot, que représente chaque cellule de la matrice ?

a)

La somme des fréquences des deux mots dans le corpus

b)

La distance euclidienne entre les deux mots

c)

Le nombre de fois où les deux mots apparaissent ensemble

d)

Le produit scalaire des deux mots

9.

Dans le calcul de la similarité cosinus, que se passe-t-il si deux vecteurs sont orthogonaux ?

a)

Leur similarité cosinus est 1

b)
  • Leur similarité cosinus est -1

c)

Leur similarité cosinus est infinie

d)

Leur similarité cosinus est 0

10.

Quelle est la formule permettant de calculer le cosinus de l’angle β entre deux vecteurs A et B ?

(a)  

11.

Quel est le but principal de la réduction de dimension ?

a)


Augmenter la taille des vecteurs

b)

Ajouter plus de caractéristiques

c)


Visualiser les données textuelles dans un espace plus petit

d)

Supprimer les mots fréquents

12.

Quelle méthode est utilisée pour projeter des vecteurs de grande dimension dans un espace 2D ?

a)

Bag-of-Words

b)


TF-IDF

c)


Encodage One-Hot

d)

PCA (Analyse en Composantes Principales)

13.

Dans le PCA, que représentent les valeurs propres (eigenvalues) ?

a)

La direction principale de variation

b)


La variance expliquée dans chaque direction

c)

Le nombre de dimensions conservées

d)


La fréquence des mots

14.

Lors de l’application du PCA sur des embeddings de mots, que représente le premier vecteur propre (eigenvector) ?

a)

La direction de la variance maximale

b)

La direction de la variance minimale

c)

La moyenne des données

d)

La somme des valeurs propres

15.

Dans le processus de PCA, pourquoi est-il important de normaliser les données avant de calculer la matrice de covariance ?

a)

Pour réduire la dimensionnalité

b)

Pour que toutes les caractéristiques soient sur la même échelle

c)

Pour augmenter la variance totale

d)

Pour faciliter le calcul du produit scalaire