Font size
WorksheetsExamen de NLP Master Data Science, Big DAta et IA
Total questions: 16
Worksheet time: 8mins
Quelle mesure est utilisée pour évaluer la performance d’un modèle de langue ?
L’Erreur Quadratique Moyen (MSE)
La perplexité
Le BLEU score
L’Entropie
Quelle est la principale limitation des RNNs ?
Ils ne peuvent pas apprendre de texte long
Ils ne peuvent pas être entraînés sur des données massives
Ils ne comprennent pas les relations contextuelles complexes
Ils oublient rapidement les informations lointaines
Que désigne le ‘hidden size’ ?
La taille des vecteurs embedding
La taille des vecteurs des états cachés
La taille des vecteurs du décodeur
La taille des vecteurs de l'encodeur
Qu'est-ce que le NLP ?
Un domaine de l'intelligence artificielle visant à permettre aux machines de comprendre et traiter le texte
Un domaine de l'intelligence artificielle visant à permettre aux machines de comprendre et traiter le langage humain
Un sous domaine de l’apprentissage profond visant à permettre aux machines de comprendre et traiter le langage humain
Un sous domaine de l’apprentissage supervisé visant à permettre aux machines de comprendre et traiter le langage humain
Pourquoi les modèles de langage pré-entraînés sont-ils adaptés à l’apprentissage par transfert (transfer learning) ?
Ils nécessitent moins de calculs que les RNN
Ils permettent d’éviter l’apprentissage de zéro en ajustant un modèle pré-entraîné sur des tâches courantes
Ils permettent d’éviter l’apprentissage de zéro en ajustant un modèle pré-entraîné sur une nouvelle tâche
Aucun
Quel est le principal problème des modèles Seq2Seq sans attention ?
Ils ne peuvent pas traiter de longues séquences efficacement
Ils nécessitent un encodage spatial des tokens
Ils utilisent trop de mémoire pour le calcul des probabilités
Ils sont incompatibles avec les réseaux récurrents
Quel est le rôle principal du mécanisme d'attention dans un modèle Seq2Seq ?
Réduire la complexité de calcul des réseaux de neurones
Permettre au modèle de se concentrer sur les parties importantes de la séquence d'entrée à chaque étape du décodage
Réduire les problèmes de mémoire à court terme des réseaux de neurones récurrents
Réduire le temps d’apprentissage des réseaux de neurones
Dans un modèle Seq2Seq avec attention, quel composant génère la séquence de sortie ?
L’encodeur
La couche d'attention
Le décodeur
La couche softmax
Quelle(s) méthode(s) est/sont utilisée(s) pour calculer les scores d’attention ?
Produit scalaire
Fonction bilinéaire
Perceptron multicouche
Toutes les réponses ci-dessus
Pourquoi la représentation fixe de l’encodeur est problématique dans un modèle Seq2Seq sans attention ?
Elle est trop coûteuse en mémoire
Elle ne capture pas toute l’information de la séquence d’entrée
Elle ne permet pas de paralléliser l’apprentissage
Elle augmente la complexité de l’algorithme de recherche
Dans un modèle Seq2Seq avec attention, comment les poids d’attention sont-ils obtenus ?
Par une normalisation ReLU appliquée aux scores d’attention
Par un filtrage des scores d’attention avec une fonction sigmoïde
Par une fonction softmax appliquée aux scores d’attention
Par une pondération linéaire des scores d’attention avant l’application du softmax
Quelle est la principale différence entre un réseau de neurones à propagation avant et un réseau récurrent ?
Les réseaux récurrents ont plus de couches cachées que les réseaux à propagation avant
Les réseaux à propagation avant utilisent la rétropropagation alors que les réseaux récurrents ne l’utilisent pas
Les réseaux récurrents peuvent traiter des séquences grâce à des connexions récurrentes, contrairement aux réseaux à propagation avant
Les réseaux à propagation avant sont uniquement utilisés pour les tâches de nlp
Quel est le but de la fonction de perte dans l'entraînement d'un réseau de neurones ?
Augmenter la précision en ajoutant plus de données
Mesurer la performance entre les prédictions et les valeurs réelles lors de l’entraînement du modèle
Mesurer l'écart entre les prédictions et les valeurs réelles
Mesurer l'écart entre les données de validation et les données d'entraînement
Pourquoi la descente de gradient est-elle utilisée dans l'optimisation des réseaux de neurones ?
Pour ajuster les poids du réseau afin de minimiser la fonction de perte
Pour ajuster les poids du réseau afin de minimiser l’erreur d’apprentissage
Pour ajuster les poids du réseau afin de minimiser l’erreur de validation
Aucun
Quel est le rôle du learning rate dans l'entraînement d'un réseau de neurones ?
Il contrôle la vitesse d’apprentissage en ajustant l’amplitude des mises à jour des poids
Il réduit la complexité du modèle en supprimant certaines connexions inutiles
Il limite la taille des batchs utilisés dans chaque itération
Il ajuste dynamiquement la fonction d’activation des neurones
Quelle mesure est utilisée pour évaluer la performance d’un modèle de traduction de texte?
L’Erreur Quadratique Moyen (MSE)
La perplexité
Le BLEU score
L’Entropie
