wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Modelos de representación del lenguaje

Total questions: 19

Worksheet time: 10mins

Name
Class
Date
1.

¿Cuál de las siguientes opciones corresponde a un modelo estadístico de representación del lenguaje?

a)

Word2Vec y GloVe

b)

Bag of Words y TF‑IDF

c)

RNN y LSTM

d)

BERT y GPT

2.

Para procesar secuencias con dependencias a largo plazo antes de los transformers, ¿qué arquitectura neural es más adecuada?

a)

FastText superficial

b)

TF‑IDF ponderado

c)

Bag of Words clásico

d)

GRU o LSTM recurrentes

3.

Quieres preentrenar representaciones contextuales con atención y luego afinarlas para clasificación de texto. Elige la opción que mejor alinea enfoques y ejemplos.

a)

Transformers como BERT o GPT

b)

Distribucionales como Word2Vec

c)

Estadísticos como TF‑IDF

d)

Recurrentes como RNN simples

4.

¿Qué representa el modelo Bag of Words al vectorizar un documento?

a)

La frecuencia de cada palabra única

b)

El orden secuencial de las palabras

c)

Las dependencias gramaticales completas

d)

El significado semántico de cada término

5.

En Bag of Words, ¿qué valor tendría la palabra "eats" en la frase "dog eats food" si aparece una vez?

a)

Dos por aparecer en el corpus

b)

Cero por ser palabra común

c)

Negativo por no ser relevante

d)

Uno en su columna correspondiente

6.

TF-IDF combina dos medidas. ¿Cuál es la mejor descripción de cada componente?

a)

TF mide posiciones; IDF mide coocurrencias

b)

TF mide frecuencia en el documento; IDF penaliza palabras frecuentes en el corpus

c)

TF mide frecuencia en el corpus; IDF premia palabras raras en el documento

d)

TF penaliza repeticiones; IDF premia términos comunes

7.

Si una palabra aparece muchas veces en un documento pero en casi todos los documentos del corpus, ¿qué efecto tendrá TF-IDF sobre su peso?

a)

Peso alto por TF grande

b)

Peso neutro por cancelación exacta

c)

Peso negativo por resta de valores

d)

Peso bajo por IDF pequeño

8.

Tienes dos documentos: D1 usa "algoritmo" diez veces; D2 lo usa una vez. En el corpus de mil documentos, "algoritmo" aparece en novecientos. ¿Qué afirmación es más razonable sobre sus pesos TF-IDF?

a)

El peso en D2 será mayor que en D1

b)

Ambos pesos serán idénticos y altos

c)

El peso en D1 será extremadamente alto

d)

Ambos pesos serán relativamente bajos

9.

Para construir un vector Bag of Words de las frases: 1) "the red dog" y 2) "red cat eats", con vocabulario [the, red, dog, cat, eats], ¿cuál es la representación correcta?

a)

[1,1,1,0,0] y [0,1,0,1,1]

b)

[1,0,1,0,1] y [0,1,1,1,0]

c)

[0,1,1,0,0] y [1,1,0,1,1]

d)

[1,1,0,1,1] y [0,1,1,0,0]

10.

¿Qué describen mejor las word embeddings en PLN?

a)

Matrices dispersas de frecuencias crudas

b)

Árboles jerárquicos de categorías

c)

Vectores numéricos en espacio semántico

d)

Listas ordenadas de sinónimos textuales

11.

¿Cuál es una propiedad clave de las word embeddings?

a)

Capturan similitud semántica entre palabras

b)

Aumentan la longitud de los documentos

c)

Sustituyen por completo a los corpus

d)

Eliminan toda polisemia automáticamente

12.

Selecciona el conjunto que contiene solo ejemplos de métodos de embeddings.

a)

Word2Vec, GloVe, FastText

b)

WordNet, TF-IDF, LDA

c)

SVM, KNN, Naive Bayes

d)

BERT, GPT, RoBERTa

13.

Observa un plano con ejes 'Gender' y 'Age' donde boy→man y girl→woman son vectores similares. ¿Qué relación ejemplifica este patrón?

a)

Relaciones análogas capturadas en el espacio

b)

Conteos de palabras por documento

c)

Traducción literal entre idiomas

d)

Orden alfabético de los términos

14.

Si dos palabras tienen vectores muy cercanos, ¿cuál es la interpretación más adecuada?

a)

Dependencia sintáctica obligatoria

b)

Equivalencia exacta de significado formal

c)

Mayor frecuencia de bigramas en el corpus

d)

Alta similitud semántica entre las palabras

15.

¿Qué característica principal comparten RNN, LSTM y GRU al procesar secuencias?

a)

Consideran orden y contexto temporal

b)

Ignoran dependencias de largo alcance

c)

Solo usan capas completamente conectadas

d)

Se entrenan sin retropropagación temporal

16.

¿Cuál es un problema que LSTM y GRU buscan mitigar respecto a RNN básicas?

a)

Desvanecimiento o explosión del gradiente

b)

Exceso de datos categóricos ruidosos

c)

Limitaciones de hardware de GPU

d)

Falta de embeddings preentrenados

17.

En tareas de NLP modernas, ¿qué ventaja clave aportan los Transformers frente a RNN?

a)

Atención paralelizable sobre toda la secuencia

b)

Necesitan menos datos para entrenarse siempre

c)

No requieren embeddings de palabras nunca

d)

Modelan contexto solo local y adyacente

18.

¿Qué describe mejor el mecanismo de self-attention en Transformers?

a)

Calcula dependencias entre todos los tokens

b)

Ordena tokens cronológicamente estrictos

c)

Sustituye completamente el aprendizaje supervisado

d)

Reduce una red a una sola capa lineal

19.

¿Cuál de los siguientes es un ejemplo de modelo basado en Transformers?

a)

Naive Bayes multinomial

b)

LSTM con puertas forget simples

c)

word2vec de contexto local

d)

BERT preentrenado bidireccional