NEW
Font size
WorksheetsModelos de representación del lenguaje
Total questions: 19
Worksheet time: 10mins
¿Cuál de las siguientes opciones corresponde a un modelo estadístico de representación del lenguaje?
Word2Vec y GloVe
Bag of Words y TF‑IDF
RNN y LSTM
BERT y GPT
Para procesar secuencias con dependencias a largo plazo antes de los transformers, ¿qué arquitectura neural es más adecuada?
FastText superficial
TF‑IDF ponderado
Bag of Words clásico
GRU o LSTM recurrentes
Quieres preentrenar representaciones contextuales con atención y luego afinarlas para clasificación de texto. Elige la opción que mejor alinea enfoques y ejemplos.
Transformers como BERT o GPT
Distribucionales como Word2Vec
Estadísticos como TF‑IDF
Recurrentes como RNN simples
¿Qué representa el modelo Bag of Words al vectorizar un documento?
La frecuencia de cada palabra única
El orden secuencial de las palabras
Las dependencias gramaticales completas
El significado semántico de cada término
En Bag of Words, ¿qué valor tendría la palabra "eats" en la frase "dog eats food" si aparece una vez?
Dos por aparecer en el corpus
Cero por ser palabra común
Negativo por no ser relevante
Uno en su columna correspondiente
TF-IDF combina dos medidas. ¿Cuál es la mejor descripción de cada componente?
TF mide posiciones; IDF mide coocurrencias
TF mide frecuencia en el documento; IDF penaliza palabras frecuentes en el corpus
TF mide frecuencia en el corpus; IDF premia palabras raras en el documento
TF penaliza repeticiones; IDF premia términos comunes
Si una palabra aparece muchas veces en un documento pero en casi todos los documentos del corpus, ¿qué efecto tendrá TF-IDF sobre su peso?
Peso alto por TF grande
Peso neutro por cancelación exacta
Peso negativo por resta de valores
Peso bajo por IDF pequeño
Tienes dos documentos: D1 usa "algoritmo" diez veces; D2 lo usa una vez. En el corpus de mil documentos, "algoritmo" aparece en novecientos. ¿Qué afirmación es más razonable sobre sus pesos TF-IDF?
El peso en D2 será mayor que en D1
Ambos pesos serán idénticos y altos
El peso en D1 será extremadamente alto
Ambos pesos serán relativamente bajos
Para construir un vector Bag of Words de las frases: 1) "the red dog" y 2) "red cat eats", con vocabulario [the, red, dog, cat, eats], ¿cuál es la representación correcta?
[1,1,1,0,0] y [0,1,0,1,1]
[1,0,1,0,1] y [0,1,1,1,0]
[0,1,1,0,0] y [1,1,0,1,1]
[1,1,0,1,1] y [0,1,1,0,0]
¿Qué describen mejor las word embeddings en PLN?
Matrices dispersas de frecuencias crudas
Árboles jerárquicos de categorías
Vectores numéricos en espacio semántico
Listas ordenadas de sinónimos textuales
¿Cuál es una propiedad clave de las word embeddings?
Capturan similitud semántica entre palabras
Aumentan la longitud de los documentos
Sustituyen por completo a los corpus
Eliminan toda polisemia automáticamente
Selecciona el conjunto que contiene solo ejemplos de métodos de embeddings.
Word2Vec, GloVe, FastText
WordNet, TF-IDF, LDA
SVM, KNN, Naive Bayes
BERT, GPT, RoBERTa
Observa un plano con ejes 'Gender' y 'Age' donde boy→man y girl→woman son vectores similares. ¿Qué relación ejemplifica este patrón?
Relaciones análogas capturadas en el espacio
Conteos de palabras por documento
Traducción literal entre idiomas
Orden alfabético de los términos
Si dos palabras tienen vectores muy cercanos, ¿cuál es la interpretación más adecuada?
Dependencia sintáctica obligatoria
Equivalencia exacta de significado formal
Mayor frecuencia de bigramas en el corpus
Alta similitud semántica entre las palabras
¿Qué característica principal comparten RNN, LSTM y GRU al procesar secuencias?
Consideran orden y contexto temporal
Ignoran dependencias de largo alcance
Solo usan capas completamente conectadas
Se entrenan sin retropropagación temporal
¿Cuál es un problema que LSTM y GRU buscan mitigar respecto a RNN básicas?
Desvanecimiento o explosión del gradiente
Exceso de datos categóricos ruidosos
Limitaciones de hardware de GPU
Falta de embeddings preentrenados
En tareas de NLP modernas, ¿qué ventaja clave aportan los Transformers frente a RNN?
Atención paralelizable sobre toda la secuencia
Necesitan menos datos para entrenarse siempre
No requieren embeddings de palabras nunca
Modelan contexto solo local y adyacente
¿Qué describe mejor el mecanismo de self-attention en Transformers?
Calcula dependencias entre todos los tokens
Ordena tokens cronológicamente estrictos
Sustituye completamente el aprendizaje supervisado
Reduce una red a una sola capa lineal
¿Cuál de los siguientes es un ejemplo de modelo basado en Transformers?
Naive Bayes multinomial
LSTM con puertas forget simples
word2vec de contexto local
BERT preentrenado bidireccional
