Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Preprocesamiento del texto

Total questions: 10

Worksheet time: 5mins

Name
Class
Date
1.

¿Cuál paso de preprocesamiento transforma palabras a su forma base conservando la categoría gramatical?

a)

Lematización para formas canónicas

b)

Normalización con minúsculas y signos

c)

Eliminación de stopwords frecuentes

d)

Tokenización y segmentación de oraciones

2.

Al diseñar un pipeline, ¿qué combinación es más adecuada para reducir variaciones superficiales sin perder demasiada información semántica?

a)

Lematización junto con normalización

b)

POS tagging sin normalización previa

c)

Solo tokenización y segmentación

d)

Stemming agresivo con eliminación de stopwords

3.

¿Qué describe mejor la tokenización en el preprocesamiento de texto?

a)

Convertir todas las palabras a minúsculas obligatoriamente

b)

Separar el texto en unidades analizables llamadas tokens

c)

Eliminar signos de puntuación y símbolos irrelevantes

d)

Unir frases similares para reducir la dimensionalidad

4.

Dado el texto: "¡El Gato COME! :) #mascotas", ¿cuál podría ser el resultado tras una normalización básica?

a)

"El Gato COME :) #mascotas" intacto

b)

"el gato come" sin emojis ni hashtags

c)

"gato come mascotas" con signos añadidos

d)

"el gato" con emojis y hashtags

5.

Se quiere preparar la frase "El gato come" para análisis. ¿Cuál es una secuencia razonable de pasos?

a)

Detectar idioma, luego reemplazar por sinónimos aleatorios

b)

Lematizar primero, luego añadir puntuación extra

c)

Tokenizar en palabras y después mezclar caracteres

d)

Normalizar eliminando símbolos y minúsculas, luego tokenizar

6.

¿Cuál es el propósito principal de eliminar stopwords en un preprocesamiento de texto?

a)

Detectar entidades con mayor precisión morfológica

b)

Traducir automáticamente términos a su idioma base

c)

Aumentar vocabulario añadiendo conectores frecuentes

d)

Reducir ruido manteniendo contenido semántico relevante

7.

¿Cuál de las siguientes palabras es más probable que sea una stopword en español en un análisis de texto general?

a)

tópicos

b)

algoritmo

c)

minería

d)

de

8.

Tienes los tokens: "corriendo", "corrí", "corre". Si aplicas lematización, ¿qué representación única elegirías y por qué?

a)

Usar "correr" porque agrupa variaciones flexionadas

b)

Usar "corre" porque refleja tercera persona singular

c)

Usar "corrí" porque conserva tiempo pasado explícito

d)

Usar "corriendo" porque mantiene aspecto progresivo

9.

¿Cuál es la mejor descripción de stemming en procesamiento de lenguaje natural?

a)

Detectar dependencias sintácticas entre oraciones

b)

Asignar etiquetas de sustantivo o verbo a palabras

c)

Traducir automáticamente textos entre diferentes idiomas

d)

Reducir palabras a la raíz eliminando sufijos

10.

Dado el texto: "Los niños felices cantan", ¿qué salida corresponde al etiquetado gramatical (POS tagging)?

a)

[(Los, DET), (niños, NOUN), (felices, ADJ), (cantan, VERB)]

b)

[(Los, NOUN), (niños, VERB), (felices, NOUN), (cantan, ADJ)]

c)

[(Los, ADJ), (niños, ADJ), (felices, VERB), (cantan, NOUN)]

d)

[(Los, PRON), (niños, PRON), (felices, ADV), (cantan, AUX)]