wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

NLP_PREPROCESSING

Total questions: 8

Worksheet time: 8mins

Name
Class
Date
1.

Jaki napis został zakodowany poniżej?

5a 61 63 7a 79 6e 61 6d 79

a)

Zaczynamy

b)

Czytamy

c)

ZnaczyMamy

d)

Zamykamy

2.

Ile znaków można maksymalnie zakodować przy pomocy kodowania UTF-8?

a)

2^8

b)

2^32

c)

2^21

d)

984 226

3.

Tokenizacja ...

a)

..dzieli tekst na zdania.

b)

..wybiera istotne statystycznie słowa z tekstu.

c)

..dzieli tekst na krótsze fragmenty zwane tokenami.

d)

..tworzy listę bigramów dla tekstu.

4.

Token powstały w wyniku stemmingu ...

a)

..jest zawsze poprawnym słowem

b)

..nigdy nie jest poprawnym słowem.

c)

..może być, ale nie musi poprawnym słowem

d)

..musi być, ale nie jest poprawnym słowem.

5.

Odległość Hamminga pomiędzy

"Quzizz jest fajny" i

"Quzizz jest NUDNY"

wynosi:

a)

5

b)

3

c)

1/5

d)

Nie istnieje

6.

word2vec, glove, fastText są modelami które:

a)

umożliwiają modelowanie tekstu o różnej długości.

b)

tworzą wektorową reprezentację dowolnego tekstu.

c)

zanurzają tokeny w euklidesowej przestrzeni R^n.

7.

Przy tworzeniu modelu liniowego do klasyfikacji zbioru tekstów lepiej jest:

a)

wykorzystać cechy bag-of-words

b)

wykorzystać cechy tf-idf

c)

tf-idf i bag-of-words pozwlą osiągnąć tę samą jakość modelu

d)

sprawdzić obie reprezentacje

8.

Odległość Hamminga dwóch zmiennych tekstowych zawsze istanieje.

a)

Prawda

b)

Fałsz