WorksheetsNLP_PREPROCESSING
Total questions: 8
Worksheet time: 8mins
Jaki napis został zakodowany poniżej?
5a 61 63 7a 79 6e 61 6d 79
Zaczynamy
Czytamy
ZnaczyMamy
Zamykamy
Ile znaków można maksymalnie zakodować przy pomocy kodowania UTF-8?
2^8
2^32
2^21
984 226
Tokenizacja ...
..dzieli tekst na zdania.
..wybiera istotne statystycznie słowa z tekstu.
..dzieli tekst na krótsze fragmenty zwane tokenami.
..tworzy listę bigramów dla tekstu.
Token powstały w wyniku stemmingu ...
..jest zawsze poprawnym słowem
..nigdy nie jest poprawnym słowem.
..może być, ale nie musi poprawnym słowem
..musi być, ale nie jest poprawnym słowem.
Odległość Hamminga pomiędzy
"Quzizz jest fajny" i
"Quzizz jest NUDNY"
wynosi:
5
3
1/5
Nie istnieje
word2vec, glove, fastText są modelami które:
umożliwiają modelowanie tekstu o różnej długości.
tworzą wektorową reprezentację dowolnego tekstu.
zanurzają tokeny w euklidesowej przestrzeni R^n.
Przy tworzeniu modelu liniowego do klasyfikacji zbioru tekstów lepiej jest:
wykorzystać cechy bag-of-words
wykorzystać cechy tf-idf
tf-idf i bag-of-words pozwlą osiągnąć tę samą jakość modelu
sprawdzić obie reprezentacje
Odległość Hamminga dwóch zmiennych tekstowych zawsze istanieje.
Prawda
Fałsz
