Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Text Mining 1

Total questions: 25

Worksheet time: 2mins

Name
Class
Date
1.

Proses mengubah seluruh teks menjadi huruf kecil untuk menyeragamkan data disebut...

a)

Tokenisasi

b)

Stemming

c)

Lowercasing

d)

Lematisasi

2.

Menurut dokumen, library Python yang dianggap sebagai "pionir" dan paling komprehensif untuk NLP adalah...

a)

spaCy

b)

Scikit-learn

c)

Pandas

d)

NLTK (Natural Language Toolkit)

3.

Kata-kata umum yang sering muncul namun tidak membawa makna signifikan (seperti 'yang', 'di', 'dan') disebut...

a)

Kata kunci

b)

Stopword

c)

Token

d)

Lemma

4.

Manakah dari berikut ini yang merupakan "3V" dari Big Data seperti yang disebutkan dalam materi?

a)

Volume, Velocity, Variety

b)

Volume, Veracity, Value

c)

Velocity, Vision, Value

d)

Variety, Vision, Veracity

5.

Lingkungan pengembangan berbasis cloud gratis dari Google yang tidak memerlukan instalasi lokal dan menyediakan akses ke GPU/TPU adalah...

a)

Jupyter Notebook

b)

Anaconda

c)

Google Colaboratory (Colab)

d)

PyCharm

6.

Perintah dasar untuk menginstal sebuah library Python menggunakan manajer paket standar adalah...

a)

python get library

b)

pip install nama_library

c)

install.pkg(nama_library)

d)

conda fetch nama_library

7.

Proses memecah teks menjadi unit-unit individual (seperti kata atau kalimat) disebut...

a)

Normalisasi

b)

Parsing

c)

Tokenisasi

d)

Tagging

8.

Tujuan utama dari stemming adalah...

a)

Memahami struktur gramatikal kalimat

b)

Mengembalikan kata ke bentuk dasarnya di kamus

c)

Menghapus tanda baca dan angka

d)

Memotong akhir kata untuk mendapatkan bentuk akar (stem)

9.

Menurut dokumen, library Scikit-learn adalah andalan utama untuk...

a)

Manipulasi data tabular

b)

Machine learning

c)

Visualisasi data

d)

Pemrosesan bahasa alami secara modern

10.

Apa singkatan dari NER?

a)

Natural Entity Routing

b)

Named Entity Recognition

c)

New E-learning Resource

d)

Normalized Entity Relation

11.

Manakah dari berikut ini yang merupakan contoh aplikasi dari klasifikasi teks?

a)

Analisis sentimen

b)

Desain database

c)

Kompresi file video

d)

Perancangan antarmuka pengguna

12.

Dalam konteks machine learning, tujuan utama membagi data menjadi training set dan testing set adalah...

a)

Untuk mempercepat proses training

b)

Untuk mengurangi jumlah data yang perlu diproses

c)

Untuk mengevaluasi kinerja model pada data yang belum pernah dilihat sebelumnya

d)

Untuk meningkatkan jumlah fitur dalam data

13.

Apa yang dimaksud dengan Bag-of-Words (BoW)?

a)

Teknik untuk memvisualisasikan data teks

b)

Metode representasi teks yang mengabaikan urutan kata dan hanya mencatat frekuensinya

c)

Algoritma klasifikasi teks

d)

Daftar kata-kata yang harus dihapus dari teks

14.

Pada evaluasi model, True Positive (TP) adalah kondisi di mana...

a)

Model memprediksi kelas positif, tetapi sebenarnya negatif

b)

Model memprediksi kelas negatif, dan prediksi tersebut benar

c)

Model memprediksi kelas negatif, tetapi sebenarnya positif

d)

Model memprediksi kelas positif, dan prediksi tersebut benar

15.

Library Python yang menyediakan struktur data DataFrame untuk manipulasi data tabular adalah...

a)

NLTK

b)

Matplotlib

c)

Pandas

d)

spaCy

16.

Apa perbedaan mendasar antara stemming dan lematisasi?

a)

Stemming lebih lambat dari lematisasi

b)

Stemming selalu menghasilkan kata yang valid dalam kamus, sedangkan lematisasi tidak

c)

Lematisasi menggunakan analisis morfologi dan kamus untuk mendapatkan bentuk dasar yang valid, sedangkan stemming hanya memotong akhir kata secara heuristik

d)

Lematisasi hanya berfungsi untuk Bahasa Inggris, sedangkan stemming untuk semua bahasa

17.

Mengapa penggunaan encoding='utf-8' dianggap praktik terbaik saat membaca file teks di Python, terutama untuk bahasa seperti Bahasa Indonesia?

a)

Untuk membuat file lebih kecil ukurannya

b)

Untuk memastikan karakter non-ASCII (seperti aksen atau simbol unik) dapat dibaca dengan benar

c)

Untuk mempercepat proses pembacaan file

d)

Untuk secara otomatis menghapus tanda baca dari teks

18.

Dalam CountVectorizer dari Scikit-learn, apa fungsi dari parameter ngram_range=(1, 2)?

a)

Mengabaikan kata yang muncul di kurang dari 1 atau lebih dari 2 dokumen

b)

Hanya mengambil kata yang terdiri dari 1 hingga 2 karakter

c)

Membuat fitur dari kata tunggal (unigram) dan pasangan kata yang berurutan (bigram)

d)

Membatasi jumlah fitur maksimal menjadi 2

19.

Menurut dokumen, apa perbedaan fokus utama antara Text Mining dan NLP?

a)

NLP berfokus pada ekstraksi pengetahuan, sedangkan Text Mining pada pemahaman bahasa

b)

Keduanya sama saja dan tidak memiliki perbedaan

c)

NLP fokus pada bagaimana komputer memahami bahasa (struktur, makna), sedangkan Text Mining fokus pada apa yang bisa dipelajari dari sekumpulan teks (pola, wawasan)

d)

Text Mining adalah bagian dari NLP, bukan sebaliknya

20.

Metrik Recall dalam evaluasi model klasifikasi mengukur...

a)

Seberapa akurat prediksi positif dari total prediksi positif yang dibuat

b)

Proporsi prediksi yang benar secara keseluruhan

c)

Kemampuan model untuk menemukan kembali semua sampel yang sebenarnya positif

d)

Rata-rata harmonik dari presisi dan akurasi

21.

Apa asumsi "naif" dalam algoritma klasifikasi Naive Bayes?

a)

Bahwa semua dokumen memiliki panjang yang sama

b)

Bahwa fitur-fitur (kata-kata) dalam dokumen saling independen satu sama lain

c)

Bahwa setiap kelas memiliki jumlah dokumen yang seimbang

d)

Bahwa data tidak mengandung noise atau kesalahan

22.

Apa tujuan dari kernel trick pada algoritma Support Vector Machine (SVM)?

a)

Untuk mengurangi jumlah support vector agar model lebih cepat

b)

Untuk secara efisien menangani data yang tidak dapat dipisahkan secara linear dengan memetakannya ke ruang dimensi yang lebih tinggi

c)

Untuk memilih fitur yang paling penting dalam data secara otomatis

d)

Untuk mengubah SVM dari model klasifikasi menjadi model regresi

23.

Keunggulan utama spaCy dibandingkan NLTK yang ditekankan dalam dokumen adalah...

a)

Memiliki lebih banyak dukungan untuk bahasa-bahasa non-Inggris

b)

Bersifat modular dan sangat fleksibel untuk penelitian akademik

c)

Dirancang untuk efisiensi, kecepatan, dan penggunaan skala produksi dengan pendekatan yang lebih terintegrasi

d)

Sepenuhnya gratis tanpa perlu mengunduh model tambahan

24.

Sebuah proyek klasifikasi teks memerlukan pemahaman gramatikal yang mendalam untuk mengekstrak hubungan antar entitas (misalnya 'siapa melakukan apa'). Berdasarkan materi, kombinasi library dan teknik mana yang paling ideal untuk digunakan sebelum data dimasukkan ke model klasifikasi Scikit-learn?

a)

Menggunakan NLTK hanya untuk tokenisasi dan stopword removal karena paling cepat.

b)

Menggunakan Scikit-learn CountVectorizer dengan ngram_range untuk menangkap hubungan kata

c)

Menggunakan pra-pemrosesan spaCy untuk mendapatkan dependency parsing guna memahami hubungan gramatikal antar kata, kemudian menggunakan hasilnya sebagai fitur.

d)

Menggunakan stemming dari NLTK karena paling agresif dalam mereduksi fitur

25.

Anda melatih sebuah model untuk mendeteksi ulasan negatif (kelas 'positif') pada dataset yang sangat tidak seimbang (95% ulasan positif, 5% negatif). Model mencapai akurasi 94%. Metrik mana yang paling mungkin memberikan gambaran yang salah tentang kinerja model, dan kombinasi metrik mana yang akan lebih andal untuk menilai kemampuannya dalam mendeteksi ulasan negatif?

a)

Salah: Akurasi. Andal: Presisi dan Recall untuk kelas negatif (atau F1-score)

b)

Salah: F1-score. Andal: Akurasi

c)

Salah: Recall. Andal: Presisi saja

d)

Salah: Presisi. Andal: Akurasi dan Recall