WorksheetsText Mining 1
Total questions: 25
Worksheet time: 2mins
Proses mengubah seluruh teks menjadi huruf kecil untuk menyeragamkan data disebut...
Tokenisasi
Stemming
Lowercasing
Lematisasi
Menurut dokumen, library Python yang dianggap sebagai "pionir" dan paling komprehensif untuk NLP adalah...
spaCy
Scikit-learn
Pandas
NLTK (Natural Language Toolkit)
Kata-kata umum yang sering muncul namun tidak membawa makna signifikan (seperti 'yang', 'di', 'dan') disebut...
Kata kunci
Stopword
Token
Lemma
Manakah dari berikut ini yang merupakan "3V" dari Big Data seperti yang disebutkan dalam materi?
Volume, Velocity, Variety
Volume, Veracity, Value
Velocity, Vision, Value
Variety, Vision, Veracity
Lingkungan pengembangan berbasis cloud gratis dari Google yang tidak memerlukan instalasi lokal dan menyediakan akses ke GPU/TPU adalah...
Jupyter Notebook
Anaconda
Google Colaboratory (Colab)
PyCharm
Perintah dasar untuk menginstal sebuah library Python menggunakan manajer paket standar adalah...
python get library
pip install nama_library
install.pkg(nama_library)
conda fetch nama_library
Proses memecah teks menjadi unit-unit individual (seperti kata atau kalimat) disebut...
Normalisasi
Parsing
Tokenisasi
Tagging
Tujuan utama dari stemming adalah...
Memahami struktur gramatikal kalimat
Mengembalikan kata ke bentuk dasarnya di kamus
Menghapus tanda baca dan angka
Memotong akhir kata untuk mendapatkan bentuk akar (stem)
Menurut dokumen, library Scikit-learn adalah andalan utama untuk...
Manipulasi data tabular
Machine learning
Visualisasi data
Pemrosesan bahasa alami secara modern
Apa singkatan dari NER?
Natural Entity Routing
Named Entity Recognition
New E-learning Resource
Normalized Entity Relation
Manakah dari berikut ini yang merupakan contoh aplikasi dari klasifikasi teks?
Analisis sentimen
Desain database
Kompresi file video
Perancangan antarmuka pengguna
Dalam konteks machine learning, tujuan utama membagi data menjadi training set dan testing set adalah...
Untuk mempercepat proses training
Untuk mengurangi jumlah data yang perlu diproses
Untuk mengevaluasi kinerja model pada data yang belum pernah dilihat sebelumnya
Untuk meningkatkan jumlah fitur dalam data
Apa yang dimaksud dengan Bag-of-Words (BoW)?
Teknik untuk memvisualisasikan data teks
Metode representasi teks yang mengabaikan urutan kata dan hanya mencatat frekuensinya
Algoritma klasifikasi teks
Daftar kata-kata yang harus dihapus dari teks
Pada evaluasi model, True Positive (TP) adalah kondisi di mana...
Model memprediksi kelas positif, tetapi sebenarnya negatif
Model memprediksi kelas negatif, dan prediksi tersebut benar
Model memprediksi kelas negatif, tetapi sebenarnya positif
Model memprediksi kelas positif, dan prediksi tersebut benar
Library Python yang menyediakan struktur data DataFrame untuk manipulasi data tabular adalah...
NLTK
Matplotlib
Pandas
spaCy
Apa perbedaan mendasar antara stemming dan lematisasi?
Stemming lebih lambat dari lematisasi
Stemming selalu menghasilkan kata yang valid dalam kamus, sedangkan lematisasi tidak
Lematisasi menggunakan analisis morfologi dan kamus untuk mendapatkan bentuk dasar yang valid, sedangkan stemming hanya memotong akhir kata secara heuristik
Lematisasi hanya berfungsi untuk Bahasa Inggris, sedangkan stemming untuk semua bahasa
Mengapa penggunaan encoding='utf-8' dianggap praktik terbaik saat membaca file teks di Python, terutama untuk bahasa seperti Bahasa Indonesia?
Untuk membuat file lebih kecil ukurannya
Untuk memastikan karakter non-ASCII (seperti aksen atau simbol unik) dapat dibaca dengan benar
Untuk mempercepat proses pembacaan file
Untuk secara otomatis menghapus tanda baca dari teks
Dalam CountVectorizer dari Scikit-learn, apa fungsi dari parameter ngram_range=(1, 2)?
Mengabaikan kata yang muncul di kurang dari 1 atau lebih dari 2 dokumen
Hanya mengambil kata yang terdiri dari 1 hingga 2 karakter
Membuat fitur dari kata tunggal (unigram) dan pasangan kata yang berurutan (bigram)
Membatasi jumlah fitur maksimal menjadi 2
Menurut dokumen, apa perbedaan fokus utama antara Text Mining dan NLP?
NLP berfokus pada ekstraksi pengetahuan, sedangkan Text Mining pada pemahaman bahasa
Keduanya sama saja dan tidak memiliki perbedaan
NLP fokus pada bagaimana komputer memahami bahasa (struktur, makna), sedangkan Text Mining fokus pada apa yang bisa dipelajari dari sekumpulan teks (pola, wawasan)
Text Mining adalah bagian dari NLP, bukan sebaliknya
Metrik Recall dalam evaluasi model klasifikasi mengukur...
Seberapa akurat prediksi positif dari total prediksi positif yang dibuat
Proporsi prediksi yang benar secara keseluruhan
Kemampuan model untuk menemukan kembali semua sampel yang sebenarnya positif
Rata-rata harmonik dari presisi dan akurasi
Apa asumsi "naif" dalam algoritma klasifikasi Naive Bayes?
Bahwa semua dokumen memiliki panjang yang sama
Bahwa fitur-fitur (kata-kata) dalam dokumen saling independen satu sama lain
Bahwa setiap kelas memiliki jumlah dokumen yang seimbang
Bahwa data tidak mengandung noise atau kesalahan
Apa tujuan dari kernel trick pada algoritma Support Vector Machine (SVM)?
Untuk mengurangi jumlah support vector agar model lebih cepat
Untuk secara efisien menangani data yang tidak dapat dipisahkan secara linear dengan memetakannya ke ruang dimensi yang lebih tinggi
Untuk memilih fitur yang paling penting dalam data secara otomatis
Untuk mengubah SVM dari model klasifikasi menjadi model regresi
Keunggulan utama spaCy dibandingkan NLTK yang ditekankan dalam dokumen adalah...
Memiliki lebih banyak dukungan untuk bahasa-bahasa non-Inggris
Bersifat modular dan sangat fleksibel untuk penelitian akademik
Dirancang untuk efisiensi, kecepatan, dan penggunaan skala produksi dengan pendekatan yang lebih terintegrasi
Sepenuhnya gratis tanpa perlu mengunduh model tambahan
Sebuah proyek klasifikasi teks memerlukan pemahaman gramatikal yang mendalam untuk mengekstrak hubungan antar entitas (misalnya 'siapa melakukan apa'). Berdasarkan materi, kombinasi library dan teknik mana yang paling ideal untuk digunakan sebelum data dimasukkan ke model klasifikasi Scikit-learn?
Menggunakan NLTK hanya untuk tokenisasi dan stopword removal karena paling cepat.
Menggunakan Scikit-learn CountVectorizer dengan ngram_range untuk menangkap hubungan kata
Menggunakan pra-pemrosesan spaCy untuk mendapatkan dependency parsing guna memahami hubungan gramatikal antar kata, kemudian menggunakan hasilnya sebagai fitur.
Menggunakan stemming dari NLTK karena paling agresif dalam mereduksi fitur
Anda melatih sebuah model untuk mendeteksi ulasan negatif (kelas 'positif') pada dataset yang sangat tidak seimbang (95% ulasan positif, 5% negatif). Model mencapai akurasi 94%. Metrik mana yang paling mungkin memberikan gambaran yang salah tentang kinerja model, dan kombinasi metrik mana yang akan lebih andal untuk menilai kemampuannya dalam mendeteksi ulasan negatif?
Salah: Akurasi. Andal: Presisi dan Recall untuk kelas negatif (atau F1-score)
Salah: F1-score. Andal: Akurasi
Salah: Recall. Andal: Presisi saja
Salah: Presisi. Andal: Akurasi dan Recall
