WorksheetsQuis Kelas Data Mining
Total questions: 50
Worksheet time: 26mins
Manakah dari berikut ini yang merupakan contoh tugas 'Deskriptif' dalam Data Mining?
Clustering (Pengelompokan)
Klasifikasi (Classification)
Regresi (Regression)
Time Series Forecasting
Dalam data mining, proses untuk menangani data yang hilang disebut …
Normalisasi
Data cleaning
Clustering
Evaluasi
Pada preprocesing, Metode mean imputation paling tepat digunakan pada data
Kategorikal nominal
Kategorikal ordinal
Numerik kontinu
Data teks
Anda memiliki dataset pelanggan dengan fitur usia, pendapatan, dan jenis kelamin.
Teknik preprocessing yang paling tepat untuk fitur jenis kelamin adalah …
Normalization
Standardization
One-hot encoding
Scaling log
Tujuan utama dari preprocessing data adalah …
Menambah ukuran dataset
Mengurangi kompleksitas algoritma
Meningkatkan kualitas data agar model bekerja optimal
Menghilangkan seluruh noise secara permanen
Korelasi antar fitur numerik paling umum dianalisis menggunakan …
Histogram
Scatter plot matrix
Heatmap
Bar chart
Jika Nilai korelasi Pearson mendekati −1 menunjukkan_____
Tidak ada hubungan
Hubungan linear yang kuat
Hubungan berkebalikan yang kuat
Hubungan non-linear
EDA citra menunjukkan ukuran gambar sangat bervariasi (64×64 hingga 512×512). Keputusan preprocessing paling tepat berdasarkan EDA tersebut adalah_____
Menghapus citra berukuran kecil
Mengubah citra menjadi grayscale
Melakukan resizing ke ukuran seragam
Mengurangi jumlah channel
EDA menunjukkan fitur kategorikal memiliki puluhan kategori unik dengan frekuensi sangat timpang.
Risiko utama jika langsung menggunakan one-hot encoding adalah …
Hilangnya informasi
Curse of dimensionality
Overfitting selalu terjadi
Model tidak bisa dilatih
Contoh data Big Data tidak terstruktur adalah …
Tabel transaksi bank
Data sensor numerik
Video CCTV dan posting media sosial
File CSV
Framework Big Data yang menggunakan konsep distributed storage dan processing adalah …
MySQL
Hadoop
Excel
SPSS
Yang termasuk masalah supervised learning adalah …
Clustering pelanggan
Deteksi anomali
Prediksi harga rumah
Topic modeling
Dalam Machine learning perbedaan utama klasifikasi dan regresi adalah _____
Jumlah fitur
dimensi data
Tipe output yang diprediksi
Jumlah data
Dalam machine learningKarakteristik utama algoritma Naive Bayes adalah …
Tidak membutuhkan data label
Mengasumsikan independensi antar fitur
Menggunakan jarak Euclidean
Berbasis pohon
Confusion matrix digunakan untuk …
Melatih model
Menampilkan performa klasifikasi
Mengurangi dimensi data
Menentukan learning rate
Tujuan utama unsupervised learning adalah …
Memprediksi nilai target
Mengklasifikasikan data berdasarkan label
Menemukan pola atau struktur tersembunyi dalam data
Mengukur akurasi model
Masalah yang paling tepat diselesaikan dengan unsupervised learning adalah …
Prediksi harga rumah
Deteksi email spam
Segmentasi pelanggan
Prediksi kelulusan mahasiswa
Output utama dari unsupervised learning biasanya berupa …
Nilai probabilitas kelas
Label target sebenarnya
Kelompok atau representasi data
Confusion matrix
Algoritma clustering yang paling populer dan berbasis centroid adalah …
DBSCAN
Hierarchical Clustering
K-Means
Gaussian Naive Bayes
Sebuah perusahaan ritel ingin mengelompokkan pelanggan berdasarkan usia, pendapatan, dan frekuensi belanja. EDA menunjukkan rentang fitur sangat berbeda. Langkah paling tepat sebelum clustering adalah …
Menambah jumlah cluster
Melakukan feature scaling
Menghapus fitur pendapatan
Mengganti algoritma
Dalam K-Means, jika fitur tidak dinormalisasi, risiko utama yang terjadi adalah …
Model tidak bisa dijalankan
Jumlah cluster berubah otomatis
Fitur berskala besar mendominasi jarak
Data menjadi tidak valid
Jika jumlah cluster belum diketahui, metode yang paling tepat untuk membantu menentukannya adalah …
Accuracy score
Confusion matrix
Elbow method atau Silhouette score
Cross-validation
K-Means kurang cocok digunakan jika …
Cluster berbentuk bulat
Jumlah cluster diketahui
Terdapat banyak noise dan outlier
Data sudah dinormalisasi
Masalah yang paling cocok diselesaikan dengan Naive Bayes adalah …
Clustering pelanggan
Klasifikasi teks
Reduksi dimensi
Prediksi time-series
Gaussian Naive Bayes cocok digunakan jika fitur …
Bersifat kategorikal
Bersifat biner
Bertipe numerik
Berbentuk teks
Dalam machine learning, Algoritma Decision Tree termasuk ke dalam jenis …
Unsupervised learning
Supervised learning
Reinforcement learning
Semi-supervised learning
Setiap node pada Decision Tree merepresentasikan …
Model regresi
Satu fitur dan aturan pemisahan
Seluruh dataset
Learning rate
Kriteria yang paling umum digunakan untuk menentukan split terbaik pada Decision Tree adalah …
Accuracy
Mean Squared Error
Gini Index dan Information Gain
Euclidean Distance
Sistem penilaian kelayakan kredit menggunakan fitur pendapatan, usia, dan riwayat kredit.
Masalah ini paling tepat diselesaikan menggunakan …
Clustering
Regresi linear
Klasifikasi dengan Decision Tree
PCA
Dalam eksperimen clustering, peneliti membandingkan label hasil K-Means dengan label asli pelanggan (loyal vs tidak loyal). Metrik yang paling sesuai digunakan adalah …
Davies-Bouldin Index
Silhouette Coefficient
Adjusted Rand Index (ARI)
Inertia
Sebuah model klasifikasi penyakit memiliki Recall tinggi tetapi Precision rendah. Artinya …
Banyak pasien sehat terdeteksi sakit
Banyak pasien sakit tidak terdeteksi
Model jarang salah memprediksi positif
Model seimbang dalam semua prediksi
Sebuah dataset sangat imbalanced (95% kelas negatif). Accuracy model mencapai 95%. Kesimpulan yang paling tepat adalah …
Model sudah sangat baik
Accuracy tidak cukup merepresentasikan performa
Precision dan recall pasti tinggi
Model tidak bisa dievaluasi
Manakah dari pernyataan berikut yang paling tepat menjelaskan metrik F1-Score?
Perbandingan antara True Positive dengan False Negative.
Rata-rata aritmatika sederhana dari Precision dan Recall.
Metrik untuk mengukur jarak antar pusat klaster dalam clustering.
Rata-rata harmonik antara Precision dan Recall.
Davies-Bouldin Index yang lebih rendah menunjukkan bahwa hasil clustering bersifat...
Lebih baik, karena klaster lebih terpisah dan lebih padat.
Sangat bergantung pada label ground truth.
Lebih buruk, karena banyak data yang tumpang tindih.
Netral, karena metrik ini hanya berlaku untuk data linear.
Kurva ROC (Receiver Operating Characteristic) memplot hubungan antara dua variabel. Variabel apakah yang dimaksud?
Accuracy dan Loss.
Precision dan Recall.
True Positive Rate dan False Positive Rate.
Intra-cluster distance dan Inter-cluster distance.
Dalam Klastering Elbow Method digunakan untuk menentukan …
Nilai silhouette maksimum
Jarak antar centroid
Jumlah cluster optimal
Label cluster
Dalam sebuah pengujian model deteksi wajah terhadap 200 gambar, diketahui: TP = 90, TN = 90, FP = 10, FN = 10, Berapakah nilai Akurasi model tersebut?
(a)
Dalam sebuah pengujian model deteksi wajah terhadap 200 gambar, diketahui: TP = 90, TN = 90, FP = 15, FN = 5, Berapakah nilai Akurasi model tersebut?
A. 0.85
0.90
0.85
0.95
Sebuah sistem filter email spam mengklasifikasikan 100 email. Model memprediksi 30 email sebagai 'Spam'. Dari 30 prediksi tersebut, ternyata hanya 20 yang benar-benar spam, sedangkan 10 sisanya adalah email penting (False Positive). Berapakah nilai Precision model ini?
0.80
0.67
0.50
0.20
Manakah dari metrik clustering berikut yang bersifat 'Internal', artinya tidak memerlukan label referensi eksternal?
Normalized Mutual Information (NMI)
Davies-Bouldin Index
Adjusted Rand Index (ARI)
Rand Index
Apa yang dimaksud dengan 'Pruning' dalam konteks algoritme Decision Tree?
Proses memilih fitur yang paling penting di awal pembentukan pohon.
Menggabungkan beberapa pohon menjadi satu model ensemble.
Teknik untuk mengisi data yang kosong sebelum proses splitting.
Proses memotong cabang-cabang pohon untuk mencegah terjadinya overfitting.
Dalam Decision Tree, fitur yang diletakkan sebagai 'Root Node' (akar) adalah fitur yang memiliki...
Jumlah data yang paling sedikit agar pohon tidak terlalu lebar.
Information Gain tertinggi atau Gini Impurity terendah setelah pemisahan.
Nilai rata-rata yang paling besar di antara fitur lainnya.
Nilai entropy yang kecil
Hadoop Distributed File System (HDFS) menggunakan arsitektur Master-Slave. Komponen manakah yang bertugas menyimpan metadata dan mengatur akses ke file oleh klien?
TaskTracker
NameNode
DataNode
Resource Manager
Teknik apa yang digunakan untuk mengubah fitur kategorikal seperti 'Warna' (Merah, Biru, Hijau) menjadi format numerik biner (0 dan 1) agar bisa diproses oleh algoritme machine learning?
One-Hot Encoding
Min-Max Scaling
Principal Component Analysis (PCA)
Standardization
Apa tujuan utama dari melakukan Feature Selection (seleksi fitur) dalam tahap preprocessing?
Mengurangi kompleksitas model dan mencegah overfitting dengan menghapus fitur yang tidak relevan.
Memastikan data mengikuti distribusi Poisson.
Mengubah data teks menjadi representasi vektor numerik.
Menghapus baris kosong pada data
Data outlier adalah nilai yang menyimpang jauh dari rata-rata. Manakah metode visualisasi yang paling efektif untuk mendeteksi outlier secara cepat?
Pie Chart
Box Plot
Line Chart
Heatmap
Manakah dari teknik berikut yang merupakan contoh dari Filter Method?
Pearson Correlation
LASSO Regression
Recursive Feature Elimination (RFE)
forward selection
Seorang insinyur data ingin memprediksi harga rumah berdasarkan luas bangunan, lokasi, dan jumlah kamar. Jenis permasalahan Machine Learning apakah ini?
Regresi
Clustering
Association Rules
Klasifikasi
Dalam Association Rule Mining, apa yang dimaksud dengan metrik 'Support'?
Rasio antara probabilitas kejadian bersama dengan probabilitas kejadian independen.
Jumlah total item unik yang ada dalam satu keranjang belanja.
Ukuran seberapa sering item B dibeli jika pelanggan sudah membeli item A.
Frekuensi kemunculan suatu kombinasi item dalam seluruh transaksi yang ada.
Diberikan aturan {Roti} -> {Selai}. Jika dari 100 transaksi, terdapat 40 transaksi yang mengandung Roti, dan 30 transaksi yang mengandung baik Roti maupun Selai, berapakah nilai Confidence-nya?
0.30 (30%)
0.75 (75%)
0.40 (40%)
0.60
