Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Quis Kelas Data Mining

Total questions: 50

Worksheet time: 26mins

Name
Class
Date
1.


Manakah dari berikut ini yang merupakan contoh tugas 'Deskriptif' dalam Data Mining?

a)

Clustering (Pengelompokan)

b)

Klasifikasi (Classification)

c)

Regresi (Regression)

d)

Time Series Forecasting

2.

Dalam data mining, proses untuk menangani data yang hilang disebut …

a)

Normalisasi

b)

Data cleaning

c)

Clustering

d)

Evaluasi

3.

Pada preprocesing, Metode mean imputation paling tepat digunakan pada data

a)

Kategorikal nominal

b)

Kategorikal ordinal

c)

Numerik kontinu

d)

Data teks

4.

Anda memiliki dataset pelanggan dengan fitur usia, pendapatan, dan jenis kelamin.
Teknik preprocessing yang paling tepat untuk fitur jenis kelamin adalah …

a)

Normalization

b)

Standardization

c)

One-hot encoding

d)

Scaling log

5.

Tujuan utama dari preprocessing data adalah …

a)

Menambah ukuran dataset

b)

Mengurangi kompleksitas algoritma

c)

Meningkatkan kualitas data agar model bekerja optimal

d)

Menghilangkan seluruh noise secara permanen

6.

Korelasi antar fitur numerik paling umum dianalisis menggunakan …

a)

Histogram

b)

Scatter plot matrix

c)

Heatmap

d)

Bar chart

7.

Jika Nilai korelasi Pearson mendekati −1 menunjukkan_____

a)

Tidak ada hubungan

b)

Hubungan linear yang kuat

c)

Hubungan berkebalikan yang kuat

d)

Hubungan non-linear

8.

EDA citra menunjukkan ukuran gambar sangat bervariasi (64×64 hingga 512×512). Keputusan preprocessing paling tepat berdasarkan EDA tersebut adalah_____

a)

Menghapus citra berukuran kecil

b)

Mengubah citra menjadi grayscale

c)

Melakukan resizing ke ukuran seragam

d)

Mengurangi jumlah channel

9.

EDA menunjukkan fitur kategorikal memiliki puluhan kategori unik dengan frekuensi sangat timpang.

Risiko utama jika langsung menggunakan one-hot encoding adalah …

a)

Hilangnya informasi

b)

Curse of dimensionality

c)

Overfitting selalu terjadi

d)

Model tidak bisa dilatih

10.

Contoh data Big Data tidak terstruktur adalah …

a)

Tabel transaksi bank

b)

Data sensor numerik

c)

Video CCTV dan posting media sosial

d)

File CSV

11.

Framework Big Data yang menggunakan konsep distributed storage dan processing adalah …

a)

MySQL

b)

Hadoop

c)

Excel

d)

SPSS

12.

Yang termasuk masalah supervised learning adalah …

a)

Clustering pelanggan

b)

Deteksi anomali

c)

Prediksi harga rumah

d)

Topic modeling

13.

Dalam Machine learning perbedaan utama klasifikasi dan regresi adalah _____

a)

Jumlah fitur

b)

dimensi data

c)

Tipe output yang diprediksi

d)

Jumlah data

14.

Dalam machine learningKarakteristik utama algoritma Naive Bayes adalah …

a)

Tidak membutuhkan data label

b)

Mengasumsikan independensi antar fitur

c)

Menggunakan jarak Euclidean

d)

Berbasis pohon

15.

Confusion matrix digunakan untuk …

a)

Melatih model

b)

Menampilkan performa klasifikasi

c)

Mengurangi dimensi data

d)

Menentukan learning rate

16.

Tujuan utama unsupervised learning adalah …

a)

Memprediksi nilai target

b)

Mengklasifikasikan data berdasarkan label

c)

Menemukan pola atau struktur tersembunyi dalam data

d)

Mengukur akurasi model

17.

Masalah yang paling tepat diselesaikan dengan unsupervised learning adalah …

a)

Prediksi harga rumah

b)

Deteksi email spam

c)

Segmentasi pelanggan

d)

Prediksi kelulusan mahasiswa

18.

Output utama dari unsupervised learning biasanya berupa …

a)

Nilai probabilitas kelas

b)

Label target sebenarnya

c)

Kelompok atau representasi data

d)

Confusion matrix

19.

Algoritma clustering yang paling populer dan berbasis centroid adalah …

a)

DBSCAN

b)

Hierarchical Clustering

c)

K-Means

d)
  • Gaussian Naive Bayes

20.

Sebuah perusahaan ritel ingin mengelompokkan pelanggan berdasarkan usia, pendapatan, dan frekuensi belanja. EDA menunjukkan rentang fitur sangat berbeda. Langkah paling tepat sebelum clustering adalah …

a)

Menambah jumlah cluster

b)

Melakukan feature scaling

c)

Menghapus fitur pendapatan

d)

Mengganti algoritma

21.

Dalam K-Means, jika fitur tidak dinormalisasi, risiko utama yang terjadi adalah …

a)

Model tidak bisa dijalankan

b)

Jumlah cluster berubah otomatis

c)

Fitur berskala besar mendominasi jarak

d)

Data menjadi tidak valid

22.

Jika jumlah cluster belum diketahui, metode yang paling tepat untuk membantu menentukannya adalah …

a)

Accuracy score

b)

Confusion matrix

c)

Elbow method atau Silhouette score

d)

Cross-validation

23.

K-Means kurang cocok digunakan jika …

a)

Cluster berbentuk bulat

b)

Jumlah cluster diketahui

c)

Terdapat banyak noise dan outlier

d)

Data sudah dinormalisasi

24.

Masalah yang paling cocok diselesaikan dengan Naive Bayes adalah …

a)

Clustering pelanggan

b)

Klasifikasi teks

c)

Reduksi dimensi

d)

Prediksi time-series

25.

Gaussian Naive Bayes cocok digunakan jika fitur …

a)

Bersifat kategorikal

b)

Bersifat biner

c)

Bertipe numerik

d)

Berbentuk teks

26.

Dalam machine learning, Algoritma Decision Tree termasuk ke dalam jenis …

a)

Unsupervised learning

b)

Supervised learning

c)

Reinforcement learning

d)

Semi-supervised learning

27.

Setiap node pada Decision Tree merepresentasikan …

a)

Model regresi

b)

Satu fitur dan aturan pemisahan

c)

Seluruh dataset

d)

Learning rate

28.

Kriteria yang paling umum digunakan untuk menentukan split terbaik pada Decision Tree adalah …

a)

Accuracy

b)

Mean Squared Error

c)

Gini Index dan Information Gain

d)

Euclidean Distance

29.

Sistem penilaian kelayakan kredit menggunakan fitur pendapatan, usia, dan riwayat kredit.

Masalah ini paling tepat diselesaikan menggunakan …

a)

Clustering

b)

Regresi linear

c)

Klasifikasi dengan Decision Tree

d)

PCA

30.

Dalam eksperimen clustering, peneliti membandingkan label hasil K-Means dengan label asli pelanggan (loyal vs tidak loyal). Metrik yang paling sesuai digunakan adalah …

a)

Davies-Bouldin Index

b)

Silhouette Coefficient

c)

Adjusted Rand Index (ARI)

d)

Inertia

31.

Sebuah model klasifikasi penyakit memiliki Recall tinggi tetapi Precision rendah. Artinya …

a)

Banyak pasien sehat terdeteksi sakit

b)

Banyak pasien sakit tidak terdeteksi

c)

Model jarang salah memprediksi positif

d)

Model seimbang dalam semua prediksi

32.

Sebuah dataset sangat imbalanced (95% kelas negatif). Accuracy model mencapai 95%. Kesimpulan yang paling tepat adalah …

a)

Model sudah sangat baik

b)

Accuracy tidak cukup merepresentasikan performa

c)

Precision dan recall pasti tinggi

d)

Model tidak bisa dievaluasi

33.

Manakah dari pernyataan berikut yang paling tepat menjelaskan metrik F1-Score?

a)

Perbandingan antara True Positive dengan False Negative.

b)

Rata-rata aritmatika sederhana dari Precision dan Recall.

c)

Metrik untuk mengukur jarak antar pusat klaster dalam clustering.

d)

Rata-rata harmonik antara Precision dan Recall.

34.


Davies-Bouldin Index yang lebih rendah menunjukkan bahwa hasil clustering bersifat...

a)

Lebih baik, karena klaster lebih terpisah dan lebih padat.

b)

Sangat bergantung pada label ground truth.

c)

Lebih buruk, karena banyak data yang tumpang tindih.

d)

Netral, karena metrik ini hanya berlaku untuk data linear.

35.

Kurva ROC (Receiver Operating Characteristic) memplot hubungan antara dua variabel. Variabel apakah yang dimaksud?

a)

Accuracy dan Loss.

b)

Precision dan Recall.

c)

True Positive Rate dan False Positive Rate.

d)

Intra-cluster distance dan Inter-cluster distance.

36.

Dalam Klastering Elbow Method digunakan untuk menentukan …

a)

Nilai silhouette maksimum

b)

Jarak antar centroid

c)

Jumlah cluster optimal

d)

Label cluster

37.

Dalam sebuah pengujian model deteksi wajah terhadap 200 gambar, diketahui: TP = 90, TN = 90, FP = 10, FN = 10, Berapakah nilai Akurasi model tersebut?

(a)  

38.

Dalam sebuah pengujian model deteksi wajah terhadap 200 gambar, diketahui: TP = 90, TN = 90, FP = 15, FN = 5, Berapakah nilai Akurasi model tersebut?

a)

A. 0.85

b)

0.90

c)

0.85

d)

0.95

39.

Sebuah sistem filter email spam mengklasifikasikan 100 email. Model memprediksi 30 email sebagai 'Spam'. Dari 30 prediksi tersebut, ternyata hanya 20 yang benar-benar spam, sedangkan 10 sisanya adalah email penting (False Positive). Berapakah nilai Precision model ini?

a)

0.80

b)

0.67

c)

0.50

d)

0.20

40.

Manakah dari metrik clustering berikut yang bersifat 'Internal', artinya tidak memerlukan label referensi eksternal?

a)

Normalized Mutual Information (NMI)

b)

Davies-Bouldin Index

c)

Adjusted Rand Index (ARI)

d)

Rand Index

41.

Apa yang dimaksud dengan 'Pruning' dalam konteks algoritme Decision Tree?

a)

Proses memilih fitur yang paling penting di awal pembentukan pohon.

b)

Menggabungkan beberapa pohon menjadi satu model ensemble.

c)

Teknik untuk mengisi data yang kosong sebelum proses splitting.

d)

Proses memotong cabang-cabang pohon untuk mencegah terjadinya overfitting.

42.


Dalam Decision Tree, fitur yang diletakkan sebagai 'Root Node' (akar) adalah fitur yang memiliki...

a)

Jumlah data yang paling sedikit agar pohon tidak terlalu lebar.

b)

Information Gain tertinggi atau Gini Impurity terendah setelah pemisahan.

c)

Nilai rata-rata yang paling besar di antara fitur lainnya.

d)

Nilai entropy yang kecil

43.

Hadoop Distributed File System (HDFS) menggunakan arsitektur Master-Slave. Komponen manakah yang bertugas menyimpan metadata dan mengatur akses ke file oleh klien?

a)

TaskTracker

b)

NameNode

c)

DataNode

d)

Resource Manager

44.


Teknik apa yang digunakan untuk mengubah fitur kategorikal seperti 'Warna' (Merah, Biru, Hijau) menjadi format numerik biner (0 dan 1) agar bisa diproses oleh algoritme machine learning?

a)

One-Hot Encoding

b)

Min-Max Scaling

c)

Principal Component Analysis (PCA)

d)

Standardization

45.

Apa tujuan utama dari melakukan Feature Selection (seleksi fitur) dalam tahap preprocessing?

a)

Mengurangi kompleksitas model dan mencegah overfitting dengan menghapus fitur yang tidak relevan.

b)

Memastikan data mengikuti distribusi Poisson.

c)

Mengubah data teks menjadi representasi vektor numerik.

d)

Menghapus baris kosong pada data

46.

Data outlier adalah nilai yang menyimpang jauh dari rata-rata. Manakah metode visualisasi yang paling efektif untuk mendeteksi outlier secara cepat?

a)

Pie Chart

b)

Box Plot

c)

Line Chart

d)

Heatmap

47.

Manakah dari teknik berikut yang merupakan contoh dari Filter Method?

a)

Pearson Correlation

b)

LASSO Regression

c)

Recursive Feature Elimination (RFE)

d)

forward selection

48.

Seorang insinyur data ingin memprediksi harga rumah berdasarkan luas bangunan, lokasi, dan jumlah kamar. Jenis permasalahan Machine Learning apakah ini?

a)

Regresi

b)

Clustering

c)

Association Rules

d)

Klasifikasi

49.

Dalam Association Rule Mining, apa yang dimaksud dengan metrik 'Support'?

a)

Rasio antara probabilitas kejadian bersama dengan probabilitas kejadian independen.

b)

Jumlah total item unik yang ada dalam satu keranjang belanja.

c)

Ukuran seberapa sering item B dibeli jika pelanggan sudah membeli item A.

d)

Frekuensi kemunculan suatu kombinasi item dalam seluruh transaksi yang ada.

50.

Diberikan aturan {Roti} -> {Selai}. Jika dari 100 transaksi, terdapat 40 transaksi yang mengandung Roti, dan 30 transaksi yang mengandung baik Roti maupun Selai, berapakah nilai Confidence-nya?

a)

0.30 (30%)

b)

0.75 (75%)

c)

0.40 (40%)

d)

0.60