Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Final Exam - Data Mining

Total questions: 60

Worksheet time: 36mins

Name
Class
Date
1.

Apa definisi sederhana Machine Learning?

a)

Algoritma yang diprogram untuk menyelesaikan masalah spesifik.

b)

Algoritma yang belajar dari data untuk membuat prediksi.

c)

Proses pengumpulan data dalam jumlah besar.

d)

Program yang sepenuhnya otomatis tanpa intervensi manusia.

2.

Apa hubungan antara Machine Learning (ML) dan Artificial Intelligence (AI)?

a)

ML adalah bagian dari AI yang memungkinkan komputer belajar dari data.

b)

AI adalah bagian dari ML yang berfokus pada prediksi data.

c)

ML dan AI adalah dua hal yang sama.

d)

ML tidak memiliki hubungan dengan AI.

3.

Manakah yang termasuk jenis metode supervised learning?

a)

Clustering

b)

Dimensional Reduction

c)

Classification

d)

Anomaly Detection

4.

Apa contoh kasus dari unsupervised learning?

a)

Credit Scoring

b)

Customer Segmentation

c)

House Price Prediction

d)

Fraud Detection dengan Label

5.

Mengapa Machine Learning diperlukan dalam menangani data?

a)

Karena komputer dapat menggantikan manusia sepenuhnya.

b)

Karena data yang besar dan kompleks sulit ditangani oleh manusia.

c)

Karena Machine Learning tidak memerlukan data berkualitas.

d)

Karena Machine Learning hanya digunakan untuk masalah sederhana.

6.

Dalam credit scoring, apa yang menjadi 'label'?

a)

Usia pemohon.

b)

Gender pemohon.

c)

Default atau tidaknya pembayaran.

d)

Pemasukan bulanan pemohon.

7.

Apa langkah pertama dalam formulasi masalah Machine Learning menurut CRISP-DM?

a)

Menentukan algoritma yang digunakan.

b)

Mengumpulkan data yang relevan.

c)

Mengidentifikasi masalah yang perlu diselesaikan.

d)

Menentukan nilai akhir yang ingin dicapai.

8.

Apa tujuan utama regresi dalam machine learning?

a)

Untuk membuat klasifikasi data.

b)

Untuk memprediksi nilai kategorik.

c)

Untuk memprediksi nilai numerik dan menganalisis hubungan variabel.

d)

Untuk memisahkan data berdasarkan clustering.

9.

Apa yang dimaksud dengan slope (B1) dalam regresi linier?

a)

Perubahan nilai variabel independen ketika variabel dependen bertambah 1 unit.

b)

Perubahan nilai variabel dependen untuk setiap perubahan 1 unit variabel independen.

c)

Nilai rata-rata variabel dependen ketika variabel independen bernilai nol.

d)

Error antara nilai prediksi dan nilai sebenarnya.

10.

Apa langkah yang digunakan untuk mengestimasi parameter regresi?

a)

Penghitungan residual tanpa metode tambahan.

b)

Metode Least Squares untuk meminimalkan jumlah kuadrat error.

c)

Analisis korelasi sederhana.

d)

Penerapan clustering pada data numerik.

11.

Apa yang menjadi ciri utama regresi multiple?

a)

Hanya memiliki satu variabel independen.

b)

Tidak memerlukan interpretasi slope.

c)

Memiliki lebih dari satu variabel independen.

d)

Hanya menggunakan variabel kategorik.

12.

Mengapa multikolinieritas dapat menjadi masalah dalam regresi?

a)

Menyebabkan model menjadi terlalu sederhana.

b)

Membuat p-value dari uji parsial bias dan sulit diinterpretasikan.

c)

Menurunkan nilai R-square model.

d)

Menyebabkan data tidak dapat diproses secara numerik.

13.

Apa tujuan analisis residual dalam regresi?

a)

Untuk menemukan nilai error populasi.

b)

Untuk memeriksa asumsi kenormalan dan validitas model.

c)

Untuk menghitung nilai multikolinieritas antar variabel independen.

d)

Untuk menentukan R-square model.

14.

Apa interpretasi dari intercept dalam regresi linier?

a)

Perubahan rata-rata variabel dependen setiap variabel independen bertambah 1 unit.

b)

Perkiraan nilai variabel dependen ketika semua variabel independen bernilai nol.

c)

Error antara prediksi dan nilai aktual.

d)

Variasi

15.

Apa yang dimaksud dengan klasifikasi?

a)

Metode untuk memprediksi nilai numerik.

b)

Proses membagi data menjadi beberapa cluster.

c)

Metode supervised learning untuk memprediksi data kategorik.

d)

Teknik untuk mengurangi dimensi data.

16.

Apa perbedaan utama antara binary classification dan multiclass classification?

a)

Binary classification memiliki lebih banyak fitur.

b)

Binary classification hanya memiliki dua kelas, sedangkan multiclass lebih dari dua.

c)

Multiclass classification tidak menggunakan algoritma supervised.

d)

Binary classification digunakan untuk data numerik.

17.

Apa tujuan logistic regression dalam konteks klasifikasi?

a)

Untuk memprediksi hasil dengan variabel target kategorik.

b)

Untuk membangun model regresi linier.

c)

Untuk melakukan clustering data.

d)

Untuk mengukur hubungan antara dua variabel independen.

18.

Apa fungsi dari sigmoid curve dalam logistic regression?

a)

Untuk menghitung jarak antara data poin.

b)

Untuk membagi data menjadi cluster.

c)

Untuk mengkonversi nilai menjadi probabilitas antara 0 dan 1.

d)

Untuk memisahkan variabel kategorik dari numerik.

19.

Dalam analisis logistik, apa arti nilai odds ratio (OR) yang lebih besar dari 1?

a)

Sukses rate meningkat ketika variabel independen meningkat.

b)

Tidak ada perubahan pada sukses rate.

c)

Sukses rate menurun ketika variabel independen meningkat.

d)

Tidak ada hubungan antara variabel independen dan dependen.

20.

Apa keunggulan utama K-Nearest Neighbour (KNN)?

a)

Sangat cepat dalam mengolah data besar.

b)

Tidak membutuhkan model parametrik.

c)

Selalu memberikan prediksi yang benar.

d)

Tidak memerlukan proses normalisasi data.

21.

Dalam metode Decision Tree, apa yang digunakan untuk menentukan kualitas splitter?

a)

Sigmoid curve

b)

Entropy dan Information Gain

c)

Odds ratio

d)

Euclidean distance

22.

Apa yang dimaksud dengan generalisasi dalam supervised learning?

a)

Kemampuan model untuk mempelajari data historis.

b)

Kemampuan model untuk membuat prediksi yang akurat pada data yang belum pernah dilihat.

c)

Pemisahan data menjadi training set dan validation set.

d)

Membuat model sederhana untuk menghindari overfitting.

23.

Apa yang terjadi pada model dengan underfitting?

a)

Model terlalu kompleks.

b)

Model terlalu sederhana untuk menangkap pola data.

c)

Model memiliki performa bagus pada training set, tetapi buruk pada test set.

d)

Model memiliki varians yang tinggi.

24.

Apa karakteristik dari overfitting?

a)

Model memiliki bias tinggi dan varians rendah.

b)

Model bekerja sangat baik pada test set.

c)

Model menangkap terlalu banyak pola bahkan yang tidak relevan.

d)

Model memiliki fitur yang sangat sedikit.

25.

Apa solusi untuk mengatasi overfitting?

a)

Menambah jumlah fitur.

b)

Menggunakan model yang lebih sederhana.

c)

Meningkatkan jumlah data pelatihan.

d)

B dan C benar.

26.

Dalam konteks bias dan varians, apa karakteristik model yang baik?

a)

Bias tinggi dan varians tinggi.

b)

Bias rendah dan varians tinggi.

c)

Bias sedang dan varians sedang.

d)

Bias rendah dan varians rendah.

27.

Bagaimana Ridge Regression membantu mengatasi overfitting?

a)

Dengan mengurangi varians model.

b)

Dengan menghapus fitur yang tidak relevan.

c)

Dengan membuat magnitude koefisien lebih kecil tanpa membuatnya nol.

d)

Dengan menambahkan lebih banyak fitur.

28.

Apa perbedaan utama antara Ridge dan Lasso Regression?

a)

Ridge membuat magnitude koefisien menjadi nol, sedangkan Lasso mengurangi magnitude.

b)

Lasso membuat magnitude koefisien menjadi nol, sedangkan Ridge hanya mengurangi magnitude.

c)

Ridge lebih cocok untuk data kategorik, sedangkan Lasso untuk data numerik.

d)

Ridge digunakan untuk overfitting, sedangkan Lasso untuk underfitting.

29.

Apa tujuan utama dari feature engineering?

a)

Menghilangkan data yang tidak relevan.

b)

Memberikan input yang lebih baik untuk model machine learning.

c)

Membuat model lebih kompleks untuk meningkatkan akurasi.

d)

Mengganti algoritma yang digunakan dalam modeling.

30.

Apa yang dimaksud dengan scaling?

a)

Transformasi variabel kategorik menjadi numerik.

b)

Penyesuaian data untuk memiliki skala yang sama.

c)

Proses penghapusan missing value.

d)

Penambahan fitur baru untuk meningkatkan akurasi.

31.

Metode encoding apa yang paling cocok digunakan untuk variabel nominal dengan banyak kategori?

a)

Ordinal Encoding

b)

Binary Encoding

c)

One Hot Encoding

d)

Polynomial Encoding

32.

Apa kelemahan dari Min-Max Scaler?

a)

Tidak dapat digunakan untuk variabel numerik.

b)

Memiliki hasil yang sulit diinterpretasikan.

c)

Sangat sensitif terhadap outlier.

d)

Mengubah data menjadi nilai yang tidak dapat diprediksi.

33.

Dalam metode Simple Imputer, kapan sebaiknya missing value diisi dengan median?

a)

Ketika data memiliki outlier yang ekstrem.

b)

Ketika data hanya memiliki beberapa kategori.

c)

Ketika data sudah di-scaling.

d)

Ketika data terdiri dari variabel kategorik.

34.

Apa tujuan dari binning dalam feature engineering?

a)

Menyederhanakan data numerik dengan mengelompokkannya ke dalam interval.

b)

Menghilangkan outlier dari dataset.

c)

Membuat model menjadi lebih kompleks.

d)

Memisahkan data menjadi training set dan test set.

35.

Apa yang dimaksud dengan iterative feature selection?

a)

Memilih fitur berdasarkan model yang sudah dibuat.

b)

Memilih fitur dengan membangun serangkaian model dengan variasi fitur yang berbeda.

c)

Menggunakan statistik univariat untuk memilih fitur terbaik.

d)

Menghapus fitur yang memiliki korelasi rendah secara manual.

36.

Apa tujuan utama dari evaluasi model machine learning?

a)

Meningkatkan akurasi pada training set.

b)

Memastikan model dapat menggeneralisasi dengan baik pada data baru.

c)

Mengoptimalkan semua hyperparameter tanpa validasi.

d)

Mengurangi kompleksitas model tanpa mempertimbangkan performa.

37.

Apa yang dimaksud dengan confusion matrix?

a)

Grafik yang menunjukkan trade-off antara presisi dan recall.

b)

Cross-tabulation antara nilai prediksi dan nilai aktual.

c)

Metode evaluasi model berbasis residual plot.

d)

Cara membandingkan model dengan menggunakan cross-validation.

38.

Manakah yang merupakan kelebihan F1-Score dalam evaluasi model klasifikasi?

a)

Mengukur kemampuan model pada dataset yang seimbang.

b)

Menggabungkan recall dan presisi untuk menangani data yang tidak seimbang.

c)

Digunakan hanya untuk regresi.

d)

Meningkatkan performa model pada data training.

39.

Apa kelemahan utama dari akurasi sebagai metrics pada dataset tidak seimbang?

a)

Tidak mampu menangkap trade-off antara recall dan presisi.

b)

Hanya fokus pada nilai positif tanpa mempertimbangkan negatif.

c)

Memberikan hasil tinggi walaupun model tidak mendeteksi kelas minoritas.

d)

Membutuhkan banyak data untuk dihitung.

40.

Apa yang dimaksud dengan ROC Curve?

a)

Grafik yang menunjukkan hubungan antara precision dan recall.

b)

Grafik yang mengukur trade-off antara True Positive Rate (TPR) dan False Positive Rate (FPR).

c)

Grafik yang digunakan untuk mengevaluasi regresi linier.

d)

Grafik yang hanya digunakan untuk dataset seimbang.

41.

Kapan kita sebaiknya menggunakan Mean Absolute Error (MAE) dibandingkan Mean Squared Error (MSE)?

a)

Ketika data memiliki banyak outlier.

b)

Ketika data memiliki distribusi yang simetris.

c)

Ketika kita ingin menghitung error dalam bentuk persentase.

d)

Ketika target variabel memiliki rentang nilai yang besar.

42.

Mengapa cross-validation sering digunakan dalam evaluasi model?

a)

Untuk meningkatkan akurasi pada training set.

b)

Untuk mengukur kemampuan generalisasi model dengan menggabungkan beberapa hasil validasi.

c)

Untuk menggantikan kebutuhan pembagian data menjadi training dan test set.

d)

Untuk menghindari overfitting pada test set.

43.

Apa yang dimaksud dengan imbalance classification?

a)

Metode klasifikasi untuk dataset dengan distribusi kelas yang merata.

b)

Klasifikasi ketika distribusi kelas minoritas lebih banyak dari kelas mayoritas.

c)

Klasifikasi ketika distribusi kelas tidak seimbang antara kelas mayoritas dan minoritas.

d)

Metode clustering untuk data numerik.

44.

Apa dampak utama dari dataset dengan kelas yang imbalance?

a)

Model memiliki akurasi tinggi, tetapi tidak mendeteksi kelas mayoritas.

b)

Model lebih fokus pada kelas mayoritas dan mengabaikan kelas minoritas.

c)

Model akan selalu menghasilkan performa yang baik.

d)

Kelas minoritas selalu lebih mudah dideteksi oleh model.

45.

Apa kelemahan utama dari metode random undersampling?

a)

Overfitting terhadap data mayoritas.

b)

Kehilangan banyak informasi karena data mayoritas dibuang.

c)

Membutuhkan banyak komputasi untuk implementasi.

d)

Tidak dapat digunakan untuk kelas mayoritas.

46.

Teknik apa yang digunakan untuk membuat data sintetis untuk kelas minoritas?

a)

Random Oversampling

b)

SMOTE (Synthetic Minority Oversampling Technique)

c)

Random Undersampling

d)

Near Miss

47.

Apa yang dimaksud dengan balanced accuracy?

a)

Rataan geometrik antara sensitivity dan specificity.

b)

Rataan aritmatik antara accuracy dan precision.

c)

Rataan antara persentase kelas positif dan negatif yang terprediksi dengan benar.

d)

Rataan harmonik antara precision dan recall.

48.

Apa tujuan utama dari stratified random sampling dalam imbalance classification?

a)

Mengurangi data minoritas agar distribusi kelas seimbang.

b)

Memastikan distribusi kelas tetap sama di setiap subset data.

c)

Menghapus noise dari data mayoritas.

d)

Membuat data sintetis untuk kelas mayoritas.

49.

Apa kelebihan utama menggunakan penalized logistic regression untuk imbalance classification?

a)

Cepat mengatasi overfitting tanpa preprocessing.

b)

Memberikan perhatian lebih pada kelas mayoritas.

c)

Mudah diimplementasikan dengan argumen "class_weight."

d)

Menghapus data minoritas secara otomatis.

50.

Ketika menggunakan stratified random sampling, distribusi kelas pada training, validation, dan test set tetap (a)   dengan data awal.

51.

Metode (a)   digunakan untuk menambah data sintetis pada kelas minoritas agar distribusi kelas lebih seimbang.

52.

Ketika menggunakan cross-validation, data dibagi menjadi beberapa subset, salah satunya adalah (a)   set, yang digunakan untuk menguji generalisasi model.

53.

Dalam feature engineering, variabel kategorik dapat direpresentasikan menjadi numerik menggunakan metode (a)   .

54.

Ridge Regression mengurangi kompleksitas model dengan mengecilkan nilai koefisien, sedangkan Lasso Regression membuat beberapa koefisien menjadi (a)   .

55.

Model yang memiliki performa baik pada training set tetapi buruk pada test set disebut model (a)   .

56.

Logistic regression memodelkan probabilitas kejadian sukses menggunakan fungsi (a)   .

57.

Dalam analisis regresi, (a)   adalah selisih antara nilai sebenarnya dan nilai prediksi.

58.

Dalam Decision Tree, semakin kecil nilai entropy, semakin (a)   subset data tersebut.

59.

Machine Learning adalah algoritma yang belajar dari (a)   untuk membuat prediksi.

60.

Dalam supervised learning, fitur digunakan untuk memprediksi (a)   yang muncul setelahnya.