Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

UAS IB

Total questions: 77

Worksheet time: 39mins

Name
Class
Date
1.

Apa tujuan Elbow Method dalam K-Means Clustering?

a)

Mengurangi noise pada data

b)

Menentukan nilai k optimal dengan memplot SSE

c)

Mengukur jarak antar titik

d)

Meningkatkan jumlah iterasi

2.

Apa yang menentukan kapan pelatihan backpropagation harus berhenti?

a)

Ketika semua bobot menjadi nol

b)

Jumlah epoch tetap

c)

Pemilihan acak

d)

Ketika metrik kesalahan memenuhi kriteria pemberhentian

3.

Apa keterbatasan utama dari algoritma K-Means?

a)

Sensitif terhadap pemilihan centroid awal

b)

Tidak dapat menangani dataset besar

c)

Hanya bekerja dengan data numerik

d)

Membutuhkan terlalu banyak iterasi

4.

Dalam jaringan multilayer, lapisan mana yang memproses data awal?

a)

Lapisan output

b)

Lapisan pemrosesan

c)

Lapisan input

d)

Lapisan tersembunyi

5.

Dalam validitas eksternal, apa yang dimaksud dengan ground truth?

a)

Metrik validasi

b)

Label cluster yang diprediksi

c)

Label kelas yang sudah diketahui

d)

Pusat cluster

6.

Dalam validasi cluster, jika Silhouette Score bernilai tinggi, apa artinya?

a)

Cluster tidak dapat digunakan untuk analisis

b)

Data dalam satu cluster sangat mirip satu sama lain dan berbeda dengan cluster lain

c)

Cluster memiliki variasi besar

d)

Hasil clustering lebih cocok untuk unsupervised learning

7.

Untuk domain dengan N variabel biner, berapa banyak angka yang dibutuhkan untuk distribusi probabilitas gabungan?

a)

2N

b)

2^N

c)

N^2

d)

N

8.

Manakah yang digunakan untuk memilih jumlah cluster optimal dalam clustering?

a)

DBSCAN

b)

Elbow Method

c)

Silhouette Score

d)

PCA

9.

Jika data memiliki korelasi tinggi dalam validasi matriks, apa artinya?

a)

Titik dalam cluster yang sama berdekatan

b)

Titik dalam cluster yang sama berjauhan

c)

Cluster acak

d)

Cluster tidak valid

10.

Apa yang menyebabkan variabel dependen dalam koneksi konvergen Bayesian Network?

a)

Variabel selalu independen

b)

Bukti tentang efek umumnya diketahui

c)

Tidak bergantung pada bukti apa pun

d)

Variabel menjadi dependen jika penyebab diketahui

11.

Apa tujuan utama dari istilah bias (x₀) dalam perceptron?

a)

Untuk mempercepat pelatihan

b)

Untuk menormalisasi nilai input

c)

Untuk menggeser batas keputusan

d)

Untuk mengurangi overfitting

12.

Untuk memilih nilai k yang optimal dalam K-Means Clustering, metode apa yang umum digunakan?

a)

Memilih nilai acak berdasarkan eksperimen

b)

Mengukur jarak antar titik dalam satu cluster

c)

Metode Elbow: Memplot sum of squared errors (SSE) terhadap jumlah cluster

d)

Menggunakan validasi eksternal

13.

Sebuah dataset memiliki 2 komponen PCA yang menjelaskan 80% dan 15% varians. Berapa total varians yang dijelaskan?

a)

90%

b)

85%

c)

95%

d)

100%

14.

Fase feed-forward melibatkan proses?

a)

Memperbarui bobot secara acak

b)

Menghapus lapisan tersembunyi

c)

Menghitung kesalahan mundur

d)

Menghitung output dari lapisan input ke output

15.

Dalam clustering hierarkis, pendekatan agglomerative bekerja dengan cara:

a)

Menggabungkan cluster dari bawah ke atas

b)

Membutuhkan jumlah cluster yang telah ditentukan sebelumnya

c)

Hanya bekerja dengan dua cluster pada satu waktu

d)

Memisahkan cluster dari atas ke bawah

16.

Jika parameter epsilon terlalu kecil dalam algoritma DBSCAN, maka:

a)

Lebih banyak data akan diklasifikasikan sebagai noise

b)

Cluster akan terpecah menjadi lebih banyak bagian

c)

Keakuratan klasifikasi akan meningkat

d)

Cluster akan menjadi lebih besar

17.

Apa fungsi utama dari perceptron?

a)

Hanya untuk memproses data kontinu

b)

Untuk menghasilkan output acak

c)

Untuk merepresentasikan permukaan keputusan hyperplane dalam ruang n-dimensi

d)

Untuk menyimpan pola memori

18.

Apa definisi independensi bersyarat antara variabel A dan B yang diberikan C?

a)

P(A|C)

b)

P(A|B)

c)

P(A|B, C)

d)

P(A, B|C)

19.

Apa perbedaan mendasar antara pembelajaran terawasi dan pembelajaran tanpa pengawasan?

a)

Pembelajaran tanpa pengawasan selalu menghasilkan hasil lebih baik

b)

Pembelajaran terawasi menggunakan data berlabel sedangkan pembelajaran tanpa pengawasan bekerja dengan data tanpa label

c)

Pembelajaran terawasi hanya digunakan untuk tugas klasifikasi

d)

Pembelajaran tanpa pengawasan membutuhkan lebih banyak data

20.

Apa tujuan utama validasi clustering?

a)

Mengukur distribusi cluster

b)

Menentukan jumlah cluster optimal

c)

Menghapus cluster noise

d)

Memberikan label eksternal

21.

Untuk meningkatkan ketepatan prediksi dalam K-Means Clustering, perusahaan perlu melakukan:

a)

Meningkatkan jumlah pelanggan dalam dataset

b)

Meningkatkan jumlah iterasi

c)

Mengurangi jumlah fitur untuk mempermudah analisis

d)

Menambah nilai k dan memeriksa perubahan dalam sum of squared errors (SSE)

22.

Berapa rentang nilai Koefisien Silhouette yang valid?

a)

0 sampai 1

b)

-∞ sampai ∞

c)

0 sampai 100

d)

-1 sampai 1

23.

Apa yang dimaksud dengan hubungan kausal dalam Bayesian Network?

a)

Semua node independen

b)

Node induk memengaruhi node anak

c)

Node tidak independen

d)

Node dihubungkan acak

24.

Manakah pernyataan berikut yang benar tentang konvergensi Perceptron Learning Rule?

a)

Setiap pembelajaran tidak pasti akan terjadi konvergen

b)

Konvergen hanya dengan tingkat pembelajaran tinggi

c)

Konvergen hanya jika data dapat dipisahkan secara linier dan tingkat pembelajaran cukup kecil

d)

Selalu konvergen terlepas dari distribusi data

25.

Manakah yang TIDAK disebut sebagai sumber ketidakpastian saat bepergian ke bandara?

a)

Observability parsial kondisi jalan

b)

Kapasitas penumpang pesawat

c)

Sensor berderau dalam laporan lalu lintas

d)

Kondisi cuaca

26.

Jika clustering memiliki Silhouette Score rendah, apa yang bisa diindikasikan?

a)

Tidak ada interpretasi

b)

Cluster sangat kuat

c)

Cluster ideal

d)

Cluster memiliki kualitas buruk

27.

Apa yang ditentukan dalam Bayesian Network untuk perhitungan independensi bersyarat?

a)

D-separation

b)

Node induk dan bukti

c)

Probabilitas total

d)

Penyebab umum

28.

Dalam jaringan Bayesian, apa yang dimaksud dengan d-separation?

a)

Independensi bersyarat antara variabel

b)

Jarak fisik antar node

c)

Hubungan langsung antara node

d)

Penghapusan node induk

29.

Apa keunggulan utama Gradient Descent dibandingkan Perceptron Learning Rule?

a)

Hanya bekerja dengan input biner

b)

Membutuhkan lebih sedikit sumber daya komputasi

c)

Dapat menangani data pelatihan yang tidak dapat dipisahkan secara linier

d)

Selalu konvergen dalam iterasi yang lebih sedikit

30.

Apa saja komponen utama dari neuron biologis menurut materi?

a)

Hanya dendrit dan sinapsis

b)

Hanya akson dan badan sel

c)

Hanya badan sel dan dendrit

d)

Dendrit, akson, badan sel, dan sinapsis

31.

Dalam batch gradient descent, kapan bobot diperbarui?

a)

Setelah memproses semua contoh pelatihan

b)

Sebelum memproses contoh apa pun

c)

Setelah setiap contoh pelatihan

d)

Secara acak selama pelatihan

32.

Apa yang terjadi jika learning rate terlalu rendah dalam Gradient Descent?

a)

Model underfitting

b)

Konvergensi menjadi lambat

c)

Fungsi loss meningkat

d)

Model konvergen cepat

33.

Apa keterbatasan utama dari algoritma K-Means?

a)

Hanya bekerja dengan data numerik

b)

Tidak dapat menangani dataset besar

c)

Sensitif terhadap pemilihan centroid awal

d)

Membutuhkan terlalu banyak iterasi

34.

Apa tujuan utama dari propagasi balik (backpropagation) dalam jaringan saraf?

a)

Untuk meningkatkan kompleksitas komputasi

b)

Untuk mengurangi jumlah lapisan tersembunyi

c)

Untuk meningkatkan kompleksitas komputasi

d)

Untuk menemukan bobot optimal untuk pemetaan input-output yang benar

35.

Teorema Bayes digunakan untuk menghitung probabilitas posterior. Jika diketahui P(A|B), maka formula yang benar adalah:

a)

P(B|A) / P(A)

b)

P(B) / P(A)

c)

P(A|B)

d)

P(B|A) * P(A) / P(B)

36.

DBSCAN adalah algoritma clustering yang digunakan untuk menemukan cluster berdasarkan kepadatan. Jika parameter epsilon terlalu kecil, apa yang akan terjadi?

a)

Cluster akan menjadi lebih besar dan terhubung

b)

Keakuratan klasifikasi akan meningkat

c)

Lebih banyak data yang akan diklasifikasikan sebagai noise

d)

Cluster akan terpecah menjadi lebih banyak bagian

37.

Apa peran bias dalam jaringan saraf?

a)

Mengurangi noise

b)

Menggeser batas keputusan

c)

Menghindari overfitting

d)

Mempercepat konvergensi

38.

Apa yang dimaksud dengan propagasi balik (backpropagation)?

a)

Metode menambah hidden layer

b)

Proses menambahkan neuron

c)

Metode menemukan bobot optimal

d)

Proses menghitung fungsi loss

39.

Berapakah learning rate (η) biasanya dibatasi dalam Perceptron Learning Rule?

a)

Kurang dari -1

b)

Kurang dari -1

c)

Antara -1 dan 0

d)

Antara 0 dan 1

40.

Sebuah perusahaan menggunakan K-Means untuk mengelompokkan pelanggan berdasarkan perilaku pembelian. Setelah analisis, SSE masih sangat tinggi. Apa yang harus dilakukan selanjutnya?

a)

Menghapus beberapa fitur

b)

Menggunakan algoritma clustering lain

c)

Menambah jumlah cluster (k)

d)

Mengurangi jumlah data

41.

Sebuah dataset memiliki nilai missing sebesar 30%. Apa pendekatan terbaik untuk mengatasinya?

a)

Menggunakan regresi logistik

b)

Menggunakan imputasi nilai rata-rata atau median

c)

Menggabungkan data duplikat

d)

Menghapus semua data dengan missing values

42.

Sebuah jaringan saraf menggunakan metode Gradient Descent dengan learning rate tinggi. Apa dampak yang paling mungkin terjadi?

a)

Model konvergen lebih cepat

b)

Fungsi loss menurun perlahan

c)

Model overfitting

d)

Fungsi loss tidak stabil dan sulit konvergen

43.

Seorang analis data menerapkan Elbow Method untuk K-Means Clustering. Apa yang ditandai oleh titik elbow pada grafik?

a)

Jumlah iterasi maksimum

b)

Jumlah optimal cluster

c)

Jumlah data outlier

d)

Jumlah fitur yang digunakan

44.

Seorang analis data menggunakan k-Fold Cross Validation dengan k=10. Apa keuntungan dari metode ini?

a)

Mengurangi bias dalam evaluasi model

b)

Menghasilkan akurasi lebih tinggi

c)

Menghindari overfitting

d)

Mempercepat waktu training

45.

Seorang ilmuwan menggunakan PCA untuk mereduksi dimensi dataset dengan 50 fitur. Setelah PCA, dua komponen utama menjelaskan 90% varians. Apa yang harus dilakukan?

a)

Menggunakan semua komponen utama

b)

Menambahkan fitur baru ke dataset

c)

Menghentikan penggunaan PCA

d)

Menggunakan dua komponen utama tersebut

46.

Sebuah perusahaan menggunakan Naive Bayes untuk klasifikasi teks. Apa asumsi utama yang diambil oleh algoritma ini?

a)

Data bersifat linear

b)

Fitur bersifat independen satu sama lain

c)

Distribusi data normal

d)

Tidak ada outlier dalam dataset

47.

Sebuah tim menggunakan algoritma DBSCAN untuk menganalisis data geografis. Namun, banyak titik dianggap sebagai noise. Apa penyebab utama masalah ini?

a)

Parameter epsilon terlalu besar

b)

Jumlah titik terlalu sedikit

c)

Parameter epsilon terlalu kecil

d)

Data tidak memiliki kepadatan yang seragam

48.

Sebuah model jaringan saraf menggunakan ReLU Activation pada hidden layer. Apa keuntungan dari pemilihan ini?

a)

Menghasilkan output probabilitas

b)

Meningkatkan interpretasi model

c)

Mengatasi masalah vanishing gradient

d)

Mempercepat training pada layer output

49.

Dalam jaringan saraf, nilai bias digunakan untuk:

a)

Menghindari overfitting

b)

Membatasi jumlah iterasi

c)

Menormalkan data input

d)

Menggeser batas keputusan

50.

Seorang analis menemukan bahwa model K-Means menghasilkan cluster yang tidak optimal. Setelah investigasi, ia menyadari bahwa data memiliki outlier. Apa solusi terbaik untuk memperbaiki masalah ini?

a)

Menghapus outlier sebelum melakukan clustering

b)

Menambah jumlah cluster

c)

Mengganti K-Means dengan DBSCAN

d)

Menggunakan PCA sebelum clustering

51.

Sebuah model klasifikasi menggunakan Decision Tree pada data tidak seimbang. Apa metode yang dapat digunakan untuk menangani masalah ini?

a)

Menghapus data duplikat

b)

Menambah lebih banyak data

c)

Oversampling kelas minoritas

d)

Menggunakan PCA

52.

Dalam jaringan saraf, Dropout digunakan selama training. Apa tujuan utama teknik ini?

a)

Meminimalkan gradient loss

b)

Menambah jumlah neuron

c)

Mempercepat konvergensi

d)

Mengurangi overfitting dengan mengabaikan neuron secara acak

53.

Pada studi kasus diagnosa kanker, seorang ilmuwan menggunakan Confusion Matrix. Apa metrik yang paling penting dalam kasus ini?

a)

Recall

b)

Akurasi

c)

Precision

d)

Rata-rata error

54.

Sebuah model regresi linear digunakan untuk memprediksi harga rumah berdasarkan luas tanah. Namun, error prediksi cukup besar. Apa langkah pertama yang harus dilakukan?

a)

Normalisasi fitur input

b)

Menambah lebih banyak fitur

c)

Menerapkan metode clustering

d)

Mengganti regresi linear dengan regresi logistik

55.

Sebuah bank menggunakan ROC Curve untuk mengevaluasi model klasifikasi. Apa arti jika area di bawah kurva (AUC) mendekati 1?

a)

Model terlalu kompleks

b)

Model mengalami underfitting

c)

Model memiliki performa yang sangat baik

d)

Model memiliki performa buruk

56.

Dalam analisis clustering dengan Silhouette Score, hasil nilai mendekati -1. Apa interpretasi dari nilai ini?

a)

Data di cluster sangat mirip

b)

Jumlah cluster terlalu sedikit

c)

Data salah terklasifikasi ke cluster yang salah

d)

Cluster memiliki performa baik

57.

Dalam analisis data cuaca, seorang ilmuwan menggunakan Time Series Analysis. Apa komponen utama yang harus dianalisis dalam dataset ini?

a)

Trend, musiman, dan residual

b)

Clustering dan validasi

c)

Dimensi dan varians

d)

Noise dan bias

58.

Sebuah model klasifikasi multi-kelas menggunakan One-Vs-Rest (OVR). Apa fungsi dari pendekatan ini?

a)

Menghindari overfitting

b)

Membagi masalah multi-kelas menjadi beberapa masalah biner

c)

Meningkatkan interpretasi model

d)

Menggabungkan semua kelas menjadi satu

59.

Dalam DBSCAN, jika dataset memiliki kepadatan cluster yang tidak seragam, bagaimana hasil clustering akan dipengaruhi?

a)

Semua cluster akan digabung menjadi satu

b)

Semua data menjadi noise

c)

Cluster dengan kepadatan rendah akan diklasifikasikan sebagai noise

d)

Cluster akan memiliki ukuran yang sama

60.

Dalam sistem deteksi penipuan, seorang analis menggunakan Random Forest. Apa kelebihan utama model ini dibandingkan Decision Tree tunggal?

a)

Mengurangi overfitting dengan menggabungkan banyak pohon

b)

Lebih cepat dalam training

c)

Menghasilkan lebih sedikit fitur

d)

Selalu memberikan akurasi 100%

61.

Sebuah perusahaan menggunakan jaringan saraf untuk memprediksi penjualan produk. Data input memiliki 10 fitur, dan outputnya adalah 1 nilai prediksi. Berapa jumlah lapisan input dalam jaringan ini?

a)

10

b)

9

c)

1

d)

11

62.

Sebuah perusahaan ingin mengelompokkan pelanggan berdasarkan nilai transaksi menggunakan Hierarchical Clustering. Apa metode linkage yang ideal jika jarak antar cluster sangat berbeda?

a)

Complete Linkage

b)

Single Linkage

c)

Ward Linkage

d)

Average Linkage

63.

Sebuah perusahaan logistik ingin mengelompokkan rute pengiriman menggunakan Hierarchical Clustering. Apa metrik yang tepat digunakan untuk mengevaluasi jumlah optimal cluster?

a)

Akurasi klasifikasi

b)

Korelasi antar cluster

c)

Sum of Squared Errors (SSE)

d)

Silhouette Score

64.

Dalam studi kasus klasifikasi spam email, algoritma Naive Bayes digunakan. Mengapa algoritma ini sering dipilih?

a)

Cepat dan efisien pada data teks

b)

Menghasilkan nilai akurasi tinggi di semua kasus

c)

Meminimalkan overfitting

d)

Mampu menangani data non-linear

65.

Sebuah model clustering hierarkis menghasilkan dendrogram dengan banyak tingkat pemotongan. Bagaimana menentukan pemotongan optimal?

a)

Menggunakan jumlah iterasi maksimum

b)

Menentukan k secara manual

c)

Menggunakan Silhouette Score

d)

Melakukan PCA

66.

Model klasifikasi menggunakan SVM (Support Vector Machine) dengan data yang tidak linearly separable. Apa solusi terbaik untuk memperbaikinya?

a)

Menggunakan Kernel Trick

b)

Mengurangi jumlah fitur

c)

Menerapkan metode regresi

d)

Menggunakan PCA

67.

Dalam pengembangan model klasifikasi citra, seorang ilmuwan data menggunakan Softmax Activation pada layer output. Mengapa pemilihan ini tepat?

a)

Softmax menormalisasi input

b)

Softmax menghasilkan distribusi probabilitas kelas

c)

Softmax menghasilkan distribusi probabilitas kelas

d)

Softmax mengurangi overfitting

68.

Sebuah dataset memiliki class imbalance dengan 90% data negatif dan 10% data positif. Algoritma apa yang cocok untuk mengatasi masalah ini?

a)

K-Means Clustering

b)

SMOTE (Synthetic Minority Oversampling Technique)

c)

PCA

d)

Naive Bayes

69.

Seorang ilmuwan data menggunakan Bagging untuk melatih model klasifikasi. Apa keuntungan utama teknik ini?

a)

Mengurangi bias secara signifikan

b)

Meningkatkan kecepatan training

c)

Mengurangi varians dan overfitting

d)

Menggunakan lebih sedikit data

70.

Seorang ilmuwan data menerapkan L1 Regularization pada model regresi. Apa efek utama dari metode ini?

a)

Menghasilkan model dengan bobot sparsity (beberapa bobot nol)

b)

Mengurangi kompleksitas model

c)

Meningkatkan performa model pada semua dataset

d)

Menghindari bias

71.

Sebuah dataset dengan variabel kategori digunakan untuk prediksi churn pelanggan. Langkah apa yang perlu dilakukan sebelum training?

a)

Mengubah variabel kategori menjadi numerik

b)

Melakukan PCA

c)

Normalisasi variabel numerik

d)

Menghapus variabel kategori

72.

Model Logistic Regression digunakan untuk memprediksi churn pelanggan. Namun, dataset memiliki fitur yang berkorelasi tinggi. Apa metode yang tepat untuk mengatasi masalah ini?

a)

Menggunakan Gradient Descent

b)

Menggunakan PCA atau menghapus fitur redundan

c)

Menambahkan lebih banyak fitur

d)

Menerapkan encoding ulang

73.

Seorang ilmuwan data menggunakan KNN untuk memprediksi kelas pelanggan. Setelah training, hasil akurasi rendah pada dataset besar. Apa penyebab paling mungkin?

a)

Model mengalami overfitting

b)

Jumlah fitur tidak mencukupi

c)

Nilai k terlalu kecil atau terlalu besar

d)

Dataset memiliki terlalu banyak noise

74.

Jika sebuah dataset memiliki outlier ekstrem, metode Mean Absolute Error (MAE) sering digunakan sebagai loss function karena:

a)

MAE mendeteksi noise pada data

b)

MAE menghitung error dengan cepat

c)

MAE tidak sensitif terhadap outlier

d)

MAE lebih akurat

75.

Dalam studi prediksi penyakit, seorang analis menggunakan Recall sebagai metrik evaluasi. Mengapa Recall lebih penting dibandingkan Precision?

a)

Recall memastikan kecepatan prediksi meningkat

b)

Recall meminimalkan jumlah kasus positif yang terlewat

c)

Recall mengurangi jumlah prediksi salah

d)

Recall hanya memperhitungkan data negatif

76.

Seorang analis ingin memvalidasi hasil clustering menggunakan DBSCAN. Jika nilai epsilon terlalu besar, apa yang mungkin terjadi?

a)

Jumlah cluster optimal meningkat

b)

Silhouette Score akan meningkat

c)

Data terbagi menjadi banyak noise

d)

Semua data menjadi satu cluster besar

77.

Sebuah model backpropagation mengalami vanishing gradient problem. Apa solusi yang efektif untuk masalah ini?

a)

Meningkatkan jumlah epoch

b)

Menghapus hidden layer

c)

Menggunakan ReLU sebagai fungsi aktivasi

d)

Menggunakan learning rate yang tinggi