WorksheetsUAS IB
Total questions: 77
Worksheet time: 39mins
Apa tujuan Elbow Method dalam K-Means Clustering?
Mengurangi noise pada data
Menentukan nilai k optimal dengan memplot SSE
Mengukur jarak antar titik
Meningkatkan jumlah iterasi
Apa yang menentukan kapan pelatihan backpropagation harus berhenti?
Ketika semua bobot menjadi nol
Jumlah epoch tetap
Pemilihan acak
Ketika metrik kesalahan memenuhi kriteria pemberhentian
Apa keterbatasan utama dari algoritma K-Means?
Sensitif terhadap pemilihan centroid awal
Tidak dapat menangani dataset besar
Hanya bekerja dengan data numerik
Membutuhkan terlalu banyak iterasi
Dalam jaringan multilayer, lapisan mana yang memproses data awal?
Lapisan output
Lapisan pemrosesan
Lapisan input
Lapisan tersembunyi
Dalam validitas eksternal, apa yang dimaksud dengan ground truth?
Metrik validasi
Label cluster yang diprediksi
Label kelas yang sudah diketahui
Pusat cluster
Dalam validasi cluster, jika Silhouette Score bernilai tinggi, apa artinya?
Cluster tidak dapat digunakan untuk analisis
Data dalam satu cluster sangat mirip satu sama lain dan berbeda dengan cluster lain
Cluster memiliki variasi besar
Hasil clustering lebih cocok untuk unsupervised learning
Untuk domain dengan N variabel biner, berapa banyak angka yang dibutuhkan untuk distribusi probabilitas gabungan?
2N
2^N
N^2
N
Manakah yang digunakan untuk memilih jumlah cluster optimal dalam clustering?
DBSCAN
Elbow Method
Silhouette Score
PCA
Jika data memiliki korelasi tinggi dalam validasi matriks, apa artinya?
Titik dalam cluster yang sama berdekatan
Titik dalam cluster yang sama berjauhan
Cluster acak
Cluster tidak valid
Apa yang menyebabkan variabel dependen dalam koneksi konvergen Bayesian Network?
Variabel selalu independen
Bukti tentang efek umumnya diketahui
Tidak bergantung pada bukti apa pun
Variabel menjadi dependen jika penyebab diketahui
Apa tujuan utama dari istilah bias (x₀) dalam perceptron?
Untuk mempercepat pelatihan
Untuk menormalisasi nilai input
Untuk menggeser batas keputusan
Untuk mengurangi overfitting
Untuk memilih nilai k yang optimal dalam K-Means Clustering, metode apa yang umum digunakan?
Memilih nilai acak berdasarkan eksperimen
Mengukur jarak antar titik dalam satu cluster
Metode Elbow: Memplot sum of squared errors (SSE) terhadap jumlah cluster
Menggunakan validasi eksternal
Sebuah dataset memiliki 2 komponen PCA yang menjelaskan 80% dan 15% varians. Berapa total varians yang dijelaskan?
90%
85%
95%
100%
Fase feed-forward melibatkan proses?
Memperbarui bobot secara acak
Menghapus lapisan tersembunyi
Menghitung kesalahan mundur
Menghitung output dari lapisan input ke output
Dalam clustering hierarkis, pendekatan agglomerative bekerja dengan cara:
Menggabungkan cluster dari bawah ke atas
Membutuhkan jumlah cluster yang telah ditentukan sebelumnya
Hanya bekerja dengan dua cluster pada satu waktu
Memisahkan cluster dari atas ke bawah
Jika parameter epsilon terlalu kecil dalam algoritma DBSCAN, maka:
Lebih banyak data akan diklasifikasikan sebagai noise
Cluster akan terpecah menjadi lebih banyak bagian
Keakuratan klasifikasi akan meningkat
Cluster akan menjadi lebih besar
Apa fungsi utama dari perceptron?
Hanya untuk memproses data kontinu
Untuk menghasilkan output acak
Untuk merepresentasikan permukaan keputusan hyperplane dalam ruang n-dimensi
Untuk menyimpan pola memori
Apa definisi independensi bersyarat antara variabel A dan B yang diberikan C?
P(A|C)
P(A|B)
P(A|B, C)
P(A, B|C)
Apa perbedaan mendasar antara pembelajaran terawasi dan pembelajaran tanpa pengawasan?
Pembelajaran tanpa pengawasan selalu menghasilkan hasil lebih baik
Pembelajaran terawasi menggunakan data berlabel sedangkan pembelajaran tanpa pengawasan bekerja dengan data tanpa label
Pembelajaran terawasi hanya digunakan untuk tugas klasifikasi
Pembelajaran tanpa pengawasan membutuhkan lebih banyak data
Apa tujuan utama validasi clustering?
Mengukur distribusi cluster
Menentukan jumlah cluster optimal
Menghapus cluster noise
Memberikan label eksternal
Untuk meningkatkan ketepatan prediksi dalam K-Means Clustering, perusahaan perlu melakukan:
Meningkatkan jumlah pelanggan dalam dataset
Meningkatkan jumlah iterasi
Mengurangi jumlah fitur untuk mempermudah analisis
Menambah nilai k dan memeriksa perubahan dalam sum of squared errors (SSE)
Berapa rentang nilai Koefisien Silhouette yang valid?
0 sampai 1
-∞ sampai ∞
0 sampai 100
-1 sampai 1
Apa yang dimaksud dengan hubungan kausal dalam Bayesian Network?
Semua node independen
Node induk memengaruhi node anak
Node tidak independen
Node dihubungkan acak
Manakah pernyataan berikut yang benar tentang konvergensi Perceptron Learning Rule?
Setiap pembelajaran tidak pasti akan terjadi konvergen
Konvergen hanya dengan tingkat pembelajaran tinggi
Konvergen hanya jika data dapat dipisahkan secara linier dan tingkat pembelajaran cukup kecil
Selalu konvergen terlepas dari distribusi data
Manakah yang TIDAK disebut sebagai sumber ketidakpastian saat bepergian ke bandara?
Observability parsial kondisi jalan
Kapasitas penumpang pesawat
Sensor berderau dalam laporan lalu lintas
Kondisi cuaca
Jika clustering memiliki Silhouette Score rendah, apa yang bisa diindikasikan?
Tidak ada interpretasi
Cluster sangat kuat
Cluster ideal
Cluster memiliki kualitas buruk
Apa yang ditentukan dalam Bayesian Network untuk perhitungan independensi bersyarat?
D-separation
Node induk dan bukti
Probabilitas total
Penyebab umum
Dalam jaringan Bayesian, apa yang dimaksud dengan d-separation?
Independensi bersyarat antara variabel
Jarak fisik antar node
Hubungan langsung antara node
Penghapusan node induk
Apa keunggulan utama Gradient Descent dibandingkan Perceptron Learning Rule?
Hanya bekerja dengan input biner
Membutuhkan lebih sedikit sumber daya komputasi
Dapat menangani data pelatihan yang tidak dapat dipisahkan secara linier
Selalu konvergen dalam iterasi yang lebih sedikit
Apa saja komponen utama dari neuron biologis menurut materi?
Hanya dendrit dan sinapsis
Hanya akson dan badan sel
Hanya badan sel dan dendrit
Dendrit, akson, badan sel, dan sinapsis
Dalam batch gradient descent, kapan bobot diperbarui?
Setelah memproses semua contoh pelatihan
Sebelum memproses contoh apa pun
Setelah setiap contoh pelatihan
Secara acak selama pelatihan
Apa yang terjadi jika learning rate terlalu rendah dalam Gradient Descent?
Model underfitting
Konvergensi menjadi lambat
Fungsi loss meningkat
Model konvergen cepat
Apa keterbatasan utama dari algoritma K-Means?
Hanya bekerja dengan data numerik
Tidak dapat menangani dataset besar
Sensitif terhadap pemilihan centroid awal
Membutuhkan terlalu banyak iterasi
Apa tujuan utama dari propagasi balik (backpropagation) dalam jaringan saraf?
Untuk meningkatkan kompleksitas komputasi
Untuk mengurangi jumlah lapisan tersembunyi
Untuk meningkatkan kompleksitas komputasi
Untuk menemukan bobot optimal untuk pemetaan input-output yang benar
Teorema Bayes digunakan untuk menghitung probabilitas posterior. Jika diketahui P(A|B), maka formula yang benar adalah:
P(B|A) / P(A)
P(B) / P(A)
P(A|B)
P(B|A) * P(A) / P(B)
DBSCAN adalah algoritma clustering yang digunakan untuk menemukan cluster berdasarkan kepadatan. Jika parameter epsilon terlalu kecil, apa yang akan terjadi?
Cluster akan menjadi lebih besar dan terhubung
Keakuratan klasifikasi akan meningkat
Lebih banyak data yang akan diklasifikasikan sebagai noise
Cluster akan terpecah menjadi lebih banyak bagian
Apa peran bias dalam jaringan saraf?
Mengurangi noise
Menggeser batas keputusan
Menghindari overfitting
Mempercepat konvergensi
Apa yang dimaksud dengan propagasi balik (backpropagation)?
Metode menambah hidden layer
Proses menambahkan neuron
Metode menemukan bobot optimal
Proses menghitung fungsi loss
Berapakah learning rate (η) biasanya dibatasi dalam Perceptron Learning Rule?
Kurang dari -1
Kurang dari -1
Antara -1 dan 0
Antara 0 dan 1
Sebuah perusahaan menggunakan K-Means untuk mengelompokkan pelanggan berdasarkan perilaku pembelian. Setelah analisis, SSE masih sangat tinggi. Apa yang harus dilakukan selanjutnya?
Menghapus beberapa fitur
Menggunakan algoritma clustering lain
Menambah jumlah cluster (k)
Mengurangi jumlah data
Sebuah dataset memiliki nilai missing sebesar 30%. Apa pendekatan terbaik untuk mengatasinya?
Menggunakan regresi logistik
Menggunakan imputasi nilai rata-rata atau median
Menggabungkan data duplikat
Menghapus semua data dengan missing values
Sebuah jaringan saraf menggunakan metode Gradient Descent dengan learning rate tinggi. Apa dampak yang paling mungkin terjadi?
Model konvergen lebih cepat
Fungsi loss menurun perlahan
Model overfitting
Fungsi loss tidak stabil dan sulit konvergen
Seorang analis data menerapkan Elbow Method untuk K-Means Clustering. Apa yang ditandai oleh titik elbow pada grafik?
Jumlah iterasi maksimum
Jumlah optimal cluster
Jumlah data outlier
Jumlah fitur yang digunakan
Seorang analis data menggunakan k-Fold Cross Validation dengan k=10. Apa keuntungan dari metode ini?
Mengurangi bias dalam evaluasi model
Menghasilkan akurasi lebih tinggi
Menghindari overfitting
Mempercepat waktu training
Seorang ilmuwan menggunakan PCA untuk mereduksi dimensi dataset dengan 50 fitur. Setelah PCA, dua komponen utama menjelaskan 90% varians. Apa yang harus dilakukan?
Menggunakan semua komponen utama
Menambahkan fitur baru ke dataset
Menghentikan penggunaan PCA
Menggunakan dua komponen utama tersebut
Sebuah perusahaan menggunakan Naive Bayes untuk klasifikasi teks. Apa asumsi utama yang diambil oleh algoritma ini?
Data bersifat linear
Fitur bersifat independen satu sama lain
Distribusi data normal
Tidak ada outlier dalam dataset
Sebuah tim menggunakan algoritma DBSCAN untuk menganalisis data geografis. Namun, banyak titik dianggap sebagai noise. Apa penyebab utama masalah ini?
Parameter epsilon terlalu besar
Jumlah titik terlalu sedikit
Parameter epsilon terlalu kecil
Data tidak memiliki kepadatan yang seragam
Sebuah model jaringan saraf menggunakan ReLU Activation pada hidden layer. Apa keuntungan dari pemilihan ini?
Menghasilkan output probabilitas
Meningkatkan interpretasi model
Mengatasi masalah vanishing gradient
Mempercepat training pada layer output
Dalam jaringan saraf, nilai bias digunakan untuk:
Menghindari overfitting
Membatasi jumlah iterasi
Menormalkan data input
Menggeser batas keputusan
Seorang analis menemukan bahwa model K-Means menghasilkan cluster yang tidak optimal. Setelah investigasi, ia menyadari bahwa data memiliki outlier. Apa solusi terbaik untuk memperbaiki masalah ini?
Menghapus outlier sebelum melakukan clustering
Menambah jumlah cluster
Mengganti K-Means dengan DBSCAN
Menggunakan PCA sebelum clustering
Sebuah model klasifikasi menggunakan Decision Tree pada data tidak seimbang. Apa metode yang dapat digunakan untuk menangani masalah ini?
Menghapus data duplikat
Menambah lebih banyak data
Oversampling kelas minoritas
Menggunakan PCA
Dalam jaringan saraf, Dropout digunakan selama training. Apa tujuan utama teknik ini?
Meminimalkan gradient loss
Menambah jumlah neuron
Mempercepat konvergensi
Mengurangi overfitting dengan mengabaikan neuron secara acak
Pada studi kasus diagnosa kanker, seorang ilmuwan menggunakan Confusion Matrix. Apa metrik yang paling penting dalam kasus ini?
Recall
Akurasi
Precision
Rata-rata error
Sebuah model regresi linear digunakan untuk memprediksi harga rumah berdasarkan luas tanah. Namun, error prediksi cukup besar. Apa langkah pertama yang harus dilakukan?
Normalisasi fitur input
Menambah lebih banyak fitur
Menerapkan metode clustering
Mengganti regresi linear dengan regresi logistik
Sebuah bank menggunakan ROC Curve untuk mengevaluasi model klasifikasi. Apa arti jika area di bawah kurva (AUC) mendekati 1?
Model terlalu kompleks
Model mengalami underfitting
Model memiliki performa yang sangat baik
Model memiliki performa buruk
Dalam analisis clustering dengan Silhouette Score, hasil nilai mendekati -1. Apa interpretasi dari nilai ini?
Data di cluster sangat mirip
Jumlah cluster terlalu sedikit
Data salah terklasifikasi ke cluster yang salah
Cluster memiliki performa baik
Dalam analisis data cuaca, seorang ilmuwan menggunakan Time Series Analysis. Apa komponen utama yang harus dianalisis dalam dataset ini?
Trend, musiman, dan residual
Clustering dan validasi
Dimensi dan varians
Noise dan bias
Sebuah model klasifikasi multi-kelas menggunakan One-Vs-Rest (OVR). Apa fungsi dari pendekatan ini?
Menghindari overfitting
Membagi masalah multi-kelas menjadi beberapa masalah biner
Meningkatkan interpretasi model
Menggabungkan semua kelas menjadi satu
Dalam DBSCAN, jika dataset memiliki kepadatan cluster yang tidak seragam, bagaimana hasil clustering akan dipengaruhi?
Semua cluster akan digabung menjadi satu
Semua data menjadi noise
Cluster dengan kepadatan rendah akan diklasifikasikan sebagai noise
Cluster akan memiliki ukuran yang sama
Dalam sistem deteksi penipuan, seorang analis menggunakan Random Forest. Apa kelebihan utama model ini dibandingkan Decision Tree tunggal?
Mengurangi overfitting dengan menggabungkan banyak pohon
Lebih cepat dalam training
Menghasilkan lebih sedikit fitur
Selalu memberikan akurasi 100%
Sebuah perusahaan menggunakan jaringan saraf untuk memprediksi penjualan produk. Data input memiliki 10 fitur, dan outputnya adalah 1 nilai prediksi. Berapa jumlah lapisan input dalam jaringan ini?
10
9
1
11
Sebuah perusahaan ingin mengelompokkan pelanggan berdasarkan nilai transaksi menggunakan Hierarchical Clustering. Apa metode linkage yang ideal jika jarak antar cluster sangat berbeda?
Complete Linkage
Single Linkage
Ward Linkage
Average Linkage
Sebuah perusahaan logistik ingin mengelompokkan rute pengiriman menggunakan Hierarchical Clustering. Apa metrik yang tepat digunakan untuk mengevaluasi jumlah optimal cluster?
Akurasi klasifikasi
Korelasi antar cluster
Sum of Squared Errors (SSE)
Silhouette Score
Dalam studi kasus klasifikasi spam email, algoritma Naive Bayes digunakan. Mengapa algoritma ini sering dipilih?
Cepat dan efisien pada data teks
Menghasilkan nilai akurasi tinggi di semua kasus
Meminimalkan overfitting
Mampu menangani data non-linear
Sebuah model clustering hierarkis menghasilkan dendrogram dengan banyak tingkat pemotongan. Bagaimana menentukan pemotongan optimal?
Menggunakan jumlah iterasi maksimum
Menentukan k secara manual
Menggunakan Silhouette Score
Melakukan PCA
Model klasifikasi menggunakan SVM (Support Vector Machine) dengan data yang tidak linearly separable. Apa solusi terbaik untuk memperbaikinya?
Menggunakan Kernel Trick
Mengurangi jumlah fitur
Menerapkan metode regresi
Menggunakan PCA
Dalam pengembangan model klasifikasi citra, seorang ilmuwan data menggunakan Softmax Activation pada layer output. Mengapa pemilihan ini tepat?
Softmax menormalisasi input
Softmax menghasilkan distribusi probabilitas kelas
Softmax menghasilkan distribusi probabilitas kelas
Softmax mengurangi overfitting
Sebuah dataset memiliki class imbalance dengan 90% data negatif dan 10% data positif. Algoritma apa yang cocok untuk mengatasi masalah ini?
K-Means Clustering
SMOTE (Synthetic Minority Oversampling Technique)
PCA
Naive Bayes
Seorang ilmuwan data menggunakan Bagging untuk melatih model klasifikasi. Apa keuntungan utama teknik ini?
Mengurangi bias secara signifikan
Meningkatkan kecepatan training
Mengurangi varians dan overfitting
Menggunakan lebih sedikit data
Seorang ilmuwan data menerapkan L1 Regularization pada model regresi. Apa efek utama dari metode ini?
Menghasilkan model dengan bobot sparsity (beberapa bobot nol)
Mengurangi kompleksitas model
Meningkatkan performa model pada semua dataset
Menghindari bias
Sebuah dataset dengan variabel kategori digunakan untuk prediksi churn pelanggan. Langkah apa yang perlu dilakukan sebelum training?
Mengubah variabel kategori menjadi numerik
Melakukan PCA
Normalisasi variabel numerik
Menghapus variabel kategori
Model Logistic Regression digunakan untuk memprediksi churn pelanggan. Namun, dataset memiliki fitur yang berkorelasi tinggi. Apa metode yang tepat untuk mengatasi masalah ini?
Menggunakan Gradient Descent
Menggunakan PCA atau menghapus fitur redundan
Menambahkan lebih banyak fitur
Menerapkan encoding ulang
Seorang ilmuwan data menggunakan KNN untuk memprediksi kelas pelanggan. Setelah training, hasil akurasi rendah pada dataset besar. Apa penyebab paling mungkin?
Model mengalami overfitting
Jumlah fitur tidak mencukupi
Nilai k terlalu kecil atau terlalu besar
Dataset memiliki terlalu banyak noise
Jika sebuah dataset memiliki outlier ekstrem, metode Mean Absolute Error (MAE) sering digunakan sebagai loss function karena:
MAE mendeteksi noise pada data
MAE menghitung error dengan cepat
MAE tidak sensitif terhadap outlier
MAE lebih akurat
Dalam studi prediksi penyakit, seorang analis menggunakan Recall sebagai metrik evaluasi. Mengapa Recall lebih penting dibandingkan Precision?
Recall memastikan kecepatan prediksi meningkat
Recall meminimalkan jumlah kasus positif yang terlewat
Recall mengurangi jumlah prediksi salah
Recall hanya memperhitungkan data negatif
Seorang analis ingin memvalidasi hasil clustering menggunakan DBSCAN. Jika nilai epsilon terlalu besar, apa yang mungkin terjadi?
Jumlah cluster optimal meningkat
Silhouette Score akan meningkat
Data terbagi menjadi banyak noise
Semua data menjadi satu cluster besar
Sebuah model backpropagation mengalami vanishing gradient problem. Apa solusi yang efektif untuk masalah ini?
Meningkatkan jumlah epoch
Menghapus hidden layer
Menggunakan ReLU sebagai fungsi aktivasi
Menggunakan learning rate yang tinggi
