NEW
Font size
WorksheetsModul 3 simulation (2)
Total questions: 35
Worksheet time: 18mins
Di bawah ini yang bukan merupakan model atau algoritma yang umum digunakan dalam unsupervised learning adalah
PCA
K-Means
KNN
DBSCAN
Berikut adalah pernyataan yang telah diubah dengan dua opsi benar dan dua opsi salah:
Misalkan Anda diminta untuk mengimplementasikan spam detection system pada sebuah layanan email. Diberikan beberapa pernyataan berikut ini.
Pernyataan:
1. Sistem Anda dapat menggunakan algoritma supervised learning untuk mengklasifikasikan email sebagai spam atau bukan spam.
2. Anda harus melatih model dengan data yang mencakup berbagai fitur, termasuk isi email dan pengirim.
3. Anda tidak perlu mempertimbangkan fitur-fitur lain selain isi email untuk melakukan prediksi.
4. Model yang Anda buat harus dilatih dengan data yang hanya terdiri dari email spam.
Pernyataan 1 dan 2 benar.
Pernyataan 1 dan 3 benar.
Pernyataan 2 dan 3 benar.
Pernyataan 3 dan 4 benar.
Pilih yang benar
kotak hijau adalah variabel independen
kotak kuning adalah slope
kotak merah adalah intercept
salah semua
Dalam analisis regresi, metode Ridge Regression digunakan untuk mengatasi masalah multikolinearitas dengan cara:
Menambahkan penalti pada jumlah kuadrat dari koefisien regresi.
Menghapus fitur yang memiliki korelasi tinggi.
Menggunakan metode klasifikasi untuk memprediksi nilai.
Mengoptimalkan jumlah data yang digunakan untuk pelatihan
Fungsi pada kode di atas akan menghitung sebuah evaluation metric yaitu
MSE
RMSE
MAPE
MAE
Berikut adalah soal yang telah diubah dengan fokus pada false negative rate:
Dalam kasus pendeteksian jawaban ujian yang merupakan hasil menyontek, di mana jawaban asli seorang siswa diasumsikan sebagai positive class, false negative rate menandakan...
Persentase jumlah jawaban hasil sontek yang dideteksi sebagai jawaban hasil sontek.
Jumlah jawaban hasil sontek yang dideteksi sebagai jawaban asli.
Jumlah jawaban asli yang dideteksi sebagai jawaban hasil sontek.
Persentase jumlah jawaban asli yang dideteksi sebagai jawaban hasil sontek.
Pada decision tree classification, splitting akan berhenti dilakukan jika terpenuhi kondisi-kondisi berikut ini, kecuali:
Seluruh elemen pada node masuk ke dalam satu kelas saja.
Kedalaman tree sudah mencapai ketentuan.
Jumlah elemen pada node sebelum melakukan splitting kurang dari ketentuan.
semua salah
Di bawah ini yang merupakan pernyataan yang salah mengenai decision tree yaitu:
Pada bagian bawah tree, nilai gini impurity cenderung lebih rendah
Decision tree dapat digunakan untuk melakukan prediksi label yang bersifat continuous.
Information gain memiliki kinerja splitting lebih baik dibanding gini index.
Semakin besar nilai parameter max_depth, semakin banyak jumlah node yang dihasilkan.
Semakin kecil nilai parameter min_samples, semakin dalam tree yang dihasilkan.
Bagian yang paling mungkin menyebabkan masalah evaluasi model pada potongan kode di atas terdapat pada
Model dilatih menggunakan data yang salah, sehingga hasil prediksi tidak akurat.
Data tidak dibagi dengan benar antara training dan testing.
Prediksi dilakukan pada data training alih-alih data testing.
Tidak ada kesalahan dalam kode ini
Pernyataan yang tepat mengenai tabel di atas adalah
Model ketiga menunjukkan performa terbaik di validation set dibandingkan model lainnya.
Model kedua mengalami overfitting.
Model pertama lebih mungkin diambil sebagai kandidat model terbaik dibanding model kedua.
Model ketiga kemungkinan dapat meningkat dengan menambah jumlah feature.
Di bawah ini yang bukan merupakan strategi untuk dapat menghindari underfitting yaitu:
Menambah jumlah fitur yang relevan.
Menggunakan model yang lebih kompleks.
Menerapkan regularization dengan ridge atau lasso
Menambahkan polynomial features pada model.
Kondisi di bawah merupakan beberapa penyebab dari overfitting, kecuali:
Menggunakan model yang terlalu kompleks untuk data yang sederhana.
Melibatkan fitur yang tidak relevan dalam model.
Menggunakan teknik regularization
Menggunakan nilai k yang sangat kecil untuk K-Nearest Neighbours.
Di antara beberapa contoh categorical variable di bawah ini, yang paling mungkin di-encode menggunakan teknik ordinal encoding yaitu:
Tingkat kepuasan pelanggan
Warna mobil
Tipe kendaraan (mobil, motor, truk)
Nama produk
Hasil dari fuel_types_train_encoded berapa kolom?
2
3
4
5
Apabila terdapat kasus missing values pada sejumlah kolom sebuah dataset, strategi yang tidak mungkin untuk dilakukan yaitu sebagai berikut, kecuali:
Mengisi missing value dengan median kolom tersebut (untuk kolom numerik)
Mengisi missing value dengan mode kolom tersebut (untuk kolom numerik)
Mengisi missing value dengan mean kolom tersebut (untuk kolom kategorik)
semua salah
Pada metode iterative forward feature selection, pemilihan feature dapat dilakukan di antaranya dengan:
Mencoba melatih beberapa model dengan jumlah feature yang berbeda-beda
Melihat koefisien dan hasil significant test dari independent variables pada sebuah linear model, atau melihat feature importance pada model seperti decision tree dan random forest.
Melatih model dengan seluruh feature, lalu menghilangkan feature satu per satu sambil menghitung sebuah metric.
Melatih model dengan sedikit feature, lalu menambahkan feature satu per satu sambil menghitung sebuah metric.
Apabila “YES” diasumsikan sebagai positive class, maka hasil perhitungan precision untuk positive class dari matriks di atas adalah
0.333
0.6
0.845
0.975
Anda bekerja di sebuah perusahaan keamanan siber yang bertugas untuk mendeteksi serangan malware. Perusahaan Anda menyadari bahwa risiko salah mengidentifikasi serangan malware sebagai aktivitas normal (false positive) dapat menyebabkan gangguan operasional yang signifikan. Oleh karena itu, penting untuk meminimalkan jumlah peringatan palsu yang dihasilkan oleh sistem deteksi.
Metric yang perlu coba diminimalkan oleh model Anda yaitu
Precision
Type II error
False negative rate
False positive rate
Jumlah kombinasi nilai hyperparameter yang akan dicoba adalah
5
12
3
4
Untuk memperoleh pengukuran evaluasi model berupa persentase selisih kuadrat antara hasil prediksi dengan data observasi yang sesungguhnya, metric yang dapat digunakan yaitu:
MAE
MAPE
RMSE
RMSPE
Di bawah ini yang merupakan strategi yang tepat dalam mengatasi kasus imbalance class adalah, kecuali
Menggunakan algoritma dengan weight untuk menyeimbangkan
oversampling atau undersampling
Mengatur bobot kelas pada model
random search cross validation pada training
Salah satu strategi dalam ensemble learning di mana terdapat lebih dari satu base learner dengan cara kerja yang berbeda, di mana setiap learner dilatih menggunakan hasil prediksi dari learner lainnya dan menggabungkan hasilnya untuk meningkatkan akurasi model disebut dengan:
Voting
Bagging
Pasting
Stacking
Apabila decision tree digunakan sebagai base learner method untuk bagging, strategi yang perlu dilakukan untuk memperoleh hasil prediksi yang optimal adalah, kecuali
menyamakan setiap model decision tree agar identik
menjalankan tiap base learner secara paralel
mengagregat hasil prediksi masing-masing base learner dengan melakukan majority vote
melatih sebuah decision tree terlebih dahulu sebagai pembanding dan untuk mengetahui adanya potensi perbaikan
Di bawah ini yang merupakan pernyataan yang tepat mengenai principal component analysis (PCA) yaitu
Terdapat hyperparameter berupa number of components yang mengatur jumlah input fitur yang dimasukkan
Hasil penerapan PCA terhadap sebuah dataset dapat digunakan untuk melakukan eksplorasi lebih lanjut semisal melakukan klasifikasi
Terdapat risiko kehilangan informasi ketika menerapkan PCA pada sebuah dataset
PCA mengurangi jumlah dimensi data dengan menghapus feature yang kurang relevan terhadap label
Dampak dari pengaturan hyperparameter epsilon atau min_samples pada DBSCAN yang benar yaitu:
Meningkatkan epsilon akan menghasilkan lebih banyak cluster dan mengurangi noise dalam data.
Meningkatkan min_samples akan membuat model lebih sensitif terhadap outlier dan mengurangi jumlah cluster.
Meningkatkan epsilon akan mengurangi jumlah data yang dianggap sebagai noise, tetapi dapat mengurangi detail cluster.
Meningkatkan min_samples akan meningkatkan jumlah cluster yang terbentuk dan mengurangi kompleksitas model.
Teknik elbow method pada K-Means Clustering dapat digunakan untuk mengetahui, kecuali:
Jumlah optimal cluster yang harus digunakan dalam model
Kualitas clustering berdasarkan nilai inertia atau within-cluster sum of squares
Jumlah total data yang harus digunakan dalam clustering
semua benar
Apabila sebuah ARIMA model menggunakan satu level differencing dan dua observasi lag sebagai predictor, maka parameter yang digunakan adalah
ARIMA(0,1,0)
ARIMA(1,2,0)
ARIMA(2,1,0)
ARIMA(0,1,2)
Kata yang memiliki bobot tf-idf terbesar pada dokumen ketiga adalah
business
money
principal
system
Apabila tokenization dilakukan menggunakan bi-gram (n=2 dan n_min = 2), maka hasil yang diperoleh dari teks berikut:
send letter, letter sister, sister no, no receive, receive due, due weather
send letter sister, letter sister no, sister no receive, no receive due, receive due weather
send letter sister no, letter sister no receive, sister no receive due, no receive due weather
send letter, letter sister, sister no, no receive, receive due, due weather, send letter sister no, letter sister no receive
Pada user-based collaborative filtering, pemberian rekomendasi dilakukan dengan
Memberi rekomendasi produk P kepada User U yang menggunakan produk P', di mana produk P’ memiliki user U’ yang juga merupakan pengguna produk P
Mencari produk P yang memiliki jumlah user U terbanyak, sehingga P akan direkomendasi ke semua user U’ yang belum menggunakannya
Mencari produk P yang memiliki jumlah produk P’ yang mirip dengannya paling banyak, sehingga P akan direkomendasikan ke semua user U’ yang belum menggunakannya
mencari produk P yang belum pernah digunakan oleh user U, namun telah digunakan oleh user U’ yang mirip dengan U, sehingga P akan direkomendasikan kepada U
Di bawah ini, yang merupakan kelemahan dalam penerapan model-based recommender system adalah
Data yang dibutuhkan cenderung lebih sedikit
Similarity measure antar item menjadi bias
Sulit untuk merekomendasikan item yang belum pernah memperoleh rating
Sulit untuk mengeksplor interest baru dari seorang user
Di bawah ini, manakah pernyataan yang paling tepat mengenai tingkat pemahaman dan penggunaan data?
Data aware adalah individu atau organisasi yang sepenuhnya mengandalkan intuisi dan tidak mempertimbangkan data sama sekali.
Data driven adalah individu atau organisasi yang menggunakan data tetapi tidak memahami cara menginterpretasikannya.
Data savvy adalah individu atau organisasi yang telah mengautomasi penggunaan data dalam pengambilan keputusan.
Data driven adalah individu atau organisasi yang telah mengautomasi proses pengambilan keputusan berdasarkan data yang tersedia.
Di bawah ini, yang merupakan contoh machine learning yang termasuk explainable machine learning model adalah
DBSCAN
Agglomerative Clustering
Logistic Regression
Decision Tree
Di bawah ini, yang merupakan business question yang bersifat inference yaitu, kecuali
Berapa banyak pelanggan yang melakukan pembelian di bulan ini?
Apakah kita dapat memprediksi pelanggan yang akan melakukan pembelian ulang?
Apa saja produk yang paling banyak dibeli oleh pelanggan?
Siapa saja pelanggan yang melakukan transaksi di atas Rp1.000.000?
Berikut metrics untuk regresi
Recall
Precision
ROC AUC
Semua salah
