NEW
Font size
WorksheetsModul 3 Versi Serius
Total questions: 35
Worksheet time: 35mins
Di bawah ini yang merupakan model atau algoritma yang umum digunakan dalam supervised learning, kecuali . . . .
Random Forest
Logistic Regression
XGBoost
Linear Regression
PCA
Pernyataan yang kurang tepat dari statement berikut adalah . . . .
1, 2, dan 4
2 dan 4
3 dan 4
1 dan 4
2 dan 3
Pernyataan di bawah ini yang tepat yaitu
komponen di dalam kotak kuning disebut dengan slope
komponen di dalam kotak kuning disebut dengan dependen variable
komponen di dalam kotak kuning disebut dengan intercept
komponen di dalam kotak hijau disebut dengan explanatory variable
komponen di dalam kotak merah disebut dengan independent variables
Metode Least Squares pada kasus regression dapat digunakan untuk mengestimasi nilai parameter model sehingga nilai sum of squared error dapat sekecil mungkin, yang ditandai dengan
jumlah selisih nilai hasil prediksi dengan data observasi yang sesungguhnya nilainya mendekati satu
jumlah dari nilai hasil prediksi dengan data observasi yang sesungguhnya dapat mendekati satu
jumlah nilai hasil prediksi dan data observasi yang sesungguhnya dapat sekecil mungkin
jumlah selisih nilai hasil prediksi dengan data observasi yang sesungguhnya dapat sekecil mungkin
Semua Statement Salah
Fungsi pada kode tersebut akan menghitung sebuah evaluation metric yaitu
MAPE
MAE
RMSE
R2
MSE
Dalam kasus pendeteksian jawaban ujian yang merupakan hasil menyontek, di mana jawaban asli seorang siswa diasumsikan sebagai positive class, false positive rate menandakan...
Persentase jumlah jawaban hasil sontek yang dideteksi sebagai jawaban hasil sontek
Banyaknya jawaban hasil sontek yang dideteksi sebagai jawaban asli
Banyaknya jawaban asli yang dideteksi sebagai jawaban hasil sontek
Persentase jumlah jawaban hasil sontek yang dideteksi sebagai jawaban asli
Persentase jumlah jawaban asli yang dideteksi sebagai jawaban hasil sontek
Pada decision tree classification, splitting akan berhenti dilakukan jika terpenuhi kondisi-kondisi berikut ini, kecuali
kedalaman tree sudah mencapai ketentuan
jumlah elemen pada node setelah melakukan splitting kurang dari ketentuan
jumlah elemen pada node sebelum melakukan splitting kurang dari ketentuan
seluruh elemen pada node masuk ke dalam satu kelas saja
Tidak Ada Jawaban Yang Benar
Di bawah ini yang merupakan pernyataan yang pasti benar mengenai decision tree yaitu
pada bagian bawah tree, nilai gini impurity cenderung lebih tinggi
DT dapat memprediksi data target numeric Continues
information gain memiliki kinerja splitting lebih baik dibanding gini index
semakin kecil nilai parameter min_samples, semakin dangkal tree yang dihasilkan
Semua Jawaban Salah
Bagian yang paling mungkin menyebabkan masalah evaluasi model pada potongan kode di atas terdapat pada
tidak ada baris kode yang bermasalah
baris ke-8
baris ke-15
baris ke-16
Baris 13
Pernyataan yang tepat dari tabel tersebut adalah
Seluruh Model Overfitting
KNN adalah best model
DT adalah best model
LogReg mengalami overfitting
KNN mengalami underfittng
Di bawah ini yang bukan merupakan strategi untuk dapat menghindari underfitting yaitu
menerapkan regularization dengan nilai parameter penalty term yang tinggi
Menambahkan jumlah feature
Menerapkan polynomial feature
Menggunakan Metode Near Miss
Semua jawaban salah
Kondisi di bawah merupakan beberapa penyebab dari overfitting, kecuali
Menggunakan order pangkat setinggi mungkin pada polynomial features
Melibatkan independent variable sebanyak mungkin pada linear regression
Melatih model dengan data yang memiliki fitur sangat banyak
menggunakan nilai k = 1 untuk K-Nearest Neighbours
Semua Jawaban Merupakan Penyebab Overfitting
Di antara beberapa contoh categorical variable di bawah ini, yang paling mungkin di-encode menggunakan teknik ordinal encoding yaitu
Nama Orang
Merk Mobil
Status Pernikahan
Golongan Darah
Jenjang Pendidikan
Nilai yang seharusnya muncul pada bagian “???” keluaran kode tersebut adalah
4
5
10
0
3
Apabila terdapat kasus missing values pada sejumlah kolom sebuah dataset, strategi yang mungkin untuk dilakukan yaitu sebagai berikut, kecuali
mengisi missing value dengan median kolom tersebut (untuk kolom numerik)
mengisi missing value dengan mode kolom tersebut (untuk kolom kategorikal)
mengisi missing value dengan mean kolom tersebut (untuk kolom kategorikal)
menghapus baris-baris dengan missing value
Semua Jawaban Benar
Pada model-based feature selection, pemilihan feature dapat dilakukan diantaranya dengan
Mencoba melatih beberapa model dengan jumlah feature yang berbeda-beda
Melihat koefisien dan hasil significant test dari independent variables pada sebuah linear model, atau melihat feature importance pada model seperti decision tree dan random forest
Melatih model dengan sedikit feature, lalu menambahkan feature satu per satu sambil menghitung sebuah metric
Melatih model dengan seluruh feature, lalu menghilangkan feature satu per satu sambil menghitung sebuah metric
Melakukan pemilihan feature berdasarkan EDA
Apabila “YES” diasumsikan sebagai positive class, maka hasil perhitungan akurasi dari matriks di atas adalah
0.333
0.6
0.533
0.89
0.975
Anda diminta untuk mengimplementasikan sebuah sistem pendeteksi uang palsu. Organisasi Anda menilai bahwa risiko salah memprediksi selembar uang palsu sebagai uang asli lebih besar dibanding risiko salah memprediksi selembar uang asli sebagai uang palsu (asumsikan bahwa “asli” akan menjadi positive label).
Metric yang perlu coba diminimalkan oleh model Anda yaitu
Precision
F1 score
Type II error
False negative rate
Semua Salah
Jumlah kombinasi nilai hyperparameter yang akan dicoba adalah
15
30
25
30
Semua Salah
Untuk memperoleh pengukuran evaluasi model berupa persentase selisih antara hasil prediksi dengan data observasi yang sesungguhnya, metric yang dapat digunakan yaitu
Goodness of Fit
MAPE
MAE
MSE
R2
Di bawah ini yang merupakan strategi yang kurang tepat dalam mengatasi kasus imbalance class adalah
melakukan random sampling pada saat train & test set splitting
mengatur bobot kelas pada model
melakukan feature engineering
melakukan undersampling
Semua Benar
Salah satu strategi dalam ensemble learning di mana terdapat lebih dari satu base learner dengan cara kerja yang serupa dan masing-masing learner dilatih menggunakan hasil sampling dengan pengembalian dari sebuah training set yang utuh di mana setiap anggota sampel dapat terpilih lebih dari satu kali disebut dengan
voting
bagging
stacking
boosting
tuning
Apabila decision tree digunakan sebagai base learner method untuk bagging, strategi yang perlu dihindari untuk memperoleh hasil prediksi yang optimal adalah
menjalankan tiap base learner secara paralel
menyamakan seluruh hyperparameter untuk setiap base learner agar masing-masing menghasilkan tree yang semirip mungkin
mengagregat hasil prediksi masing-masing base learner dengan melakukan majority vote
melatih sebuah decision tree terlebih dahulu sebagai pembanding dan untuk mengetahui adanya potensi perbaikan
melakukan hyperparameter tuning untuk menentukan jumlah base learner yang optimal
Di bawah ini yang merupakan pernyataan yang kurang tepat mengenai principal component analysis (PCA) yaitu
Terdapat hyperparameter berupa number of components yang mengatur jumlah dimensi yang dihasilkan di akhir penerapan PCA
Hasil penerapan PCA terhadap sebuah dataset dapat digunakan untuk melakukan eksplorasi lebih lanjut semisal melakukan clustering
PCA mengurangi jumlah dimensi data dengan menghapus feature yang kurang relevan terhadap label
PCA termasuk ke unsupervised learning
PCA dapat digunakan untuk memudahkan visualisasi data dalam 2D plot atau 3D plot
Dampak dari pengaturan hyperparameter epsilon atau min_samples pada DBSCAN yang benar yaitu
Memperkecil nilai min_samples akan menyebabkan semakin banyak noise yang diperoleh dari hasil DBSCAN
Memperbesar nilai min_samples akan menyebabkan semakin banyak core sample yang terbentuk
Memperbesar nilai min_samples akan menyebabkan semakin sulit bagi setiap data point untuk menjadi sebuah core sample
Mengurangi nilai epsilon akan menyebabkan cluster yang terbentuk cenderung berukuran besar
Mengurangi nilai epsilon akan menyebabkan semakin banyak data point yang masuk ke dalam sebuah cluster
Teknik elbow method pada K-Means Clustering dapat digunakan untuk mengetahui
Tidak ada jawaban yang benar
jumlah iterasi optimal yang perlu dikerjakan
letak tiap centroid optimal pada iterasi awal
jumlah cluster optimal yang dapat dibuat
jumlah kolom optimal yang digunakan untuk mengelompokkan dataset
Apabila sebuah ARIMA model menggunakan dua level differencing dan satu observasi lag sebagai predictor, maka parameter yang digunakan adalah
ARIMA(0,2,0)
ARIMA(1,0,0)
ARIMA(0,2,1)
ARIMA(1,0,2)
Tidak Ada Jawaban Yang Benar
Kata yang memiliki bobot tf-idf terbesar pada dokumen ketiga adalah
principal
system
money
business
school
Apabila tokenization dilakukan menggunakan tri-gram (n=3 dan n_min = 3) pada teks berikut, maka hasil yang diperoleh adalah
"Zilong Hero Sampah Di Mobile Legend"
Zilong, Hero, Sampah, Di, Mobile, Legend
Zilong, Hero, Sampah, Di, Mobile, Legend, Zilong Hero, Hero Sampah, Sampah Di, Di Mobile, Mobile Legend
Zilong, Hero, Sampah, Di, Mobile, Legend, Zilong Hero, Hero Sampah, Sampah Di, Di Mobile, Mobile Legend, Zilong Hero Sampah, Sampah Di Mobile, Di Mobile Legend
Zilong Hero Sampah, Hero Sampah Di, Sampah Di Mobile, Di Mobile Legend
Semua Jawaban Benar
Pada item-based collaborative filtering, pemberian rekomendasi dilakukan dengan
Tidak ada jawaban yang benar
Mencari produk P yang memiliki jumlah user U terbanyak, sehingga P akan direkomendasi ke semua user U’ yang belum menggunakannya
Mencari produk P yang memiliki jumlah produk P’ yang mirip dengannya paling banyak, sehingga P akan direkomendasikan ke semua user U’ yang belum menggunakannya
mencari produk P yang belum pernah digunakan oleh user U, namun telah digunakan oleh user U’ yang mirip dengan U, sehingga P akan direkomendasikan kepada U
Memberi rekomendasi produk P kepada User U yang menggunakan produk P', di mana produk P’ memiliki user U’ yang juga merupakan pengguna produk P
Di bawah ini, yang merupakan kelemahan dalam penerapan model-based recommender system adalah
Data yang dibutuhkan cenderung lebih sedikit
Similarity measure antar item menjadi bias
Sulit untuk merekomendasikan item yang belum pernah memperoleh rating
Sulit untuk mengeksplor interest baru dari seorang user
Semua Jawaban Salah
Data maturity level di mana sebuah organisasi yang menolak adanya data untuk mengambil keputusan, dan biasanya perusahaan-perusahaan yang berada di tahap ini adalah perusahaan korporasi yang old-minded, banyak birokrasi, sehingga sulit untuk memahami kebutuhan dari data itu sendiri. disebut dengan
Data-driven
Data savvy
Data-guided
Data aware
Semua Jawaban Salah
Di bawah ini, yang bukan merupakan contoh bentuk deliverable pada interpretable machine learning model adalah
Core samples pada DBSCAN
Dendogram pada Hierarchical Clustering
Koefisien Independent Variables pada Linear Regression
Decision tree plot
Semua Salah
Di bawah ini, yang merupakan business question yang bersifat inference yaitu
“Berapa peluang transaksi dengan nomor ID 1234 akan dibatalkan oleh pelanggan?”
“Apakah kita dapat mendeteksi secara dini pelanggan yang akan melakukan fraud sebelum pembayaran?”
“Bagaimana karakteristik dari seorang loyal customer?”
“Pelanggan mana saja yang baru mulai bertransaksi hari ini dan paling mungkin akan menjadi loyal customer?”
“Pelanggan mana saja yang bertransaksi hari ini dan terindikasi melakukan fraud?”
Berikut adalah evaluation metrics yang biasa digunakan untuk kasus klasifikasi, kecuali
Recall
ROC AUC
F1 Score
Accuracy
Semua Digunakan Untuk Klasifikasi
