WorksheetsModule 3 - Mock Test
Total questions: 35
Worksheet time: 53mins
Di bawah ini yang bukan merupakan model atau algoritma yang umum digunakan dalam supervised learning adalah ?
Linear Regression
Logistic Regression
KMeans
Decision Tree
Misalkan Anda diminta untuk mengimplementasikan fraud detection system pada sebuah transaksi keuangan. Diberikan beberapa pernyataan berikut ini.
1, Sistem Anda akan menghasilkan nilai yaitu besarnya peluang sebuah transaksi untuk dikenali sebagai Fraud (penipuan).
2. Jumlah uang dalam transaksi dapat menjadi salah satu feature untuk melakukan prediksi.
3. Anda harus mengimplementasikan sistem ini dengan pendekatan machine learning.
4. Anda harus memiliki jumlah transaksi fraud dan non-fraud yang sama untuk melatih machine learning model Anda.
Manakah penyataan yang kurang tepat
1, 2, 4
1, 4
2, 3
3, 4
Perhatikan persamaan model multiple linear regression di bawah ini.
Pernyataan yang tepat adalah…
Komponen dalam kotak kuning adalah slope
Komponen dalam kotak merah adalah intercept
Komponen dalam kotak biru adalah independent variable
Komponen dalam kotak hijau adalah response variable
Metode Least Squares pada kasus regresi dapat digunakan untuk mengestimasi nilai parameter model sehingga nilai sum of squared error-nya dapat sekecil mungkin, yang ditandai dengan …
Jumlah dari nilai hasil prediksi dan data observasinya sekecil mungkin
Jumlah selisih dari nilai hasil prediksi dengan data observasinya sekecil mungkin
Jumlah dari nilai hasil prediksi dan data observasinya mendekati 1
Tidak ada jawaban yang benar
Fungsi calculate_metric pada kode di bawah ini akan menghitung sebuah evaluation metric yaitu
MSE
RMSE
MAPE
R2
Dalam kasus sistem pendeteksi kanker, di mana orang yang menderita kanker diasumsikan sebagai positive class, false positive rate menandakan …
Persentase jumlah pasien tidak kanker yang dideteksi sebagai pasien kanker
Persentase jumlah pasien kanker yang dideteksi sebagai pasien tidak kanker
Jumlah pasien tidak kanker yang dideteksi sebagai pasien kanker
Persentase jumlah pasien tidak kanker yang dideteksi sebagai pasien tidak kanker juga.
Pada decision tree classification, splitting akan berhenti dilakukan jika terpenuhi kondisi-kondisi berikut ini:
1. Kedalaman tree sudah mencapai ketentuan
2. Jumlah elemen pada node sebelum melakukan splitting kurang dari ketentuan
3. Jumlah elemen pada node setelah melakukan splitting kurang dari ketentuan
4. Jumlah elemen pada node setelah melakukan splitting lebih dari ketentuan
5. Seluruh elemen pada node masuk ke dalam satu kelas saja
Pernyataan yang tepat ada pada nomor …
1, 2, 3
1, 2, 4
1, 2, 4, 5
1, 2, 3, 5
Di bawah ini yang merupakan pernyataan yang pasti benar mengenai decision tree yaitu ….
Decision tree dapat digunakan untuk melakukan prediksi target yang bersifat continuous
Nilai parameter min_samples_split yang besar akan menghasilkan tree yang dalam/besar
Pada bagian bawah tree, nilai gini impurity cenderung lebih tinggi
Nilai parameter max_depth yang kecil akan menghasilkan jumlah node yang sedikit
Bagian yang paling mungkin menyebabkan masalah evaluasi model pada potongan kode di bawah ini terdapat pada
Pada baris ke-7, untuk membaca dataset seharusnya np.read_csv
Pada baris ke-15, proses splitting train set dan test set seharusnya sebelum model training
Pada baris ke-15, train_test_split seharusnya menggunakan parameter stratify=y
Pada baris ke-17, untuk prediksi seharusnya tree.predict(y_test)
Perhatikan tabel hasil training dan evaluation dari 3 kandidat model berikut ini.
Model no.3 mengalami overfitting
Model no.1 adalah model terbaik karena modelnya paling general/stabil
Model no.2 mengalami underfitting
Model no.1 kemungkinan dapat ditingkatkan performanya dengan menambah jumlah feature
Di bawah ini yang bukan merupakan strategi untuk dapat menghindari underfitting yaitu …
Beralih ke model non linear apabila data tidak menunjukkan pola linear
Menerapkan regularization dengan nilai parameter penalty yang tinggi
Menambahkan polynomial features pada model
Menambah kompleksitas model
Kondisi di bawah ini merupakan beberapa penyebab dari overfitting, kecuali
Menggunakan nilai k = 1 (jumlah neighbor) untuk K-Nearest Neighbours
Menggunakan order pangkat yang tinggi pada polynomial features
Melatih model dengan data yang memiliki fitur sangat banyak
Membuat decision tree dengan entropy sebagai splitting criterion
Di antara beberapa contoh categorical variable di bawah ini, yang paling mungkin di-encode menggunakan teknik ordinal encoding yaitu
Jenjang karir/Pangkat
Jenis kelamin
Nama negara
Nama kota
Perhatikan potongan kode di bawah ini
Output:
No of unique value: 9
No. of new columns: ???
Berapa jumlah kolom yang dihasilkan dari proses One Hot Encoding di atas?
8
9
18
12
Apabila terdapat kasus missing values pada sejumlah kolom sebuah dataset, strategi yang mungkin untuk dilakukan yaitu sebagai berikut, kecuali
mengisi missing value pada suatu kolom numerikal dengan suatu nilai berdasarkan hasil regresi dari nilai pada kolom lainnya
mengisi missing value dengan mode jika kolomnya kategorikal
mengisi missing value dengan mean jika kolomnya numerikal
mengisi missing value dengan mean jika kolomnya kategorikal
Pada model-based feature selection, pemilihan feature dapat dilakukan diantaranya dengan, kecuali
Melatih model dengan seluruh feature, lalu menghilangkan feature satu per satu sambil menghitung sebuah metric
Memilih feature berdasarkan domain knowledge
Melatih model dengan sedikit feature, lalu menambahkan feature satu per satu sambil menghitung sebuah metric
Memilih feature dengan menggunakan insting
Diberikan sebuah confusion matrix dari model klasifikasi seperti di bawah ini
Apabila ‘YES’ diasumsikan sebagai positive class, berapa nilai precision?
0.980
0.806
0.89
0.961
Anda seorang Data Scientist di sebuah perusahaan FinTech dan diminta untuk mengimplementasikan sebuah sistem pendeteksi nasabah gagal bayar (default). Perusahaan Anda menilai bahwa kerugian ketika salah memprediksi nasabah yang mampu melunasi pembayaran sebagai nasabah gagal bayar (default) lebih besar dibanding kerugian ketika salah memprediksi nasabah gagal bayar sebagai nasabah yang mampu melunasi pembayaran.
Metric yang perlu coba diminimalkan nilainya oleh model Anda adalah…
F1 score
False Positive Rate
False Negative Rate
Accuracy
Berdasarkan kode di bawah ini, jumlah kombinasi nilai hyperparameter yang akan dihasilkan adalah
9
24
20
512
Untuk memperoleh pengukuran evaluasi model berupa rata-rata dari total selisih antara hasil prediksi dengan data observasi yang sesungguhnya yang dikuadratkan, metric yang dapat digunakan yaitu
MSE
MAE
RMSE
MAPE
Di bawah ini yang merupakan strategi yang kurang tepat dalam mengatasi kasus imbalance class adalah
Mengumpulkan lebih banyak data pada minority class
Melakukan undersampling
Melakukan oversampling
Menambah data pada majority class
Salah satu strategi dalam ensemble learning di mana terdapat lebih dari satu base learner dengan cara kerja sequential/berurutan di mana hasil modeling dari suatu base learner pada sample dari dataset akan mempengaruhi pemilihan sampel dan modeling pada base learner selanjutnya, disebut dengan
Voting
Stacking
Boosting
Tuning
Pada model bagging yang menggunakan decision tree sebagai base learner, manakah cara kerja model bagging berikut yang kurang tepat dalam mengoptimalkan prediksi yang dihasilkan?
Menjalankan semua base learner secara paralel
Melakukan hyperparameter tuning untuk menentukan jumlah base learner yang paling optimal terhadap data
Menjalankan base learner secara sequential
Dilakukan bootstrap-sampling untuk memiliki karakteristik data yang berbeda pada tiap base learner
Di bawah ini yang merupakan pernyataan yang kurang tepat mengenai principal component analysis (PCA) yaitu
PCA mengurangi jumlah dimensi data dengan menghapus feature yang korelasinya paling kecil terhadap target
Feature hasil penerapan PCA dapat digunakan untuk clustering
Kekurangan dari penerapan PCA adalah adanya risiko kehilangan informasi dari data yang digunakan
PCA dapat mempermudah untuk tujuan visualisasi pada 2D atau 3D plot
Pada metode clustering DBSCAN, Anda bisa mengatur hyperparameter epsilon dan min_samples. Pernyataan yang benar mengenai hal tersebut adalah ….
Memperbesar nilai epsilon akan menyebabkan cluster yang terbentuk cenderung berukuran kecil-kecil
Memperbesar nilai epsilon akan menyebabkan semakin sedikit data point yang masuk sebagai cluster
Memperbesar nilai min_samples akan menyebabkan semakin banyak data yang dianggap sebagai noise
Memperbesar nilai min_samples akan mempermudah bagi setiap data untuk menjadi core sample
Teknik elbow method pada K-Means Clustering dapat digunakan untuk mengetahui
Jumlah cluster optimal
Letak centroid terbaik
Jumlah iterasi optimal
Jumlah kolom optimal
Apabila sebuah ARIMA model menggunakan satu level differencing dan dua observasi lag sebagai predictor, maka parameter yang digunakan adalah
ARIMA(1,2,0)
ARIMA(2,1,0)
ARIMA(2,1,2)
ARIMA(0,1,2)
Diberikan sebuah teks yang sudah di-preprocess seperti berikut ini.
“saya akan membeli pizza”
Apabila tokenization dilakukan menggunakan (n=2 dan n_min = 2), maka hasil yang diperoleh adalah
saya, akan, membeli, pizza, saya akan, akan membeli, membeli pizza
saya akan, akan membeli, membeli pizza
saya, akan, membeli, pizza, saya akan, membeli pizza
saya akan, membeli pizza
Pada item-based collaborative filtering, pemberian rekomendasi dilakukan dengan …
Mencari produk P yang memiliki jumlah user terbanyak, sehingga P akan direkomendasi ke semua user U’ yang belum menggunakannya
Tidak ada jawaban yang benar
Mencari produk P yang belum pernah digunakan oleh user U, namun telah digunakan oleh user U’ yang mirip dengan U, sehingga P akan direkomendasikan kepada U
Memberi rekomendasi produk P kepada User U yang menggunakan produk P', di mana produk P’ memiliki user U’ yang juga merupakan pengguna produk P
Di bawah ini, yang merupakan kelemahan dalam penerapan model-based recommender system adalah
Memiliki keterbatasan dalam mengembangkan minat pengguna
Akan kesulitan ketika hendak merekomendasikan item-item baru yang belum ada ratingnya
Item dengan rating paling banyak akan kesulitan direkomendasikan
Metode ini memerlukan domain knowledge yang spesifik
Data maturity level di mana perusahaan memiliki data (menyimpan), kemudian melakukan analisis untuk root cause analysis, mereka juga dapat menggunakan data untuk menjadikannya aset strategi, seperti melakukan prediksi-prediksi kejadian yang ditunjukan berdasarkan pola saat ini. Hampir seluruh divisi perusahaan sudah mulai melakukan analisis data untuk mengambil keputusan, namun belum berani mengotomasi produk mereka menggunakan data.
Perusahaan tersebut termasuk dalam level …
Data resistant
Data driven
Data guided
Data savvy
Di bawah ini, yang bukan merupakan contoh bentuk deliverable pada interpretable machine learning model adalah …
Decision Tree plot
Koefisien dari feature-feature di Linear Regression
Dendogram pada Hierarchical Clustering
Core samples pada DBSCAN
Di bawah ini, yang merupakan business question yang bersifat inference yaitu
Apakah kita dapat mendeteksi siapa saja customer yang akan melakukan churn?
Kota mana yang menghasilkan pendapatan paling besar?
Apakah kita dapat mengelompokkan customer berdasarkan segmentasinya?
Pelanggan mana saja yang baru mulai bertransaksi hari ini dan paling mungkin akan menjadi loyal customer?
Berikut adalah evaluation metrics yang biasa digunakan untuk kasus klasifikasi, kecuali…
Recall
F1 score
Precision
R-square
Kata yang memiliki bobot tf-idf terbesar pada dokumen ketiga adalah
sedang
rumah
meminum
dan
