wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Module 3 Exam Simulation

Total questions: 45

Worksheet time: 2hrs 8mins

Name
Class
Date
1.

Diantara berikut yang bukan merupakan metode/model dari Machine Learning adalah

a)

Decision Tree

b)

Polynomial Regression

c)

Linear Regression

d)

Neural Network

e)

Semua Jawaban Benar

2.

Mana diantara model/metode berikut yang bukan merupakan Supervised Learning?

a)

KNN

b)

K-Means

c)

Logistic Regression

d)

Linear Regression

e)

Decision Tree

3.

Mana diantara model/metode berikut yang bukan merupakan Regression

a)

Multiple Linear Regression

b)

Decision Tree

c)

Logistic Regression

d)

KNN

e)

Polynomial Regression

4.

Melihat dari dataset tersebut, jika kita ingin memprediksi besaran tip berdasarkan total_bill dan time, maka metode yang kurang tepat digunakan adalah

a)

KNN

b)

Simple Linear Regression

c)

Decision Tree

d)

Polynomial Regression

e)

Multiple Linear Regression

5.

1. Memprediksi nominal gaji seorang calon pegawai tidak dapat dilakukan tanpa bantuan machine learning

2. Feature yang dipilih sebisa mungkin merupakan fenomena yang berhubungan dengan label yang hendak diprediksi

3. Pemilihan machine learning algorithm jauh lebih penting dari pemilihan & persiapan data yang diberikan ke model machine learning untuk membuat model machine learning yang baik

4. Machine learning dapat mengurangi keterlibatan manusia dalam proses penyusunan decision rule untuk membuat sebuah keputusan

Diantara keempat pernyataan tersebut, pernyataan yang KURANG tepat yaitu

a)

2 dan 4

b)

1 dan 3

c)

2 dan 3

d)

3 dan 4

e)

1 dan 4

6.

Apabila Anda diminta untuk mencari tahu apakah seorang pegawai di sebuah perusahaan akan resign dalam waktu dekat, maka pernyataan yang pasti salah adalah

a)

Sistem yang Anda buat tidak dapat digunakan untuk memprediksi pegawai di perusahaan lain

b)

Anda dapat menggunakan data asli yang dimiliki departemen HRD sebagai training set

c)

Tingkat kepuasan dan masa kerja pegawai dapat dijadikan feature untuk melakukan prediksi

d)

Anda dapat menerapkan unsupervised learning untuk menyelesaikan masalah ini

e)

Anda dapat memberikan prediksi peluang seseorang akan resign

7.

Di bawah ini, yang merupakan komponen yang tidak diperlukan untuk menghitung R-squared coefficient of determination adalah

a)

Tidak ada jawaban yang benar

b)

Mean squared error

c)

Sum of squared regression

d)

Sum of squared total

e)

Sum of squared error

8.

Peran sigmoid function pada logistic regression adalah

a)

mengestimasi nilai intercept

b)

mengukur kesalahan prediksi pada kasus classification

c)

mengestimasi koefisien slope untuk masing-masing independent variable

d)

memberikan penalti kepada beberapa independent variable

e)

mengubah hasil prediksi model linier ke dalam nilai berskala 0 hingga 1

9.

Di bawah ini yang merupakan pernyataan yang tepat mengenai pengaturan parameter k pada K-Nearest Neighbours untuk kasus classification adalah

a)

nilai k terbaik adalah nilai k yang mampu menghasilkan RMSE terkecil

b)

memperbesar nilai k cenderung membuat algoritma bekerja dengan lebih cepat

c)

apabila nilai k sama dengan jumlah data point pada training set, semua data akan diklasifikasikan ke dalam satu kelas yang sama

d)

nilai k yang kecil cenderung membuat model overfitting

e)

mengubah nilai k tidak akan mempengaruhi jumlah iterasi yang dilakukan oleh algoritma

10.

Apabila entropy digunakan sebagai splitting criterion sebuah decision tree, maka pernyataan yang kurang tepat adalah

a)

node dengan entropy terkecil cenderung dipilih ketika melakukan splitting

b)

entropy mencapai nilai maksimum apabila setiap kelas yang ada di suatu node memiliki jumlah elemen yang sama

c)

entropy memiliki nilai dalam rentang 0 dan 1

d)

untuk menghitung nilai entropy, perlu mengetahui peluang sebuah elemen di suatu node dikelompokkan ke dalam sebuah kelas

e)

sebuah node yang seluruh elemennya dikelompokkan ke dalam satu kelas yang sama memiliki entropy bernilai 0 atau 1

11.

Strategi yang paling tepat untuk memperkirakan apakah suatu model di production environment nanti dapat bekerja dengan baik yaitu dengan

a)

melatih model pada validation set, menguji model pada training set

b)

melatih model pada validation set, menguji model pada test set

c)

melatih dan menguji model pada validation set

d)

melatih model pada training set, menguji model pada test set & validation set

e)

melatih dan menguji model pada training set

12.

Peran nilai lambda pada lasso regression adalah

a)

tidak ada jawaban yang benar

b)

menjadi koefisien pengali untuk setiap independent variable

c)

menentukan derajat penalti yang diberikan kepada independent variable

d)

menentukan jumlah independent variable yang diberikan penalti

e)

memodifikasi orde pangkat pada independent variable

13.

Di antara beberapa contoh variabel di bawah ini, one-hot encoding paling perlu dihindari pada

a)

pernah melakukan tindakan kriminal atau tidak

b)

jenis pekerjaan

c)

status pernikahan

d)

jenjang pendidikan terakhir

e)

nomor kartu keluarga

14.

Di bawah ini, yang merupakan kelemahan dari model-based feature selection adalah

a)

Tidak ada jawaban yang benar

b)

Tidak dapat mengikutsertakan categorical features

c)

Importance suatu feature tidak bergantung pada feature lain

d)

Butuh waktu untuk melatih sebuah model terlebih dahulu

e)

Tidak dapat menangkap interaksi antar independent variables

15.

Perhatikan potongan kode berikut ini. Fungsi pada kode di atas akan menghitung sebuah evaluation metric yaitu

a)

Mean absolute percentage error

b)

Mean absolute error

c)

Mean squared error

d)

Root mean squared error

e)

R-squared

16.

Diberikan persamaan model linear regression untuk memprediksi harga mobil bekas (dalam Rupiah) seperti di bawah ini. Kesimpulan yang tepat berdasarkan persamaan di atas adalah

a)

Model di atas tidak dapat digunakan untuk memprediksi mobil bekas dengan odometer (penunjuk jarak tempuh) bersatuan mil

b)

Mobil produksi tahun 2008 dengan jarak tempuh 100.000 kilometer akan diprediksi lebih mahal dibanding mobil produksi tahun 2012 dengan jarak tempuh 150.000 kilometer

c)

Sebuah mobil bekas yang diproduksi tahun 2000 dengan jarak tempuh 150.000 kilometer akan diprediksi memiliki harga Rp255.300.000,00

d)

Kapasitas penumpang mempengaruhi harga jual sebuah mobil bekas

e)

Semakin jauh jarak tempuh sebuah mobil, maka harga jual bekasnya akan semakin mahal

17.

Berikut adalah evaluation metrics yang biasa digunakan untuk kasus regresi, kecuali

a)

Semua adalah metrics untuk regresi

b)

R2 Score

c)

F1 Score

d)

RMSE

e)

MAE

18.

Perhatikan tabel hasil training dan evaluation beberapa kandidat model berikut ini. Pernyataan yang tepat mengenai tabel di atas adalah

a)

performa model pertama pasti meningkat dengan menambah jumlah feature

b)

jumlah feature tidak memiliki dampak apapun terhadap F1 score

c)

model ketiga lebih mungkin diambil sebagai kandidat model terbaik dibanding model pertama atau kedua

d)

performa model kedua pasti meningkat dengan mengurangi jumlah feature

e)

model kedua mengalami overfitting

19.

Perhatikan ilustrasi berikut ini. Pernyataan yang kurang tepat mengenai ilustrasi tersebut adalah

a)

RMSE pada validation set yang tinggi ketika ukuran training set kecil dikarenakan pola yang belum pernah ditemui oleh model ketika training

b)

Performa RMSE model pada validation set dapat mencapai puncaknya saat ukuran training set diperbesar hingga 80

c)

Ketika data pada training set masih sedikit, model cenderung mempelajari pola yang sedikit

d)

Menambah jumlah training set hingga sebanyak mungkin belum tentu meningkatkan performa model lebih jauh

e)

Semakin banyak jumlah training set, model cenderung terhindar dari overfitting

20.

Perhatikan potongan kode berikut ini. Apabila X_train[ctg_cols] tidak memiliki missing values, X_train_ctg_encoded akan memiliki kolom sebanyak

a)

5 buah

b)

2 buah

c)

4 buah

d)

12 buah

e)

6 buah

21.

Diberikan confusion matrix sebuah model classification seperti di bawah ini. Apabila “YES” diasumsikan sebagai positive class, maka hasil perhitungan accuracy dari matriks di atas adalah

a)

0.333

b)

0.6

c)

0.845

d)

0.889

e)

0.975

22.

Andaikan error/residual untuk prediksi 5 data dalam kasus regresi seperti ini => [5, -2, 4, 1, -3]. Berapakah nilai MAE, MSE, dan RMSEnya?

a)

MAE = 3, MSE = 11, RMSE = 3.32

b)

MAE = 3, MSE = 12, RMSE = 3.42

c)

MAE = 2, MSE = 12, RMSE = 4.32

d)

MAE = 2, MSE = 11, RMSE = 3.42

e)

MAE = 4, MSE = 12, RMSE = 4.32

23.

Peran nilai alpha pada lasso regression adalah

a)

tidak ada jawaban yang benar

b)

menjadi koefisien pengali untuk setiap independent variable

c)

menentukan derajat penalti yang diberikan kepada independent variable

d)

menentukan jumlah independent variable yang diberikan penalti

e)

memodifikasi orde pangkat pada independent variable

24.

Perhatikan potongan kode berikut ini. Isi dari variabel X_poly adalah

a)

array([[ 0., 6., 10., 30.]])

b)

array([[ 1., 0., 3., 5., 0.., 9., 15., 25.]])

c)

array([[ 1., 0., 3., 5., 0., 9., 25.]])

d)

array([[ 1., 0., 3., 5., 0., 0., 0., 9., 15., 25.]])

e)

array([[ 1., 0., 9., 25.]])

25.

Anda diminta untuk mengimplementasikan sebuah sistem pendeteksi kerapuhan tulang pada lansia. Apabila seseorang yang memiliki kerapuhan tulang diprediksi oleh sistem Anda tidak memiliki kerapuhan tulang, risiko yang mungkin terjadi dinilai lebih besar dibanding kasus yang sebaliknya. Asumsikan bahwa “kerapuhan tulang” merupakan positive class pada kasus ini.

Metric yang perlu coba diminimalkan oleh model Anda yaitu

a)

Precision

b)

F1 score

c)

Accuracy

d)

False negative rate

e)

False positive rate

26.

Manakah Algorithm yang termasuk kedalam Unsupervised Learning Algorithm?

a)

Gradient Boosting

b)

Decision Tree

c)

Linear Regression

d)

KNN

e)

K-Means

27.

Di bawah ini, yang bukan merupakan salah 1 cara menangani kasus imbalanced data/class adalah

a)

Semua merupakan cara penanganan kasus imbalanced data

b)

Melakukan Undersampling

c)

Menggunakan Metric Accuracy untuk Evaluasi

d)

Menggunakan SMOTE

e)

Menggunakan Random Over Sampler

28.

Salah satu strategi dalam ensemble learning di mana terdapat beberapa base learner yang bekerja secara berurutan dengan memperbaiki hasil prediksi base learner yang sebelumnya disebut dengan

a)

voting

b)

bagging

c)

random forest

d)

stacking

e)

boosting

29.

Apabila Anda memiliki sepuluh buah model logistic regression yang dilatih menggunakan dataset yang sama persis dan di-tune dengan hyperparameters yang sama persis, melakukan ensemble method terhadap kesepuluh model tersebut kemungkinan tidak akan optimal karena

a)

Tidak ada jawaban yang benar

b)

hyperparameter tuning tidak dapat dilakukan terhadap base learner

c)

logistic regression tidak cocok untuk dijadikan base learner

d)

hasil training atau prediksi kesepuluh model tidak berbeda jauh

e)

sepuluh buah base learner belum cukup untuk menerapkan ensemble method

30.

Di bawah ini yang merupakan pernyataan yang tepat mengenai principal component analysis (PCA) yaitu

a)

DIperlukan dataset berlabel ketika hendak menerapkan PCA

b)

Melatih model dengan dataset hasil penerapan PCA tidak dapat mengurangi durasi training

c)

Terdapat risiko kehilangan informasi ketika menerapkan PCA pada sebuah dataset

d)

PCA mengurangi jumlah dimensi data dengan menghapus feature yang kurang penting untuk melakukan prediksi regression maupun classification

e)

interpretasi hasil visualisasi PCA hanya dapat berguna jika jumlah dimensi yang dihasilkan berjumlah satu

31.

Menghitung silhouette score pada K-Means Clustering dapat digunakan untuk mengetahui

a)

opening anime naruto

b)

jumlah iterasi optimal yang perlu dikerjakan

c)

letak tiap centroid optimal pada iterasi awal

d)

jumlah cluster optimal yang dapat dibuat

e)

jumlah kolom optimal yang digunakan untuk mengelompokkan dataset

32.

Di bawah ini merupakan beberapa pertanyaan yang diajukan oleh seorang Payment Service Product Manager kepada seorang Data Analyst. Pertanyaan-pertanyaan yang mengarah pada future possibilities yaitu

a)

2 dan 4

b)

1, 2, dan 4

c)

3 dan 4

d)

2 dan 3

e)

1 dan 2

33.

Andaikan kita diminta untuk dapat memprediksi mana customer kita yang akan churn dan tidak, berarti model yang dapat kita buat untuk membantu menyelesaikan masalah tersebut adalah model

a)

Semua jawaban salah

b)

Selection

c)

Dimensionality Reduction

d)

Regression

e)

Classification

34.

Data maturity level di mana salah satu cirinya yaitu bahwa suatu organisasi telah memandang data sebagai strategic asset dan tidak hanya sebagai tactical asset disebut dengan

a)

Data-driven

b)

Data savvy

c)

Data-guided

d)

Data aware

e)

Data resistant

35.

Di bawah ini, yang merupakan model yang kurang bersifat interpretable adalah

a)

Agglomerative Clustering

b)

Linear Regression model

c)

Decision Tree model

d)

K-Means Clustering

e)

XGBoost model

36.

Prediction script digunakan untuk

a)

Melakukan analisis dan training data

b)

Melakukan preproses dan training data

c)

Melakukan preproses dan prediksi data

d)

Melakukan training dan penyimpanan data

e)

Melakukan training dan saving model

37.

Diantara kelima kesalahan berikut, kesalahan yang tidak umum terjadi pada seorang Data Scientist adalah

a)

Gagal untuk menyesuaikan tools dengan problem yang dihadapi

b)

Keliru dalam menerapkan feature engineering pada data

c)

Tidak bertanggung jawab terhadap kompentensi atau kemampuan teknis

d)

Mengabaikan prasyarat yang ditetapkan oleh engineer

38.

Di bawah ini yang bukan merupakan strategi untuk dapat menghindari overfitting yaitu

a)

menambah jumlah data

b)

mengurangi jumlah fitur

c)

cross-validation

d)

meningkatkan jumlah hyperparameter space

e)

menerapkan regularization dengan nilai parameter penalty term yang lebih tinggi

39.

Jika model prediksi mengalami kondisi low variance dan high bias, maka fenomena yang dapat dijelaskan adalah

a)

Model mengalami underfiting

b)

Model mengalami overfitting

c)

Model bekerja dengan semestinya

d)

Model berhasil melakukan generalisasi/best fit

40.

Perhatikan potongan kode berikut ini. Jumlah kombinasi nilai hyperparameter yang akan dicoba adalah

a)

15 buah

b)

30 buah

c)

24 buah

d)

3 buah

e)

8 buah

41.

Salah satu strategi dalam ensemble learning di mana terdapat lebih dari satu base learner dengan cara kerja yang serupa dan masing-masing learner dilatih menggunakan hasil sampling dengan pengembalian dari sebuah training set yang utuh di mana setiap anggota sampel dapat terpilih lebih dari satu kali disebut dengan

a)

voting

b)

stacking

c)

pruning

d)

boosting

e)

bagging

42.

Apabila decision tree digunakan sebagai base learner method untuk bagging, strategi yang perlu dihindari untuk memperoleh hasil prediksi yang optimal adalah

a)

menjalankan tiap base learner secara paralel

b)

menyamakan seluruh hyperparameter untuk setiap base learner agar masing-masing menghasilkan tree yang semirip mungkin

c)

mengagregat hasil prediksi masing-masing base learner dengan melakukan majority vote

d)

melatih sebuah decision tree terlebih dahulu sebagai pembanding dan untuk mengetahui adanya potensi perbaikan

e)

melakukan hyperparameter tuning untuk menentukan jumlah base learner yang optimal

43.

Metrik evaluasi yang kurang tepat digunakan pada kasus dataset imbalanced adalah

a)

Balanced Accuracy

b)

Brier Score

c)

G-mean Score

d)

Accuracy

e)

F-beta Score

44.

Dalam evaluasi model regresi, kapan sebaiknya kita menggunakan MAE (Mean Absolute Error) sebagai metrik evaluasi?

a)

Ketika kita ingin mengukur error dalam bentuk persentase terhadap nilai aktual

b)

Ketika kita ingin memprioritaskan penalti besar untuk error yang lebih besar

c)

Ketika kita ingin mengetahui korelasi antara fitur input dan output

d)

Ketika kita ingin mengukur rata-rata kesalahan dalam satuan asli data tanpa terlalu menghukum error besar secara ekstrem

e)

Ketika kita ingin memastikan model tidak menghasilkan error sama sekali

45.

Apa perbedaan utama antara metode Bagging + Decision Tree dan Random Forest?

a)

Random Forest menggunakan decision tree tunggal, sedangkan Bagging menggunakan banyak pohon

b)

Random Forest memilih subset fitur secara acak di setiap pemisahan node, sedangkan Bagging tidak

c)

Bagging melakukan pemilihan fitur acak, sedangkan Random Forest menggunakan semua fitur

d)

Bagging tidak menggunakan teknik bootstrapping, sedangkan Random Forest menggunakannya

e)

Tidak ada perbedaan, keduanya identik dalam proses pembelajaran