wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Review Module ML

Total questions: 30

Worksheet time: 45mins

Name
Class
Date
1.

Di bawah ini yang bukan merupakan model atau algoritma yang umum digunakan dalam supervised learning adalah ...

a)

Linear Regression

b)

Logistic Regression

c)

KMeans

d)

Decision Tree

e)

Adaptive Boosting

2.

Misalkan Anda diminta untuk mengimplementasikan fraud detection system pada sebuah transakasi keuangan. Diberikan beberapa pernyataan berikut ini:

  1. 1. Sistem menghasilkan nilai peluang sebuah transaksi dikenali sebagai Fraud.

  2. 2. Jumlah uang dalam transaksi dapat menjadi salah satu feature.

  3. 3. Harus mengimplementasikan sistem ini dengan pendekatan machine learning.

  4. 4. Harus memiliki jumlah transaksi fraud dan non-fraud yang sama untuk melatih model.

Pernyataan yang kurang tepat adalah…

a)

1, 2, 4

b)

2, 4

c)

3, 4

d)

2, 3

e)

1, 4

3.

Perhatikan persamaan model multiple linear regression. Pernyataan yang tepat adalah…

a)

Komponen dalam kotak kuning adalah slope

b)

Komponen dalam kotak hijau adalah explanatory variable

c)

Komponen dalam kotak merah adalah intercept

d)

Komponen dalam kotak biru adalah independent variable

e)

Komponen dalam kotak hijau adalah response variable

4.

Pada kasus regresi, metode Least Squares (OLS) dapat digunakan untuk mengestimasi nilai parameter model dengan cara mencari ….

a)

Jumlah kuadrat dari nilai hasil prediksi dan data observasi yang sekecil mungkin

b)

Jumlah kuadrat dari nilai hasil prediksi dan data observasi yang sekecil mungkin

c)

Jumlah kuadrat dari nilai hasil prediksi dan data observasi yang mendekati 1

d)

Jumlah kuadrat selisih dari nilai hasil prediksi dengan data observasi yang mendekati 1

e)

Tidak ada jawaban yang benar

5.

Fungsi calculate_metric pada kode di bawah ini akan menghitung sebuah evaluation metric yaitu ...

a)

MSE

b)

MAE

c)

MAPE

d)

RMSE

e)

R square

6.

Dalam kasus klasifikasi sistem pendeteksi kanker, di mana orang yang menderita kanker diasumsikan sebagai positive class, false positive rate menandakan …

a)

Persentase jumlah pasien tidak kanker yang dideteksi sebagai pasien kanker

b)

Persentase jumlah pasien kanker yang dideteksi sebagai pasien tidak kanker

c)

Jumlah pasien tidak kanker yang dideteksi sebagai pasien kanker

d)

Jumlah pasien kanker yang dideteksi sebagai pasien tidak kanker

e)

Persentase jumlah pasien tidak kanker yang dideteksi sebagai pasien tidak kanker

7.

Pada decision tree classification, splitting akan berhenti dilakukan jika terpenuhi kondisi-kondisi berikut ini:

1) Kedalaman tree sudah mencapai ketentuan

2) Jumlah elemen pada node sebelum melakukan splitting kurang dari ketentuan

3) Jumlah elemen pada node setelah melakukan splitting kurang dari ketentuan

4) Jumlah elemen pada node setelah melakukan splitting lebih dari ketentuan

5) Seluruh elemen pada leaf masuk ke dalam satu kelas saja

Pernyataan yang tepat ada pada nomor …

a)

1, 2, 3

b)

1, 2, 4

c)

1, 2, 3, 5

d)

1, 2, 4, 5

e)

2, 4, 5

8.

Bagian yang paling mungkin menyebabkan masalah evaluasi model pada potongan kode di bawah ini terdapat pada

a)

Pada baris ke-7, untuk membaca dataset seharusnya np.read_csv()

b)

Pada baris ke-15, proses splitting train set dan test set seharusnya sebelum model training

c)

Pada baris ke-15, train_test_split seharusnya menggunakan parameter stratify=y

d)

Pada baris ke-17, untuk prediksi seharusnya tree.predict(y_test)

e)

Pada baris ke-18, RMSE kurang tepat digunakan untuk evaluasi kasus regresi

9.

Pernyataan yang tepat mengenai tabel di atas adalah …

a)

Model no.3 mengalami overfitting

b)

Model no.1 adalah model terbaik karena modelnya paling general/stabil

c)

Model no.2 mengalami underfitting

d)

Model no.1 kemungkinan dapat ditingkatkan performanya dengan menambah jumlah feature

e)

Model no.2 kemungkinan dapat ditingkatkan performanya dengan menambah jumlah feature

10.

Di bawah ini yang merupakan pernyataan yang pasti benar mengenai decision tree yaitu ….

a)

Decision tree dapat digunakan untuk melakukan prediksi target yang bersifat continuous

b)

Nilai parameter min_samples_split yang besar akan menghasilkan tree yang dalam/besar

c)

Pada bagian bawah tree, nilai gini impurity cenderung lebih tinggi

d)

Nilai parameter min_samples_leaf yang besar akan menghasilkan tree yang dalam/besar

e)

Nilai parameter max_depth yang besar pasti akan menghasilkan jumlah node yang banyak

11.

Di bawah ini yang bukan merupakan strategi untuk dapat menghindari overfitting yaitu …

a)

Menambah jumlah data untuk training model

b)

Menerapkan regularization dengan nilai parameter penalty yang tinggi

c)

Menggunakan polynomial features pada model

d)

Mengurangi kompleksitas model

e)

Mengurangi jumlah fitur

12.

Kondisi di bawah ini merupakan beberapa penyebab dari underfitting, kecuali ...

a)

Menggunakan nilai k (jumlah neighbor) yang besar untuk K-Nearest Neighbours

b)

Menggunakan model linear regression pada data yg tidak linear

c)

Melatih model dengan sedikit feature

d)

Membuat decision tree dengan entropy sebagai splitting criterion

e)

Membuat decision tree dengan depth = 1

13.

Di antara beberapa contoh categorical variable di bawah ini, yang paling mungkin di-encode menggunakan teknik ordinal encoding yaitu ...

a)

Jenjang karir/Pangkat

b)

Jenis kelamin

c)

Nama negara

d)

Status merokok (ya/tidak)

e)

Nama kota

14.

Output:

No of unique value: 9

No of new columns: ???

Berapa jumlah kolom yang dihasilkan dari proses One Hot Encoding di atas?

a)

8

b)

9

c)

4

d)

1

e)

81

15.

Apabila terdapat missing values pada sejumlah kolom sebuah dataset, strategi yang mungkin untuk dilakukan yaitu sebagai berikut, kecuali ...

a)

mengisi missing value pada suatu kolom numerikal dengan suatu nilai berdasarkan hasil regresi dari nilai pada kolom lainnya

b)

mengisi missing value dengan mode jika kolomnya kategorikal

c)

mengisi missing value dengan mean jika kolomnya numerikal

d)

menghapus baris yang punya missing value

e)

mengisi missing value dengan mean jika kolomnya kategorikal

16.

Pada model-based feature selection, pemilihan feature dapat dilakukan diantaranya dengan

a)

Melihat feature importance pada model seperti decision tree dan random forest

b)

Memilih feature berdasarkan domain knowledge

c)

Melatih model dengan sedikit feature, lalu menambahkan feature satu per satu sambil menghitung sebuah metric

d)

Memilih feature dengan melihat korelasi antara feature dengan target

e)

Melatih model dengan seluruh feature, lalu menghilangkan feature satu per satu sambil menghitung sebuah metric

17.

Apabila ‘YES’ diasumsikan sebagai positive class, berapa nilai precision?

a)

0.892

b)

0.980

c)

0.806

d)

0.961

e)

0.5

18.

Anda seorang Data Scientist di sebuah perusahaan FinTech dan diminta untuk mengimplementasikan sebuah sistem pendeteksi nasabah gagal bayar (default). Perusahaan Anda menilai bahwa kerugian ketika salah memprediksi nasabah yang mampu melunasi pembayaran sebagai nasabah gagal bayar (default) lebih besar dibanding kerugian ketika salah memprediksi nasabah gagal bayar sebagai nasabah yang mampu melunasi pembayaran.

Metric yang perlu coba diminimalkan nilainya oleh model Anda adalah…

a)

F1 score

b)

Precision

c)

Recall

d)

False Positive Rate

e)

False Negative Rate

19.

Berdasarkan kode di bawah ini, jumlah kombinasi nilai hyperparameter yang akan di-fitting adalah

a)

9

b)

40

c)

24

d)

48

e)

20

20.

Untuk memperoleh pengukuran evaluasi model berupa rata-rata dari kuadrat selisih antara hasil prediksi dengan data observasi yang sesungguhnya, metric yang dapat digunakan yaitu ...

a)

MAE

b)

MSE

c)

RMSE

d)

MAPE

e)

R square

21.

Di bawah ini yang merupakan strategi yang kurang tepat dalam mengatasi kasus imbalance class adalah ...

a)

Melakukan oversampling

b)

Melakukan undersampling

c)

Mengumpulkan lebih banyak data pada minority class

d)

Melakukan feature engineering

e)

Menambah data pada majority class

22.

Salah satu strategi dalam ensemble learning di mana terdapat lebih dari satu base learner dengan cara kerja sequential/berurutan di mana hasil modeling dari suatu base learner pada sample dari dataset akan mempengaruhi pemilihan sampel dan modeling pada base learner selanjutnya, disebut dengan ...

a)

Voting

b)

Stacking

c)

Bagging

d)

Boosting

e)

Tuning

23.

Pada model bagging yang menggunakan decision tree sebagai base learner, manakah cara kerja model bagging berikut yang kurang tepat dalam mengoptimalkan prediksi yang dihasilkan?

a)

Menjalankan semua base learner secara parallel

b)

Melakukan hyperparameter tuning untuk menentukan jumlah base learner yang paling optimal terhadap data

c)

Menjalankan base learner secara sequential

d)

Hasil prediksi dari setiap base learner di-agregasi dengan cara majority vote

e)

Dilakukan bootstrap-sampling untuk memiliki karakteristik data yang berbeda pada tiap base learner

24.

Di bawah ini yang merupakan pernyataan yang kurang tepat mengenai principal component analysis (PCA) yaitu

a)

PCA mengurangi jumlah dimensi data dengan menghapus feature yang korelasinya paling kecil terhadap target

b)

Kekurangan dari penerapan PCA adalah adanya risiko kehilangan informasi dari data yang digunakan

c)

Feature hasil penerapan PCA dapat digunakan untuk clustering

d)

PCA dapat mempermudah untuk tujuan visualisasi pada 2D atau 3D plot

e)

PCA dapat menangani multicollinearity

25.

Pada metode clustering DBSCAN, Anda bisa mengatur hyperparameter epsilon dan min_samples. Pernyataan yang benar mengenai hal tersebut adalah ….

a)

Memperbesar nilai epsilon akan menyebabkan cluster yang terbentuk cenderung berukuran kecil-kecil

b)

Memperbesar nilai epsilon akan menyebabkan semakin sedikit data point yang masuk sebagai cluster

c)

Memperbesar nilai min_samples akan menyebabkan semakin banyak data yang dianggap sebagai noise

d)

Memperbesar nilai min_samples akan mempermudah bagi setiap data untuk menjadi core sample

e)

Epsilon adalah jumlah minimum sample untuk menjadi core sample

26.

Pernyataan yang kurang tepat mengenai K-Means Clustering adalah …

a)

Cara kerja K-Means Clustering adalah dengan memasukkan data point pada centroid terdekat menjadi sebuah cluster, kemudian pada iterasi berikutnya centroid akan berpindah ke rata-rata pada cluster tersebut

b)

Jumlah cluster optimal dapat ditentukan menggunakan dendrogram

c)

Jumlah cluster optimal dapat ditentukan menggunakan shilouette score

d)

Jumlah cluster optimal dapat ditentukan menggunakan elbow method

e)

Tidak ada jawaban yang benar

27.

Di bawah ini, yang bukan merupakan contoh bentuk deliverable pada interpretable machine learning model adalah …

a)

Decision Tree plot

b)

Koefisien dari feature-feature di Linear Regression

c)

Decision boundary pada K-Means Clustering

d)

Feature Importance pada Gradient Boost

e)

Koefisien dari features di Logistic Regression

28.

Di bawah ini, yang merupakan business question yang bersifat inference yaitu ...

a)

Apakah kita dapat mendeteksi siapa saja customer yang akan melakukan churn?

b)

Kota mana yang menghasilkan pendapatan paling besar?

c)

Apakah kita dapat mengelompokkan customer berdasarkan segmentasinya?

d)

Pelanggan mana saja yang baru mulai bertransaksi hari ini dan paling mungkin akan menjadi loyal customer?

e)

Pelanggan mana saja yang bertransaksi hari ini dan terindikasi melakukan fraud?

29.

Berikut adalah evaluation metrics yang biasa digunakan untuk kasus klasifikasi, kecuali…

a)

Recall

b)

F1 score

c)

Accuracy

d)

Precision

e)

R-square

30.

Dalam sebuah perusahaan, 60% karyawannya adalah laki-laki dan 40% perempuan.
Diketahui bahwa:

  • 70% karyawan laki-laki bisa coding Python.

  • 50% karyawan perempuan bisa coding Python.

Jika dipilih satu orang secara acak dan ternyata orang tersebut bisa coding Python, berapa probabilitas bahwa orang tersebut (dari seluruh yang bisa coding Python) adalah laki-laki?

a)

70%

b)

67.7%

c)

42%

d)

60%

e)

50%