wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Practice Modul 3 Exam

Total questions: 20

Worksheet time: 40mins

Name
Class
Date
1.

Di bawah ini yang bukan merupakan model atau algoritma yang umum digunakan dalam supervised learning adalah

a)

Logistic Regression

b)

KMeans

c)

Adaptive Boosting

d)

Decision Tree

e)

Linear Regression

2.

Di bawah ini yang merupakan pernyataan yang kurang tepat mengenai principal component analysis (PCA) yaitu

a)

PCA dapat mempermudah untuk tujuan visualisasi pada 2D atau 3D plot

b)

Kekurangan dari penerapan PCA adalah adanya risiko kehilangan informasi dari data yang digunakan

c)

PCA mengurangi jumlah dimensi data dengan menghapus feature yang korelasinya paling kecil terhadap target

d)

Feature hasil penerapan PCA dapat digunakan untuk clustering

e)

PCA dapat menangani multicollinearity

3.

Pada metode clustering DBSCAN, Anda bisa mengatur hyperparameter epsilon dan min_samples. Pernyataan yang benar mengenai hal tersebut adalah

a)

Memperbesar nilai epsilon akan menyebabkan semakin sedikit data point yang masuk sebagai cluster

b)

Memperbesar nilai epsilon akan menyebabkan cluster yang terbentuk cenderung berukuran kecil-kecil

c)

Memperbesar nilai min_samples akan menyebabkan semakin banyak data yang dianggap sebagai noise

d)

Memperbesar nilai min_samples akan mempermudah bagi setiap data untuk menjadi core sample

e)

Epsilon adalah jumlah minimum sample untuk menjadi core sample

4.

Teknik elbow method pada K-Means Clustering dapat digunakan untuk mengetahui

a)

Jumlah iterasi optimal

b)

Jumlah kolom optimal

c)

Letak centroid terbaik

d)

Jumlah cluster optimal

e)

Tidak ada yang benar

5.

Berikut adalah evaluation metrics yang biasa digunakan untuk kasus klasifikasi, kecuali

a)

Recall

b)

F1 score

c)

Accuracy

d)

Precision

e)

Mean Absolute Error

6.

Di bawah ini, yang merupakan business question yang bersifat inference (EDA / analisis data / statistika) yaitu

a)

Apakah kita dapat mendeteksi siapa saja customer yang akan melakukan churn?

b)

Apakah kita dapat mengelompokkan customer berdasarkan segmentasinya?

c)

Kota mana yang menghasilkan pendapatan paling besar?

d)

Pelanggan mana saja yang baru mulai bertransaksi hari ini dan paling mungkin akan menjadi loyal customer?

e)

Pelanggan mana saja yang bertransaksi hari ini dan terindikasi melakukan fraud?

7.

Di bawah ini, yang merupakan kelemahan dalam penerapan model-based recommender system adalah

a)

Memiliki keterbatasan dalam mengembangkan minat pengguna

b)

Akan kesulitan ketika hendak merekomendasikan item-item baru yang belum ada ratingnya

c)

Item dengan rating paling banyak akan kesulitan direkomendasikan

d)

Metode ini memerlukan domain knowledge yang spesifik

e)

Tidak ada yang benar

8.

Di bawah ini yang merupakan strategi yang kurang tepat dalam mengatasi kasus imbalance class adalah

a)

Melakukan oversampling

b)

Melakukan undersampling

c)

Mengumpulkan lebih banyak data pada minority class

d)

Melakukan feature engineering

e)

Menambah data pada majority class

9.

Di antara beberapa contoh categorical variable di bawah ini, yang paling mungkin di-encode menggunakan teknik ordinal encoder yaitu

a)

Jenis kelamin

b)

Jenjang karir/Pangkat

c)

Nama negara

d)

Status merokok (ya/tidak)

e)

Nama kota

10.

Perhatikan tabel hasil training dan evaluation dari 3 kandidat model berikut ini. Pernyataan yang tepat mengenai tabel di atas adalah

a)

Model no.3 mengalami overfitting

b)

Model no.1 adalah model terbaik karena modelnya paling general/stabil

c)

Model no.2 mengalami underfitting

d)

Model no.1 kemungkinan dapat ditingkatkan performanya dengan menambah jumlah feature

e)

Model no.2 kemungkinan dapat ditingkatkan performanya dengan menambah jumlah feature

11.

Bagian yang paling mungkin menyebabkan masalah evaluasi model pada potongan kode di bawah ini terdapat pada

a)

Pada baris ke-7, untuk membaca dataset seharusnya np.read_csv

b)

Pada baris ke-15, proses splitting train set dan test set seharusnya sebelum model training

c)

Pada baris ke-15, train_test_split seharusnya menggunakan parameter stratify=y

d)

Pada baris ke-17, untuk prediksi seharusnya tree.predict(y_test)

e)

Pada baris ke-18, mean_squared_error digunakan untuk evaluasi kasus regresi

12.

Di bawah ini yang merupakan pernyataan yang pasti benar mengenai decision tree yaitu

a)

Nilai parameter min_samples_split yang besar akan menghasilkan tree yang dalam/besar

b)

Decision tree dapat digunakan untuk melakukan prediksi target klasifikasi dan regresi

c)

Pada bagian bawah tree, nilai gini impurity cenderung lebih tinggi

d)

Nilai parameter max_depth yang kecil akan menghasilkan jumlah node yang sedikit

e)

Nilai parameter max_depth yang kecil akan menghasilkan jumlah node yang banyak

13.

Fungsi calculate_metric pada kode di bawah ini akan menghitung sebuah evaluation metric yaitu

a)

MSE

b)

MAE

c)

MAPE

d)

RMSE

e)

Accuracy

14.

Misalkan Anda diminta untuk mengimplementasikan fraud detection system pada sebuah transaksi keuangan. Diberikan beberapa pernyataan berikut ini. Pernyataan yang kurang tepat adalah

a)

3, 4

b)

1, 2, 4

c)

2, 4

d)

2, 3

e)

1, 4

15.

Di antara beberapa contoh variabel di bawah ini, one-hot encoding paling perlu dihindari pada

a)

jenis pekerjaan

b)

jenjang pendidikan terakhir

c)

nomor telepon

d)

gender

e)

marital status

16.

Pada item-based collaborative filtering, pemberian rekomendasi dilakukan dengan

a)

Memberi rekomendasi produk P kepada User U yang menggunakan produk P', di mana produk P’ memiliki user U’ yang juga merupakan pengguna produk P

b)

Mencari produk P yang belum pernah digunakan oleh user U, namun telah digunakan oleh user U’ yang mirip dengan U, sehingga P akan direkomendasikan kepada U

c)

Memberi rekomendasi produk P pada user U berdasarkan produk P’ yang mana content produk P paling serupa dengan produk P’

d)

Mencari produk P yang memiliki jumlah user terbanyak, sehingga P akan direkomendasi ke semua user U’ yang belum menggunakannya

e)

Tidak ada yang benar

17.

Memprediksi "No Cancer" kepada orang yang memiliki "Cancer", mengakibatkan konsekuensi yang tinggi. Metrik apa yang tepat untuk membuat model?

a)

F1 Score

b)

Accuracy

c)

Recall

d)

Precision

e)

RMSE

18.

Fill the blank with proper method

a)

extend

b)

add

c)

append

d)

merge

e)

join

19.

When you have highly left-skewed data, which statement is possibly true?

a)

Mean = Median

b)

Median > Mean

c)

Mean > Median

d)

Mean > Mode

e)

Mean = Mode

20.

Sebutkan tipe dari supervised learning?

a)

AI agent and environment

b)

regression and classification

c)

classification and AI agent

d)

clustering and classification

e)

None of the above