wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Modul 3 Versi Serius

Total questions: 35

Worksheet time: 35mins

Name
Class
Date
1.

Di bawah ini yang merupakan model atau algoritma yang umum digunakan dalam supervised learning, kecuali . . . .

a)

Random Forest

b)

Logistic Regression

c)

XGBoost

d)

Linear Regression

e)

PCA

2.

Pernyataan yang kurang tepat dari statement berikut adalah . . . .

a)

1, 2, dan 4

b)

2 dan 4

c)

3 dan 4

d)

1 dan 4

e)

2 dan 3

3.

Pernyataan di bawah ini yang tepat yaitu

a)

komponen di dalam kotak kuning disebut dengan slope

b)

komponen di dalam kotak kuning disebut dengan dependen variable

c)

komponen di dalam kotak kuning disebut dengan intercept

d)

komponen di dalam kotak hijau disebut dengan explanatory variable

e)

komponen di dalam kotak merah disebut dengan independent variables

4.

Metode Least Squares pada kasus regression dapat digunakan untuk mengestimasi nilai parameter model sehingga nilai sum of squared error dapat sekecil mungkin, yang ditandai dengan

a)

jumlah selisih nilai hasil prediksi dengan data observasi yang sesungguhnya nilainya mendekati satu

b)

jumlah dari nilai hasil prediksi dengan data observasi yang sesungguhnya dapat mendekati satu

c)

jumlah nilai hasil prediksi dan data observasi yang sesungguhnya dapat sekecil mungkin

d)

jumlah selisih nilai hasil prediksi dengan data observasi yang sesungguhnya dapat sekecil mungkin

e)

Semua Statement Salah

5.

Fungsi pada kode tersebut akan menghitung sebuah evaluation metric yaitu

a)

MAPE

b)

MAE

c)

RMSE

d)

R2

e)

MSE

6.

Dalam kasus pendeteksian jawaban ujian yang merupakan hasil menyontek, di mana jawaban asli seorang siswa diasumsikan sebagai positive class, false positive rate menandakan...

a)

Persentase jumlah jawaban hasil sontek yang dideteksi sebagai jawaban hasil sontek

b)

Banyaknya jawaban hasil sontek yang dideteksi sebagai jawaban asli

c)

Banyaknya jawaban asli yang dideteksi sebagai jawaban hasil sontek

d)

Persentase jumlah jawaban hasil sontek yang dideteksi sebagai jawaban asli

e)

Persentase jumlah jawaban asli yang dideteksi sebagai jawaban hasil sontek

7.

Pada decision tree classification, splitting akan berhenti dilakukan jika terpenuhi kondisi-kondisi berikut ini, kecuali

a)

kedalaman tree sudah mencapai ketentuan

b)

jumlah elemen pada node setelah melakukan splitting kurang dari ketentuan

c)

jumlah elemen pada node sebelum melakukan splitting kurang dari ketentuan

d)

seluruh elemen pada node masuk ke dalam satu kelas saja

e)

Tidak Ada Jawaban Yang Benar

8.

Di bawah ini yang merupakan pernyataan yang pasti benar mengenai decision tree yaitu

a)

pada bagian bawah tree, nilai gini impurity cenderung lebih tinggi

b)

DT dapat memprediksi data target numeric Continues

c)

information gain memiliki kinerja splitting lebih baik dibanding gini index

d)

semakin kecil nilai parameter min_samples, semakin dangkal tree yang dihasilkan

e)

Semua Jawaban Salah

9.

Bagian yang paling mungkin menyebabkan masalah evaluasi model pada potongan kode di atas terdapat pada

a)

tidak ada baris kode yang bermasalah

b)

baris ke-8

c)

baris ke-15

d)

baris ke-16

e)

Baris 13

10.

Pernyataan yang tepat dari tabel tersebut adalah

a)

Seluruh Model Overfitting

b)

KNN adalah best model

c)

DT adalah best model

d)

LogReg mengalami overfitting

e)

KNN mengalami underfittng

11.

Di bawah ini yang bukan merupakan strategi untuk dapat menghindari underfitting yaitu

a)

menerapkan regularization dengan nilai parameter penalty term yang tinggi

b)

Menambahkan jumlah feature

c)

Menerapkan polynomial feature

d)

Menggunakan Metode Near Miss

e)

Semua jawaban salah

12.

Kondisi di bawah merupakan beberapa penyebab dari overfitting, kecuali

a)

Menggunakan order pangkat setinggi mungkin pada polynomial features

b)

Melibatkan independent variable sebanyak mungkin pada linear regression

c)

Melatih model dengan data yang memiliki fitur sangat banyak

d)

menggunakan nilai k = 1 untuk K-Nearest Neighbours

e)

Semua Jawaban Merupakan Penyebab Overfitting

13.

Di antara beberapa contoh categorical variable di bawah ini, yang paling mungkin di-encode menggunakan teknik ordinal encoding yaitu

a)

Nama Orang

b)

Merk Mobil

c)

Status Pernikahan

d)

Golongan Darah

e)

Jenjang Pendidikan

14.

Nilai yang seharusnya muncul pada bagian “???” keluaran kode tersebut adalah

a)

4

b)

5

c)

10

d)

0

e)

3

15.

Apabila terdapat kasus missing values pada sejumlah kolom sebuah dataset, strategi yang mungkin untuk dilakukan yaitu sebagai berikut, kecuali

a)

mengisi missing value dengan median kolom tersebut (untuk kolom numerik)

b)

mengisi missing value dengan mode kolom tersebut (untuk kolom kategorikal)

c)

mengisi missing value dengan mean kolom tersebut (untuk kolom kategorikal)

d)

menghapus baris-baris dengan missing value

e)

Semua Jawaban Benar

16.

Pada model-based feature selection, pemilihan feature dapat dilakukan diantaranya dengan

a)

Mencoba melatih beberapa model dengan jumlah feature yang berbeda-beda

b)

Melihat koefisien dan hasil significant test dari independent variables pada sebuah linear model, atau melihat feature importance pada model seperti decision tree dan random forest

c)

Melatih model dengan sedikit feature, lalu menambahkan feature satu per satu sambil menghitung sebuah metric

d)

Melatih model dengan seluruh feature, lalu menghilangkan feature satu per satu sambil menghitung sebuah metric

e)

Melakukan pemilihan feature berdasarkan EDA

17.

Apabila “YES” diasumsikan sebagai positive class, maka hasil perhitungan akurasi dari matriks di atas adalah

a)

0.333

b)

0.6

c)

0.533

d)

0.89

e)

0.975

18.

Anda diminta untuk mengimplementasikan sebuah sistem pendeteksi uang palsu. Organisasi Anda menilai bahwa risiko salah memprediksi selembar uang palsu sebagai uang asli lebih besar dibanding risiko salah memprediksi selembar uang asli sebagai uang palsu (asumsikan bahwa “asli” akan menjadi positive label).


Metric yang perlu coba diminimalkan oleh model Anda yaitu

a)

Precision

b)

F1 score

c)

Type II error

d)

False negative rate

e)

Semua Salah

19.

Jumlah kombinasi nilai hyperparameter yang akan dicoba adalah

a)

15

b)

30

c)

25

d)

30

e)

Semua Salah

20.

Untuk memperoleh pengukuran evaluasi model berupa persentase selisih antara hasil prediksi dengan data observasi yang sesungguhnya, metric yang dapat digunakan yaitu

a)

Goodness of Fit

b)

MAPE

c)

MAE

d)

MSE

e)

R2

21.

Di bawah ini yang merupakan strategi yang kurang tepat dalam mengatasi kasus imbalance class adalah

a)

melakukan random sampling pada saat train & test set splitting

b)

mengatur bobot kelas pada model

c)

melakukan feature engineering

d)

melakukan undersampling

e)

Semua Benar

22.

Salah satu strategi dalam ensemble learning di mana terdapat lebih dari satu base learner dengan cara kerja yang serupa dan masing-masing learner dilatih menggunakan hasil sampling dengan pengembalian dari sebuah training set yang utuh di mana setiap anggota sampel dapat terpilih lebih dari satu kali disebut dengan

a)

voting

b)

bagging

c)

stacking

d)

boosting

e)

tuning

23.

Apabila decision tree digunakan sebagai base learner method untuk bagging, strategi yang perlu dihindari untuk memperoleh hasil prediksi yang optimal adalah

a)

menjalankan tiap base learner secara paralel

b)

menyamakan seluruh hyperparameter untuk setiap base learner agar masing-masing menghasilkan tree yang semirip mungkin

c)

mengagregat hasil prediksi masing-masing base learner dengan melakukan majority vote

d)

melatih sebuah decision tree terlebih dahulu sebagai pembanding dan untuk mengetahui adanya potensi perbaikan

e)

melakukan hyperparameter tuning untuk menentukan jumlah base learner yang optimal

24.

Di bawah ini yang merupakan pernyataan yang kurang tepat mengenai principal component analysis (PCA) yaitu

a)

Terdapat hyperparameter berupa number of components yang mengatur jumlah dimensi yang dihasilkan di akhir penerapan PCA

b)

Hasil penerapan PCA terhadap sebuah dataset dapat digunakan untuk melakukan eksplorasi lebih lanjut semisal melakukan clustering

c)

PCA mengurangi jumlah dimensi data dengan menghapus feature yang kurang relevan terhadap label

d)

PCA termasuk ke unsupervised learning

e)

PCA dapat digunakan untuk memudahkan visualisasi data dalam 2D plot atau 3D plot

25.

Dampak dari pengaturan hyperparameter epsilon atau min_samples pada DBSCAN yang benar yaitu

a)

Memperkecil nilai min_samples akan menyebabkan semakin banyak noise yang diperoleh dari hasil DBSCAN

b)

Memperbesar nilai min_samples akan menyebabkan semakin banyak core sample yang terbentuk

c)

Memperbesar nilai min_samples akan menyebabkan semakin sulit bagi setiap data point untuk menjadi sebuah core sample

d)

Mengurangi nilai epsilon akan menyebabkan cluster yang terbentuk cenderung berukuran besar

e)

Mengurangi nilai epsilon akan menyebabkan semakin banyak data point yang masuk ke dalam sebuah cluster

26.

Teknik elbow method pada K-Means Clustering dapat digunakan untuk mengetahui

a)

Tidak ada jawaban yang benar

b)

jumlah iterasi optimal yang perlu dikerjakan

c)

letak tiap centroid optimal pada iterasi awal

d)

jumlah cluster optimal yang dapat dibuat

e)

jumlah kolom optimal yang digunakan untuk mengelompokkan dataset

27.

Apabila sebuah ARIMA model menggunakan dua level differencing dan satu observasi lag sebagai predictor, maka parameter yang digunakan adalah

a)

ARIMA(0,2,0)

b)

ARIMA(1,0,0)

c)

ARIMA(0,2,1)

d)

ARIMA(1,0,2)

e)

Tidak Ada Jawaban Yang Benar

28.

Kata yang memiliki bobot tf-idf terbesar pada dokumen ketiga adalah

a)

principal

b)

system

c)

money

d)

business

e)

school

29.

Apabila tokenization dilakukan menggunakan tri-gram (n=3 dan n_min = 3) pada teks berikut, maka hasil yang diperoleh adalah

"Zilong Hero Sampah Di Mobile Legend"

a)

Zilong, Hero, Sampah, Di, Mobile, Legend

b)

Zilong, Hero, Sampah, Di, Mobile, Legend, Zilong Hero, Hero Sampah, Sampah Di, Di Mobile, Mobile Legend

c)

Zilong, Hero, Sampah, Di, Mobile, Legend, Zilong Hero, Hero Sampah, Sampah Di, Di Mobile, Mobile Legend, Zilong Hero Sampah, Sampah Di Mobile, Di Mobile Legend

d)

Zilong Hero Sampah, Hero Sampah Di, Sampah Di Mobile, Di Mobile Legend

e)

Semua Jawaban Benar

30.

Pada item-based collaborative filtering, pemberian rekomendasi dilakukan dengan

a)

Tidak ada jawaban yang benar

b)

Mencari produk P yang memiliki jumlah user U terbanyak, sehingga P akan direkomendasi ke semua user U’ yang belum menggunakannya

c)

Mencari produk P yang memiliki jumlah produk P’ yang mirip dengannya paling banyak, sehingga P akan direkomendasikan ke semua user U’ yang belum menggunakannya

d)

mencari produk P yang belum pernah digunakan oleh user U, namun telah digunakan oleh user U’ yang mirip dengan U, sehingga P akan direkomendasikan kepada U

e)

Memberi rekomendasi produk P kepada User U yang menggunakan produk P', di mana produk P’ memiliki user U’ yang juga merupakan pengguna produk P

31.

Di bawah ini, yang merupakan kelemahan dalam penerapan model-based recommender system adalah

a)

Data yang dibutuhkan cenderung lebih sedikit

b)

Similarity measure antar item menjadi bias

c)

Sulit untuk merekomendasikan item yang belum pernah memperoleh rating

d)

Sulit untuk mengeksplor interest baru dari seorang user

e)

Semua Jawaban Salah

32.

Data maturity level di mana sebuah organisasi yang menolak adanya data untuk mengambil keputusan, dan biasanya perusahaan-perusahaan yang berada di tahap ini adalah perusahaan korporasi yang old-minded, banyak birokrasi, sehingga sulit untuk memahami kebutuhan dari data itu sendiri. disebut dengan

a)

Data-driven

b)

Data savvy

c)

Data-guided

d)

Data aware

e)

Semua Jawaban Salah

33.

Di bawah ini, yang bukan merupakan contoh bentuk deliverable pada interpretable machine learning model adalah

a)

Core samples pada DBSCAN

b)

Dendogram pada Hierarchical Clustering

c)

Koefisien Independent Variables pada Linear Regression

d)

Decision tree plot

e)

Semua Salah

34.

Di bawah ini, yang merupakan business question yang bersifat inference yaitu

a)

“Berapa peluang transaksi dengan nomor ID 1234 akan dibatalkan oleh pelanggan?”

b)

“Apakah kita dapat mendeteksi secara dini pelanggan yang akan melakukan fraud sebelum pembayaran?”

c)

“Bagaimana karakteristik dari seorang loyal customer?”

d)

“Pelanggan mana saja yang baru mulai bertransaksi hari ini dan paling mungkin akan menjadi loyal customer?”

e)

“Pelanggan mana saja yang bertransaksi hari ini dan terindikasi melakukan fraud?”

35.

Berikut adalah evaluation metrics yang biasa digunakan untuk kasus klasifikasi, kecuali

a)

Recall

b)

ROC AUC

c)

F1 Score

d)

Accuracy

e)

Semua Digunakan Untuk Klasifikasi