wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Modul 3 simulation (2)

Total questions: 35

Worksheet time: 18mins

Name
Class
Date
1.

Di bawah ini yang bukan merupakan model atau algoritma yang umum digunakan dalam unsupervised learning adalah

a)

PCA

b)

K-Means

c)

KNN

d)

DBSCAN

2.

Berikut adalah pernyataan yang telah diubah dengan dua opsi benar dan dua opsi salah:

Misalkan Anda diminta untuk mengimplementasikan spam detection system pada sebuah layanan email. Diberikan beberapa pernyataan berikut ini.

Pernyataan:

  1. 1. Sistem Anda dapat menggunakan algoritma supervised learning untuk mengklasifikasikan email sebagai spam atau bukan spam.

  2. 2. Anda harus melatih model dengan data yang mencakup berbagai fitur, termasuk isi email dan pengirim.

  3. 3. Anda tidak perlu mempertimbangkan fitur-fitur lain selain isi email untuk melakukan prediksi.

  4. 4. Model yang Anda buat harus dilatih dengan data yang hanya terdiri dari email spam.

a)

Pernyataan 1 dan 2 benar.

b)

Pernyataan 1 dan 3 benar.

c)

Pernyataan 2 dan 3 benar.

d)

Pernyataan 3 dan 4 benar.

3.

Pilih yang benar

a)

kotak hijau adalah variabel independen

b)

kotak kuning adalah slope

c)

kotak merah adalah intercept

d)

salah semua

4.

Dalam analisis regresi, metode Ridge Regression digunakan untuk mengatasi masalah multikolinearitas dengan cara:

a)

Menambahkan penalti pada jumlah kuadrat dari koefisien regresi.

b)

Menghapus fitur yang memiliki korelasi tinggi.

c)

Menggunakan metode klasifikasi untuk memprediksi nilai.

d)

Mengoptimalkan jumlah data yang digunakan untuk pelatihan

5.

Fungsi pada kode di atas akan menghitung sebuah evaluation metric yaitu

a)

MSE

b)

RMSE

c)

MAPE

d)

MAE

6.

Berikut adalah soal yang telah diubah dengan fokus pada false negative rate:

Dalam kasus pendeteksian jawaban ujian yang merupakan hasil menyontek, di mana jawaban asli seorang siswa diasumsikan sebagai positive class, false negative rate menandakan...

a)

Persentase jumlah jawaban hasil sontek yang dideteksi sebagai jawaban hasil sontek.

b)

Jumlah jawaban hasil sontek yang dideteksi sebagai jawaban asli.

c)

Jumlah jawaban asli yang dideteksi sebagai jawaban hasil sontek.

d)

Persentase jumlah jawaban asli yang dideteksi sebagai jawaban hasil sontek.

7.

Pada decision tree classification, splitting akan berhenti dilakukan jika terpenuhi kondisi-kondisi berikut ini, kecuali:

a)

Seluruh elemen pada node masuk ke dalam satu kelas saja.

b)

Kedalaman tree sudah mencapai ketentuan.

c)

Jumlah elemen pada node sebelum melakukan splitting kurang dari ketentuan.

d)

semua salah

8.

Di bawah ini yang merupakan pernyataan yang salah mengenai decision tree yaitu:

a)

Pada bagian bawah tree, nilai gini impurity cenderung lebih rendah

b)

Decision tree dapat digunakan untuk melakukan prediksi label yang bersifat continuous.

c)

Information gain memiliki kinerja splitting lebih baik dibanding gini index.

d)

Semakin besar nilai parameter max_depth, semakin banyak jumlah node yang dihasilkan.

e)

Semakin kecil nilai parameter min_samples, semakin dalam tree yang dihasilkan.

9.

Bagian yang paling mungkin menyebabkan masalah evaluasi model pada potongan kode di atas terdapat pada

a)

Model dilatih menggunakan data yang salah, sehingga hasil prediksi tidak akurat.

b)

Data tidak dibagi dengan benar antara training dan testing.

c)

Prediksi dilakukan pada data training alih-alih data testing.

d)

Tidak ada kesalahan dalam kode ini

10.

Pernyataan yang tepat mengenai tabel di atas adalah

a)

Model ketiga menunjukkan performa terbaik di validation set dibandingkan model lainnya.

b)

Model kedua mengalami overfitting.

c)

Model pertama lebih mungkin diambil sebagai kandidat model terbaik dibanding model kedua.

d)

Model ketiga kemungkinan dapat meningkat dengan menambah jumlah feature.

11.

Di bawah ini yang bukan merupakan strategi untuk dapat menghindari underfitting yaitu:

a)

Menambah jumlah fitur yang relevan.

b)

Menggunakan model yang lebih kompleks.

c)

Menerapkan regularization dengan ridge atau lasso

d)

Menambahkan polynomial features pada model.

12.

Kondisi di bawah merupakan beberapa penyebab dari overfitting, kecuali:

a)

Menggunakan model yang terlalu kompleks untuk data yang sederhana.

b)

Melibatkan fitur yang tidak relevan dalam model.

c)

Menggunakan teknik regularization

d)

Menggunakan nilai k yang sangat kecil untuk K-Nearest Neighbours.

13.

Di antara beberapa contoh categorical variable di bawah ini, yang paling mungkin di-encode menggunakan teknik ordinal encoding yaitu:

a)

Tingkat kepuasan pelanggan

b)

Warna mobil

c)

Tipe kendaraan (mobil, motor, truk)

d)

Nama produk

14.

Hasil dari fuel_types_train_encoded berapa kolom?

a)

2

b)

3

c)

4

d)

5

15.

Apabila terdapat kasus missing values pada sejumlah kolom sebuah dataset, strategi yang tidak mungkin untuk dilakukan yaitu sebagai berikut, kecuali:

a)

Mengisi missing value dengan median kolom tersebut (untuk kolom numerik)

b)

Mengisi missing value dengan mode kolom tersebut (untuk kolom numerik)

c)

Mengisi missing value dengan mean kolom tersebut (untuk kolom kategorik)

d)

semua salah

16.

Pada metode iterative forward feature selection, pemilihan feature dapat dilakukan di antaranya dengan:

a)

Mencoba melatih beberapa model dengan jumlah feature yang berbeda-beda

b)

Melihat koefisien dan hasil significant test dari independent variables pada sebuah linear model, atau melihat feature importance pada model seperti decision tree dan random forest.

c)

Melatih model dengan seluruh feature, lalu menghilangkan feature satu per satu sambil menghitung sebuah metric.

d)

Melatih model dengan sedikit feature, lalu menambahkan feature satu per satu sambil menghitung sebuah metric.

17.

Apabila “YES” diasumsikan sebagai positive class, maka hasil perhitungan precision untuk positive class dari matriks di atas adalah

a)

0.333

b)

0.6

c)

0.845

d)

0.975

18.

Anda bekerja di sebuah perusahaan keamanan siber yang bertugas untuk mendeteksi serangan malware. Perusahaan Anda menyadari bahwa risiko salah mengidentifikasi serangan malware sebagai aktivitas normal (false positive) dapat menyebabkan gangguan operasional yang signifikan. Oleh karena itu, penting untuk meminimalkan jumlah peringatan palsu yang dihasilkan oleh sistem deteksi.

Metric yang perlu coba diminimalkan oleh model Anda yaitu

a)

Precision

b)

Type II error

c)

False negative rate

d)

False positive rate

19.

Jumlah kombinasi nilai hyperparameter yang akan dicoba adalah

a)

5

b)

12

c)

3

d)

4

20.

Untuk memperoleh pengukuran evaluasi model berupa persentase selisih kuadrat antara hasil prediksi dengan data observasi yang sesungguhnya, metric yang dapat digunakan yaitu:

a)

MAE

b)

MAPE

c)

RMSE

d)

RMSPE

21.

Di bawah ini yang merupakan strategi yang tepat dalam mengatasi kasus imbalance class adalah, kecuali

a)

Menggunakan algoritma dengan weight untuk menyeimbangkan

b)

oversampling atau undersampling

c)

Mengatur bobot kelas pada model

d)

random search cross validation pada training

22.

Salah satu strategi dalam ensemble learning di mana terdapat lebih dari satu base learner dengan cara kerja yang berbeda, di mana setiap learner dilatih menggunakan hasil prediksi dari learner lainnya dan menggabungkan hasilnya untuk meningkatkan akurasi model disebut dengan:

a)

Voting

b)

Bagging

c)

Pasting

d)

Stacking

23.

Apabila decision tree digunakan sebagai base learner method untuk bagging, strategi yang perlu dilakukan untuk memperoleh hasil prediksi yang optimal adalah, kecuali

a)

menyamakan setiap model decision tree agar identik

b)

menjalankan tiap base learner secara paralel

c)

mengagregat hasil prediksi masing-masing base learner dengan melakukan majority vote

d)

melatih sebuah decision tree terlebih dahulu sebagai pembanding dan untuk mengetahui adanya potensi perbaikan

24.

Di bawah ini yang merupakan pernyataan yang tepat mengenai principal component analysis (PCA) yaitu

a)

Terdapat hyperparameter berupa number of components yang mengatur jumlah input fitur yang dimasukkan

b)

Hasil penerapan PCA terhadap sebuah dataset dapat digunakan untuk melakukan eksplorasi lebih lanjut semisal melakukan klasifikasi

c)

Terdapat risiko kehilangan informasi ketika menerapkan PCA pada sebuah dataset

d)

PCA mengurangi jumlah dimensi data dengan menghapus feature yang kurang relevan terhadap label

25.

Dampak dari pengaturan hyperparameter epsilon atau min_samples pada DBSCAN yang benar yaitu:

a)

Meningkatkan epsilon akan menghasilkan lebih banyak cluster dan mengurangi noise dalam data.

b)

Meningkatkan min_samples akan membuat model lebih sensitif terhadap outlier dan mengurangi jumlah cluster.

c)

Meningkatkan epsilon akan mengurangi jumlah data yang dianggap sebagai noise, tetapi dapat mengurangi detail cluster.

d)

Meningkatkan min_samples akan meningkatkan jumlah cluster yang terbentuk dan mengurangi kompleksitas model.

26.

Teknik elbow method pada K-Means Clustering dapat digunakan untuk mengetahui, kecuali:

a)

Jumlah optimal cluster yang harus digunakan dalam model

b)

Kualitas clustering berdasarkan nilai inertia atau within-cluster sum of squares

c)

Jumlah total data yang harus digunakan dalam clustering

d)

semua benar

27.

Apabila sebuah ARIMA model menggunakan satu level differencing dan dua observasi lag sebagai predictor, maka parameter yang digunakan adalah

a)

ARIMA(0,1,0)

b)

ARIMA(1,2,0)

c)

ARIMA(2,1,0)

d)

ARIMA(0,1,2)

28.

Kata yang memiliki bobot tf-idf terbesar pada dokumen ketiga adalah

a)

business

b)

money

c)

principal

d)

system

29.

Apabila tokenization dilakukan menggunakan bi-gram (n=2 dan n_min = 2), maka hasil yang diperoleh dari teks berikut:

a)

send letter, letter sister, sister no, no receive, receive due, due weather

b)

send letter sister, letter sister no, sister no receive, no receive due, receive due weather

c)

send letter sister no, letter sister no receive, sister no receive due, no receive due weather

d)

send letter, letter sister, sister no, no receive, receive due, due weather, send letter sister no, letter sister no receive

30.

Pada user-based collaborative filtering, pemberian rekomendasi dilakukan dengan

a)

Memberi rekomendasi produk P kepada User U yang menggunakan produk P', di mana produk P’ memiliki user U’ yang juga merupakan pengguna produk P

b)

Mencari produk P yang memiliki jumlah user U terbanyak, sehingga P akan direkomendasi ke semua user U’ yang belum menggunakannya

c)

Mencari produk P yang memiliki jumlah produk P’ yang mirip dengannya paling banyak, sehingga P akan direkomendasikan ke semua user U’ yang belum menggunakannya

d)

mencari produk P yang belum pernah digunakan oleh user U, namun telah digunakan oleh user U’ yang mirip dengan U, sehingga P akan direkomendasikan kepada U

31.

Di bawah ini, yang merupakan kelemahan dalam penerapan model-based recommender system adalah

a)

Data yang dibutuhkan cenderung lebih sedikit

b)

Similarity measure antar item menjadi bias

c)

Sulit untuk merekomendasikan item yang belum pernah memperoleh rating

d)

Sulit untuk mengeksplor interest baru dari seorang user

32.

Di bawah ini, manakah pernyataan yang paling tepat mengenai tingkat pemahaman dan penggunaan data?

a)

Data aware adalah individu atau organisasi yang sepenuhnya mengandalkan intuisi dan tidak mempertimbangkan data sama sekali.

b)

Data driven adalah individu atau organisasi yang menggunakan data tetapi tidak memahami cara menginterpretasikannya.

c)

Data savvy adalah individu atau organisasi yang telah mengautomasi penggunaan data dalam pengambilan keputusan.

d)

Data driven adalah individu atau organisasi yang telah mengautomasi proses pengambilan keputusan berdasarkan data yang tersedia.

33.

Di bawah ini, yang merupakan contoh machine learning yang termasuk explainable machine learning model adalah

a)

DBSCAN

b)

Agglomerative Clustering

c)

Logistic Regression

d)

Decision Tree

34.

Di bawah ini, yang merupakan business question yang bersifat inference yaitu, kecuali

a)

Berapa banyak pelanggan yang melakukan pembelian di bulan ini?

b)

Apakah kita dapat memprediksi pelanggan yang akan melakukan pembelian ulang?

c)

Apa saja produk yang paling banyak dibeli oleh pelanggan?

d)

Siapa saja pelanggan yang melakukan transaksi di atas Rp1.000.000?

35.

Berikut metrics untuk regresi

a)

Recall

b)

Precision

c)

ROC AUC

d)

Semua salah