wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Module 3 Quiz Simulation

Total questions: 35

Worksheet time: 1hrs 7mins

Name
Class
Date
1.

Di bawah ini yang merupakan model supervised learning adalah...

a)

K-Means, K Nearest Neighbours, Decision Tree

b)

PCA, K-Means, DBScan

c)

Logistic Regression, Decision Tree, DBScan

d)

Logistic Regression, Linear Regression, K Nearest Neighbors

2.

Dibawah ini yang merupakan model clustering yaitu...

a)

K-Means, K Nearest Neighbors, Decision Tree

b)

PCA, K-Means, DBScan

c)

Logistic Regression, Decision Tree, DBScan

d)

Logistic Regression, Linear Regression, K Nearest Neighbors

e)

K-Means, Agglomerative/Hierarchical, DBSCAN

3.

Which statement is true?

a)

Unsupervised Learning usually uses Classification

b)

Supervised Learning usually uses Clustering

c)

Linear Regression usually used for prediction

d)

Supervised, Unsupervised, Regresion is the same thing

e)

Unsupervised Learning usually uses Clustering

4.

Jika kita memilih nilai parameter maximum depth = 13. Maka kesimpulan yang akan didapat yaitu ...

a)

Model sudah cukup baik untuk digunakan

b)

Model mengalami underfitting

c)

Nilai training accuracy lebih tinggi daripada nilai testing accuracy

d)

Model mengalami overfitting

e)

Model yang dibuat masih terlalu sederhana

5.

Untuk melakukan transformasi data dari Plot A menjadi Plot B menggunakan metode scaling..

a)

MinMax Scaler

b)

Standard Scaler

c)

Robust Scaler

d)

Tidak ada jawaban benar

6.

Banyak kolom yang terbentuk dari proses One Hot Encoding di atas yaitu ...

a)

6

b)

9

c)

10

d)

4

7.

Pada kolom merk mobil terdapat 20 kategori. Jika kita ingin melakukan encoding, metode yang paling tepat adalah

a)

One Hot Encoding

b)

Ordinal Encoding

c)

Binary Encoding

d)

Tidak ada jawaban yang benar

8.

Pilih pernyataan yang paling tepat berkaitan dengan perubahan parameter pada DBSCAN

a)

Nilai Epsilon tinggi & min_sample tinggi = Lebih banyak cluster, lebih sedikit noise

b)

Nilai Epsilon rendah & min_sample tinggi = Lebih banyak cluster, lebih banyak noise

c)

Nilai Epsilon rendah & min_sample rendah = Lebih sedikit cluster, lebih banyak noise

d)

Nilai Epsilon tinggi & min_sample rendah = Lebih banyak cluster, lebih sedikit noise

9.

Berdasarkan plot grafik diatas, banyak cluster terbaik untuk K Nearest Neighbors adalah ...

a)

2

b)

3

c)

4

d)

5

10.

1. Training data is split into multiple samples with replacement (bootstrap sample)

2. Making a tree from each bootstrap sample


Based on those criteria, the suited model is...

a)

Bagging

b)

Stacking

c)

Decision Tree

d)

Boosting

e)

Hybrid

11.

Metode penanganan missing value paling tepat pada data numerik yang memiliki distribusi tidak normal adalah ...

a)

Mean

b)

Median

c)

Modus

d)

Standar Deviasi

12.

Pada studi kasus klasifikasi sms spam. Jika kita asumsikan spam adalah positive class (1), maka persentase prediksi benar pada sms yang memang spam disebut ...

a)

FPR

b)

Recall

c)

Accuracy

d)

Specificity

e)

Precision

13.

Rumus dari precision adalah

a)

b)

c)

14.

y = [a] + [b][c] + [d]size

Jawaban yang tepat untuk mengisi bagian [b] adalah

a)

0.0927

b)

0.6689

c)

0.1926

d)

-347.99

e)

105.9

15.

You are part of a data science team that is working for a national fast-food chain. You create a simple report that shows trend: Customers who visit the store more often and buy smaller meals spend more than customers who visit less frequently and buy larger meals. What is the most likely diagram that your team created?

a)

multiclass classification diagram

b)

Barplot

c)

classification report

d)

linear regression and scatterplots

e)

K-means cluster diagram

16.

Your company wants to predict whether existing automotive insurance customers are more likely to buy homeowners insurance. It created a model to better predict the best customers contact about homeowners insurance, and the model had a low variance but high bias. What does that say about the data model?

a)

It was consistently wrong.

b)

It was consistently right.

c)

It was inconsistently wrong.

d)

It was equally right end wrong.

17.

You want to identify global weather patterns that may have been affected by climate change. To do so, you want to use machine learning algorithms to find patterns that would otherwise be imperceptible to a human meteorologist. What is the place to start?

a)


Find labeled data of sunny days so that the machine will learn to identify bad weather.

b)


Create a training set of unusual patterns and ask the machine learning algorithms to classify them.

c)

Use unsupervised learning have the machine look for anomalies in a massive weather database.

d)

Create a training set of normal weather and have the machine look for similar patterns.

18.

Asian user complains that your company's facial recognition model does not properly identify their facial expressions. What should you do?

a)

Include Asian faces in your test data and retrain your model.

b)

Retrain your model with smaller batch sizes.

c)

Retrain your model with updated hyperparameter values.

d)

Include Asian faces in your training data and retrain your model.

19.

Hierarchical Clustering dan Boosting-Based model merupakan interpretable model

a)

Benar

b)

Salah

20.

Berdasarkan tabel di atas, nilai precision nya adalah

a)

0.7302

b)

0.7667

c)

0.6970

d)

0.8300

21.

"Which customer is at risk to leave our service"

This statement includes a prediction statement

a)

True

b)

False

22.

Companies that already have a "Data-Aware Mindset" have a higher Business Value than companies that have a "Data-Savvy Mindset".

a)

True

b)

False

23.

Saat jumlah data pada node setelah melakukan splitting kurang dari ketentuan, maka proses splitting pada Decision Tree akan berhenti

a)

Benar

b)

Salah

24.

Teknik yang melibatkan kombinasi data dari prediksi beberapa model, yang digunakan sebagai fitur untuk menghasilkan model baru dan membuat prediksi. Model yang digabungkan dikenal sebagai base learner, dan prediksinya yang digunakan sebagai fitur tambahan untuk melatih model akhir dikenal sebagai meta learner.

a)

Stacking

b)

Bagging

c)

Boosting

d)

Random Forest

25.

Teknik Principal Component Analysis (PCA) mengurangi banyak fitur dengan cara meringkas seluruh fitur yang ada menjadi beberapa komponen yang ditentukan.

a)

Benar

b)

Salah

26.

Jika kita memilih nilai parameter maximum depth = 8. Maka kesimpulan yang akan didapat yaitu ...

a)


Nilai training accuracy lebih kecil daripada nilai testing accuracy

b)

Model sudah mencapai generalisasi

c)

Model yang dibuat masih terlalu sederhana

d)

Model mengalami underfitting

e)


Model mengalami overfitting

27.

(1) Semakin besar nilai parameter min_samples, semakin dalam tree yang dihasilkan.

(2) Semakin besar nilai parameter max_depth, semakin besar kemungkinan untuk terjadi underfitting.

(3) Decision Tree hanya dapat digunakan untuk klasifikasi.

(4) Decision Tree merupakan salah satu interpretable model.

(5) Decision Tree merupakan salah satu model parametrik.

Pilih pernyataan mana saja yang benar !

a)

1

b)

2

c)

3

d)

4

e)

5

28.

Bagian yang kemungkinan dapat menyebabkan masalah saat pembuatan model yaitu pada baris ke -

a)

10

b)

12

c)

15

d)

18

29.

Variabel yang saling berkorelasi pasti saling mempengaruhi

a)

Benar

b)

Salah

30.

Kita dapat menggunakan Decision Tree untuk mengelompokan data

a)

Benar

b)

Salah

31.

Targetted marketing, Recommended Systems, and Customer Segmentation are applications in ...

a)

Unsupervised Learning: Clustering

b)

Unsupervised Learning: Dimensionality Reduction

c)

Supervised Learning: Classification

d)

Supervised Learning: Regression

e)

Supervised Learning: Clustering

32.

Terdapat data kolom hewan_peliharaan dengan unique value terdiri dari: ayam, ikan, kucing, anjing dan burung. Jumlah kolom yang akan digenerete menggunakan One Hot Encoder sebaiknya sebanyak

a)

5 kolom

b)

3 kolom

c)

4 kolom

d)

6 kolom

33.

Jumlah kombinasi nilai hyperparameter yang akan dicoba adalah

a)

15

b)

24

c)

60

d)

30

34.

Shaquille O'Neal (Big Shaq) pindah ke Phoenix pada tahun 2008 karena pertukaran pemain NBA dan memilih tinggal di apartemen dekat markas Phoenix Suns. Apartemen barunya kosong tanpa perabot, jadi dia pergi ke Walmart jam 2 pagi untuk membeli perlengkapan rumah seperti TV, kulkas, sofa, dan lainnya. Total belanjaannya mencapai hampir $70.000 dan dia mencoba membayar dengan kartu kredit. Pembayaran awalnya ditolak karena dicurigai sebagai penipuan, namun setelah Big Shaq mengonfirmasi, bank membuka blokir kartunya.

Dari cerita Big Shaq di atas, jika transaksi penipuan (fraud) ditandai sebagai kelas positif, maka metrik pada model Machine Learning yang tepat digunakan untuk meminimalisir kasus tersebut adalah

a)

PR AUC

b)

Sensitivity

c)

Precision

d)

F2-Score

e)

Recall

35.

Logistic Regression adalah salah satu model parametrik yang memiliki keunggulan yaitu kemudahannya melakukan interpretasi hubungan fitur terhadap target. Di bawah ini yang merupakan uji simultan untuk menginterpretasikan hubungan signifikansi fitur dengan target pada Logistic Regression adalah

a)

ANOVA F Test

b)

Wilcoxon Test

c)

Wald Test

d)

Shapiro-Wilk Test

e)

Log-Likelihood Ratio Test