NEW
Font size
WorksheetsModule 3 Quiz Simulation
Total questions: 35
Worksheet time: 1hrs 7mins
Di bawah ini yang merupakan model supervised learning adalah...
K-Means, K Nearest Neighbours, Decision Tree
PCA, K-Means, DBScan
Logistic Regression, Decision Tree, DBScan
Logistic Regression, Linear Regression, K Nearest Neighbors
Dibawah ini yang merupakan model clustering yaitu...
K-Means, K Nearest Neighbors, Decision Tree
PCA, K-Means, DBScan
Logistic Regression, Decision Tree, DBScan
Logistic Regression, Linear Regression, K Nearest Neighbors
K-Means, Agglomerative/Hierarchical, DBSCAN
Which statement is true?
Unsupervised Learning usually uses Classification
Supervised Learning usually uses Clustering
Linear Regression usually used for prediction
Supervised, Unsupervised, Regresion is the same thing
Unsupervised Learning usually uses Clustering
Jika kita memilih nilai parameter maximum depth = 13. Maka kesimpulan yang akan didapat yaitu ...
Model sudah cukup baik untuk digunakan
Model mengalami underfitting
Nilai training accuracy lebih tinggi daripada nilai testing accuracy
Model mengalami overfitting
Model yang dibuat masih terlalu sederhana
Untuk melakukan transformasi data dari Plot A menjadi Plot B menggunakan metode scaling..
MinMax Scaler
Standard Scaler
Robust Scaler
Tidak ada jawaban benar
Banyak kolom yang terbentuk dari proses One Hot Encoding di atas yaitu ...
6
9
10
4
Pada kolom merk mobil terdapat 20 kategori. Jika kita ingin melakukan encoding, metode yang paling tepat adalah
One Hot Encoding
Ordinal Encoding
Binary Encoding
Tidak ada jawaban yang benar
Pilih pernyataan yang paling tepat berkaitan dengan perubahan parameter pada DBSCAN
Nilai Epsilon tinggi & min_sample tinggi = Lebih banyak cluster, lebih sedikit noise
Nilai Epsilon rendah & min_sample tinggi = Lebih banyak cluster, lebih banyak noise
Nilai Epsilon rendah & min_sample rendah = Lebih sedikit cluster, lebih banyak noise
Nilai Epsilon tinggi & min_sample rendah = Lebih banyak cluster, lebih sedikit noise
Berdasarkan plot grafik diatas, banyak cluster terbaik untuk K Nearest Neighbors adalah ...
2
3
4
5
1. Training data is split into multiple samples with replacement (bootstrap sample)
2. Making a tree from each bootstrap sample
Based on those criteria, the suited model is...
Bagging
Stacking
Decision Tree
Boosting
Hybrid
Metode penanganan missing value paling tepat pada data numerik yang memiliki distribusi tidak normal adalah ...
Mean
Median
Modus
Standar Deviasi
Pada studi kasus klasifikasi sms spam. Jika kita asumsikan spam adalah positive class (1), maka persentase prediksi benar pada sms yang memang spam disebut ...
FPR
Recall
Accuracy
Specificity
Precision
Rumus dari precision adalah
y = [a] + [b][c] + [d]size
Jawaban yang tepat untuk mengisi bagian [b] adalah
0.0927
0.6689
0.1926
-347.99
105.9
You are part of a data science team that is working for a national fast-food chain. You create a simple report that shows trend: Customers who visit the store more often and buy smaller meals spend more than customers who visit less frequently and buy larger meals. What is the most likely diagram that your team created?
multiclass classification diagram
Barplot
classification report
linear regression and scatterplots
K-means cluster diagram
Your company wants to predict whether existing automotive insurance customers are more likely to buy homeowners insurance. It created a model to better predict the best customers contact about homeowners insurance, and the model had a low variance but high bias. What does that say about the data model?
It was consistently wrong.
It was consistently right.
It was inconsistently wrong.
It was equally right end wrong.
You want to identify global weather patterns that may have been affected by climate change. To do so, you want to use machine learning algorithms to find patterns that would otherwise be imperceptible to a human meteorologist. What is the place to start?
Find labeled data of sunny days so that the machine will learn to identify bad weather.
Create a training set of unusual patterns and ask the machine learning algorithms to classify them.
Use unsupervised learning have the machine look for anomalies in a massive weather database.
Create a training set of normal weather and have the machine look for similar patterns.
Asian user complains that your company's facial recognition model does not properly identify their facial expressions. What should you do?
Include Asian faces in your test data and retrain your model.
Retrain your model with smaller batch sizes.
Retrain your model with updated hyperparameter values.
Include Asian faces in your training data and retrain your model.
Hierarchical Clustering dan Boosting-Based model merupakan interpretable model
Benar
Salah
Berdasarkan tabel di atas, nilai precision nya adalah
0.7302
0.7667
0.6970
0.8300
"Which customer is at risk to leave our service"
This statement includes a prediction statement
True
False
Companies that already have a "Data-Aware Mindset" have a higher Business Value than companies that have a "Data-Savvy Mindset".
True
False
Saat jumlah data pada node setelah melakukan splitting kurang dari ketentuan, maka proses splitting pada Decision Tree akan berhenti
Benar
Salah
Teknik yang melibatkan kombinasi data dari prediksi beberapa model, yang digunakan sebagai fitur untuk menghasilkan model baru dan membuat prediksi. Model yang digabungkan dikenal sebagai base learner, dan prediksinya yang digunakan sebagai fitur tambahan untuk melatih model akhir dikenal sebagai meta learner.
Stacking
Bagging
Boosting
Random Forest
Teknik Principal Component Analysis (PCA) mengurangi banyak fitur dengan cara meringkas seluruh fitur yang ada menjadi beberapa komponen yang ditentukan.
Benar
Salah
Jika kita memilih nilai parameter maximum depth = 8. Maka kesimpulan yang akan didapat yaitu ...
Nilai training accuracy lebih kecil daripada nilai testing accuracy
Model sudah mencapai generalisasi
Model yang dibuat masih terlalu sederhana
Model mengalami underfitting
Model mengalami overfitting
(1) Semakin besar nilai parameter min_samples, semakin dalam tree yang dihasilkan.
(2) Semakin besar nilai parameter max_depth, semakin besar kemungkinan untuk terjadi underfitting.
(3) Decision Tree hanya dapat digunakan untuk klasifikasi.
(4) Decision Tree merupakan salah satu interpretable model.
(5) Decision Tree merupakan salah satu model parametrik.
Pilih pernyataan mana saja yang benar !
1
2
3
4
5
Bagian yang kemungkinan dapat menyebabkan masalah saat pembuatan model yaitu pada baris ke -
10
12
15
18
Variabel yang saling berkorelasi pasti saling mempengaruhi
Benar
Salah
Kita dapat menggunakan Decision Tree untuk mengelompokan data
Benar
Salah
Targetted marketing, Recommended Systems, and Customer Segmentation are applications in ...
Unsupervised Learning: Clustering
Unsupervised Learning: Dimensionality Reduction
Supervised Learning: Classification
Supervised Learning: Regression
Supervised Learning: Clustering
Terdapat data kolom hewan_peliharaan dengan unique value terdiri dari: ayam, ikan, kucing, anjing dan burung. Jumlah kolom yang akan digenerete menggunakan One Hot Encoder sebaiknya sebanyak
5 kolom
3 kolom
4 kolom
6 kolom
Jumlah kombinasi nilai hyperparameter yang akan dicoba adalah
15
24
60
30
Shaquille O'Neal (Big Shaq) pindah ke Phoenix pada tahun 2008 karena pertukaran pemain NBA dan memilih tinggal di apartemen dekat markas Phoenix Suns. Apartemen barunya kosong tanpa perabot, jadi dia pergi ke Walmart jam 2 pagi untuk membeli perlengkapan rumah seperti TV, kulkas, sofa, dan lainnya. Total belanjaannya mencapai hampir $70.000 dan dia mencoba membayar dengan kartu kredit. Pembayaran awalnya ditolak karena dicurigai sebagai penipuan, namun setelah Big Shaq mengonfirmasi, bank membuka blokir kartunya.
Dari cerita Big Shaq di atas, jika transaksi penipuan (fraud) ditandai sebagai kelas positif, maka metrik pada model Machine Learning yang tepat digunakan untuk meminimalisir kasus tersebut adalah
PR AUC
Sensitivity
Precision
F2-Score
Recall
Logistic Regression adalah salah satu model parametrik yang memiliki keunggulan yaitu kemudahannya melakukan interpretasi hubungan fitur terhadap target. Di bawah ini yang merupakan uji simultan untuk menginterpretasikan hubungan signifikansi fitur dengan target pada Logistic Regression adalah
ANOVA F Test
Wilcoxon Test
Wald Test
Shapiro-Wilk Test
Log-Likelihood Ratio Test
