WorksheetsPractice Modul 3 Exam
Total questions: 20
Worksheet time: 40mins
Di bawah ini yang bukan merupakan model atau algoritma yang umum digunakan dalam supervised learning adalah
Logistic Regression
KMeans
Adaptive Boosting
Decision Tree
Linear Regression
Di bawah ini yang merupakan pernyataan yang kurang tepat mengenai principal component analysis (PCA) yaitu
PCA dapat mempermudah untuk tujuan visualisasi pada 2D atau 3D plot
Kekurangan dari penerapan PCA adalah adanya risiko kehilangan informasi dari data yang digunakan
PCA mengurangi jumlah dimensi data dengan menghapus feature yang korelasinya paling kecil terhadap target
Feature hasil penerapan PCA dapat digunakan untuk clustering
PCA dapat menangani multicollinearity
Pada metode clustering DBSCAN, Anda bisa mengatur hyperparameter epsilon dan min_samples. Pernyataan yang benar mengenai hal tersebut adalah
Memperbesar nilai epsilon akan menyebabkan semakin sedikit data point yang masuk sebagai cluster
Memperbesar nilai epsilon akan menyebabkan cluster yang terbentuk cenderung berukuran kecil-kecil
Memperbesar nilai min_samples akan menyebabkan semakin banyak data yang dianggap sebagai noise
Memperbesar nilai min_samples akan mempermudah bagi setiap data untuk menjadi core sample
Epsilon adalah jumlah minimum sample untuk menjadi core sample
Teknik elbow method pada K-Means Clustering dapat digunakan untuk mengetahui
Jumlah iterasi optimal
Jumlah kolom optimal
Letak centroid terbaik
Jumlah cluster optimal
Tidak ada yang benar
Berikut adalah evaluation metrics yang biasa digunakan untuk kasus klasifikasi, kecuali
Recall
F1 score
Accuracy
Precision
Mean Absolute Error
Di bawah ini, yang merupakan business question yang bersifat inference (EDA / analisis data / statistika) yaitu
Apakah kita dapat mendeteksi siapa saja customer yang akan melakukan churn?
Apakah kita dapat mengelompokkan customer berdasarkan segmentasinya?
Kota mana yang menghasilkan pendapatan paling besar?
Pelanggan mana saja yang baru mulai bertransaksi hari ini dan paling mungkin akan menjadi loyal customer?
Pelanggan mana saja yang bertransaksi hari ini dan terindikasi melakukan fraud?
Di bawah ini, yang merupakan kelemahan dalam penerapan model-based recommender system adalah
Memiliki keterbatasan dalam mengembangkan minat pengguna
Akan kesulitan ketika hendak merekomendasikan item-item baru yang belum ada ratingnya
Item dengan rating paling banyak akan kesulitan direkomendasikan
Metode ini memerlukan domain knowledge yang spesifik
Tidak ada yang benar
Di bawah ini yang merupakan strategi yang kurang tepat dalam mengatasi kasus imbalance class adalah
Melakukan oversampling
Melakukan undersampling
Mengumpulkan lebih banyak data pada minority class
Melakukan feature engineering
Menambah data pada majority class
Di antara beberapa contoh categorical variable di bawah ini, yang paling mungkin di-encode menggunakan teknik ordinal encoder yaitu
Jenis kelamin
Jenjang karir/Pangkat
Nama negara
Status merokok (ya/tidak)
Nama kota
Perhatikan tabel hasil training dan evaluation dari 3 kandidat model berikut ini. Pernyataan yang tepat mengenai tabel di atas adalah
Model no.3 mengalami overfitting
Model no.1 adalah model terbaik karena modelnya paling general/stabil
Model no.2 mengalami underfitting
Model no.1 kemungkinan dapat ditingkatkan performanya dengan menambah jumlah feature
Model no.2 kemungkinan dapat ditingkatkan performanya dengan menambah jumlah feature
Bagian yang paling mungkin menyebabkan masalah evaluasi model pada potongan kode di bawah ini terdapat pada
Pada baris ke-7, untuk membaca dataset seharusnya np.read_csv
Pada baris ke-15, proses splitting train set dan test set seharusnya sebelum model training
Pada baris ke-15, train_test_split seharusnya menggunakan parameter stratify=y
Pada baris ke-17, untuk prediksi seharusnya tree.predict(y_test)
Pada baris ke-18, mean_squared_error digunakan untuk evaluasi kasus regresi
Di bawah ini yang merupakan pernyataan yang pasti benar mengenai decision tree yaitu
Nilai parameter min_samples_split yang besar akan menghasilkan tree yang dalam/besar
Decision tree dapat digunakan untuk melakukan prediksi target klasifikasi dan regresi
Pada bagian bawah tree, nilai gini impurity cenderung lebih tinggi
Nilai parameter max_depth yang kecil akan menghasilkan jumlah node yang sedikit
Nilai parameter max_depth yang kecil akan menghasilkan jumlah node yang banyak
Fungsi calculate_metric pada kode di bawah ini akan menghitung sebuah evaluation metric yaitu
MSE
MAE
MAPE
RMSE
Accuracy
Misalkan Anda diminta untuk mengimplementasikan fraud detection system pada sebuah transaksi keuangan. Diberikan beberapa pernyataan berikut ini. Pernyataan yang kurang tepat adalah
3, 4
1, 2, 4
2, 4
2, 3
1, 4
Di antara beberapa contoh variabel di bawah ini, one-hot encoding paling perlu dihindari pada
jenis pekerjaan
jenjang pendidikan terakhir
nomor telepon
gender
marital status
Pada item-based collaborative filtering, pemberian rekomendasi dilakukan dengan
Memberi rekomendasi produk P kepada User U yang menggunakan produk P', di mana produk P’ memiliki user U’ yang juga merupakan pengguna produk P
Mencari produk P yang belum pernah digunakan oleh user U, namun telah digunakan oleh user U’ yang mirip dengan U, sehingga P akan direkomendasikan kepada U
Memberi rekomendasi produk P pada user U berdasarkan produk P’ yang mana content produk P paling serupa dengan produk P’
Mencari produk P yang memiliki jumlah user terbanyak, sehingga P akan direkomendasi ke semua user U’ yang belum menggunakannya
Tidak ada yang benar
Memprediksi "No Cancer" kepada orang yang memiliki "Cancer", mengakibatkan konsekuensi yang tinggi. Metrik apa yang tepat untuk membuat model?
F1 Score
Accuracy
Recall
Precision
RMSE
Fill the blank with proper method
extend
add
append
merge
join
When you have highly left-skewed data, which statement is possibly true?
Mean = Median
Median > Mean
Mean > Median
Mean > Mode
Mean = Mode
Sebutkan tipe dari supervised learning?
AI agent and environment
regression and classification
classification and AI agent
clustering and classification
None of the above
