WorksheetsKlasifikasi
Total questions: 10
Worksheet time: 5mins
Variabel yang nilainya ingin kita prediksi dalam klasifikasi adalah
Variabel Prediktor
Variabel Kontinu
Variabel Kelas (Class)
Variabel Independen
Pada Confusion Matrix, sel yang menunjukkan jumlah instance negatif yang diprediksi dengan benar sebagai negatif oleh model ...
True Positive (TP)
False Positive (FP)
False Negative (FN)
True Negative (TN)
Manakah dari algoritma berikut yang bukan merupakan algoritma klasifikasi
Decision Tree
K-Means Clustering
k-Nearest Neighbor
Naive Bayes
Teknik K-Fold Cross Validation bertujuan untuk
Mempercepat waktu pelatihan model.
Mengurangi varians dari estimasi kinerja model dengan menggunakan berbagai subset data untuk pelatihan dan validasi.
Menggantikan kebutuhan akan set data uji yang terpisah.
Hanya digunakan untuk dataset yang sangat kecil.
Dalam implementasi machine learning menggunakan scikit-learn, class manakah yang TIDAK digunakan untuk tujuan klasifikasi?
RandomForestClassifier
LogisticRegression
KMeans
SVC
Sebuah model klasifikasi terlalu kompleks dan secara sempurna mempelajari pola serta noise dalam data pelatihan, sehingga kinerjanya buruk pada data baru, dikenal sebagai
Underfitting
Overfitting
Cross-validation
Feature Engineering
Dalam scikit-learn, class manakah yang digunakan untuk mengimplementasikan Naive Bayes classifier yang cocok untuk fitur-fitur kontinu (numerik) yang diasumsikan berdistribusi Gaussian?
sklearn.naive_bayes.BernoulliNB
sklearn.naive_bayes.CategoricalNB
sklearn.naive_bayes.GaussianNB
sklearn.naive_bayes.MultinomialNB
Manakah dari model berikut yang bekerja dengan menghitung jarak antara data point untuk melakukan prediksi?
Naive Bayes
Decision Tree
Logistic Regression
K-Nearest Neighbor (KNN)
Mengapa kita membutuhkan set data uji (test set) yang terpisah?
Untuk melatih model lebih cepat
Untuk mengukur seberapa baik model bekerja pada data yang belum pernah dilihat
Untuk mengurangi jumlah data latih
Untuk memilih fitur yang paling penting
Proporsi pembagian data latih dan data uji yang umum digunakan adalah...
50-50
80-20 atau 70-30
90-10
95-5
