wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

kuis konversi data mining

Total questions: 80

Worksheet time: 40mins

Name
Class
Date
1.
Berikut perbedaan dari metode Supervised Learning dengan Unsupervised Learning
a)
Supervised memiliki kolom berfungsi label; Unsupervised memiliki kolom berfungsi target
b)
Supervised menggunakan data berlabel dan tidak; Unsupervised menggunakan data tidak berlabel
c)
Supervised memiliki kolom berfungsi target; Unsupervised tidak memiliki kolom seperti itu
d)
Tidak ada jawaban
2.
Unsupervised Learning menggunakan algoritma yang mencari pola dari seluruh variabel atau atribut. Cara pengelompokkan biasanya menggunakan nilai target.
a)
Salah
b)
Benar
3.
Dalam membangun suatu model klasifikasi digunakan data pelatihan yang akan diterapkan pada data uji.
a)
Salah
b)
Benar
4.
Tahapan klasifikasi dilakukan menggunakan tahapan yang sama dengan tahapan CRISP DM, hanya berbeda pada tahapan evaluasi.
a)
Salah
b)
Benar
5.
Pada tahapan evaluasi, besar nilai accuracy lebih dipercaya dibanding nilai AUC
a)
Salah
b)
Benar
6.
Jumlah yang diprediksi lancar namun kenyataannya macet
a)
True positive
b)
False positive
c)
True negative
d)
False negative
7.
Task berikut merupakan task yang menggunakan metode Supervised
a)
Estimasi
b)
Klasifikasi
c)
Forecasting
d)
Benar semua
e)
Salah semua
8.
Pembagian data memengaruhi seberapa baik performa suatu model dalam memprediksi kelas
a)
Salah
b)
Benar
9.
Confusion Matrix tidak bias digunakan untuk data yang tidak imbang
a)
Salah
b)
Benar
10.
Hasil Confusion Matrix dapat dilihat nilai akurasi dan jumlah tiap prediksi
a)
Salah
b)
Benar
11.
Pemilihan algoritma terbaik dengan melihat nilai Accuracy dilakukan jika dataset memiliki jumlah False Negatif dan False Positif yang simetrik
a)
Salah
b)
Benar
12.
Metrik evaluasi yang digunakan untuk memberikan bobot lebih pada Precision / Recall
a)
F1 Score
b)
F Beta Score
13.
Pengubahan parameter Machine Learning secara terus menerus untuk menemukan parameter terbaik disebut Develop
a)
Salah
b)
Benar
14.
Model yang overfit / underfit dapat dipengaruhi dari jumlah K yang digunakan
a)
Salah
b)
Benar
15.
Metode yang cenderung menghasilkan model yang overfit pada data training disebut
a)
Stratified CV
b)
Leave-one-out CV
c)
Nested CV
d)
Holdout
16.
Developing set dapat digunakan untuk uji model karena data di dalamnya bersifat bias
a)
Salah
b)
Benar
17.
Pada beberapa kasus, outlier dapat memberikan informasi yang bermanfaat sehingga tidak perlu dihapus
a)
Salah
b)
Benar
18.
Noise juga tidak perlu dihapus dari data
a)
salah
b)
Benar
19.
Model klasifikasi yang memiliki error generalisasi yang tinggi namun error training yang rendah termasuk dalam model klasifikasi yang baik
a)
Salah
b)
Benar
20.
Ketika model terlalu kompleks dapat menyebabkan error generalisasi yang tinggi
a)
Salah
b)
Benar
21.
Akurasi dalam confusion matrix digunakan untuk mendeteksi overfit saja
a)
Salah
b)
Benar
22.
Pernyataan berikut ini yang benar mengenai deteksi kelas yang tidak seimbang (imbalance class)
a)
Cek sebaran data pada setiap kelas pada tahap data understanding
b)
Cek sebaran data pada tiap kelas saat tahap evaluasi model
c)
Cek data apa saja yang akan diproses pada tahap business understanding
d)
Pemilihan fitur dilakukan untuk deteksi imbalance class
e)
Imbalance class tidak dapat dideteksi pada tahap awal
23.
Hal-hal yang dapat dilakukan untuk mengatasi kelas tidak seimbang (imbalance class) adalah sebagai berikut, kecuali ...
a)
Tambah data baru pada kelas mayoritas
b)
Ganti machine learning yang digunakan untuk membuat model
c)
Lakukan resampling
d)
Ganti metrik pengukuran
e)
Berikan bobot lebih besar pada data di kelas minoritas
24.
Kelas mayor tidak dapat diprediksi ketika menggunakan data yang tidak seimbang
a)
Salah
b)
Benar
25.
Pengecekan varians kelas mayoritas dilakukan untuk penentuan resampling
a)
Salah
b)
Benar
26.
Algoritma yang memiliki performa yang baik dalam menangani data yang tidak seimbang adalah
a)
Decision Tree
b)
KNN
c)
Random Forest
d)
Naive Bayes
e)
Tidak ada jawaban benar
27.
Berbeda dengan klasifikasi yang merupakan task yang bersifat deskripsi, cluster analysis (analisis klaster) bersifat prediksi.
a)
Salah
b)
Benar
28.
Dalam clustering terdapat jarak inter-cluster dimana menunjukkan seberapa jauh antar obyek pada kluster yang berbeda.
a)
Salah
b)
Benar
29.
Clustering merupakan suatu algoritma yang digunakan untuk mencari pola dari atribut yang ada berdasarkan kolom target.
a)
Benar
b)
Salah
30.
Pendapat subjektif dalam membuat kelompok cluster membantu dalam pemilihan kelompok yang variatif.
a)
Salah
b)
Benar
31.
Visualisasi grafik dengan diagram kartesius digunakan untuk mengecek klaster dengan jumlah atribut yang melimpah.
a)
Salah
b)
Benar
32.
Saat ukuran antar cluster memiliki cukup kesamaan, maka cocok untuk menggunakan algoritma K-means.
a)
Salah
b)
Benar
33.
Tipe clustering yang tidak akan mungkin mengalami overlap / sangat terpisah adalah
a)
Density-based
b)
Conceptual cluster
c)
Well-separated cluster
d)
Contiguous cluster
34.
Iterasi berhenti saat data didalam klaster tidak berubah-ubah lagi meskipun centroid masih berpinda-pindah.
a)
Salah
b)
Benar
35.
Perbedaan penentuan klaster lebih dari dua atribut hanya pada bagian visualisasi klaster dan penentuan jumlah K.
a)
Salah
b)
Benar
36.
Cara menentukan K pada K-means clustering dapat dilakukan dengan metode sebagai berikut, kecuali
a)
The elbow method
b)
Cross validation score method
c)
Silhoutte method
d)
Gap statistic
37.
Metode ini melakukan pendekatan rata-rata nilai untuk menduga kualitas dari klaster yang terbentuk. Semakin tinggi nilai rata-rata tiap jumlah klasternya nya maka akan semakin baik.
a)
Cross validation score method
b)
Gap statistic
c)
Silhoutte method
d)
The elbow method
38.
Contoh penerapan clustering yang paling tepat ada pada studi kasus
a)
Pengklasteran karyawan berdasarkan yang paling lama bekerja untuk melihat siapa yang layak diberi bonus penghargaan kinerja
b)
Pengklasteran income customer untuk memprediksi jumlah belanja customer pada toko
c)
Pengklasteran income dan jumlah belanja customer untuk mendeskripsikan perilaku customer
d)
Tidak ada jawaban yang benar
39.
Metode ini digunakan untuk menghasilkan informasi dalam menentukan jumlah cluster terbaik dengan cara melihat persentase hasil perbandingan antara jumlah cluster yang akan membentuk siku pada suatu titik.
a)
Gap statistic
b)
Cross validation score method
c)
Silhoutte method
d)
The elbow method
40.
Yang tidak benar mengenai Partitional Clustering dan Hierarchical Clustering adalah
a)
Partitional Clustering mengelompokkan data yang mirip dalam hirarki yang sama dan yang tidak mirip di hirarki yang agak jauh
b)
Hierarchical Clustering mengelompokkan data yang mirip dalam hirarki yang sama dan yang tidak mirip di hirarki yang agak jauh
c)
Partitional Clustering membagi objek data menjadi subset yang tidak tumpang tindih (cluster) sehingga setiap objek data berada tepat dalam satu subset
d)
Hierarchical Clustering dapat divisualisasikan sebagai dendogram
41.
Langkah yang paling tepat dalam melakukan clustering
a)
Data preparation, Defening the optimal number of cluster, Access clustering tendency, Computing cluster analysis, Validating cluster analysis
b)
Access clustering tendency, Data preparation, Defening the optimal number of cluster, Computing cluster analysis, Validating cluster analysis
c)
Data preparation, Computing cluster analysis, Defening the optimal number of cluster, Access clustering tendency, Validating cluster analysis
d)
Data preparation, Access clustering tendency, Defening the optimal number of cluster, Computing cluster analysis, Validating cluster analysis
42.
Sum of Squared Error (SSE) merupakan salah satu alat untuk mengukur validitias cluster pada tahap Computing cluster analysis
a)
Benar
b)
Salah
43.
Metode ini menyediakan prosedur statistik untuk memperkirakan jumlah cluster yang optimal. Metode ini adalah
a)
Cross validation score method
b)
Gap statistic
c)
Silhoutte method
d)
The elbow method
44.
Gap Statistic merupakan metode yang paling canggil dibandingkan metode Elbow dan metode Silhoutte
a)
Benar
b)
Salah
45.
Clustering membutuhkan kelas target/label untuk menentukan jumlah klaster
a)
Benar
b)
Salah
46.
Clustering merupakan unsupervised learning
a)
Salah
b)
Benar
47.
Aturan asosiasi dilakukan untuk mengidentifikasi keterkaitan item satu sama lain yang terjadi baik secara bersamaan ataupun tidak
a)
Salah
b)
Benar
48.
Antecedent dalam asosiasi dapat berjumlah 1 atau lebih item
a)
Salah
b)
Benar
49.
Aturan asosiasi dapat digunakan untuk hal berikut, kecuali
a)
Churn analysis
b)
Medical diagnosis
c)
Selective Marketing
d)
Market analysis
e)
Tidak ada jawaban
50.
Item kombinasi dari anteseden disebut consequent
a)
Salah
b)
Benar
51.
Besar minsup berpengaruh dalam menentukan itemset
a)
Salah
b)
Benar
52.
Data yang digunakan untuk aturan asosiasi adalah data yang berisi kumpulan item
a)
Salah
b)
Benar
53.
Ketika nilai support item lebih besar sama dengan dari nilai minsup, maka item digunakan untuk asosiasi
a)
Salah
b)
Benar
54.
Nilai minsup biasanya ditentukan oleh user
a)
Salah
b)
Benar
55.
Algoritma apriori pada umumnya digunakan untuk
a)
Mengklasifikasikan data
b)
Market Basket Analisis
c)
Memprediksi data penjualan
d)
Estimasi data penjualan pada periode berikutnya
56.
Algoritma lain yang dapat digunakan untuk mengatasi kelemahan dari apriori adalah ?
a)
C.45
b)
Naive Bayes
c)
K-NN
d)
FP-Growth
57.
Item set adalah
a)
Himpunan item atau item-item pada himpunan X yang muncul bersama-sama
b)
Jumlah unsur yang terdapat pada suatu Himpunan
c)
Item set yang terdiri dari item yang ada pada himpunan X yang muncul bersama
d)
Item set yang bersifat 2 unsur
58.
Penting atau tidaknya suatu aturan asosiasi dapat diketahui dengan dua parameter yaitu ?
a)
Support dan Dataset
b)
Support dan Value
c)
Support dan Confidence
d)
Confidence dan Dataset
59.
Contoh penerapan assosiation data mining
a)
Program untuk merekomendasikan barang-barang lain kepada pembeli pada saat pembeli melakukan pencarian di website
b)
Mengembangkan aplikasi sesuai dengan barang yang sering dicari oleh konsumen
c)
Mengembangkan program untuk mencari barang yang paling sedikit untuk dibeli
d)
Mengembangkan program untuk mencari barang yang paling banyak dibeli
60.
Yang bukan merupakan langkah kerja algoritma apriori
a)
Menentukan minimum support
b)
Tetapkan nilai k-itemset dari support
c)
Tentukan label dari data
d)
Iterasi 1 : hitung item-item dari support
61.
Metric yang tidak digunakan dalam aturan asosiasi adalah
a)
Conviction
b)
Prediction
c)
Leverage
d)
Lift
62.
ECLAT merupakan salah satu metrics association rules
a)
Benar
b)
Salah
63.
Berikut ini, manakah yang bukan merupakan contoh penerapan dari algoritma asosiasi
a)
Meletakkan barang-barang yang sering dibeli bersamaan dengan posisi berdekatan agar mudah dijangkau
b)
Prediksi jumlah stok yang harus ada di suatu toko/swalayan
c)
Rekomendasi stok barang yang tidak boleh habis/kosong pada waktu tertentu
64.
"Seorang konsumen yang membeli roti dan mentega punya kemungkinan untuk juga membeli susu." merupakan salah satu hasil dari penggunaan aturan asosiasi
a)
Salah
b)
Benar
65.
Jika nilai metric lift ==1, maka
a)
Korelasi Positif
b)
Korelasi Negatif
c)
Tidak ada kolerasi
d)
Tidak ada jawaban yang benar
66.
Karakteristik dan perilaku konsumen yang kemungkinan akan pindah ke perusahaan lain merupakan penjelasan dari
a)
Market basket analysis
b)
Medical diagnosis
c)
Selective Marketing
d)
Churn analysis
67.
Penyiapan data merupakan ...
a)
Tahap yang dilakukan setelah data modelling
b)
Tahap untuk membersihkan, memilih, hingga mengubah bentuk data menjadi data yang siap untuk diproses lebih lanjut
c)
Tahap awal untuk mengumpulkan data yang dibutuhkan
d)
Semua jawaban benar
68.
Skenario yang dilakukan pada tahap penyiapan data dilakukan tanpa mempertimbangkan kondisi data namun menyesuaikan tujuan akhir
a)
Salah
b)
Benar
69.
Penanganan missing value dengan cara menghapus atribut dan/atau instance memiliki resiko tinggi
a)
Salah
b)
Benar
70.
Penanganan missing value dengan cara imputation dapat dilakukan dengan mudah karena tidak mempertimbangkan jenis atribut
a)
Salah
b)
Benar
71.
Apakah menurunkan data dari suatu atribut ke atribut baru perlu dilakukan?
a)
Ya, karena suatu atribut dapat menghasilkan informasi tambahan yang bermanfaat untuk memperkaya insight dari data
b)
Tidak, karena beresiko menambah dimensi yang dapat berakibat negatif terhadap pemodelan data
c)
Tidak, karena penambahan data ditengah-tengah proses hanya akan membuat data bias
d)
Ya, karena atribut tambahan tidak memberikan beban tambahan
e)
Ya, karena data yang diturunkan sia-sia jika tidak disimpan dalam atribut baru
72.
Berikut ini manakah pernyataan yang salah dari encoding?
a)
Dilakukan karena atribut tidak dikenali oleh machine leraning
b)
Dilakukan untuk mengubah numerik menjadi alphanumeric
c)
Merupakan salah satu metode untuk tranformasi data
d)
Pada implementasinya, dilakukan dengan mempertimbangkan jenis atribut
e)
Tidak ada jawaban
73.
Korelasi merupakan salah satu metode yang digunakan untuk memilih fitur/atribut
a)
Salah
b)
Benar
74.
Berikut ini merupakan alasan dilakukannya pemilihan fitur/atribut
a)
Fitur/atribut yang tidak relevan akan memberikan dampak positif terhadap hasil
b)
Dimensi yang tinggi merupakan hal yang positif terhadap hasil karena kaya informasi
c)
Cukup digunakan fitur yang relevan terhadap tujuan untuk dapat menghasilkan hasil yang baik
d)
Tingginya dimensi data akan menghemat cost pemodelan data
e)
Semua jawaban benar
75.
Berikut ini manakah metode yang dapat digunakan untuk pemilihan atribut/fitur?
a)
PCA
b)
Korelasi
c)
Probability value dan chi square test
d)
Semua jawaban benar
76.
Korelasi merupakan teknik untuk melihat hubungan antar variabel/atribut
a)
Salah
b)
Benar
77.
Metode korelasi yang menjadi default dari library Pandas adalah ...
a)
Pearson
b)
Spearman
c)
Kendall
d)
Seaborn
e)
Tidak ada jawaban
78.
Jika nilai korelasi X dan Y bernilai negatif, maka ...
a)
Nilai korelasinya adalah > 0
b)
Jika nilai X naik maka nilai Y turun
c)
Jika nilai X naik maka nilai Y naik
d)
Nilai korelasinya stagnan
e)
X dan Y tidak saling memberikan dampak
79.
Jika nilai korelasi X dan Y bernilai positif, maka ...
a)
Nilai korelasinya adalah < 0
b)
Jika nilai X naik maka nilai Y turun
c)
Jika nilai X turun maka nilai Y turun
d)
Nilai korelasinya stagnan
e)
X dan Y tidak saling memberikan dampak
80.
Nilai rentang korelasi adalah ...
a)
-1 hingga 1
b)
0 hingga 1
c)
-1 hingga 0
d)
Tidak ada rentangnya, bisa bernilai positif atau negatif
e)
Asalkan tidak bernilai 0