Font size
WorksheetsResponsi BDDM- ST168
Total questions: 50
Worksheet time: 50mins
Apa itu data mining?
Data mining adalah metode untuk menyimpan data dengan aman.
Data mining mengacu pada proses menghapus data yang tidak perlu.
Data mining adalah tindakan menciptakan data baru dari awal.
Data mining adalah proses menemukan pola dan pengetahuan dari sejumlah besar data.
Manakah yang merupakan teknik data mining yang dapat untuk memprediksi berapa harga mobil bekas berdasarkan tipe kendaraan, Tahun produksi, CC mobil
Clustering
Klasifikasi
Aturan Asosiasi
Regresi
Manakah yang bukan merupakan tujuan pengelompokan data dalam data mining?
Untuk memudahkan memvisualisasikan data dalam ruang dua dimensi.
Untuk mengidentifikasi pola dan hubungan.
Untuk membuat model regresi linier.
Untuk mengurangi ukuran dataset untuk analisis.
Pernyataan berikut manakah yang tepat dalam teknik Learning?
Supervised Learning adalah pendekatan pembelajaran mesin yang menggunakan data berlabel untuk melatih model agar membuat prediksi.
Supervised Learning adalah metode yang tidak memerlukan data untuk pelatihan.
Supervised Learning fokus pada pengelompokan data tanpa label.
Unsupervised Learning menggunakan data berlabel untuk melatih model.
Teknik Data mining manakah yang tepat di gunakan untuk memprediksi sebuah penyakit berdasarkan gejala-gejala
Klasifikasi
Regresi
Aturan Asosiasi
Sequence Discovery
Jelaskan istilah 'big data'.
Big data adalah istilah yang digunakan untuk data yang disimpan hanya dalam file fisik.
Big data adalah kumpulan data besar dan kompleks yang tidak dapat dikelola secara efektif oleh perangkat lunak pemrosesan data tradisional.
Big data hanya tentang volume data, mengabaikan variasi dan kecepatan.
Big data mengacu pada kumpulan data kecil dan sederhana yang dapat dikelola dengan mudah.
Apa itu "Veracity" dalam konteks big data?
Jumlah data yang besar
Kualitas dan keakuratan data
Variasi format data
Kecepatan akses data
Apa peran pra-pemrosesan data dalam penambangan data?
Pra-pemrosesan data hanya diperlukan untuk dataset besar.
Pra-pemrosesan data digunakan untuk memvisualisasikan data tanpa analisis.
Pra-pemrosesan data meningkatkan kualitas data dan mempersiapkannya untuk analisis yang efektif dalam penambangan data.
Pra-pemrosesan data menghilangkan kebutuhan untuk analisis data sama sekali.
Dalam algoritma KNN, apa yang dimaksud dengan 'K'?
Jumlah fitur dalam dataset
Jumlah tetangga terdekat yang dipertimbangkan
Jumlah cluster dalam data
Jumlah data latih
Apa yang dimaksud dengan variabel dependen dalam regresi?
Variabel yang diprediksi
Variabel yang mempengaruhi
Variabel yang tidak terukur
Variabel yang konstan
Berikut ini manakah yang termasuk dalam data cleaning adalah:
Menghapus semua data duplikat
Mengisi nilai kosong dengan rata-rata
Menghapus semua data yang tidak relevan
Menghapus outlier
Apa yang dimaksud dengan nilai outlier?
Nilai yang memiliki frekuensi tinggi
Nilai yang jauh berbeda dari sebagian besar data
Nilai yang hilang dari dataset
Nilai yang benar-benar akurat
Metode apa yang umum digunakan untuk menangani outlier?
Menghapus outlier dari dataset
Menggunakan teknik Penghalusan data(Smoothing)
Menggunakan teknik binning
Apa itu normalisasi dalam konteks data cleaning?
Menghapus semua data yang tidak relevan
Mengubah nilai data ke dalam rentang tertentu
Menambahkan data baru ke dataset
Mengubah format file data
Salah satu metode yang umum digunakan dalam unsupervised learning adalah:
Regresi linier
Klasifikasi
K-Means Clustering
Decision Tree
Apa yang dimaksud dengan data tidak terstruktur?
Data yang tersimpan dalam database relasional
Data yang memiliki format yang jelas dan teratur
Data yang tidak memiliki format tetap, seperti teks, gambar, dan video
Data yang diolah dalam bentuk angka
Teknologi mana yang sering digunakan untuk mengelola big data?
Microsoft Excel
Hadoop
SQL Server
Bagaimana Cara Mengetahui sebaran data??
Dengan Menggunakan Mean
Dengan Menggunakan Standar Deviasi
Dengan Menggunakan Inter Quartile Range (IQR)
Dengan Menggunakan Median
Apa yang dimaksud dengan encoding dalam data preprocessing?
Menghapus data yang tidak relevan
Mengubah data kategorikal menjadi format numerik agar dapat digunakan dalam algoritma
Meningkatkan ukuran dataset
Menyimpan data dalam bentuk gambar
Apa itu box plot?
Grafik yang menunjukkan hubungan antar variabel
Diagram yang menggambarkan distribusi dan outlier dari data
Tabel yang merangkum data
Grafik garis yang menunjukkan tren
Algoritma mana yang sering digunakan untuk menemukan aturan asosiasi?
K-Means
Apriori
Decision Tree
Regression
Apa itu support dalam konteks aturan asosiasi?
Frekuensi kemunculan itemset dalam dataset
Persentase item yang relevan
Tingkat keakuratan model
Jumlah data yang hilang
Apa itu "market basket analysis"?
Analisis untuk memprediksi cuaca
Metode untuk menemukan aturan asosiasi dalam data transaksi penjualan
Proses untuk menghapus outlier
Analisis untuk mengelompokkan data
Apa yang dimaksud dengan confidence dalam aturan asosiasi?
Probabilitas bahwa item B muncul ketika item A sudah ada
Jumlah total item dalam dataset
Frekuensi kemunculan item
Kualitas data yang dianalisis
Apa yang dimaksud dengan "support vector" dalam SVM?
Titik data yang paling dekat dengan hiperplane pemisah
Hiperplane yang paling jauh dari titik data
Pusat dari dataset
Semua titik data dalam satu kelas
Apa fungsi dari “hyperplane” dalam SVM?
Menyimpan data dalam jumlah besar
Mengurangi jumlah fitur
Memisahkan kelas-kelas dalam ruang data
Menyusun ulang data agar lebih mudah dibaca
Berikut ini manakah teknik yang dapat digunakan untuk mengklasifikasikan data
Artificial Neural Network
Naive Bayes
Decision Tree
Random Forest
Berikut ini manakah yang dapat digunakan untuk mengcluster data
DBSCAN
Kmeans
Optics
Association
Apa tujuan dari teknik “dimensionality reduction” seperti PCA dalam preprocessing
Mengurangi ukuran dataset
Menyederhanakan data dengan mengurangi jumlah fitur tanpa banyak mengorbankan informasi
Mengubah data menjadi skala yang lebih besar
Menghilangkan data duplikat dalam dataset
Apa tujuan utama dari seleksi fitur?
Menambah jumlah data
Menghapus fitur yang tidak relevan atau kurang penting untuk meningkatkan efisiensi model
Mengubah data kategori menjadi data numerik
Mengurangi ukuran dataset tanpa menghilangkan fitur
Mengapa seleksi fitur penting dalam machine learning?
Untuk menambah kompleksitas model
Untuk membuat model lebih cepat, akurat, dan mengurangi risiko overfitting
Untuk meningkatkan ukuran dataset
Untuk mengganti fitur dengan nilai acak
Apa yang dimaksud dengan metode “Filter” dalam seleksi fitur?
Memilih fitur berdasarkan pengaruhnya terhadap model
Memilih fitur sebelum pelatihan model berdasarkan hubungan statistik dengan target
Memilih fitur dengan menghapus semua data kategori
Memilih fitur dengan cara acak
Jika outlier disebabkan oleh kesalahan pengukuran, solusi terbaik adalah:
Mengabaikannya
Menambah lebih banyak outlier
Menghapus atau memperbaiki nilai tersebut sesuai konteks
Menganggapnya sebagai data valid
Unsupervised learning sering digunakan untuk segmentasi pasar karena:
Dapat menghasilkan data berlabel
Dapat menemukan pola dan kelompok dalam data pelanggan tanpa memerlukan label
Selalu memerlukan data terstruktur
Hasilnya selalu dapat diprediksi
Apa tujuan dari "data visualization" dalam data mining?
Untuk menyimpan data
Untuk mempresentasikan data dalam bentuk grafik atau diagram agar lebih mudah dipahami
Untuk menghapus data yang tidak relevan
Untuk meningkatkan ukuran dataset
Apa yang dimaksud dengan "predictive analytics" dalam konteks big data?
Memprediksi nilai masa lalu
Memprediksi hasil di masa depan berdasarkan analisis data saat ini
Menghapus data yang tidak relevan
Menghitung nilai rata-rata dari dataset
Apa arti dari nilai korelasi 0,8?
Terdapat hubungan yang lemah antara dua variabel
Terdapat hubungan sedang antara dua variabel
Tidak terdapat hubungan antara dua variabel
Terdapat hubungan yang kuat antara dua variabel
Korelasi negatif berarti:
Ketika satu variabel meningkat, yang lain juga meningkat
Ketika satu variabel meningkat, yang lain menurun
Tidak ada hubungan antara kedua variabel
Kedua variabel tidak dapat diukur
Contoh atribut kategorikal adalah:
Tinggi badan
Warna mobil
Umur
Berat badan
Contoh atribut ordinal adalah:
Tingkat pendidikan (misalnya, SD, SMP, SMA, Sarjana)
Warna mata
Jenis kelamin
Tanggal lahir
Apa yang dimaksud dengan atribut nominal?
Atribut yang memiliki urutan
Atribut yang tidak memiliki urutan atau hierarki
Atribut yang dapat diukur
Atribut yang hanya berisi angka
Contoh atribut kontinu adalah:
Jumlah siswa di kelas
Tinggi badan dalam sentimeter
Jenis kelamin
Nomor Kodepos
Apa yang dimaksud dengan regresi dalam konteks supervised learning?
Metode untuk mengelompokkan data
Metode untuk memprediksi nilai kontinu
Metode untuk menghapus outlier
Metode untuk visualisasi data
Contoh dari algoritma regresi adalah:
Decision Tree
Support Vector Machine
Regresi Linier
Random Forest
Dalam supervised learning, apa itu "fitur" (feature)?
Target yang ingin diprediksi
Data yang digunakan untuk pengujian
Karakteristik atau atribut dari data input yang digunakan untuk membuat prediksi
Proses melatih model
Algoritma mana yang tidak termasuk dalam supervised learning?
Random Forest
Support Vector Machines
K-Means
Naive Bayes
Apa itu Random Forest?
Algoritma klasifikasi yang menggunakan satu pohon keputusan
Algoritma klasifikasi yang menggunakan beberapa pohon keputusan dan menggabungkan hasilnya
Teknik untuk menghapus data
Metode untuk meningkatkan noise dalam data
Dalam unsupervised learning, apa yang dimaksud dengan "feature scaling"?
Proses menghapus outlier
Proses untuk menstandarkan skala fitur agar tidak mendominasi hasil
Proses untuk menghapus fitur yang tidak relevan
Proses untuk mengurangi jumlah data
Apa yang dimaksud dengan clustering?
Proses membagi data menjadi dua kelompok
Proses mengelompokkan data yang memiliki kesamaan
Proses memprediksi nilai dari data
Proses menghapus data yang tidak relevan
Clustering dapat digunakan dalam analisis musik untuk:
Mengelompokkan lagu berdasarkan genre
Menghitung durasi lagu
Memprediksi popularitas lagu
Menghapus lagu yang tidak populer
