NEW
Font size
WorksheetsData Preprocessing
Total questions: 10
Worksheet time: 5mins
Mengapa data preprocessing penting dalam machine learning?
Karena semua algoritma membutuhkan data besar
Karena model hanya bisa memproses data bersih dan terstruktur
Karena mempercepat GPU
Karena mengurangi jumlah fitur
Apa akibat jika data preprocessing dilewati?
Model menjadi lebih cepat
Data lebih mudah dibaca manusia
Model menghasilkan prediksi salah atau bias
Dataset menjadi lebih besar
Jika lebih dari 30% data dalam suatu kolom hilang, maka:
Hapus seluruh dataset
Ganti dengan Mean
Hapus Kolom
Ganti dengan nilai regresi
Apa yang anda ketahui tentang Outlier???
Nilai yang mengikuti pola umum data
Nilai ekstrem yang jauh dari data lain
Data yang hilang
Nilai yang diisi dengan mean
Metode statistik yang sering digunakan untuk mendeteksi outlier:
PCA
Z-Score dan IQR
Min-Max Scaling
One-hot encoding
Teknik yang digunakan untuk mengurangi noise pada data deret waktu adalah:
Normalization
Smoothing
Label encoding
Sampling
Normalization digunakan untuk:
Menyamakan skala data ke rentang tertentu (biasanya 0–1)
Menghapus duplikasi data
Mengubah data kategorikal menjadi numerik
Menghapus kolom tidak relevan
Masalah umum saat melakukan data integration adalah:
Overfitting
Redundansi dan konflik data antar sumber
Kekurangan data
Normalisasi yang salah
Teknik untuk mengurangi dimensi data tanpa kehilangan informasi penting adalah:
Normalization
One-hot encoding
PCA (Principal Component Analysis)
Label encoding
Kolom "tekanan darah" pada dataset pasien memiliki 45% nilai kosong akibat alat rusak.
Langkah terbaik yang dapat diambil adalah…
Isi semua nilai kosong dengan rata-rata
Hapus kolom karena terlalu banyak data hilang
Abaikan karena masih bisa dipakai
Ganti semua dengan nilai 0
