NEW
Font size
WorksheetsPengantar Data Sains Quiz
Total questions: 60
Worksheet time: 45mins
Bidang interdisipliner yang menggunakan metode ilmiah untuk mengekstrak pengetahuan dari data disebut...
Rekayasa Perangkat Lunak
Data Sains
Intelijen Bisnis
Manajemen Database
Istilah yang menggambarkan ledakan volume data yang masif di era digital adalah...
Data Mining
Data Deluge
Big Bang Data
Data Warehouse
Manakah di bawah ini yang BUKAN merupakan salah satu dari tiga pendorong utama kebangkitan Data Sains?
Peningkatan kekuatan komputasi
Volume data yang masif (Big Data)
Algoritma yang semakin canggih
Penurunan minat pada statistika
Dalam kerangka kerja CRISP-DM (Data mining life cyle), tahapan yang seringkali memakan waktu paling banyak (hingga 80%) adalah...
Business Understanding
Modeling
Data Preparation
Deployment
Seorang profesional yang fokus menganalisis data historis untuk menjawab pertanyaan "apa yang terjadi?" menggunakan tools seperti SQL dan Tableau adalah...
Data Scientist
Data Analyst
Data Engineer
Database Administrator
Teknik yang digunakan oleh Netflix dan Amazon untuk menyarankan konten atau produk berdasarkan perilaku pengguna disebut...
Sistem Klasifikasi
Mesin Rekomendasi
Analisis Regresi
Clustering Pelanggan
Seorang profesional yang membangun dan memelihara data pipelines agar data mengalir dengan andal dan efisien adalah...
Data Analyst
Data Scientist
Data Engineer
Business Analyst
Model AI yang mempelajari bias dari data historis (misal: bias gender dalam rekrutmen) adalah contoh dari isu etis yang disebut...
Privasi Data
Bias Algoritmik
Transparansi Model
Keamanan Data
Data Sains merupakan gabungan dari tiga bidang keahlian utama, yaitu...
Marketing, Keuangan, dan SDM
Ilmu Komputer, Matematika & Statistika, dan Keahlian Domain/Bisnis
Rekayasa Perangkat Lunak, Jaringan Komputer, dan Keamanan Siber
Filsafat, Sejarah, dan Seni
Tahapan pertama dalam CRISP-DM (Data mining life cyle) yang berfokus pada "apa masalah yang ingin diselesaikan?" adalah...
Data Understanding
Modeling
Evaluation
Business Understanding
Skandal Cambridge Analytica adalah contoh nyata dari pelanggaran isu etis dalam bidang...
Bias Algoritmik
Explainability
Privasi Data
Model Drift
Manakah peran yang lebih fokus pada prediksi masa depan dengan membangun model machine learning menggunakan Python/R?
Data Analyst
Data Scientist
Data Engineer
IT Support
Tujuan utama menggunakan kerangka kerja seperti CRISP-DM (Data mining life cyle) adalah...
Agar bisa menggunakan algoritma terbaru
Menjamin proyek selesai lebih cepat
Memastikan proyek tetap fokus pada tujuan bisnis dan memiliki metrik yang jelas
Untuk membuat dokumentasi proyek yang rumit
Mengapa metrik Recall sangat penting bagi StreamFlix?
Karena biaya False Positive (memberi diskon pada pelanggan setia) sangat mahal.
Karena biaya False Negative (kehilangan pelanggan yang tidak terdeteksi) jauh lebih mahal daripada False Positive.
Agar model memiliki akurasi 100%.
Karena Recall adalah satu-satunya metrik yang ada.
Proses mengubah data mentah dari berbagai sumber menjadi dataset yang bersih dan siap untuk pemodelan sering disebut sebagai...
Modeling
Data Preparation
Deployment
Evaluation
Aktivitas menggunakan statistik dan visualisasi untuk mendapatkan intuisi awal dari data dan membentuk hipotesis disebut...
Exploratory Data Analysis (EDA)
Model Deployment
Business Understanding
Model Evaluation
Penurunan performa model seiring waktu karena perubahan perilaku pelanggan atau faktor eksternal lainnya disebut...
Overfitting
Model Drift
Underfitting
Model Bias
Kerangka kerja data sains yang fokus pada alur kerja praktis sehari-hari seorang Data Scientist dengan tahapan Obtain, Scrub, Explore, Model, iNterpret adalah...
CRISP-DM
SEMMA
OSEMN
Agile
Pada kasus StreamFlix, masalah yang ingin dipecahkan (churn atau tidak churn) adalah jenis masalah machine learning...
Regresi
Klasifikasi Biner
Clustering
Reinforcement Learning
Proses mengintegrasikan model ke dalam lingkungan produksi agar dapat memberikan nilai nyata bagi bisnis disebut...
Data Preparation
Modeling
Evaluation
Deployment
Kerangka kerja yang dikembangkan oleh SAS Institute dengan tahapan Sample, Explore, Modify, Model, Assess adalah...
CRISP-DM
SEMMA
OSEMN
Waterfall
Python dan R adalah contoh dari software...
Commercial / Proprietary
Open Source
Shareware
Freemium
Keuntungan utama menggunakan platform Cloud seperti Google Colab dibandingkan On-Premise adalah...
Kontrol penuh atas keamanan data.
Tidak memerlukan koneksi internet.
Skalabilitas sumber daya sesuai permintaan dan tidak perlu instalasi.
Biaya hardware awal yang sangat tinggi.
Tiga bahasa yang dianggap sebagai "holy trinity" bagi seorang data scientist modern adalah...
JavaScript, HTML, CSS
C++, C#, Java
Python, R, dan SQL
Julia, Scala, Swift
Peran utama SQL dalam alur kerja data science adalah...
Membangun model machine learning.
Membuat visualisasi data yang interaktif.
Mengambil, memfilter, dan memanipulasi data langsung di dalam database.
Membuat aplikasi web.
Di Python, library yang menjadi standar untuk manipulasi dan analisis data terstruktur (dikenal sebagai "Excel di dalam Python") adalah...
NumPy
Pandas
Scikit-learn
Matplotlib
Library machine learning terlengkap di Python untuk tugas seperti klasifikasi, regresi, dan clustering adalah...
Pandas
TensorFlow
Scikit-learn
Seaborn
Di R, library yang dianggap sebagai standar emas untuk membuat visualisasi data yang superior dan deklaratif adalah...
dplyr
readr
Shiny
ggplot2
Di R, sebuah "ekosistem" yang berisi paket-paket seperti dplyr, ggplot2, dan tidyr untuk alur kerja data science modern disebut...
RStudio
Tidyverse
CRAN
caret
Perhatikan kode R berikut: sales %>% filter(produk == "Laptop"). Operator %>% disebut...
Assignment Operator
Logical Operator
Pipe Operator
Comparison Operator
Library Python yang menjadi fondasi untuk semua komputasi numerik dan operasi matematika pada array adalah...
Pandas
NumPy
PyTorch
Scikit-learn
Platform Jupyter Notebook gratis yang berjalan di cloud Google dan menyediakan akses gratis ke GPU/TPU adalah...
Amazon SageMaker
Microsoft Azure ML
Google Colab
Databricks
Teknik untuk menemukan kecocokan antara dua string teks yang mirip tetapi tidak 100% identik disebut...
Exact Matching
Data Cleansing
Fuzzy Matching
Data Validation
Metrik jarak yang mengukur jumlah minimum operasi "edit" (sisip, hapus, ganti) untuk mengubah satu string menjadi string lain adalah...
Jaro-Winkler
Jaccard Similarity
Levenshtein Distance
Cosine Similarity
Berapakah jarak Levenshtein antara kata "KUCING" dan "KUNCING"?
0
1
2
3
Metrik fuzzy matching yang sangat baik untuk mencocokkan nama orang karena memberi bobot ekstra pada karakter yang cocok di awal string adalah...
Levenshtein
Jaro-Winkler
Jaccard
Hamming
Metrik kemiripan yang bekerja dengan memecah string menjadi set potongan-potongan kecil (n-grams) dan mengukur proporsi potongan yang sama adalah...
Levenshtein
Jaro-Winkler
Jaccard Similarity
Euclidean Distance
Di R, untuk membaca file Excel (.xlsx) kita bisa menggunakan fungsi read_excel() dari library...
dplyr
ggplot2
readxl
jsonlite
VLOOKUP standar di Excel sering gagal menggabungkan data karena...
Hanya bisa menggabungkan data numerik.
Memerlukan pencocokan yang 100% identik (exact match)
Terlalu lambat untuk data besar.
Tidak bisa menangani lebih dari dua tabel.
Dalam Fuzzy Matching, nilai skor (misal 0.8) yang kita tentukan untuk memutuskan apakah dua string "cukup mirip" disebut...
Parameter
Hyperparameter
Threshold
Metric
Di Python (pandas) dan R, untuk mengambil data dari database SQL, Anda memerlukan...
Hanya nama tabel
Koneksi ke database (Connection Object) dan query SQL
File konfigurasi JSON
Alamat IP server saja
Jenis mekanisme data hilang yang paling problematik dan sulit ditangani karena penyebabnya berhubungan dengan nilai data yang hilang itu sendiri adalah...
MCAR (Missing Completely at Random)
MAR (Missing at Random)
MNAR (Missing Not at Random)
MACR (Missing at Constant Rate)
Seorang responden survei tidak sengaja melewatkan satu pertanyaan karena halamannya menempel. Ini adalah contoh dari...
MCAR
MAR
MNAR
Semua salah
Menghapus seluruh baris jika terdapat satu saja nilai yang hilang (Listwise Deletion) hanya aman dilakukan jika...
Data hilang secara MNAR dan jumlahnya banyak.
Data hilang secara MCAR dan proporsinya sangat kecil (< 5%).
Data hilang secara MAR.
Selalu aman dilakukan kapan saja.
Kelemahan utama dari imputasi Mean adalah...
Hanya bisa digunakan untuk data kategorikal.
Sangat sensitif terhadap nilai outlier.
Prosesnya sangat lambat.
Mengurangi hubungan antar variabel.
Metode imputasi yang paling logis untuk mengisi data kategorikal yang hilang adalah...
Mean
Median
Modus
Nilai 0
Metode imputasi yang mengisi nilai hilang berdasarkan nilai rata-rata dari 'k' tetangga terdekatnya yang paling mirip adalah...
MICE
Mean Imputation
KNN Imputation
Mode Imputation
Proses mengubah variabel numerik kontinu (misal: Usia) menjadi variabel kategorikal (misal: "Remaja", "Dewasa") disebut...
Encoding
Scaling
Binning
Normalization
Teknik encoding yang paling tepat untuk variabel nominal dengan membuat kolom biner (0/1) baru untuk setiap kategori adalah...
Label Encoding
Ordinal Encoding
One-Hot Encoding
Binary Encoding
Label Encoding aman dan sangat berguna untuk digunakan pada...
Variabel fitur yang bersifat nominal.
Variabel fitur yang bersifat ordinal dan variabel target (Y) klasifikasi.
Semua jenis variabel.
Hanya variabel numerik.
Proses mengubah bentuk, mentransformasi, atau memodifikasi data agar lebih ringkas dan relevan untuk analisis disebut...
Data Exporting
Data Visualization
Data Manipulation
Data Storage
Membuat kolom baru IndeksMassaTubuh dari kolom Berat dan Tinggi yang sudah ada adalah contoh dari...
Mengonversi Tipe Variabel
Recode Kategori
Membuat Variabel Turunan
Subsetting Data
Mengelompokkan nilai 'DKI Jakarta', 'Jakarta Pusat', dan 'Jakarta Selatan' menjadi satu kategori 'Jakarta' adalah contoh dari...
Operasi String
Recode Kategori
Membuat Variabel Logika
Mengubah Nama Variabel
Memilih hanya baris data penjualan dari tahun 2024 dan mengurutkannya dari yang terbesar adalah contoh dari...
Identifikasi Duplikat
Menggabungkan Data
Subsetting & Sorting
Membuat Variabel Turunan
Format file yang dianggap standar modern untuk analisis Big Data karena sangat cepat, efisien dalam kompresi, dan menyimpan skema tipe data adalah...
CSV
Excel (.xlsx)
JSON
Parquet
Salah satu kelemahan utama format file .csv adalah...
Tidak bisa dibuka oleh banyak software.
Ukuran file sangat kecil.
Tidak menyimpan informasi tipe data (semua bisa dibaca sebagai teks).
Hanya bisa digunakan di sistem operasi Windows.
Di R, untuk menggabungkan tabel_pelanggan dan tabel_transaksi berdasarkan ID_Pelanggan, Anda bisa menggunakan fungsi dari dplyr seperti...
filter()
select()
mutate()
left_join()
