wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Pengantar Data Sains Quiz

Total questions: 60

Worksheet time: 45mins

Name
Class
Date
1.

Bidang interdisipliner yang menggunakan metode ilmiah untuk mengekstrak pengetahuan dari data disebut...

a)

Rekayasa Perangkat Lunak

b)

Data Sains

c)

Intelijen Bisnis

d)

Manajemen Database

2.

Istilah yang menggambarkan ledakan volume data yang masif di era digital adalah...

a)

Data Mining

b)

Data Deluge

c)

Big Bang Data

d)

Data Warehouse

3.

Manakah di bawah ini yang BUKAN merupakan salah satu dari tiga pendorong utama kebangkitan Data Sains?

a)

Peningkatan kekuatan komputasi

b)

Volume data yang masif (Big Data)

c)

Algoritma yang semakin canggih

d)

Penurunan minat pada statistika

4.

Dalam kerangka kerja CRISP-DM (Data mining life cyle), tahapan yang seringkali memakan waktu paling banyak (hingga 80%) adalah...

a)

Business Understanding

b)

Modeling

c)

Data Preparation

d)

Deployment

5.

Seorang profesional yang fokus menganalisis data historis untuk menjawab pertanyaan "apa yang terjadi?" menggunakan tools seperti SQL dan Tableau adalah...

a)

Data Scientist

b)

Data Analyst

c)

Data Engineer

d)

Database Administrator

6.

Teknik yang digunakan oleh Netflix dan Amazon untuk menyarankan konten atau produk berdasarkan perilaku pengguna disebut...

a)

Sistem Klasifikasi

b)

Mesin Rekomendasi

c)

Analisis Regresi

d)

Clustering Pelanggan

7.

Seorang profesional yang membangun dan memelihara data pipelines agar data mengalir dengan andal dan efisien adalah...

a)

Data Analyst

b)

Data Scientist

c)

Data Engineer

d)

Business Analyst

8.

Model AI yang mempelajari bias dari data historis (misal: bias gender dalam rekrutmen) adalah contoh dari isu etis yang disebut...

a)

Privasi Data

b)

Bias Algoritmik

c)

Transparansi Model

d)

Keamanan Data

9.

Data Sains merupakan gabungan dari tiga bidang keahlian utama, yaitu...

a)

Marketing, Keuangan, dan SDM

b)

Ilmu Komputer, Matematika & Statistika, dan Keahlian Domain/Bisnis

c)

Rekayasa Perangkat Lunak, Jaringan Komputer, dan Keamanan Siber

d)

Filsafat, Sejarah, dan Seni

10.

Tahapan pertama dalam CRISP-DM (Data mining life cyle) yang berfokus pada "apa masalah yang ingin diselesaikan?" adalah...

a)

Data Understanding

b)

Modeling

c)

Evaluation

d)

Business Understanding

11.

Skandal Cambridge Analytica adalah contoh nyata dari pelanggaran isu etis dalam bidang...

a)

Bias Algoritmik

b)

Explainability

c)

Privasi Data

d)

Model Drift

12.

Manakah peran yang lebih fokus pada prediksi masa depan dengan membangun model machine learning menggunakan Python/R?

a)

Data Analyst

b)

Data Scientist

c)

Data Engineer

d)

IT Support

13.

Tujuan utama menggunakan kerangka kerja seperti CRISP-DM (Data mining life cyle) adalah...

a)

Agar bisa menggunakan algoritma terbaru

b)

Menjamin proyek selesai lebih cepat

c)

Memastikan proyek tetap fokus pada tujuan bisnis dan memiliki metrik yang jelas

d)

Untuk membuat dokumentasi proyek yang rumit

14.

Mengapa metrik Recall sangat penting bagi StreamFlix?

a)

Karena biaya False Positive (memberi diskon pada pelanggan setia) sangat mahal.

b)

Karena biaya False Negative (kehilangan pelanggan yang tidak terdeteksi) jauh lebih mahal daripada False Positive.

c)

Agar model memiliki akurasi 100%.

d)

Karena Recall adalah satu-satunya metrik yang ada.

15.

Proses mengubah data mentah dari berbagai sumber menjadi dataset yang bersih dan siap untuk pemodelan sering disebut sebagai...

a)

Modeling

b)

Data Preparation

c)

Deployment

d)

Evaluation

16.

Aktivitas menggunakan statistik dan visualisasi untuk mendapatkan intuisi awal dari data dan membentuk hipotesis disebut...

a)

Exploratory Data Analysis (EDA)

b)

Model Deployment

c)

Business Understanding

d)

Model Evaluation

17.

Penurunan performa model seiring waktu karena perubahan perilaku pelanggan atau faktor eksternal lainnya disebut...

a)

Overfitting

b)

Model Drift

c)

Underfitting

d)

Model Bias

18.

Kerangka kerja data sains yang fokus pada alur kerja praktis sehari-hari seorang Data Scientist dengan tahapan Obtain, Scrub, Explore, Model, iNterpret adalah...

a)

CRISP-DM

b)

SEMMA

c)

OSEMN

d)

Agile

19.

Pada kasus StreamFlix, masalah yang ingin dipecahkan (churn atau tidak churn) adalah jenis masalah machine learning...

a)

Regresi

b)

Klasifikasi Biner

c)

Clustering

d)

Reinforcement Learning

20.

Proses mengintegrasikan model ke dalam lingkungan produksi agar dapat memberikan nilai nyata bagi bisnis disebut...

a)

Data Preparation

b)

Modeling

c)

Evaluation

d)

Deployment

21.

Kerangka kerja yang dikembangkan oleh SAS Institute dengan tahapan Sample, Explore, Modify, Model, Assess adalah...

a)

CRISP-DM

b)

SEMMA

c)

OSEMN

d)

Waterfall

22.

Python dan R adalah contoh dari software...

a)

Commercial / Proprietary

b)

Open Source

c)

Shareware

d)

Freemium

23.

Keuntungan utama menggunakan platform Cloud seperti Google Colab dibandingkan On-Premise adalah...

a)

Kontrol penuh atas keamanan data.

b)

Tidak memerlukan koneksi internet.

c)

Skalabilitas sumber daya sesuai permintaan dan tidak perlu instalasi.

d)

Biaya hardware awal yang sangat tinggi.

24.

Tiga bahasa yang dianggap sebagai "holy trinity" bagi seorang data scientist modern adalah...

a)

JavaScript, HTML, CSS

b)

C++, C#, Java

c)

Python, R, dan SQL

d)

Julia, Scala, Swift

25.

Peran utama SQL dalam alur kerja data science adalah...

a)

Membangun model machine learning.

b)

Membuat visualisasi data yang interaktif.

c)

Mengambil, memfilter, dan memanipulasi data langsung di dalam database.

d)

Membuat aplikasi web.

26.

Di Python, library yang menjadi standar untuk manipulasi dan analisis data terstruktur (dikenal sebagai "Excel di dalam Python") adalah...

a)

NumPy

b)

Pandas

c)

Scikit-learn

d)

Matplotlib

27.

Library machine learning terlengkap di Python untuk tugas seperti klasifikasi, regresi, dan clustering adalah...

a)

Pandas

b)

TensorFlow

c)

Scikit-learn

d)

Seaborn

28.

Di R, library yang dianggap sebagai standar emas untuk membuat visualisasi data yang superior dan deklaratif adalah...

a)

dplyr

b)

readr

c)

Shiny

d)

ggplot2

29.

Di R, sebuah "ekosistem" yang berisi paket-paket seperti dplyr, ggplot2, dan tidyr untuk alur kerja data science modern disebut...

a)

RStudio

b)

Tidyverse

c)

CRAN

d)

caret

30.

Perhatikan kode R berikut: sales %>% filter(produk == "Laptop"). Operator %>% disebut...

a)

Assignment Operator

b)

Logical Operator

c)

Pipe Operator

d)

Comparison Operator

31.

Library Python yang menjadi fondasi untuk semua komputasi numerik dan operasi matematika pada array adalah...

a)

Pandas

b)

NumPy

c)

PyTorch

d)

Scikit-learn

32.

Platform Jupyter Notebook gratis yang berjalan di cloud Google dan menyediakan akses gratis ke GPU/TPU adalah...

a)

Amazon SageMaker

b)

Microsoft Azure ML

c)

Google Colab

d)

Databricks

33.

Di Python (pandas), fungsi yang umum digunakan untuk membaca file dengan format .csv adalah...

a)

pd.read_excel()

b)

pd.read_json()

c)

pd.read_csv()

d)

pd.open_file()

34.

Teknik untuk menemukan kecocokan antara dua string teks yang mirip tetapi tidak 100% identik disebut...

a)

Exact Matching

b)

Data Cleansing

c)

Fuzzy Matching

d)

Data Validation

35.

Metrik jarak yang mengukur jumlah minimum operasi "edit" (sisip, hapus, ganti) untuk mengubah satu string menjadi string lain adalah...

a)

Jaro-Winkler

b)

Jaccard Similarity

c)

Levenshtein Distance

d)

Cosine Similarity

36.

Berapakah jarak Levenshtein antara kata "KUCING" dan "KUNCING"?

a)

0

b)

1

c)

2

d)

3

37.

Metrik fuzzy matching yang sangat baik untuk mencocokkan nama orang karena memberi bobot ekstra pada karakter yang cocok di awal string adalah...

a)

Levenshtein

b)

Jaro-Winkler

c)

Jaccard

d)

Hamming

38.

Metrik kemiripan yang bekerja dengan memecah string menjadi set potongan-potongan kecil (n-grams) dan mengukur proporsi potongan yang sama adalah...

a)

Levenshtein

b)

Jaro-Winkler

c)

Jaccard Similarity

d)

Euclidean Distance

39.

Di R, untuk membaca file Excel (.xlsx) kita bisa menggunakan fungsi read_excel() dari library...

a)

dplyr

b)

ggplot2

c)

readxl

d)

jsonlite

40.

VLOOKUP standar di Excel sering gagal menggabungkan data karena...

a)

Hanya bisa menggabungkan data numerik.

b)

Memerlukan pencocokan yang 100% identik (exact match)

c)

Terlalu lambat untuk data besar.

d)

Tidak bisa menangani lebih dari dua tabel.

41.

Di Python (pandas), jika Anda ingin membaca data dari tabel di sebuah halaman web, fungsi yang paling tepat adalah...

a)

pd.read_sql()

b)

pd.read_html()

c)

pd.read_xml()

d)

pd.read_clipboard()

42.

Dalam Fuzzy Matching, nilai skor (misal 0.8) yang kita tentukan untuk memutuskan apakah dua string "cukup mirip" disebut...

a)

Parameter

b)

Hyperparameter

c)

Threshold

d)

Metric

43.

Di Python (pandas) dan R, untuk mengambil data dari database SQL, Anda memerlukan...

a)

Hanya nama tabel

b)

Koneksi ke database (Connection Object) dan query SQL

c)

File konfigurasi JSON

d)

Alamat IP server saja

44.

Jenis mekanisme data hilang yang paling problematik dan sulit ditangani karena penyebabnya berhubungan dengan nilai data yang hilang itu sendiri adalah...

a)

MCAR (Missing Completely at Random)

b)

MAR (Missing at Random)

c)

MNAR (Missing Not at Random)

d)

MACR (Missing at Constant Rate)

45.

Seorang responden survei tidak sengaja melewatkan satu pertanyaan karena halamannya menempel. Ini adalah contoh dari...

a)

MCAR

b)

MAR

c)

MNAR

d)

Semua salah

46.

Menghapus seluruh baris jika terdapat satu saja nilai yang hilang (Listwise Deletion) hanya aman dilakukan jika...

a)

Data hilang secara MNAR dan jumlahnya banyak.

b)

Data hilang secara MCAR dan proporsinya sangat kecil (< 5%).

c)

Data hilang secara MAR.

d)

Selalu aman dilakukan kapan saja.

47.

Kelemahan utama dari imputasi Mean adalah...

a)

Hanya bisa digunakan untuk data kategorikal.

b)

Sangat sensitif terhadap nilai outlier.

c)

Prosesnya sangat lambat.

d)

Mengurangi hubungan antar variabel.

48.

Metode imputasi yang paling logis untuk mengisi data kategorikal yang hilang adalah...

a)

Mean

b)

Median

c)

Modus

d)

Nilai 0

49.

Metode imputasi yang mengisi nilai hilang berdasarkan nilai rata-rata dari 'k' tetangga terdekatnya yang paling mirip adalah...

a)

MICE

b)

Mean Imputation

c)

KNN Imputation

d)

Mode Imputation

50.

Proses mengubah variabel numerik kontinu (misal: Usia) menjadi variabel kategorikal (misal: "Remaja", "Dewasa") disebut...

a)

Encoding

b)

Scaling

c)

Binning

d)

Normalization

51.

Teknik encoding yang paling tepat untuk variabel nominal dengan membuat kolom biner (0/1) baru untuk setiap kategori adalah...

a)

Label Encoding

b)

Ordinal Encoding

c)

One-Hot Encoding

d)

Binary Encoding

52.

Label Encoding aman dan sangat berguna untuk digunakan pada...

a)

Variabel fitur yang bersifat nominal.

b)

Variabel fitur yang bersifat ordinal dan variabel target (Y) klasifikasi.

c)

Semua jenis variabel.

d)

Hanya variabel numerik.

53.

Proses mengubah bentuk, mentransformasi, atau memodifikasi data agar lebih ringkas dan relevan untuk analisis disebut...

a)

Data Exporting

b)

Data Visualization

c)

Data Manipulation

d)

Data Storage

54.

Membuat kolom baru IndeksMassaTubuh dari kolom Berat dan Tinggi yang sudah ada adalah contoh dari...

a)

Mengonversi Tipe Variabel

b)

Recode Kategori

c)

Membuat Variabel Turunan

d)

Subsetting Data

55.

Mengelompokkan nilai 'DKI Jakarta', 'Jakarta Pusat', dan 'Jakarta Selatan' menjadi satu kategori 'Jakarta' adalah contoh dari...

a)

Operasi String

b)

Recode Kategori

c)

Membuat Variabel Logika

d)

Mengubah Nama Variabel

56.

Memilih hanya baris data penjualan dari tahun 2024 dan mengurutkannya dari yang terbesar adalah contoh dari...

a)

Identifikasi Duplikat

b)

Menggabungkan Data

c)

Subsetting & Sorting

d)

Membuat Variabel Turunan

57.

Format file yang dianggap standar modern untuk analisis Big Data karena sangat cepat, efisien dalam kompresi, dan menyimpan skema tipe data adalah...

a)

CSV

b)

Excel (.xlsx)

c)

JSON

d)

Parquet

58.

Salah satu kelemahan utama format file .csv adalah...

a)

Tidak bisa dibuka oleh banyak software.

b)

Ukuran file sangat kecil.

c)

Tidak menyimpan informasi tipe data (semua bisa dibaca sebagai teks).

d)

Hanya bisa digunakan di sistem operasi Windows.

59.

Di R, untuk menggabungkan tabel_pelanggan dan tabel_transaksi berdasarkan ID_Pelanggan, Anda bisa menggunakan fungsi dari dplyr seperti...

a)

filter()

b)

select()

c)

mutate()

d)

left_join()

60.

Di Python (pandas), setelah selesai membersihkan data dalam DataFrame df, untuk menyimpannya ke file CSV, Anda menggunakan method...

a)

df.save_csv('data_bersih.csv')

b)

df.to_csv('data_bersih.csv', index=False)

c)

df.export('data_bersih.csv')

d)

pd.write_csv(df, 'data_bersih.csv')