wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Data Sciene

Total questions: 100

Worksheet time: 1hrs 5mins

Name
Class
Date
1.

Apa yang dimaksud dengan Data Science?

a)

Ilmu yang mempelajari pola perilaku manusia.

b)

Ilmu yang memanfaatkan data untuk mendapatkan wawasan dan pengetahuan.

c)

Ilmu yang mempelajari sistem komputer.

d)

Ilmu yang mengembangkan algoritma untuk permainan video.

2.

Sebutkan tiga peran utama dalam tim Data Science.

a)

Data Analyst, Data Engineer, Data Scientist

b)

Project Manager, Software Engineer, Network Engineer

c)

Web Developer, Mobile Developer, System Analyst

d)

Graphic Designer, UX Designer, Product Manager

3.

Apa perbedaan antara Data Science dan Data Mining?

a)

Data Science fokus pada analisis data, sedangkan Data Mining fokus pada pengumpulan data.

b)

Data Science mencakup seluruh siklus hidup data, sedangkan Data Mining fokus pada menemukan pola dalam data.

c)

Data Science hanya menggunakan teknik statistik, sedangkan Data Mining hanya menggunakan machine learning.

d)

Data Science hanya digunakan di perusahaan teknologi, sedangkan Data Mining digunakan di semua industri.

4.

Jelaskan siklus hidup proyek Data Science.

a)

Pengumpulan Data, Pengolahan Data, Analisis Data, Visualisasi Data

b)

Desain, Implementasi, Pengujian, Pemeliharaan

c)

Perencanaan, Pengembangan, Penerapan, Evaluasi

d)

Inisiasi, Perencanaan, Eksekusi, Penyelesaian

5.

Apa yang dimaksud dengan mean?

a)

Nilai tengah dari data yang terurut

b)

Nilai yang paling sering muncul dalam data

c)

Jumlah total semua nilai dibagi dengan jumlah data

d)

Selisih antara nilai tertinggi dan terendah

6.

Apa itu standar deviasi?

a)

Nilai tengah dari data yang terurut

b)

Pengukuran penyebaran data dari rata-rata

c)

Nilai yang paling sering muncul dalam data

d)

Jumlah total semua nilai dibagi dengan jumlah data

7.

Apa itu distribusi normal?

a)

Distribusi di mana data tersebar merata ke semua nilai

b)

Distribusi di mana data terkumpul pada satu nilai

c)

Distribusi berbentuk lonceng yang simetris terhadap rata-rata

d)

Distribusi di mana data tersebar hanya pada nilai ekstrem

8.

Apa itu regresi linear?

a)

Metode untuk mengelompokkan data ke dalam beberapa kelompok

b)

Metode untuk mengidentifikasi hubungan antara variabel independen dan variabel dependen

c)

Metode untuk mengurangi dimensi data

d)

Metode untuk menemukan pola tersembunyi dalam data

9.

Apa bahasa pemrograman yang paling umum digunakan dalam Data Science?

a)

JavaScript

b)

Python

c)

HTML

d)

PHP

10.

Apa itu library Pandas dalam Python?

a)

Library untuk membuat game

b)

Library untuk analisis dan manipulasi data

c)

Library untuk pengembangan web

d)

Library untuk pengolahan citra

11.

Apa perbedaan antara list dan dictionary dalam pemrograman Python?

a)

List digunakan untuk menyimpan nilai-nilai tunggal, sedangkan dictionary untuk pasangan key-value

b)

List digunakan untuk menyimpan pasangan key-value, sedangkan dictionary digunakan untuk menyimpan nilai tunggal

c)

List digunakan untuk menyimpan nilai-nilai yang berurutan, sedangkan dictionary untuk pasangan key-value

d)

List digunakan untuk menyimpan nilai-nilai string, sedangkan dictionary untuk nilai-nilai numerik

12.

Apa yang dimaksud dengan data cleaning?

a)

Proses mengumpulkan data

b)

Proses menghapus data yang tidak relevan

c)

Proses mengorganisir data dalam database

d)

Proses membersihkan dan mempersiapkan data untuk analisis

13.

Sebutkan dua teknik umum yang digunakan dalam data cleaning.

a)

Normalisasi dan pengelompokan

b)

Imputasi dan penghapusan duplikasi

c)

Visualisasi dan prediksi

d)

Pengindeksan dan penyortiran

14.

Apa itu missing data?

a)

Data yang tidak relevan

b)

Data yang hilang atau tidak tersedia dalam dataset

c)

Data yang duplikat

d)

Data yang sudah dianalisis

15.

Apa yang dimaksud dengan supervised learning?

a)

Metode machine learning yang digunakan untuk mengelompokkan data

b)

Metode machine learning yang dilatih dengan data berlabel

c)

Metode machine learning yang tidak menggunakan data berlabel

d)

Metode machine learning yang digunakan untuk mereduksi dimensi data

16.

Jelaskan apa itu overfitting dalam konteks machine learning.

a)

Ketika model terlalu sederhana dan tidak dapat menangkap pola dalam data

b)

Ketika model terlalu kompleks dan menangkap noise serta pola dari data latih

c)

Ketika model tidak dapat dikonvergensi selama pelatihan

d)

Ketika model dilatih dengan data yang tidak berlabel

17.

Apa itu cross-validation dalam machine learning?

a)

Teknik untuk mengumpulkan data tambahan

b)

Teknik untuk membagi data menjadi subset untuk pelatihan dan pengujian

c)

Teknik untuk mengurangi dimensi data

d)

Teknik untuk menemukan outlier dalam data

18.

Apa tujuan utama dari visualisasi data?

a)

Untuk menghapus data yang tidak relevan

b)

Untuk membuat data lebih mudah dipahami dan dianalisis

c)

Untuk mengelompokkan data

d)

Untuk mengumpulkan data tambahan

19.

Sebutkan dua library yang digunakan untuk visualisasi data dalam Python.

a)

Pandas dan Numpy

b)

Matplotlib dan Seaborn

c)

Scikit-learn dan TensorFlow

d)

OpenCV dan Pillow

20.

Apa itu heatmap dan dalam situasi apa biasanya digunakan?

a)

Grafik untuk menampilkan distribusi data numerik

b)

Grafik untuk menampilkan hubungan antar variabel dalam bentuk matriks

c)

Grafik untuk menampilkan urutan data dalam waktu

d)

Grafik untuk menampilkan nilai tertinggi dan terendah dalam dataset

21.

Berikut ini adalah library python yang populer digunakan dalam Data Science, Kecuali ....

a)

Ggplot2

b)

Matplotlib

c)

Numpy

d)

Pandas

22.

Lybrary python yang populer digunakan untuk machine learning adalah ....

a)

Scikit-Learn

b)

SciPy

c)

Pandas

d)

Numpy

23.

IPython merupakan singkatan dari .... yang disimpan dalam format ekstensi ....

a)

Interest Python; .py

b)

Internet Python; .html

c)

Intertactive Python; .ipynb

d)

International Python; .pdf

24.

Numpy adalah library python yang berfokus pada ....

a)

Numerical Computation

b)

Machine Learning

c)

Visualization

d)

Panel Data

25.

Output dati kode berikut adalah ....

a)

(4,2)

b)

6

c)

8

d)

(2,4)

26.

Output code berikut dihasilkan dari input code ....

a)

np.array([1,2,3,4,5,6,7,8])

b)

np.arange(9)

c)

np.arange(8).reshape(3,3)

d)

np.arange(9).reshape(3,3)

27.

Di Pandas, kita mengenal dua objek, yaitu ....

a)

Series dan DataFrame

b)

Vector dan List

c)

Array dan List

d)

Vector dan DataFrame

28.

Function di bawah ini digunakan untuk mengimpot data csv ke format Python dengan pandas

a)

pd.read_txt()

b)

pd.DataFrame()

c)

pd.read_csv()

d)

pd.load_csv()

29.

Pada gambar berikut, fungsi apa yang digunakan untuk menampilkan tulisan "YEAR" pada sumbu-x di bawah gambar ...

a)

plt.xlabel("YEAR")

b)

plt.ylabel("YEAR")

c)

plt.plot("YEAR")

d)

plt.title("YEAR")

30.

Berikut ini adalah Development Environment untuk bekerja dengan python, kecuali ....

a)

Google Collaboratory

b)

Spyder

c)

Jupyter Notebook

d)

Weka

31.

Berikut proses data science, kecuali ?

a)

data preparation

b)

operation

c)

integration

d)

comunicate result

32.

Mendistribusikan kumpulan data untuk pelatihan dan pengujian, merupakan proses data science dari ?

a)

Dara preparation

b)

Model building

c)

Model Planing

d)

Operation

33.

Memilih analytic approach sesuai permasalahan yang akan coba diselesaikan masuk ke dalam metohology apa ?

a)

Analytic Approach

b)

Data Collection

c)

Modelling

d)

Evaluation

34.

Model yang biasanya digunakan untuk menunjukan hubungan ?

a)

klasifikasi

b)

klarifikasi

c)

prediktif

d)

deskriptif

35.

Model yang biasanya digunakan untuk menentukan probabilitas suatu tindakan ?

a)

prediktif

b)

deskriptif

c)

klasifikasi

d)

klarifikasi

36.

proses transformasi data menjadi fitur-fitur yang lebih representatif dalam membantu menyelesaikan masalah dengan lebih baik disebut

a)

Creation Enginering

b)

Feature transformation

c)

Feature engineering

d)

Creation transformation

37.

Tahapan yang paling memakan banyak waktu ?

a)

Data Collection

b)

Data preparation

c)

Data Understanding

d)

Data requirements

38.

Fase diagnostic measures adalah

a)

Digunakan untuk memastikan model bekerja dengan baik sesuai yang diharapkan

b)

Digunakan untuk memastikan data sudah sesuai

c)

Digunakan untuk memastikan bahwa data yang digunakan telah ditangani dan diinterpretasikan dengan benar dalam model

d)

Digunakan untuk memastikan bahwa Metode yang digunakan sudah benar

39.

Digunakan untuk memastikan bahwa data yang digunakan telah ditangani dan diinterpretasikan dengan benar di dalam model disebut ?

a)

Fase diagnostic measures

b)

Fase analytic measures

c)

Fase statistical significance testing

d)

Fase testing

40.

Pengujian terhadap kualitas model apakah model yang dirancang sebelumnya tersebut dapat mengatasi permasalahan bisnis dengan tepat merupakan tahap dari ?

a)

Feedback

b)

Modelling

c)

Evaluation

d)

Deployment

41.

Algoritma machine learning di mana kita memiliki label yang ingin diprediksi disebut

a)

Reinforcement learning

b)

Supervised learning

c)

Unsupervised learning

d)

Semi-supervised learning

42.

Mana yang merupakan bagian dari algoritma unsupervised learning

a)

Linear regression

b)

Support vector machines

c)

K-Means Clustering

d)

Decision tree

43.

Mana yang merupakan bagian dari algoritma supervised learning

a)

Hierarchical clustering

b)

Logistic regression

c)

K-Means

d)

DB-Scan

44.

Algoritma di mana variabel yang kita prediksi memiliki tipe data kategori disebut dengan

a)

Clustering

b)

Regresi

c)

Klasifikasi

d)

PCA

45.

Algoritma di mana variabel yang ingin kita prediksi memiliki tipe data numerik disebut dengan

a)

Regresi

b)

Klasifikasi

c)

Clustering

d)

PCA

46.

Pilih 3 tipe machine learning yang bisa digunakan untuk menyelesaikan masalah

a)

Supervised learning

b)

Unsupervised learning

c)

Reinforcement learning

d)

Technical learning

e)

Learning differentiated

47.

Salah satu metode di mana kita melakukan evaluasi train dan validation set berkali-kali disebut dengan

a)

Hold-out method

b)

Splitting method

c)

Cross validation

d)

Repetitive evaluation

48.

Di Orange, widget yang bisa digunakan untuk melakukan cross validation disebut dengan

a)

Predictions

b)

Preprocess

c)

Confusion matrix

d)

Test and Score

49.

Nilai apa yang harus kita masukkan ketika menemui data tipe kategori yang kosong?

a)

Mean

b)

Median

c)

Modus

d)

Standar deviasi

50.

Salah satu metrik algoritma klasifikasi yang bisa digunakan untuk evaluasi adalah

a)

RSME

b)

AUC

c)

MAE

d)

R2

51.

Berikut ini adalah berbagaihal penting dalam data mining kecuali..

a)

Estimasi

b)

Asosiasi

c)

Klastering

d)

Korelasi

e)

Klasifikasi

52.

Pada tahap Data Pre-processing, dilakukan kegiatan berikut yakni... (bisa lebih dari satu jawaban)

a)

Data Cleaning

b)

Data Integration

c)

Data Analyzing

d)

Data Reduction

53.

Kriteria evaluasi dan validasi model diperlukan tiga hal yaitu

a)

akurasi

b)

kecepatan

c)

kehandalan

d)

kegunaan

54.

Berapa Nilai akurasi modelnya?

a)

92%

b)

95%

c)

97&

d)

98%

55.

Output dari Visualization dan Models adalah...

a)

Insight

b)

Knowledge

c)

Predictive Model

d)

Tidak ada yang benar

56.

Bentuk ini adalah salah satu model Algoritma yang dinamakan...

a)

Random Forest

b)

Naive Bayes

c)

Decision Tree

d)

Logistic Regression

57.

Apa singkatan dari CA pada gambar ini?

(a)  

58.

Apa nama metode machine learning dengan model seperti ini?

a)

K-means

b)

Decision Tree

c)

Random Forest

d)

SVM

59.

widget yang benar adalah...

a)
b)
c)
d)
60.
a)
b)
c)
d)
61.

a)
b)
c)
d)
62.

Gambar seperti ini didapatkan dari widget...

a)

Network File

b)

Network Explorer

c)

Network Analysis

d)

Network Clustering

63.
a)

Corpus

b)

Preprocess Text

c)

Corpus Viewer

d)

Corpus to Network

64.

.... ........ mencari informasi dari sumber-sumber data melalui identifikasi dan eksplorasi pola tertentu.

(tuliskan dua kata menggunakan spelling english)

(a)  

65.

Pada area text mining dimana pola dari suatu dokumen mulai teridentifikasi adalah pada tahap..

a)

Information Retrieval

b)

Knowledge Discovery

c)

Natural Language Processing

d)

Information Extraction

66.

Pada area text mining dimana informasi yang sudah diperoleh sebelumnya akan diesktrak sehingga peneliti akan lebih mudah memahami permasalahan yang diteliti melalui visualisasi yang ditampilkan adalah..

a)

Information Retrieval

b)

Knowledge Discovery

c)

Natural Language Processing

d)

Information Extraction

67.

Proses memecah teks menjadi komponen yang lebih kecil (kata, kalimat, bigrams) yang terjadi pada Preprocess Text disebut..

a)

Transformation

b)

Tokenization

c)

Normalization

d)

Filtering

68.

Pada Preprocess Text ada tahapan "Most frequent tokens". Perintah ini ada pada kelompok...

a)

Transformation

b)

Tokenization

c)

Normalization

d)

Filtering

69.

Widget (a)   adalah kumpulan dokumen yang dapat menyajikan jumlah baris kalimat, dan menentukan mana fitur yang akan dan tidak akan dimasukkan untuk keperluan analisis.

70.

Pada Preprocess Text terdapat tahapan berikut kecuali...

a)

transformation

b)

tokenization

c)

stemming

d)

distance

71.

Machine learning is a subset of_________

a)

Data Learning

b)

Deep Learning

c)

Artificial Intelligence

d)

None of the above

72.

​ ​ ​ Following is not the type of Machine Learning​ .

a)

Semi-Unsupervised Learning

b)

Supervised Learning

c)

unsupervised Learning

d)

Reinforcement Lraning

73.

Which is the inner most part (Subset of Machine learning) in the given image?

a)

Deep Learning

b)

Machine Learning

c)

Artificial Intelligence 

74.

-------- type of problem is handled by Supervise Machine Learning.

a)

Association

b)

Classification and Regression

c)

Clustering

d)

Formatting

75.

_________ is a Feedback based learning method.

a)

Unsupervised Learning

b)

Reinforcement Learning

c)

Supervised Learning

d)

None of the given

76.

Observe an image and Identify Type of Machine Learning.

a)

Supervised

b)

Unsupervised

c)

Reinforcement

d)

Can't Identify

77.

from the picture, what kind of programming is it?

a)

Traditional Programming

b)

Modern Programming

c)

Machine Learning

d)

Traditional Learning

78.

Fraud Detection, Image Classification, Diagnostic, and Customer Retention are applications in ...

a)

Unsupervised Learning: Clustering

b)

Supervised Learning: Classification

c)

Reinforcement Learning

d)

Unsupervised Learning: Regression

79.

Regression is a case of which type of ML?

a)

Deep learning

b)

Unsupervised

c)

Reinforced

d)

Supervised

80.

Which of the following Machine Learning type uses Unlabeled Dataset?

a)

Supervised Machine Learning

b)

Unsupervised Machine Learning

c)

Reinforcement Machine Learning

d)

None of the Above

81.

How would you rate the overall quality of the lecture?

a)

Poor

b)

Good

c)

Very Good

d)

Excellent

82.

Apa perbedaan utama antara supervised learning dan unsupervised learning?

a)

Supervised learning menggunakan data tanpa label, sedangkan unsupervised learning menggunakan data berlabel

b)

Supervised learning digunakan untuk clustering, sedangkan unsupervised learning untuk prediksi

c)

Supervised learning menggunakan data berlabel, sedangkan unsupervised learning tidak berlabel

d)

Supervised learning lebih cepat daripada unsupervised learning

83.

Contoh algoritma yang digunakan dalam supervised learning adalah...

a)

Support Vector Machine (SVM)

b)

Linear Regression

c)

K-Nearest Neighbors (k-NN)

d)

Semua Benar

84.

Mengapa dataset harus memiliki label dalam supervised learning?

a)

Agar model bisa belajar pola hubungan antara input dan output

b)

Agar data lebih mudah dikumpulkan

c)

Agar bisa digunakan dalam semua jenis machine learning

d)

Untuk mempercepat proses training model

85.

Bagaimana cara kerja algoritma KNN dalam mengklasifikasikan data baru?

a)

Menggunakan decision tree untuk membagi data

b)

Menghitung jarak antara data baru dan tetangga terdekatnya

c)

Menggunakan persamaan regresi untuk memprediksi nilai data baru

d)

Membuat model yang terus memperbarui bobot berdasarkan kesalahan

86.

Mengapa pemilihan jumlah tetangga (k) dalam algoritma KNN sangat penting?

a)

Jika k terlalu kecil, model bisa terlalu sensitif terhadap noise

b)

Jika k terlalu besar, model akan selalu memilih kelas pertama

c)

K tidak mempengaruhi performa model

d)

Nilai k yang lebih besar selalu lebih baik

87.

Apa perbedaan antara linear regression dan logistic regression?

a)

Linear regression digunakan untuk klasifikasi, sedangkan logistic regression untuk regresi

b)

Linear regression memprediksi nilai kontinu, sedangkan logistic regression memprediksi kelas

c)

Logistic regression digunakan dalam supervised learning, sedangkan linear regression dalam unsupervised learning

d)

Linear regression tidak membutuhkan dataset berlabel

88.

Contoh algoritma dalam unsupervised learning adalah...

a)

Support Vector Machine (SVM)

b)

Naïve Bayes

c)

K-Means

d)

Linear Regression

89.

Apa prinsip dasar dari algoritma K-Means Clustering?

a)

Membagi data ke dalam k kelompok berdasarkan kesamaan

b)

Memanfaatkan jaringan saraf tiruan untuk mengelompokkan data

c)

Menentukan kelas data berdasarkan perhitungan probabilitas

d)

Menggunakan bobot dan bias untuk memisahkan klaster

90.

Bagaimana cara menentukan jumlah k (cluster) yang optimal dalam algoritma K-Means?

a)

Dengan menebak jumlah klaster berdasarkan intuisi

b)

Dengan menggunakan metode Elbow

c)

Dengan menghitung jumlah total data dibagi dua

d)

Dengan memilih jumlah klaster sebanyak mungkin

91.

Bagaimana cara kerja unsupervised learning?

a)

Menggunakan data berlabel untuk memprediksi nilai

b)

Mengelompokkan data berdasarkan pola yang ditemukan

c)

Melatih model menggunakan pasangan input-output

d)

Memanfaatkan algoritma genetika untuk mencari solusi terbaik

92.

Macam-macam definisis AI salah satunya disebut bertindak seperti manusia, yaitu

a)

thinking humanly

b)

acting humanly

c)

thinking rasionaly

d)

acting rasionaly

93.

clustering termasuk dalam

a)

unsupervised learning

b)

supervised learning

c)

reinforcement learning

d)

semi supervised learning

94.

Algoritma ini memerlukan data berlabel untuk membangun sebuah model yang tingkat akurasinya bisa ditingkatkan dari waktu ke waktu, disebut

a)

supervised learning

b)

unsupervised learning

c)

reinforcement learning

d)

semi supervised learning

95.

regression termasuk dalam algoritma

a)

supervised learning

b)

unsupervised learning

c)

reinforcement learning

d)

semi supervised learning

96.

Algoritma Decision Tree C.45 tergolong jenis

a)

supervised Learning

b)

unsupervised learning

c)

reinforcement learning

d)

semi supervised learning

97.

metode pada supervised learning yang mengembalikan target numerik untuk setiap sampel disebut model

a)

regresi

b)

klasifikasi

c)

clustering

98.

metode Unsupervised Learning yang bertujuan untuk melakukan pengelompokan data berdasarkan kemiripan atau jarak antar data.

a)

clustering

b)

klasifikasi

c)

regresi

99.

mengetahui perkiraan waktu tempuh dalam aplikasi GMap, termasuk alam task

a)

klasifikasi

b)

estimasi

c)

forecasting

d)

clustering

100.

yang termasuk data terstruktur adalah

a)

data tabular

b)

data berorientasi objek

c)

time series

d)

data teks dalam dokumen teks bebas