wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Data Mining

Total questions: 95

Worksheet time: 48mins

Name
Class
Date
1.

Langkah kedua dari algoritma PCA adalah menstandarisasi data. Jika diketahui data input seperti tabel dibawah ini, maka data standard (dataAdjust) dari data Hours (H) adalah

4 lines
2.

Termasuk dalam metode penyelesaian masalah dalam data mining adalah

a)

Relasi

b)

Prediksi

c)

Klasifikasi

d)

Relationship

e)

Asosias

3.

Dalam data mining apa saja peran yang tipe datanya berupa numerik saja?

a)

asosiasi

b)

clustering

c)

klasifikasi

d)

prediksi

e)

estimasi

4.

Kumpulan dari objek dan atributnya disebut

a)

Data

b)

Himpunan

c)

Himpunan data

d)

Atribut data

e)

Objek data

5.

Cluster: kumpulan objek data atau anggota cluster yang sama memiliki kemiripan satu sama lain, tetapi berbeda dengan anggota cluster lain, berikut ini algoritma yang termasuk didalmnya:

a)

K-MEDOID

b)

Perceptron.

c)

Naïve Bayes

d)

K-NearestNeighbours (K-NN)

6.

Untuk melakukan tahapan pre processing, klik menu...

a)

Experimenter

b)

Explorer

c)

Vizualization

d)

Program

7.

Untuk mengevaluasi model klasifikasi yang sudah kita bangun, sebaiknya kita periksa dengan

a)

Precision

Recall

Akurasi

Dunn Index

b)

Akurasi

Sensitivity

Specificity

Sillhouette score

c)

Cross-validation

Leave-one-out

d)

F1-score

Akurasi

Recall

Precision

8.

Apa itu data mining?

a)

Disiplin ilmu yang fokusnya pada pencarian data pada suatu organisasi/industri

b)

Disiplin ilmu yang mempelajari berbagai teknik statistika untuk menyelesaikan masalah pribadi

c)

Disiplin ilmu yang mempelajari metode untuk

mengekstrak pengetahuan atau menemukan pola dari suatu data yang besar

d)

Disiplin ilmu yang tujuannya mengubah data mentah (raw data) informasi yang lebih bersih dan bisa digunakan untuk pengolahan data

9.

Library dasar python yang digunakan untuk memasukkan data (import) dari berbagai format: CSV, file teks, Ms.Excel, database SQL,dan format HDF5 adalah

a)

numpy

b)

pandas

c)

matplotlib

d)

Scikit-learn

10.

Berdasarkan jenis pembelajarannya, algoritma melakukan proses belajar berdasarkan nilai dari variabel target yang terasosiasi dengan nilai dari variabel

prediktor disebut .....

a)

Supervised Learning

b)

Unsupervised Learning

c)

Semi-Supervised Learning

d)

Reinforcement Learning

11.

Tujuan utama dari data mining adalah

a)

Pencarian data

b)

Pencarian pola

c)

Pencarian database

d)

Pencarian relationship

e)

Pengeditan data

12.

Pihak penyusun kebijakan kampus membutuhkan pola kelulusan mahasiswa agar bisa memprediksi lulus tepat waktu atau tidak, maka perlu dilakukan metode :

a)

Clustering

b)

Asosiasi

c)

Estimasi

d)

Klasifikasi

13.

Decision Tree (CART, ID3, C4.5, Credal DT, Credal C4.5, Adaptative Credal C4.5), Naive Bayes (NB), K-Nearest Neighbor (kNN), Linear Discriminant Analysis (LDA), Logistic Regression (LogR) adalah algoritma yang bisa digunakan untuk metode ....

a)

Klasifikasi

b)

Clustering

c)

Asosiasi

d)

Estimasi

14.

Berikut ini yang bukan masalah pada data yang luar biasa banyaknya adalah:

a)

Jumlah data yang luar biasa

b)

Data berdimensi tinggi

c)

Aplikasi baru dan canggih

d)

Visualisasi data harus berwarna

15.

Pengelompokan data mining berikut ini, kecuali

a)

Klasifikasi

b)

Prediksi

c)

Kluster

d)

Transaksi

16.

1.    Buatlah Jaringan Syaraf Tiruan (JST) untuk melakukan fungsi logika “AND” dengan input biner dan target bipolar menggunakan algoritma Perceptron sebagai berikut:

Learning rate (α)= 0,8); Threshold (θ) = 0,5; Bias (b) = 0; bobot (w1=w2) = 0

4 lines
17.

Objek data dengan sifat yang berbeda sekali dari kebanyakan objek data dalam data-set

a)

Noise

b)

Missing value

c)

Outliers

d)

Precision

e)

Duplicate data

18.

Ada berapa peran penting data mining?

a)

3

b)

4

c)

5

d)

6

19.

Banyaknya jumlah atribut dalam data yang akan diproses pada data mining disebut sebagai...

a)

Scalability

b)

Dimensionality

c)

Data quality

d)

Streaming data

e)

Privacy preservation

20.

Eigenvector dari M merupakan vektor tidak nol e sedemikian hingga berlaku Mele. Jika diketahui l=1 dan M =  (seperti pada gambar) maka vektor eigen e yang paling tepat adalah

a)

[2 2 1]

b)

[-1 1 3]

c)

[-1 0 2]

d)

[0 1 0]

21.

Provider Internet IndiGoHome memiliki data tabel kepuasan pelanggan dengan informasi tentang masing-masing pelanggan pada tiap barisnya dan status kepuasan mereka. Dalam data mining, status kepuasan di sini bisa dijadikan LABEL/KELAS/TARGET. Lalu, informasi masing-masing pelanggan di tiap baris disebut (pilih SEMUA jawaban yang Anda anggap BENAR)

a)

Variabel Independen

b)

Feature

c)

Atribut

d)

Dimensi (dimension)

22.

Wakanda Research Center ingin mengklasifikasikan penduduk menjadi miskin dan tidak miskin. Jika kita asumsikan bahwa kelas/label miskin adalah kelas/label positif. Maka jika seseorang diprediksi oleh model sebagai miskin, ternyata TIDAK. Maka kondisi ini disebut

a)

False Negative

b)

True Positive

c)

True Negative

d)

False Positive

23.

Kodepos, dan atribut yang memiliki himpunan nilai yang berhingga maupun yang tak berhingga tetapi bisa dihitung termasuk dalam kelompok atribut

a)

Diskrit

b)

Kontinyu

c)

Interval

d)

Nominal

e)

Biner

24.

Tujuan utama dari data mining adalah

a)

Pencarian data

b)

Pencarian pola

c)

Pencarian database

d)

Pencarian relationship

e)

Pengeditan data

25.

Diketahui vektor data biner dari dua buah obyek x,y adalah x = {1,0,1,1,1,1} dan y = {0,0,1,1,0,0} maka similaritas dari dua obyek tersebut jika diukur dengan Koefisien Jaccard adalah

a)

1/6

b)

2/6

c)

1/4

d)

2/5

26.

Pada gambar berikut ini Jelaskan 2 Peran Utama Data Mining diantara 5 dibawah ini:

4 lines
27.

Berikut ini merupakan manfaat dari data mining, kecuali...

a)

Mengetahui tren pasar

b)

Mengamati perilaku konsumen

c)

Menyusun strategi penjualan

d)

Semua Benar

28.

Proses pendiskritan (discretization) yang merupakan proses merubah data tipe kontinyu menjadi tipe katagorikal diperlukan jika kita akan menerapkan teknik data mining

a)

clustering

b)

klasifikasi

c)

analisa asosiasi

d)

regresi

29.

Proses menghilangkan fitur/atribut yang tidak diperlukan terdapat dalam proses

a)

Pembersihan data

b)

Reduksi data

c)

Transformasi data

d)

Integrasi data

e)

Penambahan data

30.

Perhatikan gambar. Hasil klasifikasi disajikan pada bagian....

a)

Result List

b)

Test Option

c)

Classifier Output

d)

Status

31.

Contoh data set jenis Record

a)

Data dokumen

b)

Data transaksi

c)

Data spasial

d)

Matrik data

32.

Ada 5 peran utama data mining, yaitu:

a)

estimasi, forecasting, klasifikasi, klastering, dan visualisasi

b)

estimasi, transformasi data, klasifikasi, klastering, dan visualisasi

c)

estimasi, forecasting, klasifikasi, klastering, dan asosiasi

d)

estimasi, korelasi, klasifikasi, klastering, dan asosiasi

33.

Mr. Data Halilintar adalah seorang data scientist. Dia membuat model untuk mendiagnosa apakah seseorang terkena Covid-19 varian Omicron atau tidak. Ada 2 kelas/label status sakitnya: positif dan negatif. Menurut Anda, selain akurasi (rasio True Positive dan True Negative) dan F1-score, untuk kasus ini evaluasi apa yang seharusnya LEBIH diperhatikan? (Clue: perhatikan mana yang lebih baik dihindari, apakah False Positive atau False Negative?)

a)

Precision

b)

Recall

c)

Akurasi dan F1-score aja cukup

d)

Ampun, Pak, saya bingung

34.

Data mining adalah...

a)

Penambangan Data

b)

Kumpulan Data

c)

Gudang Data

d)

Inisialisasi Data

35.

Pemilihan dan penerapan teknik yang sesuai untuk mencapai tujuan (misalnya menerapkan decision tree C.45 pada peran klasifikasi), disebut pada fase .....

a)

Evaluation

b)

Deployment

c)

Modeling

d)

Data Understanding

36.

Data Mining adalah

a)

Melakukan ekstraksi untuk mendapatkan informasi penting yang sifatnya implisit dan sebelumnya tidak diketahui, dari suatu data

b)

Ekstraksi informasi atau pola yang menarik (non-trivial, implicit,

previously unknown dan potentially useful) dalam basis data berukuran besar

c)

Disiplin ilmu mengolah himpunan data yang sangat besar menjadi suatu pengetahuan, rumus, pola sehingga nanti dapat dimanfaatkan manusia untuk memprediksi kejadian kedepan dari kehidupan manusia

d)

Teknik tradisional yang mampu melakukan analisis data yang berukuran besar

37.

Pada tahap Business Understanding, hal yang tidak perlu dilakukan adalah:

a)

Menerjemahkan tujuan dan batasan ruang lingkup ke dalam formulasidari definisi masalah data mining.

b)

Menyiapkan strategi awal untuk mencapai tujuan bisnis atau unit penelitian.

c)

Menulis source code agar software yang dibangun sesuai dengan analisis kebutuhan pelanggan

d)

Menentukan tujuan dan persyaratan proyek bisnis atau unit penelitian dengan jelas.

38.

Yang tidak termasuk dalam penanganan missing value adalah

a)

Menambah objek data

b)

Mengurangi objek data

c)

Memperkirakan missing value

d)

Mengabaikan missing value pada saat analisis

e)

Mengganti dengan semua nilai yang mungkin

39.

Jika dimasukkan angka 70 pada pilihan Percentage Split, maka berarti....

a)

70% data digunakan pada saat pengujian

b)

30% data digunakan sebagai data training

c)

70% data digunakan sebagai data Testing

d)

70% data digunakan sebagai data training

40.

Data mining digunakan untuk melakukan information discovery yang ditujukan untuk

a)

Data analyst

b)

Programmer

c)

Network enginer

d)

Database administrator

e)

Operator komputer

41.

Nama lain dari Data Mining adalah

a)

Knowledge discovery

b)

Pattern analysis

c)

Information harvesting

d)

Knowledge Discovery in Database (KDD)

42.

Dalam Data Processing ada tugas utama pemrosesan awal data, berikut ini adalah:

a)

Pembersihan data, Integrasi data, Transformasi data, Reduksi data, Diskritisasi data

b)

Menangani Data Hilang, Noisy Data, Reduksi data, Diskritisasi data

c)

Pemasukan data, Transmisi data, Reduksi data, Diskritisasi data

43.

Akurasi adalah

a)

Ukuran di mana model data mining diterapkan pada dataset yang berbeda.

b)

Ukuran dari seberapa baik model mengkorelasikan antara hasil dengan atribut dalam data yang telah disediakan.

c)

Ukuran apakah model tersebut memberikan informasi yang

berguna.

d)

Ukuran yang menentukan faktor atau parameter yang menyebabkan class/label/target terjadi.

44.

Berdasarkan jenis/metode pembelajarannya, maka clustering termasuk dalam ....

a)

Supervised Learning

b)

Unsupervised Learning

c)

Semi Supervised Learning

d)

Reinforcement Learning

45.

Contoh metode klasifikasi yang menggunakan prinsip probabilitas dan Teorema Bayesian, adalah

a)

Naive Bayes

b)

Decision Tree

c)

KNN

d)

Neural Network

46.

Data adalah...

a)

Fakta yang terekam dan tidak membawa arti

b)

Pola, rumus, aturan atau model yang muncul dari data

c)

Segala fakta, angka atau teks yang dapat diproses oleh

komputer

47.

Perhatikan gambar. Kotak berwarna orange menyatakan....

a)

Data Training

b)

Data Testing

c)

Data set

d)

Fold

48.

Proses pengurangan dimensi (dimensionality reduction) sangat diperlukan jika kita akan menerapkan teknik data mining

a)

Clustering

b)

Klasifikasi

c)

Asosiasi

d)

regresi

49.

Evaluasi kualitas data (misalnya cek outlier, missing value) dilakukan pada tahap apa pada metodologi CRISPDM?

a)

Business Understanding

b)

Data Preparation

c)

Deployment

d)

Data Understanding

50.

Apabila berperan sebagai end user, tugasnya dalam data mining adalah

a)

mempresentasikan data

b)

mengeksplorasi data

c)

menggabungkan data

d)

membuat keputusan

51.

Berikut adalah nama lain dari Data Mining, kecuali...

a)

Knowledge discovery

b)

Pattern analysis

c)

Information harvesting

d)

Knowledge Discovery in Database (KDD)

52.

Dibawah ini yang merupakan unsur yang membedakan antara data, informasi, dan pengetahuan

a)

Volume

b)

Fungsional

c)

Integrasi

d)

Semua Salah

53.

Tantangan dalam data mining adalah besarnya ukuran basis data yang digunakan disebut

a)

Dimensionality

b)

Scalability

c)

Complex and heterogeneous data

d)

Privacy Preservation

e)

Streaming data

54.

Jika diketahui vektor data dua dimensi dari tiga buah obyek adalah A: (0.5, 0.5), B: (0, 1), C: (1.5, 1.5), dan invers matriks covariance pada gambar   

maka jarak mahalanobis antara A dan C

a)

3

b)

3.5

c)

4

d)

4.5

55.

Berikut ini merupakan tujuan dari proses aggregation, kecuali

a)

Mengurangi jumlah atribut atau obyek

b)

Mendapatkan hasil pengolahan data secara langsung

c)

Perubahan skala

d)

Penstabilan data yang akan diolah dalam data mining

56.

Dilihat dari sudut pandang keilmuan, Data Mining diperlukan karena....

a)

Tekanan kompetisi semakin kuat

b)

Teknik tradisional tidak mampu melakukan analisis data yang berukuran besar

c)

Data Mining membantu ilmuan dalam klasifikasi dan segmentasi data, pemodelan data juga clustering data

d)

Data dikumpulkan dan disimpan dengan kecepatan tinggi (GB/hour)

57.

Tujuan utama dari data mining adalah

a)

Pencarian data

b)

Pencarian pola

c)

Pencarian database

d)

Pencarian relationship

e)

Pengeditan data

58.

Data berikut ini yang merupakan jawban yang benar dari perlakuan Proses klasifikasi dalam data mining adalah...

a)
b)
c)
d)

Semua Benar

59.

Waktu Pengiriman Pizza dapat dihitung dengan formula/rumus hasil dari teknik data mining :

a)

Asosiasi

b)

Klasifikasi

c)

Estimasi

d)

Clustering

60.

Berikut ini yang bukan merupakan Data Mining adalah :

a)

Pengelompokkan informasi yang mirip dalam konteks

tertentu pada hasil pencarian

b)

Peneliti medis mencari pengelompokkan data penyakit

pasien berdasarkan data diagnosis, umur, dsb.

c)

Analisis gambar laporan keuangan penjualan perusahaan

d)

Pemanfaatan data penjualan perusahaan untuk

mendapatkan pola prediksi stok yang sebaiknya

disediakan pada tahun berikutnya

61.

Dari sudut pandang komersil, mengapa Data Mining diperlukan?

a)

Data over load

b)

Teknologi komputer menjadi lebih murah dan powerful

c)

Tekanan kompetisi yang mudah

62.

Angka 0,75 atau ¾ , berdasarkan jumlah nilainya dapat dikelompokkan kedalam atribut

a)

Diskrit

b)

Kontinyu

c)

Interval

d)

Nominal

e)

Biner

63.

Apabila ingin memprediksi cuaca pada tanggal 5 November 2021 pada jam 08.00, maka teknik data mining yang dipilih adalah.....

a)

Clustering

b)

Forecasting

c)

Asosiasi

d)

Klasifikasi

64.

Kita memiliki data yang ternyata imbalance. Hal-hal berikut yang sebaiknya dilakukan adalah, KECUALI

a)

Upsampling kelas yang jumlah datanya sedikit

b)

Downsampling kelas yang jumlah datanya banyak

c)

Biarkan saja. Cukup dipastikan agar F1-score atau kappa statistic-nya tinggi

d)

Negative samples

65.

Klasifikasi, terdapat target variable kategori, berikut ini Contohnya...

a)

Prediksi harga beras Dalam Tiga Bulan tang akan Datang

b)

Akan dilakukan estimate tekanan Darah sistolik pada pasien rumah sakit berdasrkan umur pasien, Jenis kelamin, indeks berat badan.

c)

Kelompok-kelompok konsumen untuk target pemasaran dari Suatu produk bagi perusahaan yang tidak memiliki dana pemasaran yang besar.

d)

Mendiagnosis penyakit pasien untuk mendapatkan termasuk golongan penyakit apa.

66.

Jenis data dilihat dari akumulasi pertumbuhan jumlah data dan basis data yang berbeda adalah...

a)

Data operasional atau transaksional

b)

Data Non operational

c)

Meta data

d)

Data Non transaksional

67.

Pernyataan dibawah ini yang bukan peranan utama data mining adalah...

a)

Klasifikasi

b)

Klasterisasi

c)

Asosiasi

d)

Semua Benar

68.

Aktifitas Pre Processing dilakukan pada tahapan...

a)

Business Understanding

b)

Data Understanding

c)

Data Preparation

d)

Modeling

69.

Park Soe Kim, dosen asal Korea kelahiran Semarang sangat tidak suka dengan metode K-means clustering karena mesti memilih manual jumlah cluster yang akan dicari. Untuk menghindari kelemahan K-means, di mana jumlah clusternya harus ditentukan di awal, kita bisa memilih alternatif metode lain yaitu

a)

DBSCAN (Density Based)

b)

K-medoid

c)

Fuzzy clustering, misalnya Fuzzy c-means

d)

K-modes

70.

Metode klasifikasi yang hasil pemodelannya berupa pohon adalah :

a)

Neural Network

b)

C4.5

c)

KNN

d)

Naive Bayes

71.

Tiga jenis data set berdasarkan golongannya yaitu

a)

Record

b)

Data Dokumen

c)

Graph

d)

Ordered Data

72.

Kumpulan dari objek dan atributnya disebut

a)

Data

b)

Himpunan

c)

Himpunan data

d)

Atribut data

e)

Objek data

73.

Pada proses data preparation (persiapan data) , dilakukan beberapa tahap ini, kecuali .....

a)

data cleaning

b)

data integration

c)

data mining

d)

data transformation

74.

Sebutkan yang termasuk peran penting data mining

a)

asossiasi, estimasi, supervised learning

b)

prediksi, unsupervised learning, clustering,

c)

estimasi, prediksi, klasifikasi

d)

estimasi, prediksi, klasifikasi, naive bayes

75.

Korelasi antara X=(0,-1,0,1) dan Y=(1,0,-1,0) adalah

a)

-1

b)

0

c)

1

d)

0.22

76.

Tujuan utama dari data mining adalah

a)

Pencarian data

b)

Pencarian pola

c)

Pencarian database

d)

Pencarian relationship

e)

Pengeditan data

77.

Pemilik warung membutuhkan pola belanja pelanggannya karena akan memberikan diskon atau paket khusus kepada pelanggannya. Hal ini dapat diselesaikan menggunakan :

a)

Asosiasi

b)

Estimasi

c)

Forecasting

d)

Klasifikasi

78.

Proses dalam Knowledge Discovery

a)

Himpunan Data - Metode Data Mining - Pengetahuan - Evaluation

b)

Evaluation- Pengetahuan- Metode Data Mining - Himpunan Data

c)

Himpunan Data - Pengetahuan - Metode Data Mining - Evaluation

79.

Data tidak konsisten karena berasal dari sumber data yang berbeda sehingga format data tidak sama.

a)

Benar

b)

Salah

80.

Dua tugas dalam metode Data Mining adalah...

a)

Metode Linear & Metode Statistika

b)

Metode Clustering & Metode Asosiasi

c)

Metode Prediksi & Metode Deskripsi

81.

Nilai K dalam k-NN menyatakan jumlah....

a)

Tetangga terdekat

b)

bootstrap

c)

Iterasi

d)

Cluster

82.

Proses dalam Data Mining adalah...

a)

Himpunan Data - Metode Data Mining - Pengetahuan - Evaluation

b)

Pengetahuan- Metode Data Mining - Himpunan Data - Evaluasi

c)

Himpunan Data - Pengetahuan - Metode Data Mining - Evaluasi

d)

Himpunan Data - Pengetahuan - Evaluasi - Metode Data Mining

83.

Latar belakang praproses data dikarenakan data yang tidak komplit, data yang noisy, dan data yang tidak konsisten.

a)

Benar

b)

Salah

84.

Data tidal komplit Karena masala manusia, perangkat eras dan perangkat lunar.

a)

Benar

b)

Salah

85.

Tahapan pada praproses data yaitu pembersihan data, integrasi data, trasformati data, reduci data dan diskriminasi data.

a)

Benar

b)

Salah

86.

Berikut adalah kegiatan yang dilakukan pada tahapan Pre processing data, kecuali ...

a)

Data Cleaning

b)

Data Transformation

c)

Data Reduction

d)

Pemisahan data training dan data testing

87.

Pada percobaan klasifikasi menggunakan data set Weather (dengan jumlah data 14 record), bila pada Test Option dipilih Cross Validation maka jumlah data yang digunakan pada saat pengujian model adalah...

a)

4

b)

14

c)

10

d)

2

88.

Salah satu kekurangan Algoritma KNN adalah kurang tepat jika digunakan pada data...

a)

Seimbang

b)

Tidak seimbang

c)

Numerik

d)

Kategorikal

89.

Algoritma C4.5 pada aplikasi WEKA disebut dengan...

a)

J48

b)

iBK

c)

SMO

d)

Random Tree

90.

Nilai K pada k-fold Cross Validation menunjukkan jumlah...

a)

Tetangga Terdekat

b)

Bootstrap

c)

Iterasi

d)

Cluster

91.

Salah satu tujuan praproses yaitu untuk menghasilkan hasil mining yang berkualitas

a)

Benar

b)

Salah

92.

Data yang tidak komplit artinya format data berubah-ubah karena berasal dari sumber data yang berbeda.

a)

Benar

b)

Salah

93.

Proses standar pada Data Mining disebut dengan CRISP-DM yang merupakan singkatan dari...

a)

Cross-International Standard Process for Data Mining

b)

Cross-Industry Standard Processing for Data Mining

c)

Cross-Industry Standard Process for Data Mining

d)

Crossed-Industry Standard Process for Data Mining

94.

Output dari Data Mining adalah Knowledge (pengetahuan). Berikut adalah jenis pengetahuan yang dihasilkan dari proses Data Mining, kecuali....

a)

Cluster

b)

Rumus atau fungsi

c)

Akurasi

d)

Aturan (Rule)

95.

Data noisy artily data mengandung error/outlier karena terdapat kesalahan dalam penggunaan alat, kesalahan manusia atau komputer pada saat memasukkan data..

a)

Benar

b)

Salah