wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

TAS Data Processing For Business UKSW

Total questions: 100

Worksheet time: 52mins

Name
Class
Date
1.

Data mining adalah ...

a)

Pencarian atau penambangan data dari sebuah database yang sudah rapi terstruktur

b)

Proses penarikan data yang sangat besar untuk diterjemahkan ke dalam database yang besar sehingga memudahkan pengambilan keputusan suatu masalah dan juga sebagai prediksi masa depan.

c)

Penambangan data untuk memaksimalkan keuntungan dan nilai dari pelanggan.

d)

Proses pengolahan data yang sangat besar untuk dalam database yang besar untu pengambilan keputusan di masa depan. 

e)

 Teknik untuk menemukan pola nyata yang tidak bersembunyi di balik big data.

2.

Tahapan Simulasi Monte Carlo adalah, kecuali ...

a)

Menentukan distribusi probabilitas yang diketahui dari beberapa variabel kunci.

b)

Mengubah distribusi frekuensi ke dalam distribusi probabilitas kumulatif.

c)

Mengambil sampel secara runut dari distribusi kumulatif untuk menentukan nilai variabel  yang umum untuk digunakan dalam simulasi.

d)

Mengambil sampel secara acak dari distribusi kumulatif untuk menentukan nilai variabel  yang spesifik untuk digunakan dalam simulasi.

e)

Mensimulasikan operasi yang dianalisis dalam jumlah replikasi yang sesuai dibutuhkan  dalam kondisi yang sama seperti ukuran sampel yang sesuai pada percobaan dunia  nyata.

3.

Random Number Generator (RNG) adalah ...

a)

algoritma yang digunakan untuk menghasilkan urut-urutan (sequence) dari angka sebagai hasil perhitungan dengan komputer yang diketahui distribusinya sehingga angka-angka tersebut muncul secara random dan digunakan terus-menerus.

b)

algoritma yang digunakan untuk menghasilkan angka random yang diketahui distribusinya sehingga angka-angka tersebut muncul terus-menerus.

c)

algoritma perhitungan dengan komputer yang memunculkan angka-angka secara random dan terus-menerus.

d)

Pembangkit Bilangan Acak (manual)

4.

Sifat Random Number Generator diantaranya, ...

a)

Kemunculannya dapat diprediksi.

b)

Ada komputasi yang benar-benar menghasilkan deret bilangan acak secara sempuna

c)

Bilangan acak yang dibangkitkan oleh komputer adalah bilangan acak semu (Pseudo Random Number), karena menggunakan rumus-rumus matematika

d)

Bilangan acak tidak dapat dibangkitkan dengan pola tertentu yang dinamakan dengan distribusi mengikuti fungsi distribusi yang ditentukan

e)

Kemunculannya terprediksi karena basis data yang terstruktur.

5.

Game Theory =

a)

Cara mengambil keputusan setelah merespon keputusan yang diambil oleh pemain lain.

b)

Cara yang memenangkan permainan agar lawan tidak membalas.

c)

Teori yang menganalisis bagaimana kita mengambil keputusan setelah merespon keputusan yang diambil oleh pemain lain.

d)

Teori yang menganalisis bagaimana lawan mengambil keputusan setelah merespon keputusan yang diambil oleh kita.

6.

4 Elemen Game Theory: (kecuali)

a)

Equilibrium (Keseimbangan Optimal dimana pemain tidak lagi dapat merubah posisinya)

b)

Output (Hasil yang diperoleh dari setiap keputusan)

c)

Strategy (Aturan yang diperbolehkan)

d)

Player (Pengambil Keputusan yang Rasional)

e)

Disequilibrium (Ketidakseimbangan dimana pemain masih dapat merubah posisinya)

7.

Ciri-ciri Game Theory : (kecuali)

a)

Jumlah pemain terbatas.

b)

Untuk setiap pemain, ada sejumlah kemungkinan tindakan yang terbatas.

c)

Ada pertentangan kemungkinan (conflict of interest) antara pemain.

d)

Aturan permainan untuk mengatur di dalam memilih tindakan diketahui oleh setiap pemain

Hasil seluruh kombinasi hal yang mungkin dilakukan merupakan bilangan real , positif, negatif atau nol.

e)

berhubungan dengan  pengambilan keputusan ketika   kompetisi

8.

Apa makna dari tabel tersebut??

a)

Jika A memilih strategi pertama dan B  memilih strategi kedua, maka hasilnya +4  artinya B akan memperoleh 4 sedangkan A  akan kehilangan 4 (A harus memberikan 4 kepada B).

b)

Jika A memilih strategi ketiga dan B  memilih strategi kedua, maka hasilnya -3  artinya A akan memperoleh 3 sedangkan B  akan kehilangan 3 (B harus memberikan 3 kepada A).

c)

Jika A memilih strategi kedua dan B  memilih strategi pertama maka hasilnya -1. Artinya A kehilangan satu unit dan harus memberikannya ke B (B memenangkan satu unit)

d)

Jika A memilih strategi kedua dan B  memilih strategi kedua, maka hasilnya 2  artinya B akan memperoleh 2 sedangkan A  akan kehilangan 2 (A harus memberikan 2 kepada B).

9.

Berapa nilai maximin/minimax yang benar?

a)

Nilai Maximin nya : 2, -1, 1

b)

Nilai Minimax nya: 6, 2, 7

c)

Nilai Maximin nya: 7, 4, 9

d)

Nilai Minimax nya: 6, 5, 9

10.

Hitung Nilai Maximin dan Minimax dan

Tentukan Saddle Point nya... (wajib diisi dengan benar karena bobot soal ini = 5 poin)

4 lines
11.

Pengukuran dilakukan dengan variasi pengukuran dari kuantitas yang sedang diukur dengan pengukuran antara mean dan nilai kuantitas yang diketahui, adalah jenis kesalahan pengukuran

a)

Noise

b)

Bias

c)

Presisi

d)

Akurasi

e)

Prediksi

12.

Tiga metode dari Data Mining yaitu, kecuali...

a)

Prediction (Classification, Regression, dan Time Series)

b)

Regression (Linear/Nonlinear, ANN, dan Regression Trees. 

Time Series menggunakan Autoregressive Methods, Averaging Methods, Exponential Smoothing, dan ARIMA)

c)

Association (Decision Trees, Neural Networks, Support Vector Machines, kNN, Naïve Bayes, dan GA)

d)

Segmentation (Clustering dan Outlier analysis)

13.

Tiga proses Data Mining, kecuali...

a)

KDD atau Knowledge Discovery in Databases Process melakukan prosesnya dengan memilih data terlebih dahulu, membersihkan data sehingga menjadi data yang diperlukan saja, mengubah data tersebut, mengekstrak pola/pattern yang ada, kemudian melakukan internalisasi terhadap pola/pattern yang telah diekstrak tersebut.

b)

SEMMA atau Sample, Explore, Modify, Model, and Assess melakukan prosesnya sesuai dengan namanya, pertama-tama memilih sampel dari data, kemudian melakukan visualisasi dari data tersebut, memilih variabel, kemudian hasilnya digunakan ke dalam model, terakhir mengevaluasi untuk akurasi dan kegunaan dari model tersebut.

c)

K-Fold Cross Validation, data dipisahkan dengan jumlah yang sama kedalam subsets kemudian dilakukan training/testing.

d)

CRISP-DM atau Cross-Industry Standard Process for Data Mining melakukan prosesnya dengan memahami bisnisnya terlebih dahulu, kemudian memahami datanya dan mempersiapkan data tersebut untuk diproses, kemudian membuat model yang sesuai dengan kemauan, melakukan percobaan dan evaluasi, terakhir penerapan dari model tersebut.

14.

Nama lain dari tabel ini adalah ...

a)

Colussion matrix

b)

Confused matrix

c)

Confusious matrix

d)

Confusion matrix

15.

Pilih jawaban yang salah dari Algoritma K-Means

a)

Biasanya user sudah mempunyai informasi awal tentang objek yang sedang dipelajari, Secara detail user bisa menggunakan ukuran ketidak-miripan untuk mengelompokan obyek.

b)

Teknik clustering yang paling sederhana dan umum dikenal adalah clustering K-Means. Dalam teknik ini kita ingin mengelompokan obyek kedalam K kelompok atau Cluster. 

Untuk melakukan clustering, nilai K harus ditentukan terlebih dahulu. 

c)

Algoritma K-Means sederhana untuk diimplementasikan dan dijalankan, relative cepat, mudah beradaptasi, umum dalam penggunaannya dalam praktek. 

d)

Algoritma K-Means merupakan algoritma pengelompokan iterative yang melakukan partisi set data ke dalam jumlah K cluster yang sudah ditetapkan di awal. 

e)

Klasifikasi berdasar jarak antar data adalah klasifikasi data dengan mengelompokkan data ke dalam beberapa kelompok, data (cluster) yang memiliki karakteristik yang berbeda.

16.

Jika dalam sebuah data set terdapat 5 kelas, maka berapa nilai K yang seharusnya ditetapkan?

a)

4

b)

5

c)

6

d)

7

17.

Semua pernhyataan disini benar, kecuali ...

a)

Klasifikasi dicirikan dengan data training mempunyai label, berdasarkan label ini proses klasifikasi memperoleh pola attribut dari suatu data.

b)

Proses klasifikasi biasanya dibagi menjadi dua fase : learning dan test.

 Pada fase learning, sebagian data yang telah diketahui kelas datanya diumpankan untuk membentuk model perkiraan. 

Kemudian pada fase test model yang sudah terbentuk diuji dengan sebagian data lainnya untuk mengetahui akurasi dari model tsb. Bila akurasinya mencukupi model ini dapat dipakai untuk prediksi kelas data yang belum diketahui. 

c)

Model bisa berupa aturan “jika-maka” = decision tree, formula matematis atau neural network. 

d)

Klasifikasi adalah proses untuk menemukan model atau fungsi yang menjelaskan atau membedakan konsep atau kelas data, dengan tujuan untuk dapat memperkirakan kelas dari suatu objek yang labelnya tidak diketahui. 

e)

Proses untuk menemukan model atau fungsi yang membedakan data atau kelas data, dengan tujuan untuk dapat membagi kelas dari suatu objek yang labelnya diketahui. 

18.

Fakta tentang Klasifikasi (Decision Tree) kecuali ...

a)

Proses pada Decision Tree adalah mengubah bentuk data (tabel) menjadi bentuk Tree dan Mengubah Tree menjadi Rule, serta menyederhanakan Rule.

b)

Decision tree adalah struktur yang dapat digunakan untuk membagi data yang besar menjadi himpunan record yang lebih kecil dengan menerapkan serangkaian aturan keputusan.

c)

Decision Tree sangat cocok untuk visualisasi data 

karena dapat informasi yang berguna meski tanpa hard data. 

Tiap data yang digunakan dalam prosesnya hanya memerlukan persiapan maksimal.

d)

Decison Tree merupakan struktur data yang terdiri dari nodes (simpul) dan (rusuk).

Algoritma yang digunakan untuk membentuk Decision Tree, diantaranya: CART, ID3, C4.5 

Algoritma C4.5 adalah pengembangan dari ID3

19.

Decision Tree sangat cocok untuk, kecuali ...

a)

Training data yang tidak lengkap

b)

Training data yang lengkap dan terstruktur

c)

Data Diskrit dengan output diskrit

d)

Data dalam bentuk atribut-nilai.

20.

Pernyataan tentang Atribut yang benar adalah ...

a)

Atribut untuk menentukan main tenis, kriteria yang diperhatikan adalah sepatu, baju dan raket.

b)

Atribut memiliki nilai-nilai yang dinamakan dengan instance. Misalkan atribut cuaca mempunyai instance berupa gerah, terbakar dan berkeringat.

c)

Salah satu atribut merupakan atribut yang menyatakan data solusi semua data yang disebut dengan target atribut.

d)

Atribut menyatakan suatu parameter yang dibuat sebagai kriteria dalam pembentukan tree.

21.

Definisi tentang Entropy , kecuali ...

a)

Entropy bisa dikatakan sebagai kebutuhan bit untuk menyatakan suatu kelas.

b)

Entropy(S) adalah jumlah bit yang diperkirakan dibutuhkan untuk dapat mengekstrak suatu kelas (+ atau -) dari sejumlah data acak pada ruang sample S.

c)

Semakin kecil nilai Entropy maka semakin jelek untuk digunakan dalam mengekstraksi suatu kelas.

d)

Panjang kode untuk menyatakan informasi secara optimal adalah –log2 p bits untuk messages yang mempunyai probabilitas p.

e)

Semakin kecil nilai Entropy maka semakin baik untuk digunakan dalam mengekstraksi suatu kelas.

22.

Neural network bisa menyelesaikan problem yang mempunyai karakteristik :

(kecuali)

a)

Dibutuhkannya evaluasi yang cepat terhadap proses pembelajaran

Tidak mementingkan kemampuan manusia untuk mengerti proses pembelajaran

b)

Target output bisa bernilai diskrit, real, atau vector(diskrit/real)

Penggunaan representasi simbolik, misalnya decision tree

c)

Instance direpresentasikan dalam pasangan attribute-value yang banyak 

Target.

d)

Data training mengandung error

dan ada batasan waktu pelatihan

23.

Arsitektur sederhana dalam jaringan syaraf tiruan terdiri dari ...

a)

banyak layer input unit (yang jumlah neuronnya sesuai dengan banyaknya jumlah komponen dari data yang ingin dikenali) dan banyak output unit

b)

banyak layer input unit (yang jumlah neuronnya sesuai dengan banyaknya jumlah komponen dari data yang ingin dikenali) dan satu output unit

c)

satu layer input unit (yang jumlah neuronnya sesuai dengan banyaknya jumlah komponen dari data yang ingin dikenali) dan banyak output unit

d)

satu layer input unit (yang jumlah neuronnya sesuai dengan banyaknya jumlah komponen dari data yang ingin dikenali) dan satu output unit

24.

Mengapa harus pakai Artificial Neural Network (ANN)?

(kecuali)

a)

ANN memiliki kemampuan mendapatkan prediksi sangat baik untuk memecahkan suatu masalah walaupun dengan sampel yang terbatas. 

b)

Jumlah atribut dalam data akan mengurangi akurasi dan menambah kesulitan atau kompleksitas dari algoritma ANN tersebut. Semakin sedikit atribut, akurasi akan semakin baik, untuk itu diperlukan seleksi terhadap atribut yang ada. 

c)

ANN merupakan sebuah model aritmatika yang mempunyai fitur fungsional pada jaringan saraf biologis. 

d)

ANN merupakan satu set neuron artifisial yang saling berkaitan, serta memproses suatu informasi menggunakan bentuk yang menghubungkan terhadap komputasi, salah satu Algoritma yang diterapkan ke berbagai bidang penelitian dan industri untuk melakukan peramalan, klasifikasi data, dan analisis regresi.

e)

ANN membantu dalam pengembangkan model yang paling tepat ketika hubungan pada proses fisik sudah jelas atau yang mana sifat tersebut tidak memiliki sifat yang haschaotic.

25.

Teknik Data Mining yang sudah dipelajari (kecuali) ...

a)

Decision Tree : teknik generasi selanjutnya (model prediktif yang dapat digambarkan seperti pohon. Setiap node yang terdapat dalam struktur pohon tersebut mewakili sebuah pertanyaan yang digunakan untuk menggolongkan data).

b)

Nearest Neighbour : teknik yang memprediksi pengelompokan (teknik yang tertua yang digunakan dalam data mining).

c)

Deviation detection: teknik untuk mengidentifikasi outlier yang mengekspresikan sebuah deviasi dari ekspektasi yang tidak diketahui sebelumnya.

d)

Clustering : teknik untuk mengklasifikasikan data berdasarkan kriteria masing-masing data.

26.

Clustering =

a)

Unsupervised Learning

b)

Supervised Learning

c)

Semi-Supervised Learning

d)

Machine Learning

e)

Deep Learning

27.

Pilih pernyataan yang salah tentang Tipe Learning ...

a)

Supervised Learning = data ada labelnya

b)

Supervised Learning = banyak data tidak ada labelnya

c)

UnSupervised Learning = data tidak ada labelnya

d)

Semi - Supervised Learning = data ada yang tidak berlabel

28.

Pilih prinsip clustering yang salah...

a)

clustering adalah sebuah proses untuk mengelompokan data ke dalam beberapa cluster atau kelompok sehingga data dalam satu cluster memiliki tingkat kemiripan yang maksimum dan data antar cluster memiliki kemiripan yang minimum.

b)

Clustering merupakan proses partisi satu set objek data ke dalam himpunan bagian yang disebut dengan cluster. Objek yang di dalam cluster memiliki kemiripan karakteristik antar satu sama lainnya dan berbeda dengan cluster yang lain. 

c)

Partisi tidak dilakukan secara manual melainkan dengan suatu algoritma clustering. Oleh karena itu, clustering sangat berguna dan bisa menemukan group atau kelompok yang tidak dikenal dalam data. 

d)

clustering adalah sebuah proses untuk mengelompokan data ke dalam satu cluster atau kelompok sehingga data dalam satu cluster memiliki tingkat perbedaan yang maksimum dan data antar cluster memiliki kemiripan yang maksimum.

29.

Manfaat Clustering, kecuali...

a)

Clustering merupakan metode segmentasi data yang sangat berguna dalam prediksi dan analisa masalah bisnis tertentu. Misalnya Segmentasi pasar, marketing dan pemetaan zonasi wilayah.

b)

Clustering banyak digunakan dalam berbagai aplikasi seperti misalnya pada business intelligence, pengenalan pola citra, web search, bidang ilmu biologi, dan untuk keamanan (security). 

c)

clustering bisa mengatur banyak customer ke dalam banyaknya kelompok. Contohnya mengelompokan customer ke dalam beberapa cluster dengan kesamaan karakteristik yang kuat.

d)

Clustering juga dikenal sebagai data segmentasi karena clustering mempartisi banyak data set ke dalam banyak group berdasarkan kesamaannya. Selain itu clustering juga bisa sebagai outlier detection.

e)

Identifikasi satu obyek dalam berbagai bidang seperti computer vision dan image processing.

30.

Salah satu konsep dasar Clustering yang benar, adalah:

a)

Hasil clustering yang jelek akan menghasilkan tingkat kesamaan yang tinggi dalam satu kelas dan tingkat kesamaan yang rendah antar kelas. 

b)

Kesamaan yang dimaksud merupakan pengukuran secara numeric terhadap dua buah objek.

c)

Nilai kesamaan antar kedua objek akan semakin tinggi jika kedua objek yang dibandingkan memiliki perbedaan yang tinggi. 

d)

Kualitas hasil clustering tidak bergantung pada metode yang dipakai. 

31.

Pilih pernyataan yang salah terkait Clustering :

a)

Euclidean distance menghitung jarak tiga buah point dengan mengetahui nilai dari masing-masing atribut pada ketiga poin tersebut.

b)

Metode clustering juga harus dapat mengukur kemampuannya sendiri dalam usaha untuk menemukan suatu pola tersembunyi pada data yang sedang diteliti.

c)

Terdapat berbagai metode yang dapat digunakan untuk mengukur nilai kesamaan antar objek-objek yang dibandingkan. Salah satunya ialah dengan weighted Euclidean Distance.

d)

Jarak adalah pendekatan yang umum dipakai untuk menentukan kesamaan atau ketidaksamaan dua vektor fitur yang dinyatakan dengan ranking. Apabila nilai ranking yang dihasilkan semakin kecil nilainya maka semakin dekat/tinggi kesamaan antara kedua vektor tersebut.

32.

Objek data dengan sifat yang berbeda sekali dari kebanyakan objek data dalam data-set

a)

Noise

b)

Missing value

c)

Outliers

d)

Precision

e)

Duplicate data

33.

Proses menghilangkan fitur/atribut yang tidak diperlukan terdapat dalam proses

a)

Pembersihan data

b)

Reduksi data

c)

Transformasi data

d)

Integrasi data

e)

Penambahan data

34.

Ranking yang memiliki skala 1-10, grade, tinggi atau pendidikan merupakan contoh tipe data

a)

Diskrit

b)

Ordinal

c)

Nominal

d)

Rasio

e)

Numerik

35.

Sebutkan strategi untuk transformasi data yang kalian ketahui (wajib diisi karena berbobot 5 poin)

(a)  

36.

Perhatikan Ilustrasi gambar yang ada, menurut Pendapat anda apa yang dimaksud dengan Data Mining ? (Wajib diisi karena berbobot 5 poin)

4 lines
37.

Yang termasuk dalam model data mining, adalah....

a)

Prediction Methods, Description Methods

b)

Kualitatif dan Kuantitatif

c)

Klasifikasi, Decision tree

d)

Klastering, Sequence Discovery

38.

Klasifikasi, terdapat target variable kategori, berikut ini contoh yg benar...

a)

Prediksi harga beras Dalam Tiga Bulan tang akan Datang

b)

Akan dilakukan estimate tekanan Darah sistolik pada pasien rumah sakit berdasrkan umur pasien, Jenis kelamin, indeks berat badan.

c)

Kelompok-kelompok konsumen untuk target pemasaran dari Suatu produk bagi perusahaan yang tidak memiliki dana pemasaran yang besar.

d)

Mendiagnosis penyakit pasien untuk mendapatkan termasuk golongan penyakit apa.

39.

Knowledge discovery in databases (KDD) adalah keseluruhan proses non-trivial untuk mencari dan mengidentifikasi pola (pattern) dalamdata, dimana pola yang ditemukan bersifat sah, baru, dapat bermanfaat dan dapat dimengerti. Berikut ini yang bukan merupakan tahapan dari proses KDD...

a)

Data Selection, Pre-processing/ Cleaning

b)

Transformation, Data mining

c)

Interpretation/ Evaluation

d)

Normalization

40.

Pilih jawaban yang benar dari klasifikasi data mining ini ...

a)
b)
c)
d)

Semua Benar

41.

Konsep Data

Dalam Decision Tree. Sebagaimana berikut: Data dinyatakan dalam bentuk tabel dengan atribut dan record.

Atribut menyatakan suatu parameter yang dibuat sebagai kriteria dalam pembentukan tree. Misalkan untuk menentukan main tenis, kriteria yang diperhatikan adalah cuaca, angin dan temperatur. Salah satu atribut merupakan atribut yang menyatakan data solusi per-item data yang disebut dengan target atribut.

•Atribut memiliki nilai-nilai yang dinamakan dengan instance. Misalkan atribut cuaca mempunyai instance berupa cerah, berawan dan hujan. Coba perhatikan tabel yang ada, pada Jawaban yang ada dibawah ini, mana yang menyatakan: Sample, Attribute, Target Atribut

a)

Target Attribute = Cuaca, Angin, Temperature. Sample = Main. Attribute = Nama

b)

Target attribute = Nama. Sample = Cuaca, Angin, Temperature. Attribute = Main

c)

Sample = Nama. Attribute = Cuaca, Angin, Temperature. Target Attribute = Main

d)

Semuanya Benar

42.

Kodepos, dan atribut yang memiliki himpunan nilai yang berhingga maupun yang tak berhingga tetapi bisa dihitung termasuk dalam kelompok atribut

a)

Diskrit

b)

Kontinyu

c)

Interval

d)

Nominal

e)

Biner

43.

k- Means termasuk kedalam unsupervised learning merupakan algoritma yang menyelesaikan permasalahan yang telah meiliki kategori.

a)

TRUE

b)

FALSE

44.

Setiap data harus memiliki cluster dan setiap data dapat berpindah dari kelompok yang satu ke kelompok yang lain merupakan karakteristik hierarical clustering

a)

True

b)

False

45.

Perhitungan jarak data berdasarkan Jarak rata-rata atau means setiap datanya disebut dengan average lingkage clustering

a)

TRUE

b)

FALSE

46.

Proses learning pada algoritma asosiasi (association rule) bertujuan untuk mencari atribut yang muncul bersamaan dalam satu transaksi dan menunjukan tingkat korelasi yang rendah

a)

TRUE

b)

FALSE

47.

Assosiasi rule mining dapat digunakan untuk Market Basket Analysis (menganalisa kebiasaan customer dengan mencari asosiasi dan korelasi dari data transaksi) sebagai saran pembuatan produk baru dalam mencari keuntungan yang maksimum

a)

TRUE

b)

FALSE

48.

Sebuah atribut memiliki instance "Lulus " dan "Tidak Lulus", jenis atribut tersebut merupakan

a)

Rasio

b)

Interval

c)

Nominal

d)

Ordinal

49.

Perhatikan kumpulan data berikut: 23, 45, 56, 23, 78, 90, 56, 34, 90.

Mana kumpulan data yang disebut Distinct?

a)

23, 45, 56, 78, 90, 34

b)

45, 78, 34

c)

23, 56, 90

d)

23, 45, 56, 23, 78, 90, 56, 34

50.

Perhatikan kumpulan data berikut: 23, 45, 56, 23, 78, 90, 56, 34, 90.

Mana kumpulan data yang disebut Unique?

a)

45, 78, 34

b)

23, 56, 90

c)

34, 78

d)

23, 23, 56, 56, 90, 90

51.

Data mining dapat diklasifikasikan menjadi empat teknik utama, yaitu:

a)

Forcasting modeling (Pemodelan peramalan),

Database segmentation (Segmentasi basis data),

Link analysis (Analisis tautan), dan

Supervised data (Data yang diawasi)

b)

Forcasting modeling (Pemodelan peramalan),

Database segmentation (Segmentasi basis data),

Link analysis (Analisis tautan), dan

Unsupervised data (Data tanpa pengawasan)

c)

Predictive modeling (Pemodelan prediktif),

Database segmentation (Segmentasi basis data),

Link analysis (Analisis tautan), dan

Deviation detection (Deteksi penyimpangan)

d)

Supervised data (Data yang diawasi),

Database segmentation (Segmentasi basis data),

Link analysis (Analisis tautan), dan

Deviation detection (Deteksi penyimpangan)

52.

Berikut ini merupakan tujuan dari proses aggregation, kecuali

a)

Mengurangi jumlah atribut atau obyek

b)

Mendapatkan hasil pengolahan data secara langsung

c)

Perubahan skala

d)

Penstabilan data yang akan diolah dalam data mining

53.

Berikut diberikan pernyataan teori Entropy, yaitu:

1. Semakin tinggi entropy, semakin tinggi ketidakpastian.

2. Semakin rendah entropy, semakin rendah ketidakpastian.

a)

1 benar dan 2 salah

b)

1 salah dan 2 benar

c)

1 dan 2 salah

d)

1 dan 2 benar serta berhubungan

e)

1 dan 2 benar tapi tidak berhubungan

54.

Dari gambar disamping, variabel yang mana yang menjadi node akar pertama ? ...

a)

Outlook

b)

Temperature

c)

Humidity

d)

Windy

e)

Nothing

55.

Dari gambar disamping, diperoleh kesimpulan awal bahwa pe-golf akan main ketika ...

a)

Outlook Cloudy

b)

Temperature Cool

c)

Humidity Normal

d)

Windy True

e)

Nothing

56.

Dari gambar disamping, diperoleh pe-golf main ketika:

1. Humidity Normal

2. Humidity High dan Outlook Cloudy

3. Humidity High, Outlook Rainy, dan Windy True

4. Humidity High, Outlook Sunny, dan Windy True

a)

1, 2, dan 3 benar

b)

1 dan 3 benar

c)

2 dan 4 benar

d)

4 saja yang benar

e)

semua jawaban benar

57.

Urutan yang benar dalam peran data mining adalah ...

a)

Informasi -> Data -> Knowledge -> Wisdom

b)

Data -> Knowledge -> Informasi -> Wisdom

c)

Data -> Informasi -> Wisdom -> Knowledge

d)

Data -> Informasi -> Knowledge -> Wisdom

e)

Wisdom -> Informasi -> Knowledge -> Data

58.

Pemisahan data training dan testing dalam pengujian Data Mining dilakukan dengan cara:

1. Pemisahan data manual

2. Pemisahan data dengan operator split data

3. Pemisahan data secara acak

4. Pemisahan automatis dengan cross-validation

a)

1, 2, dan 3 benar

b)

1 dan 3 benar

c)

2 dan 4 benar

d)

4 saja yang benar

e)

semua jawaban benar

59.

Pilih 3 karakteristik dari Big Data (Jawaban lebih dari satu)

a)

Volume

b)

Velocity

c)

Variety

d)

Verifiable

60.

Pilih 3 Proses yang dilakukan pada Data Mining (Jawaban lebih dari satu)

a)

Proses mengekstraksi data dari sekumpulan data yang memiliki volume yang sangat besar (big data)

b)

Proses untuk mengenali dan menemukan pola tersembunyi di seluruh kumpulan big data

c)

Proses menyelidiki, menganalisis, dan mendemonstrasikan data untuk menemukan informasi yang berguna

d)

Proses yang menghasilkan pola data

61.

2 teknik utama Machine Learning, yaitu...

a)

Supervised Learning dan Unsupervised Learning

b)

Evaluation dan Presentation

c)

Clustering dan Anomaly Detection

d)

Classification dan Regression

62.

Pilih 2 Teknik yang sesuai dengan Teknik Supervised Learning pada Machine Learning (Jawaban Lebih dari satu)

a)

Classification

b)

Anomaly Detection

c)

Regression

d)

Clustering

63.

Pilih 2 Teknik yang sesuai dengan Teknik Unsupervised Learning pada Machine Learning (Jawaban Lebih dari satu)

a)

Classification

b)

Anomaly Detection

c)

Regression

d)

Clustering

64.

Proses pengolahan data terstruktur, tidak terstruktur, semi-terstruktur lebih baik dilakukan menggunakan metode...

a)

Data Analysis

b)

Data Mining

c)

Data Preparation

d)

Data Validation

65.

Sub-bidang besar dari Artificial Intelligence (AI) yang membahas tentang bidang studi yang memberikan komputer kemampuan untuk belajar tanpa diprogram secara eksplisit disebut...

a)

Machine Learning

b)

Data Mining

c)

Neural Network

d)

Supervised Learning

66.

Proses sorting data menjadi beberapa kategori disebut...

a)

Classification

b)

Regression

c)

Clustering

d)

Anomaly Detection

67.

Menemukan pola tersembunyi pada input data yang tidak dikenali termasuk proses teknik Machine Learning...

a)

Unsupervised Learning

b)

Supervised Learning

c)

Reinforcement Learning

d)

Active Learning

68.

Melatih model dengan input dan output yang telah dikenali, sehingga dapat memprediksi masa depan output termasuk proses teknik Machine Learning...

a)

Unsupervised Learning

b)

Reinforcement Learning

c)

Active Learning

d)

Supervised Learning

69.

Data berikut ini yang merupakan jawban yang benar dari perlakuan Proses klasifikasi dalam data mining adalah...

a)
b)
c)
d)

Semua Benar

70.
Membagi pasar kedalam sub-set pelanggan yang berbeda dimana suatu sub-set mungkin dapat dipilih sebagai target pasar yang dicapai dengan satu kombinasi pemasaran yang berbeda, maka teknik data mining yang gunakan adalah
a)
klasterisasi
b)
asosiasi
c)
klasifikasi
d)
regresi
e)
prediksi
71.
Jika ingin mengetahui pola belanja konsumen ditoko, dengan tujuan menentukan penempatan barang ditoko, maka digunakan teknik data mining
a)
klasterisasi
b)
asosiasi
c)
klasifikasi
d)
regresi
e)
prediksi
72.

Pernyataan dibawah ini yang bukan peranan utama data mining adalah...

a)

Klasifikasi

b)

Klasterisasi

c)

Asosiasi

d)

Semua Benar

73.

Berdasarkan jenis/metode pembelajarannya, maka clustering termasuk dalam ....

a)

Supervised Learning

b)

Unsupervised Learning

c)

Semi Supervised Learning

d)

Reinforcement Learning

74.

Decision Tree (CART, ID3, C4.5, Credal DT, Credal C4.5, Adaptative Credal C4.5), Naive Bayes (NB), K-Nearest Neighbor (kNN), Linear Discriminant Analysis (LDA), Logistic Regression (LogR) adalah algoritma yang bisa digunakan untuk metode ....

a)

Klasifikasi

b)

Clustering

c)

Asosiasi

d)

Estimasi

75.

Berdasarkan jenis pembelajarannya, algoritma melakukan proses belajar berdasarkan nilai dari variabel target yang terasosiasi dengan nilai dari variabel

prediktor disebut .....

a)

Supervised Learning

b)

Unsupervised Learning

c)

Semi-Supervised Learning

d)

Reinforcement Learning

76.

Pandang gambar berikut. Manakah dari pernyataan- pernyataan berikut yang benar.

a)

Gambar A dan C mempunyai fungsi pemisah (klasifier) yang cukup baik.

b)

Gambar B dan D mempunyai fungsi pemisah (klasifier) yang terbaik.

c)

Gambar B, C dan D mempunyai fungsi pemisah (klasifier) yang sama baiknya.

d)

Gambar D mempunyai fungsi pemisah (klasifier) yang terbaik

77.

Berdasarkan data berikut ini, si A usia remaja dan seorang pelajar. Berapakah peluang si A beli computer yes dan no!

a)

Peluang si A beli computer = 0.8 dan tidak beli computer = 0.2

b)

Peluang si A beli computer = 0.25 dan tidak beli computer = 0.5

c)

Peluang si A beli computer = 0.88 dan tidak beli computer = 0.2

d)

Peluang si A beli computer = 0.175 dan tidak beli computer = 0.02

78.

Gambar di samping adalah gambar ...

a)

Partitional Clustering

b)

Traditional Hierarchical Clustering

c)

Non-traditional Hierarchical Clustering

d)

Traditional Dendrogram

e)

Non-traditional Dendrogram

79.

Misalkan ada dua titik centroid, yaitu m1 dan m2.

m1 = G dan m2 = H

Point yang mana saja yang paling dekat ke m2 ...

a)

A dan C

b)

A dan E

c)

B dan D

d)

B dan E

e)

C dan E

80.

Diketahui sebuah data terdiri dari 4 baris dan 5 kolom, maka data tersebut memiliki...

a)

atribut sebanyak 5

b)

atribut sebanyak 4

c)

atribut sebanyak 9

d)

atribut sebanyak 20

81.

Yang ditunjuk oleh panah merah disebut..

a)

Attribute/Feature/Dimension

b)

Class/Label/Target

c)

Record/

Object/

Sample/

Tuple/Data

d)

Numerik

82.

Yang ditunjuk oleh panah biru disebut..

a)

Attribute/Feature/Dimension

b)

Class/Label/Target

c)

Record/

Object/

Sample/

Tuple/Data

d)

Numerik

83.

Pilih peran data mining yang termasuk ke dalam supervised learning !

a)

Estimasi

b)

Klasterisasi

c)

Asosiasi

d)

Numerik

84.

Pilih peran data mining yang termasuk ke dalam unsupervised learning !

a)

Estimasi

b)

Klasterisasi

c)

Asosiasi

d)

Numerik

85.

Dalam dataset (himpunan data) bagian yang di beri garis merah disebut (pilih 3 jawaban)

a)

Attribute

b)

Dimension

c)

Feature

d)

Target

86.

Berikut ini merupakan algoritma yang tidak termasuk dalam metode estimasi dalam data mining (pilih 2 jawaban)

a)

Regresi Linear Sederhana

b)

Algoritma C 4.5

c)

Algoritma K-Nearest Neighbor

d)

Multiple Regression

87.

Output yang dihasilkan dari metode Regresi Linear Sederhana adalah ...

a)

Rule

b)

Persamaan

c)

Tree

d)

Report

88.

Pada algoritma apriori diperlukan 2 parameter yang harus digunakan dalam menemukan aturan asosiatif antara suatu kombinasi item, yaitu

a)

Support

b)

Hipotesis

c)

Confidence

d)

Koefesien

89.

Aturan yang digunakan untuk menganalisis asosiasi antara beberapa atribut disebut

a)

Market Basket Analysis

b)

Frequent Pattern Mining

c)

Generalized Rule

d)

Hash Based

90.

Rumus ini merupakan rumus untuk mencari parameter

a)

Support

b)

Confidence

c)

Rule

d)

Persamaan

91.
Kategori machine learning yang membutuhkan data training untuk mempelajari pola dan memprediksi data testing berdasarkan pola tersebut, adalah …
a)
supervised learning
b)
unsupervised learning
c)
semi supervised learning
d)
regresi
e)
klasifikasi
92.
Klasifikasi merupakan salah satu bentuk task data mining yang digunakan untuk ... dan menggunakan prinsip machine learning yang bersifat …
a)
Prediksi ; Supervised learning
b)
Prediksi ; Unsupervised learning
c)
Prediksi dan deskripsi ; Unsupervised learning
d)
Deskripsi ; Supervised learning
e)
Deskripsi ; Unsupervised learning
93.
Confusion Matrix tidak dapat digunakan untuk data yang tidak imbang
a)
Salah
b)
Benar
94.

Supervised learning biasanya bertujuan untuk prediksi, baik itu klasifikasi maupun numerik prediksi seperti regresi, ciri utamanya adalah variabel targetnya (yang akan diprediksi) sudah ada. Sementara unsupervised learning bertujuan untuk deskriptif atau mencari insight dari data, ciri utamanya adalah tidak adanya variabel target, berikut ini yang termasuk kedalam algoritma unsupervised learning adalah?

a)

SVM

b)

K-Means

c)

Jaringan syaraf tiruan (JST)

d)

Naïve Bayes

95.

Suatu proses dari kumpulan record yang memiliki kemiripin satu dengan yang lainnya dan memiliki ketidakmiripan dengan record-record yang lainnya ?

a)

Analisis Klaster

b)

Analisis Apriori

c)

Analisis Asosiasi

d)

Analisis Data Mining

96.

Apakah yang dikembangkan oleh amazon.com dalam memanfaatkan aturan asosiasi ?

a)

Mengembangkan program untuk mencari barang yang paling sedikit untuk dibeli

b)

Program untuk merekomendasikan barang-barang lain kepada pembeli pada saat pembeli melakukan browsing atau membeli suatu barang berdasarkan tingkat keyakinan (confidence)

c)

Mengembangkan aplikasi sesuai dengan barang yang sering dicari oleh konsumen

d)

Mengembangkan program untuk mencari barang yang paling banyak dibeli

97.

Menemukan kemiripan data berdasarkan karakteristik dan mengelompokan data yang mirip ke dalam cluster berikut ini disebut ?

a)

Cluster analysis

b)

Ukuran kesamaan

c)

Requirement cluster

d)

Struktur Data

98.

Output / Model / Pengetahuan yang dihasilkan dari data mining, pilih 3 jawaban!

a)

Formula

b)

Decision Tree

c)

Report

d)

Rule

e)

Estimasi

99.

Sistem simulasi yang benar adalah...

a)

sebuah objek yang diminati disebut entitas

b)

setiap properti dari sebuah entitas disebut atribut

c)

nasabah bank dapat digambarkan sebagai entitas

d)

karakteristik pelanggan (seperti pekerjaan pelanggan) dapat didefinisikan sebagai atribut

e)

semua benar

100.

simulasi merupakan ...

a)

suatu model pengambilan keputusan dengan mencontoh atau mempergunakan gambaran sebenarnya dari suatu sistem kehidupan dunia nyata tanpa harus mengalaminya pada keadaan yang sesungguhnya. 

b)

suatu model pembuatan keputusan dengan mencontoh atau mempergunakan gambaran asal dari suatu sistem kehidupan dunia fana tanpa harus mengalaminya pada keadaan yang sesungguhnya. 

c)

suatu model pengambilan rencana dengan mencontoh atau mempergunakan uraian sebenarnya dari suatu sistem kehidupan dunia nyata dengan harus mengalaminya pada keadaan yang sesungguhnya. 

d)

suatu model pengambilan keputusan dengan mencontoh atau mempergunakan gambaran sebenarnya dari suatu sistem kehidupan dunia nyata dengan harus mengalaminya pada keadaan yang sesungguhnya.