Font size
WorksheetsTAS Data Processing For Business UKSW
Total questions: 100
Worksheet time: 52mins
Data mining adalah ...
Pencarian atau penambangan data dari sebuah database yang sudah rapi terstruktur
Proses penarikan data yang sangat besar untuk diterjemahkan ke dalam database yang besar sehingga memudahkan pengambilan keputusan suatu masalah dan juga sebagai prediksi masa depan.
Penambangan data untuk memaksimalkan keuntungan dan nilai dari pelanggan.
Proses pengolahan data yang sangat besar untuk dalam database yang besar untu pengambilan keputusan di masa depan.
Teknik untuk menemukan pola nyata yang tidak bersembunyi di balik big data.
Tahapan Simulasi Monte Carlo adalah, kecuali ...
Menentukan distribusi probabilitas yang diketahui dari beberapa variabel kunci.
Mengubah distribusi frekuensi ke dalam distribusi probabilitas kumulatif.
Mengambil sampel secara runut dari distribusi kumulatif untuk menentukan nilai variabel yang umum untuk digunakan dalam simulasi.
Mengambil sampel secara acak dari distribusi kumulatif untuk menentukan nilai variabel yang spesifik untuk digunakan dalam simulasi.
Mensimulasikan operasi yang dianalisis dalam jumlah replikasi yang sesuai dibutuhkan dalam kondisi yang sama seperti ukuran sampel yang sesuai pada percobaan dunia nyata.
Random Number Generator (RNG) adalah ...
algoritma yang digunakan untuk menghasilkan urut-urutan (sequence) dari angka sebagai hasil perhitungan dengan komputer yang diketahui distribusinya sehingga angka-angka tersebut muncul secara random dan digunakan terus-menerus.
algoritma yang digunakan untuk menghasilkan angka random yang diketahui distribusinya sehingga angka-angka tersebut muncul terus-menerus.
algoritma perhitungan dengan komputer yang memunculkan angka-angka secara random dan terus-menerus.
Pembangkit Bilangan Acak (manual)
Sifat Random Number Generator diantaranya, ...
Kemunculannya dapat diprediksi.
Ada komputasi yang benar-benar menghasilkan deret bilangan acak secara sempuna
Bilangan acak yang dibangkitkan oleh komputer adalah bilangan acak semu (Pseudo Random Number), karena menggunakan rumus-rumus matematika
Bilangan acak tidak dapat dibangkitkan dengan pola tertentu yang dinamakan dengan distribusi mengikuti fungsi distribusi yang ditentukan
Kemunculannya terprediksi karena basis data yang terstruktur.
Game Theory =
Cara mengambil keputusan setelah merespon keputusan yang diambil oleh pemain lain.
Cara yang memenangkan permainan agar lawan tidak membalas.
Teori yang menganalisis bagaimana kita mengambil keputusan setelah merespon keputusan yang diambil oleh pemain lain.
Teori yang menganalisis bagaimana lawan mengambil keputusan setelah merespon keputusan yang diambil oleh kita.
4 Elemen Game Theory: (kecuali)
Equilibrium (Keseimbangan Optimal dimana pemain tidak lagi dapat merubah posisinya)
Output (Hasil yang diperoleh dari setiap keputusan)
Strategy (Aturan yang diperbolehkan)
Player (Pengambil Keputusan yang Rasional)
Disequilibrium (Ketidakseimbangan dimana pemain masih dapat merubah posisinya)
Ciri-ciri Game Theory : (kecuali)
Jumlah pemain terbatas.
Untuk setiap pemain, ada sejumlah kemungkinan tindakan yang terbatas.
Ada pertentangan kemungkinan (conflict of interest) antara pemain.
Aturan permainan untuk mengatur di dalam memilih tindakan diketahui oleh setiap pemain
Hasil seluruh kombinasi hal yang mungkin dilakukan merupakan bilangan real , positif, negatif atau nol.
berhubungan dengan pengambilan keputusan ketika kompetisi
Apa makna dari tabel tersebut??
Jika A memilih strategi pertama dan B memilih strategi kedua, maka hasilnya +4 artinya B akan memperoleh 4 sedangkan A akan kehilangan 4 (A harus memberikan 4 kepada B).
Jika A memilih strategi ketiga dan B memilih strategi kedua, maka hasilnya -3 artinya A akan memperoleh 3 sedangkan B akan kehilangan 3 (B harus memberikan 3 kepada A).
Jika A memilih strategi kedua dan B memilih strategi pertama maka hasilnya -1. Artinya A kehilangan satu unit dan harus memberikannya ke B (B memenangkan satu unit)
Jika A memilih strategi kedua dan B memilih strategi kedua, maka hasilnya 2 artinya B akan memperoleh 2 sedangkan A akan kehilangan 2 (A harus memberikan 2 kepada B).
Berapa nilai maximin/minimax yang benar?
Nilai Maximin nya : 2, -1, 1
Nilai Minimax nya: 6, 2, 7
Nilai Maximin nya: 7, 4, 9
Nilai Minimax nya: 6, 5, 9
Hitung Nilai Maximin dan Minimax dan
Tentukan Saddle Point nya... (wajib diisi dengan benar karena bobot soal ini = 5 poin)
Pengukuran dilakukan dengan variasi pengukuran dari kuantitas yang sedang diukur dengan pengukuran antara mean dan nilai kuantitas yang diketahui, adalah jenis kesalahan pengukuran
Noise
Bias
Presisi
Akurasi
Prediksi
Tiga metode dari Data Mining yaitu, kecuali...
Prediction (Classification, Regression, dan Time Series)
Regression (Linear/Nonlinear, ANN, dan Regression Trees.
Time Series menggunakan Autoregressive Methods, Averaging Methods, Exponential Smoothing, dan ARIMA)
Association (Decision Trees, Neural Networks, Support Vector Machines, kNN, Naïve Bayes, dan GA)
Segmentation (Clustering dan Outlier analysis)
Tiga proses Data Mining, kecuali...
KDD atau Knowledge Discovery in Databases Process melakukan prosesnya dengan memilih data terlebih dahulu, membersihkan data sehingga menjadi data yang diperlukan saja, mengubah data tersebut, mengekstrak pola/pattern yang ada, kemudian melakukan internalisasi terhadap pola/pattern yang telah diekstrak tersebut.
SEMMA atau Sample, Explore, Modify, Model, and Assess melakukan prosesnya sesuai dengan namanya, pertama-tama memilih sampel dari data, kemudian melakukan visualisasi dari data tersebut, memilih variabel, kemudian hasilnya digunakan ke dalam model, terakhir mengevaluasi untuk akurasi dan kegunaan dari model tersebut.
K-Fold Cross Validation, data dipisahkan dengan jumlah yang sama kedalam subsets kemudian dilakukan training/testing.
CRISP-DM atau Cross-Industry Standard Process for Data Mining melakukan prosesnya dengan memahami bisnisnya terlebih dahulu, kemudian memahami datanya dan mempersiapkan data tersebut untuk diproses, kemudian membuat model yang sesuai dengan kemauan, melakukan percobaan dan evaluasi, terakhir penerapan dari model tersebut.
Nama lain dari tabel ini adalah ...
Colussion matrix
Confused matrix
Confusious matrix
Confusion matrix
Pilih jawaban yang salah dari Algoritma K-Means
Biasanya user sudah mempunyai informasi awal tentang objek yang sedang dipelajari, Secara detail user bisa menggunakan ukuran ketidak-miripan untuk mengelompokan obyek.
Teknik clustering yang paling sederhana dan umum dikenal adalah clustering K-Means. Dalam teknik ini kita ingin mengelompokan obyek kedalam K kelompok atau Cluster.
Untuk melakukan clustering, nilai K harus ditentukan terlebih dahulu.
Algoritma K-Means sederhana untuk diimplementasikan dan dijalankan, relative cepat, mudah beradaptasi, umum dalam penggunaannya dalam praktek.
Algoritma K-Means merupakan algoritma pengelompokan iterative yang melakukan partisi set data ke dalam jumlah K cluster yang sudah ditetapkan di awal.
Klasifikasi berdasar jarak antar data adalah klasifikasi data dengan mengelompokkan data ke dalam beberapa kelompok, data (cluster) yang memiliki karakteristik yang berbeda.
Jika dalam sebuah data set terdapat 5 kelas, maka berapa nilai K yang seharusnya ditetapkan?
4
5
6
7
Semua pernhyataan disini benar, kecuali ...
Klasifikasi dicirikan dengan data training mempunyai label, berdasarkan label ini proses klasifikasi memperoleh pola attribut dari suatu data.
Proses klasifikasi biasanya dibagi menjadi dua fase : learning dan test.
Pada fase learning, sebagian data yang telah diketahui kelas datanya diumpankan untuk membentuk model perkiraan.
Kemudian pada fase test model yang sudah terbentuk diuji dengan sebagian data lainnya untuk mengetahui akurasi dari model tsb. Bila akurasinya mencukupi model ini dapat dipakai untuk prediksi kelas data yang belum diketahui.
Model bisa berupa aturan “jika-maka” = decision tree, formula matematis atau neural network.
Klasifikasi adalah proses untuk menemukan model atau fungsi yang menjelaskan atau membedakan konsep atau kelas data, dengan tujuan untuk dapat memperkirakan kelas dari suatu objek yang labelnya tidak diketahui.
Proses untuk menemukan model atau fungsi yang membedakan data atau kelas data, dengan tujuan untuk dapat membagi kelas dari suatu objek yang labelnya diketahui.
Fakta tentang Klasifikasi (Decision Tree) kecuali ...
Proses pada Decision Tree adalah mengubah bentuk data (tabel) menjadi bentuk Tree dan Mengubah Tree menjadi Rule, serta menyederhanakan Rule.
Decision tree adalah struktur yang dapat digunakan untuk membagi data yang besar menjadi himpunan record yang lebih kecil dengan menerapkan serangkaian aturan keputusan.
Decision Tree sangat cocok untuk visualisasi data
karena dapat informasi yang berguna meski tanpa hard data.
Tiap data yang digunakan dalam prosesnya hanya memerlukan persiapan maksimal.
Decison Tree merupakan struktur data yang terdiri dari nodes (simpul) dan (rusuk).
Algoritma yang digunakan untuk membentuk Decision Tree, diantaranya: CART, ID3, C4.5
Algoritma C4.5 adalah pengembangan dari ID3
Decision Tree sangat cocok untuk, kecuali ...
Training data yang tidak lengkap
Training data yang lengkap dan terstruktur
Data Diskrit dengan output diskrit
Data dalam bentuk atribut-nilai.
Pernyataan tentang Atribut yang benar adalah ...
Atribut untuk menentukan main tenis, kriteria yang diperhatikan adalah sepatu, baju dan raket.
Atribut memiliki nilai-nilai yang dinamakan dengan instance. Misalkan atribut cuaca mempunyai instance berupa gerah, terbakar dan berkeringat.
Salah satu atribut merupakan atribut yang menyatakan data solusi semua data yang disebut dengan target atribut.
Atribut menyatakan suatu parameter yang dibuat sebagai kriteria dalam pembentukan tree.
Definisi tentang Entropy , kecuali ...
Entropy bisa dikatakan sebagai kebutuhan bit untuk menyatakan suatu kelas.
Entropy(S) adalah jumlah bit yang diperkirakan dibutuhkan untuk dapat mengekstrak suatu kelas (+ atau -) dari sejumlah data acak pada ruang sample S.
Semakin kecil nilai Entropy maka semakin jelek untuk digunakan dalam mengekstraksi suatu kelas.
Panjang kode untuk menyatakan informasi secara optimal adalah –log2 p bits untuk messages yang mempunyai probabilitas p.
Semakin kecil nilai Entropy maka semakin baik untuk digunakan dalam mengekstraksi suatu kelas.
Neural network bisa menyelesaikan problem yang mempunyai karakteristik :
(kecuali)
Dibutuhkannya evaluasi yang cepat terhadap proses pembelajaran
Tidak mementingkan kemampuan manusia untuk mengerti proses pembelajaran
Target output bisa bernilai diskrit, real, atau vector(diskrit/real)
Penggunaan representasi simbolik, misalnya decision tree
Instance direpresentasikan dalam pasangan attribute-value yang banyak
Target.
Data training mengandung error
dan ada batasan waktu pelatihan
Arsitektur sederhana dalam jaringan syaraf tiruan terdiri dari ...
banyak layer input unit (yang jumlah neuronnya sesuai dengan banyaknya jumlah komponen dari data yang ingin dikenali) dan banyak output unit
banyak layer input unit (yang jumlah neuronnya sesuai dengan banyaknya jumlah komponen dari data yang ingin dikenali) dan satu output unit
satu layer input unit (yang jumlah neuronnya sesuai dengan banyaknya jumlah komponen dari data yang ingin dikenali) dan banyak output unit
satu layer input unit (yang jumlah neuronnya sesuai dengan banyaknya jumlah komponen dari data yang ingin dikenali) dan satu output unit
Mengapa harus pakai Artificial Neural Network (ANN)?
(kecuali)
ANN memiliki kemampuan mendapatkan prediksi sangat baik untuk memecahkan suatu masalah walaupun dengan sampel yang terbatas.
Jumlah atribut dalam data akan mengurangi akurasi dan menambah kesulitan atau kompleksitas dari algoritma ANN tersebut. Semakin sedikit atribut, akurasi akan semakin baik, untuk itu diperlukan seleksi terhadap atribut yang ada.
ANN merupakan sebuah model aritmatika yang mempunyai fitur fungsional pada jaringan saraf biologis.
ANN merupakan satu set neuron artifisial yang saling berkaitan, serta memproses suatu informasi menggunakan bentuk yang menghubungkan terhadap komputasi, salah satu Algoritma yang diterapkan ke berbagai bidang penelitian dan industri untuk melakukan peramalan, klasifikasi data, dan analisis regresi.
ANN membantu dalam pengembangkan model yang paling tepat ketika hubungan pada proses fisik sudah jelas atau yang mana sifat tersebut tidak memiliki sifat yang haschaotic.
Teknik Data Mining yang sudah dipelajari (kecuali) ...
Decision Tree : teknik generasi selanjutnya (model prediktif yang dapat digambarkan seperti pohon. Setiap node yang terdapat dalam struktur pohon tersebut mewakili sebuah pertanyaan yang digunakan untuk menggolongkan data).
Nearest Neighbour : teknik yang memprediksi pengelompokan (teknik yang tertua yang digunakan dalam data mining).
Deviation detection: teknik untuk mengidentifikasi outlier yang mengekspresikan sebuah deviasi dari ekspektasi yang tidak diketahui sebelumnya.
Clustering : teknik untuk mengklasifikasikan data berdasarkan kriteria masing-masing data.
Clustering =
Unsupervised Learning
Supervised Learning
Semi-Supervised Learning
Machine Learning
Deep Learning
Pilih pernyataan yang salah tentang Tipe Learning ...
Supervised Learning = data ada labelnya
Supervised Learning = banyak data tidak ada labelnya
UnSupervised Learning = data tidak ada labelnya
Semi - Supervised Learning = data ada yang tidak berlabel
Pilih prinsip clustering yang salah...
clustering adalah sebuah proses untuk mengelompokan data ke dalam beberapa cluster atau kelompok sehingga data dalam satu cluster memiliki tingkat kemiripan yang maksimum dan data antar cluster memiliki kemiripan yang minimum.
Clustering merupakan proses partisi satu set objek data ke dalam himpunan bagian yang disebut dengan cluster. Objek yang di dalam cluster memiliki kemiripan karakteristik antar satu sama lainnya dan berbeda dengan cluster yang lain.
Partisi tidak dilakukan secara manual melainkan dengan suatu algoritma clustering. Oleh karena itu, clustering sangat berguna dan bisa menemukan group atau kelompok yang tidak dikenal dalam data.
clustering adalah sebuah proses untuk mengelompokan data ke dalam satu cluster atau kelompok sehingga data dalam satu cluster memiliki tingkat perbedaan yang maksimum dan data antar cluster memiliki kemiripan yang maksimum.
Manfaat Clustering, kecuali...
Clustering merupakan metode segmentasi data yang sangat berguna dalam prediksi dan analisa masalah bisnis tertentu. Misalnya Segmentasi pasar, marketing dan pemetaan zonasi wilayah.
Clustering banyak digunakan dalam berbagai aplikasi seperti misalnya pada business intelligence, pengenalan pola citra, web search, bidang ilmu biologi, dan untuk keamanan (security).
clustering bisa mengatur banyak customer ke dalam banyaknya kelompok. Contohnya mengelompokan customer ke dalam beberapa cluster dengan kesamaan karakteristik yang kuat.
Clustering juga dikenal sebagai data segmentasi karena clustering mempartisi banyak data set ke dalam banyak group berdasarkan kesamaannya. Selain itu clustering juga bisa sebagai outlier detection.
Identifikasi satu obyek dalam berbagai bidang seperti computer vision dan image processing.
Salah satu konsep dasar Clustering yang benar, adalah:
Hasil clustering yang jelek akan menghasilkan tingkat kesamaan yang tinggi dalam satu kelas dan tingkat kesamaan yang rendah antar kelas.
Kesamaan yang dimaksud merupakan pengukuran secara numeric terhadap dua buah objek.
Nilai kesamaan antar kedua objek akan semakin tinggi jika kedua objek yang dibandingkan memiliki perbedaan yang tinggi.
Kualitas hasil clustering tidak bergantung pada metode yang dipakai.
Pilih pernyataan yang salah terkait Clustering :
Euclidean distance menghitung jarak tiga buah point dengan mengetahui nilai dari masing-masing atribut pada ketiga poin tersebut.
Metode clustering juga harus dapat mengukur kemampuannya sendiri dalam usaha untuk menemukan suatu pola tersembunyi pada data yang sedang diteliti.
Terdapat berbagai metode yang dapat digunakan untuk mengukur nilai kesamaan antar objek-objek yang dibandingkan. Salah satunya ialah dengan weighted Euclidean Distance.
Jarak adalah pendekatan yang umum dipakai untuk menentukan kesamaan atau ketidaksamaan dua vektor fitur yang dinyatakan dengan ranking. Apabila nilai ranking yang dihasilkan semakin kecil nilainya maka semakin dekat/tinggi kesamaan antara kedua vektor tersebut.
Objek data dengan sifat yang berbeda sekali dari kebanyakan objek data dalam data-set
Noise
Missing value
Outliers
Precision
Duplicate data
Proses menghilangkan fitur/atribut yang tidak diperlukan terdapat dalam proses
Pembersihan data
Reduksi data
Transformasi data
Integrasi data
Penambahan data
Ranking yang memiliki skala 1-10, grade, tinggi atau pendidikan merupakan contoh tipe data
Diskrit
Ordinal
Nominal
Rasio
Numerik
Sebutkan strategi untuk transformasi data yang kalian ketahui (wajib diisi karena berbobot 5 poin)
(a)
Perhatikan Ilustrasi gambar yang ada, menurut Pendapat anda apa yang dimaksud dengan Data Mining ? (Wajib diisi karena berbobot 5 poin)
Yang termasuk dalam model data mining, adalah....
Prediction Methods, Description Methods
Kualitatif dan Kuantitatif
Klasifikasi, Decision tree
Klastering, Sequence Discovery
Klasifikasi, terdapat target variable kategori, berikut ini contoh yg benar...
Prediksi harga beras Dalam Tiga Bulan tang akan Datang
Akan dilakukan estimate tekanan Darah sistolik pada pasien rumah sakit berdasrkan umur pasien, Jenis kelamin, indeks berat badan.
Kelompok-kelompok konsumen untuk target pemasaran dari Suatu produk bagi perusahaan yang tidak memiliki dana pemasaran yang besar.
Mendiagnosis penyakit pasien untuk mendapatkan termasuk golongan penyakit apa.
Knowledge discovery in databases (KDD) adalah keseluruhan proses non-trivial untuk mencari dan mengidentifikasi pola (pattern) dalamdata, dimana pola yang ditemukan bersifat sah, baru, dapat bermanfaat dan dapat dimengerti. Berikut ini yang bukan merupakan tahapan dari proses KDD...
Data Selection, Pre-processing/ Cleaning
Transformation, Data mining
Interpretation/ Evaluation
Normalization
Pilih jawaban yang benar dari klasifikasi data mining ini ...
Semua Benar
Konsep Data
Dalam Decision Tree. Sebagaimana berikut: Data dinyatakan dalam bentuk tabel dengan atribut dan record.
•Atribut menyatakan suatu parameter yang dibuat sebagai kriteria dalam pembentukan tree. Misalkan untuk menentukan main tenis, kriteria yang diperhatikan adalah cuaca, angin dan temperatur. Salah satu atribut merupakan atribut yang menyatakan data solusi per-item data yang disebut dengan target atribut.
•Atribut memiliki nilai-nilai yang dinamakan dengan instance. Misalkan atribut cuaca mempunyai instance berupa cerah, berawan dan hujan. Coba perhatikan tabel yang ada, pada Jawaban yang ada dibawah ini, mana yang menyatakan: Sample, Attribute, Target Atribut
Target Attribute = Cuaca, Angin, Temperature. Sample = Main. Attribute = Nama
Target attribute = Nama. Sample = Cuaca, Angin, Temperature. Attribute = Main
Sample = Nama. Attribute = Cuaca, Angin, Temperature. Target Attribute = Main
Semuanya Benar
Kodepos, dan atribut yang memiliki himpunan nilai yang berhingga maupun yang tak berhingga tetapi bisa dihitung termasuk dalam kelompok atribut
Diskrit
Kontinyu
Interval
Nominal
Biner
k- Means termasuk kedalam unsupervised learning merupakan algoritma yang menyelesaikan permasalahan yang telah meiliki kategori.
TRUE
FALSE
Setiap data harus memiliki cluster dan setiap data dapat berpindah dari kelompok yang satu ke kelompok yang lain merupakan karakteristik hierarical clustering
True
False
Perhitungan jarak data berdasarkan Jarak rata-rata atau means setiap datanya disebut dengan average lingkage clustering
TRUE
FALSE
Proses learning pada algoritma asosiasi (association rule) bertujuan untuk mencari atribut yang muncul bersamaan dalam satu transaksi dan menunjukan tingkat korelasi yang rendah
TRUE
FALSE
Assosiasi rule mining dapat digunakan untuk Market Basket Analysis (menganalisa kebiasaan customer dengan mencari asosiasi dan korelasi dari data transaksi) sebagai saran pembuatan produk baru dalam mencari keuntungan yang maksimum
TRUE
FALSE
Sebuah atribut memiliki instance "Lulus " dan "Tidak Lulus", jenis atribut tersebut merupakan
Rasio
Interval
Nominal
Ordinal
Perhatikan kumpulan data berikut: 23, 45, 56, 23, 78, 90, 56, 34, 90.
Mana kumpulan data yang disebut Distinct?
23, 45, 56, 78, 90, 34
45, 78, 34
23, 56, 90
23, 45, 56, 23, 78, 90, 56, 34
Perhatikan kumpulan data berikut: 23, 45, 56, 23, 78, 90, 56, 34, 90.
Mana kumpulan data yang disebut Unique?
45, 78, 34
23, 56, 90
34, 78
23, 23, 56, 56, 90, 90
Data mining dapat diklasifikasikan menjadi empat teknik utama, yaitu:
Forcasting modeling (Pemodelan peramalan),
Database segmentation (Segmentasi basis data),
Link analysis (Analisis tautan), dan
Supervised data (Data yang diawasi)
Forcasting modeling (Pemodelan peramalan),
Database segmentation (Segmentasi basis data),
Link analysis (Analisis tautan), dan
Unsupervised data (Data tanpa pengawasan)
Predictive modeling (Pemodelan prediktif),
Database segmentation (Segmentasi basis data),
Link analysis (Analisis tautan), dan
Deviation detection (Deteksi penyimpangan)
Supervised data (Data yang diawasi),
Database segmentation (Segmentasi basis data),
Link analysis (Analisis tautan), dan
Deviation detection (Deteksi penyimpangan)
Berikut ini merupakan tujuan dari proses aggregation, kecuali
Mengurangi jumlah atribut atau obyek
Mendapatkan hasil pengolahan data secara langsung
Perubahan skala
Penstabilan data yang akan diolah dalam data mining
Berikut diberikan pernyataan teori Entropy, yaitu:
1. Semakin tinggi entropy, semakin tinggi ketidakpastian.
2. Semakin rendah entropy, semakin rendah ketidakpastian.
1 benar dan 2 salah
1 salah dan 2 benar
1 dan 2 salah
1 dan 2 benar serta berhubungan
1 dan 2 benar tapi tidak berhubungan
Dari gambar disamping, variabel yang mana yang menjadi node akar pertama ? ...
Outlook
Temperature
Humidity
Windy
Nothing
Dari gambar disamping, diperoleh kesimpulan awal bahwa pe-golf akan main ketika ...
Outlook Cloudy
Temperature Cool
Humidity Normal
Windy True
Nothing
Dari gambar disamping, diperoleh pe-golf main ketika:
1. Humidity Normal
2. Humidity High dan Outlook Cloudy
3. Humidity High, Outlook Rainy, dan Windy True
4. Humidity High, Outlook Sunny, dan Windy True
1, 2, dan 3 benar
1 dan 3 benar
2 dan 4 benar
4 saja yang benar
semua jawaban benar
Urutan yang benar dalam peran data mining adalah ...
Informasi -> Data -> Knowledge -> Wisdom
Data -> Knowledge -> Informasi -> Wisdom
Data -> Informasi -> Wisdom -> Knowledge
Data -> Informasi -> Knowledge -> Wisdom
Wisdom -> Informasi -> Knowledge -> Data
Pemisahan data training dan testing dalam pengujian Data Mining dilakukan dengan cara:
1. Pemisahan data manual
2. Pemisahan data dengan operator split data
3. Pemisahan data secara acak
4. Pemisahan automatis dengan cross-validation
1, 2, dan 3 benar
1 dan 3 benar
2 dan 4 benar
4 saja yang benar
semua jawaban benar
Pilih 3 karakteristik dari Big Data (Jawaban lebih dari satu)
Volume
Velocity
Variety
Verifiable
Pilih 3 Proses yang dilakukan pada Data Mining (Jawaban lebih dari satu)
Proses mengekstraksi data dari sekumpulan data yang memiliki volume yang sangat besar (big data)
Proses untuk mengenali dan menemukan pola tersembunyi di seluruh kumpulan big data
Proses menyelidiki, menganalisis, dan mendemonstrasikan data untuk menemukan informasi yang berguna
Proses yang menghasilkan pola data
2 teknik utama Machine Learning, yaitu...
Supervised Learning dan Unsupervised Learning
Evaluation dan Presentation
Clustering dan Anomaly Detection
Classification dan Regression
Pilih 2 Teknik yang sesuai dengan Teknik Supervised Learning pada Machine Learning (Jawaban Lebih dari satu)
Classification
Anomaly Detection
Regression
Clustering
Pilih 2 Teknik yang sesuai dengan Teknik Unsupervised Learning pada Machine Learning (Jawaban Lebih dari satu)
Classification
Anomaly Detection
Regression
Clustering
Proses pengolahan data terstruktur, tidak terstruktur, semi-terstruktur lebih baik dilakukan menggunakan metode...
Data Analysis
Data Mining
Data Preparation
Data Validation
Sub-bidang besar dari Artificial Intelligence (AI) yang membahas tentang bidang studi yang memberikan komputer kemampuan untuk belajar tanpa diprogram secara eksplisit disebut...
Machine Learning
Data Mining
Neural Network
Supervised Learning
Proses sorting data menjadi beberapa kategori disebut...
Classification
Regression
Clustering
Anomaly Detection
Menemukan pola tersembunyi pada input data yang tidak dikenali termasuk proses teknik Machine Learning...
Unsupervised Learning
Supervised Learning
Reinforcement Learning
Active Learning
Melatih model dengan input dan output yang telah dikenali, sehingga dapat memprediksi masa depan output termasuk proses teknik Machine Learning...
Unsupervised Learning
Reinforcement Learning
Active Learning
Supervised Learning
Data berikut ini yang merupakan jawban yang benar dari perlakuan Proses klasifikasi dalam data mining adalah...
Semua Benar
Pernyataan dibawah ini yang bukan peranan utama data mining adalah...
Klasifikasi
Klasterisasi
Asosiasi
Semua Benar
Berdasarkan jenis/metode pembelajarannya, maka clustering termasuk dalam ....
Supervised Learning
Unsupervised Learning
Semi Supervised Learning
Reinforcement Learning
Decision Tree (CART, ID3, C4.5, Credal DT, Credal C4.5, Adaptative Credal C4.5), Naive Bayes (NB), K-Nearest Neighbor (kNN), Linear Discriminant Analysis (LDA), Logistic Regression (LogR) adalah algoritma yang bisa digunakan untuk metode ....
Klasifikasi
Clustering
Asosiasi
Estimasi
Berdasarkan jenis pembelajarannya, algoritma melakukan proses belajar berdasarkan nilai dari variabel target yang terasosiasi dengan nilai dari variabel
prediktor disebut .....
Supervised Learning
Unsupervised Learning
Semi-Supervised Learning
Reinforcement Learning
Pandang gambar berikut. Manakah dari pernyataan- pernyataan berikut yang benar.
Gambar A dan C mempunyai fungsi pemisah (klasifier) yang cukup baik.
Gambar B dan D mempunyai fungsi pemisah (klasifier) yang terbaik.
Gambar B, C dan D mempunyai fungsi pemisah (klasifier) yang sama baiknya.
Gambar D mempunyai fungsi pemisah (klasifier) yang terbaik
Berdasarkan data berikut ini, si A usia remaja dan seorang pelajar. Berapakah peluang si A beli computer yes dan no!
Peluang si A beli computer = 0.8 dan tidak beli computer = 0.2
Peluang si A beli computer = 0.25 dan tidak beli computer = 0.5
Peluang si A beli computer = 0.88 dan tidak beli computer = 0.2
Peluang si A beli computer = 0.175 dan tidak beli computer = 0.02
Gambar di samping adalah gambar ...
Partitional Clustering
Traditional Hierarchical Clustering
Non-traditional Hierarchical Clustering
Traditional Dendrogram
Non-traditional Dendrogram
Misalkan ada dua titik centroid, yaitu m1 dan m2.
m1 = G dan m2 = H
Point yang mana saja yang paling dekat ke m2 ...
A dan C
A dan E
B dan D
B dan E
C dan E
Diketahui sebuah data terdiri dari 4 baris dan 5 kolom, maka data tersebut memiliki...
atribut sebanyak 5
atribut sebanyak 4
atribut sebanyak 9
atribut sebanyak 20
Yang ditunjuk oleh panah merah disebut..
Attribute/Feature/Dimension
Class/Label/Target
Record/
Object/
Sample/
Tuple/Data
Numerik
Yang ditunjuk oleh panah biru disebut..
Attribute/Feature/Dimension
Class/Label/Target
Record/
Object/
Sample/
Tuple/Data
Numerik
Pilih peran data mining yang termasuk ke dalam supervised learning !
Estimasi
Klasterisasi
Asosiasi
Numerik
Pilih peran data mining yang termasuk ke dalam unsupervised learning !
Estimasi
Klasterisasi
Asosiasi
Numerik
Dalam dataset (himpunan data) bagian yang di beri garis merah disebut (pilih 3 jawaban)
Attribute
Dimension
Feature
Target
Berikut ini merupakan algoritma yang tidak termasuk dalam metode estimasi dalam data mining (pilih 2 jawaban)
Regresi Linear Sederhana
Algoritma C 4.5
Algoritma K-Nearest Neighbor
Multiple Regression
Output yang dihasilkan dari metode Regresi Linear Sederhana adalah ...
Rule
Persamaan
Tree
Report
Pada algoritma apriori diperlukan 2 parameter yang harus digunakan dalam menemukan aturan asosiatif antara suatu kombinasi item, yaitu
Support
Hipotesis
Confidence
Koefesien
Aturan yang digunakan untuk menganalisis asosiasi antara beberapa atribut disebut
Market Basket Analysis
Frequent Pattern Mining
Generalized Rule
Hash Based
Rumus ini merupakan rumus untuk mencari parameter
Support
Confidence
Rule
Persamaan
Supervised learning biasanya bertujuan untuk prediksi, baik itu klasifikasi maupun numerik prediksi seperti regresi, ciri utamanya adalah variabel targetnya (yang akan diprediksi) sudah ada. Sementara unsupervised learning bertujuan untuk deskriptif atau mencari insight dari data, ciri utamanya adalah tidak adanya variabel target, berikut ini yang termasuk kedalam algoritma unsupervised learning adalah?
SVM
K-Means
Jaringan syaraf tiruan (JST)
Naïve Bayes
Suatu proses dari kumpulan record yang memiliki kemiripin satu dengan yang lainnya dan memiliki ketidakmiripan dengan record-record yang lainnya ?
Analisis Klaster
Analisis Apriori
Analisis Asosiasi
Analisis Data Mining
Apakah yang dikembangkan oleh amazon.com dalam memanfaatkan aturan asosiasi ?
Mengembangkan program untuk mencari barang yang paling sedikit untuk dibeli
Program untuk merekomendasikan barang-barang lain kepada pembeli pada saat pembeli melakukan browsing atau membeli suatu barang berdasarkan tingkat keyakinan (confidence)
Mengembangkan aplikasi sesuai dengan barang yang sering dicari oleh konsumen
Mengembangkan program untuk mencari barang yang paling banyak dibeli
Menemukan kemiripan data berdasarkan karakteristik dan mengelompokan data yang mirip ke dalam cluster berikut ini disebut ?
Cluster analysis
Ukuran kesamaan
Requirement cluster
Struktur Data
Output / Model / Pengetahuan yang dihasilkan dari data mining, pilih 3 jawaban!
Formula
Decision Tree
Report
Rule
Estimasi
Sistem simulasi yang benar adalah...
sebuah objek yang diminati disebut entitas
setiap properti dari sebuah entitas disebut atribut
nasabah bank dapat digambarkan sebagai entitas
karakteristik pelanggan (seperti pekerjaan pelanggan) dapat didefinisikan sebagai atribut
semua benar
simulasi merupakan ...
suatu model pengambilan keputusan dengan mencontoh atau mempergunakan gambaran sebenarnya dari suatu sistem kehidupan dunia nyata tanpa harus mengalaminya pada keadaan yang sesungguhnya.
suatu model pembuatan keputusan dengan mencontoh atau mempergunakan gambaran asal dari suatu sistem kehidupan dunia fana tanpa harus mengalaminya pada keadaan yang sesungguhnya.
suatu model pengambilan rencana dengan mencontoh atau mempergunakan uraian sebenarnya dari suatu sistem kehidupan dunia nyata dengan harus mengalaminya pada keadaan yang sesungguhnya.
suatu model pengambilan keputusan dengan mencontoh atau mempergunakan gambaran sebenarnya dari suatu sistem kehidupan dunia nyata dengan harus mengalaminya pada keadaan yang sesungguhnya.
