Font size
WorksheetsData Sciene
Total questions: 100
Worksheet time: 1hrs 5mins
Apa yang dimaksud dengan Data Science?
Ilmu yang mempelajari pola perilaku manusia.
Ilmu yang memanfaatkan data untuk mendapatkan wawasan dan pengetahuan.
Ilmu yang mempelajari sistem komputer.
Ilmu yang mengembangkan algoritma untuk permainan video.
Sebutkan tiga peran utama dalam tim Data Science.
Data Analyst, Data Engineer, Data Scientist
Project Manager, Software Engineer, Network Engineer
Web Developer, Mobile Developer, System Analyst
Graphic Designer, UX Designer, Product Manager
Apa perbedaan antara Data Science dan Data Mining?
Data Science fokus pada analisis data, sedangkan Data Mining fokus pada pengumpulan data.
Data Science mencakup seluruh siklus hidup data, sedangkan Data Mining fokus pada menemukan pola dalam data.
Data Science hanya menggunakan teknik statistik, sedangkan Data Mining hanya menggunakan machine learning.
Data Science hanya digunakan di perusahaan teknologi, sedangkan Data Mining digunakan di semua industri.
Jelaskan siklus hidup proyek Data Science.
Pengumpulan Data, Pengolahan Data, Analisis Data, Visualisasi Data
Desain, Implementasi, Pengujian, Pemeliharaan
Perencanaan, Pengembangan, Penerapan, Evaluasi
Inisiasi, Perencanaan, Eksekusi, Penyelesaian
Apa yang dimaksud dengan mean?
Nilai tengah dari data yang terurut
Nilai yang paling sering muncul dalam data
Jumlah total semua nilai dibagi dengan jumlah data
Selisih antara nilai tertinggi dan terendah
Apa itu standar deviasi?
Nilai tengah dari data yang terurut
Pengukuran penyebaran data dari rata-rata
Nilai yang paling sering muncul dalam data
Jumlah total semua nilai dibagi dengan jumlah data
Apa itu distribusi normal?
Distribusi di mana data tersebar merata ke semua nilai
Distribusi di mana data terkumpul pada satu nilai
Distribusi berbentuk lonceng yang simetris terhadap rata-rata
Distribusi di mana data tersebar hanya pada nilai ekstrem
Apa itu regresi linear?
Metode untuk mengelompokkan data ke dalam beberapa kelompok
Metode untuk mengidentifikasi hubungan antara variabel independen dan variabel dependen
Metode untuk mengurangi dimensi data
Metode untuk menemukan pola tersembunyi dalam data
Apa bahasa pemrograman yang paling umum digunakan dalam Data Science?
JavaScript
Python
HTML
PHP
Apa itu library Pandas dalam Python?
Library untuk membuat game
Library untuk analisis dan manipulasi data
Library untuk pengembangan web
Library untuk pengolahan citra
Apa perbedaan antara list dan dictionary dalam pemrograman Python?
List digunakan untuk menyimpan nilai-nilai tunggal, sedangkan dictionary untuk pasangan key-value
List digunakan untuk menyimpan pasangan key-value, sedangkan dictionary digunakan untuk menyimpan nilai tunggal
List digunakan untuk menyimpan nilai-nilai yang berurutan, sedangkan dictionary untuk pasangan key-value
List digunakan untuk menyimpan nilai-nilai string, sedangkan dictionary untuk nilai-nilai numerik
Apa yang dimaksud dengan data cleaning?
Proses mengumpulkan data
Proses menghapus data yang tidak relevan
Proses mengorganisir data dalam database
Proses membersihkan dan mempersiapkan data untuk analisis
Sebutkan dua teknik umum yang digunakan dalam data cleaning.
Normalisasi dan pengelompokan
Imputasi dan penghapusan duplikasi
Visualisasi dan prediksi
Pengindeksan dan penyortiran
Apa itu missing data?
Data yang tidak relevan
Data yang hilang atau tidak tersedia dalam dataset
Data yang duplikat
Data yang sudah dianalisis
Apa yang dimaksud dengan supervised learning?
Metode machine learning yang digunakan untuk mengelompokkan data
Metode machine learning yang dilatih dengan data berlabel
Metode machine learning yang tidak menggunakan data berlabel
Metode machine learning yang digunakan untuk mereduksi dimensi data
Jelaskan apa itu overfitting dalam konteks machine learning.
Ketika model terlalu sederhana dan tidak dapat menangkap pola dalam data
Ketika model terlalu kompleks dan menangkap noise serta pola dari data latih
Ketika model tidak dapat dikonvergensi selama pelatihan
Ketika model dilatih dengan data yang tidak berlabel
Apa itu cross-validation dalam machine learning?
Teknik untuk mengumpulkan data tambahan
Teknik untuk membagi data menjadi subset untuk pelatihan dan pengujian
Teknik untuk mengurangi dimensi data
Teknik untuk menemukan outlier dalam data
Apa tujuan utama dari visualisasi data?
Untuk menghapus data yang tidak relevan
Untuk membuat data lebih mudah dipahami dan dianalisis
Untuk mengelompokkan data
Untuk mengumpulkan data tambahan
Sebutkan dua library yang digunakan untuk visualisasi data dalam Python.
Pandas dan Numpy
Matplotlib dan Seaborn
Scikit-learn dan TensorFlow
OpenCV dan Pillow
Apa itu heatmap dan dalam situasi apa biasanya digunakan?
Grafik untuk menampilkan distribusi data numerik
Grafik untuk menampilkan hubungan antar variabel dalam bentuk matriks
Grafik untuk menampilkan urutan data dalam waktu
Grafik untuk menampilkan nilai tertinggi dan terendah dalam dataset
Berikut ini adalah library python yang populer digunakan dalam Data Science, Kecuali ....
Ggplot2
Matplotlib
Numpy
Pandas
Lybrary python yang populer digunakan untuk machine learning adalah ....
Scikit-Learn
SciPy
Pandas
Numpy
IPython merupakan singkatan dari .... yang disimpan dalam format ekstensi ....
Interest Python; .py
Internet Python; .html
Intertactive Python; .ipynb
International Python; .pdf
Numpy adalah library python yang berfokus pada ....
Numerical Computation
Machine Learning
Visualization
Panel Data
Output dati kode berikut adalah ....
(4,2)
6
8
(2,4)
Output code berikut dihasilkan dari input code ....
np.array([1,2,3,4,5,6,7,8])
np.arange(9)
np.arange(8).reshape(3,3)
np.arange(9).reshape(3,3)
Di Pandas, kita mengenal dua objek, yaitu ....
Series dan DataFrame
Vector dan List
Array dan List
Vector dan DataFrame
Function di bawah ini digunakan untuk mengimpot data csv ke format Python dengan pandas
pd.read_txt()
pd.DataFrame()
pd.read_csv()
pd.load_csv()
Pada gambar berikut, fungsi apa yang digunakan untuk menampilkan tulisan "YEAR" pada sumbu-x di bawah gambar ...
plt.xlabel("YEAR")
plt.ylabel("YEAR")
plt.plot("YEAR")
plt.title("YEAR")
Berikut ini adalah Development Environment untuk bekerja dengan python, kecuali ....
Google Collaboratory
Spyder
Jupyter Notebook
Weka
Berikut proses data science, kecuali ?
data preparation
operation
integration
comunicate result
Mendistribusikan kumpulan data untuk pelatihan dan pengujian, merupakan proses data science dari ?
Dara preparation
Model building
Model Planing
Operation
Memilih analytic approach sesuai permasalahan yang akan coba diselesaikan masuk ke dalam metohology apa ?
Analytic Approach
Data Collection
Modelling
Evaluation
Model yang biasanya digunakan untuk menunjukan hubungan ?
klasifikasi
klarifikasi
prediktif
deskriptif
Model yang biasanya digunakan untuk menentukan probabilitas suatu tindakan ?
prediktif
deskriptif
klasifikasi
klarifikasi
proses transformasi data menjadi fitur-fitur yang lebih representatif dalam membantu menyelesaikan masalah dengan lebih baik disebut
Creation Enginering
Feature transformation
Feature engineering
Creation transformation
Tahapan yang paling memakan banyak waktu ?
Data Collection
Data preparation
Data Understanding
Data requirements
Fase diagnostic measures adalah
Digunakan untuk memastikan model bekerja dengan baik sesuai yang diharapkan
Digunakan untuk memastikan data sudah sesuai
Digunakan untuk memastikan bahwa data yang digunakan telah ditangani dan diinterpretasikan dengan benar dalam model
Digunakan untuk memastikan bahwa Metode yang digunakan sudah benar
Digunakan untuk memastikan bahwa data yang digunakan telah ditangani dan diinterpretasikan dengan benar di dalam model disebut ?
Fase diagnostic measures
Fase analytic measures
Fase statistical significance testing
Fase testing
Pengujian terhadap kualitas model apakah model yang dirancang sebelumnya tersebut dapat mengatasi permasalahan bisnis dengan tepat merupakan tahap dari ?
Feedback
Modelling
Evaluation
Deployment
Algoritma machine learning di mana kita memiliki label yang ingin diprediksi disebut
Reinforcement learning
Supervised learning
Unsupervised learning
Semi-supervised learning
Mana yang merupakan bagian dari algoritma unsupervised learning
Linear regression
Support vector machines
K-Means Clustering
Decision tree
Mana yang merupakan bagian dari algoritma supervised learning
Hierarchical clustering
Logistic regression
K-Means
DB-Scan
Algoritma di mana variabel yang kita prediksi memiliki tipe data kategori disebut dengan
Clustering
Regresi
Klasifikasi
PCA
Algoritma di mana variabel yang ingin kita prediksi memiliki tipe data numerik disebut dengan
Regresi
Klasifikasi
Clustering
PCA
Pilih 3 tipe machine learning yang bisa digunakan untuk menyelesaikan masalah
Supervised learning
Unsupervised learning
Reinforcement learning
Technical learning
Learning differentiated
Salah satu metode di mana kita melakukan evaluasi train dan validation set berkali-kali disebut dengan
Hold-out method
Splitting method
Cross validation
Repetitive evaluation
Di Orange, widget yang bisa digunakan untuk melakukan cross validation disebut dengan
Predictions
Preprocess
Confusion matrix
Test and Score
Nilai apa yang harus kita masukkan ketika menemui data tipe kategori yang kosong?
Mean
Median
Modus
Standar deviasi
Salah satu metrik algoritma klasifikasi yang bisa digunakan untuk evaluasi adalah
RSME
AUC
MAE
R2
Berikut ini adalah berbagaihal penting dalam data mining kecuali..
Estimasi
Asosiasi
Klastering
Korelasi
Klasifikasi
Pada tahap Data Pre-processing, dilakukan kegiatan berikut yakni... (bisa lebih dari satu jawaban)
Data Cleaning
Data Integration
Data Analyzing
Data Reduction
Kriteria evaluasi dan validasi model diperlukan tiga hal yaitu
akurasi
kecepatan
kehandalan
kegunaan
Berapa Nilai akurasi modelnya?
92%
95%
97&
98%
Output dari Visualization dan Models adalah...
Insight
Knowledge
Predictive Model
Tidak ada yang benar
Bentuk ini adalah salah satu model Algoritma yang dinamakan...
Random Forest
Naive Bayes
Decision Tree
Logistic Regression
Apa singkatan dari CA pada gambar ini?
(a)
Apa nama metode machine learning dengan model seperti ini?
K-means
Decision Tree
Random Forest
SVM
widget yang benar adalah...
Gambar seperti ini didapatkan dari widget...
Network File
Network Explorer
Network Analysis
Network Clustering
Corpus
Preprocess Text
Corpus Viewer
Corpus to Network
.... ........ mencari informasi dari sumber-sumber data melalui identifikasi dan eksplorasi pola tertentu.
(tuliskan dua kata menggunakan spelling english)
(a)
Pada area text mining dimana pola dari suatu dokumen mulai teridentifikasi adalah pada tahap..
Information Retrieval
Knowledge Discovery
Natural Language Processing
Information Extraction
Pada area text mining dimana informasi yang sudah diperoleh sebelumnya akan diesktrak sehingga peneliti akan lebih mudah memahami permasalahan yang diteliti melalui visualisasi yang ditampilkan adalah..
Information Retrieval
Knowledge Discovery
Natural Language Processing
Information Extraction
Proses memecah teks menjadi komponen yang lebih kecil (kata, kalimat, bigrams) yang terjadi pada Preprocess Text disebut..
Transformation
Tokenization
Normalization
Filtering
Pada Preprocess Text ada tahapan "Most frequent tokens". Perintah ini ada pada kelompok...
Transformation
Tokenization
Normalization
Filtering
Widget (a) adalah kumpulan dokumen yang dapat menyajikan jumlah baris kalimat, dan menentukan mana fitur yang akan dan tidak akan dimasukkan untuk keperluan analisis.
Pada Preprocess Text terdapat tahapan berikut kecuali...
transformation
tokenization
stemming
distance
Machine learning is a subset of_________
Data Learning
Deep Learning
Artificial Intelligence
None of the above
Following is not the type of Machine Learning .
Semi-Unsupervised Learning
Supervised Learning
unsupervised Learning
Reinforcement Lraning
Which is the inner most part (Subset of Machine learning) in the given image?
Deep Learning
Machine Learning
Artificial Intelligence
-------- type of problem is handled by Supervise Machine Learning.
Association
Classification and Regression
Clustering
Formatting
_________ is a Feedback based learning method.
Unsupervised Learning
Reinforcement Learning
Supervised Learning
None of the given
Observe an image and Identify Type of Machine Learning.
Supervised
Unsupervised
Reinforcement
Can't Identify
from the picture, what kind of programming is it?
Traditional Programming
Modern Programming
Machine Learning
Traditional Learning
Fraud Detection, Image Classification, Diagnostic, and Customer Retention are applications in ...
Unsupervised Learning: Clustering
Supervised Learning: Classification
Reinforcement Learning
Unsupervised Learning: Regression
Regression is a case of which type of ML?
Deep learning
Unsupervised
Reinforced
Supervised
Which of the following Machine Learning type uses Unlabeled Dataset?
Supervised Machine Learning
Unsupervised Machine Learning
Reinforcement Machine Learning
None of the Above
How would you rate the overall quality of the lecture?
Poor
Good
Very Good
Excellent
Apa perbedaan utama antara supervised learning dan unsupervised learning?
Supervised learning menggunakan data tanpa label, sedangkan unsupervised learning menggunakan data berlabel
Supervised learning digunakan untuk clustering, sedangkan unsupervised learning untuk prediksi
Supervised learning menggunakan data berlabel, sedangkan unsupervised learning tidak berlabel
Supervised learning lebih cepat daripada unsupervised learning
Contoh algoritma yang digunakan dalam supervised learning adalah...
Support Vector Machine (SVM)
Linear Regression
K-Nearest Neighbors (k-NN)
Semua Benar
Mengapa dataset harus memiliki label dalam supervised learning?
Agar model bisa belajar pola hubungan antara input dan output
Agar data lebih mudah dikumpulkan
Agar bisa digunakan dalam semua jenis machine learning
Untuk mempercepat proses training model
Bagaimana cara kerja algoritma KNN dalam mengklasifikasikan data baru?
Menggunakan decision tree untuk membagi data
Menghitung jarak antara data baru dan tetangga terdekatnya
Menggunakan persamaan regresi untuk memprediksi nilai data baru
Membuat model yang terus memperbarui bobot berdasarkan kesalahan
Mengapa pemilihan jumlah tetangga (k) dalam algoritma KNN sangat penting?
Jika k terlalu kecil, model bisa terlalu sensitif terhadap noise
Jika k terlalu besar, model akan selalu memilih kelas pertama
K tidak mempengaruhi performa model
Nilai k yang lebih besar selalu lebih baik
Apa perbedaan antara linear regression dan logistic regression?
Linear regression digunakan untuk klasifikasi, sedangkan logistic regression untuk regresi
Linear regression memprediksi nilai kontinu, sedangkan logistic regression memprediksi kelas
Logistic regression digunakan dalam supervised learning, sedangkan linear regression dalam unsupervised learning
Linear regression tidak membutuhkan dataset berlabel
Contoh algoritma dalam unsupervised learning adalah...
Support Vector Machine (SVM)
Naïve Bayes
K-Means
Linear Regression
Apa prinsip dasar dari algoritma K-Means Clustering?
Membagi data ke dalam k kelompok berdasarkan kesamaan
Memanfaatkan jaringan saraf tiruan untuk mengelompokkan data
Menentukan kelas data berdasarkan perhitungan probabilitas
Menggunakan bobot dan bias untuk memisahkan klaster
Bagaimana cara menentukan jumlah k (cluster) yang optimal dalam algoritma K-Means?
Dengan menebak jumlah klaster berdasarkan intuisi
Dengan menggunakan metode Elbow
Dengan menghitung jumlah total data dibagi dua
Dengan memilih jumlah klaster sebanyak mungkin
Bagaimana cara kerja unsupervised learning?
Menggunakan data berlabel untuk memprediksi nilai
Mengelompokkan data berdasarkan pola yang ditemukan
Melatih model menggunakan pasangan input-output
Memanfaatkan algoritma genetika untuk mencari solusi terbaik
Macam-macam definisis AI salah satunya disebut bertindak seperti manusia, yaitu
thinking humanly
acting humanly
thinking rasionaly
acting rasionaly
clustering termasuk dalam
unsupervised learning
supervised learning
reinforcement learning
semi supervised learning
Algoritma ini memerlukan data berlabel untuk membangun sebuah model yang tingkat akurasinya bisa ditingkatkan dari waktu ke waktu, disebut
supervised learning
unsupervised learning
reinforcement learning
semi supervised learning
regression termasuk dalam algoritma
supervised learning
unsupervised learning
reinforcement learning
semi supervised learning
Algoritma Decision Tree C.45 tergolong jenis
supervised Learning
unsupervised learning
reinforcement learning
semi supervised learning
metode pada supervised learning yang mengembalikan target numerik untuk setiap sampel disebut model
regresi
klasifikasi
clustering
metode Unsupervised Learning yang bertujuan untuk melakukan pengelompokan data berdasarkan kemiripan atau jarak antar data.
clustering
klasifikasi
regresi
mengetahui perkiraan waktu tempuh dalam aplikasi GMap, termasuk alam task
klasifikasi
estimasi
forecasting
clustering
yang termasuk data terstruktur adalah
data tabular
data berorientasi objek
time series
data teks dalam dokumen teks bebas
