WorksheetsBig Data Analysis
Total questions: 20
Worksheet time: 15mins
1. Hadoop digunakan untuk…
a. Menyimpan dan memproses data besar secara terdistribusi
b. Menampilkan grafik interaktif
c. Mengedit gambar digital
d. Menjalankan aplikasi mobile
2. Komponen utama Hadoop yang berfungsi untuk menyimpan data adalah:
a. MapReduce
b. HDFS (Hadoop Distributed File System)
c. YARN
d. Hive
3. Komponen Hadoop yang berfungsi untuk memproses data adalah:
a. MapReduce
b. HDFS
c. HBase
d. Pig
4. Apache Spark adalah framework yang digunakan untuk:
a. Menyimpan file di komputer lokal
b. Memproses data besar secara cepat menggunakan in-memory computing
c. Menyediakan GUI untuk Python
d. Menjalankan aplikasi web
5. Bahasa pemrograman utama yang digunakan Spark adalah:
a. C++
b. Java, Scala, dan Python
c. PHP
d. R
6. PySpark adalah:
a. Library untuk mengedit gambar
b. Antarmuka (interface) Python untuk Apache Spark
c. Plugin untuk Hadoop
d. Alat visualisasi data
7. Java diperlukan dalam instalasi Hadoop karena:
a. Hadoop ditulis dan berjalan di atas Java Virtual Machine (JVM)
b. Java berfungsi untuk visualisasi data
c. Hadoop hanya bisa dijalankan di C++
d. Java digunakan untuk koneksi database saja
8. Framework Anaconda digunakan untuk:
a. Mengedit teks
b. Mengelola paket Python dan lingkungan data science
c. Menjalankan aplikasi mobile
d. Mengatur jaringan Hadoop
9. Jupyter Notebook digunakan untuk:
a. Menulis dan menjalankan kode Python secara interaktif
b. Mengedit foto dan video
c. Mengelola cluster Hadoop
d. Menyimpan file HTML
10. Perintah untuk membaca dataset di PySpark adalah:
11. Untuk menampilkan lima baris pertama dari DataFrame di PySpark digunakan perintah:
a. show(5)
b. display(5)
c. print.head(5)
d. df.describe()
12. Dalam proses data cleaning, langkah yang biasa dilakukan adalah:
a. Menambah noise pada data
b. Menghapus nilai kosong atau duplikat
c. Menambah error pada kolom data
d. Mengganti tipe data menjadi string semua
13. Perintah di PySpark untuk menampilkan struktur (schema) data adalah:
14. Library Python yang sering digunakan untuk data cleaning selain PySpark adalah:
a. Matplotlib
b. Pandas
c. OpenCV
d. Django
15. Perintah df.na.drop() di PySpark digunakan untuk:
a. Menghapus baris yang berisi nilai kosong (null)
b. Menghitung nilai rata-rata
c. Menampilkan kolom dengan nilai unik
d. Menambah kolom baru
16. Untuk mengganti nilai kosong dengan nilai tertentu di PySpark digunakan:
17. Langkah modeling dalam analisis data berarti:
a. Membangun model matematika atau machine learning untuk memprediksi pola data
b. Menghapus data yang salah
c. Menyimpan data ke database
d. Membuat grafik saja
18. Dalam Spark MLlib, algoritma untuk regresi linear disebut:
a. LinearRegression
b. KMeans
c. DecisionTreeClassifier
d. NaiveBayes
19. Untuk menampilkan hasil prediksi dari model PySpark ML digunakan
20. Keuntungan utama menggunakan PySpark dibandingkan Python biasa adalah:
a. Dapat memproses data besar (big data) secara paralel di cluster
b. Lebih cepat dalam membuat grafik
c. Tidak membutuhkan instalasi Java
d. Hanya bekerja untuk data kecil
