Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Big Data Analysis

Total questions: 20

Worksheet time: 15mins

Name
Class
Date
1.

1. Hadoop digunakan untuk…

a)

a. Menyimpan dan memproses data besar secara terdistribusi

b)

b. Menampilkan grafik interaktif

c)

c. Mengedit gambar digital

d)

d. Menjalankan aplikasi mobile

2.

2. Komponen utama Hadoop yang berfungsi untuk menyimpan data adalah:

a)

a. MapReduce

b)

b. HDFS (Hadoop Distributed File System)

c)

c. YARN

d)

d. Hive

3.

3. Komponen Hadoop yang berfungsi untuk memproses data adalah:

a)

a. MapReduce

b)

b. HDFS

c)

c. HBase

d)

d. Pig

4.

4. Apache Spark adalah framework yang digunakan untuk:

a)

a. Menyimpan file di komputer lokal

b)

b. Memproses data besar secara cepat menggunakan in-memory computing

c)

c. Menyediakan GUI untuk Python

d)

d. Menjalankan aplikasi web

5.

5. Bahasa pemrograman utama yang digunakan Spark adalah:

a)

a. C++

b)

b. Java, Scala, dan Python

c)

c. PHP

d)

d. R

6.

6. PySpark adalah:

a)

a. Library untuk mengedit gambar

b)

b. Antarmuka (interface) Python untuk Apache Spark

c)

c. Plugin untuk Hadoop

d)

d. Alat visualisasi data

7.

7. Java diperlukan dalam instalasi Hadoop karena:

a)

a. Hadoop ditulis dan berjalan di atas Java Virtual Machine (JVM)

b)

b. Java berfungsi untuk visualisasi data

c)

c. Hadoop hanya bisa dijalankan di C++

d)

d. Java digunakan untuk koneksi database saja

8.

8. Framework Anaconda digunakan untuk:

a)

a. Mengedit teks

b)

b. Mengelola paket Python dan lingkungan data science

c)

c. Menjalankan aplikasi mobile

d)

d. Mengatur jaringan Hadoop

9.

9. Jupyter Notebook digunakan untuk:

a)

a. Menulis dan menjalankan kode Python secara interaktif

b)

b. Mengedit foto dan video

c)

c. Mengelola cluster Hadoop

d)

d. Menyimpan file HTML

10.

10. Perintah untuk membaca dataset di PySpark adalah:

a)

a. pd.read_csv()

b)

b. spark.read.csv()

c)

c. open("file.csv")

d)

d. import csv

11.

11. Untuk menampilkan lima baris pertama dari DataFrame di PySpark digunakan perintah:

a)

a. show(5)

b)

b. display(5)

c)

c. print.head(5)

d)

d. df.describe()

12.

12. Dalam proses data cleaning, langkah yang biasa dilakukan adalah:

a)

a. Menambah noise pada data

b)

b. Menghapus nilai kosong atau duplikat

c)

c. Menambah error pada kolom data

d)

d. Mengganti tipe data menjadi string semua

13.

13. Perintah di PySpark untuk menampilkan struktur (schema) data adalah:

a)

a. df.shape()

b)

b. df.printSchema()

c)

c. df.columns()

d)

d. df.show()

14.

14. Library Python yang sering digunakan untuk data cleaning selain PySpark adalah:

a)

a. Matplotlib

b)

b. Pandas

c)

c. OpenCV

d)

d. Django

15.

15. Perintah df.na.drop() di PySpark digunakan untuk:

a)

a. Menghapus baris yang berisi nilai kosong (null)

b)

b. Menghitung nilai rata-rata

c)

c. Menampilkan kolom dengan nilai unik

d)

d. Menambah kolom baru

16.

16. Untuk mengganti nilai kosong dengan nilai tertentu di PySpark digunakan:

a)

a. df.fillna(value)

b)

b. df.replace(value)

c)

c. df.update(value)

d)

d. df.na.add(value)

17.

17. Langkah modeling dalam analisis data berarti:

a)

a. Membangun model matematika atau machine learning untuk memprediksi pola data

b)

b. Menghapus data yang salah

c)

c. Menyimpan data ke database

d)

d. Membuat grafik saja

18.

18. Dalam Spark MLlib, algoritma untuk regresi linear disebut:

a)

a. LinearRegression

b)

b. KMeans

c)

c. DecisionTreeClassifier

d)

d. NaiveBayes

19.

19. Untuk menampilkan hasil prediksi dari model PySpark ML digunakan

a)
c)

c. df.printSchema()

d)

d. spark.display()

20.

20. Keuntungan utama menggunakan PySpark dibandingkan Python biasa adalah:

a)

a. Dapat memproses data besar (big data) secara paralel di cluster

b)

b. Lebih cepat dalam membuat grafik

c)

c. Tidak membutuhkan instalasi Java

d)

d. Hanya bekerja untuk data kecil