wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Quiz tentang Big Data

Total questions: 100

Worksheet time: 50mins

Name
Class
Date
1.

Apa yang dimaksud dengan Big Data ?

a)

Data yang dapat dianalisis menggunakan Excel

b)

Data yang berstruktur dan mudah dianalisis

c)

Data yang melebihi kapasitas pemrosesan sistem database konvensional

d)

Data kecil dengan struktur tetap

2.

Salah satu karakteristik Big Data adalah "Velocity". Apa maksud dari karakteristik ini?

a)

Banyaknya tipe data

b)

Kecepatan pertumbuhan dan aliran data

c)

Keakuratan data

d)

Volume data yang kecil

3.

Berikut ini yang merupakan tools untuk pengolahan data berbasis MapReduce adalah:

a)

Excel

b)

Oracle

c)

Hadoop

d)

SPSS

4.

Apa tujuan utama dari proses Data Cleansing dalam Big Data Analytics?

a)

Menggabungkan data dari berbagai sumber

b)

Menghapus data yang valid

c)

Membersihkan data dari kesalahan dan ketidaksesuaian

d)

Mengkompresi data

5.

Teknologi NoSQL cocok digunakan dalam Big Data karena:

a)

Memiliki struktur relasional

b)

Kurang efisien dalam penyimpanan cloud

c)

Lebih cepat dan scalable dibanding RDBMS

d)

Tidak dapat memproses data real-time

6.

Contoh penggunaan Big Data pada sektor pemerintahan adalah:

a)

Menyimpan dokumen rahasia

b)

Mengelola anggaran tahunan

c)

Membuka portal data terbuka seperti data.jakarta.go.id

d)

Melarang akses ke data publik

7.

Dalam analisis sentimen, metode berbasis leksikon bergantung pada:

a)

Jaringan neural

b)

Sumber data sosial media

c)

Kamus kata yang sudah memiliki polaritas

d)

Pelatihan classifier

8.

Salah satu teknik pre-processing dalam Text Mining adalah "Stemming". Tujuannya adalah:

a)

Menambahkan imbuhan pada kata

b)

Menghapus kata-kata penting

c)

Mengembalikan kata ke bentuk dasar

d)

Mengubah kalimat menjadi paragraf

9.

Hadoop Distributed File System (HDFS) digunakan untuk:

a)

Menyimpan data dalam satu komputer saja

b)

Menyimpan data terpusat di cloud

c)

Membagi penyimpanan data ke banyak komputer

d)

Menghapus data otomatis

10.

Dalam crawling data Twitter, istilah "query" merujuk pada:

a)

Nama pengguna

b)

Kata kunci untuk pencarian

c)

Tanggal pembuatan akun

d)

Panjang tweet

11.

Proses tokenisasi dilakukan untuk:

a)

Menyatukan kata-kata

b)

Menyusun ulang paragraf

c)

Memisahkan kata dalam teks

d)

Menambahkan tanda baca

12.

Contoh data tidak terstruktur yang termasuk dalam Big Data adalah:

a)

CSV

b)

Tabel Excel

c)

Gambar dan video

d)

Data relasional

13.

Salah satu manfaat Big Data adalah:

a)

Menambah pekerjaan manusia

b)

Mengurangi penggunaan teknologi

c)

Memberikan wawasan bisnis dari data

d)

Menghilangkan kebutuhan penyimpanan

14.

Dalam teknologi Big Data, Apache Spark dikenal sebagai:

a)

Database relasional

b)

Platform analisis berbasis streaming dan in-memory

c)

Sistem keamanan

d)

Alat pengolah spreadsheet

15.

Twitter API memungkinkan kita untuk:

a)

Membuat akun palsu

b)

Mengakses data pengguna secara pribadi

c)

Mengambil data tweet secara programatik

d)

Menghapus tweet pengguna

16.

Dimensi "Veracity" dalam Big Data merujuk pada:

a)

Volume data

b)

Kecepatan data

c)

Keakuratan dan kebenaran data

d)

Bentuk data

17.

Aplikasi "Intelligent Apps" dalam Big Data digunakan untuk:

a)

Menghapus log sistem

b)

Mengatur update OS

c)

Memberikan layanan personalisasi

d)

Menonaktifkan akun pengguna

18.

Studi kasus: Kota besar di AS menggunakan MongoDB untuk menurunkan angka kriminalitas. Ini adalah contoh pemanfaatan:

a)

Database relasional

b)

RDBMS konvensional

c)

Big Data untuk pelayanan publik

d)

Spreadsheet

19.

Machine Learning dalam Big Data digunakan untuk:

a)

Membuat file ZIP

b)

Menulis laporan

c)

Memprediksi pola dari data besar

d)

Membuat aku

20.

Machine Learning dalam Big Data digunakan untuk:

a)

Membuat file ZIP

b)

Menulis laporan

c)

Memprediksi pola dari data besar

d)

Membuat akun media sosial

21.

Proses parsing dalam preprocessing bertujuan untuk:

a)

Menggabungkan beberapa file

b)

Mengenali struktur dokumen

c)

Menambahkan tanda baca

d)

Mengganti kata menjadi sinonim

22.

Dalam analisis prediktif, data digunakan untuk:

a)

Menyimpan laporan

b)

Memprediksi kejadian masa depan

c)

Membuat akun palsu

d)

Menghapus opini negatif

23.

Salah satu tantangan terbesar dalam Big Data adalah:

a)

Harga perangkat lunak

b)

Kurangnya tenaga kerja

c)

Cara memvisualisasi dan menambang data

d)

Kebutuhan listrik

24.

Salah satu manfaat preprocessing teks adalah:

a)

Meningkatkan ukuran data

b)

Menambah noise

c)

Mengurangi kompleksitas dokumen

d)

Menambah kata acak

25.

Mengapa text preprocessing penting dalam analisis sentimen?

a)

Untuk memperbesar ukuran dokumen

b)

Agar kata-kata tidak terbaca

c)

Untuk menyiapkan data agar bisa dianalisis dengan lebih baik

d)

Agar hasilnya acak

26.

Dalam crawling data Twitter, salah satu batasan Search API adalah:

a)

Tidak bisa digunakan

b)

Hanya berlaku untuk data maksimal 7 hari ke belakang

c)

Hanya bisa diakses oleh Twitter Blue

d)

Tidak dapat mengakses hashtag

27.

Teknik tokenisasi dalam preprocessing menghasilkan:

a)

Paragraf

b)

Kalimat utuh

c)

Potongan-potongan kata (tokens)

d)

Nilai numerik

28.

Teknologi in-memory memiliki keunggulan utama dalam hal:

a)

Biaya tinggi

b)

Kecepatan akses data

c)

Ketergantungan pada harddisk

d)

Penyimpanan permanen

29.

Contoh data dari social media yang sering dianalisis dalam Big Data adalah:

a)

Data geologi

b)

Data tweet dan komentar

c)

Data keuangan perusahaan

d)

Data sensor satelit

30.

Hadoop menggunakan sistem file:

a)

FAT32

b)

NTFS

c)

Hadoop Distributed File System (HDFS)

d)

EXT4

31.

Dalam MapReduce, fungsi Reduce bertugas untuk:

a)

Menghapus data

b)

Membagi data

c)

Mengelompokkan hasil dari proses Map

d)

Mencetak hasil ke layar

32.

Apa keuntungan penggunaan open source software dalam teknologi Big Data?

a)

Lebih mahal

b)

Memiliki lisensi tertutup

c)

Biaya implementasi lebih rendah

d)

Tidak bisa dikembangkan

33.

Teknologi Big Data banyak digunakan dalam industri berikut, kecuali:

a)

Perbankan

b)

Transportasi

c)

Media dan hiburan

d)

Pengelolaan rumah tangga pribadi

34.

Salah satu manfaat penggunaan WEKA dalam klasifikasi opini adalah:

a)

Memblokir tweet

b)

Menghapus data negatif

c)

Menguji model klasifikasi dengan data testing

d)

Menonaktifkan akun media sosial

35.

Berikut ini yang bukan termasuk karakteristik 5V Big Data adalah:

a)

Velocity

b)

Volume

c)

Vision

d)

Veracity

36.

Dalam analisis data besar, teknik clustering bertujuan untuk:

a)

Menyusun data secara acak

b)

Menghapus data penting

c)

Mengelompokkan data berdasarkan kesamaan

d)

Menggabungkan semua data jadi satu

37.

Dalam preprocessing, proses stopword removal bertujuan untuk:

a)

Menambahkan kata sambung

b)

Menghapus kata umum yang tidak penting

c)

Mengacak kata

d)

Menambahkan huruf kapital

38.

Teknik supervised learning memerlukan:

a)

Data acak tanpa label

b)

Label dan hasil benar untuk pelatihan

c)

Intervensi manual setiap saat

d)

Sistem keamanan tambahan

39.

Studi kasus: Perusahaan e-commerce menggunakan analisis sentimen untuk membaca reaksi pelanggan terhadap produk baru. Tujuan utama dari ini adalah:

a)

Menurunkan reputasi kompetitor

b)

Memblokir opini negatif

c)

Mengambil wawasan dari opini pelanggan

d)

Menambah pengikut di media sosial

40.

Dalam WEKA, proses training data dilakukan sebelum:

a)

Instalasi aplikasi

b)

Preprocessing

c)

Klasifikasi data testing

d)

Menentukan atribut

41.

Dalam WEKA, proses training data dilakukan sebelum:

a)

Instalasi aplikasi

b)

Preprocessing

c)

Klasifikasi data testing

d)

Menentukan atribut

42.

Salah satu cara memperoleh data real-time dari Twitter adalah:

a)

Scraping menggunakan browser

b)

Search API untuk data lebih dari sebulan

c)

Streaming API

d)

Meminta data ke pengguna

43.

Dalam algoritma Naive Bayes, dasar yang digunakan adalah:

a)

Regresi linier

b)

Statistik probabilitas

c)

Jaringan syaraf

d)

Kombinasi clustering

44.

Fungsi dari visualisasi data dalam Big Data adalah:

a)

Mengurangi jumlah data

b)

Menghapus data negatif

c)

Mempermudah pemahaman pola dari data

d)

Menambah noise data

45.

Dalam Text Mining, istilah "term index" merujuk pada:

a)

Nomor halaman

b)

Kata yang tidak berguna

c)

Kata kunci penting yang mewakili isi dokumen

d)

Angka statistik

46.

Aplikasi analisis prediktif dapat membantu bisnis dengan:

a)

Menyembunyikan data

b)

Membuat laporan pajak

c)

Memprediksi perilaku konsumen

d)

Mengatur shift karyawan

47.

Fitur retweet pada Twitter berguna dalam analisis karena:

a)

Menambah panjang karakter

b)

Menunjukkan popularitas dan penyebaran informasi

c)

Menghapus tweet asli

d)

Tidak menyimpan metadata

48.

Dataset yang digunakan untuk machine learning harus dibagi menjadi:

a)

Training dan testing

b)

HTML dan CSS

c)

SQL dan NoSQL

d)

Angka dan teks

49.

Salah satu risiko dari veracity data yang rendah adalah:

a)

Meningkatnya biaya perangkat

b)

Akurasi hasil analisis menurun

c)

Kecepatan pemrosesan meningkat

d)

Visualisasi lebih indah

50.

Hadoop memungkinkan pemrosesan data skala besar dengan:

a)

Pemrosesan paralel di satu server

b)

Penyimpanan di hard disk lokal

c)

Pendekatan terdistribusi dan paralel

d)

Kompresi zip data

51.

Analisis sentimen dapat digunakan oleh pemerintah untuk:

a)

Menyensor informasi publik

b)

Menilai opini masyarakat terhadap kebijakan tertentu

c)

Mempromosikan produk swasta

d)

Menghapus akun media sosial

52.

Salah satu sumber utama data Big Data berasal dari:

a)

Kertas kerja manual

b)

CD-ROM

c)

Media sosial dan perangkat IoT

d)

Arsip perpustakaan

53.

Dalam preprocessing, proses case folding bertujuan untuk:

a)

Mengganti huruf dengan angka

b)

Menghapus huruf kapital

c)

Mengubah semua huruf menjadi huruf kecil

d)

Menambahkan tanda baca

54.

Teknologi NoSQL digunakan dalam Big Data karena mampu:

a)

Menyimpan data kecil secara efisien

b)

Menyimpan dan menangani data yang tidak terstruktur

c)

Hanya mendukung bahasa SQL

d)

Menghapus data secara otomatis

55.

Perbedaan utama antara supervised dan unsupervised learning adalah:

a)

Jumlah data

b)

Ketersediaan label atau hasil yang diketahui

c)

Jenis bahasa pemrograman

d)

Waktu pelatihan

56.

Hadoop cocok digunakan untuk analisis retrospektif karena menggunakan:

a)

Neural network

b)

RDBMS

c)

MapReduce

d)

Decision tree

57.

Dalam WEKA, data dalam format .arff harus mengandung:

a)

Nomor halaman

b)

Atribut dan data instance

c)

Metadata gambar

d)

Tanggal dan waktu

58.

Salah satu alasan mengapa Big Data disebut sebagai "data is the new gold" adalah:

a)

Data sangat mahal

b)

Data memiliki nilai ekonomi besar bila dimanfaatkan

c)

Data harus digali dari tambang

d)

Data tidak bisa rusak

59.

Dalam crawling data Twitter, istilah "seeds" merujuk pada:

a)

Kata-kata acak

b)

Sumber awal URL yang dikunjungi

c)

Nama pengguna yang disimpan

d)

Retweet yang dihapus

60.

Salah satu indikator keberhasilan klasifikasi dalam WEKA adalah:

a)

Jumlah file .doc

b)

Kecepatan pemrosesan

c)

Akurasi model terhadap data testing

d)

Banyaknya kolom kosong

61.

Dalam visualisasi data, grafik digunakan untuk:

a)

Menyulitkan pemahaman

b)

Menyederhanakan penyajian data kompleks

c)

Meningkatkan

62.

Dalam visualisasi data, grafik digunakan untuk:

a)

Menyulitkan pemahaman

b)

Menyederhanakan penyajian data kompleks

c)

Meningkatkan ukuran file

d)

Menyembunyikan kesalahan

63.

Twitter dianggap penting dalam analisis sosial karena:

a)

Hanya bisa digunakan di Indonesia

b)

Data tidak dapat dibagikan

c)

Interaksi yang cepat dan bersifat publik

d)

Tidak memiliki trending topic

64.

Dalam proses MapReduce, output dari fungsi Map disebut:

a)

Dataset

b)

Vector

c)

Key/Value intermediate

d)

Node

65.

Salah satu manfaat dari text mining adalah:

a)

Mengubah teks menjadi grafik

b)

Menghapus semua kata dalam dokumen

c)

Menemukan pola dan informasi tersembunyi dalam teks

d)

Mengubah teks menjadi data numerik

66.

Data streaming dalam Big Data mengacu pada:

a)

Penyimpanan jangka panjang

b)

Aliran data secara real-time

c)

Data yang dicetak ke kertas

d)

Arsip data yang diam

67.

Proses penggabungan hasil fungsi Map berdasarkan Key dalam MapReduce dilakukan oleh:

a)

Visualisasi

b)

Reduce

c)

Tokenizer

d)

Parser

68.

Aplikasi seperti Facebook, Instagram, dan Twitter menyediakan:

a)

Data personal yang terproteksi

b)

Sumber data untuk analisis opini publik

c)

Data keuangan

d)

Data formal legal

69.

Salah satu jenis analisis dalam Web Mining yang fokus pada struktur hyperlink adalah:

a)

Web usage mining

b)

Web structure mining

c)

Web content mining

d)

Web data crawling

70.

Salah satu teknik klasifikasi dalam machine learning untuk data besar adalah:

a)

SQL

b)

Naive Bayes

c)

HTML

d)

API

71.

Contoh penerapan Big Data di sektor transportasi adalah:

a)

Mengumpulkan tiket manual

b)

Mengontrol lalu lintas menggunakan data sensor real-time

c)

Mengurangi jumlah kendaraan

d)

Menghapus data GPS

72.

Dalam preprocessing, menghapus duplikasi data dilakukan untuk:

a)

Menambah beban analisis

b)

Menurunkan akurasi

c)

Mengurangi redundansi dan meningkatkan efisiensi

d)

Mengubah format file

73.

Text mining banyak digunakan dalam:

a)

Analisis visual warna

b)

Sentiment analysis

c)

Pengolahan gambar

d)

Pemrosesan sinyal

74.

Keuntungan menggunakan Python untuk crawling data Twitter adalah:

a)

Tidak bisa digunakan di sistem operasi Linux

b)

Memiliki banyak library seperti Tweepy

c)

Hanya berjalan di browser

d)

Tidak mendukung data teks

75.

Salah satu hasil penting dari klasifikasi opini adalah:

a)

Nilai estetika dokumen

b)

Klasifikasi positif, negatif, atau netral

c)

Warna latar halaman

d)

Jumlah huruf kapital

76.

Contoh nyata analisis sentimen adalah:

a)

Menghitung jumlah kata dalam novel

b)

Menilai opini publik terhadap calon pemimpin dalam Pilkada

c)

Menyimpan tweet ke file txt

d)

Mengubah font dalam komentar

77.

Salah satu peran Big Data dalam sektor kesehatan adalah:

a)

Menghapus data medis lama

b)

Membatasi akses dokter terhadap data

c)

Memprediksi penyebaran penyakit berdasarkan data historis dan real-time

d)

Mengurangi penggunaan teknologi digital

78.

Dataset opini yang digunakan dalam WEKA biasanya dipisahkan menjadi:

a)

Positif dan negatif

b)

Laki-laki dan perempuan

c)

Latihan dan tes

d)

Publik dan pribadi

79.

Salah satu bentuk hasil visualisasi dalam analisis sentimen adalah:

a)

Diagram garis sentimen

b)

Dokumen teks

c)

File JSON mentah

d)

Log pemrograman

80.

Dalam crawling, web crawler juga dikenal sebagai:

a)

Cookie browser

b)

Bot

c)

Data client

d)

Proxy server

81.

Salah satu fitur keamanan dalam analisis Big Data adalah:

a)

Antivirus

b)

Firewall

c)

SIEM (Security Information and Event Management)

d)

Malware scanner

82.

Kelebihan dari metode lexicon-based untuk analisis sentimen adalah:

a)

Tidak memerlukan kamus kata

b)

Cocok untuk teks pendek tanpa polaritas

c)

Akurat jika cakupan kata lengkap

d)

Bergantung pada supervisi manusia

83.

Dalam pembagian tugas T, P, E pada machine learning, huruf "E" merujuk pada:

a)

Elemen data

b)

Ekspresi logika

c)

Experience (pengalaman)

d)

Execution (eksekusi program)

84.

Satu tweet dapat dijadikan:

a)

Satu paragraf

b)

Satu dokumen dalam analisis

c)

Satu visualisasi

d)

Satu sumber suara

85.

Contoh nilai yang bisa diukur dalam sentiment analysis adalah:

a)

Panjang nama pengguna

b)

Frekuensi munculnya kata "bagus"

c)

Nomor telepon pengguna

d)

Alamat IP pengguna

86.

Salah satu alat untuk menyimpan dan memproses data tidak terstruktur dalam Big Data adalah:

a)

MySQL

b)

Oracle

c)

MongoDB

d)

Ms Access

87.

Salah satu tantangan dari Big Data yang berasal dari IoT adalah:

a)

Terlalu sedikit data yang tersedia

b)

Ukuran data yang statis

c)

Volume dan kecepatan data yang sangat tinggi

d)

Data terlalu rapi

88.

Dalam MapReduce, hasil akhir yang diperoleh dari fungsi Reduce:

a)

Disimpan di RAM

b)

Langsung dikirim ke printer

c)

Merupakan output akhir yang siap dianalisis

d)

Disimpan dalam format gambar

89.

Open Data Government memberikan akses publik ke:

a)

Data pribadi pegawai

b)

Informasi rahasia negara

c)

Dataset yang bisa digunakan untuk kepentingan publik dan analisis

d)

File terenkripsi

90.

Contoh hashtag yang dapat digunakan untuk analisis tren adalah:

a)

#pahlawanNasional

b)

@username

c)

DM saya

d)

URL link

91.

Twitter API membutuhkan entitas berikut, kecuali:

a)

Consumer Key

b)

Access Token

c)

Consumer PIN

d)

Consumer Secret

92.

Metode unsupervised learning berbeda dengan supervised karena:

a)

Memerlukan data lebih banyak

b)

Tidak membutuhkan data berlabel

c)

Menghasilkan visualisasi langsung

d)

Menggunakan SQL

93.

Salah satu alasan menggunakan stemming dalam preprocessing adalah:

a)

Untuk menghias teks

b)

Menemukan kata dasar agar analisis lebih akurat

c)

Menyisipkan kata baru

d)

Menerjemahkan teks

94.

Format JSON digunakan dalam crawling Twitter untuk:

a)

Membuat file Excel

b)

Menyimpan data dalam format terstruktur teks

c)

Menyimpan gambar

d)

Menyimpan video

95.

Dalam Twitter, fungsi hashtag berguna untuk:

a)

Mengirim pesan privat

b)

Menandai topik dan memudahkan pencarian

c)

Mengedit profil

d)

Membatasi retweet

96.

Salah satu hal yang perlu dilakukan sebelum menjalankan crawler Twitter adalah:

a)

Membuat website

b)

Mendaftarkan aplikasi Twitter dan memperoleh akses token

c)

Mengganti kata sandi akun

d)

Mengunduh semua tweet

97.

Dalam analisis opini, hasil klasifikasi bisa digunakan untuk:

a)

Memblokir komentar negatif

b)

Membuat keputusan berbasis data publik

c)

Menyembunyikan identitas pengguna

d)

Mengedit status pengguna

98.

Fungsi dari modul Tweepy di Python adalah:

a)

Membuat video

b)

Mengakses dan mengambil data dari Twitter API

c)

Memformat PDF

d)

Menjalankan algoritma clustering

99.

Visualisasi dalam sentiment analysis sering disajikan dalam bentuk:

a)

Audio

b)

Peta interaktif

c)

Pie chart, bar chart, dan line graph

d)

Script Python

100.

Salah satu manfaat Big Data di sektor hiburan adalah:

a)

Menyembunyikan informasi artis

b)

Menganalisis preferensi penonton

c)

Menghapus akun tidak aktif

d)

Menghentikan siaran langsung