Font size
WorksheetsQuiz tentang Big Data
Total questions: 100
Worksheet time: 50mins
Apa yang dimaksud dengan Big Data ?
Data yang dapat dianalisis menggunakan Excel
Data yang berstruktur dan mudah dianalisis
Data yang melebihi kapasitas pemrosesan sistem database konvensional
Data kecil dengan struktur tetap
Salah satu karakteristik Big Data adalah "Velocity". Apa maksud dari karakteristik ini?
Banyaknya tipe data
Kecepatan pertumbuhan dan aliran data
Keakuratan data
Volume data yang kecil
Berikut ini yang merupakan tools untuk pengolahan data berbasis MapReduce adalah:
Excel
Oracle
Hadoop
SPSS
Apa tujuan utama dari proses Data Cleansing dalam Big Data Analytics?
Menggabungkan data dari berbagai sumber
Menghapus data yang valid
Membersihkan data dari kesalahan dan ketidaksesuaian
Mengkompresi data
Teknologi NoSQL cocok digunakan dalam Big Data karena:
Memiliki struktur relasional
Kurang efisien dalam penyimpanan cloud
Lebih cepat dan scalable dibanding RDBMS
Tidak dapat memproses data real-time
Contoh penggunaan Big Data pada sektor pemerintahan adalah:
Menyimpan dokumen rahasia
Mengelola anggaran tahunan
Membuka portal data terbuka seperti data.jakarta.go.id
Melarang akses ke data publik
Dalam analisis sentimen, metode berbasis leksikon bergantung pada:
Jaringan neural
Sumber data sosial media
Kamus kata yang sudah memiliki polaritas
Pelatihan classifier
Salah satu teknik pre-processing dalam Text Mining adalah "Stemming". Tujuannya adalah:
Menambahkan imbuhan pada kata
Menghapus kata-kata penting
Mengembalikan kata ke bentuk dasar
Mengubah kalimat menjadi paragraf
Hadoop Distributed File System (HDFS) digunakan untuk:
Menyimpan data dalam satu komputer saja
Menyimpan data terpusat di cloud
Membagi penyimpanan data ke banyak komputer
Menghapus data otomatis
Dalam crawling data Twitter, istilah "query" merujuk pada:
Nama pengguna
Kata kunci untuk pencarian
Tanggal pembuatan akun
Panjang tweet
Proses tokenisasi dilakukan untuk:
Menyatukan kata-kata
Menyusun ulang paragraf
Memisahkan kata dalam teks
Menambahkan tanda baca
Contoh data tidak terstruktur yang termasuk dalam Big Data adalah:
CSV
Tabel Excel
Gambar dan video
Data relasional
Salah satu manfaat Big Data adalah:
Menambah pekerjaan manusia
Mengurangi penggunaan teknologi
Memberikan wawasan bisnis dari data
Menghilangkan kebutuhan penyimpanan
Dalam teknologi Big Data, Apache Spark dikenal sebagai:
Database relasional
Platform analisis berbasis streaming dan in-memory
Sistem keamanan
Alat pengolah spreadsheet
Twitter API memungkinkan kita untuk:
Membuat akun palsu
Mengakses data pengguna secara pribadi
Mengambil data tweet secara programatik
Menghapus tweet pengguna
Dimensi "Veracity" dalam Big Data merujuk pada:
Volume data
Kecepatan data
Keakuratan dan kebenaran data
Bentuk data
Aplikasi "Intelligent Apps" dalam Big Data digunakan untuk:
Menghapus log sistem
Mengatur update OS
Memberikan layanan personalisasi
Menonaktifkan akun pengguna
Studi kasus: Kota besar di AS menggunakan MongoDB untuk menurunkan angka kriminalitas. Ini adalah contoh pemanfaatan:
Database relasional
RDBMS konvensional
Big Data untuk pelayanan publik
Spreadsheet
Machine Learning dalam Big Data digunakan untuk:
Membuat file ZIP
Menulis laporan
Memprediksi pola dari data besar
Membuat aku
Machine Learning dalam Big Data digunakan untuk:
Membuat file ZIP
Menulis laporan
Memprediksi pola dari data besar
Membuat akun media sosial
Proses parsing dalam preprocessing bertujuan untuk:
Menggabungkan beberapa file
Mengenali struktur dokumen
Menambahkan tanda baca
Mengganti kata menjadi sinonim
Dalam analisis prediktif, data digunakan untuk:
Menyimpan laporan
Memprediksi kejadian masa depan
Membuat akun palsu
Menghapus opini negatif
Salah satu tantangan terbesar dalam Big Data adalah:
Harga perangkat lunak
Kurangnya tenaga kerja
Cara memvisualisasi dan menambang data
Kebutuhan listrik
Salah satu manfaat preprocessing teks adalah:
Meningkatkan ukuran data
Menambah noise
Mengurangi kompleksitas dokumen
Menambah kata acak
Mengapa text preprocessing penting dalam analisis sentimen?
Untuk memperbesar ukuran dokumen
Agar kata-kata tidak terbaca
Untuk menyiapkan data agar bisa dianalisis dengan lebih baik
Agar hasilnya acak
Dalam crawling data Twitter, salah satu batasan Search API adalah:
Tidak bisa digunakan
Hanya berlaku untuk data maksimal 7 hari ke belakang
Hanya bisa diakses oleh Twitter Blue
Tidak dapat mengakses hashtag
Teknik tokenisasi dalam preprocessing menghasilkan:
Paragraf
Kalimat utuh
Potongan-potongan kata (tokens)
Nilai numerik
Teknologi in-memory memiliki keunggulan utama dalam hal:
Biaya tinggi
Kecepatan akses data
Ketergantungan pada harddisk
Penyimpanan permanen
Contoh data dari social media yang sering dianalisis dalam Big Data adalah:
Data geologi
Data tweet dan komentar
Data keuangan perusahaan
Data sensor satelit
Hadoop menggunakan sistem file:
FAT32
NTFS
Hadoop Distributed File System (HDFS)
EXT4
Dalam MapReduce, fungsi Reduce bertugas untuk:
Menghapus data
Membagi data
Mengelompokkan hasil dari proses Map
Mencetak hasil ke layar
Apa keuntungan penggunaan open source software dalam teknologi Big Data?
Lebih mahal
Memiliki lisensi tertutup
Biaya implementasi lebih rendah
Tidak bisa dikembangkan
Teknologi Big Data banyak digunakan dalam industri berikut, kecuali:
Perbankan
Transportasi
Media dan hiburan
Pengelolaan rumah tangga pribadi
Salah satu manfaat penggunaan WEKA dalam klasifikasi opini adalah:
Memblokir tweet
Menghapus data negatif
Menguji model klasifikasi dengan data testing
Menonaktifkan akun media sosial
Berikut ini yang bukan termasuk karakteristik 5V Big Data adalah:
Velocity
Volume
Vision
Veracity
Dalam analisis data besar, teknik clustering bertujuan untuk:
Menyusun data secara acak
Menghapus data penting
Mengelompokkan data berdasarkan kesamaan
Menggabungkan semua data jadi satu
Dalam preprocessing, proses stopword removal bertujuan untuk:
Menambahkan kata sambung
Menghapus kata umum yang tidak penting
Mengacak kata
Menambahkan huruf kapital
Teknik supervised learning memerlukan:
Data acak tanpa label
Label dan hasil benar untuk pelatihan
Intervensi manual setiap saat
Sistem keamanan tambahan
Studi kasus: Perusahaan e-commerce menggunakan analisis sentimen untuk membaca reaksi pelanggan terhadap produk baru. Tujuan utama dari ini adalah:
Menurunkan reputasi kompetitor
Memblokir opini negatif
Mengambil wawasan dari opini pelanggan
Menambah pengikut di media sosial
Dalam WEKA, proses training data dilakukan sebelum:
Instalasi aplikasi
Preprocessing
Klasifikasi data testing
Menentukan atribut
Dalam WEKA, proses training data dilakukan sebelum:
Instalasi aplikasi
Preprocessing
Klasifikasi data testing
Menentukan atribut
Salah satu cara memperoleh data real-time dari Twitter adalah:
Scraping menggunakan browser
Search API untuk data lebih dari sebulan
Streaming API
Meminta data ke pengguna
Dalam algoritma Naive Bayes, dasar yang digunakan adalah:
Regresi linier
Statistik probabilitas
Jaringan syaraf
Kombinasi clustering
Fungsi dari visualisasi data dalam Big Data adalah:
Mengurangi jumlah data
Menghapus data negatif
Mempermudah pemahaman pola dari data
Menambah noise data
Dalam Text Mining, istilah "term index" merujuk pada:
Nomor halaman
Kata yang tidak berguna
Kata kunci penting yang mewakili isi dokumen
Angka statistik
Aplikasi analisis prediktif dapat membantu bisnis dengan:
Menyembunyikan data
Membuat laporan pajak
Memprediksi perilaku konsumen
Mengatur shift karyawan
Fitur retweet pada Twitter berguna dalam analisis karena:
Menambah panjang karakter
Menunjukkan popularitas dan penyebaran informasi
Menghapus tweet asli
Tidak menyimpan metadata
Dataset yang digunakan untuk machine learning harus dibagi menjadi:
Training dan testing
HTML dan CSS
SQL dan NoSQL
Angka dan teks
Salah satu risiko dari veracity data yang rendah adalah:
Meningkatnya biaya perangkat
Akurasi hasil analisis menurun
Kecepatan pemrosesan meningkat
Visualisasi lebih indah
Hadoop memungkinkan pemrosesan data skala besar dengan:
Pemrosesan paralel di satu server
Penyimpanan di hard disk lokal
Pendekatan terdistribusi dan paralel
Kompresi zip data
Analisis sentimen dapat digunakan oleh pemerintah untuk:
Menyensor informasi publik
Menilai opini masyarakat terhadap kebijakan tertentu
Mempromosikan produk swasta
Menghapus akun media sosial
Salah satu sumber utama data Big Data berasal dari:
Kertas kerja manual
CD-ROM
Media sosial dan perangkat IoT
Arsip perpustakaan
Dalam preprocessing, proses case folding bertujuan untuk:
Mengganti huruf dengan angka
Menghapus huruf kapital
Mengubah semua huruf menjadi huruf kecil
Menambahkan tanda baca
Teknologi NoSQL digunakan dalam Big Data karena mampu:
Menyimpan data kecil secara efisien
Menyimpan dan menangani data yang tidak terstruktur
Hanya mendukung bahasa SQL
Menghapus data secara otomatis
Perbedaan utama antara supervised dan unsupervised learning adalah:
Jumlah data
Ketersediaan label atau hasil yang diketahui
Jenis bahasa pemrograman
Waktu pelatihan
Hadoop cocok digunakan untuk analisis retrospektif karena menggunakan:
Neural network
RDBMS
MapReduce
Decision tree
Dalam WEKA, data dalam format .arff harus mengandung:
Nomor halaman
Atribut dan data instance
Metadata gambar
Tanggal dan waktu
Salah satu alasan mengapa Big Data disebut sebagai "data is the new gold" adalah:
Data sangat mahal
Data memiliki nilai ekonomi besar bila dimanfaatkan
Data harus digali dari tambang
Data tidak bisa rusak
Dalam crawling data Twitter, istilah "seeds" merujuk pada:
Kata-kata acak
Sumber awal URL yang dikunjungi
Nama pengguna yang disimpan
Retweet yang dihapus
Salah satu indikator keberhasilan klasifikasi dalam WEKA adalah:
Jumlah file .doc
Kecepatan pemrosesan
Akurasi model terhadap data testing
Banyaknya kolom kosong
Dalam visualisasi data, grafik digunakan untuk:
Menyulitkan pemahaman
Menyederhanakan penyajian data kompleks
Meningkatkan
Dalam visualisasi data, grafik digunakan untuk:
Menyulitkan pemahaman
Menyederhanakan penyajian data kompleks
Meningkatkan ukuran file
Menyembunyikan kesalahan
Twitter dianggap penting dalam analisis sosial karena:
Hanya bisa digunakan di Indonesia
Data tidak dapat dibagikan
Interaksi yang cepat dan bersifat publik
Tidak memiliki trending topic
Dalam proses MapReduce, output dari fungsi Map disebut:
Dataset
Vector
Key/Value intermediate
Node
Salah satu manfaat dari text mining adalah:
Mengubah teks menjadi grafik
Menghapus semua kata dalam dokumen
Menemukan pola dan informasi tersembunyi dalam teks
Mengubah teks menjadi data numerik
Data streaming dalam Big Data mengacu pada:
Penyimpanan jangka panjang
Aliran data secara real-time
Data yang dicetak ke kertas
Arsip data yang diam
Proses penggabungan hasil fungsi Map berdasarkan Key dalam MapReduce dilakukan oleh:
Visualisasi
Reduce
Tokenizer
Parser
Aplikasi seperti Facebook, Instagram, dan Twitter menyediakan:
Data personal yang terproteksi
Sumber data untuk analisis opini publik
Data keuangan
Data formal legal
Salah satu jenis analisis dalam Web Mining yang fokus pada struktur hyperlink adalah:
Web usage mining
Web structure mining
Web content mining
Web data crawling
Salah satu teknik klasifikasi dalam machine learning untuk data besar adalah:
SQL
Naive Bayes
HTML
API
Contoh penerapan Big Data di sektor transportasi adalah:
Mengumpulkan tiket manual
Mengontrol lalu lintas menggunakan data sensor real-time
Mengurangi jumlah kendaraan
Menghapus data GPS
Dalam preprocessing, menghapus duplikasi data dilakukan untuk:
Menambah beban analisis
Menurunkan akurasi
Mengurangi redundansi dan meningkatkan efisiensi
Mengubah format file
Text mining banyak digunakan dalam:
Analisis visual warna
Sentiment analysis
Pengolahan gambar
Pemrosesan sinyal
Keuntungan menggunakan Python untuk crawling data Twitter adalah:
Tidak bisa digunakan di sistem operasi Linux
Memiliki banyak library seperti Tweepy
Hanya berjalan di browser
Tidak mendukung data teks
Salah satu hasil penting dari klasifikasi opini adalah:
Nilai estetika dokumen
Klasifikasi positif, negatif, atau netral
Warna latar halaman
Jumlah huruf kapital
Contoh nyata analisis sentimen adalah:
Menghitung jumlah kata dalam novel
Menilai opini publik terhadap calon pemimpin dalam Pilkada
Menyimpan tweet ke file txt
Mengubah font dalam komentar
Salah satu peran Big Data dalam sektor kesehatan adalah:
Menghapus data medis lama
Membatasi akses dokter terhadap data
Memprediksi penyebaran penyakit berdasarkan data historis dan real-time
Mengurangi penggunaan teknologi digital
Dataset opini yang digunakan dalam WEKA biasanya dipisahkan menjadi:
Positif dan negatif
Laki-laki dan perempuan
Latihan dan tes
Publik dan pribadi
Salah satu bentuk hasil visualisasi dalam analisis sentimen adalah:
Diagram garis sentimen
Dokumen teks
File JSON mentah
Log pemrograman
Dalam crawling, web crawler juga dikenal sebagai:
Cookie browser
Bot
Data client
Proxy server
Salah satu fitur keamanan dalam analisis Big Data adalah:
Antivirus
Firewall
SIEM (Security Information and Event Management)
Malware scanner
Kelebihan dari metode lexicon-based untuk analisis sentimen adalah:
Tidak memerlukan kamus kata
Cocok untuk teks pendek tanpa polaritas
Akurat jika cakupan kata lengkap
Bergantung pada supervisi manusia
Dalam pembagian tugas T, P, E pada machine learning, huruf "E" merujuk pada:
Elemen data
Ekspresi logika
Experience (pengalaman)
Execution (eksekusi program)
Satu tweet dapat dijadikan:
Satu paragraf
Satu dokumen dalam analisis
Satu visualisasi
Satu sumber suara
Contoh nilai yang bisa diukur dalam sentiment analysis adalah:
Panjang nama pengguna
Frekuensi munculnya kata "bagus"
Nomor telepon pengguna
Alamat IP pengguna
Salah satu alat untuk menyimpan dan memproses data tidak terstruktur dalam Big Data adalah:
MySQL
Oracle
MongoDB
Ms Access
Salah satu tantangan dari Big Data yang berasal dari IoT adalah:
Terlalu sedikit data yang tersedia
Ukuran data yang statis
Volume dan kecepatan data yang sangat tinggi
Data terlalu rapi
Dalam MapReduce, hasil akhir yang diperoleh dari fungsi Reduce:
Disimpan di RAM
Langsung dikirim ke printer
Merupakan output akhir yang siap dianalisis
Disimpan dalam format gambar
Open Data Government memberikan akses publik ke:
Data pribadi pegawai
Informasi rahasia negara
Dataset yang bisa digunakan untuk kepentingan publik dan analisis
File terenkripsi
Contoh hashtag yang dapat digunakan untuk analisis tren adalah:
#pahlawanNasional
@username
DM saya
URL link
Twitter API membutuhkan entitas berikut, kecuali:
Consumer Key
Access Token
Consumer PIN
Consumer Secret
Metode unsupervised learning berbeda dengan supervised karena:
Memerlukan data lebih banyak
Tidak membutuhkan data berlabel
Menghasilkan visualisasi langsung
Menggunakan SQL
Salah satu alasan menggunakan stemming dalam preprocessing adalah:
Untuk menghias teks
Menemukan kata dasar agar analisis lebih akurat
Menyisipkan kata baru
Menerjemahkan teks
Format JSON digunakan dalam crawling Twitter untuk:
Membuat file Excel
Menyimpan data dalam format terstruktur teks
Menyimpan gambar
Menyimpan video
Dalam Twitter, fungsi hashtag berguna untuk:
Mengirim pesan privat
Menandai topik dan memudahkan pencarian
Mengedit profil
Membatasi retweet
Salah satu hal yang perlu dilakukan sebelum menjalankan crawler Twitter adalah:
Membuat website
Mendaftarkan aplikasi Twitter dan memperoleh akses token
Mengganti kata sandi akun
Mengunduh semua tweet
Dalam analisis opini, hasil klasifikasi bisa digunakan untuk:
Memblokir komentar negatif
Membuat keputusan berbasis data publik
Menyembunyikan identitas pengguna
Mengedit status pengguna
Fungsi dari modul Tweepy di Python adalah:
Membuat video
Mengakses dan mengambil data dari Twitter API
Memformat PDF
Menjalankan algoritma clustering
Visualisasi dalam sentiment analysis sering disajikan dalam bentuk:
Audio
Peta interaktif
Pie chart, bar chart, dan line graph
Script Python
Salah satu manfaat Big Data di sektor hiburan adalah:
Menyembunyikan informasi artis
Menganalisis preferensi penonton
Menghapus akun tidak aktif
Menghentikan siaran langsung
