Font size
WorksheetsResponsi Big Data and Predictive Lanjut
Total questions: 86
Worksheet time: 47mins
Apa fungsi utama dari SparkContext dalam PySpark?
Membaca file CSV
Membuat koneksi cluster
Menulis data ke tabel
Menambah kolom data
Apa peran dari master dalam konfigurasi cluster Spark?
Mengirim hasil perhitungan ke worker
Mengatur pembagian data dan perhitungan ke worker
Menerima data dari worker
Menyimpan data secara lokal
Bagaimana cara membuat SparkSession di PySpark?
spark = SparkSession.builder.create()
spark = SparkSession.builder.getOrCreate()
spark = SparkContext()
spark = SparkSession.start()
Apakah output dari perintah print(spark.catalog.listTables())?
Daftar kolom di DataFrame
Daftar tabel dalam SparkSession
Daftar semua worker dalam cluster
Informasi konfigurasi SparkSession
Apa yang dilakukan perintah flights10.filter("distance > 1000")?
Menampilkan semua data di tabel flights10
Memfilter data dengan jarak di atas 1000
Menghapus data yang jaraknya kurang dari 1000
Mengelompokkan data berdasarkan jarak
Bagaimana cara melakukan query untuk menampilkan hanya data dari kolom origin, dest, dan distance?
flights.select(['origin', 'dest', 'distance'])
flights.filter('origin', 'dest', 'distance')
flights.groupby(['origin', 'dest', 'distance'])
flights.where(['origin', 'dest', 'distance'])
Apa tujuan dari perintah flights.withColumn('duration_hrs', flights.air_time / 60)?
Menambahkan kolom baru duration_hrs
Menghapus kolom air_time
Mengganti nilai di kolom air_time
Menghapus data dalam kolom duration_hrs
Bagaimana cara menghitung rata-rata air_time dari data yang berasal dari SEA?
flights.filter(flights.origin == 'SEA').groupBy().avg('air_time')
flights.select('air_time').avg().filter(flights.origin == 'SEA')
flights.groupBy('origin').filter('SEA').avg('air_time')
flights.avg('air_time').where(flights.origin == 'SEA')
Perintah apa yang digunakan untuk melakukan inner join antara DataFrame employees dan departments berdasarkan dept_id?
employees.join(departments, 'dept_id', 'inner')
employees.union(departments, 'dept_id', 'inner')
employees.filter(departments, 'dept_id', 'inner')
employees.group(departments, 'dept_id', 'inner')
Perintah apa yang digunakan untuk melakukan left join di PySpark?
join(df1, df2, 'left')
join(df1, df2, 'left_outer')
union(df1, df2, 'left')
merge(df1, df2, 'left_outer')
Bagaimana cara menghitung rata-rata kolom distance untuk tiap manufacturer?
flights.groupBy('manufacturer').avg('distance')
flights.avg('distance').groupBy('manufacturer')
flights.agg('manufacturer').avg('distance')
flights.filter('manufacturer').avg('distance')
Apa hasil dari perintah flights.describe('air_time', 'distance').show()?
Menghapus nilai kosong pada kolom air_time dan distance
Menampilkan statistik deskriptif air_time dan distance
Mengelompokkan data berdasarkan air_time dan distance
Menghitung total air_time dan distance
Apa yang dihasilkan oleh perintah flights10.show(5)?
Menampilkan 5 baris pertama data dari flights10
Menampilkan kolom-kolom terpilih dari flights10
Menghapus 5 baris pertama di flights10
Mengurutkan data flights10
Apa fungsi dari filter("distance > 1000") dalam Spark DataFrame?
Memilih kolom distance di atas 1000
Menampilkan data yang distance-nya lebih dari 1000
Mengurutkan data berdasarkan distance
Mengelompokkan data berdasarkan distance
Apa fungsi dari filter("distance > 1000") dalam Spark DataFrame?
Memilih kolom distance di atas 1000
Menampilkan data yang distance-nya lebih dari 1000
Mengurutkan data berdasarkan distance
Mengelompokkan data berdasarkan distance
Dalam PySpark, apa fungsi dari flights.selectExpr("origin", "dest", "distance/(air_time/60) as avg_speed")?
Menambah kolom avg_speed berdasarkan ekspresi yang diberikan
Menghapus kolom avg_speed
Mengurutkan data berdasarkan avg_speed
Mengganti nilai kolom distance
Bagaimana cara menampilkan semua tabel yang terdaftar dalam SparkSession saat ini?
spark.catalog.listTables()
spark.showTables()
spark.catalog.show()
spark.listTables()
Apa fungsi dari spark.table('flights')?
Membuat tabel baru bernama flights
Menghapus tabel flights
Mengembalikan DataFrame dari tabel flights
Menampilkan tabel flights dalam Spark UI
Apa kegunaan perintah flights.withColumn('duration_hrs', flights.air_time / 60)?
Mengkonversi kolom air_time ke jam dan menambah kolom duration_hrs
Menghapus kolom air_time
Mengubah semua data di air_time menjadi menit
Menyimpan data ke tabel baru
Bagaimana cara menghitung jumlah total durasi (jam) untuk seluruh penerbangan?
flights.groupBy().sum('duration_hrs')
flights.sum('duration_hrs')
flights.withColumn('duration_hrs', flights.air_time/60).groupBy().sum('duration_hrs')
flights.sum(flights.duration_hrs)
Apa hasil dari perintah flights.describe('distance').show()?
Menghapus kolom distance
Menghitung statistik deskriptif untuk distance
Mengganti nilai distance dengan rata-rata
Mengelompokkan data berdasarkan distance
Perintah apa yang digunakan untuk melakukan join antar DataFrame flights dan airports berdasarkan dest?
flights.join(airports, "dest", "left")
flights.concat(airports, "dest", "left")
flights.combine(airports, "dest", "left")
flights.append(airports, "dest", "left")
Apa tujuan penggunaan left_outer dalam join DataFrame?
Menggabungkan data dari kiri saja
Memastikan semua data dari DataFrame sebelah kiri muncul meskipun tidak ada pasangan di kanan
Menghapus data yang tidak berpasangan di kanan
Mengurutkan data berdasarkan kolom di kanan
Perintah apa yang digunakan untuk melakukan join penuh atau lengkap (full outer join)?
join(df1, df2, "full")
join(df1, df2, "complete")
join(df1, df2, "full_outer")
join(df1, df2, "outer_full")
Bagaimana cara menampilkan jumlah total penerbangan dari setiap origin?
flights.groupBy('origin').count()
flights.groupby('origin').sum()
flights.select('origin').sum()
flights.select('origin').group()
Fungsi apa yang digunakan untuk menghitung rata-rata pada kolom tertentu di PySpark?
count()
average()
mean()
avg()
Bagaimana cara menghitung rata-rata dep_delay berdasarkan month dan dest?
flights.groupBy('month', 'dest').avg('dep_delay')
flights.groupby(['month', 'dest']).average('dep_delay')
flights.groupBy('month', 'dest').mean('dep_delay')
flights.groupby('month', 'dest').sum('dep_delay')
Bagaimana cara mengurutkan data flights berdasarkan distance dari nilai terbesar ke terkecil?
flights.sort('distance', ascending=False)
flights.orderBy('distance', ascending=False)
flights.orderBy('distance', False)
flights.sort('distance', 'desc')
Apa hasil dari perintah flights.orderBy('air_time').show()?
Menghapus kolom air_time
Mengelompokkan data berdasarkan air_time
Mengurutkan data berdasarkan air_time dalam urutan naik
Menyimpan hasil ke dalam tabel baru
Bagaimana cara mengurutkan DataFrame berdasarkan beberapa kolom sekaligus di PySpark?
df.orderBy(['col1', 'col2'])
df.sort('col1', 'col2')
df.orderBy('col1', 'col2')
df.sort(['col1', 'col2'])
Apa fungsi dari withColumnRenamed('col1', 'col2') di PySpark?
Mengubah nama kolom col1 menjadi col2
Menghapus kolom col1
Menambahkan kolom baru col2
Mengganti nilai di kolom col1
Bagaimana cara mengubah tipe data kolom distance menjadi float?
flights.withColumn('distance', flights.distance.cast('float'))
flights.cast('distance', 'float')
flights.convert('distance', 'float')
flights.changeType('distance', 'float')
Perintah apa yang digunakan untuk menambah kolom baru dengan data tetap di PySpark?
withColumn('new_col', lit(10))
addColumn('new_col', 10)
createColumn('new_col', 10)
appendColumn('new_col', 10)
Apa fungsi F.avg dalam PySpark?
Mengambil rata-rata dari kolom yang dipilih
Menghitung jumlah total dari kolom
Mengubah tipe data kolom menjadi integer
Menghapus data duplikat
Fungsi sum dalam PySpark digunakan untuk:
Menggabungkan dua DataFrame
Menambah kolom baru
Menghitung total nilai kolom
Mengurutkan data
Apa yang dihasilkan oleh flights.groupBy("origin").sum("distance")?
Total distance untuk setiap origin
Rata-rata distance untuk setiap origin
Semua kolom dengan nilai distance terurut
Data distance yang difilter
Bagaimana cara memfilter data untuk menunjukkan penerbangan yang berasal dari SEA dengan distance lebih dari 1000?
flights.filter("origin == 'SEA' & distance > 1000")
flights.select('origin', 'distance').where("origin == 'SEA'").where("distance > 1000")
flights.filter((F.col("origin") == 'SEA') & (F.col("distance") > 1000))
flights.query('origin = SEA and distance > 1000')
Fungsi filter pada DataFrame digunakan untuk:
Menghapus baris kosong
Memilih data berdasarkan kondisi tertentu
Menambah kolom baru dengan kondisi
Mengurutkan data berdasarkan kolom tertentu
Bagaimana cara menggabungkan filter untuk menampilkan penerbangan dari SEA dan PDX?
flights.filter((F.col('origin') == 'SEA') | (F.col('origin') == 'PDX'))
flights.where(F.col('origin').isin('SEA', 'PDX'))
flights.filter("origin in ('SEA', 'PDX')")
Semua jawaban benar
Apa yang dihasilkan dari flights.groupBy('origin').agg(F.max('air_time').alias('max_air_time'))?
Rata-rata waktu terbang untuk setiap origin
Jumlah total penerbangan untuk setiap origin
Waktu terbang maksimum untuk setiap origin
Waktu terbang minimum untuk setiap origin
Bagaimana cara menghitung jumlah penerbangan unik untuk setiap dest?
flights.groupBy('dest').count()
flights.groupBy('dest').agg(F.countDistinct('flight').alias('unique_flights'))
flights.groupby('dest').sum('flight')
flights.groupby('dest').unique('flight')
Perintah apa yang digunakan untuk menghitung total distance per bulan (month) dan tujuan (dest)?
flights.groupby('month', 'dest').agg(F.sum('distance').alias('total_distance'))
flights.sum('distance').groupBy('month', 'dest')
flights.select('month', 'dest').agg(F.sum('distance'))
flights.groupby('month', 'dest').avg('distance')
Fungsi agg digunakan untuk:
Menggabungkan beberapa DataFrame
Mengelompokkan data berdasarkan beberapa kolom
Melakukan agregasi dengan beberapa fungsi sekaligus
Menyaring data dari DataFrame
Apa tujuan dari perintah flights.write.saveAsTable("flights")?
Menyimpan DataFrame flights sebagai tabel bernama flights
Membaca data dari tabel flights
Menghapus data dalam tabel flights
Menampilkan DataFrame flights sebagai tabel
Bagaimana cara menampilkan semua data dari tabel flights menggunakan SQL dalam Spark?
spark.sql("SELECT * FROM flights")
spark.query("SELECT * FROM flights")
flights.show()
spark.catalog.listTables()
Apa hasil dari flights.write.csv("output_path")?
Menyimpan DataFrame flights dalam format CSV di output_path
Menampilkan DataFrame flights dalam format CSV
Menyimpan DataFrame flights dalam format JSON di output_path
Membaca file CSV dari output_path
Fungsi isNull digunakan untuk:
Menghapus data yang kosong
Memeriksa nilai null di suatu kolom
Mengganti nilai null dengan data tertentu
Memfilter kolom yang tidak null
Apa fungsi distinct() dalam PySpark?
Menampilkan jumlah baris unik
Mengurutkan data berdasarkan kolom tertentu
Menghapus data yang duplikat
Menggabungkan DataFrame duplikat
Bagaimana cara menampilkan data pada DataFrame tanpa data duplikat di kolom origin?
flights.select('origin').distinct()
flights.filter('origin').distinct()
flights.unique('origin')
flights.drop_duplicates('origin')
Bagaimana cara menampilkan data flights yang memiliki distance lebih dari 1000 dan berasal dari SEA atau PDX?
flights.filter((F.col('origin').isin('SEA', 'PDX')) & (F.col('distance') > 1000))
flights.where('distance > 1000').filter('origin in ('SEA', 'PDX')')
flights.select('origin', 'distance').filter('distance > 1000 and origin in ('SEA', 'PDX')')
flights.query('origin = SEA OR PDX and distance > 1000')
Perintah apa yang digunakan untuk menggabungkan DataFrame employees dengan departments menggunakan dept_id sebagai kunci?
employees.join(departments, 'dept_id')
employees.select('dept_id').join(departments, 'dept_id')
employees.merge(departments, 'dept_id')
employees.filter('dept_id').join(departments, 'dept_id')
Fungsi min dalam PySpark digunakan untuk:
Menemukan nilai minimum dari suatu kolom
Menghitung rata-rata dari suatu kolom
Menggabungkan dua DataFrame
Menampilkan data berdasarkan kolom
Bagaimana cara menghitung nilai rata-rata arr_delay per bulan (month)?
flights.groupBy('month').avg('arr_delay')
flights.groupby('month').sum('arr_delay')
flights.groupBy('month').mean('arr_delay')
flights.groupby('month').total('arr_delay')
Apa hasil dari flights.groupBy('dest').max('distance')?
Jarak maksimum ke setiap tujuan (dest)
Jarak minimum ke setiap tujuan (dest)
Total jarak untuk setiap tujuan (dest)
Apa hasil dari flights.groupBy('dest').max('distance')?
Jarak maksimum ke setiap tujuan (dest)
Jarak minimum ke setiap tujuan (dest)
Total jarak untuk setiap tujuan (dest)
Waktu terbang maksimum untuk setiap tujuan (dest)
Bagaimana cara membaca file CSV airports.csv sebagai DataFrame di PySpark?
spark.read.csv('airports.csv', header=True, inferSchema=True)
spark.readFile('airports.csv')
spark.csv('airports.csv')
spark.load('airports.csv')
Bagaimana cara mengatur kolom pertama file CSV sebagai header saat membaca file di PySpark?
header=True
header=False
schema=True
schema=False
Fungsi inferSchema=True digunakan untuk:
Memastikan tipe data otomatis ditentukan oleh Spark
Mengabaikan header saat membaca file
Menyimpan data dengan tipe data tertentu
Mengganti kolom data
Apa tujuan utama dari SparkSession dalam PySpark?
Membuat sesi untuk menjalankan tugas Spark
Menambah kolom dalam DataFrame
Membuat filter pada DataFrame
Menampilkan hasil Spark UI
Bagaimana cara memulai SparkSession baru dengan nama aplikasi?
SparkSession.builder.appName("AppName").getOrCreate()
SparkSession.start("AppName")
SparkSession.new("AppName")
sparkSession.create("AppName")
Apakah fungsi dari builder dalam SparkSession.builder?
Menghapus SparkSession lama
Membuat sesi Spark baru
Mengatur konfigurasi SparkSession
Menghentikan SparkSession
Apa peran Spark UI dalam eksekusi PySpark?
Menyimpan hasil dari operasi Spark
Menyediakan antarmuka pengguna untuk memonitor eksekusi
Menyimpan data dari SparkSession
Menghentikan eksekusi Spark
Apa singkatan dari RDD dalam PySpark?
Resilient Distributed Data
Redundant Distributed Data
Resilient Distributed Dataset
Recomputed Distributed Dataset
Apa karakteristik utama dari RDD dalam Spark?
Immutable dan terdistribusi
Mutable dan lokal
Mutable dan terdistribusi
Immutable dan lokal
Bagaimana cara membuat RDD dari sebuah list di PySpark?
spark.createRDD([1, 2, 3])
spark.sparkContext.parallelize([1, 2, 3])
spark.sparkContext.createRDD([1, 2, 3])
spark.RDD([1, 2, 3])
Manakah pernyataan yang benar mengenai transformasi pada RDD?
Transformasi pada RDD langsung mengembalikan hasil
Transformasi pada RDD bersifat lazy (ditunda hingga aksi dilakukan)
Transformasi hanya bisa dilakukan satu kali pada RDD
Transformasi pada RDD bersifat eager (langsung dieksekusi)
Manakah yang termasuk contoh transformasi pada RDD?
collect()
map()
count()
saveAsTextFile()
Manakah yang termasuk contoh aksi (action) pada RDD?
map()
filter()
count()
distinct()
Apa fungsi dari map() pada RDD?
Memfilter data dalam RDD
Menerapkan fungsi ke setiap elemen dalam RDD
Mengurutkan data dalam RDD
Menghapus duplikasi dalam RDD
Apa fungsi dari filter() pada RDD?
Mengelompokkan data dalam RDD
Menerapkan fungsi ke setiap elemen dalam RDD
Memilih elemen yang memenuhi kondisi tertentu
Menggabungkan dua RDD
Bagaimana cara menghitung jumlah elemen dalam sebuah RDD?
rdd.count()
rdd.size()
rdd.len()
rdd.collect()
Apa hasil dari rdd.collect() pada RDD?
Menyimpan data RDD ke file
Mengembalikan semua elemen RDD ke driver dalam bentuk list
Apa hasil dari rdd.collect() pada RDD?
Menyimpan data RDD ke file
Mengembalikan semua elemen RDD ke driver dalam bentuk list
Menghapus duplikasi dalam RDD
Menyimpan hasil RDD di cluster
Apa itu Pair RDD dalam PySpark?
RDD yang memiliki data berbentuk pasangan (key-value)
RDD yang memiliki dua elemen
RDD yang berisi data unik
RDD yang berbentuk matriks
Bagaimana cara membuat Pair RDD dari list [(1, 'a'), (2, 'b'), (3, 'c')]?
spark.parallelize([(1, 'a'), (2, 'b'), (3, 'c')])
spark.sparkContext.makeRDD([(1, 'a'), (2, 'b'), (3, 'c')])
spark.sparkContext.parallelize([(1, 'a'), (2, 'b'), (3, 'c')])
Semua jawaban benar
Fungsi reduceByKey() pada Pair RDD digunakan untuk:
Mengurutkan nilai berdasarkan kunci
Mengelompokkan nilai dengan kunci yang sama dan menerapkan fungsi reduksi
Menggabungkan dua Pair RDD
Menghapus duplikasi pada Pair RDD
Apa fungsi dari groupByKey() pada Pair RDD?
Menghapus nilai dengan kunci yang sama
Mengelompokkan nilai berdasarkan kunci yang sama tanpa menggabungkan nilai
Mengurutkan Pair RDD
Menerapkan fungsi ke setiap nilai
Manakah operasi yang dapat digunakan untuk menghitung jumlah nilai berdasarkan kunci di Pair RDD?
reduceByKey(lambda x, y: x + y)
countByKey()
groupByKey().mapValues(len)
Semua jawaban benar
Apa hasil dari pairRDD.reduceByKey(lambda x, y: x + y) jika pairRDD memiliki data [(1, 2), (1, 3), (2, 4)]?
[(1, 5), (2, 4)]
[(1, 2), (1, 3), (2, 4)]
[(1, 5)]
[(2, 4)]
Apa hasil dari pairRDD.mapValues(lambda x: x + 1) jika pairRDD memiliki data [(1, 2), (2, 3)]?
[(1, 3), (2, 4)]
[(1, 2), (2, 3)]
[(1, 1), (2, 2)]
[(1, 4), (2, 5)]
Apa fungsi dari sortByKey() pada Pair RDD?
Mengurutkan RDD berdasarkan nilai
Mengurutkan RDD berdasarkan kunci
Menghapus duplikasi berdasarkan kunci
Menggabungkan RDD berdasarkan kunci
Bagaimana cara menghitung rata-rata nilai untuk setiap kunci di Pair RDD?
pairRDD.groupByKey().mapValues(lambda x: sum(x) / len(x))
pairRDD.mapValues(lambda x: sum(x) / len(x))
pairRDD.reduceByKey(lambda x, y: (x + y) / 2)
pairRDD.sortByKey().mapValues(lambda x: x / 2)
Manakah pernyataan yang benar mengenai combineByKey()?
Digunakan untuk mengelompokkan nilai tanpa mengubah tipe data
Memungkinkan kombinasi nilai untuk setiap kunci dengan fungsi kustom
Digunakan untuk menghitung total jumlah data dalam Pair RDD
Hanya digunakan untuk Pair RDD dengan data numerik
Fungsi keys() pada Pair RDD digunakan untuk:
Mengembalikan daftar kunci dari Pair RDD
Menghapus duplikasi kunci dalam Pair RDD
Mengembalikan nilai dari Pair RDD
Mengurutkan data dalam Pair RDD
Apa hasil dari pairRDD.keys().collect() jika pairRDD memiliki data [(1, 'a'), (2, 'b'), (3, 'c')]?
[1, 2, 3]
['a', 'b', 'c']
[(1, 'a'), (2, 'b'), (3, 'c')]
[('a'), ('b'), ('c')]
Fungsi join() pada Pair RDD digunakan untuk:
Menggabungkan dua Pair RDD berdasarkan kunci yang sama
Menghapus kunci yang tidak memiliki pasangan
Mengurutkan Pair RDD berdasarkan nilai
Mengelompokkan Pair RDD berdasarkan kunci
