Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Pyspark MLib

Total questions: 20

Worksheet time: 40mins

Name
Class
Date
1.

Untuk memuat dataset CSV ke dalam DataFrame di Spark, metode mana yang digunakan?

a)
spark.read.file()
b)
spark.load.csv()
c)
spark.read.csv()
d)
spark.import.csv()
2.

Lengkapi kode pada titik-titik untuk menggabungkan atribut menjadi satu vektor!

assembler = VectorAssembler(.........=selected_features, .........="featuress")

a)
assembler = VectorAssembler(inputs=selected_features, outputs='features')
b)
assembler = VectorAssembler(inputCols=selected_features, outputCol=features_col)
c)
assembler = VectorAssembler(inputCols=features, outputCol=selected_features)
d)
assembler = VectorAssembler(inputCols=selected_features, outputCol="features")
3.

Lengkapi kode berikut untuk melakukan pembagian dataset menjadi data latih dan data uji, dimana data uji diberikan jumlah subset 20% !

train_data, test_data = data.randomSplit(.........)

a)

train_data, test_data = data.randomSplit([0.6, 0.4])

b)

train_data, test_data = data.randomSplit([0.8, 0.2])

c)

train_data, test_data = data.randomSplit([0.7, 0.3])

d)

train_data, test_data = data.randomSplit([0.9, 0.1])

4.

Fungsi mana yang digunakan untuk menghitung jumlah baris dalam DataFrame di Spark?

a)

df.size()

b)

df.rows()

c)

df.count()

d)

df.length()

5.

Fungsi mana yang digunakan untuk menampilkan skema DataFrame di Spark?

a)

df.schema()

b)

df.displaySchema()

c)

df.printSchema()

d)

df.showSchema()

6.

Lengkapi kode dibawah ini, agar hanya mengambil kolom yang memiliki fitur numerik !

numeric = [t[0] for t in df.dtypes if t[1] == 'int']

numeric_summary = df.select( (a)   ).summary()

numeric_summary.show(truncate=False)

7.

Fungsi mana yang digunakan untuk menghapus kolom dari DataFrame di Spark?

a)

df.dropCol()

b)

df.remove()

c)

df.drop()

d)

df.delete()

8.

Lengkapi kode berikut untuk mengubah kolom menjadi tipe data Integer!

df = df.withColumn("new_column", df["old_column"].cast(.........))

a)

FloatType()

b)

StringType()

c)

IntegerType()

d)

DoubleType()

9.

Lengkapi kode dibawah ini untuk dapat membuat sesi pada spark! (Hanya satu jawaban saja, Case sensitive)
from pyspark.sql import ______

spark = ______.builder.getOrCreate()

sc = spark.sparkContext

(a)  

10.

Apa fungsi dari Pipeline dalam MLib Spark?

a)
Pipeline berfungsi untuk meningkatkan kecepatan komputasi.
b)
Pipeline digunakan untuk visualisasi data dalam Spark.
c)
Pipeline digunakan untuk menyimpan data secara permanen.
d)

Pipeline digunakan Menggabungkan beberapa langkah dalam proses pelatihan machine learning.

11.

Apa fungsi dari CrossValidator dalam MLib Spark?

a)

CrossValidator digunakan untuk membagi data menjadi beberapa subset.

b)

CrossValidator digunakan untuk mengoptimalkan hyperparameter model.

c)

CrossValidator digunakan untuk menyimpan model yang telah dilatih.

d)

CrossValidator digunakan untuk menampilkan hasil evaluasi model.

12.

Apakah kode untuk melengkapi bagian yang blok tersebut? (Case Sensitive)

a)

(a) GridSearchCV, (b) param_grid

b)

(a) RandomSearchCV, (b) param_grid

c)

(a) RandomSearchCV, (b) ParamGrid

d)

(a) GridSearchCv, (b) paramgrid

13.

Lengkapi kode dibawah ini! Dimana iterasi dilakukan sebanyak 10 kali

lr = LogisticRegression(featuresCol = 'features', labelCol = 'label', ................)

lrModel = lr.fit(train)

a)
maxIter=10
b)
iterations=10
c)
numIterations=10
d)
maxIterations=10
14.

Lengkapi kode berikut untuk menghapus baris yang memiliki nilai null pada kolom tertentu!

df = df.filter(df["column_name"].isNotNull())

a)

df.cleanNull()

b)

df.filterNull()

c)

df.removeNull()

d)

df.dropna()

15.

Saya ingin mengubah kata menjadi vektor agar menghasilkan seperti pada gambar, dimana saya ingin mempertimbangkan konteks kata dalam kalimat. Metode apa yang bisa saya gunakan untuk melakukan ini?

a)
TF-IDF
b)
CountVectorizer
c)
Bag of Words
d)
Word2Vec
16.

Lengkapi kode dibawah ini! Dimana jumlah data akan dibagi menjadi 5 Cluster

from pyspark.ml.clustering import KMeans

kmeans = KMeans()._____.setSeed(1)

model = kmeans.fit(df)

a)
setK(5)
b)
setK(3)
c)
setClusters(5)
d)
setNumClusters(5)
17.

Fungsi mana yang digunakan untuk menggabungkan dua DataFrame di Spark?

a)

df.concat()

b)

df.merge()

c)

df.join()

d)

df.combine()

18.

Apakah perintah yang tepat untuk melengkapi kode dalam mengelompokan data yang ada di di kolom deposit?
grouped_data = df.______('deposit')._____()

grouped_data.show()

a)
aggregate('deposit').count()
b)
filter('deposit').sum()
c)
sort_values('deposit').head()
d)

groupby('deposit').count()

19.

Lengkapi kode berikut untuk mengubah nama kolom dalam DataFrame!

df = df.withColumnRenamed("old_name", "new_name")

a)

df.renameColumn()

b)

df.withColumnRenamed()

c)

df.changeColumnName()

d)

df.updateColumnName()

20.

Untuk menghapus duplikat dari DataFrame di Spark, fungsi mana yang digunakan?

a)

df.removeDuplicates()

b)

df.distinct()

c)

df.unique()

d)

df.dropDuplicates()