Wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Responsi Lab

Total questions: 40

Worksheet time: 22mins

Name
Class
Date
1.

Dalam library Pandas, fungsi mana yang paling efisien untuk mendeteksi jumlah nilai kosong (NaN) di setiap kolom dataset?

a)

df.dropna()

b)

df.isnull().sum()

c)

df.describe()

d)

df.count_na()

2.

Apa fungsi dari parameter inplace=trueinplace=true pada perintah df.dropna(inplace=True)df.dropna(inplace=True) ?

a)

Menyimpan perubahan langsung pada dataframe asli tanpa perlu assignment baru.

b)

Hanya menghapus baris yang semua kolomnya kosong

c)

Membuat salinan baru dari dataframe.

d)

Menghapus kolom, bukan baris.

3.

Jika ada nilai Annual Income=137Annual\ Income=137 , maka…

a)

data tersebut outlier

b)

data tersebut bukan outlier

c)

tidak dapat disimpulkan

4.

Fungsi regex r"+\s+" adalah…

a)

Menghapus semua huruf

b)

menghapus angka

c)

menghapus spasi berlebih

d)

menghapus emoticon

5.

Apa yang dilakukan kode ini?

a)

mengecek outlier

b)

menghapus outlier

c)

mengganti outlier dengan batas bawah dan batas atas

d)

mencari tendensi sentral

6.

nilai dari X_norm tersebut akan berada pada rentang___

a)

(-∞, ∞)

b)

(0, 1)

c)

(-1, 1)

d)

(1, 10)

7.

Perhatikan Grafik tersebut !. Berdasarkan grafik tersebut tuliskan jumlah klaster yang optimal

(a)  

8.

Perhatikan informasi data tersebut!. Pada data tersebut memiliki missing value?

a)

Ya

b)

Tidak

c)

Tidak dapat ditentukan

9.

Berdasarkan informasi tersebut, berapa jumlah fitur yang dimili oleh data tersebut?

(a)  

10.

Output df.shapedf.shape adalah (1250,8)(1250,8) . Interpretasi yang benar adalah …

a)

Dataset memiliki 8 baris dan 1250 kolom

b)

Dataset memiliki 1250 baris dan 8 kolom

c)

Dataset memiliki 1250 fitur numerik

d)

Dataset memiliki 8 variabel target

11.

Jika sebuah dataset memiliki banyak kolom kategorikal, informasi struktur yang PALING penting dicek terlebih dahulu adalah …

a)

Nilai maksimum setiap kolom

b)

Distribusi data

c)

Tipe data dan jumlah nilai unik

d)

Korelasi antar fitur

12.

Seorang analis ingin mengganti nilai kosong pada kolom job dengan 'Unknown'. Kode yang benar adalah

a)
df['job'].replace('', 'Unknown', inplace=True)
b)
df['job'].fillna('Unknown', inplace=True)
c)

df.fill('Unknown')

d)

df.dropna('job')

13.

Untuk mengurutkan dataset berdasarkan kolom age dari terbesar ke terkecil, perintah yang benar adalah

a)

df.sort(age, descending=True)

b)

df.sort_values('age', ascending=False)

c)

df.order_by('age')

d)

df.sort_index('age')

14.

Perintah yang digunakan untuk menghapus baris yang memiliki missing value adalah …

a)

df.remove()

b)

df.dropna()

c)

df.isnull()

d)

df.clean()

15.

Anda menemukan bahwa kolom jobjob memiliki 120 kategori unik, padahal dataset hanya berisi 500 baris. Keputusan manipulasi data yang PALING LOGIS adalah …

a)

Menghapus kolom job

b)

Menggabungkan kategori langka menjadi “Other”

c)

Menormalkan kolom

d)

Melakukan encode dengan label encoding

16.

berdasarkan kode tersebut, jika dataset berisi 1000 data, tuliskan jumlah data train yang digunakan untuk membuat model

(a)  

17.

Berapakah jumlah True Positive (TP) pada confusion matrix di atas?

a)

79

b)

72

c)

67

d)

82

18.

berdasarkan nilai classification report tersebut apakah metrik akurasi adalah metrik yang tepat untuk mengcapture kasus tersebut

a)

ya

b)

tidak

c)

tidak tahu

19.

Berdasarkan informasi classification report tersebut, apakah metrik akurasi adalah metrik yang tepat untuk menilai performa model tersebut?

a)

ya

b)

tidak

c)

tidak tahu

20.

sebuah kasus di selesaikan dengan menggunakan pemodelan Logistic Regression, Naive bayes dan KNN. Hasil pengujian model ditunjukkan oleh kurva ROC-AUC tersebut. Dari hasil tersebut, model manakah yang memiliki performa yang lebih baik

a)

Naive Bayes

b)

KNN

c)

Logistic Regression

d)

Tidak dapat disimpulkan

21.

Sebuah kasus diselesaikan dengan pemodelan KMeans dan DBSCAN. Adapun hasil pengujian ditunjukkan oleh tabel tersebut. Berdasarkan tabel tersebut, model manakah yang memiliki kinerja lebih baik?

a)

Kmeans

b)

DBSCAN

c)

Tidak dapat disimpulkan

22.

seseorang melakukan modelling dengan Kmeans dengan konfigurasi yang ditunjukkan oleh gambar tersebut. Fungsi n_init=10 pada konfigurasi tersebut adalah …

a)

Mengulang training 10 kali

b)

Mencoba 10 inisialisasi centroid berbeda dan memilih yang terbaik (inertia terendah)

c)

Membagi data menjadi 10 fold

d)

Menetapkan 10 cluster awal tetap

23.

berdasarkan sintaks tersebut, tujuan df2 adalah …

a)

Mengambil centroid cluster 2

b)

Mengambil semua data yang termasuk cluster 2

c)

Menghapus cluster 2

d)

Menggabungkan cluster

24.

Bagaimana cara mengetahui titik core pada scikit-learn DBSCAN setelah data dilatih?

a)

db.core_sample_indices_

b)

db.centroids_

c)

db.cluster_centers_

d)

db.inertia_

25.

Pada DBSCAN, pernyataan yang benar adalah …

a)

Border point punya minimal min_samples tetangga

b)

Core point tidak punya tetangga

c)

Noise point tidak termasuk cluster manapun (label -1)

d)

Semua titik pasti core point

26.

Pipeline yang paling tepat untuk DBSCAN pada fitur numerik berskala berbeda adalah …

a)

b)

c)

d)

27.

Jika hasil DBSCAN menghasilkan banyak label -1, penyebab paling mungkin adalah …

a)

eps terlalu besar

b)

min_samples terlalu kecil

c)

eps terlalu kecil atau min_samples terlalu besar

d)

data tidak bisa di-cluster

28.

sebuah kasus diselesaikan dengan modelling DBSCAN. hasilnya ditunjukan oleh gambar tersebut. tuliskan berapa jumlah outlier pada data tersebut?

(a)  

29.

Pada Algoritma DBSCAN, parameter eps merepresentasikan …

a)

Jumlah cluster yang diinginkan

b)

Radius tetangga (neighborhood) untuk mengukur kepadatan

c)

Skor kualitas cluster

d)

Jumlah fitur yang dipakai

30.

Fungsi utama dari kode tersebut adalah

a)

Menghasilkan aturan asosiasi

b)

Menghasilkan itemset yang sering muncul

c)

Menghitung confidence

d)

Menghapus item jarang

31.

sebuah data dimining dengan aturan asosiasi. berdasarkan output tersebut interpretasi yang dihasilkan oleh aturan tersebut adalah

a)

40% transaksi berisi Milk dan Bread

b)

80% transaksi yang membeli Bread juga membeli Milk

c)

Pembeli Milk 80% juga membeli Bread

d)

Milk dan Bread tidak berhubungan

32.

Tujuan utama kode tersebut adalah …

a)

Menghapus semua aturan

b)

Menyimpan aturan yang kuat dan relevan

c)

Mengurutkan aturan

d)

Menghitung support

33.

Sebuah kasus diselesaikan dengan decision tree, adapun konfigurasinya ditunjukkan oleh gambar tersebut. Fungsi max_depth pada code tersebut adalah …

a)

Menentukan jumlah fitur

b)

Membatasi kedalaman pohon

c)

Menentukan jumlah data

d)

Mengatur learning rate

34.

Pada code tersebut, tujuan pengaturan min_samples_leaf adalah …

a)

Menentukan jumlah leaf

b)

Mencegah leaf dengan data terlalu sedikit

c)

Mengatur jumlah fitur

d)

Menghitung entropy

35.

Manakah contoh embedded feature selection?

a)

b)

RFE(LogisticRegression())

RFE(LogisticRegression())

c)

d)

36.

Jika setelah feature selection akurasi turun, kesimpulan yang PALING TEPAT adalah …

a)

Feature selection salah

b)

Dataset rusak

c)

Fitur yang dihapus ternyata informatif

d)

Model harus diganti

37.

Perhatikan error tersebut. Penyebab paling mungkin adalah …

a)

Missing value belum dihapus

b)

Data belum di-scaling

c)

Fitur kategorikal belum di-encoding

d)

Target salah

38.

output dari kode tersebut adalah

a)

Label kelas

b)

Nilai residual

c)

Probabilitas tiap kelas

d)

Confusion matrix

39.

jika model memiliki performa seperti gambar tersebut, maka analisis yang tepat adalah

a)

Model sangat baik

b)

Model gagal total

c)

Model bias ke kelas mayoritas

d)

Model dilatih dari data yang seimbang

40.

Mengapa GaussianNB tidak membutuhkan scaling seketat KNN?

a)

Karena tidak menggunakan jarak

b)

Karena otomatis scaling

c)

Karena fitur dibuang

d)

Karena supervised