wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

NKD ML

Total questions: 12

Worksheet time: 9mins

Name
Class
Date
1.

Trong một dự án Machine Learning, khi dữ liệu đầu vào thực tế thay đổi theo thời gian so với dữ liệu dùng để huấn luyện (ví dụ: người dùng bắt đầu chụp ảnh bằng camera có độ phân giải cao hơn), hiện tượng này được gọi là gì?

a)

Concept Drift

b)

Overfitting

c)

Data Drift

d)

Data Leakage

2.

Vì sao cần thực hiện Feature Scaling khi dùng các thuật toán nhạy cảm với khoảng cách như SVM hoặc KNN?

a)

Để mã hóa thuộc tính chữ thành số

b)

Để tránh thuộc tính có thang đo lớn chi phối

c)

Để tăng số lượng mẫu huấn luyện

d)

Để loại bỏ giá trị thiếu trong dữ liệu

3.

Phương pháp nào phù hợp nhất để mã hóa thuộc tính có thứ tự như 'Tệ', 'Trung bình', 'Tốt', 'Tuyệt vời'?

a)

One-Hot Encoding

b)

Imputation

c)

Standardization

d)

Ordinal/Label Encoding

4.

Biểu đồ nào thường được sử dụng trong bước Khám phá Dữ liệu (EDA) để trực quan hóa ma trận tương quan (correlation matrix) giữa nhiều biến số?

a)

Heatmap

b)

Bar chart

c)

Line chart

d)

Scatter plot

5.

Phương pháp tinh chỉnh mô hình 'Grid Search' hoạt động như thế nào?

a)

Thử nghiệm một cách có hệ thống tất cả các tổ hợp siêu tham số (hyperparameter) được chỉ định.

b)

Luôn dự đoán bằng giá trị trung bình hoặc phổ biến nhất của tập dữ liệu.

c)

Thử nghiệm ngẫu nhiên một số lượng tổ hợp siêu tham số nhất định từ một gian tìm kiếm.

d)

Kết hợp dự đoán của nhiều mô hình yếu để tạo ra một mô hình mạnh hơn.

6.

Trong bối cảnh pháp lý và đạo đức khi thu thập dữ liệu, việc ẩn danh hóa (Anonymization) thông tin cá nhân (PII) giúp tuân thủ quy định nào?

a)

Cân bằng lớp (Class balance) trong dữ liệu.

b)

Bản quyền (Copyright) của dữ liệu.

c)

Quy định về quyền riêng tư như GDPR.

d)

Tính toàn vẹn (Completeness) của dữ liệu.

7.

Kỹ thuật 'Data Augmentation' như xoay, lật, hoặc thêm nhiễu vào hình ảnh được sử dụng chủ yếu để làm gì?

a)

Chuẩn hóa thang đo của các giá trị pixel trong ảnh.

b)

Làm sạch dữ liệu bằng cách loại bỏ các điểm ảnh bị lỗi.

c)

Tăng kích thước tập huấn luyện và giảm overfitting.

d)

Giảm kích thước của tập dữ liệu để huấn luyện nhanh hơn.

8.

Khi một mô hình hoạt động tốt trên tập huấn luyện (training set) nhưng rất tệ trên tập kiểm tra (test set), hiện tượng này được gọi là gì?

a)

Data Drift

b)

Overfitting

c)

Class Imbalance

d)

Underfitting

9.

Mục tiêu chính của mô hình baseline trong quy trình học máy là gì?

a)

Đảm bảo mô hình đạt độ chính xác 100%

b)

Tối ưu toàn bộ siêu tham số ngay lập tức

c)

Tăng độ phức tạp của mô hình ban đầu

d)

Tạo mốc so sánh đơn giản để đánh giá

10.

Thư viện nào thường dùng để tuần tự hóa và lưu mô hình đã huấn luyện?

a)

Pickle hoặc Joblib

b)

Matplotlib

c)

Pandas

d)

Flask

11.

Lợi ích cốt lõi của kỹ thuật Ensemble Learning là gì?

a)

Tự động xử lý dữ liệu bị thiếu hoàn toàn

b)

Giảm thời gian huấn luyện một mô hình

c)

Giảm kích thước tệp mô hình lưu trữ

d)

Kết hợp nhiều mô hình để cải thiện kết quả

12.

Phương pháp mã hóa nào phù hợp nhất cho dữ liệu danh mục không có thứ tự như Mèo, Chó, Gà?

a)

Label Encoding

b)

One-Hot Encoding

c)

Min-Max Scaling

d)

Ordinal Encoding