wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Câu hỏi trắc nghiệm Học máy (Machine Learning) – Lớp 12

Total questions: 90

Worksheet time: 45mins

Name
Class
Date
1.

Học máy (Machine Learning) là gì?

a)

Một nhánh của khoa học máy tính giúp máy tự học từ dữ liệu

b)

Một ngôn ngữ lập trình

c)

Một phần mềm phân tích dữ liệu thủ công

d)

Một công nghệ lưu trữ dữ liệu

2.

Học máy thuộc lĩnh vực nào của khoa học dữ liệu?

a)

Lập trình web

b)

Phân tích dữ liệu và trí tuệ nhân tạo

c)

Xử lý văn bản

d)

Quản trị mạng

3.

Mục tiêu chính của học máy là gì?

a)

Tăng dung lượng lưu trữ dữ liệu

b)

Giúp máy tính tự động học từ dữ liệu để đưa ra dự đoán hoặc quyết định

c)

Thay thế hoàn toàn con người

d)

Tạo hình ảnh đồ họa 3D

4.

Học máy được chia thành mấy loại chính?

a)

2

b)

3

c)

4

d)

5

5.

Các loại học máy chính là gì?

a)

Supervised, Unsupervised, Reinforcement Learning

b)

Classification, Regression, Clustering

c)

AI, Data Mining, Deep Learning

d)

None of the above

6.

Thuật toán trong học máy là gì?

a)

Một tập các quy tắc giúp máy học từ dữ liệu

b)

Một dạng phần cứng máy tính

c)

Một cơ sở dữ liệu

d)

Một giao diện người dùng

7.

Dữ liệu huấn luyện (training data) là gì?

a)

Dữ liệu được sử dụng để kiểm tra mô hình

b)

Dữ liệu được dùng để dạy mô hình học

c)

Dữ liệu bị loại bỏ

d)

Dữ liệu chứa toàn lỗi

8.

Trong học máy, "model" có nghĩa là gì?

a)

Một file hình ảnh

b)

Cấu trúc toán học mà máy học từ dữ liệu

c)

Một kiểu dữ liệu

d)

Một phần mềm hệ thống

9.

Quá trình đánh giá hiệu suất mô hình được gọi là gì?

a)

Training

b)

Testing

c)

Validation

d)

Optimization

10.

Một ứng dụng phổ biến của học máy là gì?

a)

Gợi ý phim trên Netflix

b)

Soạn nhạc

c)

Dịch thuật thủ công

d)

Sao lưu dữ liệu

11.

Trong học máy, "overfitting" là gì?

a)

Mô hình quá đơn giản

b)

Mô hình học thuộc dữ liệu huấn luyện mà không tổng quát tốt

c)

Mô hình hoạt động quá nhanh

d)

Dữ liệu bị thiếu

12.

"Underfitting" có nghĩa là gì?

a)

Mô hình không học đủ thông tin từ dữ liệu

b)

Mô hình quá phức tạp

c)

Mô hình chạy quá chậm

d)

Dữ liệu bị nhiễu quá nhiều

13.

Quá trình chia dữ liệu thành tập huấn luyện và kiểm thử gọi là gì?

a)

Data Mining

b)

Data Splitting

c)

Data Collection

d)

Data Storage

14.

"Feature" trong học máy là gì?

a)

Một đặc trưng hoặc thuộc tính mô tả dữ liệu

b)

Một loại thuật toán

c)

Một giá trị ngẫu nhiên

d)

Một phần cứng hỗ trợ học máy

15.

"Label" trong học máy có giám sát là gì?

a)

Dữ liệu đầu ra (output) mà mô hình cần dự đoán

b)

Một tập dữ liệu không có nhãn

c)

Một phương pháp phân cụm

d)

Một dạng kiểm tra chéo

16.

"Accuracy" dùng để đo điều gì?

a)

Độ chính xác của mô hình

b)

Tốc độ xử lý của máy tính

c)

Dung lượng dữ liệu

d)

Độ phức tạp của thuật toán

17.

"Training" và "Testing" khác nhau như thế nào?

a)

Training là quá trình mô hình học, Testing là quá trình đánh giá

b)

Cả hai là một

c)

Testing xảy ra trước Training

d)

Training chỉ dành cho dữ liệu kiểm thử

18.

Một ví dụ điển hình của học máy trong đời sống là gì?

a)

Nhận diện khuôn mặt

b)

Tính toán thủ công

c)

Đánh máy văn bản

d)

Sử dụng máy tính cầm tay

19.

Học máy có giám sát (Supervised Learning) là gì?

a)

Mô hình học từ dữ liệu có nhãn (label)

b)

Mô hình không cần dữ liệu huấn luyện

c)

Mô hình không có đầu ra xác định

d)

Mô hình học mà không cần dữ liệu

20.

Ví dụ điển hình của Supervised Learning là gì?

a)

Phân loại email spam

b)

Gom cụm khách hàng

c)

Giảm số chiều dữ liệu

d)

Phát hiện mẫu ẩn trong dữ liệu

21.

Dữ liệu trong Supervised Learning gồm hai thành phần nào?

a)

Feature và Label

b)

Input và Output

c)

Training và Testing

d)

Feature và Cluster

22.

Học có giám sát được chia thành hai loại chính là gì?

a)

Classification và Regression

b)

Clustering và Segmentation

c)

Association và Reinforcement

d)

Prediction và Grouping

23.

Thuật toán hồi quy (Regression) dùng để làm gì?

a)

Dự đoán giá trị liên tục

b)

Phân loại dữ liệu rời rạc

c)

Giảm nhiễu dữ liệu

d)

Tăng độ phức tạp của mô hình

24.

Ví dụ về bài toán hồi quy là gì?

a)

Dự đoán giá nhà

b)

Phân loại email

c)

Nhận dạng chữ viết

d)

Gom cụm khách hàng

25.

Bài toán phân loại (Classification) nhằm mục đích gì?

a)

Gán dữ liệu vào các nhóm có sẵn

b)

Giảm số chiều dữ liệu

c)

Sinh dữ liệu mới

d)

Gom nhóm không nhãn

26.

Trong Classification, "binary classification" nghĩa là gì?

a)

Phân loại hai lớp

b)

Phân loại nhiều lớp

c)

Phân loại không giám sát

d)

Phân loại ngẫu nhiên

27.

Linear Regression dựa trên mối quan hệ gì giữa biến độc lập và phụ thuộc?

a)

Tuyến tính

b)

Phi tuyến tính

c)

Ngẫu nhiên

d)

Tương quan nghịch

28.

Trong Linear Regression, hàm mất mát phổ biến là gì?

a)

Mean Squared Error (MSE)

b)

Cross Entropy

c)

Hinge Loss

d)

Log Loss

29.

Logistic Regression được dùng cho loại bài toán nào?

a)

Phân loại

b)

Hồi quy tuyến tính

c)

Gom cụm

d)

Giảm chiều dữ liệu

30.

Trong Decision Tree, nút gốc (root node) là gì?

a)

Điểm bắt đầu của quá trình phân chia dữ liệu

b)

Nút cuối cùng của cây

c)

Dữ liệu bị loại bỏ

d)

Nút chứa dữ liệu nhãn

31.

Tiêu chí chia nhánh phổ biến trong Decision Tree là gì?

a)

Information Gain

b)

Cross Validation

c)

Clustering

d)

Reinforcement

32.

"Overfitting" thường xảy ra trong Decision Tree khi nào?

a)

Cây quá sâu

b)

Cây quá nông

c)

Dữ liệu bị thiếu

d)

Không có nhãn

33.

Thuật toán K-Nearest Neighbors (KNN) dựa trên nguyên tắc gì?

a)

Khoảng cách giữa các điểm dữ liệu

b)

Trọng số tuyến tính

c)

Học tham số

d)

Tăng cường chính sách

34.

Trong KNN, giá trị K càng lớn thì mô hình thế nào?

a)

Tổng quát hơn

b)

Nhạy cảm hơn

c)

Dễ overfit hơn

d)

Dễ underfit hơn

35.

SVM viết tắt của gì?

a)

Support Vector Machine

b)

Simple Vector Model

c)

System Value Metric

d)

Sample Variable Machine

36.

Mục tiêu của SVM là gì?

a)

Tìm siêu phẳng (hyperplane) tối ưu để phân tách dữ liệu

b)

Tăng số lượng đặc trưng

c)

Giảm chiều dữ liệu

d)

Tạo nhãn giả cho dữ liệu

37.

Trong SVM, kernel function được dùng để làm gì?

a)

Biến đổi dữ liệu sang không gian mới

b)

Giảm kích thước dữ liệu

c)

Thay đổi learning rate

d)

Giảm noise

38.

Naive Bayes dựa trên định lý nào?

a)

Bayes Theorem

b)

Pythagoras

c)

Euclid

d)

Gauss

39.

Giả định chính của Naive Bayes là gì?

a)

Các đặc trưng độc lập với nhau

b)

Dữ liệu có mối liên hệ phức tạp

c)

Phân phối chuẩn lệch

d)

Các nhãn phụ thuộc lẫn nhau

40.

Mô hình nào phù hợp với dữ liệu có nhãn và liên tục thay đổi theo thời gian?

a)

Linear Regression

b)

Time Series Model

c)

PCA

d)

K-Means

41.

Cross-validation dùng để làm gì?

a)

Đánh giá hiệu suất mô hình trên nhiều tập dữ liệu

b)

Tăng kích thước dữ liệu

c)

Chia nhỏ đặc trưng

d)

Kiểm tra lỗi cú pháp

42.

Trong Cross-validation, kỹ thuật K-Fold chia dữ liệu thành mấy phần?

a)

K phần

b)

2 phần

c)

3 phần

d)

5 phần cố định

43.

Random Forest là gì?

a)

Tập hợp nhiều Decision Trees

b)

Một cây đơn

c)

Mô hình dựa trên KNN

d)

Mô hình tuyến tính đơn giản

44.

Ưu điểm của Random Forest là gì?

a)

Giảm overfitting so với Decision Tree

b)

Huấn luyện nhanh hơn mọi mô hình

c)

Không cần dữ liệu huấn luyện

d)

Không cần gán nhãn

45.

Gradient Boosting khác Random Forest ở điểm nào?

a)

Cây được huấn luyện tuần tự để sửa lỗi cây trước

b)

Cây được huấn luyện song song

c)

Không sử dụng gradient

d)

Không có lỗi tích lũy

46.

Mô hình Ensemble Learning dùng để làm gì?

a)

Kết hợp nhiều mô hình để tăng độ chính xác

b)

Tạo thêm dữ liệu giả

c)

Giảm số chiều dữ liệu

d)

Chia nhỏ tập dữ liệu

47.

Khi dữ liệu mất cân bằng (imbalanced data), cần làm gì?

a)

Cân bằng lại bằng oversampling hoặc undersampling

b)

Bỏ qua dữ liệu thiếu số

c)

Thêm nhãn ngẫu nhiên

d)

Giảm kích thước dữ liệu

48.

Evaluation metric nào phù hợp cho phân loại nhiều lớp?

a)

Accuracy, Precision, Recall, F1-score

b)

MSE, RMSE

c)

Silhouette Score

d)

Entropy

49.

ROC-AUC dùng để đánh giá điều gì?

a)

Hiệu quả phân biệt giữa các lớp

b)

Tốc độ huấn luyện

c)

Kích thước dữ liệu

d)

Số lượng đặc trưng

50.

Trong Regression, hệ số R^2 biểu diễn điều gì?

a)

Mức độ phù hợp của mô hình với dữ liệu

b)

Tốc độ huấn luyện

c)

Độ nhiễu của dữ liệu

d)

Số chiều của đặc trưng

51.

Học máy không giám sát (Unsupervised Learning) là gì?

a)

Học từ dữ liệu không có nhãn

b)

Học từ dữ liệu có nhãn

c)

Học dựa trên phần thưởng

d)

Học không cần dữ liệu

52.

Mục tiêu chính của Unsupervised Learning là gì?

a)

Tìm cấu trúc hoặc mẫu ẩn trong dữ liệu

b)

Dự đoán giá trị đầu ra

c)

Huấn luyện mô hình theo nhãn

d)

Sinh dữ liệu giả

53.

Hai nhóm bài toán chính của Unsupervised Learning là gì?

a)

Clustering và Dimensionality Reduction

b)

Classification và Regression

c)

Reinforcement và Supervised

d)

Association và Forecasting

54.

'Clustering' nghĩa là gì?

a)

Phân nhóm các điểm dữ liệu tương tự nhau

b)

Dự đoán đầu ra

c)

Gán nhãn cho dữ liệu

d)

Giảm nhiễu dữ liệu

55.

Thuật toán K-Means thuộc loại nào?

a)

Clustering

b)

Classification

c)

Regression

d)

Reinforcement

56.

Trong K-Means, K biểu thị điều gì?

a)

Số cụm cần phân chia

b)

Số đặc trưng của dữ liệu

c)

Số vòng lặp huấn luyện

d)

Số thuộc tính độc lập

57.

Mục tiêu của thuật toán K-Means là gì?

a)

Tối thiểu hóa khoảng cách trong cụm

b)

Tối đa hóa khoảng cách trong cụm

c)

Giảm số chiều dữ liệu

d)

Tăng độ nhiễu dữ liệu

58.

Trong K-Means, bước đầu tiên là gì?

a)

Chọn ngẫu nhiên K tâm cụm (centroid)

b)

Tính khoảng cách Euclidean

c)

Gán nhãn cho dữ liệu

d)

Chuẩn hóa dữ liệu

59.

Khi số lượng cụm K quá lớn, điều gì xảy ra?

a)

Mô hình có thể overfitting

b)

Mô hình underfitting

c)

Giảm khả năng phân tách

d)

Không ảnh hưởng gì

60.

Hierarchical Clustering khác K-Means ở điểm nào?

a)

Không cần chỉ định số cụm trước

b)

Dựa trên khoảng cách trung bình

c)

Dùng mạng nơ-ron

d)

Không có bước hợp cụm

61.

Phương pháp nào được dùng để xác định số cụm tối ưu trong K-Means?

a)

Elbow Method

b)

ROC Curve

c)

Gradient Descent

d)

Silhouette Boost

62.

PCA (Principal Component Analysis) là kỹ thuật gì?

a)

Giảm chiều dữ liệu

b)

Phân loại dữ liệu

c)

Gom cụm

d)

Sinh dữ liệu mới

63.

Mục tiêu của PCA là gì?

a)

Giảm số đặc trưng nhưng vẫn giữ thông tin quan trọng

b)

Tăng số lượng đặc trưng

c)

Loại bỏ dữ liệu bị lỗi

d)

Gán nhãn cho dữ liệu

64.

Thành phần chính (Principal Component) là gì?

a)

Tổ hợp tuyến tính của các đặc trưng ban đầu

b)

Một nhãn của dữ liệu

c)

Một mẫu ngẫu nhiên

d)

Một phần tử dữ liệu gốc

65.

Giải thuật nào thường dùng để trích xuất thành phần chính trong PCA?

a)

Eigenvalue Decomposition

b)

Decision Tree

c)

Logistic Regression

d)

Random Forest

66.

Thuật toán Apriori dùng cho loại bài toán nào?

a)

Association Rule Learning

b)

Regression

c)

Clustering

d)

Dimensionality Reduction

67.

Mục tiêu của Association Rule Learning là gì?

a)

Tìm mối quan hệ giữa các mục trong tập dữ liệu

b)

Phân loại dữ liệu

c)

Giảm chiều dữ liệu

d)

Gom cụm dữ liệu tương tự

68.

Trong Apriori, 'support' biểu thị điều gì?

a)

Tần suất xuất hiện của một tập mục trong dữ liệu

b)

Độ chính xác của mô hình

c)

Mức độ liên kết giữa nhãn

d)

Tốc độ huấn luyện

69.

'Confidence' trong luật kết hợp thể hiện gì?

a)

Xác suất xuất hiện của mục B khi mục A xuất hiện

b)

Độ lệch chuẩn của dữ liệu

c)

Độ chính xác tổng thể

d)

Mức độ tương quan tuyến tính

70.

'Anomaly detection' trong Unsupervised Learning nhằm mục đích gì?

a)

Phát hiện điểm dữ liệu bất thường

b)

Gom nhóm dữ liệu tương tự

c)

Dự đoán giá trị liên tục

d)

Gán nhãn mới cho dữ liệu

71.

Thuật toán nào phù hợp để phát hiện bất thường?

a)

Isolation Forest

b)

Linear Regression

c)

Decision Tree

d)

Random Forest

72.

Mô hình Autoencoder thuộc nhóm nào?

a)

Unsupervised Learning

b)

Supervised Learning

c)

Reinforcement Learning

d)

Semi-supervised Learning

73.

Autoencoder thường được dùng để làm gì?

a)

Nén và tái tạo dữ liệu

b)

Phân loại nhãn chính xác

c)

Tối ưu hóa phần thưởng

d)

Tăng số đặc trưng

74.

Học tăng cường (Reinforcement Learning – RL) là gì?

a)

Quá trình huấn luyện mô hình bằng dữ liệu có sẵn

b)

Quá trình agent học bằng cách thử và sai thông qua phản hồi (reward)

c)

Quá trình dán nhãn dữ liệu đầu vào

d)

Quá trình phân tích mối quan hệ tuyến tính giữa các biến

75.

Trong học tăng cường, thuật ngữ agent chỉ điều gì?

a)

Tập dữ liệu đầu vào

b)

Mô hình dự đoán

c)

Thực thể thực hiện hành động trong môi trường

d)

Tập các tham số huấn luyện

76.

Environment (môi trường) trong RL có vai trò gì?

a)

Lưu trữ dữ liệu huấn luyện

b)

Đưa ra phản hồi và trạng thái mới cho agent

c)

Là phần tính toán giá trị Q

d)

Là tập hợp chính sách của agent

77.

Agent trong RL nhận được thông tin từ môi trường dưới dạng gì?

a)

Ảnh

b)

Reward và trạng thái mới (next state)

c)

Tập dữ liệu

d)

Độ chính xác

78.

Reward (phần thưởng) trong RL là gì?

a)

Giá trị mô hình dự đoán

b)

Thông tin mô tả môi trường

c)

Phản hồi cho agent sau mỗi hành động

d)

Kết quả huấn luyện cuối cùng

79.

Học tăng cường khác học có giám sát ở điểm nào?

a)

RL không có tập dữ liệu nhãn sẵn

b)

RL không có đầu vào

c)

RL chỉ học một lần duy nhất

d)

RL không có mô hình

80.

Mục tiêu của agent trong RL là gì?

a)

Giảm sai số dự đoán

b)

Tối đa hóa tổng phần thưởng nhận được

c)

Tối thiểu hóa giá trị Q

d)

Giảm độ phức tạp của môi trường

81.

Q-learning là thuật toán thuộc loại nào?

a)

Supervised learning

b)

Unsupervised learning

c)

Reinforcement learning

d)

Deep learning

82.

Hàm Q(s, a) biểu diễn điều gì?

a)

Xác suất hành động

b)

Giá trị kỳ vọng của phần thưởng khi thực hiện hành động a tại trạng thái s

c)

Tổng phần thưởng trung bình

d)

Hàm tổn thất

83.

Policy (chính sách) trong RL có chức năng gì?

a)

Tính toán giá trị trung bình

b)

Quyết định hành động tiếp theo của agent dựa vào trạng thái

c)

Chọn phần thưởng lớn nhất

d)

Giảm tốc độ học

84.

Một chính sách tối ưu (optimal policy) là gì?

a)

Chính sách chọn hành động ngẫu nhiên

b)

Chính sách mang lại tổng phần thưởng lớn nhất theo thời gian

c)

Chính sách giúp agent dừng sớm

d)

Chính sách có reward bằng 0

85.

Discount factor (γ) trong RL dùng để làm gì?

a)

Cân bằng giữa phần thưởng hiện tại và tương lai

b)

Tăng tốc độ học

c)

Giảm giá trị Q về 0

d)

Ngăn chặn overfitting

86.

Học tăng cường thường được áp dụng trong lĩnh vực nào?

a)

Phân loại email

b)

Dự đoán giá cổ phiếu

c)

Robot tự hành và trò chơi (game AI)

d)

Xử lý ảnh tĩnh

87.

Deep Q-Network (DQN) là sự kết hợp giữa hai lĩnh vực nào?

a)

Deep Learning và Reinforcement Learning

b)

Unsupervised Learning và Statistics

c)

Decision Tree và Neural Network

d)

PCA và Regression

88.

Thuật toán Monte Carlo trong RL dựa trên nguyên tắc nào?

a)

Tính toán toàn bộ phần thưởng sau khi kết thúc tập

b)

Cập nhật giá trị sau mỗi bước hành động

c)

Giảm dần learning rate

d)

Bỏ qua reward âm

89.

Exploration và exploitation trong RL thể hiện điều gì?

a)

Khả năng dự đoán chính xác dữ liệu mới

b)

Cân bằng giữa việc thử hành động mới và tận dụng hành động tốt đã biết

c)

Quá trình chuẩn hóa dữ liệu

d)

Lựa chọn phần thưởng ngẫu nhiên

90.

Trade-off giữa exploration và exploitation có nghĩa là gì?

a)

Agent phải chọn giữa học và kiểm tra

b)

Agent cần cân bằng giữa khám phá cái mới và tận dụng kinh nghiệm cũ

c)

Agent phải giảm reward để học tốt hơn

d)

Agent không thể nhận reward âm