wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Câu hỏi trắc nghiệm về Học máy

Total questions: 65

Worksheet time: 11mins

Name
Class
Date
1.

Thuật toán nào sau đây thường được dùng để tối ưu hàm mất mát trong deep learning? Chọn một đáp án.

a)

Principal Component Analysis

b)

Gradient Descent

c)

Decision Tree

d)

K-means

2.

Logistic Regression thường được dùng cho loại bài toán nào? Chọn một đáp án.

a)

Phân loại nhị phân

b)

Cụm (clustering)

c)

Phân loại nhiều lớp duy nhất

d)

Hồi quy liên tục

3.

Một trong những nhược điểm của Linear Regression là gì? Chọn một đáp án.

a)

Yêu cầu phải có GPU

b)

Nhạy cảm với nhiễu (noise)

c)

Khó xác định và tốn nhiều thời gian

d)

Không thể áp dụng cho dữ liệu số

4.

Tầng đầu vào (Input Layer) trong mạng nơ-ron có nhiệm vụ gì? Chọn một đáp án.

a)

Sinh dữ liệu ngẫu nhiên để huấn luyện

b)

Tiếp nhận dữ liệu ban đầu đưa vào mô hình

c)

Tối ưu hàm mất mát

d)

Lưu trọng số mô hình

5.

Trong mô hình hồi quy tuyến tính đơn, công thức nào sau đây là đúng? Chọn tất cả đáp án đúng.

a)

β0x+β1x+ε\beta_0 x + \beta_1 x + \varepsilon

b)

β0+β1x+ε\beta_0 + \beta_1 x + \varepsilon

c)

β0x2+β1x+ε\beta_0 x^2 + \beta_1 x + \varepsilon

d)

β0+x+ε\beta_0 + x + \varepsilon

6.

Phân tích thành phần chính (PCA) dùng để? Chọn một đáp án.

a)

Dịch văn bản

b)

Tối ưu thuật toán

c)

Giảm số chiều dữ liệu

d)

Tăng tốc xử lý ảnh

7.

Học có giám sát (Supervised Learning) yêu cầu gì? Chọn một đáp án.

a)

Dữ liệu đầu vào không cần gán nhãn

b)

Chỉ áp dụng với dữ liệu phi tuyến tính

c)

Dữ liệu đầu vào phải được gán nhãn rõ ràng

d)

Chỉ áp dụng với dữ liệu không có cấu trúc

8.

Trong cây quyết định, việc phân chia node kết thúc khi nào? Chọn một đáp án.

a)

Khi không còn đặc trưng nào để chia tiếp

b)

Khi các node lá thuần nhất

c)

Tất cả đáp án trên

d)

Khi đạt chiều cao tối đa

9.

Hàm kích hoạt (activation function) được sử dụng trong Logistic Regression là gì? Chọn một đáp án.

a)

ReLU

b)

Tanh

c)

Sigmoid

d)

Softmax

10.

Thuật ngữ "Principal Component Analysis (PCA)" được sử dụng để làm gì trong học máy? Chọn một đáp án.

a)

Phân loại dữ liệu

b)

Tóm tắt dữ liệu

c)

Giảm số chiều dữ liệu

d)

Xây dựng mô hình phân tích

11.

Thuật toán K-means ngầm giả định điều gì về hình dạng và cấu trúc của các cụm (clusters)? Chọn một đáp án.

a)

Mỗi cụm tương đương với một nhãn có sẵn

b)

Các cụm có thể có bất kỳ hình dạng nào

c)

Các cụm có kích thước và mật độ thay đổi linh hoạt

d)

Các cụm có hình tròn đều và phân bố đều nhau

12.

Mục tiêu của học tăng cường (Reinforcement Learning) là gì? Chọn một đáp án.

a)

Phân loại dữ liệu thành các nhóm có sẵn

b)

Tìm ra một chính sách tối ưu để tác nhân nhận được phần thưởng cao nhất trong môi trường tương tác

c)

Rút trích các đặc trưng từ dữ liệu

d)

Dự đoán một giá trị liên tục

13.

Ví dụ nào sau đây thuộc về học không giám sát? Chọn một đáp án.

a)

Nhận diện khuôn mặt

b)

Phân cụm khách hàng

c)

Dự đoán giá nhà

d)

Phân loại email

14.

Kỹ thuật nào dùng trong học không giám sát? Chọn một đáp án.

a)

K-means

b)

Linear Regression

c)

Naive Bayes

d)

Random Forest

15.

Khi dữ liệu không được chuẩn hóa (normalize) trước khi áp dụng KNN, vấn đề gì có thể xảy ra? Chọn một đáp án.

a)

Dữ liệu dễ bị thiếu lớp

b)

Tăng độ chính xác của mô hình

c)

Các đặc trưng có giá trị lớn sẽ chi phối khoảng cách tính toán

d)

Kết quả phân loại luôn là ngẫu nhiên

16.

Học tăng cường (Reinforcement Learning) là gì? Chọn một đáp án.

a)

Một kỹ thuật học mà agent học bằng cách tương tác với môi trường để tối ưu hóa phần thưởng nhận được

b)

Một kỹ thuật học máy giám sát

c)

Một kỹ thuật học máy không giám sát

d)

Một kỹ thuật dựa trên cụm dữ liệu

17.

Các loại thuật toán trong Machine Learning là gì? Chọn một đáp án.

a)

Học có giám sát, học không giám sát, học tăng cường

b)

Học tuyến tính, học phi tuyến tính, học tăng cường

c)

Học tuần tự, học song song, học tăng cường

d)

Học gián tiếp, học trực tiếp, học không giám sát

18.

Mục tiêu chính của hồi quy tuyến tính là gì? Chọn một đáp án.

a)

Tính xác suất của một sự kiện xảy ra

b)

Phân loại dữ liệu đầu vào thành các nhóm khác nhau

c)

Tính khoảng cách giữa các điểm dữ liệu

d)

Tối thiểu hóa tổng sai số và tìm hàm dự đoán tuyến tính tốt nhất

19.

Ưu điểm nổi bật của K-means Clustering là gì? Chọn một đáp án.

a)

Không yêu cầu biết trước số cụm

b)

Luôn tìm ra phân cụm tối ưu

c)

Hiệu suất cao và dễ mở rộng

d)

Không cần dữ liệu huấn luyện

20.

K-means clustering là một thuật toán học kiểu gì? Chọn một đáp án.

a)

Tăng cường

b)

Có giám sát

c)

Học sâu

d)

Không giám sát

21.

Điểm khác biệt cơ bản giữa KNN và K-means là gì?

a)

KNN là thuật toán học không giám sát, còn K-means là học giám sát

b)

KNN dùng để phân cụm, còn K-means để phân loại

c)

Cả hai đều không cần nhãn và hoạt động dựa trên khoảng cách

d)

KNN cần nhãn dữ liệu để phân loại, còn K-means không cần nhãn để phân cụm

22.

Thuật toán "học có giám sát" sử dụng những gì để huấn luyện?

a)

Dữ liệu âm thanh

b)

Dữ liệu không gán nhãn

c)

Dữ liệu hình ảnh

d)

Dữ liệu có gán nhãn

23.

Học giám sát cần gì để hoạt động?

a)

Không có dữ liệu

b)

Dữ liệu phi cấu trúc

c)

Dữ liệu có nhãn

d)

Mạng LAN

24.

Thuật ngữ "Regression" trong học giám sát thường được áp dụng cho loại vấn đề nào?

a)

Dự đoán giá trị liên tục

b)

Phân loại

c)

Phân cụm

d)

Phân tích cảm xúc

25.

K-means Clustering là phương pháp phân cụm dựa trên:

a)

Khoảng cách Euclid

b)

Tích phân đạo hàm

c)

Phân tích chuỗi thời gian

d)

Hồi quy phi tuyến

26.

Tâm cụm mới của cụm có 4 điểm dữ liệu: (2,4,6), (4,2,8), (6,6,4), (8,8,10) là:

a)

(10,10,14)

b)

(5,7,5)

c)

(5,5,7)

d)

(5,5,6)

27.

Điều kiện dừng của thuật toán K-means là khi nào?

a)

Khi số cụm tăng dần

b)

Khi tâm cụm không thay đổi nữa

c)

Khi không còn điểm dữ liệu

d)

Khi số vòng lặp nhỏ hơn 1

28.

Trong mô hình hồi quy tuyến tính đơn biến ( y=ax+b+ey=ax + b + e ), hệ số góc a cho biết điều gì?

a)

Mức độ ảnh hưởng của biến độc lập x đến biến phụ thuộc y

b)

0

c)

Độ chính xác của mô hình hồi quy

d)

Mức độ dao động ngẫu nhiên của dữ liệu

e)

Giá trị trung bình của y khi x=0

29.

DỮ LIỆU (DATA) LÀ GÌ TRONG HỌC MÁY?

a)

Cấu trúc mạng nơ-ron dùng để học sâu.

b)

Kết quả dự đoán từ mô hình.

c)

Tập hợp các thông tin, con số, hoặc quan sát được thu thập để phân tích và xử lý

d)

Các thuật toán dùng để huấn luyện mô hình.

30.

Thuật toán hồi quy tuyến tính đơn giản (Simple Linear Regression) sử dụng bao nhiêu biến độc lập?

a)

Hai biến phụ thuộc

b)

Không có biến độc lập

c)

Một biến độc lập

d)

Ba biến đầu ra

31.

Tiêu chí nào thường được sử dụng để phân chia node trong cây quyết định?

a)

Gradient Descent

b)

Information Gain và Entropy

c)

R-squared

d)

MSE (Mean Squared Error)

32.

Trong phương trình tuyến tính đơn giản y=ax+by = ax + b , nếu a<0a<0 thì mối quan hệ đó là gì?

a)

Quan hệ tuyến tính thuận

b)

Không có quan hệ tuyến tính

c)

Không có mối quan hệ

d)

Quan hệ tuyến tính nghịch

33.

Hàm kích hoạt (activation function) có vai trò gì trong mạng nơ-ron?

a)

Phân loại dữ liệu đầu vào

b)

Giúp mạng học được mối quan hệ phi tuyến giữa đầu vào và đầu ra

c)

Tăng tốc độ tính toán

d)

Lưu trữ dữ liệu đầu vào

34.

Trong CNN, max-pooling có chức năng gì?

a)

Huấn luyện trong số

b)

Kết nối toàn bộ các nơ-ron

c)

Tăng độ phân giải của ảnh

d)

Giảm kích thước đầu ra bằng cách lấy giá trị lớn nhất

35.

HỌC KHÔNG GIÁM SÁT (UNSUPERVISED LEARNING) PHÙ HỢP VỚI BÀI TOÁN NÀO?

a)

Dự đoán giá trị liên tục

b)

Dự đoán xác suất xảy ra sự kiện

c)

Phân cụm dữ liệu không có nhãn

d)

Phân loại dữ liệu có nhãn

36.

"Học không giám sát" khác với "học có giám sát" ở điểm nào?

a)

Không cần dữ liệu gán nhãn

b)

Yêu cầu sự can thiệp của con người

c)

Chỉ sử dụng dữ liệu số

d)

Không sử dụng dữ liệu

37.

Mạng nơ-ron nhân tạo thường được huấn luyện bằng cách nào?

a)

Phân cụm dữ liệu

b)

Lan truyền ngược (Backpropagation)

c)

Học không giám sát

d)

Tăng cường ngẫu nhiên

38.

Logistic Regression tối ưu hàm mất mát nào?

a)

Euclidean Distance

b)

Mean Squared Error

c)

Cross Entropy Loss (Log Loss)

d)

Hinge Loss

39.

Thuật ngữ "K-means clustering" áp dụng cho loại vấn đề nào trong học máy?

a)

Phân loại

b)

Giảm số chiều dữ liệu

c)

Tóm tắt dữ liệu

d)

Phân cụm

40.

Học không giám sát (Unsupervised Learning) thường được sử dụng cho:

a)

Phân cụm dữ liệu

b)

Phân loại hình ảnh

c)

Nhận diện giọng nói

d)

Dự đoán giá cổ phiếu

41.

Mô hình hồi quy tuyến tính dùng để?

a)

Chia cụm

b)

Phân loại nhãn

c)

Dự đoán giá trị liên tục

d)

Tìm kiếm văn bản

42.

Thuật toán học có giám sát thường được áp dụng để làm gì?

a)

Dự đoán kết quả dựa trên dữ liệu trước

b)

Phân cụm dữ liệu

c)

Xóa dữ liệu cũ

d)

Tạo dữ liệu ngẫu nhiên

43.

Trong KNN (K-nearest neighbors - Láng giềng gần), vai trò của tham số k là gì?

a)

Số lớp đầu ra của mô hình

b)

Số điểm dữ liệu gần nhất được dùng để dự đoán

c)

Số vòng huấn luyện trước khi mô hình hội tụ

d)

Số nhãn có thể phân loại

44.

Mô hình K-Nearest Neighbors (KNN) dựa trên nguyên lý gì?

a)

Tính xác suất

b)

Cây quyết định

c)

Tìm điểm dữ liệu gần nhất dựa trên khoảng cách

d)

Truyền thông tin qua mạng nơ-ron

45.

Giá trị của Information Gain càng cao thì:

a)

Cây càng nhỏ

b)

Việc phân chia dữ liệu càng hiệu quả

c)

Thuộc tính càng ít quan trọng

d)

Entropy tăng sau khi chia

46.

Trong quá trình học của DNN, bước "lan truyền ngược" dùng để làm gì?

a)

Tăng số lượng lớp ẩn

b)

Đưa dữ liệu đầu vào vào mạng

c)

Tính toán lời giải cuối ra dự đoán và đầu ra thực

d)

Cập nhật trọng số để giảm lỗi

47.

Thuật toán học trong AI chủ yếu được sử dụng để làm gì?

a)

Phân tích và học hỏi từ dữ liệu

b)

Lưu trữ dữ liệu

c)

Thiết kế giao diện người dùng

d)

Tăng tốc độ xử lý dữ liệu

48.

Hồi quy logistic thường được áp dụng trong bài toán:

a)

Dự đoán giá cổ phiếu trong tương lai

b)

Phân loại bệnh nhân có bị ung thư hay không (có/không)

c)

Phân nhóm khách hàng dựa trên hành vi

d)

Tính toán khoảng cách giữa các điểm dữ liệu

49.

Trong thuật toán KNN, khoảng cách giữa các điểm được dùng để:

a)

Đánh giá sai số

b)

Chọn tham số K

c)

Vẽ đồ thị

d)

Tìm điểm gần nhất với điểm cần dự đoán

50.

Loại thuật toán Machine Learning nào sử dụng các cặp dữ liệu (data, label) đã biết để dự đoán đầu ra cho dữ liệu mới?

a)

Unsupervised Learning (Học không giám sát)

b)

Supervised Learning (Học có giám sát)

c)

Deep Learning (Học sâu)

d)

Unsupervised Learning (Học không giám sát)

51.

Trong hồi quy logistic, hàm sigmoid được sử dụng để:

a)

Tăng tốc độ huấn luyện mô hình

b)

Tính sai số giữa giá trị dự đoán và thực tế

c)

Chuyển đầu ra của mô hình thành xác suất trong khoảng từ 0 đến 1

d)

Giảm số chiều của dữ liệu

52.

Học tăng cường (Reinforcement Learning) có đặc điểm gì?

a)

Học từ phần thưởng và phạt

b)

Không cần dữ liệu

c)

Chỉ học từ hình ảnh

d)

Chỉ học từ văn bản

53.

Học giám sát (Supervised Learning) là gì?

a)

Mô hình không cần huấn luyện

b)

Mô hình chỉ dùng để phân tích dữ liệu cũ

c)

Mô hình học từ dữ liệu không có nhãn

d)

Mô hình học từ dữ liệu có nhãn

54.

Chỉ số Entropy bằng 0 nghĩa là gì?

a)

Node thuần nhất (Chỉ có 1 lớp duy nhất)

b)

Dữ liệu có sự phân bố đồng đều

c)

Dữ liệu bị thiếu

d)

Không có dữ liệu

55.

Mục đích chính của bài toán Regression (Hồi quy) trong Supervised Learning là gì?

a)

Tìm ra cấu trúc ẩn trong dữ liệu không nhãn

b)

Dự đoán một giá trị rời rạc

c)

Dự đoán một giá trị liên tục (Continuous Value)

d)

Phân chia dữ liệu thành các lớp

56.

Hàm mất mát thường dùng trong hồi quy logistic là:

a)

Cross-Entropy

b)

Hinge Loss

c)

Mean Squared Error

d)

Mean Absolute Error

57.

Giá trị đầu ra của hàm sigmoid trong Logistic Regression nằm trong khoảng nào?

a)

(,)(-\infty, \infty)

b)

[0,1][0, 1]

c)

[1,1][-1, 1]

d)

[0,)[0, \infty)

58.

Trong mạng nơ-ron, trọng số (weight) thể hiện điều gì?

a)

Mức độ ảnh hưởng giữa các neuron

b)

Số lớp ẩn trong mạng

c)

Tốc độ học của mô hình

d)

Kích thước của mạng

59.

Trong mô hình KNN, nếu chọn giá trị k quá nhỏ (ví dụ k=1k=1 ), điều gì có thể xảy ra?

a)

Mô hình bị underfitting

b)

Mô hình không thể học

c)

Mô hình bị overfitting và nhạy cảm với nhiễu

d)

Mô hình hội tụ nhanh hơn

60.

Khi nào thì thuật toán K-means sẽ dừng lại?

a)

Khi các centers được chọn ban đầu thay đổi nhỏ

b)

Khi số vòng lặp đạt đến một ngưỡng nhất định

c)

Khi việc gán dữ liệu vào từng cluster không thay đổi so với vòng lặp trước

d)

Khi hàm mất mát (loss function) đạt giá trị 0

61.

Thuật toán hồi quy tuyến tính (Linear Regression) được sử dụng để làm gì?

a)

Tạo ra các hình ảnh mới

b)

Phân loại dữ liệu thành các lớp rời rạc

c)

Tìm các cụm dữ liệu

d)

Dự đoán một giá trị liên tục dựa trên các biến đầu vào

62.

Thuật toán cây quyết định (Decision Tree) là

a)

Học không giám sát

b)

Học có giám sát

c)

Không thuộc AI

d)

Thuật toán học có giám sát

63.

Trong học máy, thuật toán nào sau đây thường được sử dụng cho bài toán phân loại?

a)

Linear Regression

b)

K-Means

c)

K-Nearest Neighbors (KNN)

d)

PCA

64.

Tốc độ hội tụ của Gradient Descent phụ thuộc chủ yếu vào yếu tố nào?

a)

Learning rate

b)

Số lượng đặc trưng

c)

Số lượng epoch

d)

Kích thước tập dữ liệu

65.

Thuật toán nào sau đây thuộc nhóm học máy không giám sát (Unsupervised Learning)?

a)

Linear Regression

b)

Naive Bayes

c)

Support Vector Machine (SVM)

d)

K-Means