wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Trắc nghiệm Máy học ứng dụng

Total questions: 130

Worksheet time: 1hrs 7mins

Name
Class
Date
1.

Cho cây quyết định như hình, NHỮNG phát biểu nào sau đây là phát biểu SAI:

(1) Thuộc tính của tập dữ liệu: size, brand, sport, engine

(2) Thuộc tính của tập dữ liệu: large, mid, small, yes, no

(3) Thuộc tính của tập dữ liệu: size, brand, sport, engine, yes, no

(4) Thuộc tính của tập dữ liệu: F12, V10, V8, Volvo, BMW, SUV

a)

(1)

b)

(2)

c)

(3)

d)

(4)

2.

Cho tập dữ liệu như hình, người ta cần huấn luyện mô hình để khi có một phần tử mới có các thông tin sau: “X1=35”, “X2=32”, “X3=1” thì người ta có thể dự đoán được giá trị “Y” của nó, ta cần lựa chọn giải thuật nào sau đây để thực hiện yêu cầu trên?

a)

KNN

b)

Hồi quy tuyến tính

c)

Bayes thơ ngây

d)

Cây quyết định

3.

Cho tập dữ liệu chứa các thông tin về khách hàng của một ngân hàng: tuổi, nghề nghiệp, số lượng thẻ tín dụng, thu nhập hàng tháng. Ngân hàng cần tìm ra các nhóm khách hàng khác nhau để có những gói dịch vụ phù hợp cho các nhóm đối tượng này. Chúng ta càn sử dụng giải thuật học gì để giúp các nhà quản lý của ngân hàng này?

a)

Giải thuật học không có giám sát, giải thuật phân lớp

b)

Giải thuật học không có giám sát, giải thuật gom nhóm/gom cụm

c)

Giải thuật học có giám sát, giải thuật hồi quy

d)

Giải thuật học có giám sát, giải thuật phân lớp

4.

Cho “perceptron” như hình, phát biểu nào sau đây là phát biểu ĐÚNG?

a)

Đây là perceptron tuyến tính có ngưỡng với hàm kích hoạt là một hàm ngưỡng [0,1]

b)

Các giá trị 0.3, 0.25 và 0.7 là giá trị trọng số tương ứng của các thuộc tính, hàm truyền là một hàm ngưỡng [0,1]

c)

Đây là perceptron tuyến tính có ngưỡng với hàm truyền là một hàm ngưỡng [0,1]

d)

Các giá trị 0.3, 0.25 và 0.7 là giá trị các thuộc tính, hàm kích hoạt là một hàm ngưỡng [0,1]

5.

Giả sử tập dữ liệu có 1.000 mẫu tin (là các tin nhắn) trong đó có 10 tin nhắn rác và 990 tin nhắn bình thường. Có hai mô hình phân lớp M1 và M2 cho kết quả tương ứng như hình. Hãy cho biết mô hình nào thích hợp để xử lý tập dữ liệu trên? Giải thích lý do tại sao?

a)

Mô hình M1 vì chỉ số F1 của mô hình M1 nhỏ hơn chỉ số F1 của mô hình M2

b)

Mô hình M2 vì chỉ số F1 của mô hình M2 lớn hơn chỉ số F1 của mô hình M1

c)

Mô hình M1 vì chỉ số F1 của mô hình M1 lớn hơn chỉ số F1 của mô hình M2

d)

Mô hình M2 vì chỉ số F1 của mô hình M2 nhỏ hơn chỉ số F1 của mô hình M1

6.

Các phát biểu nào sau đây là phát biểu đúng?

a)

Giải thuật KNN không có quá trình học nên khi phân loại có tốc độ nhanh hơn các giải thuật khác

b)

Giải thuật KNN không có quá trình học nên khi phân loại có tốc độ chậm hơn các giải thuật khác

c)

Giải thuật KNN giải quyết cho bài toán phân loại và bài toán gom nhóm

7.

Xét một mô hình nhận dạng hoa hồng và hoa cúc. Tập dữ liệu gồm có 1000 hoa hồng và 950 hoa cúc, được chia thành 2 phần là tập huấn luyện và tập kiểm thử với tỷ lệ 70/30. Sau khi huấn luyện, độ chính xác của mô hình đạt được 30% trên tập huấn luyện và 20% trên tập kiểm tra. Mô hình này như thế nào?

a)

Underfitting

b)

Overfitting

c)

Good Fitting

8.

Cho tập dữ liệu như hình (dữ liệu không bao gồm cột STT), người ta cần chia dữ liệu này thành 2 nhóm, anh chị cần lựa chọn giải thuật nào sau đây để thực hiện yêu cầu trên?

a)

Cây quyết định

b)

KNN

c)

Kmeans

d)

Bayes thơ ngây

9.

Phát biểu nào sau đây đúng cho "Boosting technique"?

a)

Giúp giảm lỗi Variance

b)

Xây dựng các mô hình độc lập nhau

c)

Tập trung cải tiến lỗi sinh ra từ mô hình trước

10.

Phát biểu nào sau đây đúng cho "Bagging technique"?

a)

Tập trung cải tiến lỗi sinh ra từ mô hình trước

b)

Bagging có thể thực hiện song song

c)

Giúp giảm lỗi Bias

d)

Giúp giảm lỗi Variance

11.

Cho tập dữ liệu gồm 5 phần tử với 3 thuộc tính BMI, huyết áp, Glucose và nhãn tương ứng như hình. Sử dụng giải thuật KNN với để dự đoán cho phần tử mới tới, chúng ta cần tính khoảng cách của phần tử mới tới đến tất cả các phần tử của tập dữ liệu. Hãy cho biết khoảng cách từ phần tử mới tới đến phần tử thứ 3 (tô màu cam) là bao nhiêu nếu sử dụng khoảng cách Manhattan.

a)

65

b)

53.75

c)

2889

d)

70.21

12.

Cho thông tin như sau: tuổi, tình trạng mang thai, chỉ số Glucose, huyết áp, chỉ số BMI, tình trạng bệnh tiểu đường (có/không). Ta nên sử dụng giải thuật học gì để dự báo bệnh nhân có bị bệnh tiểu đường hay không?

a)

Giải thuật học có giám sát, giải thuật phân lớp

b)

Giải thuật học không có giám sát, giải thuật phân lớp

c)

Giải thuật học không có giám sát, giải thuật gom nhóm, gom cụm

d)

Giải thuật học có giám sát, giải thuật hồi quy

13.

Chúng ta xem xét một mô hình phân loại có khả năng nhận dạng ảnh hoa hồng và hoa cúc. Tập kiểm tra gồm có 100 ảnh hoa hồng và 75 ảnh hoa cúc. Đối với 100 ảnh hoa hồng, mô hình nhận dạng đúng 80 ảnh. Đối với ảnh hoa cúc, mô hình nhận dạng đúng 60 ảnh. Hãy cho biết độ chính xác tổng thể (accuracy) của mô hình này?

a)

(80+60) / (100+75)

b)

80/100

c)

(80/100) + (60/75)

d)

60/75

14.

Cho hai nhận định sau về overfitting:

(1) Xảy ra khi sai số dự đoán của mô hình trên tập huấn luyện cao, nhưng trên tập kiểm thử thì thấp

(2) Xảy ra khi sai số dự đoán của mô hình trên cả tập huấn luyện và tập kiểm thử đều thấp.

Chọn đáp án đúng.

a)

(1) đúng

b)

(1) sai

c)

(1), (2) đúng

d)

(1), (2) sai

15.

Cho tập dữ liệu như hình gồm 6 phần tử với 2 thuộc tính màu tóc, độ bóng mượt và nhãn là tình trạng tóc. Hãy tính độ hỗn loạn thông tin sau khi phân hoạch cho thuộc tính “độ bóng mượt" với điểm phân hoạch là 54.

a)

0.528

b)

0.389

c)

1

d)

0.918

16.

Đặc trưng trong máy học là gì?

a)

Hàm mục tiêu

b)

Thuộc tính có giá trị quyết định đối với mục tiêu

c)

Dữ liệu đầu vào

d)

Phương pháp đánh giá mô hình

17.

Xét một mô hình phân loại có khả năng nhận dạng ảnh con chó và con mèo. Tập kiểm tra gồm có 120 ảnh con chó và 100 ảnh con mèo. Trong 120 ảnh con chó, mô hình nhận dạng đúng 90 ảnh. Đối với ảnh con mèo, phần mềm nhận dạng nhầm 30 ảnh mèo thành chó. Hãy tính precision của mô hình này?

a)

(90) / (90+30)

b)

(90) / (90+120)

c)

(90) / (100+30)

d)

(100)/(120+30)

18.
a)

P(đạt/A) = (0.0086/ P(A));

P (không đạt/A) = (0.0018/ P(A)):

nhãn Không Đạt

b)

P(đạt/A) = (0.0043/ P(A));

P (không đạt/A) = (0.00088/ P(A)):

nhãn Đạt

c)

P(đạt/A) = (0.0086/ P(A));

P (không đạt/A) = (0.0018/ P(A)):

nhãn Đạt

d)

P(đạt/A) = (0.0043/ P(A));

P (không đạt/A) = (0.00088/ P(A)):

nhãn Không Đạt

19.

Cho tập dữ liệu gồm 10 phần tử. Mỗi phần tử gồm có 2 biến độc lập X1, X2​ và 1 biến phụ thuộc Y. Tập dữ liệu này được chia thành 2 phần, tập huấn luyện và tập kiểm thử. Sau khi huấn luyện, ta tìm được giá trị θ0=0.3; θ1=0.46; θ2=0.32. Giả sử tập kiểm thử có giá trị như sau, hãy tính chỉ số MAE (Mean Absolute Error).

a)

6

b)

5.7

c)

6.2

d)

5.4

20.

Cho cây quyết định như hình và các phát biểu sau:

(1) Nhãn của tập dữ liệu: size, brand, sport, engine

(2) Nhãn của tập dữ liệu: size, brand, sport, engine, yes, no

(3) Nhãn của tập dữ liệu: F12, V10, V8, Volvo, BMW, SUV

(4) Nhãn của tập dữ liệu: yes, no

Hãy cho biết số phát biểu đúng.

a)

1

b)

2

c)

3

d)

4

21.

Trích xuất đặc trưng thường được thực hiện ở đâu trong quy trình xây dựng mô hình máy học?

a)

Trước và sau quá trình xử lý dữ liệu

b)

Khi thực hiện huấn luyện

c)

Trong quá trình lựa chọn mô hình

d)

Trước quá trình xử lý dữ liệu

22.

Cho các phát biểu sau về averaging technique:

(1) Được dùng cho bài toán phân lớp

(2) Được dùng cho bài toán hồi quy

Chọn nhận định đúng về các phát biểu trên.

a)

(1) đúng

b)

(2) đúng

c)

(1), (2) đúng

d)

(1), (2) sai

23.

Phương pháp tập hợp mô hình (Ensemble Methods) là kết hợp nhiều mô hình cơ sở dựa trên tập học nhằm cải thiện độ chính xác của giải thuật dự đoán. Tăng hiệu quả của mô hình dựa trên cơ sở giảm lỗi bias, variance. Lỗi bias được hiểu như thế nào?

a)

Lỗi Bias là lỗi liên quan đến mô hình (bộ phân lớp/ dự đoán) mà không liên quan đến dữ liệu được dùng để huấn luyện

b)

Lỗi Bias là lỗi do tính biến thiên của mô hình so với tính ngẫu nhiên của các mẫu dữ liệu học (data samples).

c)
Lỗi Bias là lỗi phát sinh từ việc sử dụng quá nhiều mô hình trong tập hợp
d)

Lỗi Bias là lỗi liên quan đến việc lựa chọn dữ liệu để huấn luyện mô hình

24.

Để đánh giá hiệu quả của mô hình hồi quy tuyến tính, người ta có thể dùng những chỉ số nào sau

đây?

a)

Precision

b)

MAE

c)

Accuracy

d)

RMSE

e)

Recall

25.

Cho tập dữ liệu như hình gồm 6 phần tử với 2 thuộc tính màu sắc, trọng lượng và nhãn là chuẩn xuất khẩu. Hãy xác định chỉ số Gini của thuộc tính “màu sắc"

a)

0.25

b)

0.5

c)

1

d)

0.75

26.

Để đánh giá hiệu quả của bài toán phân lớp với số lượng lớp lớn hơn 2, ta sử dụng chỉ số nào sau

đây?

a)

Recall

b)

F1

c)

Accuracy

d)

Precision

27.

Xét một mô hình nhận dạng hoa hồng và hoa cúc. Tập dữ liệu gồm có 1000 hoa hồng và 950 hoa cúc, được chia thành 2 phần là tập huấn luyện và tập kiểm thử với tỷ lệ 70/30. Sau khi huấn luyện, độ chính xác của mô hình đạt được 95% trên tập huấn luyện và 20% trên tập kiểm tra. Mô hình này như thế nào?

a)

Good Fitting

b)

Overfitting

c)

Underfitting

28.

Để đánh giá mô hình dự báo mật số rầy nâu gây hại trên lúa (được xây dựng bằng giải thuật hồi quy), bạn sẽ sử dụng tiêu chí nào sau đây?

a)

Precision

b)

F1

c)

Recall

d)

MSE

29.

Xem xét một nghiên cứu với tập dữ liệu có 9360 dòng. Mỗi dòng là một ngày và mỗi dòng có 6 giá trị là nhiệt độ (tmax, tmin), bức xạ mặt trời (solar radiation), hướng gió (wind-dir), tốc độ gió (wind-speed) và lượng mưa (rainfall). Tất cả các tham số này đều có giá trị thực. Ta được giao nhiệm vụ xây dựng mô hình dự báo lượng mưa (rainfall) với đơn vị đo mm từ 5 thuộc tính còn lại. Bài toán trên thuộc dạng nào sau đây?

a)

Bài toán gom cụm

b)

Thỏa mãn ràng buộc

c)

Bài toán phân lớp

d)

Bài toán hồi quy

30.

Mô hình được gọi là underfitting khi:

a)

Sai số dự đoán của mô hình trên tập huấn luyện cao, nhưng trên tập kiểm thử thì thấp

b)

Sai số dự đoán của mô hình trên cả tập huấn luyện và tập kiểm thử đều thấp

c)

Sai số dự đoán của mô hình trên tập huấn luyện thấp, nhưng trên tập kiểm thử thì cao

d)

Sai số dự đoán của mô hình trên cả tập huấn luyện và tập kiểm thử đều cao

31.

Để đánh giá hiệu quả của mô hình hồi quy tuyến tính, người ta dùng chỉ số nào sau đây?

a)

Recall

b)

F1

c)

Accuracy

d)

MSE

32.

Giải thuật cây quyết định được xây dựng Top-down, bắt đầu nút gốc, tất cả các dữ liệu học ở nút gốc. Nếu dữ liệu tại 1 nút có cùng lớp -> nút lá (nhãn của nút chính là nhãn của các phần tử thuộc nút lá); Nếu dữ liệu ở nút chứa các phần tử có lớp rất khác nhau (không thuần nhất) thì phân hoạch dữ liệu một cách đệ quy bằng “việc chọn 1 thuộc tính để thực hiện phân hoạch tốt nhất có thể” => kết quả thu được cây nhỏ nhất. Việc chọn 1 thuộc tính để thực hiện phân hoạch tốt nhất có thể trong định nghĩa trên được hiểu như thế nào là đúng?

a)

Chọn thuộc tính có độ lợi thông tin nhỏ nhất và chỉ số gini lớn nhất

b)

Chọn thuộc tính có độ lợi thông tin nhỏ nhất

c)

Chọn thuộc tính có chỉ số gini lớn nhất

d)

Chọn thuộc tính có độ lợi thông tin lớn nhất hoặc chỉ số gini nhỏ nhất

33.

Cho bảng dữ liệu gồm 6 phần tử với các thông tin X1, X2, X3. Người ta đã tính khoảng cách từ phần tử mới tới là Hưng với các thuộc tính <X1=30, X2=50, X3=2> đến 6 phần tử có trong tập dữ liệu như cột “Khoảng cách". Hãy cho biết nhãn của Hưng là gì khi K=3, tại sao?

a)

Nhãn là “Không” vì Hưng gần với Mai, Dũng và Nam

b)

Nhãn là “Không" vì Hưng gần với Tuấn

c)

Nhãn là “Có” vì Hưng gần với Lan, Ngọc nhất

d)

Nhãn là “Có” vì Hưng gần với Lan, Ngọc và Tuấn

34.

Cho tập dữ liệu chứa các thông tin về rượu vang như sau: độ Ph, độ cồn, lượng đường, axit cố định, axit bay hơi, thời gian xuất xưởng (theo đơn vị giờ). Chúng ta cần sử dụng giải thuật học gì để giúp dự đoán thời gian xuất xưởng của rượu khi biết thông tin độ Ph, độ cồn, lượng đường, axit cố định, axit bay hơi của loại rượu đó?

a)

gom cụm

b)

tìm kiếm thoả mãn ràng buộc

c)

hồi quy

d)

phân lớp

35.

Để xây dựng mô hình dự báo dịch rầy nâu gây hại trên lúa, các nhà nghiên cứu của một trường đại học đã thu thập dữ liệu tại địa bàn Trung An, Quận Thốt Nốt, Thành Phố Cần Thơ. Tập dữ liệu thu được là kết quả điều tra tại 840 địa điểm (phần tử), với 24 thuộc tính khác nhau. Sau khi tiền xử lý, loại bỏ các thuộc tính không dùng trong dự báo như: số thứ tự, mã ruộng, các thuộc tính có dữ liệu nhiễu và số liệu điều tra sai lệch cũng được bỏ qua như: ngày điều tra, ngày sạ, tuổi lúa. Các nhà nghiên cứu đã thu được 12 thuộc tính, trong đó có 11 thuộc tính dự báo dùng để xây dựng mô hình dự báo mật số rầy (thuộc tính phụ thuộc, có giá trị từ 0 đến 12900). Các thuộc tính dự báo như hình. Hãy chọn những chỉ số sau đây để đánh giá mô hình dự báo mật số rầy nâu từ 11 thuộc tính này.

a)

MAE

b)

RMSE

c)

F1

d)

Accuracy

e)

Recall

36.

Trong một cuộc bầu cử, N người bầu cử đang bỏ phiếu cho một trong hai ứng cử viên. Những người bỏ phiếu không giao tiếp với nhau trong khi bỏ phiếu. Cho các phương pháp tập hợp mô hình sau đây:

(1) Bagging (2) Boosting. Chọn nhận định đúng.

a)

(1) đúng

b)

(2) đúng

c)

(1), (2) đúng

d)

(1), (2) sai

37.

Cho tập dữ liệu như hình gồm 5 phần tử với 3 thuộc tính thời gian sử dụng dịch vụ, số tiền sử dụng, số lượng dịch vụ. Sử dụng giải thuật KNN để dự đoán cho phần tử mới tới, chúng ta cần tính khoảng cách của phần tử mới tới đến tất cả các phần tử của tập dữ liệu. Tính khoảng cách từ phần tử mới có giá trị thời gian sử dụng dịch vụ=7, số tiền sử dụng=4, số lượng dịch vụ=2 đến phần tử thứ 5 (tô màu cam) là bao nhiêu nếu sử dụng khoảng cách Manhattan.

a)

2

b)

1.4

c)

2.4

d)

26

38.

Cho tập dữ liệu gồm 15 phần tử. Mỗi phần tử bao gồm 2 biến độc lập X1, X2 và 1 biến phụ thuộc Y. Tập dữ liệu này được chia thành hai phần: tập huấn luyện và tập kiểm thử. Sau khi huấn luyện, ta thu được các giá trị: θ0=0.3, θ1=0.66, θ2=0.72. Giả sử tập kiểm thử có các giá trị như hình, hãy tính chỉ số MAE (Mean Absolute Error).

a)

0.44

b)

0.25

c)

0.5

d)

0.24

e)

0.2

39.

Đại học ABC, từ năm 1976 đến nay, đã sưu tập và lưu giữ hầu hết các giống lúa mùa cổ truyền của vùng Đồng bằng sông Cửu Long (ĐBSCL), với số lượng hơn 1.900 mẫu. Mỗi giống lúa trong ngân hàng thông tin được mô tả bởi 69 đặc điểm hình thái và đặc tính nông sinh học, bao gồm: góc lá đòng, độ cứng cây, chiều cao cây, thời gian sinh trưởng, số bông hữu hiệu/khóm, số hạt chắc, lép/bông, khối lượng nghìn hạt, năng suất lý thuyết (các đặc điểm này được đánh giá theo thang điểm của International Rice Research Institute). Chúng ta cần xây dựng các công cụ tin học giúp các nhà nghiên cứu phát hiện ra các mẫu lúa thuộc cùng một nhóm. Giải thuật máy học nào sau đây phù hợp cho bài toán này?

a)

Giải thuật học có giám sát – Giải thuật hồi quy (Regression)

b)

Giải thuật học không có giám sát – Giải thuật gom nhóm, gom cụm (Clustering)

c)

Giải thuật học có giám sát – Giải thuật phân lớp (Classification)

d)

Giải thuật học không có giám sát – Giải thuật hồi quy (Regression)

40.

Phát biểu nào sau đây là đúng trong việc chọn lựa các mô hình trong phương pháp tập hợp mô hình?

(1) Các mô hình có thể sử dụng cùng một giải thuật với các tham số khác nhau.

(2) Các mô hình có thể được xây dựng từ các giải thuật khác nhau

(3) Các mô hình có thể được xây dựng trên những tập dữ liệu huấn luyện khác nhau.

a)

(1)

b)

(2)

c)

(3)

41.

Người ta sử dụng 4 giải thuật hồi quy khác nhau để xây dựng mô hình dự báo. Để đánh giá hiệu quả của giải thuật, người ta đo chỉ số MAE (Mean absolute error) và có kết quả như hình.

Với các giá trị MAE như trên, giải thuật nào là phù hợp nhất cho bài toán này?

a)

1

b)

2

c)

3

d)

4

42.

Cho tập dữ liệu như hình. Hãy tính khoảng cách giữa Nam đối với 4 bạn nữ Mai, Lan, Cúc, Trúc và cho biết Nam có khoảng cách "gần" với bạn nữ nào nhất?

a)

Mai

b)

Lan

c)

Cúc

d)

Trúc

43.

Cho tập dữ liệu như bảng bên dưới gồm 6 phần tử với 2 thuộc tính màu tóc, độ bóng mượt và nhãn là tình trạng tóc. Hãy xác định chỉ số Gini của thuộc tính “màu tóc".

a)

0.25

b)

0.5

c)

0.75

d)

0.44

44.

Cho tập dữ liệu như bảng 1 gồm 7 phần tử, mỗi phần tử có 2 thuộc tính (Bao gồm tiền điện, kích thước phòng) và cột nhãn/lớp là cột “giá thuê phòng”. Với mô hình Bayes thơ ngây được xây dựng sẵn như bảng 2, hãy cho biết giá trị u của bảng “bao gồm tiền điện" ở cột [Không, Cao] là bao nhiêu?

a)

0.33

b)

0.25

c)

0.67

d)

0.5

45.

Để đánh giá hiệu quả của bài toán phân lớp nhị phân với số lượng lớp quan tâm có tỉ lệ rất ít so với phân lớp còn lại, ta không sử dụng chỉ số nào sau đây?

a)

Precision

b)

Recall

c)

Accuracy

d)

F1

46.

Phát biểu nào sau đây về Naive Bayes là không đúng?

a)

Các thuộc tính có thể là chữ hoặc số

b)

Các thuộc tính đều quan trọng như nhau

c)

Các thuộc tính phụ thuộc thống kê lẫn nhau với giá trị của lớp

d)

Các thuộc tính độc lập về mặt thống kê với nhau theo giá trị của lớp

47.

Cho 03 câu A, B, C như hình:

Hãy sử dụng Bag of Word để tính vector của A.

Biết từ điển gồm: [are, comes, data, language, learning, natural, processing, science, under, we]

a)

1,0,1,0,1,0,0,1,0,1

b)

1,0,1,0,1,1,1,0,0,1

c)

1,0,0,1,1,1,1,0,0,1

d)

0,1,1,1,0,1,1,1,1,0

48.

Dựa vào thông tin tuổi, giới tính, nồng độ cholesterol, nhịp tim, điện tâm đồ người ta cần dự báo mức độ bệnh của bệnh nhân với các cấp độ sau: bình thường, nhẹ, nặng và nghiêm trọng, hãy cho biết giải thuật nào nên được sử dụng để dự báo mức độ bệnh của bệnh nhân?

a)

Giải thuật học không có giám sát, giải thuật phân lớp

b)

Giải thuật học có giám sát, giải thuật hồi quy

c)

Giải thuật học có giám sát, giải thuật phân lớp

d)

Giải thuật học không có giám sát, giải thuật gom nhóm, gom cụm

49.

Cho cây quyết định như hình và các phát biểu sau:

(1) Nhãn của tập dữ liệu: có lịch thi, tình trạng tài chính, tình trạng Covid

(2) Nhãn của tập dữ liệu: mua sắm, ở nhà, đi thi

(3) Nhãn của tập dữ liệu: mua sắm, ở nhà, đi thi, đúng, sai, tốt, xấu, nhiễm (F0), Khoẻ

(4) Nhãn của tập dữ liệu: đúng, sai, tốt, xấu, nhiễm (F0), Khoẻ

Hãy chỉ ra các phát biểu sai.

a)

(1)

b)

(2)

c)

(3)

d)

(4)

50.

Cho dữ liệu như hình. Người ta thực hiện gom nhóm dữ liệu trên thành 2 nhóm bằng giải thuật Kmeans, với các thông tin sau:

• Các tâm khởi động ngẫu nhiên : c1 (6, 3, 5) ; c2 (5, 2, 1)

• Khoảng cách sử dụng: khoảng cách Manhattan

Hãy cho biết khoảng cách từ phần tử thứ 3 (Tô màu) đến tâm C1 và C2 là bao nhiêu và xác định nhóm của phần tử thứ 3 này là nhóm 1 hay nhóm 2?

a)

Khoảng cách đến tâm C1= 4.15, đến tâm C2=4.36; thuộc nhóm 1

b)

Khoảng cách đến tâm C1= 6.5, đến tâm C2=3.5; thuộc nhóm 1

c)

Khoảng cách đến tâm C1= 4.15, đến tâm C2=4.36; thuộc nhóm 2

d)

Khoảng cách đến tâm C1= 6.5, đến tâm C2=3.5; thuộc nhóm 2

51.

Phát biểu nào sau đây là phát biểu đúng khi nói về giải thuật KNN?

a)

Giải thuật KNN không có quá trình học nên khi phân loại có tốc độ nhanh hơn các giải thuật khác

b)

Giải thuật KNN giải quyết cho bài toán phân loại và bài toán gom nhóm

c)

Giải thuật KNN không có quá trình học nên khi phân loại có tốc độ chậm hơn các giải thuật khác

d)

Giải thuật KNN luôn cho kết quả chính xác hơn so với các mô hình học máy có giám sát khác

52.

Cho tập dữ liệu như hình. Sử dụng giải thuật KNN với K=5, anh chị hãy dự đoán cân nặng của anh Nguyễn Văn A có chiều cao 1.71 m?

a)

64.65

b)

63.11

c)

61.29

d)

68.1

e)

66.28

53.

Cho dữ liệu như bảng 1 (dữ liệu không bao gồm cột STT) Người ta thực hiện gom nhóm dữ liệu trên thành 2 nhóm bằng giải thuật Kmeans, với các thông tin sau:

• Các tâm khởi động ngẫu nhiên: c1(6, 3, 5); c2(4.5, 2, 1.5)

• Khoảng cách sử dụng: khoảng cách Manhattan

Người ta đã tính được khoảng cách tới các tâm như bảng 2, hãy cho biết tâm C1 của bước tiếp theo có giá trị là bao nhiêu?

(a)  

54.

Cho một tập dữ liệu chứa các thông tin sau về rượu vang: Độ Ph, độ cồn, lượng đường, axit cố định, axit bay hơi, thời gian xuất xưởng. Người ta cần xác định thời gian xuất xưởng của từng loại rượu theo đơn vị giờ. Cho biết các thuộc tính của tập dữ liệu này là gì?

a)

thời gian xuất xưởng của rượu

b)

độ Ph, độ cồn, hàm lượng đường, axit cố định, axit bay hơi của rượu

c)

độ Ph, độ cồn, hàm lượng đường, thời gian xuất xưởng của rượu

d)

độ Ph, độ cồn, hàm lượng đường, axit cố định, axit bay hơi của rượu, thời gian xuất xưởng của rượu

55.

Phát biểu nào sau đây là đúng đối với giải thuật K láng giềng gần (KNN)?

a)

Nên chọn giá trị K lẻ để việc phân lớp được hiệu quả điểm

b)

Thời gian thực hiện giải thuật KNN nhanh hơn các giải thuật khác do không cần xây dựng mô hình

c)

Độ chính xác của việc phân lớp hiệu quả hơn khi chọn giá trị K nhỏ

d)

Giải thuật KNN không phù hợp cho bài toán hồi quy

56.

Công ty viễn thông ABC dự định phát triển API phát hiện các tin nhắn rác. Công ty đã tiến hành thu thập 10.000 mẫu dữ liệu, bao gồm 3.000 tin nhắn rác và 7.000 tin nhắn bình thường. Chúng ta cần sử dụng giải thuật máy học gì để giúp công ty ABC xây dựng mô hình dự đoán tin nhắn rác?

a)

Giải thuật học có giám sát, giải thuật hồi quy

b)

Giải thuật học không có giám sát, giải thuật gom nhóm, gom cụm

c)

Tìm kiếm đối kháng

d)

Giải thuật học có giám sát, giải thuật phân lớp

57.

Giải thuật nào có thể sử dụng cho cả bài toán hồi quy và bài toán phân lớp?

a)

Rừng ngẫu nhiên

b)

Hồi quy tuyến tính

c)

Kmeans

d)

Bayes thơ ngây

58.

Tại bước huấn luyện mô hình của giải thuật Bayes thơ ngây người ta cần làm gì?

a)

Tính xác suất xuất hiện của các thuộc tính theo từng giá trị nhãn

b)

Tính xác suất xuất hiện của các thuộc tính theo từng giá trị nhẫn và xác suất xuất hiện của từng nhãn

c)

Tính xác suất xuất hiện của nhãn

d)

Tất cả đều sai

59.

Hãy tính giá trị F1, Accuracy của kết quả đánh giá mô hình như hình.

a)

Accuracy = 90%, F1 = 20%

b)

Accuracy = 99.9%, F1= 9.8%

c)

Accuracy = 90%, F1=9.8%

d)

Accuracy = 99.9%, F1=20%

60.

Giả sử tập dữ liệu có 30000 mẫu tin trong đó có 15 mẫu tin thuộc lớp dương (+1), có hai mô hình phân lớp M1 và M2 cho kết quả tương ứng trong bảng 1, 2 như hình. Anh/chị hãy cho biết mô hình nào thích hợp để xử lý tập dữ liệu trên? Hãy giải thích lý do cho lựa chọn đó.

a)

Chọn mô hình M2 vì recall của M2 > M1

b)

Chọn mô hình M2 vì accuracy của M2 > M1

c)

Chọn mô hình M1 vì F1 của M1 > M2

d)

Chọn mô hình M1 vì precision của M1 > M2

61.

Cho ma trận confusion sau, anh chị hãy cho biết độ chính xác của rượu loại 3.

a)

85%

b)

88%

c)

90%

d)

92%

62.

Cho tập dữ liệu như hình. Giả sử sau n bước lặp, ta tìm được giá trị θ0 = 0.3; θ1 = 0.46; θ2 = 0.32, hãy cho biết giá trị dự báo giá trị Y nếu biết X1 = 5, X2 = 12

a)

6.44

b)

17

c)

6.14

d)

7.02

e)

7.42

63.

Sơ đồ như hình mô tả cho phương pháp nào?

a)

Học tăng cường

b)

Học bán giám sát

c)

Học không có giám sát

d)

Học có giám sát

64.

Cho cây quyết định như hình. Hãy xác định nhãn cho trường hợp sau: Weather = Rainy, Parents = Yes.

a)

Play-tennis

b)

Cinema

c)

Stay-in

65.

Cho tập dữ liệu như bảng 1 gồm 7 phần tử, mỗi phần tử có 2 thuộc tính (Bao gồm tiền điện, kích thước phòng) và cột nhân/lớp là cột "giá thuê phòng" . Với mô hình Bayes thơ ngây được xây dựng sẵn như bảng 2, hãy cho biết giá trị x của bảng "kích thước phòng" ở ô [Phương sai, Thấp] là bao nhiêu?

a)

0.25

b)

0.5

c)

1

d)

0.71

e)

2

66.

Nhược điểm chính của KNN là gì?

a)

Quá phức tạp

b)

Cần lưu tất cả dữ liệu huấn luyện

c)

Không cần tham số

d)

Thiếu chính xác

67.

Dữ liệu đầu vào của KNN được biểu diễn bởi?

a)

Ma trận đặc trưng

b)

Đồ thị

c)

Cây nhị phân

d)

Cây quyết định

68.

Khi dữ liệu có nhiều thuộc tính, cần sử dụng phương pháp nào để cải thiện KNN?

a)

Chuẩn hóa dữ liệu

b)

Loại bỏ thuộc tính không quan trọng

c)

Loại bỏ thuộc tính quan trọng

d)

Thay đổi dữ liệu đầu vào

69.

KNN yêu cầu điều gì để hoạt động chính xác?

a)

Một tập huấn luyện chất lượng cao

b)

Một tập kiểm tra lớn

c)

Một tập kiểm tra chất lượng cao

d)

Một tập huấn luyện lớn

70.

Dữ liệu gồm các thuộc tính: Màu tóc (Đỏ, Đen), Chiều cao (Cao, Thấp). Điểm mới xuất hiện là Màu tóc: Đen, Chiều cao: Cao. Khoảng cách theo kiểu rời rạc giữa điểm mới và điểm có thuộc tính: Màu tóc: Đỏ, Chiều cao: Cao là bao nhiêu?

a)

0.5

b)

0.3

c)

0.7

d)

1

71.

Khi sử dụng KNN để phân loại khách hàng với các thuộc tính Thu nhập và Tuổi, tại sao cần chuẩn hóa thuộc tính này trước khi tính khoảng cách?

a)

Để tránh thuộc tính có giá trị lớn chi phối

b)

Để tăng tốc độ tính toán

c)

Để giảm nhiễu

d)

Để loại bỏ thuộc tính không cần thiết

72.

Trong một bài toán KNN, phần tử mới được phân loại nhờ vào nhãn của các láng giềng gần nhất. Điều gì sẽ xảy ra nếu hai láng giềng có nhãn khác nhau?

a)

Chọn nhãn có khoảng cách xa nhất

b)

Chọn nhãn phổ biến nhất

c)

Chọn nhãn đầu tiên

d)

Chọn nhãn ngẫu nhiên

73.

Khi áp dụng KNN trên dữ liệu lớn, yếu tố nào dưới đây có thể giúp tăng hiệu quả tính toán?

a)

Sử dụng cấu trúc dữ liệu như KD-Tree hoặc Ball-Tree

b)

Tăng giá trị k vô hạn

c)

Sử dụng khoảng cách Manhattan thay vì Euclid

d)

Giảm kích thước tập huấn luyện

74.

Giả sử bạn có các thuộc tính E1, E2,..., En và nhãn H. Công thức của định lý Bayes là gì?

a)

𝑃(𝐻𝐸)=𝑃(𝐸𝐻)×𝑃(𝐻)𝑃(𝐻∣𝐸)=𝑃(𝐸∣𝐻)\times𝑃(𝐻)

b)

𝑃(𝐻𝐸)=𝑃(𝐸𝐻)×𝑃(𝐻)𝑃(𝐸)𝑃(𝐻∣𝐸)=\frac{𝑃(𝐸∣𝐻)\times𝑃(𝐻)}{𝑃(𝐸)}

c)

𝑃(𝐻𝐸)=𝑃(HE)×𝑃(𝐻)𝑃(𝐸)𝑃(𝐻∣𝐸)=\frac{𝑃(H∣E)\times𝑃(𝐻)}{𝑃(𝐸)}

d)

𝑃(𝐻𝐸)=𝑃(𝐸)×𝑃(𝐻)𝑃(𝐻∣𝐸)=𝑃(𝐸)\times𝑃(𝐻)

75.

Ưu điểm chính của giải thuật Bayes thơ ngây là gì?

a)

Độ chính xác cao mặc dù giả định không thực tế

b)

Không cần dữ liệu huấn luyện

c)

Phân loại nhanh hơn các thuật toán khác

d)

Yêu cầu dữ liệu lớn

76.

Giải thuật Bayes thơ ngây dựa trên giả định gì về các thuộc tính?

a)

Các thuộc tính độc lập thống kê

b)

Các thuộc tính phụ thuộc lẫn nhau

c)

Các thuộc tính không có ý nghĩa

d)

Các thuộc tính bị bỏ qua

77.

Bước đầu tiên trong giải thuật Bayes thơ ngây là gì?

a)

Huấn luyện mô hình

b)

Dự đoán dữ liệu mới

c)

Loại bỏ nhiễu

d)

Chuẩn hóa dữ liệu

78.

Khi sử dụng ước lượng Laplace, điều gì được thực hiện để tránh xác suất bằng 0?

a)

Cộng thêm một giá trị dương μip vào tử số và mẫu số giá trị μ

b)

Cộng thêm một giá trị dương μip vào tử số và mẫu số giá trị p

c)

Cộng thêm một giá trị dương p vào tử số và mẫu số giá trị μip

d)

Cộng thêm một giá trị dương μ vào tử số và mẫu số giá trị μip

79.

Khi sử dụng Bayes thơ ngây, trường hợp nào thường cho kết quả không chính xác?

a)

Các thuộc tính phụ thuộc lẫn nhau

b)

Các thuộc tính độc lập thống kê

c)

Dữ liệu nhiễu

d)

Dữ liệu chưa được chuẩn hóa

80.

Cho các phát biểu sau:

(1) MAE là chỉ số được sử dụng nhiều nhất vì khả năng giải thích trực tiếp của nó.

(2) RMSE tương tự như MAE nhưng chú trọng tới những giá trị có độ lệch lớn.

(3) MAE, MSE, RMSE càng cao thì hiệu quả của hệ thống càng cao.

(4) MAE, MSE, RMSE là các chỉ số đánh giá cho bài toán hồi quy.

Số phát biểu đúng là:

a)

1

b)

2

c)

3

d)

4

81.

Khi cần phân loại dữ liệu liên tục trong Bayes thơ ngây, ta sử dụng phân phối nào?

a)

Phân phối chuẩn

b)

Phân phối nhị phân

c)

Phân phối đồng đều

d)

Phân phối mật độ hạt nhân

82.

Dữ liệu nào sau đây phù hợp với mô hình Bernoulli Bayes thơ ngây?

a)

Dữ liệu phân phối Gauss

b)

Dữ liệu nhị phân

c)

Dữ liệu liên tục

d)

Dữ liệu văn bản

83.

Làm thế nào để cải thiện hiệu quả của Bayes thơ ngây khi thuộc tính không độc lập?

a)

Sử dụng mạng Bayes

b)

Loại bỏ các thuộc tính không liên quan

c)

Sử dụng phân phối chuẩn

d)

Loại bỏ các thuộc tính không độc lập

84.

Nếu dữ liệu không cân bằng, cần tập trung vào chỉ số nào để đánh giá?

a)

Độ chính xác tổng thể

b)

Độ chính xác lớp nhỏ

c)

Độ chính xác lớp lớn

d)

Tỷ lệ tập dữ liệu

85.

Giá trị entropy bằng 0 thể hiện điều gì?

a)

Dữ liệu hoàn toàn hỗn loạn

b)

Dữ liệu hoàn toàn thuần nhất

c)

Dữ liệu chưa được phân hoạch

d)

Dữ liệu không khả dụng

86.

Quá trình phân loại dữ liệu mới trong cây quyết định bắt đầu từ đâu?

a)

Nút lá đầu tiên

b)

Nút con đầu tiên

c)

Thuộc tính đầu tiên

d)

Nút gốc

87.

Quá trình xây dựng cây quyết định bắt đầu từ đâu?

a)

Dữ liệu thuần nhất

b)

Dữ liệu không thuần nhất

c)

Dữ liệu có nhiều thuộc tính nhất

d)

Dữ liệu có ít thuộc tính nhất

88.

Chỉ số Gini được sử dụng để đánh giá điều gì?

a)

Độ hỗn loạn thông tin

b)

Mức độ không thuần nhất

c)

Mức độ thuần nhất

d)

Độ ổn định thông tin

89.

Nếu thuộc tính có giá trị Gini thấp nhất, điều này có ý nghĩa gì?

a)

Thuộc tính này tốt nhất để phân hoạch

b)

Thuộc tính này có giá trị thông tin thấp nhất

c)

Thuộc tính này không liên quan đến dữ liệu nhất

d)

Thuộc tính này cần bị loại bỏ nhất

90.

Chỉ số Gini nào được sử dụng để đo lường mức độ thuần nhất của một tập dữ liệu sau khi phân hoạch?

a)

Gini của tập mẹ

b)

Gini split

c)

Entropy của tập con

d)

Giá trị trung bình của các nhánh

91.

Phương pháp nào được sử dụng để giảm hiện tượng học vẹt (overfitting) trong cây quyết định?

a)

Tăng độ lợi thông tin

b)

Cắt nhánh

c)

Gắn nhánh

d)

Tăng kích thước cây quyết định

92.

Phương pháp nào được sử dụng để ước lượng các tham số trong hồi quy tuyến tính?

a)

KNN

b)

LMS

c)

Random sampling

d)

Gradient boosting

93.

Hàm hồi quy tuyến tính đơn biến có dạng gì?

a)
  • h(x)=θ01x

b)
  • h(x)=θ1x

c)
  • h(x)=x2

d)
  • h(x)=θ0x+θ1x2

94.

Khái niệm "sai số dự đoán" trong hồi quy biểu thị điều gì?

a)

Hiệu giữa giá trị thực và giá trị dự đoán

b)

Hiệu giữa giá trị lớn nhất và nhỏ nhất

c)

Giá trị trung bình của giá trị thực và giá trị dự đoán

d)

Giá trị trung bình của giá trị lớn nhất và nhỏ nhất

95.

Kỹ thuật nào giúp giảm sai số trong hồi quy tuyến tính?

a)

Tăng tốc độ học

b)

Giảm số lượng dữ liệu huấn luyện

c)

Dùng giá trị khởi tạo lớn

d)

Giảm dữ liệu nhiễu

96.

Phương pháp "batch gradient descent" khác biệt với "stochastic gradient descent" ở điểm nào?

a)

Batch gradient descent cập nhật tham số dựa trên toàn bộ dữ liệu

b)

Batch gradient descent chỉ cập nhật tham số cho một phần tử

c)

Stochastic gradient descent sử dụng dữ liệu lớn

d)

Cả hai đều cập nhật tham số cho toàn bộ dữ liệu

97.

Trong bài toán hồi quy, hàm lỗi nào nhấn mạnh vào sai số lớn hơn?

a)

MAE

b)

MSE

c)

RMS

d)

RMSE

98.

Trong phương pháp giảm gradient, "tốc độ học" (learning rate) biểu thị điều gì?

a)

Giá trị lớn nhất mà mô hình học được

b)

Mức độ thay đổi của tham số 𝜃 trong mỗi lần lặp

c)

Giá trị nhỏ nhất của dữ liệu

d)

Mức độ ảnh hưởng của dữ liệu nhiễu

99.

Hàm lỗi RMS khác biệt với MAE ở điểm nào?

a)

RMS bình phương sai số trước khi tính trung bình

b)

RMS sử dụng giá trị lớn nhất của dữ liệu

c)

RMS chỉ áp dụng với dữ liệu rời rạc

d)

RMS chỉ áp dụng cho hồi quy đa biến

100.

Khi nào nên áp dụng hồi quy tuyến tính đơn biến?

a)

Khi dữ liệu có một thuộc tính đầu vào

b)

Khi dữ liệu có nhiều thuộc tính đầu vào

c)

Khi dữ liệu không có giá trị liên tục

d)

Khi dữ liệu cần được phân loại

101.

Phương pháp giảm gradient tối ưu hóa tham số mô hình như thế nào?

a)

Tăng giá trị của hàm chi phí

b)

Giảm giá trị của hàm chi phí

c)

Tăng số lượng thuộc tính

d)

Giảm số lượng thuộc tính

102.

Khi áp dụng giảm gradient, điều gì sẽ xảy ra nếu tốc độ học 𝛼 quá lớn?

a)

Mô hình hội tụ nhanh hơn

b)

Mô hình có thể không hội tụ

c)

Mô hình hội tụ chậm hơn

d)

Mô hình chắc chắn sẽ hội tụ

103.

Tại sao phương pháp hồi quy tuyến tính đơn giản được sử dụng phổ biến?

a)

Nó không yêu cầu dữ liệu huấn luyện

b)

Nó hiệu quả và dễ hiểu

c)

Nó phù hợp với mọi loại dữ liệu

d)

Nó loại bỏ hoàn toàn sai số dự đoán

104.

Ý nghĩa của giá trị ngưỡng θ trong mạng nơ-ron là gì?

a)

Độ lệch giữa đầu vào và đầu ra

b)

Độ phức tạp của dữ liệu

c)

Độ nghiêng của đường thẳng

d)

Giá trị trung bình của các trọng số

105.

Trong mô hình perceptron, đầu vào giả X₀ có giá trị bằng bao nhiêu?

a)

giá trị trung bình

b)

-1

c)

0

d)

1

106.

Trong mô hình perceptron tuyến tính, điều kiện hội tụ xảy ra khi nào?

a)

Khi giá trị lỗi nhỏ hơn ngưỡng dung sai

b)

Khi tất cả giá trị trọng số đều bằng 0

c)

Khi giá trị lỗi lớn hơn tất cả các trọng số

d)

Khi giá trị đầu vào được chuẩn hóa

107.

Đầu vào của mô hình perceptron tuyến tính không ngưỡng có giá trị như thế nào?

a)

0

b)

1

c)

-1

d)

giá trị trọng số

108.

Chọn phát biểu SAI về thuật toán gom cụm k-means?

a)

Việc khởi tạo trung tâm cụm sẽ làm ảnh hưởng đến thuật toán

b)

Đây là bài toán không giám sát

c)

Kết quả gom cụm phụ thuộc vào hàm khoảng cách

d)

Phương pháp Elbow luôn xác định chính xác số cụm k tối ưu.

109.

Chọn phát biểu SAI về các thuật toán học máy dựa trên mạng Nơ-ron nhân tạo?

a)

các thuật toán thường đi tìm nghiệm tối ưu bằng phương pháp Gradient Descent

b)

các thuật toán học sâu cũng là thuật toán học dựa trên mạng Nơron nhân tạo

c)

thường được áp dụng để xây dựng các ứng dụng như phát hiện đối tượng trong ảnh, dịch máy

d)

không thể biểu diễn bài toán linear regression bằng mạng Nơron nhân tạo

110.

Thuật toán nào sau đây phù hợp nhất với yêu cầu: “Hãy dự đoán tỉ giá ngoại tệ (là một số thực) dựa vào các dữ liệu về kinh tế vĩ mô được thu thập trong quá khứ”?

a)

KNN

b)

Kmeans

c)

Hồi quy tuyến tính

d)

Cây quyết định

111.

Sự khác biệt cơ bản giữa học có giám sát (supervised) và không giám sát (unsupervised) là gì?

a)

học có giám sát yêu cầu dữ liệu được dán nhãn, trong khi học không giám sát thì không

b)

học có giám sát sử dụng thuật toán gom cụm, học không giám sát sử dụng thuật toán phân loại

c)

học có giám sát được sử dụng thuật toán hồi quy, học không giám sát sử dụng thuật toán gom cụm

d)

không có sự khác biệt giữa học có giám sát và không giám sát

112.

Phát biểu nào sau đây là ĐÚNG chính xác nhất về khái niệm học máy?

a)

việc lập trình máy tính để tối ưu hóa một tiêu chí hiệu suất dựa trên các dữ liệu mẫu hoặc kinh nghiệm trong quá khứ

b)

việc lập trình máy tính để hiện thực hóa một tiêu chí hiệu suất dựa trên các dữ liệu mẫu hoặc kinh nghiệm trong quá khứ

c)

việc lập trình để triển khai hệ thống máy tính dựa trên các dữ liệu mẫu hoặc kinh nghiệm trong quá khứ

d)

việc lập trình để tối ưu hóa hoạt động của hệ thống máy tính dựa trên các dữ liệu mẫu hoặc kinh nghiệm trong quá khứ

113.

Thuật toán học máy nào sau đây không thuộc nhóm học có giám sát?

a)

KNN

b)

Kmeans

c)

Hồi quy

d)

Cây quyết định

114.

Thuật toán phân loại nào sau đây áp dụng cho hai lớp được gán nhãn -1 và +1?

a)

KNN

b)

Naive Bayes

c)

Perceptron

d)

Cây quyết định

115.

Phát biểu nào sau đây KHÔNG ĐÚNG đối với thuật toán Kmeans?

a)

biết nhãn của từng điểm dữ liệu

b)

cụm là tập hợp các điểm dữ liệu có vector đặc trưng gần nhau

c)

khoảng cách Euclid được sử dụng phổ biến nhất để xác định khoảng cách giữa các vector đặc trưng với tâm của mỗi cụm

d)

có thể áp dụng cho dữ liệu có nhãn

116.

Cho tập dữ liệu như hình. Hãy tìm ra nhận định SAI.

a)

Phần tử X mới đến (0.22, 4, 3) sẽ được gán nhãn +1

b)

Phần tử Y mới đến (0.5, 3, 4) sẽ được gán nhãn +1

c)

Phần tử Z mới đến (0.84, 2, 6) sẽ được gán nhãn -1

d)

Phần tử W mới đến (0.1, 4, 2) sẽ được gán nhãn -1

117.

Cho tập dữ liệu như hình. Sau khi lần lượt sử dụng công thức tính khoảng cách Manhattan, Euclid và giải thuật k láng giềng với k=1 để dự đoán cho phần tử mới đến X (370, 550, 0.75), ta được hai kết quả gán nhãn a và b. Hãy tìm ra nhận định ĐÚNG.

a)

a=Yes, b=No

b)

a=No, b=Yes

c)

a=Yes, b=Yes

d)

a=No, b=No

118.

Phương pháp matching được áp dụng khi kiểu dữ liệu là:

a)

số

b)

nhị phân

c)

liên tục

d)

rời rạc

119.

Cho tập dữ liệu như hình, mỗi điểm thuộc một trong hai lớp 1 (Yes) hoặc 0 (No). Hãy dự đoán nhãn cho điểm mới X=(3,4).

(a)  

120.

(21) Cho tập dữ liệu như hình 1 gồm 14 phần tử, mỗi phần tử có 4 thuộc tính (Id, Animals, Size, BodyColor) và cột nhãn/lớp là cột "Can we pet them?". Với mô hình Bayes thơ ngây được xây dựng sẵn như bảng 2, hãy cho biết giá trị b của bảng Animals ô [Cow, No] là bao nhiêu?

a)

2/14

b)

2/5

c)

2/6

d)

2/11

121.

Cho tập dữ liệu gồm 5 phần tử A, B, C, D, E với ma trận khoảng cách Manhattan như hình. Theo phương pháp Agnes (bottom-up), đầu tiên, 5 cụm dữ liệu được khởi tạo với mỗi cụm chứa 1 phần tử đơn. Hãy cho biết bước tiếp theo hai cụm dữ liệu nào được chọn để tạo thành cụm dữ liệu mới?

a)

{C}, {E}

b)

{A, D}, {C}

c)

{A, D}, {C, E}

d)

{A, D}, {E}

e)

{A}, {D}

122.

Cho tập dữ liệu gồm 4 điểm:

A = (1, 2) thuộc lớp dương

B = (3, 1) thuộc lớp dương

C = (0, 0) thuộc lớp âm

D = (2, -1) thuộc lớp âm

Tìm phương trình siêu phẳng từ 4 điểm dữ liệu trên.

Cho X=(2, 3) sẽ thuộc lớp nào (Dương/Âm)? Biết rằng: chọn điểm chênh b là A (1, 2) để tính toán

a)

không tính được

b)

dương

c)

âm

d)

không xác định

123.

Soft Margin SVM là gì?

a)

SVM sử dụng các đường biên cứng để phân loại

b)

SVM không cho phép bất kì ngoại lệ nào

c)

SVM cho phép một số điểm dữ liệu vi phạm margin

d)

Một kĩ thuật để giảm kích thước dữ liệu

124.

Dựa trên tập dữ liệu về tuổi và cân nặng (kg) của gần 1000 trẻ em, người ta xây dựng được mô hình dự đoán cân nặng của trẻ dựa trên tuổi. Mô hình thu được là một phương trình hồi quy như hình. Căn cứ theo phương trình hồi quy thu được, chúng ta có thể kết luận khi em bé tăng lên 1 tuổi thì cân nặng sẽ thay đổi như thế nào?

a)

Khi em bé tăng lên 1 tuổi thì cân nặng sẽ tăng 2,37 kg

b)

Không thể kết luận được điều gì

c)

Khi em bé tăng lên 1 tuổi thì cân nặng sẽ tăng 0,777 kg

d)

Khi em bé tăng lên 1 tuổi thì cân nặng sẽ tăng 1,96 kg

125.

Trong các định nghĩa nào sau đây là phát biểu sai:

a)

Giải thuật hồi quy (regression) là xây dựng mô hình dự đoán dựa trên dữ liệu tập học đã có nhãn (lớp) là giá trị liên tục

b)

Học có giám sát là thuật toán học tạo ra một hàm ánh xạ dữ liệu đầu vào tới kết quả đích mong muốn (nhãn, lớp, giá trị cần dự báo). Trong học có giám sát, tập dữ liệu dùng để huấn luyện phải được gán nhãn, lớp hay giá trị cần dự báo

c)

Giải thuật phân lớp (classification) là xây dựng mô hình phân loại dựa trên dữ liệu tập học đã có nhãn (lớp) là kiểu liệt kê

d)

Giải thuật hồi quy (regression) là xây dựng mô hình phân loại dựa trên dữ liệu tập học có thuộc tính là giá trị liên tục

126.

Trong SVM, C thường được sử dụng để điều chỉnh gì?

a)

Kích thước của không gian đặc trưng

b)

Độ phức tạp của mô hình

c)

Sự linh hoạt của đường ranh giới

d)

Độ chính xác của mô hình

127.

Cho tập dữ liệu như hình, mỗi điểm dữ liệu đại diện cho một loài hoa với hai đặc trưng là chiều dài cánh hoa và chiều rộng cánh hoa. Sử dụng KNN với k=1 để dự đoán loài hoa của điểm dữ liệu mới có chiều dài cánh hoa là 6.0 và chiều rộng cánh hoa là 3.0 (Sử dụng phép đo Euclide). Loài hoa (điểm dữ liệu) gần nhất với điểm dữ liệu mới là:

a)

Iris setosa 1

b)

Iris setosa 2

c)

Iris setosa 3

d)

Iris Versicolor 1

128.

Hãy cho biết hình ảnh minh họa cho giải thuật nào trong quá trình gom nhóm tập dữ liệu {a, b, c, d, e}?

a)

Gom cụm phân cấp từ dưới lên

b)

Gom cụm phân cấp từ trên xuống

c)

KNN

d)

Kmeans

e)

K-fold

129.

Kernel trong SVM được sử dụng để làm gì?

a)

Phân loại dữ liệu không tuyến tính

b)

Tránh overfitting

c)

Tăng tốc độ tính toán

d)

Giảm kích thước dữ liệu

130.

Cho bảng tính sẵn xác suất cho nhẫn "PP1" và "PP2" của thuộc tính "tình trạng bệnh" như bảng bên dưới, giá trị xác suất nào bên dưới là không chính xác nếu sử dụng ước lượng Laplace để tránh tình trạng tạo ra giá trị 0 ở ô [mức 1, PP1]?

a)

Mức 1 = (1/3+0)/(4+1)

Mức 2 = (1/3+2)/(4+1)

Mức 3= (1/3+2)/(4+1)

b)

Mức 1 = (1/5+0)/(4+1) Mức 2 = (2/5+2)/(4+1)

Mức 3 = (2/5+2)/(4+1)

c)

Mức 1 = (1/6+0)/(4+1)

Mức 2 = (2/6+2)/(4+1)

Mức 3 = (3/6+2)/(4+1)

d)

Mức 1 = (1/8+0)/(4+1)

Mức 2 = (2/8+2)/(4+1)

Mức 3 = (3/8+2)/(4+1)