wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Untitled Quiz

Total questions: 101

Worksheet time: 51mins

Name
Class
Date
1.

Khoa học dữ liệu là gì?

a)

Một lĩnh vực nghiên cứu về con người

b)

Một lĩnh vực sử dụng toán học, thống kê để phân tích dữ liệu

c)

Một cách để thu thập dữ liệu từ internet

d)

Một phương pháp lưu trữ dữ liệu

2.

Big Data có những đặc điểm nào sau đây?

a)

Variety, Velocity, Volume, Variability

b)

Small, Medium, Large, Extra Large

c)

Structured, Semi-Structured, Unstructured

d)

Fast, Slow, Real-time, Batch

3.

Dữ liệu có thể thuộc các dạng nào?

a)

Hình ảnh, âm thanh, văn bản

b)

Số nguyên, số thực, Boolean

c)

Dữ liệu có cấu trúc, bán cấu trúc, không có cấu trúc

d)

Tất cả các phương án trên

4.

Mục tiêu chính của Trí tuệ Nhân tạo (AI) là gì?

a)

Mô phỏng hành vi của con người

b)

Thay thế hoàn toàn con người

c)

Tự động hóa các nhiệm vụ đơn giản

d)

Phát triển phần mềm

5.

Các ứng dụng của AI trong đời sống bao gồm?

a)

Nhận diện khuôn mặt

b)

Xe tự lái

c)

Gợi ý sản phẩm trực tuyến

d)

Tất cả các phương án trên

6.

Loại học máy nào dựa trên dữ liệu có nhãn?

a)

Học có giám sát (Supervised Learning)

b)

Học không giám sát (Unsupervised Learning)

c)

Học tăng cường (Reinforcement Learning)

d)

Không có phương án nào đúng

7.

Học không giám sát (Unsupervised Learning) thường được sử dụng trong?

a)

Phân cụm dữ liệu (Clustering)

b)

Dự đoán giá chứng khoán

c)

Phát hiện gian lận

d)

Phát hiện lỗi trong phần mềm

8.

Dữ liệu lớn có thể được lưu trữ trong các hệ thống nào sau đây?

a)

Database, Data warehouse

b)

CSV, XML, JSON

c)

Video, Audio, Image

d)

Tất cả các phương án trên

9.

Công việc nào không thuộc về một Data Scientist?

a)

Phân tích dữ liệu

b)

Thiết kế trang web

c)

Xây dựng mô hình máy học

d)

Dự báo xu hướng thị trường

10.

Bước nào KHÔNG thuộc quy trình xử lý dữ liệu?

a)

Thu thập dữ liệu

b)

Chuẩn bị dữ liệu

c)

Phát minh ra dữ liệu

d)

Triển khai mô hình

11.

Thuật ngữ nào mô tả việc trích xuất thông tin từ tập dữ liệu lớn?

a)

Data Mining

b)

Data Cleaning

c)

Data Storing

d)

Data Viewing

12.

Học sâu (Deep Learning) là một phần của?

a)

Học máy

b)

AI

c)

Khoa học dữ liệu

d)

Tất cả các phương án trên

13.

Mô hình Machine Learning nào thường được sử dụng cho bài toán phân loại?

a)

Hồi quy tuyến tính (Linear Regression)

b)

Hồi quy logistic (Logistic Regression)

c)

K-means Clustering

d)

Apriori Algorithm

14.

Lĩnh vực nào không liên quan trực tiếp đến khoa học dữ liệu?

a)

Thống kê

b)

Khoa học máy tính

c)

Marketing

d)

Nông nghiệp

15.

Trong một hệ thống AI, dữ liệu đầu vào thường được biểu diễn dưới dạng gì?

a)

Hình ảnh

b)

Chuỗi ký tự

c)

Dữ liệu số

d)

Tất cả các phương án trên

16.

Thống kê mô tả bao gồm các phương pháp nào?

a)

Trung bình, trung vị, phương sai

b)

Hồi quy tuyến tính

c)

Phân tích tương quan

d)

Thu thập dữ liệu

17.

Giá trị trung bình (Mean) có nhược điểm gì?

a)

Không bị ảnh hưởng bởi ngoại lệ

b)

Dễ bị ảnh hưởng bởi giá trị ngoại lệ

c)

Không phản ánh phân phối dữ liệu

d)

Luôn lớn hơn trung vị

18.

Giá trị trung vị (Median) là gì?

a)

Giá trị phổ biến nhất trong tập dữ liệu

b)

Giá trị nằm giữa tập dữ liệu đã sắp xếp

c)

Trung bình cộng của tập dữ liệu

d)

Tổng các giá trị chia cho số lượng phần tử

19.

Trong phân tích dữ liệu, phương sai (Variance) đo lường điều gì?

a)

Mức độ tập trung của dữ liệu quanh giá trị trung bình

b)

Giá trị phổ biến nhất

c)

Tổng của các giá trị trong tập dữ liệu

d)

Khoảng cách lớn nhất giữa hai giá trị trong tập dữ liệu

20.

Độ lệch chuẩn (Standard Deviation) là gì?

a)

Bình phương của phương sai

b)

Căn bậc hai của phương sai

c)

Tổng của các giá trị trong tập dữ liệu

d)

Giá trị phổ biến nhất trong tập dữ liệu

21.

Trong phân tích dữ liệu, phân vị (Percentile) dùng để?

a)

Phân chia dữ liệu thành phần bằng nhau

b)

Tính giá trị trung bình

c)

Dự đoán xu hướng dữ liệu

d)

Tăng tốc độ tính toán

22.

Tứ phân vị thứ hai (Q2) trong tập dữ liệu chính là?

a)

Trung vị

b)

Trung bình

c)

Giá trị nhỏ nhất

d)

Giá trị lớn nhất

23.

Mối quan hệ giữa hai biến số trong tập dữ liệu có thể đo lường bằng?

a)

Độ tương quan (Correlation)

b)

Phương sai

c)

Trung bình

d)

Độ lệch chuẩn

24.

Một mẫu dữ liệu có thể được sử dụng để?

a)

Thay thế toàn bộ quần thể

b)

Đưa ra kết luận về quần thể

c)

Dự đoán chính xác 100%

d)

Chỉ áp dụng cho nghiên cứu nhỏ

25.

Ma trận hiệp phương sai (Covariance Matrix) giúp xác định điều gì?

a)

Mối quan hệ giữa nhiều biến số

b)

Giá trị trung bình của tập dữ liệu

c)

Điểm trung vị

d)

Độ lệch chuẩn

26.

Hệ số tương quan (Correlation Coefficient) có giá trị nằm trong khoảng?

a)

0 đến 1

b)

-1 đến 1

c)

-∞ đến ∞

d)

0 đến ∞

27.

Mối quan hệ nhân quả có thể được suy ra từ?

a)

Phân tích tương quan

b)

Phân tích hồi quy

c)

Phân tích phương sai

d)

Không có phương án nào chính xác

28.

Phương pháp nào không phải là một phần của thống kê mô tả?

a)

Trung vị

b)

Phương sai

c)

Hồi quy tuyến tính

d)

Khoảng giá trị (Range)

29.

Một tập dữ liệu có độ lệch chuẩn cao thì?

a)

Các giá trị phân bố xa trung bình

b)

Các giá trị tập trung gần trung bình

c)

Dữ liệu ít biến động

d)

Dữ liệu không có giá trị ngoại lệ

30.

Phương pháp tốt nhất để xử lý giá trị ngoại lệ trong dữ liệu là?

a)

Loại bỏ ngay lập tức

b)

Kiểm tra và xem xét nguyên nhân

c)

Sử dụng luôn mà không cần kiểm tra

d)

Thêm nhiều dữ liệu hơn

31.

Machine Learning là gì?

a)

Một nhánh của Trí tuệ Nhân tạo giúp máy học từ dữ liệu

b)

Một phương pháp lập trình truyền thống

c)

Một kỹ thuật nén dữ liệu

d)

Một loại cơ sở dữ liệu mới

32.

Học máy có mấy loại chính?

a)

2

b)

3

c)

4

d)

5

33.

Học có giám sát (Supervised Learning) sử dụng loại dữ liệu nào?

a)

Dữ liệu không có nhãn

b)

Dữ liệu có nhãn

c)

Dữ liệu ngẫu nhiên

d)

Cả A và B

34.

Học không giám sát (Unsupervised Learning) chủ yếu được dùng để làm gì?

a)

Phân loại dữ liệu

b)

Phân cụm dữ liệu

c)

Dự đoán giá trị liên tục

d)

Giảm sai số dự đoán

35.

Một ví dụ của học tăng cường (Reinforcement Learning) là?

a)

Xe tự lái

b)

Phân cụm khách hàng

c)

Hồi quy tuyến tính

d)

Tính điểm trung bình của sinh viên

36.

Hồi quy tuyến tính dùng để?

a)

Dự đoán giá trị liên tục

b)

Phân loại dữ liệu

c)

Nhóm dữ liệu thành cụm

d)

Giảm số chiều dữ liệu

37.

Trong hồi quy tuyến tính, thuật ngữ "Residual" có nghĩa là?

a)

Khoảng cách giữa giá trị thực tế và giá trị dự đoán

b)

Trọng số của mô hình

c)

Giá trị trung bình của biến đầu ra

d)

Giá trị của biến đầu vào

38.

Hồi quy tuyến tính có thể áp dụng khi nào?

a)

Khi dữ liệu có mối quan hệ tuyến tính

b)

Khi dữ liệu hoàn toàn ngẫu nhiên

c)

Khi dữ liệu có quá nhiều giá trị trùng lặp

d)

Khi không có biến đầu vào

39.

Mean Squared Error (MSE) dùng để đo lường gì?

a)

Độ chính xác của mô hình

b)

Sai số trung bình bình phương giữa giá trị thực tế và giá trị dự đoán

c)

Hệ số tương quan giữa hai biến

d)

Giá trị trung bình của biến độc lập

40.

R-squared (R2) thể hiện điều gì?

a)

Mức độ mô hình giải thích được phương sai của dữ liệu

b)

Độ chính xác của dự đoán

c)

Số lượng biến đầu vào

d)

Giá trị trung bình của sai số

41.

Hồi quy tuyến tính đa biến được sử dụng khi nào?

a)

Khi có nhiều hơn một biến đầu vào

b)

Khi chỉ có một biến đầu vào

c)

Khi muốn phân loại dữ liệu

d)

Khi dữ liệu không có xu hướng tuyến tính

42.

Overfitting là gì?

a)

Mô hình quá đơn giản và không học được quy luật dữ liệu

b)

Mô hình quá phức tạp và ghi nhớ dữ liệu huấn luyện

c)

Mô hình không có khả năng học dữ liệu

d)

Mô hình chạy nhanh hơn nhưng kém chính xác

43.

Underfitting là gì?

a)

Mô hình không học được quy luật của dữ liệu

b)

Mô hình quá phức tạp

c)

Mô hình có quá nhiều tham số

d)

Mô hình hoạt động tốt trên tập huấn luyện nhưng kém trên tập kiểm tra

44.

Tại sao phải chia dữ liệu thành tập huấn luyện và tập kiểm tra?

a)

Để mô hình học nhanh hơn

b)

Để kiểm tra khả năng tổng quát hóa của mô hình

c)

Để giảm thời gian xử lý

d)

Để lưu trữ dữ liệu tốt hơn

45.

Điều kiện nào dưới đây KHÔNG phải là giả định của hồi quy tuyến tính?

a)

Mối quan hệ giữa biến đầu vào và đầu ra là tuyến tính

b)

Sai số có phân phối chuẩn

c)

Các biến độc lập phải có tương quan cao với nhau

d)

Phương sai của sai số không đổi (homoscedasticity)

46.

Hiện tượng đa cộng tuyến (Multicollinearity) xảy ra khi?

a)

Hai hoặc nhiều biến độc lập có tương quan cao với nhau

b)

Biến đầu ra không có tương quan với biến đầu vào

c)

Mô hình hồi quy không hội tụ

d)

Hồi quy tuyến tính không thể hoạt động với nhiều biến đầu vào

47.

Cách nào có thể giúp giảm đa cộng tuyến trong hồi quy tuyến tính?

a)

Loại bỏ một số biến độc lập có tương quan cao

b)

Tăng số lượng biến độc lập

c)

Tăng số lượng dữ liệu huấn luyện

d)

Giảm số lần huấn luyện mô hình

48.

Giá trị R² càng cao thì?

a)

Mô hình giải thích tốt hơn phương sai của dữ liệu

b)

Sai số dự đoán càng cao

c)

Mô hình càng đơn giản

d)

Mô hình có thể không phù hợp với dữ liệu

49.

Nếu giá trị Mean Absolute Error (MAE) cao, điều này có nghĩa là?

a)

Mô hình có độ chính xác thấp

b)

Mô hình hoạt động tốt

c)

Mô hình không bị overfitting

d)

Giá trị này không ảnh hưởng đến mô hình

50.

RMSE (Root Mean Squared Error) khác với MAE ở điểm nào?

a)

RMSE phạt sai số lớn nặng hơn so với MAE

b)

RMSE luôn nhỏ hơn MAE

c)

RMSE chỉ dùng cho mô hình phi tuyến tính

d)

RMSE không quan trọng trong hồi quy tuyến tính

51.

Khi huấn luyện mô hình hồi quy tuyến tính, tại sao cần chuẩn hóa dữ liệu?

a)

Để các biến có cùng đơn vị đo lường

b)

Để mô hình chạy nhanh hơn

c)

Để giảm số lượng tham số

d)

Không có tác dụng gì

52.

Để đánh giá mô hình hồi quy tuyến tính, ta cần?

a)

Tập huấn luyện và tập kiểm tra

b)

Chỉ cần tập huấn luyện

c)

Chỉ cần tập kiểm tra

d)

Không cần chia tập dữ liệu

53.

Hồi quy tuyến tính có thể áp dụng trong bài toán nào sau đây?

a)

Dự đoán giá nhà

b)

Phân loại email spam

c)

Nhận diện khuôn mặt

d)

Xác định loại động vật trong ảnh

54.

Ứng dụng của hồi quy tuyến tính trong kinh tế là?

a)

Dự đoán doanh thu của công ty

b)

Nhận diện chữ viết tay

c)

Phân loại khách hàng

d)

Phân cụm dữ liệu

55.

Trong lĩnh vực y tế, hồi quy tuyến tính có thể giúp?

a)

Dự đoán chi phí điều trị bệnh nhân

b)

Phân loại hình ảnh X-ray

c)

Nhận diện tế bào ung thư

d)

Xây dựng chatbot hỗ trợ bệnh nhân

56.

Một công ty thương mại điện tử có thể dùng hồi quy tuyến tính để?

a)

Dự đoán giá sản phẩm dựa trên đánh giá của khách hàng

b)

Nhận diện hình ảnh sản phẩm

c)

Tạo chatbot chăm sóc khách hàng

d)

Dự đoán xu hướng tìm kiếm của khách hàng

57.

Trong marketing, hồi quy tuyến tính có thể giúp?

a)

Dự đoán doanh số bán hàng dựa trên ngân sách quảng cáo

b)

Phân loại khách hàng theo sở thích

c)

Nhận diện nội dung video

d)

Tạo nội dung quảng cáo tự động

58.

Một công ty bảo hiểm có thể áp dụng hồi quy tuyến tính để?

a)

Dự đoán mức phí bảo hiểm dựa trên hồ sơ khách hàng

b)

Phân loại đơn khiếu nại

c)

Nhận diện hình ảnh gian lận

d)

Phân cụm khách hàng

59.

Trong giao thông, hồi quy tuyến tính có thể được dùng để?

a)

Dự đoán thời gian di chuyển dựa trên dữ liệu thời tiết

b)

Nhận diện biển báo giao thông

c)

Phân loại phương tiện giao thông

d)

Xây dựng hệ thống tự lái

60.

Một công ty bất động sản muốn dự đoán giá nhà dựa trên diện tích và số phòng ngủ. Mô hình phù hợp nhất để sử dụng là?

a)

Hồi quy tuyến tính đa biến

b)

Hồi quy logistic

c)

Phân cụm K-means

d)

Cây quyết định

61.

Trong tài chính, hồi quy tuyến tính có thể giúp?

a)

Dự đoán lợi nhuận của một công ty dựa trên dữ liệu lịch sử

b)

Nhận diện giao dịch gian lận

c)

Phân nhóm khách hàng theo hành vi chi tiêu

d)

Xây dựng hệ thống chấm điểm tín dụng

62.

Một công ty sản xuất muốn tối ưu hóa lượng nguyên liệu sử dụng để giảm chi phí. Họ có thể sử dụng mô hình nào?

a)

Hồi quy tuyến tính để dự đoán lượng nguyên liệu cần thiết

b)

Hồi quy logistic để phân loại sản phẩm lỗi

c)

Mạng nơ-ron nhân tạo để nhận diện sản phẩm

d)

Cây quyết định để phân nhóm khách hàng

63.

Trong thể thao, hồi quy tuyến tính có thể giúp?

a)

Dự đoán hiệu suất của một vận động viên dựa trên dữ liệu tập luyện

b)

Xếp hạng đội bóng theo điểm số

c)

Phân loại cầu thủ theo vị trí chơi

d)

Nhận diện khuôn mặt cầu thủ

64.

Một công ty giao hàng muốn dự đoán thời gian giao hàng dựa trên khoảng cách và tình trạng giao thông. Phương pháp phù hợp nhất là?

a)

Hồi quy tuyến tính

b)

Mạng nơ-ron nhân tạo

c)

Hồi quy logistic

d)

Học tăng cường (Reinforcement Learning)

65.

Trong thương mại điện tử, mô hình hồi quy tuyến tính có thể giúp gì?

a)

Dự đoán số lượng đơn hàng dựa trên số lượng khách truy cập trang web

b)

Phân loại sản phẩm theo danh mục

c)

Nhận diện khách hàng VIP

d)

Xây dựng chatbot hỗ trợ khách hàng

66.

Một bệnh viện muốn dự đoán chi phí điều trị cho bệnh nhân dựa trên số ngày nằm viện và tình trạng sức khỏe. Phương pháp phù hợp nhất là?

a)

Hồi quy tuyến tính

b)

Hồi quy logistic

c)

Cây quyết định

d)

Học sâu (Deep Learning)

67.

Một công ty xe hơi muốn dự đoán mức tiêu thụ nhiên liệu của xe dựa trên trọng lượng và công suất động cơ. Họ nên dùng mô hình nào?

a)

Hồi quy tuyến tính

b)

Hồi quy logistic

c)

Phân cụm K-means

d)

Mạng nơ-ron nhân tạo

68.

Trong ngành du lịch, hồi quy tuyến tính có thể được dùng để?

a)

Dự đoán lượng khách du lịch dựa trên các yếu tố thời tiết và mùa du lịch

b)

Phân loại khách sạn theo đánh giá của khách hàng

c)

Nhận diện ảnh địa điểm du lịch

d)

Phân tích cảm xúc của khách hàng về dịch vụ

69.

Một ngân hàng muốn ước tính thu nhập của khách hàng dựa trên số tiền gửi tiết kiệm hàng tháng. Họ nên sử dụng?

a)

Hồi quy tuyến tính

b)

Hồi quy logistic

c)

Phân cụm K-means

d)

Mạng nơ-ron nhân tạo

70.

Công cụ nào sau đây KHÔNG được dùng để biểu diễn trực quan hoá dữ liệu

a)

Bar plot

b)

Các mô hình hồi quy tuyến tính

c)

Scatter plot

d)

Box plot

71.

Giá trị trung vị là gì?

a)

Là đại lượng chia đôi tập dữ liệu

b)

Là giá trị trung bình của tập dữ liệu

c)

Là giá trị có tần suất xuất hiện nhiều nhất

d)

Là trung bình cộng của tập dữ liệu

72.

Cho một tập dữ liệu về tuổi của khách hàng, để biểu diễn tần suất xuất hiện của mỗi tuổi trong tập dữ liệu người ta thường dùng đồ thị nào?

a)

Bar plot

b)

Box plot

c)

Scatter plot

d)

Pie chart

73.

Biểu đồ sau được gọi là gì?

a)

Scatter plot

b)

Line plot

c)

Bar plot

d)

Pie chart

74.

Biểu đồ sau được gọi là gì?

a)

Scatter plot

b)

Line plot

c)

Bar plot

d)

Pie chart

75.

Biểu đồ sau được gọi là gì?

a)

Histogram

b)

Line plot

c)

Pie plot

d)

Bar plot

76.

Đồ thị sau là gì?

a)

Bar plot

b)

Box plot

c)

Scatter plot

d)

Line plot

77.

Một tập dữ liệu là gì?

a)

Tập hợp thông tin nguyên thủy của các đối tượng thỏa mãn một điều kiện nghiên cứu nào đó

b)

Tập hợp các công cụ để lưu trữ dữ liệu

c)

Tập hợp các thuật toán

d)

Tập hợp các mô hình toán học

78.

Một hãng ôtô muốn nghiên cứu khả năng mua một loại xe mới của khách hàng, đối tượng nghiên cứu của họ có thể là?

a)

Tất cả các công dân Việt Nam

b)

Tất cả người dân sống tại TP. HCM

c)

Những người trưởng thành có độ tuổi nằm trong khoảng [20, 60]

d)

Tất cả những người dân sống tại Hà Nội

79.

Biểu đồ nào có outliner?

a)

1

b)

2

c)

3

d)

4

80.

Trong các phương pháp sau, phương pháp nào thường không được sử dụng cho bài toán phân loại (classification)?

a)

Logistic Regression

b)

Support Vector Machines

c)

Decision Trees

d)

Linear Regression

81.

Khi đánh giá mô hình hồi quy, chỉ số nào dưới đây không phải là một tiêu chí đánh giá thường dùng?

a)

Mean Absolute Error (MAE)

b)

Root Mean Square Error (RMSE)

c)

Accuracy

d)

R-squared ( R2R^2 )

82.

Trong phương pháp phân cụm K-Means, bước nào sau đây là quan trọng nhất để đảm bảo kết quả tốt?

a)

Chọn số cụm k

b)

Sắp xếp lại các cụm

c)

Khởi tạo các tâm cụm (centroids)

d)

Tính toán độ lệch chuẩn trong cụm

83.

Trong học tăng cường, thuật ngữ nào sau đây mô tả sự thay đổi của trạng thái môi trường sau khi thực hiện một hành động?

a)

Action

b)

State

c)

Reward

d)

Transition

84.

Trong một tình huống mà bạn cần giảm thiểu số lượng False Negatives (FN), bạn sẽ tập trung cải thiện chỉ số nào của mô hình?

a)

Accuracy

b)

Precision

c)

Recall

d)

F1 Score

85.

Tập huấn luyện (train set) trong quá trình huấn luyện mô hình có vai trò gì?

a)

Để kiểm tra hiệu suất của mô hình

b)

Để đánh giá độ chính xác của mô hình

c)

Để giảm các tham số của mô hình

d)

Để giảm thiểu lỗi của mô hình

86.

Tại sao tập kiểm tra (test set) không nên được sử dụng trong quá trình huấn luyện mô hình?

a)

Để tránh tình trạng mô hình bị quá khớp (overfitting)

b)

Để tiết kiệm thời gian huấn luyện

c)

Để tăng cường tính chính xác của mô hình

d)

Để giảm thiểu sự phức tạp của mô hình

87.

Điểm khác biệt chính giữa tập huấn luyện và tập kiểm tra là gì?

a)

Tập huấn luyện dùng để kiểm tra mô hình, còn tập kiểm tra dùng để huấn luyện mô hình

b)

Tập huấn luyện dùng để huấn luyện mô hình, còn tập kiểm tra dùng để đánh giá mô hình

c)

Tập huấn luyện dùng để giảm thiểu lỗi, còn tập kiểm tra dùng để tăng cường độ chính xác

d)

Tập huấn luyện dùng để kiểm tra độ chính xác, còn tập kiểm tra dùng để kiểm tra hiệu suất

88.

Nếu mô hình của bạn cho thấy hiệu suất rất tốt trên tập huấn luyện nhưng kém trên tập kiểm tra, hiện tượng này gọi là gì?

a)

Underfitting

b)

Regularization

c)

Cross-validation

d)

Overfitting

89.

Tại sao việc chia dữ liệu thành tập huấn luyện và tập kiểm tra là quan trọng?

a)

Để có thể kiểm tra các giả định thống kê

b)

Để đảm bảo mô hình có khả năng tổng quát hóa tốt

c)

Để giảm thiểu chi phí tính toán

d)

Để tăng tốc độ huấn luyện

90.

Tập kiểm tra (test set) được sử dụng chủ yếu để?

a)

Huấn luyện mô hình với các tham số tốt nhất

b)

Điều chỉnh siêu tham số (hyperparameters)

c)

Đánh giá hiệu suất tổng quát của mô hình

d)

Chọn mô hình tốt nhất từ các mô hình đã huấn luyện

91.

Cross-validation thường được sử dụng trong bối cảnh nào và với mục đích gì?

a)

Để huấn luyện mô hình với dữ liệu lớn hơn

b)

Để chọn siêu tham số tối ưu và đánh giá khả năng tổng quát của mô hình

c)

Để giảm thời gian huấn luyện

d)

Để cải thiện tốc độ dự đoán của mô hình

92.

R² score trong hồi quy là gì?

a)

Đo lường độ chính xác của mô hình bằng cách so sánh số lượng dự đoán đúng

b)

Đo lường sự khác biệt giữa giá trị dự đoán và giá trị thực tế

c)

Đo lường tỷ lệ biến thiên của biến phụ thuộc được giải thích bởi biến độc lập

d)

Đo lường sự khác biệt giữa các điểm dữ liệu với giá trị trung bình của chúng

93.

Nếu một mô hình hồi quy có R² score bằng 0.85, điều này có nghĩa là gì?

a)

85% biến thiên trong biến độc lập được giải thích bởi mô hình

b)

85% biến thiên trong biến phụ thuộc được giải thích bởi biến độc lập

c)

15% biến thiên trong biến độc lập được giải thích bởi biến phụ thuộc

d)

15% biến thiên trong biến phụ thuộc được giải thích bởi mô hình

94.

Một mô hình có R² score rất cao trên tập huấn luyện nhưng thấp trên tập kiểm tra có thể là dấu hiệu của hiện tượng gì?

a)

Underfitting

b)

Overfitting

c)

Proper fitting

d)

Regularization

95.

R² score có thể có giá trị âm trong trường hợp nào?

a)

Khi mô hình có khả năng dự đoán hoàn hảo

b)

Khi mô hình dự đoán tốt hơn giá trị trung bình của dữ liệu

c)

Khi mô hình dự đoán tệ hơn so với việc sử dụng giá trị trung bình của dữ liệu

d)

Khi dữ liệu không có sự biến thiên

96.

Bạn có một tập dữ liệu chứa các thông tin về các email và bạn muốn phân loại chúng thành "spam" và "không spam". Đây là ví dụ của loại học máy nào?

a)

Supervised learning

b)

Unsupervised learning

c)

Reinforcement learning

d)

Semi-supervised learning

97.

Khi bạn có một tập dữ liệu khách hàng với các thuộc tính như độ tuổi, thu nhập, và bạn muốn nhóm các khách hàng này vào các phân khúc khác nhau mà không có nhãn trước. Đây là loại bài toán gì?

a)

Supervised learning

b)

Unsupervised learning

c)

Reinforcement learning

d)

Semi-supervised learning

98.

Bài toán dự đoán giá nhà dựa trên các yếu tố như diện tích, số phòng, và vị trí thuộc loại nào trong học máy?

a)

Supervised learning

b)

Unsupervised learning

c)

Reinforcement learning

d)

Semi-supervised learning

99.

Bạn có một tập dữ liệu về hình ảnh và muốn nhóm các hình ảnh tương tự lại với nhau mà không biết trước các nhóm. Đây là ví dụ của phương pháp nào?

a)

Classification

b)

Clustering

c)

Regression

d)

Dimensionality reduction

100.

Trong bài toán dự đoán thời gian kết thúc của một vận động viên chạy marathon dựa trên lịch sử các lần chạy trước, bạn sẽ sử dụng loại học máy nào?

a)

Supervised learning

b)

Unsupervised learning

c)

Reinforcement learning

d)

Semi-supervised learning

101.

Một công ty muốn phân tích dữ liệu về lịch sử mua sắm của khách hàng để phát hiện ra các nhóm hành vi mua sắm khác nhau mà không có nhãn sẵn có. Bài toán này thuộc loại nào?

a)

Supervised learning

b)

Unsupervised learning

c)

Reinforcement learning

d)

Semi-supervised learning