wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Bài tập phân tích dữ liệu và biến số

Total questions: 90

Worksheet time: 50mins

Name
Class
Date
1.

Trong đồ thị y = 2x, x nằm trên trục nào?

a)

Trục z

b)

Trục x

c)

Trục y

d)

Không xác định

2.

Biến độc lập thường được hiểu là:

a)

Biến giải thích

b)

Biến dự đoán

c)

Biến phụ thuộc

d)

Biến phản ứng

3.

Biến phụ thuộc còn được gọi là:

a)

Biến kết quả

b)

Biến phản ứng

c)

Biến giải thích

d)

Biến độc lập

4.

Trong các mô hình phân tích, biến độc lập có thể:

a)

Ảnh hưởng đến biến phụ thuộc

b)

Được xác định sau khi phân tích

c)

Là yếu tố nguyên nhân

d)

Không có giá trị cụ thể

5.

Trong phân tích dữ liệu, biến phụ thuộc có đặc điểm nào sau đây:

a)

Có giá trị ngẫu nhiên

b)

Luôn cố định

c)

Luôn bằng giá trị trung bình

d)

Phụ thuộc vào biến x

6.

Một hệ số tương quan r = 0 có ý nghĩa gì?

a)

Không tồn tại mối liên hệ tuyến tính

b)

Hai biến độc lập hoàn toàn

c)

Một biến luôn bằng 0

d)

Không thể tính được hồi quy

7.

Khi phân tích tương quan, tại sao cần xem cả đồ thị và hệ số r?

a)

Vì đồ thị cung cấp thông tin trực quan bổ sung

b)

Vì đồ thị là không cần thiết

c)

Vì r không thể tính trong mọi trường hợp

d)

Vì giá trị r luôn đúng

8.

Hệ số tương quan nên được sử dụng khi nào?

a)

Khi phân tích mức độ chặt chẽ của mối liên hệ

b)

Khi dữ liệu là định tính

c)

Khi muốn xác định mối quan hệ tuyến tính giữa hai biến

d)

Khi muốn kiểm định tính nhân quả

9.

Đâu là những yếu tố cần cân trọng khi giải thích r?

a)

R luôn xác định được chiều tác động

b)

Giá trị r không thể hiện quan hệ nhân quả

c)

R có đơn vị đo lường cụ thể

d)

R có thể bị ảnh hưởng bởi yếu tố ngẫu nhiên

10.

Một tương quan chặt có thể là giả khi:

a)

Các biến phụ thuộc lẫn nhau

b)

Một biến có giá trị âm

c)

Mẫu dữ liệu quá nhỏ hoặc ngẫu nhiên

d)

Hai biến không có mối liên hệ thực sự

11.

Những mức độ ý nghĩa thống kê khi phân tích r bao gồm:

a)

Một sao: p < 0.05

b)

Bốn sao: p < 0.0001

c)

Hai sao: p < 0.01

d)

Không có sao nếu p > 0.1

12.

Mô hình hồi quy tuyến tính đa biến khác hồi quy đơn biến ở điểm nào?

a)

Có nhiều biến độc lập

b)

Không có biến phụ thuộc

c)

Không cần kiểm tra tương quan

d)

Có nhiều biến phụ thuộc

13.

Giá trị R-squared gần 1 cho thấy:

a)

Số dự đoán lớn

b)

Mô hình giải thích tốt biến phụ thuộc

c)

Mô hình không phù hợp

d)

Không có ý nghĩa thống kê

14.

Trong mô hình hồi quy, hệ số hồi quy ß thể hiện:

a)

Ảnh hưởng của biến độc lập lên biến phụ thuộc

b)

Độ chênh lệch trung bình

c)

Sai số mô hình

d)

Biến ngẫu nhiên của mô hình

15.

Đặc điểm của hồi quy tuyến tính là:

a)

Dùng trong mọi loại dữ liệu định tính

b)

Luôn yêu cầu biến độc lập phải là số nguyên

c)

Mô tả mối quan hệ tuyến tính giữa các biến

d)

Có thể sử dụng để dự đoán giá trị tương lai

16.

Trong phân tích dữ liệu, hồi quy có thể được dùng để:

a)

Phân loại khách hàng

b)

Mã hóa dữ liệu

c)

Dự báo xu hướng giá

d)

Xác định ảnh hưởng giữa các biến

17.

Tại sao cần phân tích tương quan trước khi hồi quy?

a)

Vì không cần kiểm định giả thuyết

b)

Để xác định mô hình nhân quả phù hợp

c)

Để kiểm tra độ mạnh của mối liên hệ

d)

Vì hồi quy không cần giả định gì

18.

Mô hình hồi quy tuyến tính yêu cầu:

a)

Biến phụ thuộc là số lượng liên tục

b)

Không cần dữ liệu huấn luyện

c)

Giá trị biến phụ thuộc là dạng nhị phân

d)

Biến độc lập có thể là nhiều biến

19.

Phân tích hồi quy có thể hỗ trợ doanh nghiệp:

a)

Tính tỷ lệ lỗi sản phẩm

b)

Kiểm tra bảo mật hệ thống

c)

Tối ưu chi phí

d)

Dự đoán doanh thu

20.

Mô hình hồi quy phi tuyến phù hợp khi:

a)

Dữ liệu bị thiếu hoàn toàn

b)

Dữ liệu cho thấy xu hướng cong hoặc biến động

c)

Cần phân loại khách hàng

d)

Quan hệ giữa x và y không theo đường thẳng

21.

Trong mô hình hồi quy tuyến tính, biến phụ

a)

Là biến được dùng để giải thích

b)

Được dự đoán từ biến độc lập

c)

Luôn có giá trị âm

d)

Luôn là một hằng số

22.

Trong phân tích hồi quy, biến nào sau đây được gọi là biến giải thích?

a)

Biến độc lập

b)

Biến ngẫu nhiên

c)

Biến phụ thuộc

d)

Biến đáp ứng

23.

Biến phụ thuộc có giá trị:

a)

Luôn bằng 0

b)

Cố định

c)

Độc lập với biến x

d)

Không xác định

24.

Giá trị của hệ số tương quan r luôn nằm trong khoảng:

a)

[-0.5 , 0.5]

b)

[-1 , 1]

c)

[0 , 1]

d)

[-2 , 2]

25.

Nếu r = 0.9, điều này thể hiện:

a)

Mối tương quan tuyến tính rất chặt

b)

Mối quan hệ tuyến tính yếu

c)

Mối quan hệ phi tuyến

d)

Hai biến hoàn toàn không liên quan

26.

Ý nghĩa của hệ số tương quan Pearson (r) là gì?

a)

Lượng hóa mức độ chặt chẽ của mối quan hệ tuyến tính

b)

Dự đoán chính xác giá trị biến phụ thuộc

c)

Tính trung bình cộng của hai biến

d)

Đo lường mối quan hệ phi tuyến giữa hai biến

27.

Trường hợp nào dưới đây phù hợp với mô hình hồi quy tuyến tính?

a)

Dự đoán xu hướng phi tuyến tính

b)

Phân loại văn bản

c)

Dự đoán giá nhà dựa trên diện tích

d)

Dự đoán kết quả có/không

28.

Khi r < 0 và có trị tuyệt đối lớn, điều đó có ý nghĩa là:

a)

Không thể kết luận gì

b)

Hai biến có mối quan hệ ngẫu nhiên

c)

Khi x tăng thì y giảm

d)

Khi biến x tăng thì biến y cũng tăng

29.

Khi sử dụng quy hồi tuyến tính, bước đầu tiên là:

a)

Phân tích mối tương quan giữa các biến

b)

Vẽ biểu đồ phân bố chuẩn

c)

Ước lượng sai số

d)

Tạo báo cáo dự đoán

30.

Trong mô hình y = 2x, biến y được gọi là:

a)

Biến phụ thuộc

b)

Biến giải thích

c)

Biến độc lập

d)

Biến nguyên nhân

31.

Trong hồi quy logistic, biến phụ thuộc có dạng gì?

a)

Chuỗi ký tự

b)

Số thực

c)

Biến nhị phân

d)

Biến không xác định

32.

Hồi quy logistic nhị phân được dùng khi:

a)

Dự đoán biến định lượng

b)

Biến phụ thuộc là văn bản

c)

Biến phụ thuộc có hai trạng thái

d)

Biến mục tiêu có nhiều mức độ

33.

Khi sử dụng mô hình hồi quy logistic, kết quả đầu ra là:

a)

Phân phối chuẩn

b)

Hệ số tương quan

c)

Giá trị liên tục

d)

Xác suất và phân loại

34.

Đầu vào của mô hình logistic regression trong Sklearn là:

a)

Một biểu đồ

b)

Một ma trận đặc trưng (X)

c)

Chỉ biến mục tiêu

d)

Một cột dữ liệu văn bản

35.

Trong bài toán dự đoán mua hàng, tăng số lượt truy cập web sẽ:

a)

Loại bỏ khách hàng

b)

Có thể tăng xác suất mua hàng

c)

Giảm xác suất mua hàng

d)

Không ảnh hưởng

36.

Trong mô hình binary logistic, đầu ra của mô hình là:

a)

Xác suất và nhãn 0/1

b)

Một giá trị chuỗi

c)

Giá trị thực bất kỳ

d)

Tỉ lệ phần trăm lồi

37.

Biến đầu ra của hồi quy logistic có thể:

a)

Nhận giá trị 0 hoặc 1

b)

Là giá trị bất kỳ

c)

Là xác suất từ 0 đến 1

d)

Là chuỗi ký tự

38.

Mô hình hồi quy logistic sử dụng trong:

a)

Dự báo GDP

b)

Tính phương sai mẫu

c)

Phân tích khả năng mua hàng

d)

Dự đoán nhị phân (có/không)

39.

Hàm logistic có đặc điểm:

a)

Có giá trị âm vô hạn

b)

Là hàm phi tuyến

c)

Giới hạn đầu ra từ 0 đến 1

d)

Là hàm tuyến tính

40.

Hồi quy logistic khác hồi quy tuyến tính ở điểm:

a)

Biến phụ thuộc là nhị phân

b)

Không cần biến độc lập

c)

Không có hệ số chặn

d)

Dự đoán xác suất chứ không phải giá trị cụ thể

41.

Các loại hồi quy logistic bao gồm:

a)

Hồi quy logistic nhị phân

b)

Hồi quy phi tuyến hoàn toàn

c)

Hồi quy logistic đa thức

d)

Hồi quy tuyến tính

42.

Hồi quy logistic thứ tự phù hợp với bài toán nào?

a)

Đánh giá mức độ hài lòng: kém, ổn, tốt, xuất sắc

b)

Dự đoán điểm số học sinh theo xếp loại

c)

Dự đoán giá cổ phiếu

d)

Dự đoán dân số

43.

Mục đích của việc sử dụng hồi quy logistic là:

a)

Tính toán độ lệch chuẩn

b)

Dự đoán xác suất

c)

Vẽ biểu đồ tương quan

d)

Phân nhóm đối tượng

44.

Mô hình logistic có thể được dùng để:

a)

Phân tích tương quan

b)

Xác định biến liên tục

c)

Phân tích hiệu quả chiến dịch marketing

d)

Dự đoán khả năng khách hàng mua sản phẩm

45.

Khi sử dụng mô hình logistic, cần chia dữ liệu thành:

a)

Tập kiểm tra

b)

Tập xác định trung bình

c)

Tập huấn luyện

d)

Tập đánh giá độ lệch chuẩn

46.

Trong báo cáo phân loại, các chỉ số đánh giá hiệu quả mô hình gồm:

a)

F1 – score

b)

Độ tương quan r

c)

Độ chính xác (accuracy)

d)

Biến độc lập

47.

Khi đánh giá mô hình logistic bằng classification_report, bạn nhận được:

a)

Đồ thị scatter

b)

Nhớ lại

c)

Biểu đồ tương quan

d)

Độ chính xác

48.

Mô hình logistic có thể áp dụng trong trường hợp

a)

Dự đoán giá nhà chính xác

b)

Xác suất xảy ra một hành vi

c)

Dữ liệu huấn luyện nhị phân

d)

Không có biến mục tiêu

49.

Ưu điểm của hồi quy logistic trong phân tích kinh doanh là:

a)

Dự đoán giá trị liên tục

b)

Dễ giải thích kết quả

c)

Không cần dữ liệu huấn luyện

d)

Phân loại hiệu quả

50.

Trong mô hình logistic, biến đầu vào có thể là:

a)

Địa chỉ email

b)

Tên khách hàng

c)

Tuổi khách hàng

d)

Thu nhập hàng tháng

51.

Phân tích xác suất mua hàng dựa trên:

a)

Biến định lượng

b)

Biến định tính đã được mã hóa

c)

Tỷ số tương quan

d)

Mô hình tuyến tính

52.

Hàm logit dùng để làm gì trong hồi quy logistic?

a)

Ước lượng xác suất giữa 0 và 1

b)

Tính trung bình mẫu

c)

Tính khoảng tin cậy

d)

Kiểm định độc lập

53.

Mục tiêu của hồi quy logistic là gì?

a)

Giảm số chiều dữ liệu

b)

Dự đoán xác suất thuộc một nhóm

c)

Tính phương sai

d)

Tối ưu hóa chi phí

54.

Nếu mô hình logistic về nghiên cứu khả năng mua hàng của khách hàng mục tiêu có đầu vào là Age và Salary, biến mục tiêu phù hợp nhất là:

a)

Điểm trung bình

b)

Thu nhập

c)

Số lượt xem

d)

Mua hàng (0/1)

55.

Trong ma trận nhầm lẫn, giá trị nằm trên đường chéo chính đại diện cho:

a)

Tổng số dự đoán

b)

Dữ liệu huấn luyện

c)

Dự đoán sai

d)

Dự đoán đúng

56.

Trong mô hình binary logistic, nếu xác suất dự đoán là 0.8, mô hình sẽ:

a)

Gán nhãn 0

b)

Gán nhãn 1

c)

Không phân loại

d)

Tính lại trung bình

57.

Mô hình hồi quy logistic là gì?

a)

Mô hình tuyến tính đa biến

b)

Mô hình hồi quy đa thức

c)

Mô hình phân loại nhị phân

d)

Mô hình phân tích chuỗi thời gian

58.

Sau khi huấn luyện mô hình, lệnh model.predict(X_test) thực hiện việc:

a)

Dự đoán phân loại

b)

Tạo báo cáo huấn luyện

c)

Dự đoán xác suất

d)

Đánh giá dữ liệu

59.

Dạng tổng quát của hàm logit trả về giá trị

a)

Từ 0 đến 1

b)

Lớn hơn 100%

c)

Lớn hơn 1

d)

Bất kỳ số âm nào

60.

Hàm predict_proba() trong Scikit-learn dùng để:

a)

Dự đoán xác suất

b)

Tạo ra ma trận nhầm lẫn

c)

Phân nhóm dữ liệu

d)

Dự đoán nhãn

61.

Trong học có giám sát, dữ liệu đầu ra thường là gì?

a)

Giá trị nhãn được gán trước

b)

Dữ liệu văn bản

c)

Tập dữ liệu không phân loại

d)

Giá trị bị thiếu

62.

Dữ liệu huấn luyện (training data) thường được dùng để:

a)

Xác định tập kiểm tra

b)

Huấn luyện mô hình

c)

Kiểm tra độ chính xác

d)

Tối ưu bộ nhớ

63.

Hai ví dụ của unsupervised learning là:

a)

Phân tích thành phần chính (PCA)

b)

Phân cụm K-means

c)

Hồi quy tuyến tính

d)

Cây quyết định

64.

Học tăng cường (reinforcement learning) liên quan đến:

a)

Không sử dụng phản hồi

b)

Ra quyết định tối ưu trong môi trường

c)

Thưởng và phạt

d)

Giám sát chặt chẽ

65.

Học không giám sát (unsupervised learning) dùng để:

a)

Huấn luyện mạng nơ-ron có nhãn

b)

Phân loại email spam

c)

Phát hiện cấu trúc ẩn trong dữ liệu

d)

Tìm cụm (clustering) trong dữ liệu

66.

Tại sao supervised learning thường đạt độ chính xác cao hơn unsupervised learning?

a)

Vì luôn dùng nhiều dữ liệu hơn

b)

Do chỉ dùng trong bài toán phân lớp

c)

Do được huấn luyện bằng dữ liệu không bị nhiễu

d)

Vì có thêm thông tin đầu ra từ dữ liệu huấn luyện

67.

Ví dụ nào sau đây phù hợp nhất với supervised learning?

a)

Tìm nhóm khách hàng tiềm năng

b)

Xác định chủ đề văn bản

c)

Dự đoán điểm thi dựa vào số giờ học

d)

Phân loại email là spam hoặc không spam

68.

Clustering là gì trong học máy?

a)

Cách để dự đoán nhãn mới

b)

Phân nhóm các đối tượng dựa trên độ tương đồng

c)

Xếp loại đầu ra có giám sát

d)

Phương pháp dán nhãn dữ liệu

69.

Reinforcement learning được dùng nhiều trong các ứng dụng nào?

a)

Điều khiển robot tự động

b)

Phân cụm dữ liệu

c)

Chơi cờ, game tự động

d)

Dự đoán thời tiết

70.

Semi-supervised learning là gì?

a)

Dùng trong bài toán hồi quy

b)

Chỉ dùng dữ liệu có nhãn

c)

Học tăng cường nhưng không có phản hồi

d)

Kết hợp cả dữ liệu có nhãn và không nhãn trong huấn luyện

71.

Khi nào nên dùng unsupervised learning?

a)

Khi cần dự đoán đầu ra cụ thể

b)

Khi dữ liệu có thể chia nhóm tự nhiên

c)

Khi không có nhãn cho dữ liệu

d)

Khi cần gán nhãn tự động

72.

Supervised learning hiệu quả nhất khi nào?

a)

Khi dữ liệu hỗn hợp giữa số và văn bản

b)

Khi không có thông tin đầu ra

c)

Khi có tập dữ liệu huấn luyện lớn và đủ nhãn

d)

Khi không cần phân loại

73.

Trong bài toán dự đoán khách hàng rời bỏ dịch vụ, phương pháp nào sau đây phù hợp?

a)

Random Forest

b)

Logistic Regression

c)

Reinforcement learning

d)

Principal Component Analysis

74.

Bạn có dữ liệu hành vi truy cập website, không có nhãn. Mục tiêu là chia nhóm hành vi, bạn chọn:

a)

Unsupervised learning

b)

K-means

c)

Hồi quy logistic

d)

SVM

75.

Bạn muốn lập mô hình dự báo lượng tiêu thụ sản phẩm theo thời gian. Bạn nên sử dụng:

a)

Linear regression

b)

Reinforcement learning

c)

Classification

d)

Time series forecasting

76.

Trong việc xây dựng hệ thống đề xuất (recommendation system), bạn có thể sử dụng:

a)

Clustering

b)

Content – based Filtering

c)

Hồi quy tuyến tính

d)

Collaborative Filtering

77.

Để phân nhóm ảnh khuôn mặt theo nét tương đồng, bạn nên dùng:

a)

Supervised learning

b)

Hồi quy logistic

c)

Clustering

d)

PCA

78.

Nếu bạn muốn huấn luyện mô hình chơi game tự động, nên dùng phương pháp nào?

a)

Unsupervised learning

b)

Reinforcement learning

c)

Clustering

d)

Supervised learning

79.

Bạn có dữ liệu ảnh mèo và chó đã được dán nhãn, muốn mô hình phân biệt hai loại này. Phương pháp nào phù hợp?

a)

Unsupervised learning

b)

Classification

c)

Clustering

d)

SVM

80.

Với bài toán nhận diện chữ số viết tay (0-9), mô hình nào sau đây phù hợp?

a)

Neural Network

b)

Logistic Regression

c)

KNN

d)

K-means

81.

Unsupervised learning phù hợp với bài toán nào sau đây?

a)

phân cụm khách hàng theo hành vi mua sắm

b)

phân tích cấu trúc dữ liệu chưa nhãn

c)

dự đoán giá nhà

d)

phân loại thư rác

82.

Supervised learning khác với unsupervised learning ở điểm nào?

a)

Không có đầu vào

b)

Không yêu cầu đầu ra

c)

Có sử dụng dữ liệu có nhãn

d)

Không cần mô hình

83.

Điểm khác biệt của reinforcement learning là:

a)

Không học từ dữ liệu

b)

Không sử dụng bất kỳ nhãn nào

c)

Học thông qua phần thưởng và hình phạt từ môi trường

d)

Chỉ dùng trong bài toán hồi quy

84.

Trong bài toán phân nhóm khách hàng tiềm năng từ dữ liệu chưa có nhãn, bạn nên dùng:

a)

K-means

b)

Logistic Regression

c)

Clustering (phân cụm)

d)

Classification

85.

Mục tiêu chính của học máy là gì?

a)

Giảm dung lượng bộ nhớ

b)

Mô tả dữ liệu

c)

Tự động hóa các nhiệm vụ dựa trên dữ liệu

d)

Tạo đồ họa đẹp

86.

Bạn muốn xây dựng mô hình phân loại thư rác, nên dùng phương pháp nào?

a)

Linear regression

b)

Naive Bayes

c)

Decision Tree

d)

K-means clustering

87.

Supervised learning hoạt động như thế nào?

a)

Học từ tập dữ liệu có đầu ra được xác định trước

b)

Tự tạo ra đầu ra giả định

c)

Dựa vào phản hồi từ người dùng

d)

Huấn luyện mô hình với dữ liệu không có nhãn

88.

Nếu bạn có tập dữ liệu người dùng có thông tin giới tính, độ tuổi và số lượt truy cập web, phương pháp nào phù hợp để phân loại nhóm mua hàng?

a)

Supervised learning

b)

Random sampling

c)

Classification

d)

Clustering

89.

Định nghĩa cơ bản của Machine Learning là gì?

a)

Một cách để viết phần mềm thông thường

b)

Một hệ thống có thể học từ dữ liệu và cải thiện theo thời gian

c)

Một phương pháp lưu trữ dữ liệu

d)

Một lĩnh vực của y học

90.

Để dự đoán điểm thi sinh viên dựa vào số giờ học, bạn nên chọn:

a)

Regression model

b)

K-means

c)

Hồi quy tuyến tính

d)

Decision Tree