wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

phân tích dữ liệu kinh doanh 2

Total questions: 94

Worksheet time: 50mins

Name
Class
Date
1.

Khi phân tích tương quan, tại sao cần xem cả đồ thị và hệ số r?

4 lines
2.

Hệ số tương quan nên được sử dụng khi nào?

a)

Khi dữ liệu là định tính

b)

Khi phân tích mức độ chặt chẽ của mối liên hệ

c)

Khi muốn kiểm định tính nhân quả

d)

Khi muốn xác định mối quan hệ tuyến tính giữa hai biến

3.

Đâu là những yếu tố cần cân trọng khi giải thích r?

a)

R luôn xác định được chiều tác động

b)

Giá trị r không thể hiện quan hệ nhân quả

c)

R có thể bị ảnh hưởng bởi yếu tố ngẫu nhiên

d)

R có đơn vị đo lường cụ thể

4.

Một tương quan chặt có thể là giả khi:

a)

A. Một biến có giá trị âm

b)

B. Hai biến không có mối liên hệ thực sự

c)

C. Mẫu dữ liệu quá nhỏ hoặc ngẫu nhiên

d)

D. Các biến phụ thuộc lẫn nhau

5.

Những mức độ ý nghĩa thống kê khi phân tích r bao gồm:

a)

B. Hai sao: p < 0.01

b)

D. Một sao: p < 0.05

c)

A. Bốn sao: p < 0.0001

d)

C. Không có sao nếu p > 0.1

6.

Mô hình hồi quy tuyến tính đa biến khác hồi quy đơn biến ở điểm nào?

a)

Có nhiều biến phụ thuộc

b)

Không có biến phụ thuộc

c)

Có nhiều biến độc lập

d)

Không cần kiểm tra tương quan

7.

Giá trị R-squared gần 1 cho thấy:

a)

Mô hình không phù hợp

b)

Sai số dự đoán lớn

c)

Không có ý nghĩa thống kê

d)

Mô hình giải thích tốt biến phụ thuộc

8.

Trong mô hình hồi quy, hệ số hồi quy β thể hiện:

a)

Độ chênh lệch trung bình

b)

Sai số mô hình

c)

Biến ngẫu nhiên của mô hình

d)

Ảnh hưởng của biến độc lập lên biến phụ thuộc

9.

Đặc điểm của hồi quy tuyến tính là: (chọn 2)

a)

Dùng trong mọi loại dữ liệu định tính

b)

Mô tả mối quan hệ tuyến tính giữa các biến

c)

Luôn yêu cầu biến độc lập phải là số nguyên

d)

Có thể sử dụng để dự đoán giá trị tương lai

10.

Trong phân tích dữ liệu, hồi quy có thể được dùng để:

a)

Dự báo xu hướng giá

b)

Phân loại khách hàng

c)

Mã hóa dữ liệu

d)

Xác định ảnh hưởng giữa các biến

11.

Tại sao cần phân tích tương quan trước khi hồi quy?

a)

A. Để kiểm tra độ mạnh của mỗi liên hệ

b)

B. Để xác định mô hình nhân quả phù hợp

c)

C. Vì hồi quy không cần giả định gì

d)

D. Vì không cần kiểm định giả thuyết

12.

Mô hình hồi quy tuyến tính yêu cầu:

a)

A. Giá trị biến phụ thuộc là dạng nhị phân

b)

B. Không cần dữ liệu huấn luyện

c)

C. Biến phụ thuộc là số lượng liên tục

d)

D. Biến độc lập có thể là nhiều biến

13.

Phân tích hồi quy có thể hỗ trợ doanh nghiệp:

a)

A. Kiểm tra bảo mật hệ thống

b)

B. Tối ưu chi phí

c)

C. Tính tỷ lệ lời sản phẩm

d)

D. Dự đoán doanh thu

14.

Mô hình hồi quy phi tuyến phù hợp khi nào?

a)

Khi mối quan hệ giữa các biến không phải là tuyến tính và dữ liệu có xu hướng phi tuyến.

b)

Khi tất cả các biến đều độc lập với nhau.

c)

Khi dữ liệu không có sự biến động.

d)

Khi mô hình tuyến tính không phù hợp với dữ liệu.

15.

Trong mô hình hồi quy tuyến tính, biến phụ

a)

Là biến được dùng để giải thích

b)

Được dự đoán từ biến độc lập

c)

Luôn có giá trị âm

d)

Luôn là một hằng số

16.

Trong phân tích hồi quy, biến nào sau đây được gọi là biến giải thích?

a)

Biến độc lập

b)

Biến ngẫu nhiên

c)

Biến phụ thuộc

d)

Biến đáp ứng

17.

Biến phụ thuộc có giá trị:

a)

Luôn bằng 0

b)

Cố định

c)

Độc lập với biến x

d)

Không xác định

18.

Giá trị của hệ số tương quan r luôn nằm trong khoảng:

a)

[-0.5, 0.5]

b)

[-1, 1]

c)

[0, 1]

d)

[-2, 2]

19.

Nếu r = 0.9, điều này thể hiện:

a)

Mối tương quan tuyến tính rất chặt

b)

Mối quan hệ tuyến tính yếu

c)

Mối quan hệ phi tuyến

d)

Hai biến hoàn toàn không liên quan

20.

Ý nghĩa của hệ số tương quan Pearson (r) là gì?

a)

Lượng hóa mức độ chặt chẽ của mối quan hệ tuyến tính

b)

Dự đoán chính xác giá trị biến phụ thuộc

c)

Tính trung bình cộng của hai biến

d)

Đo lường mối quan hệ phi tuyến giữa hai biến

21.

Trường hợp nào dưới đây phù hợp với mô hình hồi quy tuyến tính?

a)

Dự đoán xu hướng phi tuyến tính

b)

Dự đoán xu hướng tuyến tính rất chặt

c)

Dự đoán xu hướng tuyến tính yếu

d)

Dự đoán xu hướng tuyến tính hoặc phi tuyến tính

22.

Khi r < 0 và có trị tuyệt đối lớn, điều đó có ý nghĩa là:

a)

Không thể kết luận gì

b)

Hai biến có mối quan hệ ngẫu nhiên

c)

Khi x tăng thì y giảm

d)

Khi biến x tăng thì biến y cũng tăng

23.

Khi sử dụng quy hồi tuyến tính, bước đầu tiên là:

a)

Phân tích mối tương quan giữa các biến

b)

Vẽ biểu đồ phân bố chuẩn

c)

Ước lượng sai số

d)

Tạo báo cáo dự đoán

24.

Trong mô hình y = 2x, biến y được gọi là:

a)

Biến phụ thuộc

b)

Biến giải thích

c)

Biến độc lập

d)

Biến nguyên nhân

25.

Trong hồi quy logistic, biến phụ thuộc có dạng gì?

a)

Biến nhị phân

b)

Chuỗi ký tự

c)

Biến không xác định

d)

Số thực

26.

Hồi quy logistic nhị phân được dùng khi:

a)

Dự đoán biến định lượng

b)

Biến mục tiêu có nhiều mức độ

c)

Biến phụ thuộc có hai trạng thái

d)

Biến phụ thuộc là văn bản

27.

Khi sử dụng mô hình hồi quy logistic, kết quả đầu ra là:

a)

Phân phối chuẩn

b)

Hệ số tương quan

c)

Giá trị liên tục

d)

Xác suất và phân loại

28.

Biến đầu ra của hồi quy logistic có thể:

a)

A. Biến nhị phân

b)

B. Chuỗi ký tự

c)

C. Biến không xác định

d)

D. Số thực

29.

Mô hình hồi quy logistic sử dụng trong:

a)

Dự báo GDP

b)

Tính phương sai mẫu

c)

Phân tích khả năng mua hàng

d)

Dự đoán nhị phân (có/không)

30.

Hàm logistic có đặc điểm:

a)

A. Có giá trị âm vô hạn

b)

B. Là hàm tuyến tính

c)

C. Là hàm phi tuyến

d)

D. Giới hạn đầu ra từ 0 đến 1

31.

Hồi quy logistic khác hồi quy tuyến tính ở điểm:

a)

A. Biến phụ thuộc là nhị phân

b)

B. Không có hệ số chặn

c)

C. Không cần biến độc lập

d)

D. Dự đoán xác suất chứ không phải giá trị cụ thể

32.

Các loại hồi quy logistic bao gồm:

a)

Hồi quy logistic nhị phân

b)

Hồi quy tuyến tính

c)

Hồi quy logistic đa thức

d)

Hồi quy phi tuyến hoàn toàn

33.

Hồi quy logistic thường phù hợp với bài toán nào?

a)

Đánh giá mức độ hài lòng: kém, ổn, tốt, xuất sắc

b)

Dự đoán giá cổ phiếu

c)

Dự đoán điểm số học sinh theo xếp loại

d)

Dự đoán dân số

34.

Mục đích của việc sử dụng hồi quy logistic là: (chọn 2)

a)

A. Phân loại đối tượng

b)

B. Dự đoán giá trị liên tục

c)

C. Ước lượng xác suất xảy ra sự kiện

d)

D. Dự đoán xu hướng

35.

Mô hình nào có thể sử dụng để dự đoán xác suất?

a)

Dự đoán xác suất

b)

Vẽ biểu đồ tương quan

c)

Phân nhóm đối tượng

d)

Tính toán độ lệch chuẩn

36.

Đầu vào của mô hình logistic regression trong Sklearn là:

a)

Chỉ biến mục tiêu

b)

Một ma trận đặc trưng (X)

c)

Một cột dữ liệu văn bản

d)

Một biểu đồ

37.

Trong bài toán dự đoán mua hàng, tăng số lượt truy cập web sẽ:

a)

Có thể tăng xác suất mua hàng

b)

Giảm xác suất mua hàng

c)

Loại bỏ khách hàng

d)

Không ảnh hưởng

38.

Trong mô hình binary logistic, đầu ra của mô hình là:

a)

Một giá trị chuỗi

b)

Giá trị thực bất kỳ

c)

Tỉ lệ phần trăm lỗi

d)

Xác suất và nhãn 0/1

39.

Mô hình logistic có thể được dùng để:

a)

Phân tích hiệu quả chiến dịch marketing

b)

Phân tích tương quan

c)

Dự đoán khả năng khách hàng mua sản phẩm

d)

Xác định biến liên tục

40.

Khi sử dụng mô hình logistic, cần chia dữ liệu thành:

a)

Tập đánh giá độ lệch chuẩn

b)

Tập kiểm tra

c)

Tập huấn luyện

d)

Tập xác định trung bình

41.

Trong báo cáo phân loại, các chỉ số đánh giá hiệu quả mô hình gồm:

a)

Độ chính xác (accuracy)

b)

F1-score

c)

Biến độc lập

d)

Độ tương quan r

42.

Khi đánh giá mô hình logistic bằng classification_report, bạn nhận được:

a)

Biểu đồ tương quan

b)

Recall

c)

Đồ thị scatter

d)

Precision

43.

Mô hình logistic có thể áp dụng trong trường hợp:

a)

Dữ liệu huấn luyện nhị phân

b)

Xác suất xảy ra một hành vi

c)

Không có biến mục tiêu

d)

Dự đoán giá nhà chính xác

44.

Ưu điểm của hồi quy logistic trong phân tích kinh doanh là:

a)

A. Phân loại hiệu quả

b)

B. Dự đoán giá trị liên tục

c)

C. Không cần dữ liệu huấn luyện

d)

D. Dễ giải thích kết quả

45.

Trong mô hình logistic, biến đầu vào có thể là:

a)

A. Địa chỉ email

b)

B. Tên khách hàng

c)

C. Tuổi khách hàng

d)

D. Thu nhập hàng tháng

46.

Phân tích xác suất mua hàng dựa trên:

a)

Mô hình tuyến tính

b)

Biến định tính đã được mã hóa

c)

Tỷ số tương quan

d)

Biến định lượng

47.

Hàm logit dùng để làm gì trong hồi quy logistic?

a)

Ước lượng xác suất giữa 0 và 1

b)

Tính trung bình mẫu

c)

Tính khoảng tin cậy

d)

Kiểm định độc lập

48.

Mục tiêu của hồi quy logistic là gì?

a)

Giảm số chiều dữ liệu

b)

Dự đoán xác suất thuộc một nhóm

c)

Tính phương sai

d)

Tối ưu hóa chi phí

49.

Nếu mô hình logistic về nghiên cứu khả năng mua hàng của khách hàng mục tiêu có đầu vào là Age và Salary, biến mục tiêu phù hợp nhất là:

a)

Điểm trung bình

b)

Thu nhập

c)

Số lượt xem

d)

Mua hàng (0/1)

50.

Trong ma trận nhầm lẫn, giá trị nằm trên đường chéo chính đại diện cho:

a)

Tổng số dự đoán

b)

Dữ liệu huấn luyện

c)

Dự đoán sai

d)

Dự đoán đúng

51.

Trong mô hình binary logistic, nếu xác suất dự đoán là 0.8, mô hình sẽ:

a)

Gán nhãn 0

b)

Gán nhãn 1

c)

Không phân loại

d)

Tính lại trung bình

52.

Mô hình hồi quy logistic là gì?

a)

Mô hình tuyến tính đa biến

b)

Mô hình hồi quy đa thức

c)

Mô hình phân loại nhị phân

d)

Mô hình phân tích chuỗi thời gian

53.

Sau khi huấn luyện mô hình, lệnh model.predict(X_test) thực hiện việc:

a)

Dự đoán phân loại

b)

Tạo báo cáo huấn luyện

c)

Dự đoán xác suất

d)

Đánh giá dữ liệu

54.

Dạng tổng quát của hàm logit trả về giá trị

a)

Từ 0 đến 1

b)

Lớn hơn 100%

c)

Lớn hơn 1

d)

Bất kỳ số âm nào

55.

Trong học có giám sát, dữ liệu đầu ra thường là gì?

a)

Giá trị bị thiếu

b)

Dữ liệu văn bản

c)

Tập dữ liệu không phân loại

d)

Giá trị nhãn được gán trước

56.

Dữ liệu huấn luyện (training data) thường được dùng để:

a)

Huấn luyện mô hình

b)

Kiểm tra độ chính xác

c)

Xác định tập kiểm tra

d)

Tối ưu bộ nhớ

57.

Hai ví dụ của unsupervised learning là:

a)

A. Cây quyết định

b)

B. Phân cụm K-means

c)

C. Hồi quy tuyến tính

d)

D. Phân tích thành phần chính (PCA)

58.

Học tăng cường (reinforcement learning) liên quan đến:

a)

A. Ra quyết định tối ưu trong môi trường

b)

B. Không sử dụng phản hồi

c)

C. Giám sát chặt chẽ

d)

D. Thưởng và phạt

59.

Học không giám sát (unsupervised learning) dùng để:

a)

Phát hiện cấu trúc ẩn trong dữ liệu

b)

Huấn luyện mạng nơ-ron có nhãn

c)

Phân loại email spam

d)

Tìm cụm (clustering) trong dữ liệu

60.

Câu 6: Chọn 2 lý do tại sao supervised learning thường đạt độ chính xác cao hơn unsupervised learning:

a)

Vì supervised learning sử dụng dữ liệu đã gán nhãn để huấn luyện mô hình.

b)

Vì supervised learning có thể đánh giá hiệu quả dựa trên nhãn đúng.

c)

Vì unsupervised learning luôn có dữ liệu lớn hơn.

d)

Vì supervised learning không cần kiểm tra kết quả.

61.

Vì sao sau đây phù hợp nhất với supervised learning?

a)

Vì luôn dùng nhiều dữ liệu hơn

b)

Do chỉ dùng trong bài toán phân lớp

c)

Vì có thêm thông tin đầu ra từ dữ liệu huấn luyện

d)

Do được huấn luyện bằng dữ liệu không bị nhiễu

62.

Clustering là gì trong học máy?

a)

Phương pháp dán nhãn dữ liệu

b)

Phân nhóm các đối tượng dựa trên độ tương đồng

c)

Cách để dự đoán nhãn mới

d)

Xếp loại đầu ra có giám sát

63.

Reinforcement learning được dùng nhiều trong các ứng dụng nào?

a)

Phân cụm dữ liệu

b)

Chơi cờ, game tự động

c)

Điều khiển robot tự động

d)

Dự đoán thời tiết

64.

Semi-supervised learning là gì?

a)

Học tăng cường nhưng không có phản hồi

b)

Kết hợp cả dữ liệu có nhãn và không nhãn trong huấn luyện

c)

Dùng trong bài toán hồi quy

d)

Chỉ dùng dữ liệu có nhãn

65.

Khi nào nên dùng unsupervised learning?

a)

Khi cần gán nhãn tự động

b)

Khi dữ liệu có thể chia nhóm tự nhiên

c)

Khi không có nhãn cho dữ liệu

d)

Khi cần dự đoán đầu ra cụ thể

66.

Supervised learning hiệu quả nhất khi nào?

a)

Khi không có thông tin đầu ra

b)

Khi có nhiều dữ liệu đã được gán nhãn

c)

Khi đầu ra có thể đo lường được

d)

Khi dữ liệu đầu vào không liên quan đến đầu ra

67.

Trong bài toán dự đoán khách hàng rời bỏ dịch vụ, phương pháp nào sau đây phù hợp?

a)

A. Reinforcement learning

b)

B. Logistic Regression

c)

C. Random Forest

d)

D. Principal Component Analysis

68.

Bạn có dữ liệu hành vi truy cập website, không có nhãn. Mục tiêu là chia nhóm hành vi, bạn chọn:

a)

A. Unsupervised learning

b)

B. SVM

c)

C. Hồi quy logistic

d)

D. K-means

69.

Bạn muốn lập mô hình dự báo lượng tiêu thụ sản phẩm theo thời gian. Bạn nên sử dụng:

a)

A. Classification

b)

B. Linear regression

c)

C. Time series forecasting

d)

D. Reinforcement learning

70.

Trong việc xây dựng hệ thống đề xuất (recommendation system), bạn có thể sử dụng:

a)

A. Content-based Filtering

b)

B. Collaborative Filtering

c)

C. Hồi quy tuyến tính

d)

D. Clustering

71.

Để phân nhóm ảnh khuôn mặt theo nét tương đồng, bạn nên dùng:

a)

Hồi quy logistic

b)

Supervised learning

c)

Clustering

d)

PCA

72.

Với bài toán nhận diện chữ số viết tay (0-9), mô hình nào sau đây phù hợp?

a)

Logistic Regression

b)

K-means

c)

KNN

d)

Neural Network

73.

Bạn có dữ liệu ảnh mèo và chó đã được dán nhãn, muốn mô hình phân biệt hai loại này. Phương pháp nào phù hợp?

a)

Clustering

b)

Unsupervised learning

c)

SVM

d)

Classification

74.

Nếu bạn muốn huấn luyện mô hình chơi game tự động, nên dùng phương pháp nào?

a)

Supervised learning

b)

Unsupervised learning

c)

Clustering

d)

Reinforcement learning

75.

Unsupervised learning phù hợp với bài toán nào sau đây?

a)

Phân cụm khách hàng theo hành vi mua sắm

b)

Phân tích cấu trúc dữ liệu chưa nhãn

c)

Dự đoán giá nhà

d)

Phân loại thư rác

76.

Supervised learning khác với unsupervised learning ở điểm nào?

a)

Không có đầu vào

b)

Không yêu cầu đầu ra

c)

Có sử dụng dữ liệu có nhãn

d)

Không cần mô hình

77.

Điểm khác biệt của reinforcement learning là:

a)

Không học từ dữ liệu

b)

Không sử dụng bất kỳ nhãn nào

c)

Học thông qua phần thưởng và hình phạt từ môi trường

d)

Chỉ dùng trong bài toán hồi quy

78.

Trong bài toán phân nhóm khách hàng tiềm năng từ dữ liệu chưa có nhãn, bạn nên dùng:

a)

K-means

b)

Logistic Regression

c)

Clustering (phân cụm)

d)

Classification

79.

Mục tiêu chính của học máy là gì?

a)

Giảm dung lượng bộ nhớ

b)

Mô tả dữ liệu

c)

Tự động hóa các nhiệm vụ dựa trên dữ liệu

d)

Tạo đồ họa đẹp

80.

Bạn muốn xây dựng mô hình phân loại thư rác, nên dùng phương pháp nào?

a)

Linear regression

b)

Naive Bayes

c)

Decision Tree

d)

K-means clustering

81.

Supervised learning hoạt động như thế nào?

a)

Học từ tập dữ liệu có đầu ra được xác định trước

b)

Tự tạo ra đầu ra giả định

c)

Dựa vào phản hồi từ người dùng

d)

Huấn luyện mô hình với dữ liệu không có nhãn

82.

Nếu bạn có dữ liệu người dùng có thông tin giới tính, độ tuổi và số lượt truy cập web, phương pháp nào phù hợp để phân loại nhóm mua hàng?

a)

Supervised learning

b)

Random sampling

c)

Classification

d)

Clustering

83.

Định nghĩa cơ bản của Machine Learning là gì?

a)

Một cách để viết phần mềm thông thường

b)

Một hệ thống có thể học từ dữ liệu và cải thiện theo thời gian

c)

Một phương pháp lưu trữ dữ liệu

d)

Một lĩnh vực của y học

84.

Sinh viên chọn 2 phương án đúng nhất:

a)

Regression model

b)

K-means

c)

Hồi quy tuyến tính

d)

Decision Tree

85.

Trong phân tích dữ liệu kinh doanh, yếu tố nào giúp nâng cao độ tin cậy của phân tích chẩn đoán?

a)

Tập trung vào mô tả bề mặt

b)

Giảm quy mô dữ liệu phân tích

c)

Kết hợp dữ liệu chất lượng và chuyên môn

d)

Sử dụng độc lập không cần chuyên gia

86.

Phân tích chẩn đoán khác biệt cơ bản với phân tích mô tả ở điểm nào?

a)

Tập trung vào trả lời câu hỏi "tại sao?" thay vì câu hỏi "cái gì?"

b)

Yêu cầu dữ liệu lớn hơn

c)

Chỉ áp dụng cho lĩnh vực tài chính

d)

Sử dụng công cụ trực quan phức tạp hơn

87.

Nhận định nào đúng về phân tích chẩn đoán trong kinh doanh?

a)

Thay thế hoàn toàn vai trò quản lý

b)

Tự động đề xuất kế hoạch hành động

c)

Xác định mối quan hệ nhân quả tiềm ẩn

d)

Giải thích nguyên nhân sự kiện đã xảy ra

88.

Hạn chế của phân tích chẩn đoán trong kinh doanh bao gồm?

a)

Yêu cầu phần mềm đắt tiền

b)

Không trực tiếp đưa ra giải pháp

c)

Kết quả luôn chính xác tuyệt đối

d)

Chỉ dừng ở mức giải thích nguyên nhân

89.

Lợi ích doanh nghiệp nhận được từ phân tích chẩn đoán?

a)

Thay thế phân tích dự báo

b)

Ngăn chặn sai lầm tương tự trong tương lai

c)

Tạo nền tảng cho các chiến lược mới

d)

Tự động hóa toàn bộ quy trình vận hành

90.

Tình huống nào phù hợp áp dụng phân tích chẩn đoán trong kinh doanh?

a)

Dự báo doanh thu năm sau

b)

Tìm hiểu lý do khách hàng huỷ đơn hàng loạt

c)

Phân tích nhân khẩu học người dùng

d)

Lý giải nguyên nhân lợi nhuận sụt giảm đột ngột

91.

Yếu tố ảnh hưởng đến chất lượng phân tích chẩn đoán trong kinh doanh?

a)

Màu sắc báo cáo trực quan

b)

Tốc độ xử lý máy tính

c)

Sự tham gia của chuyên gia ngành

d)

Quy mô và chất lượng dữ liệu đầu vào

92.

Vai trò của chuyên gia trong phân tích chẩn đoán?

a)

Thiết kế giao diện báo cáo

b)

Thu thập dữ liệu thủ công

c)

Diễn giải kết quả thành hành động phù hợp

d)

Nâng cao độ tin cậy của kết luận

93.

Kết quả đầu ra của phân tích chẩn đoán trong kinh doanh?

a)

Báo cáo mô tả dữ liệu cơ bản

b)

Giả thuyết về nguyên nhân gốc rễ

c)

Danh sách giải pháp ưu tiên

d)

Xác định mối quan hệ giữa biến số

94.

Phân tích chẩn đoán cho thấy doanh thu của một doanh nghiệp giảm mạnh ở khu vực miền Trung. Dữ liệu nào sau đây ít liên quan nhất tới sự sụt giảm đó?

a)

Chính sách thuế mới của chính phủ

b)

Lương nhân viên bộ phận kế toán

c)

Báo cáo về số lượng khách hàng mua hàng

d)

Tỷ lệ click quảng cáo theo vùng