wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

PHÂN TÍCH DỮ LIỆU KINH DOANH - BÀI 1

Total questions: 81

Worksheet time: 43mins

Name
Class
Date
1.

Khi coi phân tích dữ liệu là một "trào lưu" trong doanh nghiệp thì yếu tố nào được coi là quan trọng nhất?

a)

Cơ cấu tổ chức doanh nghiệp

b)

Văn hóa ra quyết định dựa trên dữ liệu

c)

Tăng ngân sách quảng cáo

d)

Công cụ kỹ thuật hiện đại

2.

Trong doanh nghiệp, loại dữ liệu nào sau đây cần bảo mật ở mức cao nhất?

a)

Dữ liệu bí mật

b)

Dữ liệu công khai

c)

Dữ liệu tiếp thị sản phẩm

d)

Dữ liệu nhạy cảm

3.

Theo phân loại dữ liệu doanh nghiệp, đâu là các ví dụ điển hình của dữ liệu phi cấu trúc?

a)

Bài đăng trên mạng xã hội

b)

Dữ liệu có định dạng XML

c)

File Excel

d)

Email khách hàng

4.

Dữ liệu về tần suất mua hàng và sản phẩm ưa thích của khách hàng thường thuộc loại nào sau đây?

a)

Tiếp thị - bán hàng

b)

Khách hàng

c)

Vận hành - sản xuất

d)

Tài chính

5.

Hai thách thức lớn nhất thường gặp khi thu thập dữ liệu kinh doanh là:

a)

Dữ liệu không chính xác

b)

Rủi ro về bảo mật

c)

Khó lưu trữ thông tin

d)

Khó thiết kế bảng hỏi

6.

Đâu là lý do khiến phương pháp hỗn hợp được sử dụng trong phân tích dữ liệu kinh doanh: (chọn 2)

a)

A. Tăng độ sâu và toàn diện của kết quả phân tích

b)

B. Loại bỏ hoàn toàn sai lệch trong dữ liệu

c)

C. Kết hợp được cả góc nhìn định tính và định lượng

d)

D. Giúp tiết kiệm thời gian hơn dùng từng phương pháp riêng biệt

7.

Đâu không phải là nguồn dữ liệu miễn phí hữu ích cho phân tích thị trường:

a)

A. SurveyCTO

b)

B. Google Trends

c)

C. Google Docs

d)

D. Kaggle

8.

Trong quá trình phát triển công cụ thu thập dữ liệu kinh doanh, những yếu tố cần được đảm bảo?

a)

Tính linh hoạt

b)

Khả năng sao lưu

c)

Tính hợp lệ

d)

Độ tin cậy

9.

Quá trình lựa chọn một nhóm đối tượng đại diện thay cho tổng thể là bước nào trong quy trình thu thập dữ liệu kinh doanh?

a)

Lưu trữ dữ liệu

b)

Thu thập dữ liệu

c)

Chọn mẫu

d)

Xác định mục tiêu

10.

Những công cụ nào sau đây thường được sử dụng để thu thập dữ liệu khảo sát khách hàng trực tuyến?

(a)  

11.

Các thách thức chính trong quá trình thu thập dữ liệu kinh doanh là:

a)

Giao diện không thân thiện

b)

Tính bảo mật

c)

Thiếu ngân sách

d)

Dữ liệu không chính xác

12.

Nguồn dữ liệu nào sau đây cung cấp dữ liệu miễn phí cho phân tích thị trường?

a)

Outlook Web

b)

Tik Tok Ads

c)

Google Trends

d)

Kaggle

13.

Trong lúc phân tích dữ liệu kinh doanh, bạn sẽ dùng thư viện nào để kiểm định thống kê như t-test, phân phối chuẩn?

a)

pandas

b)

sklearn

c)

scipy.stats

d)

plotly

14.

Khi áp dụng phương pháp phân tích định tính vào phân tích dữ liệu kinh doanh, bước nào sau đây giúp xác định các chủ đề nổi bật từ nội dung trả lời?

a)

Tạo biểu mẫu Google Form

b)

Vẽ biểu đồ tần suất

c)

Phân cụm dữ liệu

d)

Phân loại từ khóa

15.

Thư viện nào trong Python chuyên dùng để trực quan hóa dữ liệu kinh doanh?

a)

Seaborn

b)

Matplotlib

c)

NumPy

d)

Pandas

16.

Để thu thập dữ liệu kinh doanh định lượng, có thể dùng những công cụ nào sau đây?

a)

SurveyMonkey

b)

Excel

c)

Word

d)

Google Form

17.

Trong quá trình phân tích dữ liệu kinh doanh, muốn kiểm tra dữ liệu bằng pandas, hai hàm nào giúp xem thông tin cơ bản về dữ liệu?

a)

analyze()

b)

show()

c)

info()

d)

describe()

18.

Google Forms và SurveyMonkey là công cụ dùng để:

a)

Thu thập dữ liệu từ khảo sát khách hàng trực tuyến

b)

Viết bài phân tích dữ liệu kinh doanh

c)

Tìm kiếm dữ liệu mã nguồn mở trên các nền tảng thương mại điện tử

d)

Tạo biểu đồ tương tác

19.

Trong phân tích dữ liệu kinh doanh, vì sao không nên sử dụng phương pháp thu thập dữ liệu định tính cho trường hợp phân tích thống kê quy mô lớn?

a)

Không có khả năng xử lý bằng công cụ máy tính

b)

Cần người có chuyên môn cao để phân tích

c)

Dữ liệu không thể đo lường bằng số lượng

d)

Dữ liệu thường thiếu khách quan

20.

Trong quá trình thu thập dữ liệu kinh doanh, bước "chọn mẫu" có vai trò gì?

a)

Giảm thiểu rủi ro bảo mật thông tin

b)

Tối ưu hóa thời gian và chi phí thu thập dữ liệu

c)

Tăng độ chi tiết của dữ liệu thu thập

d)

Đảm bảo mẫu có đầy đủ cả định tính và định lượng

21.

Khi thu thập dữ liệu kinh doanh bằng phương pháp định lượng, loại công cụ nào thường được sử dụng?

a)

Bản đồ tư duy

b)

Quan sát hành vi thực tế

c)

Phỏng vấn sâu và ghi âm

d)

Bảng hỏi với thang đo cố định như Likert

22.

Khi đọc dữ liệu từ một file lưu trữ dữ liệu kinh doanh có định dạng .csv, bạn cần dùng thư viện nào?

a)

pandas

b)

matplotlib

c)

sklearn

d)

seaborn

23.

Phân tích thống kê mô tả giúp doanh nghiệp hiểu rõ dữ liệu bằng cách:

a)

A. Xây dựng mô hình dự báo

b)

B. Tính toán các chỉ số như trung bình và độ lệch chuẩn

c)

C. Trực quan hóa phân phối

d)

D. Phân tích hồi quy đa biến

24.

Ứng dụng phổ biến của phân tích thống kê mô tả trong kiểm tra dữ liệu kinh doanh bao gồm:

a)

Kiểm tra tính hợp lệ của dữ liệu

b)

Tạo mô hình học sâu

c)

Xác định độ chính xác của mô hình dự đoán

d)

Phát hiện vấn đề ngoại lệ

25.

Phương pháp phân tích thống kê mô tả có vai trò gì trong phân tích dữ liệu kinh doanh?

a)

A. Là bước đầu giúp hiểu dữ liệu

b)

B. Là bước cuối cùng của phân tích

c)

C. Phát hiện xu hướng và đặc điểm nổi bật

d)

D. Dự đoán giá trị đầu ra của biến mục tiêu

26.

Giả sử dữ liệu giá bán sản phẩm có dạng: [1.2, 1.5, 1.5, 1.7, 1.8, 2.0, 10.5]. Để loại bỏ ảnh hưởng của giá trị ngoại lai, nên dùng cặp chỉ số nào?

a)

Mode + Range

b)

Median + IQR

c)

Mean + Variance

d)

Mean + Std

27.

Khi phân tích tần suất mua sản phẩm A của khách hàng, chỉ số nào quan trọng nhất?

a)

A. Trung bình

b)

B. Độ lệch chuẩn

28.

Khi phân tích dữ liệu khách hàng có phân phối lệch trái, hãy chọn 2 chỉ số nên dùng thay cho chỉ số trung bình?

a)

Phương sai (Variance)

b)

Độ lệch chuẩn (Std)

c)

Mốt (Mode)

d)

Trung vị (Median)

29.

Khi đánh giá hiệu quả đào tạo nhân viên, cặp chỉ số nào giúp đánh giá cả xu hướng trung tâm và độ phân tán?

a)

Mean + Median

b)

Median + IQR

c)

Mean + Std

d)

Mode + Range

30.

Khi so sánh hiệu suất 2 nhà máy, chọn 2 chỉ số phù hợp nhất để báo cáo ban lãnh đạo?

a)

IQR năng suất

b)

Trung bình năng suất

c)

Phân vị 95%

d)

Skewness

31.

Phân tích doanh thu bán hàng có Q * 1 = 500 triệu, Q * 3 = 800 triệu. Chọn 2 kết luận đúng?

a)

A. ≥25% cửa hàng đạt ≤500 triệu

b)

B. Không có cửa hàng nào vượt 1 tỷ

c)

C. ≥75% cửa hàng đạt ≤800 triệu

d)

D. Doanh thu trung bình là 650 triệu

32.

Để đánh giá rủi ro tài chính của 2 dự án, nên kết hợp 2 chỉ số nào?

a)

A. Trung bình lợi nhuận

b)

B. Độ lệch chuẩn lợi nhuận

c)

C. Kurtosis lợi nhuận

d)

D. Mode lợi nhuận

33.

Chỉ số Kurtosis = 4.5 của lợi nhuận quý cho biết điều gì về rủi ro đầu tư?

a)

Rủi ro cao, nhiều biến động cực đoan

b)

Không ảnh hưởng đến rủi ro

c)

Rủi ro thấp, phân phối ổn định

d)

Phân phối chuẩn lý tưởng

34.

Mục tiêu chính của phân tích thống kê mô tả là gì?

a)

Kiểm tra giả thuyết

b)

Gắn nhãn dữ liệu bằng mô hình học máy

c)

Dự báo xu hướng trong tương lai

d)

Tóm tắt và mô tả đặc điểm của tập dữ liệu kinh doanh

35.

Trong phân tích dữ liệu kinh doanh, phương sai và độ lệch chuẩn dùng để:

a)

Đo mức độ phân tán của dữ liệu

b)

Kiểm tra độ chính xác của mô hình

c)

Phân nhóm dữ liệu

d)

Tính trung vị dữ liệu

36.

Một chuỗi siêu thị phân tích doanh thu 50 cửa hàng và phát hiện Q * 1 = 120 triệu, Q * 3 = 180 triệu. Khoảng IQR này cho biết điều gì về sự phân bố doanh thu?

a)

Khoảng doanh thu của 50% cửa hàng nằm trong khoảng từ 120 triệu đến 180 triệu.

b)

Doanh thu trung bình của các cửa hàng là 150 triệu.

c)

Có sự chênh lệch lớn giữa doanh thu của các cửa hàng.

d)

Doanh thu của các cửa hàng phân bố đều.

37.

Một hệ số tương quan r = 0 có ý nghĩa gì?

a)

Không tồn tại mối liên hệ tuyến tính

b)

Không thể tính được hồi quy

38.

Khi phân tích tương quan, tại sao cần xem cả đồ thị và hệ số r?

a)

Vì đồ thị là không cần thiết

b)

Vì r không thể tính trong mọi trường hợp

c)

Vì giá trị r luôn đúng

d)

Vì đồ thị cung cấp thông tin trực quan bổ sung

39.

Một tương quan chặt có thể là giả khi:

a)

A. Một biến có giá trị âm

b)

B. Hai biến không có mối liên hệ thực sự

c)

C. Mẫu dữ liệu quá nhỏ hoặc ngẫu nhiên

d)

D. Các biến phụ thuộc lẫn nhau

40.

Những mức độ ý nghĩa thống kê khi phân tích r bao gồm:

a)

Bốn sao: p < 0.0001

b)

Hai sao: p < 0.01

c)

Không có sao nếu p > 0.1

d)

Một sao: p < 0.05

41.

Giá trị R-squared gần 1 cho thấy:

a)

Mô hình không phù hợp

b)

Sai số dự đoán lớn

c)

Không có ý nghĩa thống kê

d)

Mô hình giải thích tốt biến phụ thuộc

42.

Trong mô hình hồi quy, hệ số hồi quy β thể hiện:

a)

Độ chênh lệch trung bình

b)

Sai số mô hình

c)

Biến ngẫu nhiên của mô hình

d)

Ảnh hưởng của biến độc lập lên biến phụ thuộc

43.

Đặc điểm của hồi quy tuyến tính là: (chọn 2)

a)

Dùng trong mọi loại dữ liệu định tính

b)

Mô tả mối quan hệ tuyến tính giữa các biến

c)

Luôn yêu cầu biến độc lập phải là số nguyên

d)

Có thể sử dụng để dự đoán giá trị tương lai

44.

Trong phân tích dữ liệu, hồi quy có thể được dùng để:

a)

Dự báo xu hướng giá

b)

Phân loại khách hàng

c)

Mã hóa dữ liệu

d)

Xác định ảnh hưởng giữa các biến

45.

Tại sao cần phân tích tương quan trước khi hồi quy?

a)

A. Để kiểm tra độ mạnh của mối liên hệ

b)

B. Để xác định mô hình nhận quả phù hợp

c)

C. Vì hồi quy không cần giả định gì

d)

D. Vì không cần kiểm định giả thuyết

46.

Mô hình hồi quy tuyến tính yêu cầu:

a)

A. Giá trị biến phụ thuộc là dạng nhị phân

b)

B. Không cần dữ liệu huấn luyện

c)

C. Biến phụ thuộc là số lượng liên tục

d)

D. Biến độc lập có thể là nhiều biến

47.

Phân tích hồi quy có thể hỗ trợ doanh nghiệp: (chọn 2)

4 lines
48.

Mô hình hồi quy phi tuyến phù hợp khi:

a)

Căn phân loại khách hàng

b)

Dữ liệu bị thiếu hoàn toàn

c)

Quan hệ giữa x và y không theo đường thẳng

d)

Dữ liệu cho thấy xu hướng cong hoặc biến động

49.

Trong mô hình hồi quy tuyến tính, biến phụ

a)

Là biến được dùng để giải thích

b)

Được dự đoán từ biến độc lập

c)

Luôn có giá trị âm

d)

Luôn là một hằng số

50.

Giá trị của hệ số tương quan r luôn nằm trong khoảng:

a)

[-0,5 ; 0,5]

b)

[-1 ; 1]

c)

[0 ; 1]

d)

[-2 ; 2]

51.

Trường hợp nào dưới đây phù hợp với mô hình hồi quy tuyến tính?

a)

Dự đoán xu hướng phi tuyến tính

b)

Phân loại văn bản

c)

Dự đoán giá nhà dựa trên diện tích

d)

Dự đoán kết quả có/không

52.

Trong mô hình y = 2x, biến y được gọi là:

a)

Biến phụ thuộc

b)

Biến giải thích

c)

Biến độc lập

d)

Biến nguyên nhân

53.

Trong hồi quy logistic, biến phụ thuộc có dạng gì?

a)

Biến nhị phân

b)

Chuỗi ký tự

c)

Biến không xác định

d)

Số thực

54.

Mô hình hồi quy logistic sử dụng trong:

a)

A. Dự báo GDP

b)

B. Tính phương sai mẫu

c)

C. Phân tích khả năng mua hàng

d)

D. Dự đoán nhị phân (có/không)

55.

Hồi quy logistic khác hồi quy tuyến tính ở điểm:

a)

A. Biến phụ thuộc là nhị phân

b)

B. Không có hệ số chặn

c)

C. Không cần biến độc lập

d)

D. Dự đoán xác suất chứ không phải giá trị cụ thể

56.

Các loại hồi quy logistic bao gồm:

a)

Hồi quy logistic nhị phân

b)

Hồi quy tuyến tính

c)

Hồi quy logistic đa thức

d)

Hồi quy tuyến hoàn toàn

57.

Hồi quy logistic thứ tự phù hợp với bài toán nào?

a)

Đánh giá mức độ hài lòng: kém, ổn, tốt, xuất sắc

b)

Dự báo GDP

c)

Phân tích khả năng mua hàng

d)

Tính phương sai mẫu

58.

Mục đích của việc sử dụng hồi quy logistic là:

a)

Dự đoán xác suất

b)

Vẽ biểu đồ tương quan

c)

Phân nhóm đối tượng

d)

Tính toán độ lệch chuẩn

59.

Đầu vào của mô hình logistic regression trong Sklearn là:

a)

Chỉ biến mục tiêu

b)

Một ma trận đặc trưng

c)

Một cột dữ liệu văn bản

d)

Một biểu đồ

60.

Trong bài toán dự đoán mua hàng, tăng số lượt truy cập web sẽ:

a)

Có thể tăng xác suất mua hàng

b)

Giảm xác suất mua hàng

c)

Loại bỏ khách hàng

d)

Không ảnh hưởng

61.

Khi sử dụng mô hình logistic, cần chia dữ liệu thành:

a)

Tập đánh giá độ lệch chuẩn

b)

Tập kiểm tra

c)

Tập huấn luyện

d)

Tập xác định trung bình

62.

Phân tích xác suất mua hàng dựa trên:

a)

Mô hình tuyến tính

b)

Biến định tính đã được mã hóa

c)

Tỷ số tương quan

d)

Biến định lượng

63.

Mô hình hồi quy logistic là gì?

a)

Mô hình tuyến tính đa biến

b)

Mô hình hồi quy đa thức

c)

Mô hình phân loại nhị phân

d)

Mô hình phân tích chuỗi thời gian

64.

Sau khi huấn luyện mô hình, lệnh model.predict(X_test) thực hiện việc:

a)

Dự đoán phân loại

b)

Tạo báo cáo huấn luyện

c)

Dự đoán xác suất

d)

Đánh giá dữ liệu

65.

Trong học có giám sát, dữ liệu đầu ra thường là gì?

a)

Giá trị bị thiếu

b)

Dữ liệu văn bản

c)

Tập dữ liệu không phân loại

d)

Giá trị nhãn được gán trước

66.

Học tăng cường (reinforcement learning) liên quan đến:

a)

Ra quyết định tối ưu trong môi trường

b)

Không sử dụng phản hồi

c)

Giám sát chặt chẽ

d)

Thưởng và phạt

67.

Học không giám sát (unsupervised learning) dùng để:

a)

Phân cụm dữ liệu

b)

Phân tích thành phần chính (PCA)

c)

Dự đoán nhãn

d)

Tối ưu hóa mô hình

68.

Giá trị trả về của hàm predict_proba() trong Scikit-learn nằm trong khoảng nào?

a)

Từ 0 đến 1

b)

Lớn hơn 100%

c)

Lớn hơn 1

d)

Bất kỳ số âm nào

69.

Tại sao supervised learning thường đạt độ chính xác cao hơn unsupervised learning?

a)

Vì luôn dùng nhiều dữ liệu hơn

b)

Do chỉ dùng trong bài toán phân lớp

c)

Vì có thêm thông tin đầu ra từ dữ liệu huấn luyện

d)

Do được huấn luyện bằng dữ liệu không bị nhiễu

70.

Ví dụ nào sau đây phù hợp nhất với supervised learning?

a)

Xác định chủ đề văn bản

b)

Phân loại email là spam hoặc không spam

c)

Dự đoán điểm thi dựa vào số giờ học

d)

Tìm nhóm khách hàng tiềm năng

71.

Clustering là gì trong học máy?

a)

Phương pháp dán nhãn dữ liệu

b)

Phân nhóm các đối tượng dựa trên độ tương đồng

c)

Cách để dự đoán nhãn mới

d)

Xếp loại đầu ra có giám sát

72.

Reinforcement learning được dùng nhiều trong các ứng dụng nào?

a)

Phân cụm dữ liệu

b)

Chơi cờ, game tự động

c)

Điều khiển robot tự động

d)

Dự đoán thời tiết

73.

Semi-supervised learning là gì?

a)

Học tăng cường nhưng không có phản hồi

b)

Kết hợp cả dữ liệu có nhãn và không nhãn trong huấn luyện

c)

Dùng trong bài toán hồi quy

d)

Chỉ dùng dữ liệu có nhãn

74.

Khi nào nên dùng unsupervised learning?

a)

Khi cần gán nhãn tự động

b)

Khi dữ liệu có thể chia nhóm tự nhiên

75.

Bạn có dữ liệu hành vi truy cập website, không có nhãn. Mục tiêu là chia nhóm hành vi, bạn chọn:

a)

A. Unsupervised learning

b)

B. SVM

c)

C. Hồi quy logistic

d)

D. K-means

76.

Supervised learning khác với unsupervised learning ở điểm nào?

a)

Không có đầu vào

b)

Không yêu cầu đầu ra

c)

Có sử dụng dữ liệu có nhãn

d)

Không cần mô hình

77.

Câu 23:

a)

Không học từ dữ liệu

b)

Không sử dụng bất kỳ nhãn nào

c)

Học thông qua phần thưởng và hình phạt từ môi trường

d)

Chỉ dùng trong bài toán hồi quy

78.

Trong bài toán phân nhóm khách hàng tiềm năng từ dữ liệu chưa có nhãn, bạn nên dùng:

a)

K-means

b)

Logistic Regression

c)

Clustering (phân cụm)

d)

Classification

79.

Mục tiêu chính của học máy là gì?

a)

Giảm dung lượng bộ nhớ

b)

Mô tả dữ liệu

c)

Tự động hóa các nhiệm vụ dựa trên dữ liệu

d)

Tạo đồ họa đẹp

80.

Supervised learning hoạt động như thế nào?

a)

Học từ tập dữ liệu có đầu ra được xác định trước

b)

Tự tạo ra đầu ra giả định

c)

Dựa vào phản hồi từ người dùng

d)

Huấn luyện mô hình với dữ liệu không có nhãn

81.

Nếu bạn có tập dữ liệu người dùng có thông tin giới tính, độ tuổi và số lượt truy cập web, phương pháp nào phù hợp để phân loại nhóm mua hàng?

a)

Supervised learning

b)

Random sampling

c)

Classification

d)

Clustering