Font size
WorksheetsPHÂN TÍCH DỮ LIỆU KINH DOANH - BÀI 1
Total questions: 81
Worksheet time: 43mins
Khi coi phân tích dữ liệu là một "trào lưu" trong doanh nghiệp thì yếu tố nào được coi là quan trọng nhất?
Cơ cấu tổ chức doanh nghiệp
Văn hóa ra quyết định dựa trên dữ liệu
Tăng ngân sách quảng cáo
Công cụ kỹ thuật hiện đại
Trong doanh nghiệp, loại dữ liệu nào sau đây cần bảo mật ở mức cao nhất?
Dữ liệu bí mật
Dữ liệu công khai
Dữ liệu tiếp thị sản phẩm
Dữ liệu nhạy cảm
Theo phân loại dữ liệu doanh nghiệp, đâu là các ví dụ điển hình của dữ liệu phi cấu trúc?
Bài đăng trên mạng xã hội
Dữ liệu có định dạng XML
File Excel
Email khách hàng
Dữ liệu về tần suất mua hàng và sản phẩm ưa thích của khách hàng thường thuộc loại nào sau đây?
Tiếp thị - bán hàng
Khách hàng
Vận hành - sản xuất
Tài chính
Hai thách thức lớn nhất thường gặp khi thu thập dữ liệu kinh doanh là:
Dữ liệu không chính xác
Rủi ro về bảo mật
Khó lưu trữ thông tin
Khó thiết kế bảng hỏi
Đâu là lý do khiến phương pháp hỗn hợp được sử dụng trong phân tích dữ liệu kinh doanh: (chọn 2)
A. Tăng độ sâu và toàn diện của kết quả phân tích
B. Loại bỏ hoàn toàn sai lệch trong dữ liệu
C. Kết hợp được cả góc nhìn định tính và định lượng
D. Giúp tiết kiệm thời gian hơn dùng từng phương pháp riêng biệt
Đâu không phải là nguồn dữ liệu miễn phí hữu ích cho phân tích thị trường:
A. SurveyCTO
B. Google Trends
C. Google Docs
D. Kaggle
Trong quá trình phát triển công cụ thu thập dữ liệu kinh doanh, những yếu tố cần được đảm bảo?
Tính linh hoạt
Khả năng sao lưu
Tính hợp lệ
Độ tin cậy
Quá trình lựa chọn một nhóm đối tượng đại diện thay cho tổng thể là bước nào trong quy trình thu thập dữ liệu kinh doanh?
Lưu trữ dữ liệu
Thu thập dữ liệu
Chọn mẫu
Xác định mục tiêu
Những công cụ nào sau đây thường được sử dụng để thu thập dữ liệu khảo sát khách hàng trực tuyến?
(a)
Các thách thức chính trong quá trình thu thập dữ liệu kinh doanh là:
Giao diện không thân thiện
Tính bảo mật
Thiếu ngân sách
Dữ liệu không chính xác
Nguồn dữ liệu nào sau đây cung cấp dữ liệu miễn phí cho phân tích thị trường?
Outlook Web
Tik Tok Ads
Google Trends
Kaggle
Trong lúc phân tích dữ liệu kinh doanh, bạn sẽ dùng thư viện nào để kiểm định thống kê như t-test, phân phối chuẩn?
pandas
sklearn
scipy.stats
plotly
Khi áp dụng phương pháp phân tích định tính vào phân tích dữ liệu kinh doanh, bước nào sau đây giúp xác định các chủ đề nổi bật từ nội dung trả lời?
Tạo biểu mẫu Google Form
Vẽ biểu đồ tần suất
Phân cụm dữ liệu
Phân loại từ khóa
Thư viện nào trong Python chuyên dùng để trực quan hóa dữ liệu kinh doanh?
Seaborn
Matplotlib
NumPy
Pandas
Để thu thập dữ liệu kinh doanh định lượng, có thể dùng những công cụ nào sau đây?
SurveyMonkey
Excel
Word
Google Form
Trong quá trình phân tích dữ liệu kinh doanh, muốn kiểm tra dữ liệu bằng pandas, hai hàm nào giúp xem thông tin cơ bản về dữ liệu?
analyze()
show()
info()
describe()
Google Forms và SurveyMonkey là công cụ dùng để:
Thu thập dữ liệu từ khảo sát khách hàng trực tuyến
Viết bài phân tích dữ liệu kinh doanh
Tìm kiếm dữ liệu mã nguồn mở trên các nền tảng thương mại điện tử
Tạo biểu đồ tương tác
Trong phân tích dữ liệu kinh doanh, vì sao không nên sử dụng phương pháp thu thập dữ liệu định tính cho trường hợp phân tích thống kê quy mô lớn?
Không có khả năng xử lý bằng công cụ máy tính
Cần người có chuyên môn cao để phân tích
Dữ liệu không thể đo lường bằng số lượng
Dữ liệu thường thiếu khách quan
Trong quá trình thu thập dữ liệu kinh doanh, bước "chọn mẫu" có vai trò gì?
Giảm thiểu rủi ro bảo mật thông tin
Tối ưu hóa thời gian và chi phí thu thập dữ liệu
Tăng độ chi tiết của dữ liệu thu thập
Đảm bảo mẫu có đầy đủ cả định tính và định lượng
Khi thu thập dữ liệu kinh doanh bằng phương pháp định lượng, loại công cụ nào thường được sử dụng?
Bản đồ tư duy
Quan sát hành vi thực tế
Phỏng vấn sâu và ghi âm
Bảng hỏi với thang đo cố định như Likert
Khi đọc dữ liệu từ một file lưu trữ dữ liệu kinh doanh có định dạng .csv, bạn cần dùng thư viện nào?
pandas
matplotlib
sklearn
seaborn
Phân tích thống kê mô tả giúp doanh nghiệp hiểu rõ dữ liệu bằng cách:
A. Xây dựng mô hình dự báo
B. Tính toán các chỉ số như trung bình và độ lệch chuẩn
C. Trực quan hóa phân phối
D. Phân tích hồi quy đa biến
Ứng dụng phổ biến của phân tích thống kê mô tả trong kiểm tra dữ liệu kinh doanh bao gồm:
Kiểm tra tính hợp lệ của dữ liệu
Tạo mô hình học sâu
Xác định độ chính xác của mô hình dự đoán
Phát hiện vấn đề ngoại lệ
Phương pháp phân tích thống kê mô tả có vai trò gì trong phân tích dữ liệu kinh doanh?
A. Là bước đầu giúp hiểu dữ liệu
B. Là bước cuối cùng của phân tích
C. Phát hiện xu hướng và đặc điểm nổi bật
D. Dự đoán giá trị đầu ra của biến mục tiêu
Giả sử dữ liệu giá bán sản phẩm có dạng: [1.2, 1.5, 1.5, 1.7, 1.8, 2.0, 10.5]. Để loại bỏ ảnh hưởng của giá trị ngoại lai, nên dùng cặp chỉ số nào?
Mode + Range
Median + IQR
Mean + Variance
Mean + Std
Khi phân tích tần suất mua sản phẩm A của khách hàng, chỉ số nào quan trọng nhất?
A. Trung bình
B. Độ lệch chuẩn
Khi phân tích dữ liệu khách hàng có phân phối lệch trái, hãy chọn 2 chỉ số nên dùng thay cho chỉ số trung bình?
Phương sai (Variance)
Độ lệch chuẩn (Std)
Mốt (Mode)
Trung vị (Median)
Khi đánh giá hiệu quả đào tạo nhân viên, cặp chỉ số nào giúp đánh giá cả xu hướng trung tâm và độ phân tán?
Mean + Median
Median + IQR
Mean + Std
Mode + Range
Khi so sánh hiệu suất 2 nhà máy, chọn 2 chỉ số phù hợp nhất để báo cáo ban lãnh đạo?
IQR năng suất
Trung bình năng suất
Phân vị 95%
Skewness
Phân tích doanh thu bán hàng có Q * 1 = 500 triệu, Q * 3 = 800 triệu. Chọn 2 kết luận đúng?
A. ≥25% cửa hàng đạt ≤500 triệu
B. Không có cửa hàng nào vượt 1 tỷ
C. ≥75% cửa hàng đạt ≤800 triệu
D. Doanh thu trung bình là 650 triệu
Để đánh giá rủi ro tài chính của 2 dự án, nên kết hợp 2 chỉ số nào?
A. Trung bình lợi nhuận
B. Độ lệch chuẩn lợi nhuận
C. Kurtosis lợi nhuận
D. Mode lợi nhuận
Chỉ số Kurtosis = 4.5 của lợi nhuận quý cho biết điều gì về rủi ro đầu tư?
Rủi ro cao, nhiều biến động cực đoan
Không ảnh hưởng đến rủi ro
Rủi ro thấp, phân phối ổn định
Phân phối chuẩn lý tưởng
Mục tiêu chính của phân tích thống kê mô tả là gì?
Kiểm tra giả thuyết
Gắn nhãn dữ liệu bằng mô hình học máy
Dự báo xu hướng trong tương lai
Tóm tắt và mô tả đặc điểm của tập dữ liệu kinh doanh
Trong phân tích dữ liệu kinh doanh, phương sai và độ lệch chuẩn dùng để:
Đo mức độ phân tán của dữ liệu
Kiểm tra độ chính xác của mô hình
Phân nhóm dữ liệu
Tính trung vị dữ liệu
Một chuỗi siêu thị phân tích doanh thu 50 cửa hàng và phát hiện Q * 1 = 120 triệu, Q * 3 = 180 triệu. Khoảng IQR này cho biết điều gì về sự phân bố doanh thu?
Khoảng doanh thu của 50% cửa hàng nằm trong khoảng từ 120 triệu đến 180 triệu.
Doanh thu trung bình của các cửa hàng là 150 triệu.
Có sự chênh lệch lớn giữa doanh thu của các cửa hàng.
Doanh thu của các cửa hàng phân bố đều.
Một hệ số tương quan r = 0 có ý nghĩa gì?
Không tồn tại mối liên hệ tuyến tính
Không thể tính được hồi quy
Khi phân tích tương quan, tại sao cần xem cả đồ thị và hệ số r?
Vì đồ thị là không cần thiết
Vì r không thể tính trong mọi trường hợp
Vì giá trị r luôn đúng
Vì đồ thị cung cấp thông tin trực quan bổ sung
Một tương quan chặt có thể là giả khi:
A. Một biến có giá trị âm
B. Hai biến không có mối liên hệ thực sự
C. Mẫu dữ liệu quá nhỏ hoặc ngẫu nhiên
D. Các biến phụ thuộc lẫn nhau
Những mức độ ý nghĩa thống kê khi phân tích r bao gồm:
Bốn sao: p < 0.0001
Hai sao: p < 0.01
Không có sao nếu p > 0.1
Một sao: p < 0.05
Giá trị R-squared gần 1 cho thấy:
Mô hình không phù hợp
Sai số dự đoán lớn
Không có ý nghĩa thống kê
Mô hình giải thích tốt biến phụ thuộc
Trong mô hình hồi quy, hệ số hồi quy β thể hiện:
Độ chênh lệch trung bình
Sai số mô hình
Biến ngẫu nhiên của mô hình
Ảnh hưởng của biến độc lập lên biến phụ thuộc
Đặc điểm của hồi quy tuyến tính là: (chọn 2)
Dùng trong mọi loại dữ liệu định tính
Mô tả mối quan hệ tuyến tính giữa các biến
Luôn yêu cầu biến độc lập phải là số nguyên
Có thể sử dụng để dự đoán giá trị tương lai
Trong phân tích dữ liệu, hồi quy có thể được dùng để:
Dự báo xu hướng giá
Phân loại khách hàng
Mã hóa dữ liệu
Xác định ảnh hưởng giữa các biến
Tại sao cần phân tích tương quan trước khi hồi quy?
A. Để kiểm tra độ mạnh của mối liên hệ
B. Để xác định mô hình nhận quả phù hợp
C. Vì hồi quy không cần giả định gì
D. Vì không cần kiểm định giả thuyết
Mô hình hồi quy tuyến tính yêu cầu:
A. Giá trị biến phụ thuộc là dạng nhị phân
B. Không cần dữ liệu huấn luyện
C. Biến phụ thuộc là số lượng liên tục
D. Biến độc lập có thể là nhiều biến
Phân tích hồi quy có thể hỗ trợ doanh nghiệp: (chọn 2)
Mô hình hồi quy phi tuyến phù hợp khi:
Căn phân loại khách hàng
Dữ liệu bị thiếu hoàn toàn
Quan hệ giữa x và y không theo đường thẳng
Dữ liệu cho thấy xu hướng cong hoặc biến động
Trong mô hình hồi quy tuyến tính, biến phụ
Là biến được dùng để giải thích
Được dự đoán từ biến độc lập
Luôn có giá trị âm
Luôn là một hằng số
Giá trị của hệ số tương quan r luôn nằm trong khoảng:
[-0,5 ; 0,5]
[-1 ; 1]
[0 ; 1]
[-2 ; 2]
Trường hợp nào dưới đây phù hợp với mô hình hồi quy tuyến tính?
Dự đoán xu hướng phi tuyến tính
Phân loại văn bản
Dự đoán giá nhà dựa trên diện tích
Dự đoán kết quả có/không
Trong mô hình y = 2x, biến y được gọi là:
Biến phụ thuộc
Biến giải thích
Biến độc lập
Biến nguyên nhân
Trong hồi quy logistic, biến phụ thuộc có dạng gì?
Biến nhị phân
Chuỗi ký tự
Biến không xác định
Số thực
Mô hình hồi quy logistic sử dụng trong:
A. Dự báo GDP
B. Tính phương sai mẫu
C. Phân tích khả năng mua hàng
D. Dự đoán nhị phân (có/không)
Hồi quy logistic khác hồi quy tuyến tính ở điểm:
A. Biến phụ thuộc là nhị phân
B. Không có hệ số chặn
C. Không cần biến độc lập
D. Dự đoán xác suất chứ không phải giá trị cụ thể
Các loại hồi quy logistic bao gồm:
Hồi quy logistic nhị phân
Hồi quy tuyến tính
Hồi quy logistic đa thức
Hồi quy tuyến hoàn toàn
Hồi quy logistic thứ tự phù hợp với bài toán nào?
Đánh giá mức độ hài lòng: kém, ổn, tốt, xuất sắc
Dự báo GDP
Phân tích khả năng mua hàng
Tính phương sai mẫu
Mục đích của việc sử dụng hồi quy logistic là:
Dự đoán xác suất
Vẽ biểu đồ tương quan
Phân nhóm đối tượng
Tính toán độ lệch chuẩn
Đầu vào của mô hình logistic regression trong Sklearn là:
Chỉ biến mục tiêu
Một ma trận đặc trưng
Một cột dữ liệu văn bản
Một biểu đồ
Trong bài toán dự đoán mua hàng, tăng số lượt truy cập web sẽ:
Có thể tăng xác suất mua hàng
Giảm xác suất mua hàng
Loại bỏ khách hàng
Không ảnh hưởng
Khi sử dụng mô hình logistic, cần chia dữ liệu thành:
Tập đánh giá độ lệch chuẩn
Tập kiểm tra
Tập huấn luyện
Tập xác định trung bình
Phân tích xác suất mua hàng dựa trên:
Mô hình tuyến tính
Biến định tính đã được mã hóa
Tỷ số tương quan
Biến định lượng
Mô hình hồi quy logistic là gì?
Mô hình tuyến tính đa biến
Mô hình hồi quy đa thức
Mô hình phân loại nhị phân
Mô hình phân tích chuỗi thời gian
Sau khi huấn luyện mô hình, lệnh model.predict(X_test) thực hiện việc:
Dự đoán phân loại
Tạo báo cáo huấn luyện
Dự đoán xác suất
Đánh giá dữ liệu
Trong học có giám sát, dữ liệu đầu ra thường là gì?
Giá trị bị thiếu
Dữ liệu văn bản
Tập dữ liệu không phân loại
Giá trị nhãn được gán trước
Học tăng cường (reinforcement learning) liên quan đến:
Ra quyết định tối ưu trong môi trường
Không sử dụng phản hồi
Giám sát chặt chẽ
Thưởng và phạt
Học không giám sát (unsupervised learning) dùng để:
Phân cụm dữ liệu
Phân tích thành phần chính (PCA)
Dự đoán nhãn
Tối ưu hóa mô hình
Giá trị trả về của hàm predict_proba() trong Scikit-learn nằm trong khoảng nào?
Từ 0 đến 1
Lớn hơn 100%
Lớn hơn 1
Bất kỳ số âm nào
Tại sao supervised learning thường đạt độ chính xác cao hơn unsupervised learning?
Vì luôn dùng nhiều dữ liệu hơn
Do chỉ dùng trong bài toán phân lớp
Vì có thêm thông tin đầu ra từ dữ liệu huấn luyện
Do được huấn luyện bằng dữ liệu không bị nhiễu
Ví dụ nào sau đây phù hợp nhất với supervised learning?
Xác định chủ đề văn bản
Phân loại email là spam hoặc không spam
Dự đoán điểm thi dựa vào số giờ học
Tìm nhóm khách hàng tiềm năng
Clustering là gì trong học máy?
Phương pháp dán nhãn dữ liệu
Phân nhóm các đối tượng dựa trên độ tương đồng
Cách để dự đoán nhãn mới
Xếp loại đầu ra có giám sát
Reinforcement learning được dùng nhiều trong các ứng dụng nào?
Phân cụm dữ liệu
Chơi cờ, game tự động
Điều khiển robot tự động
Dự đoán thời tiết
Semi-supervised learning là gì?
Học tăng cường nhưng không có phản hồi
Kết hợp cả dữ liệu có nhãn và không nhãn trong huấn luyện
Dùng trong bài toán hồi quy
Chỉ dùng dữ liệu có nhãn
Khi nào nên dùng unsupervised learning?
Khi cần gán nhãn tự động
Khi dữ liệu có thể chia nhóm tự nhiên
Bạn có dữ liệu hành vi truy cập website, không có nhãn. Mục tiêu là chia nhóm hành vi, bạn chọn:
A. Unsupervised learning
B. SVM
C. Hồi quy logistic
D. K-means
Supervised learning khác với unsupervised learning ở điểm nào?
Không có đầu vào
Không yêu cầu đầu ra
Có sử dụng dữ liệu có nhãn
Không cần mô hình
Câu 23:
Không học từ dữ liệu
Không sử dụng bất kỳ nhãn nào
Học thông qua phần thưởng và hình phạt từ môi trường
Chỉ dùng trong bài toán hồi quy
Trong bài toán phân nhóm khách hàng tiềm năng từ dữ liệu chưa có nhãn, bạn nên dùng:
K-means
Logistic Regression
Clustering (phân cụm)
Classification
Mục tiêu chính của học máy là gì?
Giảm dung lượng bộ nhớ
Mô tả dữ liệu
Tự động hóa các nhiệm vụ dựa trên dữ liệu
Tạo đồ họa đẹp
Supervised learning hoạt động như thế nào?
Học từ tập dữ liệu có đầu ra được xác định trước
Tự tạo ra đầu ra giả định
Dựa vào phản hồi từ người dùng
Huấn luyện mô hình với dữ liệu không có nhãn
Nếu bạn có tập dữ liệu người dùng có thông tin giới tính, độ tuổi và số lượt truy cập web, phương pháp nào phù hợp để phân loại nhóm mua hàng?
Supervised learning
Random sampling
Classification
Clustering
