Font size
Worksheetsphân tích dữ liệu kinh doanh 2
Total questions: 94
Worksheet time: 50mins
Khi phân tích tương quan, tại sao cần xem cả đồ thị và hệ số r?
Hệ số tương quan nên được sử dụng khi nào?
Khi dữ liệu là định tính
Khi phân tích mức độ chặt chẽ của mối liên hệ
Khi muốn kiểm định tính nhân quả
Khi muốn xác định mối quan hệ tuyến tính giữa hai biến
Đâu là những yếu tố cần cân trọng khi giải thích r?
R luôn xác định được chiều tác động
Giá trị r không thể hiện quan hệ nhân quả
R có thể bị ảnh hưởng bởi yếu tố ngẫu nhiên
R có đơn vị đo lường cụ thể
Một tương quan chặt có thể là giả khi:
A. Một biến có giá trị âm
B. Hai biến không có mối liên hệ thực sự
C. Mẫu dữ liệu quá nhỏ hoặc ngẫu nhiên
D. Các biến phụ thuộc lẫn nhau
Những mức độ ý nghĩa thống kê khi phân tích r bao gồm:
B. Hai sao: p < 0.01
D. Một sao: p < 0.05
A. Bốn sao: p < 0.0001
C. Không có sao nếu p > 0.1
Mô hình hồi quy tuyến tính đa biến khác hồi quy đơn biến ở điểm nào?
Có nhiều biến phụ thuộc
Không có biến phụ thuộc
Có nhiều biến độc lập
Không cần kiểm tra tương quan
Giá trị R-squared gần 1 cho thấy:
Mô hình không phù hợp
Sai số dự đoán lớn
Không có ý nghĩa thống kê
Mô hình giải thích tốt biến phụ thuộc
Trong mô hình hồi quy, hệ số hồi quy β thể hiện:
Độ chênh lệch trung bình
Sai số mô hình
Biến ngẫu nhiên của mô hình
Ảnh hưởng của biến độc lập lên biến phụ thuộc
Đặc điểm của hồi quy tuyến tính là: (chọn 2)
Dùng trong mọi loại dữ liệu định tính
Mô tả mối quan hệ tuyến tính giữa các biến
Luôn yêu cầu biến độc lập phải là số nguyên
Có thể sử dụng để dự đoán giá trị tương lai
Trong phân tích dữ liệu, hồi quy có thể được dùng để:
Dự báo xu hướng giá
Phân loại khách hàng
Mã hóa dữ liệu
Xác định ảnh hưởng giữa các biến
Tại sao cần phân tích tương quan trước khi hồi quy?
A. Để kiểm tra độ mạnh của mỗi liên hệ
B. Để xác định mô hình nhân quả phù hợp
C. Vì hồi quy không cần giả định gì
D. Vì không cần kiểm định giả thuyết
Mô hình hồi quy tuyến tính yêu cầu:
A. Giá trị biến phụ thuộc là dạng nhị phân
B. Không cần dữ liệu huấn luyện
C. Biến phụ thuộc là số lượng liên tục
D. Biến độc lập có thể là nhiều biến
Phân tích hồi quy có thể hỗ trợ doanh nghiệp:
A. Kiểm tra bảo mật hệ thống
B. Tối ưu chi phí
C. Tính tỷ lệ lời sản phẩm
D. Dự đoán doanh thu
Mô hình hồi quy phi tuyến phù hợp khi nào?
Khi mối quan hệ giữa các biến không phải là tuyến tính và dữ liệu có xu hướng phi tuyến.
Khi tất cả các biến đều độc lập với nhau.
Khi dữ liệu không có sự biến động.
Khi mô hình tuyến tính không phù hợp với dữ liệu.
Trong mô hình hồi quy tuyến tính, biến phụ
Là biến được dùng để giải thích
Được dự đoán từ biến độc lập
Luôn có giá trị âm
Luôn là một hằng số
Trong phân tích hồi quy, biến nào sau đây được gọi là biến giải thích?
Biến độc lập
Biến ngẫu nhiên
Biến phụ thuộc
Biến đáp ứng
Biến phụ thuộc có giá trị:
Luôn bằng 0
Cố định
Độc lập với biến x
Không xác định
Giá trị của hệ số tương quan r luôn nằm trong khoảng:
[-0.5, 0.5]
[-1, 1]
[0, 1]
[-2, 2]
Nếu r = 0.9, điều này thể hiện:
Mối tương quan tuyến tính rất chặt
Mối quan hệ tuyến tính yếu
Mối quan hệ phi tuyến
Hai biến hoàn toàn không liên quan
Ý nghĩa của hệ số tương quan Pearson (r) là gì?
Lượng hóa mức độ chặt chẽ của mối quan hệ tuyến tính
Dự đoán chính xác giá trị biến phụ thuộc
Tính trung bình cộng của hai biến
Đo lường mối quan hệ phi tuyến giữa hai biến
Trường hợp nào dưới đây phù hợp với mô hình hồi quy tuyến tính?
Dự đoán xu hướng phi tuyến tính
Dự đoán xu hướng tuyến tính rất chặt
Dự đoán xu hướng tuyến tính yếu
Dự đoán xu hướng tuyến tính hoặc phi tuyến tính
Khi r < 0 và có trị tuyệt đối lớn, điều đó có ý nghĩa là:
Không thể kết luận gì
Hai biến có mối quan hệ ngẫu nhiên
Khi x tăng thì y giảm
Khi biến x tăng thì biến y cũng tăng
Khi sử dụng quy hồi tuyến tính, bước đầu tiên là:
Phân tích mối tương quan giữa các biến
Vẽ biểu đồ phân bố chuẩn
Ước lượng sai số
Tạo báo cáo dự đoán
Trong mô hình y = 2x, biến y được gọi là:
Biến phụ thuộc
Biến giải thích
Biến độc lập
Biến nguyên nhân
Trong hồi quy logistic, biến phụ thuộc có dạng gì?
Biến nhị phân
Chuỗi ký tự
Biến không xác định
Số thực
Hồi quy logistic nhị phân được dùng khi:
Dự đoán biến định lượng
Biến mục tiêu có nhiều mức độ
Biến phụ thuộc có hai trạng thái
Biến phụ thuộc là văn bản
Khi sử dụng mô hình hồi quy logistic, kết quả đầu ra là:
Phân phối chuẩn
Hệ số tương quan
Giá trị liên tục
Xác suất và phân loại
Biến đầu ra của hồi quy logistic có thể:
A. Biến nhị phân
B. Chuỗi ký tự
C. Biến không xác định
D. Số thực
Mô hình hồi quy logistic sử dụng trong:
Dự báo GDP
Tính phương sai mẫu
Phân tích khả năng mua hàng
Dự đoán nhị phân (có/không)
Hàm logistic có đặc điểm:
A. Có giá trị âm vô hạn
B. Là hàm tuyến tính
C. Là hàm phi tuyến
D. Giới hạn đầu ra từ 0 đến 1
Hồi quy logistic khác hồi quy tuyến tính ở điểm:
A. Biến phụ thuộc là nhị phân
B. Không có hệ số chặn
C. Không cần biến độc lập
D. Dự đoán xác suất chứ không phải giá trị cụ thể
Các loại hồi quy logistic bao gồm:
Hồi quy logistic nhị phân
Hồi quy tuyến tính
Hồi quy logistic đa thức
Hồi quy phi tuyến hoàn toàn
Hồi quy logistic thường phù hợp với bài toán nào?
Đánh giá mức độ hài lòng: kém, ổn, tốt, xuất sắc
Dự đoán giá cổ phiếu
Dự đoán điểm số học sinh theo xếp loại
Dự đoán dân số
Mục đích của việc sử dụng hồi quy logistic là: (chọn 2)
A. Phân loại đối tượng
B. Dự đoán giá trị liên tục
C. Ước lượng xác suất xảy ra sự kiện
D. Dự đoán xu hướng
Mô hình nào có thể sử dụng để dự đoán xác suất?
Dự đoán xác suất
Vẽ biểu đồ tương quan
Phân nhóm đối tượng
Tính toán độ lệch chuẩn
Đầu vào của mô hình logistic regression trong Sklearn là:
Chỉ biến mục tiêu
Một ma trận đặc trưng (X)
Một cột dữ liệu văn bản
Một biểu đồ
Trong bài toán dự đoán mua hàng, tăng số lượt truy cập web sẽ:
Có thể tăng xác suất mua hàng
Giảm xác suất mua hàng
Loại bỏ khách hàng
Không ảnh hưởng
Trong mô hình binary logistic, đầu ra của mô hình là:
Một giá trị chuỗi
Giá trị thực bất kỳ
Tỉ lệ phần trăm lỗi
Xác suất và nhãn 0/1
Mô hình logistic có thể được dùng để:
Phân tích hiệu quả chiến dịch marketing
Phân tích tương quan
Dự đoán khả năng khách hàng mua sản phẩm
Xác định biến liên tục
Khi sử dụng mô hình logistic, cần chia dữ liệu thành:
Tập đánh giá độ lệch chuẩn
Tập kiểm tra
Tập huấn luyện
Tập xác định trung bình
Trong báo cáo phân loại, các chỉ số đánh giá hiệu quả mô hình gồm:
Độ chính xác (accuracy)
F1-score
Biến độc lập
Độ tương quan r
Khi đánh giá mô hình logistic bằng classification_report, bạn nhận được:
Biểu đồ tương quan
Recall
Đồ thị scatter
Precision
Mô hình logistic có thể áp dụng trong trường hợp:
Dữ liệu huấn luyện nhị phân
Xác suất xảy ra một hành vi
Không có biến mục tiêu
Dự đoán giá nhà chính xác
Ưu điểm của hồi quy logistic trong phân tích kinh doanh là:
A. Phân loại hiệu quả
B. Dự đoán giá trị liên tục
C. Không cần dữ liệu huấn luyện
D. Dễ giải thích kết quả
Trong mô hình logistic, biến đầu vào có thể là:
A. Địa chỉ email
B. Tên khách hàng
C. Tuổi khách hàng
D. Thu nhập hàng tháng
Phân tích xác suất mua hàng dựa trên:
Mô hình tuyến tính
Biến định tính đã được mã hóa
Tỷ số tương quan
Biến định lượng
Hàm logit dùng để làm gì trong hồi quy logistic?
Ước lượng xác suất giữa 0 và 1
Tính trung bình mẫu
Tính khoảng tin cậy
Kiểm định độc lập
Mục tiêu của hồi quy logistic là gì?
Giảm số chiều dữ liệu
Dự đoán xác suất thuộc một nhóm
Tính phương sai
Tối ưu hóa chi phí
Nếu mô hình logistic về nghiên cứu khả năng mua hàng của khách hàng mục tiêu có đầu vào là Age và Salary, biến mục tiêu phù hợp nhất là:
Điểm trung bình
Thu nhập
Số lượt xem
Mua hàng (0/1)
Trong ma trận nhầm lẫn, giá trị nằm trên đường chéo chính đại diện cho:
Tổng số dự đoán
Dữ liệu huấn luyện
Dự đoán sai
Dự đoán đúng
Trong mô hình binary logistic, nếu xác suất dự đoán là 0.8, mô hình sẽ:
Gán nhãn 0
Gán nhãn 1
Không phân loại
Tính lại trung bình
Mô hình hồi quy logistic là gì?
Mô hình tuyến tính đa biến
Mô hình hồi quy đa thức
Mô hình phân loại nhị phân
Mô hình phân tích chuỗi thời gian
Sau khi huấn luyện mô hình, lệnh model.predict(X_test) thực hiện việc:
Dự đoán phân loại
Tạo báo cáo huấn luyện
Dự đoán xác suất
Đánh giá dữ liệu
Dạng tổng quát của hàm logit trả về giá trị
Từ 0 đến 1
Lớn hơn 100%
Lớn hơn 1
Bất kỳ số âm nào
Trong học có giám sát, dữ liệu đầu ra thường là gì?
Giá trị bị thiếu
Dữ liệu văn bản
Tập dữ liệu không phân loại
Giá trị nhãn được gán trước
Dữ liệu huấn luyện (training data) thường được dùng để:
Huấn luyện mô hình
Kiểm tra độ chính xác
Xác định tập kiểm tra
Tối ưu bộ nhớ
Hai ví dụ của unsupervised learning là:
A. Cây quyết định
B. Phân cụm K-means
C. Hồi quy tuyến tính
D. Phân tích thành phần chính (PCA)
Học tăng cường (reinforcement learning) liên quan đến:
A. Ra quyết định tối ưu trong môi trường
B. Không sử dụng phản hồi
C. Giám sát chặt chẽ
D. Thưởng và phạt
Học không giám sát (unsupervised learning) dùng để:
Phát hiện cấu trúc ẩn trong dữ liệu
Huấn luyện mạng nơ-ron có nhãn
Phân loại email spam
Tìm cụm (clustering) trong dữ liệu
Câu 6: Chọn 2 lý do tại sao supervised learning thường đạt độ chính xác cao hơn unsupervised learning:
Vì supervised learning sử dụng dữ liệu đã gán nhãn để huấn luyện mô hình.
Vì supervised learning có thể đánh giá hiệu quả dựa trên nhãn đúng.
Vì unsupervised learning luôn có dữ liệu lớn hơn.
Vì supervised learning không cần kiểm tra kết quả.
Vì sao sau đây phù hợp nhất với supervised learning?
Vì luôn dùng nhiều dữ liệu hơn
Do chỉ dùng trong bài toán phân lớp
Vì có thêm thông tin đầu ra từ dữ liệu huấn luyện
Do được huấn luyện bằng dữ liệu không bị nhiễu
Clustering là gì trong học máy?
Phương pháp dán nhãn dữ liệu
Phân nhóm các đối tượng dựa trên độ tương đồng
Cách để dự đoán nhãn mới
Xếp loại đầu ra có giám sát
Reinforcement learning được dùng nhiều trong các ứng dụng nào?
Phân cụm dữ liệu
Chơi cờ, game tự động
Điều khiển robot tự động
Dự đoán thời tiết
Semi-supervised learning là gì?
Học tăng cường nhưng không có phản hồi
Kết hợp cả dữ liệu có nhãn và không nhãn trong huấn luyện
Dùng trong bài toán hồi quy
Chỉ dùng dữ liệu có nhãn
Khi nào nên dùng unsupervised learning?
Khi cần gán nhãn tự động
Khi dữ liệu có thể chia nhóm tự nhiên
Khi không có nhãn cho dữ liệu
Khi cần dự đoán đầu ra cụ thể
Supervised learning hiệu quả nhất khi nào?
Khi không có thông tin đầu ra
Khi có nhiều dữ liệu đã được gán nhãn
Khi đầu ra có thể đo lường được
Khi dữ liệu đầu vào không liên quan đến đầu ra
Trong bài toán dự đoán khách hàng rời bỏ dịch vụ, phương pháp nào sau đây phù hợp?
A. Reinforcement learning
B. Logistic Regression
C. Random Forest
D. Principal Component Analysis
Bạn có dữ liệu hành vi truy cập website, không có nhãn. Mục tiêu là chia nhóm hành vi, bạn chọn:
A. Unsupervised learning
B. SVM
C. Hồi quy logistic
D. K-means
Bạn muốn lập mô hình dự báo lượng tiêu thụ sản phẩm theo thời gian. Bạn nên sử dụng:
A. Classification
B. Linear regression
C. Time series forecasting
D. Reinforcement learning
Trong việc xây dựng hệ thống đề xuất (recommendation system), bạn có thể sử dụng:
A. Content-based Filtering
B. Collaborative Filtering
C. Hồi quy tuyến tính
D. Clustering
Để phân nhóm ảnh khuôn mặt theo nét tương đồng, bạn nên dùng:
Hồi quy logistic
Supervised learning
Clustering
PCA
Với bài toán nhận diện chữ số viết tay (0-9), mô hình nào sau đây phù hợp?
Logistic Regression
K-means
KNN
Neural Network
Bạn có dữ liệu ảnh mèo và chó đã được dán nhãn, muốn mô hình phân biệt hai loại này. Phương pháp nào phù hợp?
Clustering
Unsupervised learning
SVM
Classification
Nếu bạn muốn huấn luyện mô hình chơi game tự động, nên dùng phương pháp nào?
Supervised learning
Unsupervised learning
Clustering
Reinforcement learning
Unsupervised learning phù hợp với bài toán nào sau đây?
Phân cụm khách hàng theo hành vi mua sắm
Phân tích cấu trúc dữ liệu chưa nhãn
Dự đoán giá nhà
Phân loại thư rác
Supervised learning khác với unsupervised learning ở điểm nào?
Không có đầu vào
Không yêu cầu đầu ra
Có sử dụng dữ liệu có nhãn
Không cần mô hình
Điểm khác biệt của reinforcement learning là:
Không học từ dữ liệu
Không sử dụng bất kỳ nhãn nào
Học thông qua phần thưởng và hình phạt từ môi trường
Chỉ dùng trong bài toán hồi quy
Trong bài toán phân nhóm khách hàng tiềm năng từ dữ liệu chưa có nhãn, bạn nên dùng:
K-means
Logistic Regression
Clustering (phân cụm)
Classification
Mục tiêu chính của học máy là gì?
Giảm dung lượng bộ nhớ
Mô tả dữ liệu
Tự động hóa các nhiệm vụ dựa trên dữ liệu
Tạo đồ họa đẹp
Bạn muốn xây dựng mô hình phân loại thư rác, nên dùng phương pháp nào?
Linear regression
Naive Bayes
Decision Tree
K-means clustering
Supervised learning hoạt động như thế nào?
Học từ tập dữ liệu có đầu ra được xác định trước
Tự tạo ra đầu ra giả định
Dựa vào phản hồi từ người dùng
Huấn luyện mô hình với dữ liệu không có nhãn
Nếu bạn có dữ liệu người dùng có thông tin giới tính, độ tuổi và số lượt truy cập web, phương pháp nào phù hợp để phân loại nhóm mua hàng?
Supervised learning
Random sampling
Classification
Clustering
Định nghĩa cơ bản của Machine Learning là gì?
Một cách để viết phần mềm thông thường
Một hệ thống có thể học từ dữ liệu và cải thiện theo thời gian
Một phương pháp lưu trữ dữ liệu
Một lĩnh vực của y học
Sinh viên chọn 2 phương án đúng nhất:
Regression model
K-means
Hồi quy tuyến tính
Decision Tree
Trong phân tích dữ liệu kinh doanh, yếu tố nào giúp nâng cao độ tin cậy của phân tích chẩn đoán?
Tập trung vào mô tả bề mặt
Giảm quy mô dữ liệu phân tích
Kết hợp dữ liệu chất lượng và chuyên môn
Sử dụng độc lập không cần chuyên gia
Phân tích chẩn đoán khác biệt cơ bản với phân tích mô tả ở điểm nào?
Tập trung vào trả lời câu hỏi "tại sao?" thay vì câu hỏi "cái gì?"
Yêu cầu dữ liệu lớn hơn
Chỉ áp dụng cho lĩnh vực tài chính
Sử dụng công cụ trực quan phức tạp hơn
Nhận định nào đúng về phân tích chẩn đoán trong kinh doanh?
Thay thế hoàn toàn vai trò quản lý
Tự động đề xuất kế hoạch hành động
Xác định mối quan hệ nhân quả tiềm ẩn
Giải thích nguyên nhân sự kiện đã xảy ra
Hạn chế của phân tích chẩn đoán trong kinh doanh bao gồm?
Yêu cầu phần mềm đắt tiền
Không trực tiếp đưa ra giải pháp
Kết quả luôn chính xác tuyệt đối
Chỉ dừng ở mức giải thích nguyên nhân
Lợi ích doanh nghiệp nhận được từ phân tích chẩn đoán?
Thay thế phân tích dự báo
Ngăn chặn sai lầm tương tự trong tương lai
Tạo nền tảng cho các chiến lược mới
Tự động hóa toàn bộ quy trình vận hành
Tình huống nào phù hợp áp dụng phân tích chẩn đoán trong kinh doanh?
Dự báo doanh thu năm sau
Tìm hiểu lý do khách hàng huỷ đơn hàng loạt
Phân tích nhân khẩu học người dùng
Lý giải nguyên nhân lợi nhuận sụt giảm đột ngột
Yếu tố ảnh hưởng đến chất lượng phân tích chẩn đoán trong kinh doanh?
Màu sắc báo cáo trực quan
Tốc độ xử lý máy tính
Sự tham gia của chuyên gia ngành
Quy mô và chất lượng dữ liệu đầu vào
Vai trò của chuyên gia trong phân tích chẩn đoán?
Thiết kế giao diện báo cáo
Thu thập dữ liệu thủ công
Diễn giải kết quả thành hành động phù hợp
Nâng cao độ tin cậy của kết luận
Kết quả đầu ra của phân tích chẩn đoán trong kinh doanh?
Báo cáo mô tả dữ liệu cơ bản
Giả thuyết về nguyên nhân gốc rễ
Danh sách giải pháp ưu tiên
Xác định mối quan hệ giữa biến số
Phân tích chẩn đoán cho thấy doanh thu của một doanh nghiệp giảm mạnh ở khu vực miền Trung. Dữ liệu nào sau đây ít liên quan nhất tới sự sụt giảm đó?
Chính sách thuế mới của chính phủ
Lương nhân viên bộ phận kế toán
Báo cáo về số lượng khách hàng mua hàng
Tỷ lệ click quảng cáo theo vùng
