Font size
WorksheetsBài tập phân tích dữ liệu và biến số
Total questions: 90
Worksheet time: 50mins
Trong đồ thị y = 2x, x nằm trên trục nào?
Trục z
Trục x
Trục y
Không xác định
Biến độc lập thường được hiểu là:
Biến giải thích
Biến dự đoán
Biến phụ thuộc
Biến phản ứng
Biến phụ thuộc còn được gọi là:
Biến kết quả
Biến phản ứng
Biến giải thích
Biến độc lập
Trong các mô hình phân tích, biến độc lập có thể:
Ảnh hưởng đến biến phụ thuộc
Được xác định sau khi phân tích
Là yếu tố nguyên nhân
Không có giá trị cụ thể
Trong phân tích dữ liệu, biến phụ thuộc có đặc điểm nào sau đây:
Có giá trị ngẫu nhiên
Luôn cố định
Luôn bằng giá trị trung bình
Phụ thuộc vào biến x
Một hệ số tương quan r = 0 có ý nghĩa gì?
Không tồn tại mối liên hệ tuyến tính
Hai biến độc lập hoàn toàn
Một biến luôn bằng 0
Không thể tính được hồi quy
Khi phân tích tương quan, tại sao cần xem cả đồ thị và hệ số r?
Vì đồ thị cung cấp thông tin trực quan bổ sung
Vì đồ thị là không cần thiết
Vì r không thể tính trong mọi trường hợp
Vì giá trị r luôn đúng
Hệ số tương quan nên được sử dụng khi nào?
Khi phân tích mức độ chặt chẽ của mối liên hệ
Khi dữ liệu là định tính
Khi muốn xác định mối quan hệ tuyến tính giữa hai biến
Khi muốn kiểm định tính nhân quả
Đâu là những yếu tố cần cân trọng khi giải thích r?
R luôn xác định được chiều tác động
Giá trị r không thể hiện quan hệ nhân quả
R có đơn vị đo lường cụ thể
R có thể bị ảnh hưởng bởi yếu tố ngẫu nhiên
Một tương quan chặt có thể là giả khi:
Các biến phụ thuộc lẫn nhau
Một biến có giá trị âm
Mẫu dữ liệu quá nhỏ hoặc ngẫu nhiên
Hai biến không có mối liên hệ thực sự
Những mức độ ý nghĩa thống kê khi phân tích r bao gồm:
Một sao: p < 0.05
Bốn sao: p < 0.0001
Hai sao: p < 0.01
Không có sao nếu p > 0.1
Mô hình hồi quy tuyến tính đa biến khác hồi quy đơn biến ở điểm nào?
Có nhiều biến độc lập
Không có biến phụ thuộc
Không cần kiểm tra tương quan
Có nhiều biến phụ thuộc
Giá trị R-squared gần 1 cho thấy:
Số dự đoán lớn
Mô hình giải thích tốt biến phụ thuộc
Mô hình không phù hợp
Không có ý nghĩa thống kê
Trong mô hình hồi quy, hệ số hồi quy ß thể hiện:
Ảnh hưởng của biến độc lập lên biến phụ thuộc
Độ chênh lệch trung bình
Sai số mô hình
Biến ngẫu nhiên của mô hình
Đặc điểm của hồi quy tuyến tính là:
Dùng trong mọi loại dữ liệu định tính
Luôn yêu cầu biến độc lập phải là số nguyên
Mô tả mối quan hệ tuyến tính giữa các biến
Có thể sử dụng để dự đoán giá trị tương lai
Trong phân tích dữ liệu, hồi quy có thể được dùng để:
Phân loại khách hàng
Mã hóa dữ liệu
Dự báo xu hướng giá
Xác định ảnh hưởng giữa các biến
Tại sao cần phân tích tương quan trước khi hồi quy?
Vì không cần kiểm định giả thuyết
Để xác định mô hình nhân quả phù hợp
Để kiểm tra độ mạnh của mối liên hệ
Vì hồi quy không cần giả định gì
Mô hình hồi quy tuyến tính yêu cầu:
Biến phụ thuộc là số lượng liên tục
Không cần dữ liệu huấn luyện
Giá trị biến phụ thuộc là dạng nhị phân
Biến độc lập có thể là nhiều biến
Phân tích hồi quy có thể hỗ trợ doanh nghiệp:
Tính tỷ lệ lỗi sản phẩm
Kiểm tra bảo mật hệ thống
Tối ưu chi phí
Dự đoán doanh thu
Mô hình hồi quy phi tuyến phù hợp khi:
Dữ liệu bị thiếu hoàn toàn
Dữ liệu cho thấy xu hướng cong hoặc biến động
Cần phân loại khách hàng
Quan hệ giữa x và y không theo đường thẳng
Trong mô hình hồi quy tuyến tính, biến phụ
Là biến được dùng để giải thích
Được dự đoán từ biến độc lập
Luôn có giá trị âm
Luôn là một hằng số
Trong phân tích hồi quy, biến nào sau đây được gọi là biến giải thích?
Biến độc lập
Biến ngẫu nhiên
Biến phụ thuộc
Biến đáp ứng
Biến phụ thuộc có giá trị:
Luôn bằng 0
Cố định
Độc lập với biến x
Không xác định
Giá trị của hệ số tương quan r luôn nằm trong khoảng:
[-0.5 , 0.5]
[-1 , 1]
[0 , 1]
[-2 , 2]
Nếu r = 0.9, điều này thể hiện:
Mối tương quan tuyến tính rất chặt
Mối quan hệ tuyến tính yếu
Mối quan hệ phi tuyến
Hai biến hoàn toàn không liên quan
Ý nghĩa của hệ số tương quan Pearson (r) là gì?
Lượng hóa mức độ chặt chẽ của mối quan hệ tuyến tính
Dự đoán chính xác giá trị biến phụ thuộc
Tính trung bình cộng của hai biến
Đo lường mối quan hệ phi tuyến giữa hai biến
Trường hợp nào dưới đây phù hợp với mô hình hồi quy tuyến tính?
Dự đoán xu hướng phi tuyến tính
Phân loại văn bản
Dự đoán giá nhà dựa trên diện tích
Dự đoán kết quả có/không
Khi r < 0 và có trị tuyệt đối lớn, điều đó có ý nghĩa là:
Không thể kết luận gì
Hai biến có mối quan hệ ngẫu nhiên
Khi x tăng thì y giảm
Khi biến x tăng thì biến y cũng tăng
Khi sử dụng quy hồi tuyến tính, bước đầu tiên là:
Phân tích mối tương quan giữa các biến
Vẽ biểu đồ phân bố chuẩn
Ước lượng sai số
Tạo báo cáo dự đoán
Trong mô hình y = 2x, biến y được gọi là:
Biến phụ thuộc
Biến giải thích
Biến độc lập
Biến nguyên nhân
Trong hồi quy logistic, biến phụ thuộc có dạng gì?
Chuỗi ký tự
Số thực
Biến nhị phân
Biến không xác định
Hồi quy logistic nhị phân được dùng khi:
Dự đoán biến định lượng
Biến phụ thuộc là văn bản
Biến phụ thuộc có hai trạng thái
Biến mục tiêu có nhiều mức độ
Khi sử dụng mô hình hồi quy logistic, kết quả đầu ra là:
Phân phối chuẩn
Hệ số tương quan
Giá trị liên tục
Xác suất và phân loại
Đầu vào của mô hình logistic regression trong Sklearn là:
Một biểu đồ
Một ma trận đặc trưng (X)
Chỉ biến mục tiêu
Một cột dữ liệu văn bản
Trong bài toán dự đoán mua hàng, tăng số lượt truy cập web sẽ:
Loại bỏ khách hàng
Có thể tăng xác suất mua hàng
Giảm xác suất mua hàng
Không ảnh hưởng
Trong mô hình binary logistic, đầu ra của mô hình là:
Xác suất và nhãn 0/1
Một giá trị chuỗi
Giá trị thực bất kỳ
Tỉ lệ phần trăm lồi
Biến đầu ra của hồi quy logistic có thể:
Nhận giá trị 0 hoặc 1
Là giá trị bất kỳ
Là xác suất từ 0 đến 1
Là chuỗi ký tự
Mô hình hồi quy logistic sử dụng trong:
Dự báo GDP
Tính phương sai mẫu
Phân tích khả năng mua hàng
Dự đoán nhị phân (có/không)
Hàm logistic có đặc điểm:
Có giá trị âm vô hạn
Là hàm phi tuyến
Giới hạn đầu ra từ 0 đến 1
Là hàm tuyến tính
Hồi quy logistic khác hồi quy tuyến tính ở điểm:
Biến phụ thuộc là nhị phân
Không cần biến độc lập
Không có hệ số chặn
Dự đoán xác suất chứ không phải giá trị cụ thể
Các loại hồi quy logistic bao gồm:
Hồi quy logistic nhị phân
Hồi quy phi tuyến hoàn toàn
Hồi quy logistic đa thức
Hồi quy tuyến tính
Hồi quy logistic thứ tự phù hợp với bài toán nào?
Đánh giá mức độ hài lòng: kém, ổn, tốt, xuất sắc
Dự đoán điểm số học sinh theo xếp loại
Dự đoán giá cổ phiếu
Dự đoán dân số
Mục đích của việc sử dụng hồi quy logistic là:
Tính toán độ lệch chuẩn
Dự đoán xác suất
Vẽ biểu đồ tương quan
Phân nhóm đối tượng
Mô hình logistic có thể được dùng để:
Phân tích tương quan
Xác định biến liên tục
Phân tích hiệu quả chiến dịch marketing
Dự đoán khả năng khách hàng mua sản phẩm
Khi sử dụng mô hình logistic, cần chia dữ liệu thành:
Tập kiểm tra
Tập xác định trung bình
Tập huấn luyện
Tập đánh giá độ lệch chuẩn
Trong báo cáo phân loại, các chỉ số đánh giá hiệu quả mô hình gồm:
F1 – score
Độ tương quan r
Độ chính xác (accuracy)
Biến độc lập
Khi đánh giá mô hình logistic bằng classification_report, bạn nhận được:
Đồ thị scatter
Nhớ lại
Biểu đồ tương quan
Độ chính xác
Mô hình logistic có thể áp dụng trong trường hợp
Dự đoán giá nhà chính xác
Xác suất xảy ra một hành vi
Dữ liệu huấn luyện nhị phân
Không có biến mục tiêu
Ưu điểm của hồi quy logistic trong phân tích kinh doanh là:
Dự đoán giá trị liên tục
Dễ giải thích kết quả
Không cần dữ liệu huấn luyện
Phân loại hiệu quả
Trong mô hình logistic, biến đầu vào có thể là:
Địa chỉ email
Tên khách hàng
Tuổi khách hàng
Thu nhập hàng tháng
Phân tích xác suất mua hàng dựa trên:
Biến định lượng
Biến định tính đã được mã hóa
Tỷ số tương quan
Mô hình tuyến tính
Hàm logit dùng để làm gì trong hồi quy logistic?
Ước lượng xác suất giữa 0 và 1
Tính trung bình mẫu
Tính khoảng tin cậy
Kiểm định độc lập
Mục tiêu của hồi quy logistic là gì?
Giảm số chiều dữ liệu
Dự đoán xác suất thuộc một nhóm
Tính phương sai
Tối ưu hóa chi phí
Nếu mô hình logistic về nghiên cứu khả năng mua hàng của khách hàng mục tiêu có đầu vào là Age và Salary, biến mục tiêu phù hợp nhất là:
Điểm trung bình
Thu nhập
Số lượt xem
Mua hàng (0/1)
Trong ma trận nhầm lẫn, giá trị nằm trên đường chéo chính đại diện cho:
Tổng số dự đoán
Dữ liệu huấn luyện
Dự đoán sai
Dự đoán đúng
Trong mô hình binary logistic, nếu xác suất dự đoán là 0.8, mô hình sẽ:
Gán nhãn 0
Gán nhãn 1
Không phân loại
Tính lại trung bình
Mô hình hồi quy logistic là gì?
Mô hình tuyến tính đa biến
Mô hình hồi quy đa thức
Mô hình phân loại nhị phân
Mô hình phân tích chuỗi thời gian
Sau khi huấn luyện mô hình, lệnh model.predict(X_test) thực hiện việc:
Dự đoán phân loại
Tạo báo cáo huấn luyện
Dự đoán xác suất
Đánh giá dữ liệu
Dạng tổng quát của hàm logit trả về giá trị
Từ 0 đến 1
Lớn hơn 100%
Lớn hơn 1
Bất kỳ số âm nào
Hàm predict_proba() trong Scikit-learn dùng để:
Dự đoán xác suất
Tạo ra ma trận nhầm lẫn
Phân nhóm dữ liệu
Dự đoán nhãn
Trong học có giám sát, dữ liệu đầu ra thường là gì?
Giá trị nhãn được gán trước
Dữ liệu văn bản
Tập dữ liệu không phân loại
Giá trị bị thiếu
Dữ liệu huấn luyện (training data) thường được dùng để:
Xác định tập kiểm tra
Huấn luyện mô hình
Kiểm tra độ chính xác
Tối ưu bộ nhớ
Hai ví dụ của unsupervised learning là:
Phân tích thành phần chính (PCA)
Phân cụm K-means
Hồi quy tuyến tính
Cây quyết định
Học tăng cường (reinforcement learning) liên quan đến:
Không sử dụng phản hồi
Ra quyết định tối ưu trong môi trường
Thưởng và phạt
Giám sát chặt chẽ
Học không giám sát (unsupervised learning) dùng để:
Huấn luyện mạng nơ-ron có nhãn
Phân loại email spam
Phát hiện cấu trúc ẩn trong dữ liệu
Tìm cụm (clustering) trong dữ liệu
Tại sao supervised learning thường đạt độ chính xác cao hơn unsupervised learning?
Vì luôn dùng nhiều dữ liệu hơn
Do chỉ dùng trong bài toán phân lớp
Do được huấn luyện bằng dữ liệu không bị nhiễu
Vì có thêm thông tin đầu ra từ dữ liệu huấn luyện
Ví dụ nào sau đây phù hợp nhất với supervised learning?
Tìm nhóm khách hàng tiềm năng
Xác định chủ đề văn bản
Dự đoán điểm thi dựa vào số giờ học
Phân loại email là spam hoặc không spam
Clustering là gì trong học máy?
Cách để dự đoán nhãn mới
Phân nhóm các đối tượng dựa trên độ tương đồng
Xếp loại đầu ra có giám sát
Phương pháp dán nhãn dữ liệu
Reinforcement learning được dùng nhiều trong các ứng dụng nào?
Điều khiển robot tự động
Phân cụm dữ liệu
Chơi cờ, game tự động
Dự đoán thời tiết
Semi-supervised learning là gì?
Dùng trong bài toán hồi quy
Chỉ dùng dữ liệu có nhãn
Học tăng cường nhưng không có phản hồi
Kết hợp cả dữ liệu có nhãn và không nhãn trong huấn luyện
Khi nào nên dùng unsupervised learning?
Khi cần dự đoán đầu ra cụ thể
Khi dữ liệu có thể chia nhóm tự nhiên
Khi không có nhãn cho dữ liệu
Khi cần gán nhãn tự động
Supervised learning hiệu quả nhất khi nào?
Khi dữ liệu hỗn hợp giữa số và văn bản
Khi không có thông tin đầu ra
Khi có tập dữ liệu huấn luyện lớn và đủ nhãn
Khi không cần phân loại
Trong bài toán dự đoán khách hàng rời bỏ dịch vụ, phương pháp nào sau đây phù hợp?
Random Forest
Logistic Regression
Reinforcement learning
Principal Component Analysis
Bạn có dữ liệu hành vi truy cập website, không có nhãn. Mục tiêu là chia nhóm hành vi, bạn chọn:
Unsupervised learning
K-means
Hồi quy logistic
SVM
Bạn muốn lập mô hình dự báo lượng tiêu thụ sản phẩm theo thời gian. Bạn nên sử dụng:
Linear regression
Reinforcement learning
Classification
Time series forecasting
Trong việc xây dựng hệ thống đề xuất (recommendation system), bạn có thể sử dụng:
Clustering
Content – based Filtering
Hồi quy tuyến tính
Collaborative Filtering
Để phân nhóm ảnh khuôn mặt theo nét tương đồng, bạn nên dùng:
Supervised learning
Hồi quy logistic
Clustering
PCA
Nếu bạn muốn huấn luyện mô hình chơi game tự động, nên dùng phương pháp nào?
Unsupervised learning
Reinforcement learning
Clustering
Supervised learning
Bạn có dữ liệu ảnh mèo và chó đã được dán nhãn, muốn mô hình phân biệt hai loại này. Phương pháp nào phù hợp?
Unsupervised learning
Classification
Clustering
SVM
Với bài toán nhận diện chữ số viết tay (0-9), mô hình nào sau đây phù hợp?
Neural Network
Logistic Regression
KNN
K-means
Unsupervised learning phù hợp với bài toán nào sau đây?
phân cụm khách hàng theo hành vi mua sắm
phân tích cấu trúc dữ liệu chưa nhãn
dự đoán giá nhà
phân loại thư rác
Supervised learning khác với unsupervised learning ở điểm nào?
Không có đầu vào
Không yêu cầu đầu ra
Có sử dụng dữ liệu có nhãn
Không cần mô hình
Điểm khác biệt của reinforcement learning là:
Không học từ dữ liệu
Không sử dụng bất kỳ nhãn nào
Học thông qua phần thưởng và hình phạt từ môi trường
Chỉ dùng trong bài toán hồi quy
Trong bài toán phân nhóm khách hàng tiềm năng từ dữ liệu chưa có nhãn, bạn nên dùng:
K-means
Logistic Regression
Clustering (phân cụm)
Classification
Mục tiêu chính của học máy là gì?
Giảm dung lượng bộ nhớ
Mô tả dữ liệu
Tự động hóa các nhiệm vụ dựa trên dữ liệu
Tạo đồ họa đẹp
Bạn muốn xây dựng mô hình phân loại thư rác, nên dùng phương pháp nào?
Linear regression
Naive Bayes
Decision Tree
K-means clustering
Supervised learning hoạt động như thế nào?
Học từ tập dữ liệu có đầu ra được xác định trước
Tự tạo ra đầu ra giả định
Dựa vào phản hồi từ người dùng
Huấn luyện mô hình với dữ liệu không có nhãn
Nếu bạn có tập dữ liệu người dùng có thông tin giới tính, độ tuổi và số lượt truy cập web, phương pháp nào phù hợp để phân loại nhóm mua hàng?
Supervised learning
Random sampling
Classification
Clustering
Định nghĩa cơ bản của Machine Learning là gì?
Một cách để viết phần mềm thông thường
Một hệ thống có thể học từ dữ liệu và cải thiện theo thời gian
Một phương pháp lưu trữ dữ liệu
Một lĩnh vực của y học
Để dự đoán điểm thi sinh viên dựa vào số giờ học, bạn nên chọn:
Regression model
K-means
Hồi quy tuyến tính
Decision Tree
