WorksheetsUNSUPERVISED LEARNING
Total questions: 15
Worksheet time: 5mins
Khác biệt chính giữa học có giám sát (supervised learning) và học không giám sát (unsupervised learning) là gì?
A. Học không giám sát luôn cho kết quả chính xác hơn học có giám sát
B. Học có giám sát không cần dữ liệu đầu vào
C. Học không giám sát không yêu cầu dữ liệu gán nhãn trong khi học có giám sát cần dữ liệu có nhãn
D. Học không giám sát chỉ áp dụng cho dữ liệu hình ảnh
Trong các ví dụ sau, đâu là một ứng dụng tiêu biểu của học không giám sát?
A. Phân nhóm khách hàng theo hành vi tiêu dùng
B. Phân loại email là spam hay không spam
C. Dự đoán giá cổ phiếu trong tương lai dựa trên dữ liệu lịch sử
D. Nhận diện chữ viết tay từ hình ảnh
Mục tiêu chính của unsupervised learning là gì?
A. Dự đoán đầu ra chính xác dựa trên đầu vào mới
B. Khám phá các mẫu ẩn và cấu trúc trong dữ liệu không có nhãn
C. Tối ưu hóa hàm mất mát dựa trên dữ liệu được gán nhãn
D. So sánh độ chính xác giữa các mô hình học sâu
Trong thuật toán DBSCAN, điểm nào sau đây là điểm biên (border point)?
A. Một điểm nằm ngoài cụm và không có lân cận
B. Một điểm có đủ số điểm trong bán kính Eps để trở thành điểm lõi
C. Một điểm nằm trong vùng lân cận của điểm lõi nhưng không đủ điểm để trở thành điểm lõi
D. Một điểm được chọn làm trung tâm cụm trong K-Means
Điểm khác biệt chính giữa K-Means và Hierarchical Clustering là gì?
A. K-Means không cần biết trước số cụm, còn Hierarchical Clustering thì cần
B. Hierarchical Clustering chỉ hoạt động với dữ liệu có nhãn
C. Hierarchical Clustering luôn cho kết quả chính xác hơn K-Means
D. K-Means yêu cầu xác định trước số cụm, còn Hierarchical Clustering thì không
Mục tiêu chính của phương pháp PCA trong giảm chiều dữ liệu là gì?
A. Giảm số chiều bằng cách giữ nguyên toàn bộ đặc trưng gốc
B. Bảo toàn cấu trúc cục bộ giữa các điểm dữ liệu
C. Tối đa hóa phương sai của dữ liệu trong không gian mới
D. Trực quan hóa dữ liệu tốt hơn so với các phương pháp khác
So với t-SNE, UMAP có điểm mạnh nào sau đây?
A. Tốc độ nhanh hơn và bảo toàn được cả cấu trúc cục bộ lẫn toàn cục
B. Có thể giải thích dễ dàng hơn về mặt thống kê
C. Giữ được nhiều phương sai hơn trong dữ liệu
D. Không cần điều chỉnh bất kỳ tham số nào
Trong mô hình Latent Dirichlet Allocation (LDA), điều nào sau đây là đúng?
A. LDA giả định mỗi từ trong văn bản chỉ thuộc về một chủ đề duy nhất
B. LDA yêu cầu dữ liệu được gán nhãn trước để huấn luyện mô hình
C. LDA sử dụng phân phối Dirichlet để mô hình hóa phân phối chủ đề và từ
D. LDA quan tâm đến thứ tự các từ trong tài liệu
Phát biểu nào sau đây không đúng về Non-negative Matrix Factorization (NMF)?
A. NMF phân rã một ma trận không âm thành hai ma trận cũng không âm
B. NMF có thể sử dụng để phát hiện các đặc trưng cơ bản như mắt, mũi trong hình ảnh khuôn mặt
C. NMF có thể áp dụng cho bài toán phân cụm văn bản
D. NMF yêu cầu dữ liệu đầu vào có thể chứa cả giá trị âm và dương
Lợi ích chính của Matrix Factorization trong hệ thống gợi ý là gì?
A. Giúp dữ liệu có cấu trúc rõ ràng hơn và tránh bị nhiễu
B. Dự đoán chính xác tương tác giữa người dùng và sản phẩm chưa được quan sát
C. Xây dựng các cây quyết định cho bài toán phân loại
D. Tăng độ chính xác của mô hình hồi quy tuyến tính
Trong thuật toán Isolation Forest, điều gì cho thấy một điểm dữ liệu có khả năng là bất thường cao?
A. Khi điểm đó có khoảng cách lớn với trung tâm cụm dữ liệu
B. Khi điểm đó bị cô lập nhanh với chiều sâu trung bình nhỏ
C. Khi điểm đó có mật độ cục bộ thấp hơn các điểm lân cận
D. Khi điểm đó có nhãn là “bất thường” trong dữ liệu huấn luyện
Thuật toán Local Outlier Factor (LOF) xác định một điểm là bất thường dựa trên yếu tố nào sau đây?
A. Mức độ ngẫu nhiên khi chia thuộc tính trong cây nhị phân
B. Tỷ lệ mật độ cục bộ của điểm đó so với mật độ của các hàng xóm gần nhất
C. Số lần điểm đó xuất hiện trong cụm nhỏ nhất sau phân cụm
D. Mức độ thay đổi của thuộc tính theo thời gian
Chỉ số nào sau đây không yêu cầu nhãn thực tế để đánh giá chất lượng phân cụm?
A. Adjusted Rand Index (ARI)
B. Precision
C. F1-Score
D. Silhouette Score
Trong học không giám sát, "lời nguyền của chiều" (curse of dimensionality) ảnh hưởng đến thuật toán như thế nào?
A. Khiến thuật toán dễ bị overfitting
B. Làm cho việc tính khoảng cách giữa các điểm trở nên kém ý nghĩa
C. Làm giảm tốc độ hội tụ của mô hình tuyến tính
D. Làm tăng độ chính xác của phân cụm
Thuật toán phân cụm nào sau đây không yêu cầu xác định trước số lượng cụm?
A. K-Means
B. Agglomerative Clustering
C. DBSCAN
D. Gaussian Mixture Model (GMM)
