WorksheetsCâu hỏi trắc nghiệm về LLE, PCA và t‑SNE
Total questions: 15
Worksheet time: 11mins
Cụm từ LLE trong thuật toán Locally Linear Embedding có nghĩa là gì?
Nhúng tuyến tính cục bộ
Ánh xạ tuyến tính không gian
Nhúng tuyến tính toàn cục
Phân tích thành phần chính cục bộ
Sự khác biệt chính giữa PCA và LLE là gì?
LLE sử dụng phương sai, còn PCA sử dụng khoảng cách trắc địa
PCA xử lý dữ liệu phi tuyến tốt hơn LLE
PCA không yêu cầu tính toán ma trận, còn LLE thì có
PCA bảo tồn cấu trúc toàn cục, còn LLE bảo tồn cấu trúc địa phương
Tại sao PCA thường thất bại với dữ liệu có dạng Swiss Roll?
Vì Swiss Roll là cấu trúc quá đơn giản cho PCA
Vì Swiss Roll không có phương sai
Vì PCA cố gắng chiếu thẳng dữ liệu xuống, làm chồng lấn các lớp dữ liệu cong
Vì PCA yêu cầu số lượng điểm dữ liệu cực lớn
Bước đầu tiên trong quy trình 3 bước của LLE là gì?
Tính toán trị riêng của ma trận trọng số
Chuẩn hóa dữ liệu về phân phối đơn vị
Xác định ma trận trọng số W
Tìm k láng giềng gần nhất cho mỗi điểm dữ liệu
Trong Bước 2 của LLE, mục tiêu của việc tối ưu hóa là gì?
Cực đại hóa khoảng cách giữa các cụm dữ liệu
Tìm các trục có phương sai lớn nhất
Giảm số lượng láng giềng k xuống mức thấp nhất
Cực tiểu hóa sai số tái tạo điểm dữ liệu từ các láng giềng
Siêu tham số quan trọng nhất trong LLE là gì?
Hàm kích hoạt (activation function)
Số lượng láng giềng k
Số lượng vòng lặp (epochs)
Tốc độ học (learning rate)
Điều gì xảy ra nếu chọn giá trị k quá lớn trong LLE?
Dữ liệu sẽ bị phân mảnh thành nhiều cụm rời rạc
Tính chất địa phương bị phá vỡ và LLE hoạt động gần giống PCA
Thời gian tính toán sẽ giảm đáng kể
Ma trận M sẽ trở nên thưa hơn
Nếu một điểm dữ liệu xj không phải là láng giềng của xi, thì trọng số wij sẽ như thế nào?
wij có giá trị âm rất lớn
wij được tính bằng khoảng cách Euclide ngược
wij=1
wij=0
Mục tiêu chính của thuật toán t‑SNE là gì?
Tối ưu hóa các đường thẳng phân cách
Tối đa hóa phương sai dữ liệu
Bảo toàn cấu trúc toàn cục tuyệt đối
Bảo toàn cấu trúc cục bộ (local structure)
Trong bước 1 của t‑SNE, phân phối nào được dùng để tính xác suất tương đồng trong không gian gốc?
Phân phối Bernoulli
Phân phối Student‑t
Phân phối Poisson
Phân phối Gaussian (phân phối chuẩn)
Vấn đề Chen Chúc (The Crowding Problem) xảy ra khi nào?
Khi giá trị Perplexity được đặt quá cao
Khi ép dữ liệu từ không gian nhiều chiều xuống không gian 2D
Khi tập dữ liệu có quá nhiều mẫu
Khi dữ liệu có quá nhiều nhiễu
Tại sao phân phối Student‑t lại giải quyết được vấn đề chen chúc?
Vì nó có đuôi nặng (heavy tail) hơn Gaussian
Vì nó làm cho các cụm dữ liệu co lại nhỏ hơn
Vì nó không yêu cầu tham số σ
Vì nó tính toán nhanh hơn Gaussian
Một nhược điểm lớn của t‑SNE so với UMAP là gì?
Kết quả luôn giống nhau giữa mỗi lần chạy
Chi phí tính toán cao và chậm với dataset lớn
Không thể xử lý dữ liệu phi tuyến
Chỉ có thể giảm xuống đúng 2 chiều
Đặc điểm nào của UMAP giúp nó xử lý hàng triệu mẫu dữ liệu?
Nó chuyển mọi dữ liệu thành dạng ảnh
Tốc độ xử lý rất nhanh
Nó chỉ lấy mẫu ngẫu nhiên 1% dữ liệu
Nó không cần tính toán khoảng cách
Trong tài liệu, t‑SNE có xu hướng làm gì với các vùng dữ liệu thưa thớt?
Co lại để mật độ hiển thị đồng đều
Phóng to chúng ra gấp 10 lần
Giữ nguyên khoảng cách Euclid gốc
Xóa bỏ các điểm đó vì coi là nhiễu
