NEW
Font size
Worksheets9.1/9.2
Total questions: 10
Worksheet time: 5mins
Quan sát sơ đồ ma trận attention: ở Causal Attention (Hình 1), các ô phía trên đường chéo chính được gán −∞. Điều này tương ứng với nhận định nào sau đây?
Mỗi token chỉ được phép chú ý đến các token quá khứ và hiện tại, không nhìn tương lai
Mỗi token có thể chú ý đến toàn bộ chuỗi theo cả hai chiều mà không bị che
Mỗi token chỉ chú ý đến đúng một token liền kề phía sau để dự đoán tiếp theo
Ma trận attention bị chuẩn hóa về cùng một giá trị cho mọi vị trí do masking
Quan sát sơ đồ “Transformer Encoder Block” (mô tả gồm Input Embedding → Layer Norm → Multi-Head Attention → Layer Norm → FFN → tạo Contextual Embedding, có các nút cộng biểu thị kết nối dư). Thành phần nào trực tiếp chịu trách nhiệm học các quan hệ giữa các token theo cả hai chiều trong encoder?
Feed-Forward Network (FFN)
Multi-Head Attention
Layer Normalization
Input Embedding
Quan sát sơ đồ “Encoder stacking trong BERT”. Mỗi tầng Encoder gồm các khối nào được lặp lại theo thứ tự, tạo nên học đặc trưng phân cấp?
attention → layer norm → feedforward
feedforward → attention → layer norm
attention → feedforward → layer norm (hai lần)
feedforward → layer norm → attention → layer norm
Theo mô tả sau, chọn phát biểu đúng về nhiệm vụ huấn luyện điển hình của mô hình LLM: "Trong huấn luyện LLM, ta buộc mô hình dự đoán từ tiếp theo trong văn bản." Nhiệm vụ cốt lõi là gì?
Dịch câu sang ngôn ngữ khác
Phân loại cảm xúc của văn bản
Dự đoán từ tiếp theo dựa trên ngữ cảnh trái sang phải
Phát hiện spam trong email
Phát biểu nào mô tả đúng ảnh hưởng của việc bỏ ràng buộc chú ý trái‑sang‑phải đối với nhiệm vụ dự đoán từ tiếp theo?
Nhiệm vụ trở nên khó hơn vì thiếu ngữ cảnh trước
Nhiệm vụ trở nên vô nghĩa vì ngữ cảnh sau đã tiết lộ từ kế tiếp
Nhiệm vụ không thay đổi vì mô hình vẫn chỉ nhìn sang trái
Nhiệm vụ chuyển thành phân loại nhiều nhãn
Theo sơ đồ về Masked Language Modeling (MLM), mục tiêu chính của MLM trong huấn luyện mô hình ngôn ngữ là gì?
Dự đoán từ tiếp theo theo hướng trái→phải
Dịch câu từ ngôn ngữ nguồn sang ngôn ngữ đích
Dự đoán các token đã bị che (masked) để học ngữ cảnh hai chiều
Phân loại cảm xúc dựa trên nhãn câu cho trước
Nếu một batch có 1000 token được chọn để thao tác theo chiến lược chuẩn, xấp xỉ bao nhiêu token sẽ được thay bằng [MASK]?
800 token
100 token
600 token
900 token
Trong mô hình BERT, vai trò của Layer Normalization là gì trong quá trình huấn luyện?
Đảm bảo các đầu vào có phân phối chuẩn
Giúp mô hình học các đặc trưng không gian
Cải thiện tốc độ hội tụ của mô hình
Giảm thiểu độ thiên lệch trong dữ liệu đầu vào
Trong kiến trúc Transformer, thành phần nào chịu trách nhiệm tạo ra các vector nhúng cho từ trong câu?
Layer Normalization
Multi-Head Attention
Feed-Forward Network
Input Embedding
Trong quá trình huấn luyện mô hình ngôn ngữ, mục tiêu của việc sử dụng kỹ thuật Masking là gì?
Tăng cường khả năng phân loại của mô hình
Đảm bảo mô hình không nhìn thấy từ bị che
Giảm thiểu độ phức tạp của mô hình
Giúp mô hình học cách dự đoán từ tiếp theo
