WorksheetsCâu hỏi về Mạng Nơ-ron
Total questions: 16
Worksheet time: 12mins
Tại sao một mạng nơ-ron nông (một lớp) không thể học được hàm logic XOR?
Vì không thể vẽ một đường thẳng duy nhất để tách các điểm dữ liệu của hai lớp.
Vì hàm kích hoạt của Perceptron quá phức tạp.
Vì Perceptron không có hệ số chệch (bias).
Vì hàm XOR yêu cầu đầu vào là số thực, không phải số nhị phân.
Trong kiến trúc Mạng Nơ-ron Sâu (DNN), yếu tố nào định nghĩa tính 'sâu' (deep) của mạng?
Việc có nhiều hơn một lớp ẩn (hidden layer).
Số lượng nơ-ron trong lớp đầu ra.
Số lượng nơ-ron trong lớp đầu vào.
Sử dụng hàm mất mát Cross-Entropy.
Điều gì sẽ xảy ra nếu một mạng nơ-ron sâu chỉ sử dụng các hàm kích hoạt tuyến tính (ví dụ: f(x)=x)?
Mạng sẽ tính toán nhanh hơn nhưng không chính xác.
Toàn bộ mạng sẽ tương đương với một mô hình tuyến tính duy nhất (một lớp).
Mạng sẽ chỉ giải quyết được bài toán hồi quy, không giải quyết được bài toán phân loại.
Mạng sẽ không thể huấn luyện được do gradient bằng không.
Đặc điểm của một lớp Fully Connected (Dense) là gì?
Mỗi nơ-ron chỉ kết nối với một nơ-ron ở lớp trước đó.
Mỗi nơ-ron được kết nối với tất cả các nơ-ron ở lớp trước đó.
Chỉ các nơ-ron liền kề ở lớp trước và sau được kết nối.
Các nơ-ron trong cùng một lớp được kết nối với nhau.
Quá trình tính toán từ lớp đầu vào đến lớp đầu ra trong mạng nơ-ron được gọi là gì?
Activation (Kích hoạt)
Backpropagation (Lan truyền ngược)
Forward Propagation (Lan truyền xuôi)
Gradient Descent (Giảm theo Gradient)
Nhược điểm chính của hàm kích hoạt Sigmoid và Tanh được đề cập trong tài liệu là gì?
Dying ReLU (ReLU chết)
Vanishing Gradient (Biến mất đạo hàm)
Phạm vi đầu ra quá rộng.
Tính toán quá tốn kém vì có phép chia.
Hiện tượng 'Dying ReLU' xảy ra khi nào?
Khi giá trị đầu vào của nơ-ron ReLU rất lớn (x>0).
Khi giá trị đầu vào của nơ-ron ReLU luôn nhỏ hơn hoặc bằng 0.
Khi mạng nơ-ron có quá nhiều lớp.
Khi sử dụng hàm mất mát Mean Squared Error.
Hàm kích hoạt Softmax thường được sử dụng ở đâu trong một mạng nơ-ron?
Chỉ ở lớp đầu vào để tiền xử lý dữ liệu.
Ở lớp đầu ra của bài toán hồi quy (regression).
Ở lớp đầu ra của bài toán phân loại đa lớp (multi-class classification).
Trong tất cả các lớp ẩn để chuẩn hóa dữ liệu.
Mục tiêu chính của quá trình huấn luyện mạng nơ-ron liên quan đến hàm mất mát (Loss Function) là gì?
Tìm bộ trọng số để giá trị hàm mất mát đạt giá trị nhỏ nhất.
Tìm bộ trọng số để giá trị hàm mất mát đạt giá trị lớn nhất.
Tìm bộ trọng số sao cho hàm mất mát bằng 0 ngay từ đầu.
Giữ cho giá trị hàm mất mát không đổi trong suốt quá trình huấn luyện.
Hàm mất mát Mean Squared Error (MSE) phù hợp nhất cho loại bài toán nào?
Hồi quy (Regression)
Phân cụm (Clustering)
Phân loại đa lớp (Multi-class classification)
Phân loại nhị phân (Binary classification)
Hàm mất mát Cross-Entropy đo lường sự khác biệt giữa hai đối tượng nào?
Giữa trọng số của hai lớp liền kề.
Giữa đầu vào và đầu ra của mạng.
Giữa hai phân phối xác suất: dự đoán và thực tế.
Giữa giá trị mất mát của epoch hiện tại và epoch trước đó.
Hàm kích hoạt Tanh được cho là tốt hơn Sigmoid một chút trong các lớp ẩn vì lý do nào?
Nó có thể xử lý các giá trị đầu vào âm, trong khi Sigmoid thì không.
Nó tính toán nhanh hơn nhiều so với Sigmoid
Dữ liệu đầu ra của nó được chuẩn hóa quanh điểm 0 (zero-centered).
Nó không bao giờ bị biến mất đạo hàm.
Biến thể Leaky ReLU được tạo ra để giải quyết vấn đề gì của hàm ReLU gốc?
Vanishing Gradient (Biến mất đạo hàm)
Dying ReLU (ReLU chết)
Hiệu suất tính toán chậm.
Exploding Gradient (Bùng nổ đạo hàm)
Nếu một mô hình phân loại đa lớp dự đoán xác suất rất thấp (ví dụ 0.001) cho nhãn đúng, giá trị của hàm mất mát Cross-Entropy sẽ như thế nào?
Cực kỳ lớn, tiến tới vô cùng.
Là một số âm.
Rất nhỏ, tiến gần về 0.
Bằng 1.
Sự khác biệt cơ bản giữa thuật toán Adam và AdamW là gì?
AdamW sử dụng một learning rate động trong khi Adam sử dụng learning rate cố định.
AdamW nhanh hơn về mặt tính toán so với Adam.
Adam chỉ hoạt động với hàm kích hoạt ReLU, còn AdamW hoạt động với mọi hàm
AdamW tách biệt bước cập nhật Weight Decay ra khỏi bước cập nhật gradient.
Mục đích chính của việc sử dụng 'Learning Rate Scheduling' là gì?
Tăng learning rate khi loss giảm.
Thay đổi learning rate một cách có chiến lược trong quá trình huấn luyện.
Giữ cho learning rate không đổi trong suốt quá trình huấn luyện.
Chỉ áp dụng cho thuật toán SGD.
