NEW
Font size
WorksheetsComputer Vision
Total questions: 25
Worksheet time: 19mins
Dữ liệu MNIST bao gồm loại ảnh nào?
Ảnh màu RGB
Ảnh xám 28×28 pixel
Ảnh vệ tinh
Ảnh động GIF
Fashion-MNIST dùng để phân loại gì?
Chữ viết tay
Động vật
Quần áo/thời trang
Biển số xe
Kỹ thuật chuẩn hóa ảnh thường đưa giá trị pixel về khoảng nào?
0–255
0–10
0–1 hoặc -1–1
100–200
Mục đích chính của Data Augmentation là gì?
Giảm số lượng dữ liệu
Tăng độ đa dạng, cải thiện khả năng khái quát
Làm ảnh đẹp hơn
Giảm chi phí tính toán
Kỹ thuật Mixup trong augmentation là gì?
Ghép 2 ảnh lại theo tỉ lệ trọng số
Làm mờ ảnh bằng Gaussian blur
Cắt/xoay ảnh ngẫu nhiên
Thay đổi độ sáng
Mục đích chính của lớp convolution trong CNN là gì?
Phát hiện mẫu cục bộ (edges, shapes)
Giảm kích thước ảnh
Tăng độ sáng
Chuyển ảnh thành văn bản
Lớp Pooling trong CNN có tác dụng:
Phát hiện đặc trưng phức tạp hơn
Giảm số chiều và tạo tính bất biến dịch chuyển
Biến ảnh thành RGB
Làm ảnh sắc nét hơn
ResNet giải quyết vấn đề nào trong huấn luyện mạng sâu?
Overfitting
Thiếu dữ liệu
Vanishing/Exploding gradient
Tốc độ inference chậm
Đặc điểm chính của MobileNet là gì?
Dùng skip connection
Dùng depthwise separable convolution → nhẹ, tối ưu cho thiết bị di động
Dùng nhiều lớp fully-connected
Chỉ hoạt động trên ảnh màu
EfficientNet đạt được hiệu quả bằng cách nào?
Tăng số lớp vô hạn
Compound scaling (cân bằng depth, width, resolution)
Chỉ dùng ảnh nhỏ
Thay pooling bằng transformer
Transfer Learning thường dùng mô hình nào đã được huấn luyện sẵn?
ImageNet (1.2M ảnh, 1000 lớp)
CIFAR-10
Pascal VOC
COCO
Bước đầu tiên trong transfer learning với CNN thường là:
Huấn luyện lại toàn bộ mô hình từ đầu
Đóng băng (freeze) các tầng trích đặc trưng
Xóa toàn bộ trọng số
Thêm nhiều ảnh mới
Nhược điểm của transfer learning là gì?
Luôn cần GPU mạnh
Không phải lúc nào cũng được phép trong các cuộc thi
Không áp dụng được cho ảnh màu
Chỉ áp dụng cho ảnh 28×28
Mục tiêu chính của quá trình huấn luyện trong thị giác máy tính là gì?
Giảm kích thước tập dữ liệu
Điều chỉnh tham số mô hình để tối ưu hóa độ chính xác
Chỉ làm augmentation
Làm mô hình đẹp hơn
Trong bài toán phân loại với CNN, lớp cuối cùng thường là gì?
ReLU
Sigmoid
Softmax
Tanh
Vision Transformer (ViT) xử lý ảnh bằng cách nào?
Quét toàn bộ ảnh như một vector dài
Chia ảnh thành các patch, embedding rồi đưa vào Transformer Encoder
Dùng pooling để giảm kích thước
Áp dụng depthwise convolution
Điểm mạnh chính của Vision Transformer (ViT) là gì?
Hiệu quả với tập dữ liệu nhỏ
Đạt độ chính xác cao trên tập lớn
Ít cần tài nguyên tính toán
Không cần augmentation
Nhược điểm chính của ViT là gì?
Không dùng được cho ảnh màu
Yêu cầu dữ liệu & tính toán rất lớn
Không thể học đặc trưng cục bộ
Chỉ dùng cho MNIST
Swin Transformer khác ViT ở điểm nào?
Không dùng attention
Dùng attention trong cửa sổ dịch chuyển (shifted windows) → tạo tương tác liên cửa sổ
Không dùng positional encoding
Chỉ áp dụng cho ảnh 28×28
Lợi ích chính của Swin Transformer so với ViT thuần túy là:
Khả năng mở rộng, hiệu quả, phù hợp cho detection & segmentation
Nhẹ hơn MobileNet
Không cần dữ liệu huấn luyện
Luôn nhanh hơn CNN
Độ chính xác cơ bản khi huấn luyện CNN trên MNIST thường đạt:
~60%
~75%
~90%
~99%
Độ chính xác cơ bản khi huấn luyện CNN trên Fashion-MNIST là:
~50%
~70%
~90%
~99%
Kỹ thuật nào sau đây KHÔNG phải là augmentation nâng cao?
CutMix
AutoAugment
GridMask
MaxPooling
Gaussian noise thuộc nhóm augmentation nào?
Biến đổi hình học
Điều chỉnh màu sắc
Nhiễu (Noise Injection)
Làm mờ (Blurring)
Trong pipeline huấn luyện CV hiện đại, thứ tự điển hình là:
Thu thập dữ liệu → Tiền xử lý & Augmentation → Huấn luyện mô hình → Đánh giá → Fine-tuning
Đánh giá → Thu thập dữ liệu → Huấn luyện → Augmentation
Huấn luyện → Thu thập dữ liệu → Tiền xử lý → Fine-tuning
Fine-tuning → Huấn luyện → Tiền xử lý
