wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Computer Vision

Total questions: 25

Worksheet time: 19mins

Name
Class
Date
1.

Dữ liệu MNIST bao gồm loại ảnh nào?

a)

Ảnh màu RGB

b)

Ảnh xám 28×28 pixel

c)

Ảnh vệ tinh

d)

Ảnh động GIF

2.

Fashion-MNIST dùng để phân loại gì?

a)

Chữ viết tay

b)

Động vật

c)

Quần áo/thời trang

d)

Biển số xe

3.

Kỹ thuật chuẩn hóa ảnh thường đưa giá trị pixel về khoảng nào?

a)

0–255

b)

0–10

c)

0–1 hoặc -1–1

d)

100–200

4.

Mục đích chính của Data Augmentation là gì?

a)

Giảm số lượng dữ liệu

b)

Tăng độ đa dạng, cải thiện khả năng khái quát

c)

Làm ảnh đẹp hơn

d)

Giảm chi phí tính toán

5.

Kỹ thuật Mixup trong augmentation là gì?

a)

Ghép 2 ảnh lại theo tỉ lệ trọng số

b)

Làm mờ ảnh bằng Gaussian blur

c)

Cắt/xoay ảnh ngẫu nhiên

d)

Thay đổi độ sáng

6.

Mục đích chính của lớp convolution trong CNN là gì?

a)

Phát hiện mẫu cục bộ (edges, shapes)

b)

Giảm kích thước ảnh

c)

Tăng độ sáng

d)

Chuyển ảnh thành văn bản

7.

Lớp Pooling trong CNN có tác dụng:

a)

Phát hiện đặc trưng phức tạp hơn

b)

Giảm số chiều và tạo tính bất biến dịch chuyển

c)

Biến ảnh thành RGB

d)

Làm ảnh sắc nét hơn

8.

ResNet giải quyết vấn đề nào trong huấn luyện mạng sâu?

a)

Overfitting

b)

Thiếu dữ liệu

c)

Vanishing/Exploding gradient

d)

Tốc độ inference chậm

9.

Đặc điểm chính của MobileNet là gì?

a)

Dùng skip connection

b)

Dùng depthwise separable convolution → nhẹ, tối ưu cho thiết bị di động

c)

Dùng nhiều lớp fully-connected

d)

Chỉ hoạt động trên ảnh màu

10.

EfficientNet đạt được hiệu quả bằng cách nào?

a)

Tăng số lớp vô hạn

b)

Compound scaling (cân bằng depth, width, resolution)

c)

Chỉ dùng ảnh nhỏ

d)

Thay pooling bằng transformer

11.

Transfer Learning thường dùng mô hình nào đã được huấn luyện sẵn?

a)

ImageNet (1.2M ảnh, 1000 lớp)

b)

CIFAR-10

c)

Pascal VOC

d)

COCO

12.

Bước đầu tiên trong transfer learning với CNN thường là:

a)

Huấn luyện lại toàn bộ mô hình từ đầu

b)

Đóng băng (freeze) các tầng trích đặc trưng

c)

Xóa toàn bộ trọng số

d)

Thêm nhiều ảnh mới

13.

Nhược điểm của transfer learning là gì?

a)

Luôn cần GPU mạnh

b)

Không phải lúc nào cũng được phép trong các cuộc thi

c)

Không áp dụng được cho ảnh màu

d)

Chỉ áp dụng cho ảnh 28×28

14.

Mục tiêu chính của quá trình huấn luyện trong thị giác máy tính là gì?

a)

Giảm kích thước tập dữ liệu

b)

Điều chỉnh tham số mô hình để tối ưu hóa độ chính xác

c)

Chỉ làm augmentation

d)

Làm mô hình đẹp hơn

15.

Trong bài toán phân loại với CNN, lớp cuối cùng thường là gì?

a)

ReLU

b)

Sigmoid

c)

Softmax

d)

Tanh

16.

Vision Transformer (ViT) xử lý ảnh bằng cách nào?

a)

Quét toàn bộ ảnh như một vector dài

b)

Chia ảnh thành các patch, embedding rồi đưa vào Transformer Encoder

c)

Dùng pooling để giảm kích thước

d)

Áp dụng depthwise convolution

17.

Điểm mạnh chính của Vision Transformer (ViT) là gì?

a)

Hiệu quả với tập dữ liệu nhỏ

b)

Đạt độ chính xác cao trên tập lớn

c)

Ít cần tài nguyên tính toán

d)

Không cần augmentation

18.

Nhược điểm chính của ViT là gì?

a)

Không dùng được cho ảnh màu

b)

Yêu cầu dữ liệu & tính toán rất lớn

c)

Không thể học đặc trưng cục bộ

d)

Chỉ dùng cho MNIST

19.

Swin Transformer khác ViT ở điểm nào?

a)

Không dùng attention

b)

Dùng attention trong cửa sổ dịch chuyển (shifted windows) → tạo tương tác liên cửa sổ

c)

Không dùng positional encoding

d)

Chỉ áp dụng cho ảnh 28×28

20.

Lợi ích chính của Swin Transformer so với ViT thuần túy là:

a)

Khả năng mở rộng, hiệu quả, phù hợp cho detection & segmentation

b)

Nhẹ hơn MobileNet

c)

Không cần dữ liệu huấn luyện

d)

Luôn nhanh hơn CNN

21.

Độ chính xác cơ bản khi huấn luyện CNN trên MNIST thường đạt:

a)

~60%

b)

~75%

c)

~90%

d)

~99%

22.

Độ chính xác cơ bản khi huấn luyện CNN trên Fashion-MNIST là:

a)

~50%

b)

~70%

c)

~90%

d)

~99%

23.

Kỹ thuật nào sau đây KHÔNG phải là augmentation nâng cao?

a)

CutMix

b)

AutoAugment

c)

GridMask

d)

MaxPooling

24.

Gaussian noise thuộc nhóm augmentation nào?

a)

Biến đổi hình học

b)

Điều chỉnh màu sắc

c)

Nhiễu (Noise Injection)

d)

Làm mờ (Blurring)

25.

Trong pipeline huấn luyện CV hiện đại, thứ tự điển hình là:

a)

Thu thập dữ liệu → Tiền xử lý & Augmentation → Huấn luyện mô hình → Đánh giá → Fine-tuning

b)

Đánh giá → Thu thập dữ liệu → Huấn luyện → Augmentation

c)

Huấn luyện → Thu thập dữ liệu → Tiền xử lý → Fine-tuning

d)

Fine-tuning → Huấn luyện → Tiền xử lý