wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Kiến thức về Mạng Neural

Total questions: 100

Worksheet time: 50mins

Name
Class
Date
1.

Mạng neural là gì?

a)

Mô hình phi tuyến với đầu vào và đầu ra số học

b)

A.  Thuật toán phân cụm

c)

A.  hình xác suất

d)

A.  Hệ thống logic

2.

Perceptron là gì?

a)

A.           Bộ phân loại tuyến tính nhị phân đơn lớp

b)

A.  Mạng nhiều lớp

c)

A.  hình hồi quy

d)

A.  Mạng hồi tiếp

3.

Perceptron không thể học hàm nào sau đây?

a)

AND

b)

OR

c)

XOR

d)

NAND

4.

Một perceptron gồm những thành phần nào?

a)

Activation, pooling, softmax

b)

Trọng số, bias, hàm kích hoạt

c)

Entropy, kernel, margin

d)

Loss, learning rate, epoch

5.

Activation function nào là dạng ngưỡng rời rạc?

a)

Step function (sgn)

b)

Sigmoid

c)

Tanh

d)

ReLU

6.

Hàm sigmoid biến đổi giá trị đầu vào thành?

a)

[-1, 1]

b)

[0, ∞)

c)

[0, 1]

d)

[-∞, ∞]

7.

Hàm sigmoid có đạo hàm là?

a)

f(x)

b)

f(x)(1 - f(x))

c)

x^2

d)

e^x

8.

Hàm tanh trả về giá trị trong khoảng?

a)

[0, 1]

b)

[-1, 1]

c)

[-∞, ∞]

d)

[0, ∞)

9.

Hàm ReLU có đặc điểm gì?

a)

Trả về 0 nếu x <= 0, ngược lại trả về x

b)

Luôn trả về 1

c)

Tạo giá trị ngẫu nhiên

d)

Không khả vi

10.

Ưu điểm chính của ReLU là?

a)

Dễ tính đạo hàm và giảm vanishing gradient

b)

Không phân biệt tuyến tính

c)

Tối ưu margin

d)

Cải thiện precision

11.

MLP viết tắt của?

a)

Multilayer Perceptron

b)

Multi Loss Predictor

c)

Machine Learned Predictor

d)

Model Layer Phase

12.

Lớp ẩn trong MLP có chức năng?

a)

Tạo input mới

b)

Học đặc trưng phi tuyến

c)

Chuẩn hóa output

d)

Không cần thiết

13.

Mỗi liên kết trong mạng neural có?

a)

Trọng số riêng

b)

Hàm sigmoid

c)

Hàm mất mát

d)

Bộ lọc

14.

Mạng neural có mấy loại lớp?

a)

Input, processing

b)

Input, hidden, output

c)

Feature, weight, loss

d)

Train, test

15.

Cấu trúc mạng gồm các phần nào?

a)

Neurons, layers, weights, activation functions

b)

Trees, branches, leaves

c)

Gradient, epoch, MAE

d)

Bias, entropy, cluster

16.

Lan truyền ngược là?

a)

Cách tính đạo hàm ngược từ output về input

b)

Học ngẫu nhiên

c)

Học không giám sát

d)

Kết thúc huấn luyện

17.

Ý nghĩa chính của backpropagation?

a)

Đánh giá mạng

b)

Tối ưu trọng số qua đạo hàm của hàm lỗi

c)

Giảm noise đầu vào

d)

Sinh dữ liệu mới

18.

Công cụ toán học cốt lõi của backpropagation?

a)

Quy tắc chuỗi đạo hàm (chain rule)

b)

Tích phân phân đoạn

c)

Đại số tuyến tính

d)

Giải tích tổ hợp

19.

Backpropagation cần thông tin nào để cập nhật trọng số?

a)

Gradient của hàm lỗi theo từng trọng số

b)

Giá trị output

c)

Ma trận hiệp phương sai

d)

Tỉ lệ dropout

20.

Sau mỗi lần lan truyền ngược, trọng số được cập nhật bằng?

a)

w = w - learning_rate * gradient

b)

w = w + output

c)

w = w^2

d)

w = bias * epoch

21.

Hàm softmax thường dùng trong?

a)

Regression

b)

Classification đa lớp

c)

Clustering

d)

Reinforcement

22.

Softmax trả về?

a)

Giá trị nhị phân

b)

Xác suất các lớp cộng lại bằng 1

c)

Hàm lỗi

d)

Entropy

23.

Hàm mất mát (loss function) phổ biến cho classification là?

a)

MSE

b)

RMSE

c)

Cross-entropy

d)

Euclidean

24.

Cross-entropy đo lường?

a)

Độ lệch giữa phân phối dự đoán và thực tế

b)

Khoảng cách Euclidean

c)

Tổng số lỗi tuyệt đối

d)

Tổng đạo hàm

25.

Optimizer nào sau đây mở rộng từ SGD?

a)

Adam

b)

MSE

c)

ReLU

d)

Dropout

26.

Adam kết hợp những kỹ thuật nào?

a)

Dropout và tanh

b)

Momentum và adaptive learning rate

c)

SGD và Max pooling

d)

Cross-validation và RMS

27.

Epoch là gì?

a)

Một lượt qua toàn bộ tập huấn luyện

b)

Một batch

c)

Một class

d)

Một chiều mạng

28.

Batch size ảnh hưởng tới?

a)

Số class

b)

Tốc độ và ổn định huấn luyện

c)

Đầu ra

d)

Hàm kích hoạt

29.

Nếu learning rate quá cao thì?

a)

Hội tụ nhanh

b)

Không hội tụ hoặc dao động

c)

Giảm lỗi nhanh

d)

Tăng precision

30.

Nếu learning rate quá thấp?

a)

Không học được

b)

Học rất chậm

c)

Tăng lỗi

d)

Không cập nhật trọng số

31.

CNN viết tắt của?

a)

Convolutional Neural Network

b)

Core Neural Net

c)

Classifier Network Node

d)

Converged Normal Network

32.

CNN nổi bật trong xử lý?

a)

Chuỗi thời gian

b)

Hình ảnh và video

c)

Văn bản

d)

Câu hỏi trắc nghiệm

33.

Thành phần chính của CNN gồm?

a)

Convolution layer, pooling layer, fully connected layer

b)

Tree, node, margin

c)

Perceptron, sigmoid, MAE

d)

Layer, bias, MAE

34.

Convolution giúp?

a)

Trích xuất đặc trưng cục bộ

b)

Sinh noise

c)

Tối ưu gradient

d)

Làm sạch dữ liệu

35.

Pooling layer dùng để?

a)

Giảm chiều và giữ đặc trưng chính

b)

Tăng batch size

c)

Làm mịn output

d)

Phân loại ảnh

36.

Max pooling chọn gì?

a)

Trung bình

b)

Tích

c)

Giá trị lớn nhất trong vùng

d)

Giá trị ngẫu nhiên

37.

Dropout được dùng để?

a)

Giảm overfitting

b)

Tăng loss

c)

Giảm số lớp

d)

Xóa nhãn

38.

Một ứng dụng phổ biến của mạng neural là?

a)

Dịch mã DNA

b)

Dự đoán GDP

c)

Nhận diện khuôn mặt

d)

Tính diện tích hình vuông

39.

Early stopping giúp?

a)

Ngừng huấn luyện sớm nếu không cải thiện

b)

Tăng số epoch

c)

Giảm dropout

d)

Làm sạch dữ liệu

40.

Transfer learning nghĩa là?

a)

Huấn luyện từ đầu

b)

Tận dụng mô hình đã học cho bài toán mới

c)

Dùng dữ liệu mới

d)

Trích xuất lớp output

41.

Clustering là phương pháp?

a)

Học không giám sát (Unsupervised learning)

b)

Học có giám sát

c)

Học tăng cường

d)

Học bán giám sát

42.

Mục tiêu chính của clustering là?

a)

Dự đoán nhãn

b)

Nhóm các đối tượng tương đồng vào cùng cụm

c)

Giảm số chiều

d)

Sinh dữ liệu mới

43.

Một cluster là gì?

a)

Một đối tượng đơn lẻ

b)

Một nhóm các đối tượng tương đồng nhau

c)

Một nhãn

d)

Một hàm toán học

44.

Clustering khác classification ở điểm nào?

a)

Không biết trước nhãn

b)

Chia tập train và test

c)

Có mô hình giám sát

d)

Tăng accuracy

45.

Ứng dụng nào sau đây phù hợp với clustering?

a)

Dự đoán giá nhà

b)

Phân loại email spam

c)

Nhóm khách hàng theo hành vi mua sắm

d)

Dịch ngôn ngữ

46.

Khoảng cách phổ biến dùng trong clustering là?

a)

Euclidean và Manhattan

b)

Hamming

c)

Cosine và Jaccard

d)

Pearson

47.

Khoảng cách Euclidean được dùng khi?

a)

Dữ liệu dạng văn bản

b)

Dữ liệu số liên tục

c)

Dữ liệu rời rạc

d)

Dữ liệu hình ảnh

48.

Trong metric Minkowski, p = 1 cho ra?

a)

Euclidean

b)

Manhattan

c)

Cosine

d)

Mahalanobis

49.

Trong clustering, intra-cluster distance là?

a)

Khoảng cách giữa các điểm trong cùng một cụm

b)

Khoảng cách giữa các cụm

c)

Tổng lỗi

d)

Trung bình đặc trưng

50.

Mục tiêu khi clustering là?

a)

Tăng số cụm

b)

Giảm khoảng cách trong cụm, tăng khoảng cách giữa cụm

c)

Tối đa accuracy

d)

Tăng số chiều

51.

K-means là phương pháp?

a)

Phân hoạch dữ liệu thành K cụm dựa vào trung tâm cụm

b)

Dựa trên mật độ

c)

Phân loại tuyến tính

d)

Tìm cây tối ưu

52.

K trong K-means biểu thị?

a)

Số thuộc tính

b)

Số cụm cần phân chia

c)

Số chiều

d)

Số lần lặp

53.

Hàm lỗi trong K-means là?

a)

MSE

b)

Sum of Squared Errors (SSE)

c)

Cross-entropy

d)

MAE

54.

Trung tâm cụm trong K-means là?

a)

Mode

b)

Mean của các điểm trong cụm

c)

Giá trị đầu tiên

d)

Random vector

55.

Nhược điểm chính của K-means?

a)

Không hội tụ

b)

Nhạy với outliers và khởi tạo ngẫu nhiên

c)

Không xử lý dữ liệu số

d)

Không mở rộng được

56.

K-medoids cải tiến gì so với K-means?

a)

Giảm thời gian chạy

b)

Ít nhạy với outlier do chọn điểm trung tâm là 1 điểm thực tế

c)

Dễ code hơn

d)

Xác suất cao hơn

57.

K-medians dùng giá trị gì để làm đại diện cụm?

a)

Mode

b)

Trung vị (median)

c)

Max

d)

Mean

58.

K-modes dùng khi dữ liệu?

a)

Liên tục

b)

Hình ảnh

c)

Danh mục (categorical)

d)

Text dài

59.

Phân cụm phân cấp (hierarchical) có đặc điểm gì?

a)

Tạo cây phân cấp (dendrogram)

b)

Dùng mạng nơ-ron

c)

Chạy ngẫu nhiên

d)

Không lặp

60.

Hai hướng tiếp cận của hierarchical clustering là?

a)

K-means và DBSCAN

b)

Agglomerative (bottom-up) và Divisive (top-down)

c)

SGD và Adam

d)

Mean và Mode

61.

DBSCAN viết tắt của?

a)

Density-Based Spatial Clustering of Applications with Noise

b)

Distance-Based Sample Classification

c)

Deep Binary Scan

d)

Data-Biased Scale Cluster Algorithm

62.

DBSCAN thuộc loại?

a)

Phân hoạch

b)

Phân cấp

c)

Dựa trên mật độ (density-based)

d)

Lưới (grid-based)

63.

Ưu điểm của DBSCAN?

a)

Phát hiện cụm bất kỳ hình dạng và xử lý tốt outlier

b)

Luôn chính xác

c)

Nhanh hơn K-means

d)

Không cần chọn tham số

64.

Trong DBSCAN, điểm core là gì?

a)

Có ít nhất MinPts điểm trong vùng bán kính ε (epsilon)

b)

Có khoảng cách nhỏ nhất

c)

Có xác suất cao

d)

Không có ý nghĩa

65.

Epsilon trong DBSCAN là?

a)

Số lần lặp

b)

Bán kính tìm hàng xóm

c)

Hệ số lỗi

d)

Trọng số cụm

66.

Grid-based clustering hoạt động bằng cách?

a)

Chia không gian thành các ô lưới và nhóm các ô có mật độ cao

b)

Phân cụm cây

c)

Dùng mạng CNN

d)

Random chọn điểm

67.

STING là ví dụ của?

a)

Hierarchical clustering

b)

Density-based clustering

c)

Grid-based clustering

d)

Partitioning

68.

Ưu điểm chính của phương pháp grid-based?

a)

Tính toán nhanh, không phụ thuộc kích thước dữ liệu

b)

Tính chính xác cao hơn DBSCAN

c)

Dễ trực quan hóa

d)

Không cần tham số

69.

Grid-based clustering phù hợp khi?

a)

Dữ liệu lớn, không gian cao chiều

b)

Dữ liệu rời rạc

c)

Dữ liệu không có nhiễu

d)

Dữ liệu có nhãn

70.

Clustering có thể áp dụng cho bài toán nào?

a)

Gán nhãn trước

b)

Dự đoán lớp

c)

Phát hiện dị thường, phân đoạn thị trường, nén dữ liệu

d)

Dự đoán chuỗi thời gian

71.

GAN gồm hai thành phần chính là gì?

a)

Generator và Discriminator

b)

Decoder và Encoder

c)

Convolution và Pooling

d)

LSTM và CNN

72.

Vai trò của Generator trong GAN là?

a)

Phát hiện ảnh giả

b)

Sinh dữ liệu giả giống thật

c)

Phân loại ảnh

d)

Tối ưu hóa loss

73.

GAN được huấn luyện như thế nào?

a)

Generator thắng thì dừng

b)

Chỉ cập nhật Generator

c)

Generator và Discriminator cùng học theo kiểu đối kháng

d)

Dựa trên MAE

74.

StackGAN dùng GAN để làm gì?

a)

Phát hiện gian lận

b)

Tạo ảnh từ mô tả văn bản

c)

Dự đoán thời tiết

d)

Nhận diện chữ viết tay

75.

Một vấn đề thường gặp trong GAN là gì?

a)

Mode collapse (Generator tạo dữ liệu giống nhau)

b)

Accuracy thấp

c)

Gradient biến mất

d)

Dữ liệu thiếu nhãn

76.

LLM là mô hình học kiểu gì?

a)

Supervised

b)

Self-supervised learning

c)

Reinforcement

d)

Transfer learning

77.

Mô hình nào sau đây là LLM?

a)

ResNet

b)

GPT-3

c)

YOLO

d)

LeNet

78.

PhoBERT được huấn luyện trên?

a)

Dữ liệu tiếng Việt lớn (Wikipedia, VnExpress...)

b)

Chỉ sách giáo khoa

c)

Google Translate

d)

Ảnh việt hóa

79.

Kiến trúc chính của LLM là gì?

a)

CNN

b)

Transformer

c)

RNN

d)

PCA

80.

Một ứng dụng phổ biến của LLM là?

a)

Dịch ảnh

b)

Trả lời câu hỏi tự nhiên

c)

Đo khoảng cách

d)

Nén dữ liệu

81.

Metric Silhouette Coefficient đo lường gì?

a)

Mức độ phân tách và gắn kết của cụm

b)

Khoảng cách giữa trung tâm

c)

Xác suất cụm

d)

Độ chính xác

82.

Clustering intrinsic evaluation là gì?

a)

Đánh giá qua label

b)

Đánh giá bằng chính cấu trúc cụm không cần nhãn

c)

So sánh với mô hình khác

d)

Dùng mạng nơ-ron

83.

BCubed precision dùng cho?

a)

Đánh giá clustering có giám sát

b)

Dự đoán xác suất

c)

Gradient boosting

d)

KNN

84.

Subspace clustering (CLIQUE) xử lý gì?

a)

Tìm cụm trong không gian con chiều cao

b)

Clustering trên ảnh

c)

Class imbalance

d)

Feature ranking

85.

OPTICS khác DBSCAN ở điểm nào?

a)

Không dùng mật độ

b)

Không cần chọn epsilon cố định, sinh biểu đồ thứ tự

c)

Luôn phân hoạch

d)

Tăng số chiều

86.

Hàm mất mát trong ví dụ f(x) = x² + 2x + 5 là?

a)

f′(x) = 2x + 2

b)

f′(x) = x² + 2

c)

f′(x) = x + 1

d)

f′(x) = x² - 2

87.

Cập nhật x trong Gradient Descent: x = ?

a)

x + λ f(x)

b)

x - λ f′(x)

c)

x / λ

d)

x - λ^2

88.

Nếu gradient gần 0 thì?

a)

Cập nhật mạnh

b)

Đã gần điểm hội tụ

c)

Luôn nhảy bước lớn

d)

Mô hình bị overfitting

89.

Nếu f(x) là hàm lồi thì Gradient Descent...?

a)

Hội tụ về nghiệm duy nhất (global minimum)

b)

Tăng mãi

c)

Không dùng được

d)

Phụ thuộc random

90.

Mini-batch Gradient Descent...?

a)

Chia dữ liệu thành nhóm nhỏ để huấn luyện

b)

Chạy một mẫu mỗi lần

c)

Là SGD

d)

Luôn hội tụ nhanh hơn

91.

Bayesian Belief Network là gì?

a)

Mạng xác suất mô hình hóa quan hệ phụ thuộc giữa biến

b)

Một loại mạng nơ-ron

c)

Thuật toán phân cụm

d)

Dạng đặc biệt của kNN

92.

BBN khắc phục hạn chế nào của Naive Bayes?

a)

Xử lý được phụ thuộc giữa các thuộc tính

b)

Chạy nhanh hơn

c)

Tự động gán nhãn

d)

Giảm số chiều

93.

BBN được biểu diễn qua?

a)

Biểu đồ phân cụm

b)

Đồ thị có hướng không chu trình (DAG)

c)

Mạng nơ-ron sâu

d)

Hàm mất mát tuyến tính

94.

Thuật toán phổ biến học cấu trúc BBN là?

a)

K2 Algorithm

b)

Gradient Boosting

c)

EM Clustering

d)

SVM-Tree

95.

Nhược điểm chính của BBN?

a)

Không xử lý được dữ liệu rời rạc

b)

Phức tạp tính toán khi số thuộc tính lớn

c)

Thiếu độ chính xác

d)

Không mở rộng được

96.

ML cần nhiều feature engineering hơn DL vì?

a)

DL có thể tự học đặc trưng qua các tầng

b)

ML dùng mạng sâu hơn

c)

ML luôn có dữ liệu nhiều hơn

d)

DL không có activation function

97.

DL yêu cầu phần cứng gì cao hơn ML?

a)

GPU/TPU

b)

SSD

c)

HDD

d)

CPU đơn nhân

98.

Với dữ liệu nhỏ, nên dùng?

a)

ML truyền thống như SVM, Random Forest

b)

LSTM

c)

Transformer

d)

GAN

99.

ML thường học nhanh hơn DL vì?

a)

Dùng convolution

b)

Có ít tham số hơn

c)

Tối ưu tốt hơn

d)

Không dùng loss function

100.

Khi nào nên dùng DL thay vì ML?

a)

Dữ liệu nhỏ và rời rạc

b)

Dữ liệu lớn, nhiều chiều như ảnh/video

c)

Mô hình tuyến tính

d)

Dữ liệu không nhãn