Font size
WorksheetsKiến thức về Mạng Neural
Total questions: 100
Worksheet time: 50mins
Mạng neural là gì?
Mô hình phi tuyến với đầu vào và đầu ra số học
A. Thuật toán phân cụm
A. Mô hình xác suất
A. Hệ thống logic
Perceptron là gì?
A. Bộ phân loại tuyến tính nhị phân đơn lớp
A. Mạng nhiều lớp
A. Mô hình hồi quy
A. Mạng hồi tiếp
Perceptron không thể học hàm nào sau đây?
AND
OR
XOR
NAND
Một perceptron gồm những thành phần nào?
Activation, pooling, softmax
Trọng số, bias, hàm kích hoạt
Entropy, kernel, margin
Loss, learning rate, epoch
Activation function nào là dạng ngưỡng rời rạc?
Step function (sgn)
Sigmoid
Tanh
ReLU
Hàm sigmoid biến đổi giá trị đầu vào thành?
[-1, 1]
[0, ∞)
[0, 1]
[-∞, ∞]
Hàm sigmoid có đạo hàm là?
f(x)
f(x)(1 - f(x))
x^2
e^x
Hàm tanh trả về giá trị trong khoảng?
[0, 1]
[-1, 1]
[-∞, ∞]
[0, ∞)
Hàm ReLU có đặc điểm gì?
Trả về 0 nếu x <= 0, ngược lại trả về x
Luôn trả về 1
Tạo giá trị ngẫu nhiên
Không khả vi
Ưu điểm chính của ReLU là?
Dễ tính đạo hàm và giảm vanishing gradient
Không phân biệt tuyến tính
Tối ưu margin
Cải thiện precision
MLP viết tắt của?
Multilayer Perceptron
Multi Loss Predictor
Machine Learned Predictor
Model Layer Phase
Lớp ẩn trong MLP có chức năng?
Tạo input mới
Học đặc trưng phi tuyến
Chuẩn hóa output
Không cần thiết
Mỗi liên kết trong mạng neural có?
Trọng số riêng
Hàm sigmoid
Hàm mất mát
Bộ lọc
Mạng neural có mấy loại lớp?
Input, processing
Input, hidden, output
Feature, weight, loss
Train, test
Cấu trúc mạng gồm các phần nào?
Neurons, layers, weights, activation functions
Trees, branches, leaves
Gradient, epoch, MAE
Bias, entropy, cluster
Lan truyền ngược là?
Cách tính đạo hàm ngược từ output về input
Học ngẫu nhiên
Học không giám sát
Kết thúc huấn luyện
Ý nghĩa chính của backpropagation?
Đánh giá mạng
Tối ưu trọng số qua đạo hàm của hàm lỗi
Giảm noise đầu vào
Sinh dữ liệu mới
Công cụ toán học cốt lõi của backpropagation?
Quy tắc chuỗi đạo hàm (chain rule)
Tích phân phân đoạn
Đại số tuyến tính
Giải tích tổ hợp
Backpropagation cần thông tin nào để cập nhật trọng số?
Gradient của hàm lỗi theo từng trọng số
Giá trị output
Ma trận hiệp phương sai
Tỉ lệ dropout
Sau mỗi lần lan truyền ngược, trọng số được cập nhật bằng?
w = w - learning_rate * gradient
w = w + output
w = w^2
w = bias * epoch
Hàm softmax thường dùng trong?
Regression
Classification đa lớp
Clustering
Reinforcement
Softmax trả về?
Giá trị nhị phân
Xác suất các lớp cộng lại bằng 1
Hàm lỗi
Entropy
Hàm mất mát (loss function) phổ biến cho classification là?
MSE
RMSE
Cross-entropy
Euclidean
Cross-entropy đo lường?
Độ lệch giữa phân phối dự đoán và thực tế
Khoảng cách Euclidean
Tổng số lỗi tuyệt đối
Tổng đạo hàm
Optimizer nào sau đây mở rộng từ SGD?
Adam
MSE
ReLU
Dropout
Adam kết hợp những kỹ thuật nào?
Dropout và tanh
Momentum và adaptive learning rate
SGD và Max pooling
Cross-validation và RMS
Epoch là gì?
Một lượt qua toàn bộ tập huấn luyện
Một batch
Một class
Một chiều mạng
Batch size ảnh hưởng tới?
Số class
Tốc độ và ổn định huấn luyện
Đầu ra
Hàm kích hoạt
Nếu learning rate quá cao thì?
Hội tụ nhanh
Không hội tụ hoặc dao động
Giảm lỗi nhanh
Tăng precision
Nếu learning rate quá thấp?
Không học được
Học rất chậm
Tăng lỗi
Không cập nhật trọng số
CNN viết tắt của?
Convolutional Neural Network
Core Neural Net
Classifier Network Node
Converged Normal Network
CNN nổi bật trong xử lý?
Chuỗi thời gian
Hình ảnh và video
Văn bản
Câu hỏi trắc nghiệm
Thành phần chính của CNN gồm?
Convolution layer, pooling layer, fully connected layer
Tree, node, margin
Perceptron, sigmoid, MAE
Layer, bias, MAE
Convolution giúp?
Trích xuất đặc trưng cục bộ
Sinh noise
Tối ưu gradient
Làm sạch dữ liệu
Pooling layer dùng để?
Giảm chiều và giữ đặc trưng chính
Tăng batch size
Làm mịn output
Phân loại ảnh
Max pooling chọn gì?
Trung bình
Tích
Giá trị lớn nhất trong vùng
Giá trị ngẫu nhiên
Dropout được dùng để?
Giảm overfitting
Tăng loss
Giảm số lớp
Xóa nhãn
Một ứng dụng phổ biến của mạng neural là?
Dịch mã DNA
Dự đoán GDP
Nhận diện khuôn mặt
Tính diện tích hình vuông
Early stopping giúp?
Ngừng huấn luyện sớm nếu không cải thiện
Tăng số epoch
Giảm dropout
Làm sạch dữ liệu
Transfer learning nghĩa là?
Huấn luyện từ đầu
Tận dụng mô hình đã học cho bài toán mới
Dùng dữ liệu mới
Trích xuất lớp output
Clustering là phương pháp?
Học không giám sát (Unsupervised learning)
Học có giám sát
Học tăng cường
Học bán giám sát
Mục tiêu chính của clustering là?
Dự đoán nhãn
Nhóm các đối tượng tương đồng vào cùng cụm
Giảm số chiều
Sinh dữ liệu mới
Một cluster là gì?
Một đối tượng đơn lẻ
Một nhóm các đối tượng tương đồng nhau
Một nhãn
Một hàm toán học
Clustering khác classification ở điểm nào?
Không biết trước nhãn
Chia tập train và test
Có mô hình giám sát
Tăng accuracy
Ứng dụng nào sau đây phù hợp với clustering?
Dự đoán giá nhà
Phân loại email spam
Nhóm khách hàng theo hành vi mua sắm
Dịch ngôn ngữ
Khoảng cách phổ biến dùng trong clustering là?
Euclidean và Manhattan
Hamming
Cosine và Jaccard
Pearson
Khoảng cách Euclidean được dùng khi?
Dữ liệu dạng văn bản
Dữ liệu số liên tục
Dữ liệu rời rạc
Dữ liệu hình ảnh
Trong metric Minkowski, p = 1 cho ra?
Euclidean
Manhattan
Cosine
Mahalanobis
Trong clustering, intra-cluster distance là?
Khoảng cách giữa các điểm trong cùng một cụm
Khoảng cách giữa các cụm
Tổng lỗi
Trung bình đặc trưng
Mục tiêu khi clustering là?
Tăng số cụm
Giảm khoảng cách trong cụm, tăng khoảng cách giữa cụm
Tối đa accuracy
Tăng số chiều
K-means là phương pháp?
Phân hoạch dữ liệu thành K cụm dựa vào trung tâm cụm
Dựa trên mật độ
Phân loại tuyến tính
Tìm cây tối ưu
K trong K-means biểu thị?
Số thuộc tính
Số cụm cần phân chia
Số chiều
Số lần lặp
Hàm lỗi trong K-means là?
MSE
Sum of Squared Errors (SSE)
Cross-entropy
MAE
Trung tâm cụm trong K-means là?
Mode
Mean của các điểm trong cụm
Giá trị đầu tiên
Random vector
Nhược điểm chính của K-means?
Không hội tụ
Nhạy với outliers và khởi tạo ngẫu nhiên
Không xử lý dữ liệu số
Không mở rộng được
K-medoids cải tiến gì so với K-means?
Giảm thời gian chạy
Ít nhạy với outlier do chọn điểm trung tâm là 1 điểm thực tế
Dễ code hơn
Xác suất cao hơn
K-medians dùng giá trị gì để làm đại diện cụm?
Mode
Trung vị (median)
Max
Mean
K-modes dùng khi dữ liệu?
Liên tục
Hình ảnh
Danh mục (categorical)
Text dài
Phân cụm phân cấp (hierarchical) có đặc điểm gì?
Tạo cây phân cấp (dendrogram)
Dùng mạng nơ-ron
Chạy ngẫu nhiên
Không lặp
Hai hướng tiếp cận của hierarchical clustering là?
K-means và DBSCAN
Agglomerative (bottom-up) và Divisive (top-down)
SGD và Adam
Mean và Mode
DBSCAN viết tắt của?
Density-Based Spatial Clustering of Applications with Noise
Distance-Based Sample Classification
Deep Binary Scan
Data-Biased Scale Cluster Algorithm
DBSCAN thuộc loại?
Phân hoạch
Phân cấp
Dựa trên mật độ (density-based)
Lưới (grid-based)
Ưu điểm của DBSCAN?
Phát hiện cụm bất kỳ hình dạng và xử lý tốt outlier
Luôn chính xác
Nhanh hơn K-means
Không cần chọn tham số
Trong DBSCAN, điểm core là gì?
Có ít nhất MinPts điểm trong vùng bán kính ε (epsilon)
Có khoảng cách nhỏ nhất
Có xác suất cao
Không có ý nghĩa
Epsilon trong DBSCAN là?
Số lần lặp
Bán kính tìm hàng xóm
Hệ số lỗi
Trọng số cụm
Grid-based clustering hoạt động bằng cách?
Chia không gian thành các ô lưới và nhóm các ô có mật độ cao
Phân cụm cây
Dùng mạng CNN
Random chọn điểm
STING là ví dụ của?
Hierarchical clustering
Density-based clustering
Grid-based clustering
Partitioning
Ưu điểm chính của phương pháp grid-based?
Tính toán nhanh, không phụ thuộc kích thước dữ liệu
Tính chính xác cao hơn DBSCAN
Dễ trực quan hóa
Không cần tham số
Grid-based clustering phù hợp khi?
Dữ liệu lớn, không gian cao chiều
Dữ liệu rời rạc
Dữ liệu không có nhiễu
Dữ liệu có nhãn
Clustering có thể áp dụng cho bài toán nào?
Gán nhãn trước
Dự đoán lớp
Phát hiện dị thường, phân đoạn thị trường, nén dữ liệu
Dự đoán chuỗi thời gian
GAN gồm hai thành phần chính là gì?
Generator và Discriminator
Decoder và Encoder
Convolution và Pooling
LSTM và CNN
Vai trò của Generator trong GAN là?
Phát hiện ảnh giả
Sinh dữ liệu giả giống thật
Phân loại ảnh
Tối ưu hóa loss
GAN được huấn luyện như thế nào?
Generator thắng thì dừng
Chỉ cập nhật Generator
Generator và Discriminator cùng học theo kiểu đối kháng
Dựa trên MAE
StackGAN dùng GAN để làm gì?
Phát hiện gian lận
Tạo ảnh từ mô tả văn bản
Dự đoán thời tiết
Nhận diện chữ viết tay
Một vấn đề thường gặp trong GAN là gì?
Mode collapse (Generator tạo dữ liệu giống nhau)
Accuracy thấp
Gradient biến mất
Dữ liệu thiếu nhãn
LLM là mô hình học kiểu gì?
Supervised
Self-supervised learning
Reinforcement
Transfer learning
Mô hình nào sau đây là LLM?
ResNet
GPT-3
YOLO
LeNet
PhoBERT được huấn luyện trên?
Dữ liệu tiếng Việt lớn (Wikipedia, VnExpress...)
Chỉ sách giáo khoa
Google Translate
Ảnh việt hóa
Kiến trúc chính của LLM là gì?
CNN
Transformer
RNN
PCA
Một ứng dụng phổ biến của LLM là?
Dịch ảnh
Trả lời câu hỏi tự nhiên
Đo khoảng cách
Nén dữ liệu
Metric Silhouette Coefficient đo lường gì?
Mức độ phân tách và gắn kết của cụm
Khoảng cách giữa trung tâm
Xác suất cụm
Độ chính xác
Clustering intrinsic evaluation là gì?
Đánh giá qua label
Đánh giá bằng chính cấu trúc cụm không cần nhãn
So sánh với mô hình khác
Dùng mạng nơ-ron
BCubed precision dùng cho?
Đánh giá clustering có giám sát
Dự đoán xác suất
Gradient boosting
KNN
Subspace clustering (CLIQUE) xử lý gì?
Tìm cụm trong không gian con chiều cao
Clustering trên ảnh
Class imbalance
Feature ranking
OPTICS khác DBSCAN ở điểm nào?
Không dùng mật độ
Không cần chọn epsilon cố định, sinh biểu đồ thứ tự
Luôn phân hoạch
Tăng số chiều
Hàm mất mát trong ví dụ f(x) = x² + 2x + 5 là?
f′(x) = 2x + 2
f′(x) = x² + 2
f′(x) = x + 1
f′(x) = x² - 2
Cập nhật x trong Gradient Descent: x = ?
x + λ f(x)
x - λ f′(x)
x / λ
x - λ^2
Nếu gradient gần 0 thì?
Cập nhật mạnh
Đã gần điểm hội tụ
Luôn nhảy bước lớn
Mô hình bị overfitting
Nếu f(x) là hàm lồi thì Gradient Descent...?
Hội tụ về nghiệm duy nhất (global minimum)
Tăng mãi
Không dùng được
Phụ thuộc random
Mini-batch Gradient Descent...?
Chia dữ liệu thành nhóm nhỏ để huấn luyện
Chạy một mẫu mỗi lần
Là SGD
Luôn hội tụ nhanh hơn
Bayesian Belief Network là gì?
Mạng xác suất mô hình hóa quan hệ phụ thuộc giữa biến
Một loại mạng nơ-ron
Thuật toán phân cụm
Dạng đặc biệt của kNN
BBN khắc phục hạn chế nào của Naive Bayes?
Xử lý được phụ thuộc giữa các thuộc tính
Chạy nhanh hơn
Tự động gán nhãn
Giảm số chiều
BBN được biểu diễn qua?
Biểu đồ phân cụm
Đồ thị có hướng không chu trình (DAG)
Mạng nơ-ron sâu
Hàm mất mát tuyến tính
Thuật toán phổ biến học cấu trúc BBN là?
K2 Algorithm
Gradient Boosting
EM Clustering
SVM-Tree
Nhược điểm chính của BBN?
Không xử lý được dữ liệu rời rạc
Phức tạp tính toán khi số thuộc tính lớn
Thiếu độ chính xác
Không mở rộng được
ML cần nhiều feature engineering hơn DL vì?
DL có thể tự học đặc trưng qua các tầng
ML dùng mạng sâu hơn
ML luôn có dữ liệu nhiều hơn
DL không có activation function
DL yêu cầu phần cứng gì cao hơn ML?
GPU/TPU
SSD
HDD
CPU đơn nhân
Với dữ liệu nhỏ, nên dùng?
ML truyền thống như SVM, Random Forest
LSTM
Transformer
GAN
ML thường học nhanh hơn DL vì?
Dùng convolution
Có ít tham số hơn
Tối ưu tốt hơn
Không dùng loss function
Khi nào nên dùng DL thay vì ML?
Dữ liệu nhỏ và rời rạc
Dữ liệu lớn, nhiều chiều như ảnh/video
Mô hình tuyến tính
Dữ liệu không nhãn
