Font size
WorksheetsCâu hỏi trắc nghiệm Học máy (Machine Learning) – Lớp 12
Total questions: 90
Worksheet time: 45mins
Học máy (Machine Learning) là gì?
Một nhánh của khoa học máy tính giúp máy tự học từ dữ liệu
Một ngôn ngữ lập trình
Một phần mềm phân tích dữ liệu thủ công
Một công nghệ lưu trữ dữ liệu
Học máy thuộc lĩnh vực nào của khoa học dữ liệu?
Lập trình web
Phân tích dữ liệu và trí tuệ nhân tạo
Xử lý văn bản
Quản trị mạng
Mục tiêu chính của học máy là gì?
Tăng dung lượng lưu trữ dữ liệu
Giúp máy tính tự động học từ dữ liệu để đưa ra dự đoán hoặc quyết định
Thay thế hoàn toàn con người
Tạo hình ảnh đồ họa 3D
Học máy được chia thành mấy loại chính?
2
3
4
5
Các loại học máy chính là gì?
Supervised, Unsupervised, Reinforcement Learning
Classification, Regression, Clustering
AI, Data Mining, Deep Learning
None of the above
Thuật toán trong học máy là gì?
Một tập các quy tắc giúp máy học từ dữ liệu
Một dạng phần cứng máy tính
Một cơ sở dữ liệu
Một giao diện người dùng
Dữ liệu huấn luyện (training data) là gì?
Dữ liệu được sử dụng để kiểm tra mô hình
Dữ liệu được dùng để dạy mô hình học
Dữ liệu bị loại bỏ
Dữ liệu chứa toàn lỗi
Trong học máy, "model" có nghĩa là gì?
Một file hình ảnh
Cấu trúc toán học mà máy học từ dữ liệu
Một kiểu dữ liệu
Một phần mềm hệ thống
Quá trình đánh giá hiệu suất mô hình được gọi là gì?
Training
Testing
Validation
Optimization
Một ứng dụng phổ biến của học máy là gì?
Gợi ý phim trên Netflix
Soạn nhạc
Dịch thuật thủ công
Sao lưu dữ liệu
Trong học máy, "overfitting" là gì?
Mô hình quá đơn giản
Mô hình học thuộc dữ liệu huấn luyện mà không tổng quát tốt
Mô hình hoạt động quá nhanh
Dữ liệu bị thiếu
"Underfitting" có nghĩa là gì?
Mô hình không học đủ thông tin từ dữ liệu
Mô hình quá phức tạp
Mô hình chạy quá chậm
Dữ liệu bị nhiễu quá nhiều
Quá trình chia dữ liệu thành tập huấn luyện và kiểm thử gọi là gì?
Data Mining
Data Splitting
Data Collection
Data Storage
"Feature" trong học máy là gì?
Một đặc trưng hoặc thuộc tính mô tả dữ liệu
Một loại thuật toán
Một giá trị ngẫu nhiên
Một phần cứng hỗ trợ học máy
"Label" trong học máy có giám sát là gì?
Dữ liệu đầu ra (output) mà mô hình cần dự đoán
Một tập dữ liệu không có nhãn
Một phương pháp phân cụm
Một dạng kiểm tra chéo
"Accuracy" dùng để đo điều gì?
Độ chính xác của mô hình
Tốc độ xử lý của máy tính
Dung lượng dữ liệu
Độ phức tạp của thuật toán
"Training" và "Testing" khác nhau như thế nào?
Training là quá trình mô hình học, Testing là quá trình đánh giá
Cả hai là một
Testing xảy ra trước Training
Training chỉ dành cho dữ liệu kiểm thử
Một ví dụ điển hình của học máy trong đời sống là gì?
Nhận diện khuôn mặt
Tính toán thủ công
Đánh máy văn bản
Sử dụng máy tính cầm tay
Học máy có giám sát (Supervised Learning) là gì?
Mô hình học từ dữ liệu có nhãn (label)
Mô hình không cần dữ liệu huấn luyện
Mô hình không có đầu ra xác định
Mô hình học mà không cần dữ liệu
Ví dụ điển hình của Supervised Learning là gì?
Phân loại email spam
Gom cụm khách hàng
Giảm số chiều dữ liệu
Phát hiện mẫu ẩn trong dữ liệu
Dữ liệu trong Supervised Learning gồm hai thành phần nào?
Feature và Label
Input và Output
Training và Testing
Feature và Cluster
Học có giám sát được chia thành hai loại chính là gì?
Classification và Regression
Clustering và Segmentation
Association và Reinforcement
Prediction và Grouping
Thuật toán hồi quy (Regression) dùng để làm gì?
Dự đoán giá trị liên tục
Phân loại dữ liệu rời rạc
Giảm nhiễu dữ liệu
Tăng độ phức tạp của mô hình
Ví dụ về bài toán hồi quy là gì?
Dự đoán giá nhà
Phân loại email
Nhận dạng chữ viết
Gom cụm khách hàng
Bài toán phân loại (Classification) nhằm mục đích gì?
Gán dữ liệu vào các nhóm có sẵn
Giảm số chiều dữ liệu
Sinh dữ liệu mới
Gom nhóm không nhãn
Trong Classification, "binary classification" nghĩa là gì?
Phân loại hai lớp
Phân loại nhiều lớp
Phân loại không giám sát
Phân loại ngẫu nhiên
Linear Regression dựa trên mối quan hệ gì giữa biến độc lập và phụ thuộc?
Tuyến tính
Phi tuyến tính
Ngẫu nhiên
Tương quan nghịch
Trong Linear Regression, hàm mất mát phổ biến là gì?
Mean Squared Error (MSE)
Cross Entropy
Hinge Loss
Log Loss
Logistic Regression được dùng cho loại bài toán nào?
Phân loại
Hồi quy tuyến tính
Gom cụm
Giảm chiều dữ liệu
Trong Decision Tree, nút gốc (root node) là gì?
Điểm bắt đầu của quá trình phân chia dữ liệu
Nút cuối cùng của cây
Dữ liệu bị loại bỏ
Nút chứa dữ liệu nhãn
Tiêu chí chia nhánh phổ biến trong Decision Tree là gì?
Information Gain
Cross Validation
Clustering
Reinforcement
"Overfitting" thường xảy ra trong Decision Tree khi nào?
Cây quá sâu
Cây quá nông
Dữ liệu bị thiếu
Không có nhãn
Thuật toán K-Nearest Neighbors (KNN) dựa trên nguyên tắc gì?
Khoảng cách giữa các điểm dữ liệu
Trọng số tuyến tính
Học tham số
Tăng cường chính sách
Trong KNN, giá trị K càng lớn thì mô hình thế nào?
Tổng quát hơn
Nhạy cảm hơn
Dễ overfit hơn
Dễ underfit hơn
SVM viết tắt của gì?
Support Vector Machine
Simple Vector Model
System Value Metric
Sample Variable Machine
Mục tiêu của SVM là gì?
Tìm siêu phẳng (hyperplane) tối ưu để phân tách dữ liệu
Tăng số lượng đặc trưng
Giảm chiều dữ liệu
Tạo nhãn giả cho dữ liệu
Trong SVM, kernel function được dùng để làm gì?
Biến đổi dữ liệu sang không gian mới
Giảm kích thước dữ liệu
Thay đổi learning rate
Giảm noise
Naive Bayes dựa trên định lý nào?
Bayes Theorem
Pythagoras
Euclid
Gauss
Giả định chính của Naive Bayes là gì?
Các đặc trưng độc lập với nhau
Dữ liệu có mối liên hệ phức tạp
Phân phối chuẩn lệch
Các nhãn phụ thuộc lẫn nhau
Mô hình nào phù hợp với dữ liệu có nhãn và liên tục thay đổi theo thời gian?
Linear Regression
Time Series Model
PCA
K-Means
Cross-validation dùng để làm gì?
Đánh giá hiệu suất mô hình trên nhiều tập dữ liệu
Tăng kích thước dữ liệu
Chia nhỏ đặc trưng
Kiểm tra lỗi cú pháp
Trong Cross-validation, kỹ thuật K-Fold chia dữ liệu thành mấy phần?
K phần
2 phần
3 phần
5 phần cố định
Random Forest là gì?
Tập hợp nhiều Decision Trees
Một cây đơn
Mô hình dựa trên KNN
Mô hình tuyến tính đơn giản
Ưu điểm của Random Forest là gì?
Giảm overfitting so với Decision Tree
Huấn luyện nhanh hơn mọi mô hình
Không cần dữ liệu huấn luyện
Không cần gán nhãn
Gradient Boosting khác Random Forest ở điểm nào?
Cây được huấn luyện tuần tự để sửa lỗi cây trước
Cây được huấn luyện song song
Không sử dụng gradient
Không có lỗi tích lũy
Mô hình Ensemble Learning dùng để làm gì?
Kết hợp nhiều mô hình để tăng độ chính xác
Tạo thêm dữ liệu giả
Giảm số chiều dữ liệu
Chia nhỏ tập dữ liệu
Khi dữ liệu mất cân bằng (imbalanced data), cần làm gì?
Cân bằng lại bằng oversampling hoặc undersampling
Bỏ qua dữ liệu thiếu số
Thêm nhãn ngẫu nhiên
Giảm kích thước dữ liệu
Evaluation metric nào phù hợp cho phân loại nhiều lớp?
Accuracy, Precision, Recall, F1-score
MSE, RMSE
Silhouette Score
Entropy
ROC-AUC dùng để đánh giá điều gì?
Hiệu quả phân biệt giữa các lớp
Tốc độ huấn luyện
Kích thước dữ liệu
Số lượng đặc trưng
Trong Regression, hệ số R^2 biểu diễn điều gì?
Mức độ phù hợp của mô hình với dữ liệu
Tốc độ huấn luyện
Độ nhiễu của dữ liệu
Số chiều của đặc trưng
Học máy không giám sát (Unsupervised Learning) là gì?
Học từ dữ liệu không có nhãn
Học từ dữ liệu có nhãn
Học dựa trên phần thưởng
Học không cần dữ liệu
Mục tiêu chính của Unsupervised Learning là gì?
Tìm cấu trúc hoặc mẫu ẩn trong dữ liệu
Dự đoán giá trị đầu ra
Huấn luyện mô hình theo nhãn
Sinh dữ liệu giả
Hai nhóm bài toán chính của Unsupervised Learning là gì?
Clustering và Dimensionality Reduction
Classification và Regression
Reinforcement và Supervised
Association và Forecasting
'Clustering' nghĩa là gì?
Phân nhóm các điểm dữ liệu tương tự nhau
Dự đoán đầu ra
Gán nhãn cho dữ liệu
Giảm nhiễu dữ liệu
Thuật toán K-Means thuộc loại nào?
Clustering
Classification
Regression
Reinforcement
Trong K-Means, K biểu thị điều gì?
Số cụm cần phân chia
Số đặc trưng của dữ liệu
Số vòng lặp huấn luyện
Số thuộc tính độc lập
Mục tiêu của thuật toán K-Means là gì?
Tối thiểu hóa khoảng cách trong cụm
Tối đa hóa khoảng cách trong cụm
Giảm số chiều dữ liệu
Tăng độ nhiễu dữ liệu
Trong K-Means, bước đầu tiên là gì?
Chọn ngẫu nhiên K tâm cụm (centroid)
Tính khoảng cách Euclidean
Gán nhãn cho dữ liệu
Chuẩn hóa dữ liệu
Khi số lượng cụm K quá lớn, điều gì xảy ra?
Mô hình có thể overfitting
Mô hình underfitting
Giảm khả năng phân tách
Không ảnh hưởng gì
Hierarchical Clustering khác K-Means ở điểm nào?
Không cần chỉ định số cụm trước
Dựa trên khoảng cách trung bình
Dùng mạng nơ-ron
Không có bước hợp cụm
Phương pháp nào được dùng để xác định số cụm tối ưu trong K-Means?
Elbow Method
ROC Curve
Gradient Descent
Silhouette Boost
PCA (Principal Component Analysis) là kỹ thuật gì?
Giảm chiều dữ liệu
Phân loại dữ liệu
Gom cụm
Sinh dữ liệu mới
Mục tiêu của PCA là gì?
Giảm số đặc trưng nhưng vẫn giữ thông tin quan trọng
Tăng số lượng đặc trưng
Loại bỏ dữ liệu bị lỗi
Gán nhãn cho dữ liệu
Thành phần chính (Principal Component) là gì?
Tổ hợp tuyến tính của các đặc trưng ban đầu
Một nhãn của dữ liệu
Một mẫu ngẫu nhiên
Một phần tử dữ liệu gốc
Giải thuật nào thường dùng để trích xuất thành phần chính trong PCA?
Eigenvalue Decomposition
Decision Tree
Logistic Regression
Random Forest
Thuật toán Apriori dùng cho loại bài toán nào?
Association Rule Learning
Regression
Clustering
Dimensionality Reduction
Mục tiêu của Association Rule Learning là gì?
Tìm mối quan hệ giữa các mục trong tập dữ liệu
Phân loại dữ liệu
Giảm chiều dữ liệu
Gom cụm dữ liệu tương tự
Trong Apriori, 'support' biểu thị điều gì?
Tần suất xuất hiện của một tập mục trong dữ liệu
Độ chính xác của mô hình
Mức độ liên kết giữa nhãn
Tốc độ huấn luyện
'Confidence' trong luật kết hợp thể hiện gì?
Xác suất xuất hiện của mục B khi mục A xuất hiện
Độ lệch chuẩn của dữ liệu
Độ chính xác tổng thể
Mức độ tương quan tuyến tính
'Anomaly detection' trong Unsupervised Learning nhằm mục đích gì?
Phát hiện điểm dữ liệu bất thường
Gom nhóm dữ liệu tương tự
Dự đoán giá trị liên tục
Gán nhãn mới cho dữ liệu
Thuật toán nào phù hợp để phát hiện bất thường?
Isolation Forest
Linear Regression
Decision Tree
Random Forest
Mô hình Autoencoder thuộc nhóm nào?
Unsupervised Learning
Supervised Learning
Reinforcement Learning
Semi-supervised Learning
Autoencoder thường được dùng để làm gì?
Nén và tái tạo dữ liệu
Phân loại nhãn chính xác
Tối ưu hóa phần thưởng
Tăng số đặc trưng
Học tăng cường (Reinforcement Learning – RL) là gì?
Quá trình huấn luyện mô hình bằng dữ liệu có sẵn
Quá trình agent học bằng cách thử và sai thông qua phản hồi (reward)
Quá trình dán nhãn dữ liệu đầu vào
Quá trình phân tích mối quan hệ tuyến tính giữa các biến
Trong học tăng cường, thuật ngữ agent chỉ điều gì?
Tập dữ liệu đầu vào
Mô hình dự đoán
Thực thể thực hiện hành động trong môi trường
Tập các tham số huấn luyện
Environment (môi trường) trong RL có vai trò gì?
Lưu trữ dữ liệu huấn luyện
Đưa ra phản hồi và trạng thái mới cho agent
Là phần tính toán giá trị Q
Là tập hợp chính sách của agent
Agent trong RL nhận được thông tin từ môi trường dưới dạng gì?
Ảnh
Reward và trạng thái mới (next state)
Tập dữ liệu
Độ chính xác
Reward (phần thưởng) trong RL là gì?
Giá trị mô hình dự đoán
Thông tin mô tả môi trường
Phản hồi cho agent sau mỗi hành động
Kết quả huấn luyện cuối cùng
Học tăng cường khác học có giám sát ở điểm nào?
RL không có tập dữ liệu nhãn sẵn
RL không có đầu vào
RL chỉ học một lần duy nhất
RL không có mô hình
Mục tiêu của agent trong RL là gì?
Giảm sai số dự đoán
Tối đa hóa tổng phần thưởng nhận được
Tối thiểu hóa giá trị Q
Giảm độ phức tạp của môi trường
Q-learning là thuật toán thuộc loại nào?
Supervised learning
Unsupervised learning
Reinforcement learning
Deep learning
Hàm Q(s, a) biểu diễn điều gì?
Xác suất hành động
Giá trị kỳ vọng của phần thưởng khi thực hiện hành động a tại trạng thái s
Tổng phần thưởng trung bình
Hàm tổn thất
Policy (chính sách) trong RL có chức năng gì?
Tính toán giá trị trung bình
Quyết định hành động tiếp theo của agent dựa vào trạng thái
Chọn phần thưởng lớn nhất
Giảm tốc độ học
Một chính sách tối ưu (optimal policy) là gì?
Chính sách chọn hành động ngẫu nhiên
Chính sách mang lại tổng phần thưởng lớn nhất theo thời gian
Chính sách giúp agent dừng sớm
Chính sách có reward bằng 0
Discount factor (γ) trong RL dùng để làm gì?
Cân bằng giữa phần thưởng hiện tại và tương lai
Tăng tốc độ học
Giảm giá trị Q về 0
Ngăn chặn overfitting
Học tăng cường thường được áp dụng trong lĩnh vực nào?
Phân loại email
Dự đoán giá cổ phiếu
Robot tự hành và trò chơi (game AI)
Xử lý ảnh tĩnh
Deep Q-Network (DQN) là sự kết hợp giữa hai lĩnh vực nào?
Deep Learning và Reinforcement Learning
Unsupervised Learning và Statistics
Decision Tree và Neural Network
PCA và Regression
Thuật toán Monte Carlo trong RL dựa trên nguyên tắc nào?
Tính toán toàn bộ phần thưởng sau khi kết thúc tập
Cập nhật giá trị sau mỗi bước hành động
Giảm dần learning rate
Bỏ qua reward âm
Exploration và exploitation trong RL thể hiện điều gì?
Khả năng dự đoán chính xác dữ liệu mới
Cân bằng giữa việc thử hành động mới và tận dụng hành động tốt đã biết
Quá trình chuẩn hóa dữ liệu
Lựa chọn phần thưởng ngẫu nhiên
Trade-off giữa exploration và exploitation có nghĩa là gì?
Agent phải chọn giữa học và kiểm tra
Agent cần cân bằng giữa khám phá cái mới và tận dụng kinh nghiệm cũ
Agent phải giảm reward để học tốt hơn
Agent không thể nhận reward âm
