NEW
Font size
WorksheetsCâu hỏi về Regression và Linear Regression
Total questions: 70
Worksheet time: 35mins
Regression thuộc loại học máy nào?
Unsupervised learning
Supervised learning
Reinforcement learning
Semi-supervised learning
Bài toán dự đoán giá nhà thuộc loại nào?
Classification
Regression
Clustering
Forecasting
Trong regression, biến mục tiêu y có tính chất gì?
Rời rạc
Liên tục
Chuỗi
Nhị phân
Mô hình Regression học gì từ dữ liệu?
Mối quan hệ giữa đầu vào x và đầu ra y
Tốc độ sinh nhản
Ma trận chỉ số
Chuẩn hoá dữ liệu
Mễ thuật Linear Regression để làm gì?
Ước lượng y như là hàm tuyến tính của x
Dự đoán nhãn phân loại
Tính toán mạng nơ-ron
Biến đổi vector
Phép tính của Linear Regression được xác định theo công thức:
f(x) = ax^2 + b
f(x) = w0 + w1x1 + ... + wmxm
f(x) = √(x)
f(x) = log(x)
Bias trong Linear Regression là giá trị nào?
w0 (hằng số tự do)
w1
x1
λ
Mục tiêu huấn luyện của mô hình Regression là?
Tối đa accuracy
Giảm tối đa hàm loss
Tăng số features
Giảm chi phí dữ liệu
Lỗi dự đoán của mô hình Regression được xác định bằng:
Accuracy
f(x) - y
Gradient
x - w
Cost function Mean Squared Error (MSE) được tính theo:
∑|f(x) - y|
∑(f(x) - y)^2
∑(f(x) + y)^2
∑|f(x) + y|
Hàm loss luôn âm đúng không?
Đúng
Sai
Tuỳ thuộc dữ liệu
Tùy mô hình
Mean Absolute Error (MAE) là?
Trung bình tổng sai số tuyệt đối
Trung bình tổng sai số bình phương
Chuẩn hoá dữ liệu
Trung bình nhãn
Tại sao RMSE được ưa chuộng hơn MAE trong nưốc sâu?
Tốc độ nhanh hơn
Nhạy cảm hơn với sai số lớn
Tính toán đơn giản
Áp dụng cho nhãn nhỏ
Cost function trong Linear Regression có đặc điểm gì?
Lôi lồi lồi (convex)
Lồi phi tuyến tính
Có nhiều cực tiểu
Không xác định
Gradient Descent được dùng để?
Gắn nhãn
Tìm giá trị tham số tối ưu
Tăng accuracy
Phát sinh dữ liệu
Trong Gradient Descent, đạo hàm > 0 thì làm gì?
Tăng giá trị tham số
Giảm giá trị tham số
Dừng cập nhật
Tăng bias
Vai trò của learning rate (λ)?
Xác định bước nhảy khi cập nhật
Tự động huấn luyện
Chọn feature
Gắn nhãn nhị
Learning rate quá lớn gây ra?
Tối ưu nhanh hơn
Mô hình chuẩn hơn
Bỏ qua minimum, hoặc không hội tụ
Đạo hàm sai
Overfitting xảy ra khi?
Mô hình không học được
Mô hình học qúa kỹ dữ liệu huấn luyện
Dữ liệu không có nhãn
Mô hình được tối ưu
Underfitting xảy ra khi?
Mô hình được tối ưu
Mô hình không bị nhiễu
Mô hình quá đơn giản, không bám dữ liệu
Dữ liệu thừa kém
Cross-validation giúp làm gì?
Huấn luyện mô hình nhanh hơn
Đánh giá khả năng tổng quát hoá của mô hình
Tăng kích thước dữ liệu
Xóa nhãn
K-fold cross-validation chia dữ liệu như thế nào?
Tự động random
Chia dữ liệu thành k phần, xoay vòng validation
Chia theo label
Gộp theo nhóm
Leave-one-out cross-validation là?
Lấy ngẫu nhiên 80% training
Lần lượt loại 1 dữ liệu làm test, còn lại train
Test trên tập validation
Cross-validation nhóm 3 phần
KNN regression dự đoán dựa trên?
Decision tree
Trung bình y của k láng giềng gần nhất
Deep learning
Max pooling
Trong KNN, k quá nhỏ dẫn đến?
Kết quả rất ổn định
Nhạy cảm với nhiễu
Hiệu suất cao
Tự động generalize
Trong KNN, k quá lớn dẫn đến?
Tăng noise
Mất nhãn
Bình quân hoá lỏm mất đặc trưng cục bộ
Tăng bias
Logistic Regression dùng cho?
Bài toán Classification
Dự đoán số thực
Tối ưu hoá ma trận
Giảm chiều
Hàm sigmoid dùng trong Logistic Regression trả về giá trị:
[0,∞)
[0,1]
(-∞,+∞)
[-1,1]
Classification dùng để làm gì?
Phân loại dữ liệu theo nhãn rời rạc
Dự đoán số liên tục
Sinh dữ liệu ngẫu nhiên
Tính trung bình dữ liệu
Dữ liệu trong classification gồm:
Chỉ input features
Chỉ output labels
Cặp (x, y) với x là feature, y là class label
Danh sách class
Classification khác regression ở điểm nào?
Dữ liệu ít hơn
Kết quả dự đoán là nhãn rời rạc
Sử dụng kNN
Dự đoán chuỗi
Output y trong classification thuộc kiểu dữ liệu nào?
Số liên tục
Nhãn rời rạc (categorical)
Dữ liệu text
Ma trận
Thuật ngữ "attribute set" đồng nghĩa với:
Class
Feature, predictor, input variable
Label
Outcome
Accuracy là gì?
Tỷ lệ dữ liệu test được dự đoán đúng
Tổng số prediction
Số nhãn huấn luyện
Độ phủ hợp giữa x và y
Error rate = ?
Accuracy + 1
1 - Accuracy
TP / (TP + TN)
FP / (FN + TN)
Sensitivity (Recall) đo lường?
TP / (TP + FN)
TP / (TP + FP)
TN / (FP + TN)
1 - Accuracy
Specificity là?
TN / (TP + FN)
TN / (FP + TN)
TP / (TP + TN)
FP / (TP + TN)
Precision là:
TP / (TP + FP)
TP / (TP + FN)
TN / (TN + FN)
FN / (TP + FP)
F1-score là:
TB của precision và recall
Trung bình hại hòa (harmonic mean)
Max precision, recall
TP - FN
ROC curve vẽ mối quan hệ giữa:
TPR (Recall) và FPR
Accuracy và Recall
Precision và F1
TP và TN
AUC là giá trị đại diện cho?
Precision
Diện tích dưới đường cong ROC
Accuracy
TP
AUC = 0.5 mang ý nghĩa?
Mô hình hoàn hảo
Đoán ngẫu nhiên (không phân biệt)
Precision = 1
Recall = 0
Accuracy cao nhưng Precision thấp đồng nghĩa với?
Mô hình tốt
Nhiều False Positive
Nhiều True Negative
Dữ liệu lớn
kNN d���a vào yếu tố nào?
Khoảng cách tới k láng giềng gần nhất
Cây quyết định
Tính entropy
Gradient descent
Trong kNN, k quá nhỏ gây ra?
Tổng quát hoá cao
Nhạy với nhiễu hoặc outlier
Bỏ qua outlier
Giảm noise
Trong kNN, k quá lớn gây ra?
Mất tính cục bộ, nghiên về đa số
Tăng sai số
Giảm accuracy
Tăng noise
Để đo khoảng cách trong kNN ta có thể dùng?
MAE
Gradient
Euclidean, Manhattan, Minkowski
Cross entropy
KNN thuộc loại học gì?
Eager learning
Lazy learning (không huấn luyện trước)
Deep learning
Online learning
Naive Bayes dựa trên giả thuyết?
Đồ thị quyết định
Bayes' Theorem
Gradient Descent
SVM Margin
Giả định lớn nhất trong Naive Bayes dựa trên:
P(Ci|X)
P(X|Ci) + P(Ci)
Accuracy
k-fold
Tính độc lập có điều kiện được giả định trong Naive Bayes giúp:
Giảm chi phí tính toán
Tăng độ chính xác
Giảm noise
Tăng recall
Dữ liệu numeric trong Naive Bayes thường dùng?
Random Forest
Phân phối Gaussian
Uniform
MAE
Để tránh xác suất = 0 trong Naive Bayes ta dùng?
Laplace Correction (add-one smoothing)
Gradient
Decision Tre
Dữ liệu numeric trong Naive Bayes thường dùng?
Random Forest
Phân phối Gaussian
Uniform
MAE
Để tránh xác suất = 0 trong Naive Bayes ta dùng?
Laplace Correction (add-one smoothing)
Gradient
Decision Tree
kNN tuning
Mục tiêu chính của SVM là?
Tìm siêu phẳng tối ưu phân tách các lớp
Tối đa số điểm đúng
Giảm MAE
Sinh dữ liệu mới
Margin trong SVM là gì?
Khoảng cách giữa hai điểm
Khoảng cách giữa siêu phẳng và điểm gần nhất
Tổng lỗi mô hình
Trung bình sai số
SVM hiệu quả nhất khi dữ liệu
Rất nhiễu
Có thể phân tách tuyến tính tốt
Có nhiều class
Có dạng ảnh
Kernel trick trong SVM giúp?
Biến dữ liệu phi tuyến thành tuyến tính trong không gian mới
Tối ưu độ chính xác
Xóa nhiễu
Gán nhãn
Một ví dụ kernel phổ biến trong SVM là?
MAE
RBF (Gaussian)
Cross entropy
Manhattan loss
Nếu chọn kernel sai trong SVM, điều gì có thể xảy ra?
Accuracy cao hơn
Mô hình underfitting hoặc overfitting
Không ảnh hưởng
Luôn tốt hơn Logistic Regression
SVM có thể dùng cho?
Regression duy nhất
Classification và Regression
Reinforcement Learning
Clustering
Hyperparameter C trong SVM ảnh hưởng?
Chiều của dữ liệu
Độ cho phép lỗi - trade-off giữa margin và lỗi
Learning rate
Epoch
Logistic Regression thường dùng cho?
Bài toán phân loại nhị phân
Phân cụm
Dự đoán giá trị liên tục
Tối ưu ma trận
Hàm sigmoid trong Logistic Regression giúp?
Sinh nhãn
Biến output thành xác suất trong [0, 1]
Tăng accuracy
Giảm noise
Output của Logistic Regression thường được xử lý như thế nào?
Nếu xác suất > 0.5 thì dự đoán class 1, ngược lại class 0
Luôn lấy nhãn lớn hơn
Làm tròn về 0 hoặc 1
Tự động normalize
Hàm mất mát thường dùng trong Logistic Regression?
MAE
MSE
Cross-entropy loss
RMSE
Regularization giúp gì cho Logistic Regression?
Tránh overfitting
Tăng precision
Sinh nhãn
Giảm recall
L1 regularization còn gọi là?
Lasso
Ridge
ElasticNet
Linear
Sự khác biệt chính giữa L1 và L2 trong Logistic Regression?
L1 phạt nhẹ hơn
L2 tạo sparse model
L1 có thể loại bỏ feature (hệ số = 0), L2 thì không
Không có sự khác biệt
