Font size
WorksheetsBài kiểm tra trắc nghiệm về Trí tuệ nhân tạo và Học máy
Total questions: 150
Worksheet time: 1hrs 15mins
Thuật ngữ “Artificial Intelligence” được đưa ra lần đầu tiên vào năm nào?
1950
1956
1970
1980
Đặc điểm nào sau đây mô tả về Weak AI (AI yếu)?
Có ý nghĩ, lý trí và nhận thức
Có khả năng thực hiện mọi nhiệm vụ như con người
Chỉ có thể mô phỏng một hoặc một số hành vi trí tuệ của con người
Tự học từ trải nghiệm mà không cần can thiệp
Sắp xếp nào sau đây đúng về mối quan hệ giữa các lĩnh vực?
Deep Learning < Machine Learning < AI
AI < Machine Learning < Deep Learning
Machine Learning < AI < Deep Learning
Deep Learning < AI < Machine Learning
Trong quy trình xây dựng mô hình, bước nào tốn nhiều thời gian và nguồn lực nhất?
Thu thập dữ liệu
Chuẩn bị dữ liệu
Huấn luyện mô hình
Đánh giá mô hình
Khi gặp dữ liệu thiếu (Missing value) khoảng 70–80% ở một cột, phương pháp xử lý tốt nhất là:
Điền giá trị trung bình
Loại bỏ hàng
Loại bỏ cột
Giữ nguyên dữ liệu
Học máy có giám sát (Supervised Learning) bao gồm hai loại chính là:
Phân cụm và Giảm chiều dữ liệu
Phân loại và Hồi quy
Học củng cố và Học bán giám sát
Phân loại và Phân cụm
Thuật toán KNN (K-Nearest Neighbors) còn được gọi là gì?
Eager learning
Lazy learning
Deep learning
Reinforcement learning
Chỉ số Accuracy (Độ chính xác) không phù hợp để đánh giá khi nào?
Tập dữ liệu lớn
Tập dữ liệu mất cân bằng
Mô hình Hồi quy
Khi dùng tập Test
Precision cao nhưng Recall thấp có nghĩa là:
Mô hình dự đoán nhầm nhiều
Mô hình bỏ sót nhiều trường hợp dương tính thực tế
Mô hình dự đoán tất cả là dương tính
Mô hình hoạt động hoàn hảo
Nút lá (Leaf nodes) trong Cây quyết định biểu diễn điều gì?
Thuộc tính quyết định
Đầu ra của quyết định
Nhãn lớp
Phép thử logic
Đâu là độ đo lựa chọn thuộc tính phổ biến trong Cây quyết định?
Euclidean và Manhattan
Gini Index và Entropy
MAE và MSE
Precision và Recall
Thuật toán Naive Bayes dựa trên giả thiết nào về các chiều dữ liệu?
Phụ thuộc lẫn nhau
Độc lập với nhau
Luôn tuân theo phân phối chuẩn
Có trọng số như nhau
Kỹ thuật Bag of Words (BoW) trong NLP tập trung vào điều gì?
Ngữ pháp câu
Trật tự từ
Tần suất xuất hiện của từ
Ngữ nghĩa của từ
Chỉ số nào phản ánh mức độ quan trọng của một từ đối với một tài liệu trong toàn bộ tập văn bản?
BoW
TF-IDF
Gini Index
Accuracy
Hồi quy tuyến tính (Linear Regression) nhằm mục đích dự đoán đầu ra là giá trị:
Rời rạc
Liên tục
Nhị phân
Nhãn lớp
Chỉ số MAE (Mean Absolute Error) trong hồi quy là:
Sai số bình phương trung bình
Sai số tuyệt đối trung bình
Độ lệch chuẩn
Hệ số xác định
Hiện tượng Overfitting xảy ra khi:
Tập Train thấp, tập Test thấp
Tập Train và Test đều cao
Tập Train cao nhưng tập Test thấp
Mô hình không thể học được dữ liệu
Thư viện Python nào được coi là mạnh mẽ nhất cho Machine Learning (phân lớp, hồi quy, phân cụm...)?
TensorFlow
Scikit-learn
Keras
Pandas
Lĩnh vực nghiên cứu các hệ thống mô phỏng hành vi, suy nghĩ và khả năng ra quyết định của con người được gọi là gì?
Khoa học dữ liệu
Trí tuệ nhân tạo (AI)
Internet vạn vật (IoT)
Hệ quản trị cơ sở dữ liệu
Quan niệm Strong AI đề cập đến hệ thống có khả năng nào?
Chỉ thực hiện một nhóm nhiệm vụ cụ thể
Thực hiện mọi nhiệm vụ mà con người có thể làm và có ý thức
Không thể tự học những điều mới ngoài dữ liệu
Đạt hiệu suất cao trong một lĩnh vực hẹp
Đặc điểm nổi bật nhất của Học máy (Machine Learning) là gì?
Phải được lập trình cụ thể cho từng nhiệm vụ
Chỉ làm việc với dữ liệu hình ảnh
Có khả năng tự học từ dữ liệu mà không cần lập trình cụ thể
Hoạt động không cần dữ liệu trong quá khứ
Thuật ngữ Machine Learning trở nên phổ biến trong giai đoạn nào?
1950–1970
1980–2006
2010–2017
Sau năm 2020
Độ chính xác của kết quả dự đoán trong học máy phụ thuộc chủ yếu vào yếu tố nào?
Tốc độ đường truyền internet
Lượng dữ liệu đưa vào hệ thống
Ngôn ngữ lập trình được sử dụng
Thương hiệu máy tính sử dụng
Ứng dụng nào sau đây không được liệt kê là ứng dụng của ML trong tài liệu?
Phát hiện thư rác (spam)
Giao dịch gian lận
Quản lý nhân sự thủ công
Phân tích cảm xúc
Học không giám sát (Unsupervised Learning) tập trung vào dữ liệu nào?
Đã được gán nhãn đầy đủ
Chỉ có thông tin đầu vào (biến X), không có nhãn (biến y)
Có một phần nhỏ được gán nhãn
Được nhận phần thưởng từ môi trường
Ví dụ điển hình của thuật toán học không giám sát là gì?
Hồi quy và Phân loại
Phân cụm và Giảm chiều dữ liệu
Học tăng cường
Nhận dạng tiếng nói
Trong học củng cố (Reinforcement Learning), Agent sẽ nhận penalty khi nào?
Thực hiện hành động đúng
Thực hiện hành động sai
Không làm gì cả
Môi trường không phản hồi
Thư viện Python nào nổi tiếng nhất để xây dựng các mô hình Deep Learning?
Scikit-learn
TensorFlow
Pandas
Matplotlib
Bước đầu tiên trong quy trình xây dựng mô hình học máy là gì?
Chuẩn bị dữ liệu
Xác định bài toán và thu thập dữ liệu
Huấn luyện mô hình
Đánh giá mô hình
Việc tích hợp dữ liệu từ nhiều nguồn để tạo thành một tập dữ liệu nhất quán được gọi là gì?
Dataset
Data Mining
Data Warehouse
Big Data
Outliers trong chuẩn bị dữ liệu được hiểu là gì?
Dữ liệu bị thiếu
Dữ liệu nhiễu
Dữ liệu ngoại lai
Dữ liệu đã được gán nhãn
Nếu bài toán có nhãn là các giá trị rời rạc, đó thuộc loại bài toán nào?
Hồi quy
Phân lớp (Classification)
Phân cụm
Giảm chiều dữ liệu
Bản chất của việc huấn luyện mô hình ML là gì?
Sao chép dữ liệu vào bộ nhớ
Tìm các tham số tối ưu cho thuật toán
Vẽ biểu đồ dữ liệu
Xóa bỏ các giá trị nhiễu
Tập dữ liệu nào được sử dụng ở Bước đánh giá mô hình để dự đoán?
Tập Train
Tập Test
Tập Validation
Dữ liệu thô ban đầu
Trường hợp best fit xảy ra khi nào?
Cả tập Train và Test đều thấp
Tập Train cao nhưng tập Test thấp
Cả tập Train và tập Test đều cao
Chỉ tập Test cao
Hyperparameter tuning được thực hiện để làm gì?
Thu thập thêm dữ liệu mới
Tìm tham số tốt nhất cho mô hình để đạt best fit
Thay đổi thuật toán sang loại khác
Xóa bỏ các cột bị thiếu dữ liệu
Hai phương pháp phổ biến để tùy chỉnh tham số (hyperparameter tuning) là gì?
Linear và Nonlinear Search
Grid Search và Randomized Search
Manual và Auto Search
Forward và Backward Search
Phương pháp Deletion Rows (loại bỏ hàng) khi xử lý dữ liệu thiếu có nhược điểm gì?
Tốn nhiều bộ nhớ
Có thể làm mất nhiều dữ liệu nếu chỉ có vài dòng thiếu
Làm dữ liệu bị sai lệch thời gian
Không thể áp dụng cho dữ liệu số
Bài toán mà dữ liệu thay đổi theo thời gian, có tính đến xu hướng và thời vụ là bài toán gì?
Bài toán phân loại nhị phân
Bài toán chuỗi thời gian (Time-Series Problem)
Bài toán hồi quy đơn biến
Bài toán phân cụm
Thuật toán KNN thực hiện mọi tính toán khi nào?
Đang trong giai đoạn huấn luyện
Cần dự đoán nhãn của dữ liệu mới
Đang thu thập dữ liệu
Xây dựng cây quyết định
Tên gọi nào sau đây không phải là tên khác của KNN?
Instance-based learning
Memory-based learning
Eager learning
Lazy learning
Trong bài toán Hồi quy sử dụng KNN với k=1 , giá trị dự đoán cho điểm dữ liệu mới là gì?
Giá trị trung bình của toàn bộ tập dữ liệu
Nhãn của điểm dữ liệu đã biết gần nhất
Giá trị 0
Giá trị ngẫu nhiên
Tham số weights trong Scikit-learn cho KNN có giá trị mặc định là gì?
distance
uniform
manhattan
auto
Nhược điểm lớn nhất của KNN liên quan đến hiệu năng là gì?
Độ phức tạp huấn luyện cao
Lưu toàn bộ dữ liệu trong bộ nhớ ảnh hưởng hiệu năng
Khó cài đặt
Không dùng được cho bài toán hồi quy
KNN rất nhạy với nhiễu khi nào?
Giá trị k rất lớn
Giá trị K nhỏ
Sử dụng khoảng cách Euclidean
Sử dụng dữ liệu đã chuẩn hóa
Trong Ma trận nhầm lẫn (Confusion Matrix), các phần tử trên đường chéo biểu thị điều gì?
Số điểm bị phân loại sai của từng lớp
Số điểm được phân loại đúng của mỗi lớp dữ liệu
Tổng số mẫu của toàn bộ tập kiểm thử
Tỷ lệ chính xác của mô hình
"Positive" trong Precision và Recall thường đại diện cho
Lớp dữ liệu ít quan trọng hơn.
Lớp dữ liệu quan trọng hơn và cần được dự đoán chính xác.
Toàn bộ các lớp dữ liệu.
Các mẫu dữ liệu bị nhiễu.
Một mô hình dự đoán Email spam/normal cần rất cẩn thận khi dự đoán dương tính để tránh mất email quan trọng, mô hình này cần ưu tiên chỉ số nào
Recall.
Precision.
MSE.
Gini Index.
F1 -score là trung bình điều hòa của hai đại lượng nào
Accuracy và Precision.
Precision và Recall.
Recall và Accuracy.
MAE và RMSE.
Giá trị của F1 -score nằm trong khoảng nào
[0,1]
(−1,1)
(0,1]
(0,+∞)
Cây quyết định là mô hình học máy thuộc loại nào
Không giám sát.
Có giám sát, dùng cho cả phân loại và hồi quy.
Chỉ dùng cho dữ liệu số.
Học củng cố.
Việc duyệt cây để đưa ra quyết định được thực hiện theo hướng nào
Lá đến gốc.
Gốc đến lá.
Trái sang phải.
Ngẫu nhiên.
Thuộc tính với điểm đo lựa chọn thuộc tính như thế nào sẽ được lựa chọn để phân chia
Điểm thấp nhất.
Điểm trung bình.
Điểm cao nhất.
Điểm âm.
"Cắt tỉa cây" (Pruning) là cần thiết để làm gì
Làm cây dài hơn.
Loại bỏ những nhánh không tin cậy và giảm quá khớp.
Thêm nhiều biến quan trọng.
Tăng tốc độ thu thập dữ liệu.
Một ưu điểm của Cây quyết định là "Phi tham số", nghĩa là gì
Không cần sử dụng bất kỳ tham số nào.
Không cần giả định về phân phối của dữ liệu.
Chỉ dùng cho các biến định tính.
Tốc độ dự đoán bằng 0.
Mục tiêu chính của Xử lý ngôn ngữ tự nhiên (NLP) là gì
Giúp máy tính hiểu và thực hiện các nhiệm vụ liên quan đến ngôn ngữ con người.
Dịch toàn bộ văn bản sang mã máy nhị phân.
Thay thế hoàn toàn người phiên dịch.
Chỉ tập trung vào việc kiểm tra lỗi chính tả.
NLP được chia thành 2 nhánh lớn là gì
Dịch máy và Chatbot.
Xử lý tiếng nói và Xử lý văn bản.
Nhận dạng hình ảnh và Video.
Thu thập và Làm sạch dữ liệu.
Định lý Bayes cho phép chúng ta tính toán gì
Khoảng cách Euclidean.
Một xác suất chưa biết dựa vào các xác suất có điều kiện khác.
Tổng bình phương sai số RSS.
Chỉ số Gini của nút gốc.
Loại Naïve Bayes nào được sử dụng khi các thành phần của vector đặc trưng là giá trị nhị phân (0 hoặc 1)
Gaussian Naïve Bayes.
Multinomial Naïve Bayes.
Bernoulli Naïve Bayes.
Poisson Naïve Bayes.
Nhược điểm của kỹ thuật Bag of Words (BoW) là gì
Khó triển khai.
Không nắm bắt được ngữ cảnh hoặc quan hệ giữa các từ.
Không thể đếm tần suất từ.
Chỉ dùng được cho tiếng Anh.
Trong công thức TF-IDF, IDF (Inverse Document Frequency) giúp điều gì
Tăng trọng số cho các từ xuất hiện ở mọi văn bản.
Phản ánh mức độ quan trọng của một từ đối với một tài liệu trong toàn bộ tập văn bản.
Đếm số lần xuất hiện của từ trong một câu duy nhất.
Sửa lỗi chính tả tự động.
Hồi quy tuyến tính trong không gian ba chiều có đồ thị dạng gì
Một đường thẳng.
Một mặt phẳng.
Một siêu mặt phẳng.
Một đường cong parabol.
Chỉ số MSE phản ánh điều gì về mô hình hồi quy
Tỷ lệ dự đoán đúng nhãn.
Mức độ dao động giữa giá trị dự đoán với giá trị thực.
Xu hướng lệch của giá trị dự đoán.
Độ quan trọng của các biến độc lập.
Chỉ số nào sau đây rất nhạy với những giá trị sai số lớn
MAE.
Accuracy.
RMSE.
Gini Index.
Định nghĩa về AI của John McCarthy (1956) được đánh giá như thế nào trong tài liệu
Rất rõ ràng và khoa học.
Không rõ ràng và gây hiểu lầm.
Là định nghĩa duy nhất chính xác đến nay.
Chỉ áp dụng cho lĩnh vực toán học.
Hệ thống có khả năng tự học từ trải nghiệm mà không cần con người can thiệp là đặc điểm của loại nào
Weak AI.
Strong AI.
Lập trình truyền thống.
AI giai đoạn 1950.
Hệ thống "Weak AI" có đặc điểm nào dưới đây
Có ý nghĩ và nhận thức độc lập.
Hiểu và sử dụng ngôn ngữ linh hoạt như con người.
Có thể đạt performance vượt trội con người trong nhiệm vụ cụ thể.
Tự cải thiện mà không cần dữ liệu mới.
Lĩnh vực nào là "tập con của AI" và là "nhánh nhỏ của Khoa học máy tính"
Deep Learning.
Hệ chuyên gia.
Học máy (Machine Learning).
Xử lý ngôn ngữ tự nhiên.
AI mô phỏng khả năng tư duy và hành vi của con người là một
Khái niệm nhỏ trong ML.
Khái niệm lớn bao quát.
Thuật toán cụ thể.
Quy trình làm sạch dữ liệu.
Thuật ngữ "Deep Learning" được tài liệu xác định trong giai đoạn nào
1950 – 1970.
1980 – 2006.
2010 – 2017.
2020 – 2025.
Trong học máy, khi có dữ liệu mới, hệ thống sẽ làm gì
Yêu cầu lập trình lại từ đầu.
Dự đoán kết quả dựa vào mô hình đã được học.
Tự động xóa dữ liệu cũ.
Ngừng hoạt động để cập nhật.
Mục tiêu của Học bán giám sát (Semi-supervised Learning) là làm việc trên tập huấn luyện như thế nào
Hoàn toàn không gán nhãn.
Hoàn toàn đã gán nhãn.
Bao gồm một phần gán nhãn và một phần không gán nhãn.
Chỉ bao gồm dữ liệu nhiễu.
"Phân cụm" (Clustering) là ví dụ điển hình của loại hình học máy nào
Học có giám sát.
Học không giám sát.
Học củng cố.
Học sâu.
Trong Học củng cố, thực thể thực hiện hành động được gọi là gì
Model.
Agent (Tác tử).
Target.
Label.
Ứng dụng "Phân đoạn khách hàng" thường sử dụng loại học máy nào
Học có giám sát.
Học không giám sát (Phân cụm).
Hồi quy tuyến tính.
Học củng cố.
Kỹ năng nào sau đây cần thiết cho ML theo tài liệu
Kỹ năng quản trị kinh doanh.
Kiến thức toán và kỹ năng lập trình.
Kỹ năng thiết kế đồ họa.
Kỹ năng lắp ráp phần cứng.
Đâu là một ứng dụng của ML trong dịch vụ khách hàng?
Ghi âm cuộc gọi
Tự động hóa dịch vụ khách hàng
In hóa đơn
Kiểm kho thủ công
"Giảm chiều dữ liệu" thuộc nhóm thuật toán nào?
Supervised Learning
Unsupervised Learning
Semi-supervised Learning
Reinforcement Learning
AI yếu (Weak AI) không thể làm điều gì?
Vượt trội con người trong một nhiệm vụ
Tự học những điều mới ngoài phạm vi dữ liệu
Mô phỏng hành vi con người
Triển khai trong thực tế
Bước nào trong quy trình ML có nhiệm vụ "Xác định các nguồn dữ liệu liên quan"?
Bước 1: Xác định bài toán và thu thập dữ liệu
Bước 2: Chuẩn bị dữ liệu
Bước 3: Lựa chọn mô hình
Bước 4: Huấn luyện mô hình
Việc "rời rạc hóa và chuẩn hóa" dữ liệu nằm ở bước nào?
Bước 1
Bước 2
Bước 5
Bước 7
Tại sao cần thực hiện bước 6 (Nâng cao độ chính xác)?
Khi mô hình đã đạt Best fit
Khi mô hình rơi vào Underfitting hoặc Overfitting
Khi muốn thay đổi bài toán ban đầu
Khi đã thu thập đủ dữ liệu
Một cách để nâng cao độ chính xác mô hình là:
Giảm bớt lượng dữ liệu huấn luyện
Thay đổi các tham số của mô hình (Hyperparameter tuning)
Giữ nguyên các tham số mặc định
Chỉ sử dụng tập Test để huấn luyện
Machine Learning thực chất là đi tìm:
Một cơ sở dữ liệu mới
Một hàm số
Một máy tính mạnh hơn
Một quy trình thủ công
Bước "Cân bằng" dữ liệu (Balancing) thuộc giai đoạn nào?
Thu thập dữ liệu
Chuẩn bị dữ liệu
Lựa chọn mô hình
Đánh giá mô hình
Nếu dữ liệu đầu vào có nhãn là các số thực (ví dụ: nhiệt độ), ta chọn lớp bài toán nào?
Phân lớp (Classification)
Hồi quy (Regression)
Phân cụm (Clustering)
Giảm chiều (Dimensionality reduction)
Trong bước Đánh giá, trường hợp tập Train cao nhưng tập Test thấp gọi là:
Underfitting
Overfitting
Best fit
Noise
"Dữ liệu thiếu, dữ liệu nhiễu, dữ liệu ngoại lai" được gọi chung là:
Dataset
Dữ liệu thô cần làm sạch
Tham số tối ưu
Target
Bước 7 trong quy trình ML là gì?
Nâng cao độ chính xác
Sử dụng mô hình đã xây dựng để dự đoán
Thu thập thêm dữ liệu
Chọn thuật toán KNN
"Rút gọn thuộc tính" là nhiệm vụ của bước:
Bước 1
Bước 2
Bước 4
Bước 6
Khi nào nên sử dụng phương pháp "Randomized Search"?
Khi muốn thử tất cả các tổ hợp tham số
Khi tùy chỉnh tham số (Hyperparameter tuning)
Khi thu thập dữ liệu từ OpenWeather API
Khi xóa các hàng có giá trị thiếu
Điều gì quyết định đến độ chính xác cao của mô hình ở Bước 1?
Tốc độ của thuật toán
Số lượng và chất lượng dữ liệu thu thập được
Việc gán nhãn y
Sử dụng thư viện Keras
Trong bài toán "Chuỗi thời gian", yếu tố "Seasonality" nghĩa là:
Xu hướng tăng trưởng
Tính thời vụ
Dữ liệu bị nhiễu
Các biến độc lập x
"Grid Search" là phương pháp dùng để:
Thu thập dữ liệu web
Xác định tham số tốt nhất cho model
Xây dựng cây quyết định
Tính khoảng cách Manhattan
Ý tưởng bản chất của KNN là tìm đâu ra của điểm mới dựa trên:
Toàn bộ các điểm trong tập dữ liệu
K điểm dữ liệu trong tập huấn luyện gần nó nhất
Điểm dữ liệu xa nó nhất
Hàm số tuyến tính y=β0+β1x
Trong tham số KNN của Scikit-learn, giá trị mặc định của n_neighbors là:
1
3
5
7
Tham số nào xác định việc "gần hơn thì trọng số cao hơn" trong KNN?
weights='uniform'
weights='distance'
p=2
algorithm='brute'
Để tính khoảng cách theo Manhattan trong Scikit-learn, tham số p phải bằng:
1
2
3
Vô cùng
Thuật toán KNN KHÔNG cần giả sử điều gì?
Về phân phối của các class
Về số lượng láng giềng K
Về cách tính khoảng cách
Về dữ liệu huấn luyện
Khi K càng lớn, độ phức tạp của KNN sẽ:
Giảm đi
Giữ nguyên
Tăng lên
Bằng 0
Một trong những ưu điểm của KNN là:
Tiết kiệm bộ nhớ
Độ phức tạp tính toán huấn luyện bằng O
Không nhạy với nhiễu
Phù hợp với tập dữ liệu cực lớn
ball_tree và kd_tree là các giá trị của tham số nào trong KNN?
weights
p
algorithm
n_neighbors
Công thức tính khoảng cách Euclidean dựa trên:
Tổng trị tuyệt đối hiệu các tọa độ
Căn bậc hai của tổng bình phương hiệu các tọa độ
Tích các tọa độ
Xác suất có điều kiện
Bước thứ 5 trong quy trình thực hiện KNN là:
Khởi tạo K
Sắp xếp khoảng cách
Áp dụng quy tắc Đa số đơn giản
Lấy láng giềng gần nhất
KNN được sử dụng cho:
Chỉ bài toán Phân loại
Chỉ bài toán Hồi quy
Cả bài toán Phân loại và Hồi quy
Chỉ bài toán Phân cụm
Trong KNN cho Hồi quy, nhãn có thể được tính bằng:
Tổng các nhãn
Trung bình có trọng số của những điểm gần nhất
Hiệu các nhãn
Nhãn của điểm xa nhất
Giá trị mặc định của tham số p trong KNN là bao nhiêu?
1
2
5
Auto
"Instance-based learning" nghĩa là:
Học dựa trên các quy tắc
Học dựa trên các ví dụ/mẫu cụ thể
Học dựa trên xác suất
Học dựa trên mạng nơ-ron
Nhược điểm "Tốn nhiều thời gian tính toán khoảng cách tới từng điểm trong tập Train" thuộc thuật toán:
Cây quyết định
KNN
Naïve Bayes
Hồi quy tuyến tính
Trong Confusion Matrix, FP (False Positive) nghĩa là:
Dự đoán đúng là Positive
Thực tế là Negative nhưng dự đoán là Positive
Thực tế là Positive nhưng dự đoán là Negative
Dự đoán đúng là Negative
Công thức của Precision là:
TP/(TP+FN)
TP/(TP+FP)
TN/(TN+FP)
(TP+TN)/Tổng soˆˊ maˆ˜u
Mô hình "Rất cẩn thận khi dự đoán dương tính, chỉ dự đoán khi rất chắc chắn" có đặc điểm:
Recall cao
Precision cao nhưng Recall thấp
F1-score thấp
Accuracy thấp
Tại sao F1-score lại cần thiết?
Vì nó dễ tính hơn Accuracy
Vì nếu chỉ dùng Precision hoặc Recall đơn lẻ thì không đánh giá được toàn diện chất lượng mô hình
Vì nó chỉ áp dụng cho bài toán hồi quy
Vì nó không phụ thuộc vào giá trị TP
"Tỷ lệ dự đoán nhầm" liên quan mật thiết đến chỉ số nào?
Accuracy
Precision
Recall
MSE
"Tỷ lệ bỏ sót" liên quan mật thiết đến chỉ số nào?
Precision
Recall
Gini Index
R2
Giá trị của Precision và Recall luôn nằm trong đoạn:
[−1,1]
[0,1]
(0,+∞)
Tùy thuộc vào K
Một bộ phân lớp càng tốt khi F1-score:
Càng gần 0
Càng gần 1
Càng lớn hơn 1
Bằng Precision
Khi tất cả các điểm dự đoán đều là Positive, chỉ số nào sẽ bằng 1?
Precision
Recall
Accuracy
Gini Index
"Dự đoán ung thư" là bài toán cần ưu tiên chỉ số nào để đảm bảo an toàn cho bệnh nhân?
Precision cao
Recall cao
Accuracy cao
Chỉ số Gini thấp
Trong Confusion Matrix, tổng số mẫu tập kiểm thử bằng:
Tổng các phần tử trên đường chéo
Tổng tất cả các phần tử trong ma trận
TP + TN
Precision + Recall
Chỉ số Accuracy được tính bằng công thức:
Số lượng dự đoán đúng / Tổng số mẫu
TP/(TP+FP)
(TP+FP)/Tổng soˆˊ maˆ˜u
TN/(TN+FN)
Nếu mô hình chỉ đưa ra dự đoán cho 1 điểm duy nhất mà nó chắc chắn nhất, Precision sẽ bằng:
0
0.5
1
Không xác định
Một cây quyết định có thể được biểu diễn bằng tập các luật:
Toán học xác suất
IF-THEN
Khoảng cách Euclidean
Đạo hàm và tích phân
"Nút quyết định" (Decision node) tương ứng với:
Nhãn lớp
Quyết định của thuộc tính
Kết quả cuối cùng
Dữ liệu nhiễu
Một phần được chia ra gọi là "thuần nhất" khi:
Chứa các mẫu thuộc nhiều lớp khác nhau
Chứa các mẫu cùng thuộc một lớp
Không chứa mẫu nào
Có chỉ số Gini bằng 1
Giá trị mặc định của phương pháp lựa chọn thuộc tính trong Scikit-learn là:
Entropy
Gini Index
Gain ratio
Misclassification error
Nhược điểm lớn nhất của Cây quyết định được đề cập là:
Khó hiểu
Overfitting (quá khớp)
Tốc độ học chậm
Phụ thuộc vào phân phối dữ liệu
Phương pháp học quy nạp (Inductive learning) phổ biến nhất là:
KNN
Cây quyết định
Naïve Bayes
Hồi quy tuyến tính
"Nhánh cây" biểu diễn điều gì?
Một đặc trưng
Đầu ra của quyết định hoặc tập con dữ liệu được phân chia
Nhãn lớp
Nút gốc
Cây quyết định có thể làm việc ngay cả với dữ liệu:
Bị thiếu hoàn toàn
Chứa nhiều lỗi (noise data)
Không có biến độc lập X
Chỉ có nhãn y
Thuộc tính được chọn để phân chia ở một nút là thuộc tính có:
Chỉ số Gini cao nhất
Điểm đo xếp hạng cao nhất
Nhiều giá trị nhất
Ít lỗi nhất
"Xác suất phân loại sai" được ký hiệu là:
Qm
IG
IH
RSS
Ưu điểm "Hữu ích" của Cây quyết định nghĩa là:
Tốc độ dự đoán nhanh
Xác định được các biến quan trọng
Dễ biểu diễn trực quan
Dùng được cho cả bài toán phân loại và liên tục
Tại sao Cây quyết định được coi là mô hình "Phi tham số"?
Vì không dùng tham số beta
Vì không cần giả định về phân phối của dữ liệu
Vì nó không cần dữ liệu huấn luyện
Vì kết quả luôn là nhãn rời rạc
Tập biểu diễn các đối tượng được khởi tạo tại đâu?
Nút lá
Nút gốc
Nút quyết định
Các nhánh
"Cắt tỉa cây" giúp loại bỏ điều gì?
Các biến độc lập
Những nhánh không tin cậy
Nút gốc
Toàn bộ dữ liệu nhiễu
Nhận dạng tiếng nói và tóm tắt văn bản tự động là ứng dụng của lĩnh vực nào?
KNN
NLP (Xử lý ngôn ngữ tự nhiên)
Hồi quy tuyến tính
Cây quyết định
"Gaussian Naive Bayes" chủ yếu sử dụng cho loại dữ liệu nào?
Dữ liệu nhị phân
Dữ liệu là các biến liên tục
Dữ liệu đếm số lần từ xuất hiện
Dữ liệu chuỗi thời gian
Kỹ thuật biểu diễn văn bản đơn giản và phổ biến nhất trong NLP là gì?
TF-IDF
Bag of Words (BoW)
Cây quyết định
Ma trận nhầm lẫn
BoW KHÔNG quan tâm đến yếu tố nào?
Tần suất từ
Ngữ pháp, trật tự từ, hay ngữ nghĩa
Bộ từ vựng
Số lần từ xuất hiện
"Ma trận đặc trưng thưa" (sparse matrix) là nhược điểm của kỹ thuật nào khi dữ liệu lớn?
KNN
BoW
Hồi quy tuyến tính
Gaussian Naive Bayes
TF-IDF là viết tắt của cụm từ nào?
Term Frequency – Inverse Document Frequency
Total Frequency – Internal Document Frequency
Term Function – Inverse Data Format
Time Frequency – Inverse Document Format
Ưu điểm của TF-IDF so với BoW là gì?
Đơn giản hơn
Cải thiện khả năng biểu diễn nội dung văn bản
Nắm bắt được ngữ cảnh từ
Tốc độ xử lý nhanh hơn
TF-IDF vẫn bỏ qua yếu tố quan trọng nào?
Tần suất từ
Thứ tự và ngữ cảnh giữa các từ
Trọng số từ
Toàn bộ tập văn bản
Multinomial Naive Bayes thường đi kèm với kỹ thuật nào?
TF-IDF
Bag of Words (BoW)
Ma trận nhầm lẫn
Grid Search
Trong công thức TF-IDF, ∣D∣ đại diện cho điều gì?
Số lần từ xuất hiện
Tổng số văn bản trong tập D
Số văn bản có chứa từ t
Độ dài của văn bản
Nhận dạng tiếng nói và tổng hợp tiếng nói thuộc nhánh nào của NLP?
Xử lý văn bản
Xử lý tiếng nói
Dịch máy
Chatbot
Một mô hình Naive Bayes tốt khi xử lý hiện tượng nào?
Đồng nghĩa và đa nghĩa
Độc lập giữa các chiều dữ liệu
Trật tự câu
Dữ liệu thiếu 80%
Bài toán dự báo nhiệt độ, giá nhà là bài toán thuộc loại nào?
Phân lớp
Hồi quy
Phân cụm
Xử lý tiếng nói
"Simple Linear Regression" sử dụng bao nhiêu biến độc lập X?
0
1
n (> 1)
Vô số
