Font size
WorksheetsTrắc nghiệm Máy học ứng dụng
Total questions: 130
Worksheet time: 1hrs 7mins
Cho cây quyết định như hình, NHỮNG phát biểu nào sau đây là phát biểu SAI:
(1) Thuộc tính của tập dữ liệu: size, brand, sport, engine
(2) Thuộc tính của tập dữ liệu: large, mid, small, yes, no
(3) Thuộc tính của tập dữ liệu: size, brand, sport, engine, yes, no
(4) Thuộc tính của tập dữ liệu: F12, V10, V8, Volvo, BMW, SUV
(1)
(2)
(3)
(4)
Cho tập dữ liệu như hình, người ta cần huấn luyện mô hình để khi có một phần tử mới có các thông tin sau: “X1=35”, “X2=32”, “X3=1” thì người ta có thể dự đoán được giá trị “Y” của nó, ta cần lựa chọn giải thuật nào sau đây để thực hiện yêu cầu trên?
KNN
Hồi quy tuyến tính
Bayes thơ ngây
Cây quyết định
Cho tập dữ liệu chứa các thông tin về khách hàng của một ngân hàng: tuổi, nghề nghiệp, số lượng thẻ tín dụng, thu nhập hàng tháng. Ngân hàng cần tìm ra các nhóm khách hàng khác nhau để có những gói dịch vụ phù hợp cho các nhóm đối tượng này. Chúng ta càn sử dụng giải thuật học gì để giúp các nhà quản lý của ngân hàng này?
Giải thuật học không có giám sát, giải thuật phân lớp
Giải thuật học không có giám sát, giải thuật gom nhóm/gom cụm
Giải thuật học có giám sát, giải thuật hồi quy
Giải thuật học có giám sát, giải thuật phân lớp
Cho “perceptron” như hình, phát biểu nào sau đây là phát biểu ĐÚNG?
Đây là perceptron tuyến tính có ngưỡng với hàm kích hoạt là một hàm ngưỡng [0,1]
Các giá trị 0.3, 0.25 và 0.7 là giá trị trọng số tương ứng của các thuộc tính, hàm truyền là một hàm ngưỡng [0,1]
Đây là perceptron tuyến tính có ngưỡng với hàm truyền là một hàm ngưỡng [0,1]
Các giá trị 0.3, 0.25 và 0.7 là giá trị các thuộc tính, hàm kích hoạt là một hàm ngưỡng [0,1]
Giả sử tập dữ liệu có 1.000 mẫu tin (là các tin nhắn) trong đó có 10 tin nhắn rác và 990 tin nhắn bình thường. Có hai mô hình phân lớp M1 và M2 cho kết quả tương ứng như hình. Hãy cho biết mô hình nào thích hợp để xử lý tập dữ liệu trên? Giải thích lý do tại sao?
Mô hình M1 vì chỉ số F1 của mô hình M1 nhỏ hơn chỉ số F1 của mô hình M2
Mô hình M2 vì chỉ số F1 của mô hình M2 lớn hơn chỉ số F1 của mô hình M1
Mô hình M1 vì chỉ số F1 của mô hình M1 lớn hơn chỉ số F1 của mô hình M2
Mô hình M2 vì chỉ số F1 của mô hình M2 nhỏ hơn chỉ số F1 của mô hình M1
Các phát biểu nào sau đây là phát biểu đúng?
Giải thuật KNN không có quá trình học nên khi phân loại có tốc độ nhanh hơn các giải thuật khác
Giải thuật KNN không có quá trình học nên khi phân loại có tốc độ chậm hơn các giải thuật khác
Giải thuật KNN giải quyết cho bài toán phân loại và bài toán gom nhóm
Xét một mô hình nhận dạng hoa hồng và hoa cúc. Tập dữ liệu gồm có 1000 hoa hồng và 950 hoa cúc, được chia thành 2 phần là tập huấn luyện và tập kiểm thử với tỷ lệ 70/30. Sau khi huấn luyện, độ chính xác của mô hình đạt được 30% trên tập huấn luyện và 20% trên tập kiểm tra. Mô hình này như thế nào?
Underfitting
Overfitting
Good Fitting
Cho tập dữ liệu như hình (dữ liệu không bao gồm cột STT), người ta cần chia dữ liệu này thành 2 nhóm, anh chị cần lựa chọn giải thuật nào sau đây để thực hiện yêu cầu trên?
Cây quyết định
KNN
Kmeans
Bayes thơ ngây
Phát biểu nào sau đây đúng cho "Boosting technique"?
Giúp giảm lỗi Variance
Xây dựng các mô hình độc lập nhau
Tập trung cải tiến lỗi sinh ra từ mô hình trước
Phát biểu nào sau đây đúng cho "Bagging technique"?
Tập trung cải tiến lỗi sinh ra từ mô hình trước
Bagging có thể thực hiện song song
Giúp giảm lỗi Bias
Giúp giảm lỗi Variance
Cho tập dữ liệu gồm 5 phần tử với 3 thuộc tính BMI, huyết áp, Glucose và nhãn tương ứng như hình. Sử dụng giải thuật KNN với để dự đoán cho phần tử mới tới, chúng ta cần tính khoảng cách của phần tử mới tới đến tất cả các phần tử của tập dữ liệu. Hãy cho biết khoảng cách từ phần tử mới tới đến phần tử thứ 3 (tô màu cam) là bao nhiêu nếu sử dụng khoảng cách Manhattan.
65
53.75
2889
70.21
Cho thông tin như sau: tuổi, tình trạng mang thai, chỉ số Glucose, huyết áp, chỉ số BMI, tình trạng bệnh tiểu đường (có/không). Ta nên sử dụng giải thuật học gì để dự báo bệnh nhân có bị bệnh tiểu đường hay không?
Giải thuật học có giám sát, giải thuật phân lớp
Giải thuật học không có giám sát, giải thuật phân lớp
Giải thuật học không có giám sát, giải thuật gom nhóm, gom cụm
Giải thuật học có giám sát, giải thuật hồi quy
Chúng ta xem xét một mô hình phân loại có khả năng nhận dạng ảnh hoa hồng và hoa cúc. Tập kiểm tra gồm có 100 ảnh hoa hồng và 75 ảnh hoa cúc. Đối với 100 ảnh hoa hồng, mô hình nhận dạng đúng 80 ảnh. Đối với ảnh hoa cúc, mô hình nhận dạng đúng 60 ảnh. Hãy cho biết độ chính xác tổng thể (accuracy) của mô hình này?
(80+60) / (100+75)
80/100
(80/100) + (60/75)
60/75
Cho hai nhận định sau về overfitting:
(1) Xảy ra khi sai số dự đoán của mô hình trên tập huấn luyện cao, nhưng trên tập kiểm thử thì thấp
(2) Xảy ra khi sai số dự đoán của mô hình trên cả tập huấn luyện và tập kiểm thử đều thấp.
Chọn đáp án đúng.
(1) đúng
(1) sai
(1), (2) đúng
(1), (2) sai
Cho tập dữ liệu như hình gồm 6 phần tử với 2 thuộc tính màu tóc, độ bóng mượt và nhãn là tình trạng tóc. Hãy tính độ hỗn loạn thông tin sau khi phân hoạch cho thuộc tính “độ bóng mượt" với điểm phân hoạch là 54.
0.528
0.389
1
0.918
Đặc trưng trong máy học là gì?
Hàm mục tiêu
Thuộc tính có giá trị quyết định đối với mục tiêu
Dữ liệu đầu vào
Phương pháp đánh giá mô hình
Xét một mô hình phân loại có khả năng nhận dạng ảnh con chó và con mèo. Tập kiểm tra gồm có 120 ảnh con chó và 100 ảnh con mèo. Trong 120 ảnh con chó, mô hình nhận dạng đúng 90 ảnh. Đối với ảnh con mèo, phần mềm nhận dạng nhầm 30 ảnh mèo thành chó. Hãy tính precision của mô hình này?
(90) / (90+30)
(90) / (90+120)
(90) / (100+30)
(100)/(120+30)
P(đạt/A) = (0.0086/ P(A));
P (không đạt/A) = (0.0018/ P(A)):
nhãn Không Đạt
P(đạt/A) = (0.0043/ P(A));
P (không đạt/A) = (0.00088/ P(A)):
nhãn Đạt
P(đạt/A) = (0.0086/ P(A));
P (không đạt/A) = (0.0018/ P(A)):
nhãn Đạt
P(đạt/A) = (0.0043/ P(A));
P (không đạt/A) = (0.00088/ P(A)):
nhãn Không Đạt
Cho tập dữ liệu gồm 10 phần tử. Mỗi phần tử gồm có 2 biến độc lập X1, X2 và 1 biến phụ thuộc Y. Tập dữ liệu này được chia thành 2 phần, tập huấn luyện và tập kiểm thử. Sau khi huấn luyện, ta tìm được giá trị θ0=0.3; θ1=0.46; θ2=0.32. Giả sử tập kiểm thử có giá trị như sau, hãy tính chỉ số MAE (Mean Absolute Error).
6
5.7
6.2
5.4
Cho cây quyết định như hình và các phát biểu sau:
(1) Nhãn của tập dữ liệu: size, brand, sport, engine
(2) Nhãn của tập dữ liệu: size, brand, sport, engine, yes, no
(3) Nhãn của tập dữ liệu: F12, V10, V8, Volvo, BMW, SUV
(4) Nhãn của tập dữ liệu: yes, no
Hãy cho biết số phát biểu đúng.
1
2
3
4
Trích xuất đặc trưng thường được thực hiện ở đâu trong quy trình xây dựng mô hình máy học?
Trước và sau quá trình xử lý dữ liệu
Khi thực hiện huấn luyện
Trong quá trình lựa chọn mô hình
Trước quá trình xử lý dữ liệu
Cho các phát biểu sau về averaging technique:
(1) Được dùng cho bài toán phân lớp
(2) Được dùng cho bài toán hồi quy
Chọn nhận định đúng về các phát biểu trên.
(1) đúng
(2) đúng
(1), (2) đúng
(1), (2) sai
Phương pháp tập hợp mô hình (Ensemble Methods) là kết hợp nhiều mô hình cơ sở dựa trên tập học nhằm cải thiện độ chính xác của giải thuật dự đoán. Tăng hiệu quả của mô hình dựa trên cơ sở giảm lỗi bias, variance. Lỗi bias được hiểu như thế nào?
Lỗi Bias là lỗi liên quan đến mô hình (bộ phân lớp/ dự đoán) mà không liên quan đến dữ liệu được dùng để huấn luyện
Lỗi Bias là lỗi do tính biến thiên của mô hình so với tính ngẫu nhiên của các mẫu dữ liệu học (data samples).
Lỗi Bias là lỗi liên quan đến việc lựa chọn dữ liệu để huấn luyện mô hình
Để đánh giá hiệu quả của mô hình hồi quy tuyến tính, người ta có thể dùng những chỉ số nào sau
đây?
Precision
MAE
Accuracy
RMSE
Recall
Cho tập dữ liệu như hình gồm 6 phần tử với 2 thuộc tính màu sắc, trọng lượng và nhãn là chuẩn xuất khẩu. Hãy xác định chỉ số Gini của thuộc tính “màu sắc"
0.25
0.5
1
0.75
Để đánh giá hiệu quả của bài toán phân lớp với số lượng lớp lớn hơn 2, ta sử dụng chỉ số nào sau
đây?
Recall
F1
Accuracy
Precision
Xét một mô hình nhận dạng hoa hồng và hoa cúc. Tập dữ liệu gồm có 1000 hoa hồng và 950 hoa cúc, được chia thành 2 phần là tập huấn luyện và tập kiểm thử với tỷ lệ 70/30. Sau khi huấn luyện, độ chính xác của mô hình đạt được 95% trên tập huấn luyện và 20% trên tập kiểm tra. Mô hình này như thế nào?
Good Fitting
Overfitting
Underfitting
Để đánh giá mô hình dự báo mật số rầy nâu gây hại trên lúa (được xây dựng bằng giải thuật hồi quy), bạn sẽ sử dụng tiêu chí nào sau đây?
Precision
F1
Recall
MSE
Xem xét một nghiên cứu với tập dữ liệu có 9360 dòng. Mỗi dòng là một ngày và mỗi dòng có 6 giá trị là nhiệt độ (tmax, tmin), bức xạ mặt trời (solar radiation), hướng gió (wind-dir), tốc độ gió (wind-speed) và lượng mưa (rainfall). Tất cả các tham số này đều có giá trị thực. Ta được giao nhiệm vụ xây dựng mô hình dự báo lượng mưa (rainfall) với đơn vị đo mm từ 5 thuộc tính còn lại. Bài toán trên thuộc dạng nào sau đây?
Bài toán gom cụm
Thỏa mãn ràng buộc
Bài toán phân lớp
Bài toán hồi quy
Mô hình được gọi là underfitting khi:
Sai số dự đoán của mô hình trên tập huấn luyện cao, nhưng trên tập kiểm thử thì thấp
Sai số dự đoán của mô hình trên cả tập huấn luyện và tập kiểm thử đều thấp
Sai số dự đoán của mô hình trên tập huấn luyện thấp, nhưng trên tập kiểm thử thì cao
Sai số dự đoán của mô hình trên cả tập huấn luyện và tập kiểm thử đều cao
Để đánh giá hiệu quả của mô hình hồi quy tuyến tính, người ta dùng chỉ số nào sau đây?
Recall
F1
Accuracy
MSE
Giải thuật cây quyết định được xây dựng Top-down, bắt đầu nút gốc, tất cả các dữ liệu học ở nút gốc. Nếu dữ liệu tại 1 nút có cùng lớp -> nút lá (nhãn của nút chính là nhãn của các phần tử thuộc nút lá); Nếu dữ liệu ở nút chứa các phần tử có lớp rất khác nhau (không thuần nhất) thì phân hoạch dữ liệu một cách đệ quy bằng “việc chọn 1 thuộc tính để thực hiện phân hoạch tốt nhất có thể” => kết quả thu được cây nhỏ nhất. Việc chọn 1 thuộc tính để thực hiện phân hoạch tốt nhất có thể trong định nghĩa trên được hiểu như thế nào là đúng?
Chọn thuộc tính có độ lợi thông tin nhỏ nhất và chỉ số gini lớn nhất
Chọn thuộc tính có độ lợi thông tin nhỏ nhất
Chọn thuộc tính có chỉ số gini lớn nhất
Chọn thuộc tính có độ lợi thông tin lớn nhất hoặc chỉ số gini nhỏ nhất
Cho bảng dữ liệu gồm 6 phần tử với các thông tin X1, X2, X3. Người ta đã tính khoảng cách từ phần tử mới tới là Hưng với các thuộc tính <X1=30, X2=50, X3=2> đến 6 phần tử có trong tập dữ liệu như cột “Khoảng cách". Hãy cho biết nhãn của Hưng là gì khi K=3, tại sao?
Nhãn là “Không” vì Hưng gần với Mai, Dũng và Nam
Nhãn là “Không" vì Hưng gần với Tuấn
Nhãn là “Có” vì Hưng gần với Lan, Ngọc nhất
Nhãn là “Có” vì Hưng gần với Lan, Ngọc và Tuấn
Cho tập dữ liệu chứa các thông tin về rượu vang như sau: độ Ph, độ cồn, lượng đường, axit cố định, axit bay hơi, thời gian xuất xưởng (theo đơn vị giờ). Chúng ta cần sử dụng giải thuật học gì để giúp dự đoán thời gian xuất xưởng của rượu khi biết thông tin độ Ph, độ cồn, lượng đường, axit cố định, axit bay hơi của loại rượu đó?
gom cụm
tìm kiếm thoả mãn ràng buộc
hồi quy
phân lớp
Để xây dựng mô hình dự báo dịch rầy nâu gây hại trên lúa, các nhà nghiên cứu của một trường đại học đã thu thập dữ liệu tại địa bàn Trung An, Quận Thốt Nốt, Thành Phố Cần Thơ. Tập dữ liệu thu được là kết quả điều tra tại 840 địa điểm (phần tử), với 24 thuộc tính khác nhau. Sau khi tiền xử lý, loại bỏ các thuộc tính không dùng trong dự báo như: số thứ tự, mã ruộng, các thuộc tính có dữ liệu nhiễu và số liệu điều tra sai lệch cũng được bỏ qua như: ngày điều tra, ngày sạ, tuổi lúa. Các nhà nghiên cứu đã thu được 12 thuộc tính, trong đó có 11 thuộc tính dự báo dùng để xây dựng mô hình dự báo mật số rầy (thuộc tính phụ thuộc, có giá trị từ 0 đến 12900). Các thuộc tính dự báo như hình. Hãy chọn những chỉ số sau đây để đánh giá mô hình dự báo mật số rầy nâu từ 11 thuộc tính này.
MAE
RMSE
F1
Accuracy
Recall
Trong một cuộc bầu cử, N người bầu cử đang bỏ phiếu cho một trong hai ứng cử viên. Những người bỏ phiếu không giao tiếp với nhau trong khi bỏ phiếu. Cho các phương pháp tập hợp mô hình sau đây:
(1) Bagging (2) Boosting. Chọn nhận định đúng.
(1) đúng
(2) đúng
(1), (2) đúng
(1), (2) sai
Cho tập dữ liệu như hình gồm 5 phần tử với 3 thuộc tính thời gian sử dụng dịch vụ, số tiền sử dụng, số lượng dịch vụ. Sử dụng giải thuật KNN để dự đoán cho phần tử mới tới, chúng ta cần tính khoảng cách của phần tử mới tới đến tất cả các phần tử của tập dữ liệu. Tính khoảng cách từ phần tử mới có giá trị thời gian sử dụng dịch vụ=7, số tiền sử dụng=4, số lượng dịch vụ=2 đến phần tử thứ 5 (tô màu cam) là bao nhiêu nếu sử dụng khoảng cách Manhattan.
2
1.4
2.4
26
Cho tập dữ liệu gồm 15 phần tử. Mỗi phần tử bao gồm 2 biến độc lập X1, X2 và 1 biến phụ thuộc Y. Tập dữ liệu này được chia thành hai phần: tập huấn luyện và tập kiểm thử. Sau khi huấn luyện, ta thu được các giá trị: θ0=0.3, θ1=0.66, θ2=0.72. Giả sử tập kiểm thử có các giá trị như hình, hãy tính chỉ số MAE (Mean Absolute Error).
0.44
0.25
0.5
0.24
0.2
Đại học ABC, từ năm 1976 đến nay, đã sưu tập và lưu giữ hầu hết các giống lúa mùa cổ truyền của vùng Đồng bằng sông Cửu Long (ĐBSCL), với số lượng hơn 1.900 mẫu. Mỗi giống lúa trong ngân hàng thông tin được mô tả bởi 69 đặc điểm hình thái và đặc tính nông sinh học, bao gồm: góc lá đòng, độ cứng cây, chiều cao cây, thời gian sinh trưởng, số bông hữu hiệu/khóm, số hạt chắc, lép/bông, khối lượng nghìn hạt, năng suất lý thuyết (các đặc điểm này được đánh giá theo thang điểm của International Rice Research Institute). Chúng ta cần xây dựng các công cụ tin học giúp các nhà nghiên cứu phát hiện ra các mẫu lúa thuộc cùng một nhóm. Giải thuật máy học nào sau đây phù hợp cho bài toán này?
Giải thuật học có giám sát – Giải thuật hồi quy (Regression)
Giải thuật học không có giám sát – Giải thuật gom nhóm, gom cụm (Clustering)
Giải thuật học có giám sát – Giải thuật phân lớp (Classification)
Giải thuật học không có giám sát – Giải thuật hồi quy (Regression)
Phát biểu nào sau đây là đúng trong việc chọn lựa các mô hình trong phương pháp tập hợp mô hình?
(1) Các mô hình có thể sử dụng cùng một giải thuật với các tham số khác nhau.
(2) Các mô hình có thể được xây dựng từ các giải thuật khác nhau
(3) Các mô hình có thể được xây dựng trên những tập dữ liệu huấn luyện khác nhau.
(1)
(2)
(3)
Người ta sử dụng 4 giải thuật hồi quy khác nhau để xây dựng mô hình dự báo. Để đánh giá hiệu quả của giải thuật, người ta đo chỉ số MAE (Mean absolute error) và có kết quả như hình.
Với các giá trị MAE như trên, giải thuật nào là phù hợp nhất cho bài toán này?
1
2
3
4
Cho tập dữ liệu như hình. Hãy tính khoảng cách giữa Nam đối với 4 bạn nữ Mai, Lan, Cúc, Trúc và cho biết Nam có khoảng cách "gần" với bạn nữ nào nhất?
Mai
Lan
Cúc
Trúc
Cho tập dữ liệu như bảng bên dưới gồm 6 phần tử với 2 thuộc tính màu tóc, độ bóng mượt và nhãn là tình trạng tóc. Hãy xác định chỉ số Gini của thuộc tính “màu tóc".
0.25
0.5
0.75
0.44
Cho tập dữ liệu như bảng 1 gồm 7 phần tử, mỗi phần tử có 2 thuộc tính (Bao gồm tiền điện, kích thước phòng) và cột nhãn/lớp là cột “giá thuê phòng”. Với mô hình Bayes thơ ngây được xây dựng sẵn như bảng 2, hãy cho biết giá trị u của bảng “bao gồm tiền điện" ở cột [Không, Cao] là bao nhiêu?
0.33
0.25
0.67
0.5
Để đánh giá hiệu quả của bài toán phân lớp nhị phân với số lượng lớp quan tâm có tỉ lệ rất ít so với phân lớp còn lại, ta không sử dụng chỉ số nào sau đây?
Precision
Recall
Accuracy
F1
Phát biểu nào sau đây về Naive Bayes là không đúng?
Các thuộc tính có thể là chữ hoặc số
Các thuộc tính đều quan trọng như nhau
Các thuộc tính phụ thuộc thống kê lẫn nhau với giá trị của lớp
Các thuộc tính độc lập về mặt thống kê với nhau theo giá trị của lớp
Cho 03 câu A, B, C như hình:
Hãy sử dụng Bag of Word để tính vector của A.
Biết từ điển gồm: [are, comes, data, language, learning, natural, processing, science, under, we]
1,0,1,0,1,0,0,1,0,1
1,0,1,0,1,1,1,0,0,1
1,0,0,1,1,1,1,0,0,1
0,1,1,1,0,1,1,1,1,0
Dựa vào thông tin tuổi, giới tính, nồng độ cholesterol, nhịp tim, điện tâm đồ người ta cần dự báo mức độ bệnh của bệnh nhân với các cấp độ sau: bình thường, nhẹ, nặng và nghiêm trọng, hãy cho biết giải thuật nào nên được sử dụng để dự báo mức độ bệnh của bệnh nhân?
Giải thuật học không có giám sát, giải thuật phân lớp
Giải thuật học có giám sát, giải thuật hồi quy
Giải thuật học có giám sát, giải thuật phân lớp
Giải thuật học không có giám sát, giải thuật gom nhóm, gom cụm
Cho cây quyết định như hình và các phát biểu sau:
(1) Nhãn của tập dữ liệu: có lịch thi, tình trạng tài chính, tình trạng Covid
(2) Nhãn của tập dữ liệu: mua sắm, ở nhà, đi thi
(3) Nhãn của tập dữ liệu: mua sắm, ở nhà, đi thi, đúng, sai, tốt, xấu, nhiễm (F0), Khoẻ
(4) Nhãn của tập dữ liệu: đúng, sai, tốt, xấu, nhiễm (F0), Khoẻ
Hãy chỉ ra các phát biểu sai.
(1)
(2)
(3)
(4)
Cho dữ liệu như hình. Người ta thực hiện gom nhóm dữ liệu trên thành 2 nhóm bằng giải thuật Kmeans, với các thông tin sau:
• Các tâm khởi động ngẫu nhiên : c1 (6, 3, 5) ; c2 (5, 2, 1)
• Khoảng cách sử dụng: khoảng cách Manhattan
Hãy cho biết khoảng cách từ phần tử thứ 3 (Tô màu) đến tâm C1 và C2 là bao nhiêu và xác định nhóm của phần tử thứ 3 này là nhóm 1 hay nhóm 2?
Khoảng cách đến tâm C1= 4.15, đến tâm C2=4.36; thuộc nhóm 1
Khoảng cách đến tâm C1= 6.5, đến tâm C2=3.5; thuộc nhóm 1
Khoảng cách đến tâm C1= 4.15, đến tâm C2=4.36; thuộc nhóm 2
Khoảng cách đến tâm C1= 6.5, đến tâm C2=3.5; thuộc nhóm 2
Phát biểu nào sau đây là phát biểu đúng khi nói về giải thuật KNN?
Giải thuật KNN không có quá trình học nên khi phân loại có tốc độ nhanh hơn các giải thuật khác
Giải thuật KNN giải quyết cho bài toán phân loại và bài toán gom nhóm
Giải thuật KNN không có quá trình học nên khi phân loại có tốc độ chậm hơn các giải thuật khác
Giải thuật KNN luôn cho kết quả chính xác hơn so với các mô hình học máy có giám sát khác
Cho tập dữ liệu như hình. Sử dụng giải thuật KNN với K=5, anh chị hãy dự đoán cân nặng của anh Nguyễn Văn A có chiều cao 1.71 m?
64.65
63.11
61.29
68.1
66.28
Cho dữ liệu như bảng 1 (dữ liệu không bao gồm cột STT) Người ta thực hiện gom nhóm dữ liệu trên thành 2 nhóm bằng giải thuật Kmeans, với các thông tin sau:
• Các tâm khởi động ngẫu nhiên: c1(6, 3, 5); c2(4.5, 2, 1.5)
• Khoảng cách sử dụng: khoảng cách Manhattan
Người ta đã tính được khoảng cách tới các tâm như bảng 2, hãy cho biết tâm C1 của bước tiếp theo có giá trị là bao nhiêu?
(a)
Cho một tập dữ liệu chứa các thông tin sau về rượu vang: Độ Ph, độ cồn, lượng đường, axit cố định, axit bay hơi, thời gian xuất xưởng. Người ta cần xác định thời gian xuất xưởng của từng loại rượu theo đơn vị giờ. Cho biết các thuộc tính của tập dữ liệu này là gì?
thời gian xuất xưởng của rượu
độ Ph, độ cồn, hàm lượng đường, axit cố định, axit bay hơi của rượu
độ Ph, độ cồn, hàm lượng đường, thời gian xuất xưởng của rượu
độ Ph, độ cồn, hàm lượng đường, axit cố định, axit bay hơi của rượu, thời gian xuất xưởng của rượu
Phát biểu nào sau đây là đúng đối với giải thuật K láng giềng gần (KNN)?
Nên chọn giá trị K lẻ để việc phân lớp được hiệu quả điểm
Thời gian thực hiện giải thuật KNN nhanh hơn các giải thuật khác do không cần xây dựng mô hình
Độ chính xác của việc phân lớp hiệu quả hơn khi chọn giá trị K nhỏ
Giải thuật KNN không phù hợp cho bài toán hồi quy
Công ty viễn thông ABC dự định phát triển API phát hiện các tin nhắn rác. Công ty đã tiến hành thu thập 10.000 mẫu dữ liệu, bao gồm 3.000 tin nhắn rác và 7.000 tin nhắn bình thường. Chúng ta cần sử dụng giải thuật máy học gì để giúp công ty ABC xây dựng mô hình dự đoán tin nhắn rác?
Giải thuật học có giám sát, giải thuật hồi quy
Giải thuật học không có giám sát, giải thuật gom nhóm, gom cụm
Tìm kiếm đối kháng
Giải thuật học có giám sát, giải thuật phân lớp
Giải thuật nào có thể sử dụng cho cả bài toán hồi quy và bài toán phân lớp?
Rừng ngẫu nhiên
Hồi quy tuyến tính
Kmeans
Bayes thơ ngây
Tại bước huấn luyện mô hình của giải thuật Bayes thơ ngây người ta cần làm gì?
Tính xác suất xuất hiện của các thuộc tính theo từng giá trị nhãn
Tính xác suất xuất hiện của các thuộc tính theo từng giá trị nhẫn và xác suất xuất hiện của từng nhãn
Tính xác suất xuất hiện của nhãn
Tất cả đều sai
Hãy tính giá trị F1, Accuracy của kết quả đánh giá mô hình như hình.
Accuracy = 90%, F1 = 20%
Accuracy = 99.9%, F1= 9.8%
Accuracy = 90%, F1=9.8%
Accuracy = 99.9%, F1=20%
Giả sử tập dữ liệu có 30000 mẫu tin trong đó có 15 mẫu tin thuộc lớp dương (+1), có hai mô hình phân lớp M1 và M2 cho kết quả tương ứng trong bảng 1, 2 như hình. Anh/chị hãy cho biết mô hình nào thích hợp để xử lý tập dữ liệu trên? Hãy giải thích lý do cho lựa chọn đó.
Chọn mô hình M2 vì recall của M2 > M1
Chọn mô hình M2 vì accuracy của M2 > M1
Chọn mô hình M1 vì F1 của M1 > M2
Chọn mô hình M1 vì precision của M1 > M2
Cho ma trận confusion sau, anh chị hãy cho biết độ chính xác của rượu loại 3.
85%
88%
90%
92%
Cho tập dữ liệu như hình. Giả sử sau n bước lặp, ta tìm được giá trị θ0 = 0.3; θ1 = 0.46; θ2 = 0.32, hãy cho biết giá trị dự báo giá trị Y nếu biết X1 = 5, X2 = 12
6.44
17
6.14
7.02
7.42
Sơ đồ như hình mô tả cho phương pháp nào?
Học tăng cường
Học bán giám sát
Học không có giám sát
Học có giám sát
Cho cây quyết định như hình. Hãy xác định nhãn cho trường hợp sau: Weather = Rainy, Parents = Yes.
Play-tennis
Cinema
Stay-in
Cho tập dữ liệu như bảng 1 gồm 7 phần tử, mỗi phần tử có 2 thuộc tính (Bao gồm tiền điện, kích thước phòng) và cột nhân/lớp là cột "giá thuê phòng" . Với mô hình Bayes thơ ngây được xây dựng sẵn như bảng 2, hãy cho biết giá trị x của bảng "kích thước phòng" ở ô [Phương sai, Thấp] là bao nhiêu?
0.25
0.5
1
0.71
2
Nhược điểm chính của KNN là gì?
Quá phức tạp
Cần lưu tất cả dữ liệu huấn luyện
Không cần tham số
Thiếu chính xác
Dữ liệu đầu vào của KNN được biểu diễn bởi?
Ma trận đặc trưng
Đồ thị
Cây nhị phân
Cây quyết định
Khi dữ liệu có nhiều thuộc tính, cần sử dụng phương pháp nào để cải thiện KNN?
Chuẩn hóa dữ liệu
Loại bỏ thuộc tính không quan trọng
Loại bỏ thuộc tính quan trọng
Thay đổi dữ liệu đầu vào
KNN yêu cầu điều gì để hoạt động chính xác?
Một tập huấn luyện chất lượng cao
Một tập kiểm tra lớn
Một tập kiểm tra chất lượng cao
Một tập huấn luyện lớn
Dữ liệu gồm các thuộc tính: Màu tóc (Đỏ, Đen), Chiều cao (Cao, Thấp). Điểm mới xuất hiện là Màu tóc: Đen, Chiều cao: Cao. Khoảng cách theo kiểu rời rạc giữa điểm mới và điểm có thuộc tính: Màu tóc: Đỏ, Chiều cao: Cao là bao nhiêu?
0.5
0.3
0.7
1
Khi sử dụng KNN để phân loại khách hàng với các thuộc tính Thu nhập và Tuổi, tại sao cần chuẩn hóa thuộc tính này trước khi tính khoảng cách?
Để tránh thuộc tính có giá trị lớn chi phối
Để tăng tốc độ tính toán
Để giảm nhiễu
Để loại bỏ thuộc tính không cần thiết
Trong một bài toán KNN, phần tử mới được phân loại nhờ vào nhãn của các láng giềng gần nhất. Điều gì sẽ xảy ra nếu hai láng giềng có nhãn khác nhau?
Chọn nhãn có khoảng cách xa nhất
Chọn nhãn phổ biến nhất
Chọn nhãn đầu tiên
Chọn nhãn ngẫu nhiên
Khi áp dụng KNN trên dữ liệu lớn, yếu tố nào dưới đây có thể giúp tăng hiệu quả tính toán?
Sử dụng cấu trúc dữ liệu như KD-Tree hoặc Ball-Tree
Tăng giá trị k vô hạn
Sử dụng khoảng cách Manhattan thay vì Euclid
Giảm kích thước tập huấn luyện
Giả sử bạn có các thuộc tính E1, E2,..., En và nhãn H. Công thức của định lý Bayes là gì?
P(H∣E)=P(E∣H)×P(H)
P(H∣E)=P(E)P(E∣H)×P(H)
P(H∣E)=P(E)P(H∣E)×P(H)
P(H∣E)=P(E)×P(H)
Ưu điểm chính của giải thuật Bayes thơ ngây là gì?
Độ chính xác cao mặc dù giả định không thực tế
Không cần dữ liệu huấn luyện
Phân loại nhanh hơn các thuật toán khác
Yêu cầu dữ liệu lớn
Giải thuật Bayes thơ ngây dựa trên giả định gì về các thuộc tính?
Các thuộc tính độc lập thống kê
Các thuộc tính phụ thuộc lẫn nhau
Các thuộc tính không có ý nghĩa
Các thuộc tính bị bỏ qua
Bước đầu tiên trong giải thuật Bayes thơ ngây là gì?
Huấn luyện mô hình
Dự đoán dữ liệu mới
Loại bỏ nhiễu
Chuẩn hóa dữ liệu
Khi sử dụng ước lượng Laplace, điều gì được thực hiện để tránh xác suất bằng 0?
Cộng thêm một giá trị dương μip vào tử số và mẫu số giá trị μ
Cộng thêm một giá trị dương μip vào tử số và mẫu số giá trị p
Cộng thêm một giá trị dương p vào tử số và mẫu số giá trị μip
Cộng thêm một giá trị dương μ vào tử số và mẫu số giá trị μip
Khi sử dụng Bayes thơ ngây, trường hợp nào thường cho kết quả không chính xác?
Các thuộc tính phụ thuộc lẫn nhau
Các thuộc tính độc lập thống kê
Dữ liệu nhiễu
Dữ liệu chưa được chuẩn hóa
Cho các phát biểu sau:
(1) MAE là chỉ số được sử dụng nhiều nhất vì khả năng giải thích trực tiếp của nó.
(2) RMSE tương tự như MAE nhưng chú trọng tới những giá trị có độ lệch lớn.
(3) MAE, MSE, RMSE càng cao thì hiệu quả của hệ thống càng cao.
(4) MAE, MSE, RMSE là các chỉ số đánh giá cho bài toán hồi quy.
Số phát biểu đúng là:
1
2
3
4
Khi cần phân loại dữ liệu liên tục trong Bayes thơ ngây, ta sử dụng phân phối nào?
Phân phối chuẩn
Phân phối nhị phân
Phân phối đồng đều
Phân phối mật độ hạt nhân
Dữ liệu nào sau đây phù hợp với mô hình Bernoulli Bayes thơ ngây?
Dữ liệu phân phối Gauss
Dữ liệu nhị phân
Dữ liệu liên tục
Dữ liệu văn bản
Làm thế nào để cải thiện hiệu quả của Bayes thơ ngây khi thuộc tính không độc lập?
Sử dụng mạng Bayes
Loại bỏ các thuộc tính không liên quan
Sử dụng phân phối chuẩn
Loại bỏ các thuộc tính không độc lập
Nếu dữ liệu không cân bằng, cần tập trung vào chỉ số nào để đánh giá?
Độ chính xác tổng thể
Độ chính xác lớp nhỏ
Độ chính xác lớp lớn
Tỷ lệ tập dữ liệu
Giá trị entropy bằng 0 thể hiện điều gì?
Dữ liệu hoàn toàn hỗn loạn
Dữ liệu hoàn toàn thuần nhất
Dữ liệu chưa được phân hoạch
Dữ liệu không khả dụng
Quá trình phân loại dữ liệu mới trong cây quyết định bắt đầu từ đâu?
Nút lá đầu tiên
Nút con đầu tiên
Thuộc tính đầu tiên
Nút gốc
Quá trình xây dựng cây quyết định bắt đầu từ đâu?
Dữ liệu thuần nhất
Dữ liệu không thuần nhất
Dữ liệu có nhiều thuộc tính nhất
Dữ liệu có ít thuộc tính nhất
Chỉ số Gini được sử dụng để đánh giá điều gì?
Độ hỗn loạn thông tin
Mức độ không thuần nhất
Mức độ thuần nhất
Độ ổn định thông tin
Nếu thuộc tính có giá trị Gini thấp nhất, điều này có ý nghĩa gì?
Thuộc tính này tốt nhất để phân hoạch
Thuộc tính này có giá trị thông tin thấp nhất
Thuộc tính này không liên quan đến dữ liệu nhất
Thuộc tính này cần bị loại bỏ nhất
Chỉ số Gini nào được sử dụng để đo lường mức độ thuần nhất của một tập dữ liệu sau khi phân hoạch?
Gini của tập mẹ
Gini split
Entropy của tập con
Giá trị trung bình của các nhánh
Phương pháp nào được sử dụng để giảm hiện tượng học vẹt (overfitting) trong cây quyết định?
Tăng độ lợi thông tin
Cắt nhánh
Gắn nhánh
Tăng kích thước cây quyết định
Phương pháp nào được sử dụng để ước lượng các tham số trong hồi quy tuyến tính?
KNN
LMS
Random sampling
Gradient boosting
Hàm hồi quy tuyến tính đơn biến có dạng gì?
h(x)=θ0+θ1x
h(x)=θ1x
h(x)=x2
h(x)=θ0x+θ1x2
Khái niệm "sai số dự đoán" trong hồi quy biểu thị điều gì?
Hiệu giữa giá trị thực và giá trị dự đoán
Hiệu giữa giá trị lớn nhất và nhỏ nhất
Giá trị trung bình của giá trị thực và giá trị dự đoán
Giá trị trung bình của giá trị lớn nhất và nhỏ nhất
Kỹ thuật nào giúp giảm sai số trong hồi quy tuyến tính?
Tăng tốc độ học
Giảm số lượng dữ liệu huấn luyện
Dùng giá trị khởi tạo lớn
Giảm dữ liệu nhiễu
Phương pháp "batch gradient descent" khác biệt với "stochastic gradient descent" ở điểm nào?
Batch gradient descent cập nhật tham số dựa trên toàn bộ dữ liệu
Batch gradient descent chỉ cập nhật tham số cho một phần tử
Stochastic gradient descent sử dụng dữ liệu lớn
Cả hai đều cập nhật tham số cho toàn bộ dữ liệu
Trong bài toán hồi quy, hàm lỗi nào nhấn mạnh vào sai số lớn hơn?
MAE
MSE
RMS
RMSE
Trong phương pháp giảm gradient, "tốc độ học" (learning rate) biểu thị điều gì?
Giá trị lớn nhất mà mô hình học được
Mức độ thay đổi của tham số 𝜃 trong mỗi lần lặp
Giá trị nhỏ nhất của dữ liệu
Mức độ ảnh hưởng của dữ liệu nhiễu
Hàm lỗi RMS khác biệt với MAE ở điểm nào?
RMS bình phương sai số trước khi tính trung bình
RMS sử dụng giá trị lớn nhất của dữ liệu
RMS chỉ áp dụng với dữ liệu rời rạc
RMS chỉ áp dụng cho hồi quy đa biến
Khi nào nên áp dụng hồi quy tuyến tính đơn biến?
Khi dữ liệu có một thuộc tính đầu vào
Khi dữ liệu có nhiều thuộc tính đầu vào
Khi dữ liệu không có giá trị liên tục
Khi dữ liệu cần được phân loại
Phương pháp giảm gradient tối ưu hóa tham số mô hình như thế nào?
Tăng giá trị của hàm chi phí
Giảm giá trị của hàm chi phí
Tăng số lượng thuộc tính
Giảm số lượng thuộc tính
Khi áp dụng giảm gradient, điều gì sẽ xảy ra nếu tốc độ học 𝛼 quá lớn?
Mô hình hội tụ nhanh hơn
Mô hình có thể không hội tụ
Mô hình hội tụ chậm hơn
Mô hình chắc chắn sẽ hội tụ
Tại sao phương pháp hồi quy tuyến tính đơn giản được sử dụng phổ biến?
Nó không yêu cầu dữ liệu huấn luyện
Nó hiệu quả và dễ hiểu
Nó phù hợp với mọi loại dữ liệu
Nó loại bỏ hoàn toàn sai số dự đoán
Ý nghĩa của giá trị ngưỡng θ trong mạng nơ-ron là gì?
Độ lệch giữa đầu vào và đầu ra
Độ phức tạp của dữ liệu
Độ nghiêng của đường thẳng
Giá trị trung bình của các trọng số
Trong mô hình perceptron, đầu vào giả X₀ có giá trị bằng bao nhiêu?
giá trị trung bình
-1
0
1
Trong mô hình perceptron tuyến tính, điều kiện hội tụ xảy ra khi nào?
Khi giá trị lỗi nhỏ hơn ngưỡng dung sai
Khi tất cả giá trị trọng số đều bằng 0
Khi giá trị lỗi lớn hơn tất cả các trọng số
Khi giá trị đầu vào được chuẩn hóa
Đầu vào của mô hình perceptron tuyến tính không ngưỡng có giá trị như thế nào?
0
1
-1
giá trị trọng số
Chọn phát biểu SAI về thuật toán gom cụm k-means?
Việc khởi tạo trung tâm cụm sẽ làm ảnh hưởng đến thuật toán
Đây là bài toán không giám sát
Kết quả gom cụm phụ thuộc vào hàm khoảng cách
Phương pháp Elbow luôn xác định chính xác số cụm k tối ưu.
Chọn phát biểu SAI về các thuật toán học máy dựa trên mạng Nơ-ron nhân tạo?
các thuật toán thường đi tìm nghiệm tối ưu bằng phương pháp Gradient Descent
các thuật toán học sâu cũng là thuật toán học dựa trên mạng Nơron nhân tạo
thường được áp dụng để xây dựng các ứng dụng như phát hiện đối tượng trong ảnh, dịch máy
không thể biểu diễn bài toán linear regression bằng mạng Nơron nhân tạo
Thuật toán nào sau đây phù hợp nhất với yêu cầu: “Hãy dự đoán tỉ giá ngoại tệ (là một số thực) dựa vào các dữ liệu về kinh tế vĩ mô được thu thập trong quá khứ”?
KNN
Kmeans
Hồi quy tuyến tính
Cây quyết định
Sự khác biệt cơ bản giữa học có giám sát (supervised) và không giám sát (unsupervised) là gì?
học có giám sát yêu cầu dữ liệu được dán nhãn, trong khi học không giám sát thì không
học có giám sát sử dụng thuật toán gom cụm, học không giám sát sử dụng thuật toán phân loại
học có giám sát được sử dụng thuật toán hồi quy, học không giám sát sử dụng thuật toán gom cụm
không có sự khác biệt giữa học có giám sát và không giám sát
Phát biểu nào sau đây là ĐÚNG chính xác nhất về khái niệm học máy?
việc lập trình máy tính để tối ưu hóa một tiêu chí hiệu suất dựa trên các dữ liệu mẫu hoặc kinh nghiệm trong quá khứ
việc lập trình máy tính để hiện thực hóa một tiêu chí hiệu suất dựa trên các dữ liệu mẫu hoặc kinh nghiệm trong quá khứ
việc lập trình để triển khai hệ thống máy tính dựa trên các dữ liệu mẫu hoặc kinh nghiệm trong quá khứ
việc lập trình để tối ưu hóa hoạt động của hệ thống máy tính dựa trên các dữ liệu mẫu hoặc kinh nghiệm trong quá khứ
Thuật toán học máy nào sau đây không thuộc nhóm học có giám sát?
KNN
Kmeans
Hồi quy
Cây quyết định
Thuật toán phân loại nào sau đây áp dụng cho hai lớp được gán nhãn -1 và +1?
KNN
Naive Bayes
Perceptron
Cây quyết định
Phát biểu nào sau đây KHÔNG ĐÚNG đối với thuật toán Kmeans?
biết nhãn của từng điểm dữ liệu
cụm là tập hợp các điểm dữ liệu có vector đặc trưng gần nhau
khoảng cách Euclid được sử dụng phổ biến nhất để xác định khoảng cách giữa các vector đặc trưng với tâm của mỗi cụm
có thể áp dụng cho dữ liệu có nhãn
Cho tập dữ liệu như hình. Hãy tìm ra nhận định SAI.
Phần tử X mới đến (0.22, 4, 3) sẽ được gán nhãn +1
Phần tử Y mới đến (0.5, 3, 4) sẽ được gán nhãn +1
Phần tử Z mới đến (0.84, 2, 6) sẽ được gán nhãn -1
Phần tử W mới đến (0.1, 4, 2) sẽ được gán nhãn -1
Cho tập dữ liệu như hình. Sau khi lần lượt sử dụng công thức tính khoảng cách Manhattan, Euclid và giải thuật k láng giềng với k=1 để dự đoán cho phần tử mới đến X (370, 550, 0.75), ta được hai kết quả gán nhãn a và b. Hãy tìm ra nhận định ĐÚNG.
a=Yes, b=No
a=No, b=Yes
a=Yes, b=Yes
a=No, b=No
Phương pháp matching được áp dụng khi kiểu dữ liệu là:
số
nhị phân
liên tục
rời rạc
Cho tập dữ liệu như hình, mỗi điểm thuộc một trong hai lớp 1 (Yes) hoặc 0 (No). Hãy dự đoán nhãn cho điểm mới X=(3,4).
(a)
(21) Cho tập dữ liệu như hình 1 gồm 14 phần tử, mỗi phần tử có 4 thuộc tính (Id, Animals, Size, BodyColor) và cột nhãn/lớp là cột "Can we pet them?". Với mô hình Bayes thơ ngây được xây dựng sẵn như bảng 2, hãy cho biết giá trị b của bảng Animals ô [Cow, No] là bao nhiêu?
2/14
2/5
2/6
2/11
Cho tập dữ liệu gồm 5 phần tử A, B, C, D, E với ma trận khoảng cách Manhattan như hình. Theo phương pháp Agnes (bottom-up), đầu tiên, 5 cụm dữ liệu được khởi tạo với mỗi cụm chứa 1 phần tử đơn. Hãy cho biết bước tiếp theo hai cụm dữ liệu nào được chọn để tạo thành cụm dữ liệu mới?
{C}, {E}
{A, D}, {C}
{A, D}, {C, E}
{A, D}, {E}
{A}, {D}
Cho tập dữ liệu gồm 4 điểm:
A = (1, 2) thuộc lớp dương
B = (3, 1) thuộc lớp dương
C = (0, 0) thuộc lớp âm
D = (2, -1) thuộc lớp âm
Tìm phương trình siêu phẳng từ 4 điểm dữ liệu trên.
Cho X=(2, 3) sẽ thuộc lớp nào (Dương/Âm)? Biết rằng: chọn điểm chênh b là A (1, 2) để tính toán
không tính được
dương
âm
không xác định
Soft Margin SVM là gì?
SVM sử dụng các đường biên cứng để phân loại
SVM không cho phép bất kì ngoại lệ nào
SVM cho phép một số điểm dữ liệu vi phạm margin
Một kĩ thuật để giảm kích thước dữ liệu
Dựa trên tập dữ liệu về tuổi và cân nặng (kg) của gần 1000 trẻ em, người ta xây dựng được mô hình dự đoán cân nặng của trẻ dựa trên tuổi. Mô hình thu được là một phương trình hồi quy như hình. Căn cứ theo phương trình hồi quy thu được, chúng ta có thể kết luận khi em bé tăng lên 1 tuổi thì cân nặng sẽ thay đổi như thế nào?
Khi em bé tăng lên 1 tuổi thì cân nặng sẽ tăng 2,37 kg
Không thể kết luận được điều gì
Khi em bé tăng lên 1 tuổi thì cân nặng sẽ tăng 0,777 kg
Khi em bé tăng lên 1 tuổi thì cân nặng sẽ tăng 1,96 kg
Trong các định nghĩa nào sau đây là phát biểu sai:
Giải thuật hồi quy (regression) là xây dựng mô hình dự đoán dựa trên dữ liệu tập học đã có nhãn (lớp) là giá trị liên tục
Học có giám sát là thuật toán học tạo ra một hàm ánh xạ dữ liệu đầu vào tới kết quả đích mong muốn (nhãn, lớp, giá trị cần dự báo). Trong học có giám sát, tập dữ liệu dùng để huấn luyện phải được gán nhãn, lớp hay giá trị cần dự báo
Giải thuật phân lớp (classification) là xây dựng mô hình phân loại dựa trên dữ liệu tập học đã có nhãn (lớp) là kiểu liệt kê
Giải thuật hồi quy (regression) là xây dựng mô hình phân loại dựa trên dữ liệu tập học có thuộc tính là giá trị liên tục
Trong SVM, C thường được sử dụng để điều chỉnh gì?
Kích thước của không gian đặc trưng
Độ phức tạp của mô hình
Sự linh hoạt của đường ranh giới
Độ chính xác của mô hình
Cho tập dữ liệu như hình, mỗi điểm dữ liệu đại diện cho một loài hoa với hai đặc trưng là chiều dài cánh hoa và chiều rộng cánh hoa. Sử dụng KNN với k=1 để dự đoán loài hoa của điểm dữ liệu mới có chiều dài cánh hoa là 6.0 và chiều rộng cánh hoa là 3.0 (Sử dụng phép đo Euclide). Loài hoa (điểm dữ liệu) gần nhất với điểm dữ liệu mới là:
Iris setosa 1
Iris setosa 2
Iris setosa 3
Iris Versicolor 1
Hãy cho biết hình ảnh minh họa cho giải thuật nào trong quá trình gom nhóm tập dữ liệu {a, b, c, d, e}?
Gom cụm phân cấp từ dưới lên
Gom cụm phân cấp từ trên xuống
KNN
Kmeans
K-fold
Kernel trong SVM được sử dụng để làm gì?
Phân loại dữ liệu không tuyến tính
Tránh overfitting
Tăng tốc độ tính toán
Giảm kích thước dữ liệu
Cho bảng tính sẵn xác suất cho nhẫn "PP1" và "PP2" của thuộc tính "tình trạng bệnh" như bảng bên dưới, giá trị xác suất nào bên dưới là không chính xác nếu sử dụng ước lượng Laplace để tránh tình trạng tạo ra giá trị 0 ở ô [mức 1, PP1]?
Mức 1 = (1/3+0)/(4+1)
Mức 2 = (1/3+2)/(4+1)
Mức 3= (1/3+2)/(4+1)
Mức 1 = (1/5+0)/(4+1) Mức 2 = (2/5+2)/(4+1)
Mức 3 = (2/5+2)/(4+1)
Mức 1 = (1/6+0)/(4+1)
Mức 2 = (2/6+2)/(4+1)
Mức 3 = (3/6+2)/(4+1)
Mức 1 = (1/8+0)/(4+1)
Mức 2 = (2/8+2)/(4+1)
Mức 3 = (3/8+2)/(4+1)
