Font size
WorksheetsÔn tập trí tuệ nhân tạo 3
Total questions: 154
Worksheet time: 4hrs 52mins
Đáp án đầy đủ nhất khi nói về khía cạnh chính của khoa học dữ liệu?
Tiền sử lí dữ liệu
Phân tích dữ liệu
Tất cả các lựa chọn còn lại
Thu thập dữ liệu
Đại lượng nào sau đây KHÔNG được coi là đặc trưng thống kê về cân nặng của gà trong một trang trại?
Giá trị trung vị (median)
Giá trị trung bình (mean)
Phương sai (Variance)
Tên chủ trang trại
Mục đích của trực quan trong dữ liệu trong khoa học dữ liệu là gì?
Để chuẩn bị dữ liệu cho việc xây dựng các thuật toán học máy
Để tìm kiếm các quy luật trong dữ liệu
Để làm sạch và xử lí dữ liệu
Để thực hiện việc trình bày thông tin bằng ngôn ngữ hình ảnh phục vụ việc trao đổi thông điệp và dữ liệu với các bên liên quan.
Giá trị độ lệch chuẩn (std) của tập dữ liệu trên là?
0.712
0.127
-0.127
0.712
Giá trị độ lệch chuẩn (std) của tập dữ liệu trên là?
0.712
0.127
-0.127
0.712
Việc chuẩn hoá dữ liệu là gì?
Là quá trình biến đổi dữ liệu theo phân phối Gaussian
Là quá trình biến đổi dữ liệu sang một định dạng(format) chuẩn
Là quá trình loại bỏ những điểm những dữ liệu bất thường
Là quá trình thay đổi lại thang đo của các đại lượng trong tập dữ liệu để dùng trong học máy
Giá trị trung vị (median) của tập dữ liệu trên là?
-0.044
-0.030
-0.205
-0.314
Giá trị trung vị(median) của tập dữ liệu trên là?
-0.426
-0.207
0.428
-0.276
Một hãng oto muốn nghiên cứu khả năng mua một loại xe mới của khách hàng, đối tượng nghiên cứu phù hợp nhất là:
Tất cả các công nhân Việt Nam
Những người trưởng thành có độ tuổ từ 18 đến 60
Tất cả người dân sông tại TPHCM
Tất cả những người dân sống tại TP HN
Giá trị trung bình của tập dữ liệu trên là
1.095
-1.095
-0.995
2.092
Mệnh đề nào sau đây ĐÚNG trong các mệnh đề sau:
Trí tuệ nhân tạo là khả năng thích nghi của các loài động vật
Trí tuệ nhân tạo là khả năng của con người có thể xây dựng các chương trình máy tính có thể học.
Trí tuệ nhân tạo có thể được xem như một chương trình máy tính có thể khái quát hoá tri thức từ dữ liệu để thực hiện một chức năng nào đó giống con người.
Trí tuệ nhân tạo là trí tuệ tự nhiên của con người.
Biểu đồ tần suất(histogram) là gì?
Là biểu đồ thể hiên sự phân phối của các điểm
Là biểu đồ thể hiện tần suất xuất hiện của các điểm dữ liệu
Là biểu đồ thể hiện giá trị trung bình của tập dữ liệu
Là biểu đồ thể hiện mối quan hệ giữa các biến
Giá trị trung bình của tập dữ liệu trên là?
0.653
-0.365
0.365
-0.635
Cho tập dữ liệu sau: X=[-0.703, -0.344,-0.669, -0.636,-0.913] Giá trị trung bình của tập dữ liệu trên là?
0.653
-0.365
0.365
-0.635
Cho tập dữ liệu sau: X=[-1.217, -2.059, -0.868, -0.341, -1.237] giá trị trung bình
-0.615
-0.651
0.615
-1.1444
Phát biêu nào sau đây không chính xác
Giá trị trung bình của một tập dữ liệu luôn lớn hơn giá trị nhỏ nhất
Phương sai là đại lượng đặc trưng cho độ phân tán của tập dữ liệu
Giá trị trung bình của một tập dữ liệu luôn nhỏ hơn giá trị lớn nhất
Phương sai là đại lượng đo lường dữ liệu
Đặc trưng thuộc tính của dữ liệu là gì
Vector có số thành phần bằng tổng số điểm dữ liệu và số thuộc tính
Là số đối tượng nghiên cứu trong tập dữ liệu
Vector trong không gian 3 chiều
Là tập hợp các thuộc tính của các đối tượng nghiên cứu
Một tập dữ liệu là gì
Tập hợp các thuật toán
Tập hợp các công cụ để lưu trữ dữ liệu
Tập hợp các mô hình toán học
Tập hợp thông tin nguyên thuỷ của các đối tượng thoả mãn một điều kiện nghiên
Một tập dữ liệu thường được coi là một bảng, trong đó:
Số hàng bằng số điểm dữ liệu, số cột là số thuộc tính của các đối tượng dữ liệu
Số hàng luôn bằng số cột và bằng số điểm dữ liệu
Số hàng bằng số điểm dữ liệu , số cột là một đặc trưng(thuộc tính) của các điểm dữ liệu.
Số hàng bằng số cột
Để nghiên cứu khả năng mua hàng của một khách hàng thì các đặc trưng nào về khách hàng là phù hợp với đối tượng nghiên cứu?
Tuổi, giới tính, thu nhập, địa chỉ, nghề nghiệp
Địa chỉ, địa chỉ email, chiều cao, cân nặng
Địa chỉ, số điện thoại, nhóm máu, nghề nghiệp
Địa chỉ email, tên, giới tính, nhóm máu.
Giá trị độ lệch chuẩn (std) của tập dữ liệu trên là
-0.615
-0.651
0.615
0.561
Giá trị độ lệch chuẩn của tập dữ liệu
0.712
0.127
-0.127
0.712
Mục đích chính của khoa học dữ liệu là gì
Nghiên cứu để trích xuất các giá trị ấn trong dữ liệu phục vụ việc đưa ra các quyết định để giải quyết một bài toán nghiệp vụ nào đó.
Tất cả các đáp án khác đều đúng
Nghiên cứu để lưu trữ và quản lí dữ liệu
Để trực quan hoá dữ liệu và xây dựng báo cáo
Phần mềm nào sau đây Không phải là công cụ chính của khoa học dữ liệu?
Ngôn ngữ lập trình R
Các phần mềm xử lý bảng tính (spreadsheet – Excel)
Microsoft Word
Ngôn ngữ lập trình Python
Định nghĩa của khoa học dữ liệu là gì
Là việc sử dụng các mô hình thống kê để phân tích dữ liệu
Là quá trình thu thập lưu trữ và quản lý dữ liệu
Là lĩnh vực nghiên cứu
Định nghĩa của khoa học dữ liệu là gì
Là việc sử dụng các mô hình thống kê để phân tích dữ liệu
Là quá trình thu thập lưu trữ và quản lý dữ liệu
Là lĩnh vực nghiên cứu liên ngành kết hợp toán thống kê khoa học dữ liệu và một số kiến thức chuyên môn sâu của dữ liệu để tìm kiếm các quy luật từ các tập dữ liệu.
Là việc tạo ra các biểu đồ trực quan hoá dữ liệu để trình bày các quy luật trong dữ liệu .
Vai trò của nhà khoa học dữ liệu là gì?
Xây dựng các mô hình dự báo và thuật toán
Tất cả các phương án khác
Thu thập và làm sạch dữ liệu
Xây dựng các phương thức trao đổi thông tin tóm tắt bản chất của dữ liệu liên quan
Mục đích chính trong công việc của các nhà khoa học dữ liệu là gì?
Cung cấp các gợi ý cho việc phát triển sản phẩm và dịch vụ mới
Cải tiến quá trình xây dựng các quyết định trong kinh doanh
Tất cả các phương pháp nghiên cứu
Hỗ trợ các nghiên cứu khoa học
Các kĩ năng cần có để thực thi một nhà phân tích dữ liệu cần có?
Kỹ năng phân tích thống kê dữ liệu
Kỹ năng lập trình
Kỹ năng giao tiếp và trình bày
Tất cả các kĩ năng được liệt kê
Các hàng trong một bảng dữ liệu thường chứa các thông tin gì?
Là một tập con thuộc các thuộc tính của một dữ liệu
Là một tập con của các trường thông tin
Là một trường thông tin chứa giá trị của một thuộc tính của các mẫu (đối tượng) dữ liệu
Là các mẫu (đối tượng) trong tập dữ liệu
Một đặc trưng của các mẫu (đối tượng) trong tập dữ liệu là gì?
Là một thuộc tính của các mẫu dữ liệu
Là một đối tượng trong tập dữ liệu
Là một hàng trong bảng dữ liệu
Là một tập hợp các đối tượng được nghiên cứu
Phát biểu nào sau đây là KHÔNG chính xác?
Giá trị trung bình của một tập dữ liệu luôn lớn giá trị nhỏ nhất
Phương sai là đại lượng đặc trưng cho độ ph
Câu 37. Phát biểu nào sau đây là KHÔNG chính xác?
A.Giá trị trung bình của một tập dữ liệu luôn lớn giá trị nhỏ nhất
B.Phương sai là đại lượng đặc trưng cho độ phân tán của tập dữ liệu
C.Giá trị trung bình của một tập dữ liệu luôn nhỏ hơn giá trị lớn nhất
D.Phương sai là đại lượng đo lường dữ liệu
Câu 38. Đại lượng nào sau đây KHÔNG được coi là đặc trưng thống kê về cân nặng của đàn gà trong một trang trại?
A.Giá trị trung vị
B.Phương sai
C.Giá trị trung bình
D.Tên người chủ trại
Câu 39. Công cụ nào sau đây không dùng để biểu diễn trực quan hoá dữ liệu?
A.Các mô hình hồi qui tuyến tính
B.Box plot
C.Bar plot
D.Scatter plot
Câu 40. Đại lượng trung vị là gì?
A.Là đại lượng chia đôi tập dữ liệu
B.Là trung bình cộng của tập dữ liệu
C.Là giá trị có tần suất xuất hiện nhiều nhất
D.Là giá trị trung bình của tập dữ liệu
Câu 41. Một tập dữ liệu là gì?
A.Tập các thuật toán
B.Tập hợp thông tin nguyên thuỷ của các đối tượng thoả mãn một điều kiện nghiên cứu nào đó
C.Tập hợp các công cụ để lưu trữ dữ liệu
D.Tập hợp các mô hình toán học
Câu 42. Bước đầu tiên trong một quá trình làm khoa học dữ liệu
A.Phân tích dữ liệu
B.Trực quan hoá dữ liệu
C.Làm sạch dữ liệu
D.Thu thập dữ liệu
Câu 43. Mục tiêu chính của việc làm sạch dữ liệu là gì?
A.Để loại bỏ những điểm dữ liệu bị thiếu và không phù hợp
B.Để bảo đảm tính chính xác và tương thích của dữ liệu
C.Cả 2 đáp án trên
Câu 44. Một tập dữ liệu được coi là môt bảng:
A.Số hàng bằng số điểm dữ liệu số cột là một đặc trưng (thuộc tính) của điểm dữ liệu
B.Số hàng bằng số cột
C.Số hàng luôn bằng số cột và bằng số điểm dữ liệu
D.Số hàng bằng số mẫu (đối tượng) của tập dữ liệu số cột là số thuộc tính của các mẫu (đối tượng) dữ liệu
Câu 45. Chương trình máy tính nào sau đây KHÔNG được coi là một ứng dụng của trí tuệ nhân tạo ?
(a)
Chương trình máy tính nào sau đây KHÔNG được coi là một ứng dụng của trí tuệ nhân tạo ?
Chương trình điều khiển xe tự lái
Chương trình quản lý sinh viên
Chương trình gợi ý các sản phẩm hoặc dịch vụ cho khách hàng
Chương trình nhận diện khuôn mặt
Đặc trưng thuộc tính của tập dữ liệu là gì?
Là tập hợp các thuộc tính (giá trị thuộc tính) của các đối tượng nghiên cứu
Chính là số đối tượng nghiên cứu trong tập dữ liệu
Vector có số thành phần bằng tổng số điểm dữ liệu và số thuộc tính
Vector trong không gian 3 chiều
Mệnh đề nào sau đây ĐÚNG?
Trí tuệ nhân tạo là trí tuệ của con người
Trí tuệ nhân tạo là khả năng thích nghi của các loài động vật
Trí nhân tạo có thể được xem như một chương trình máy tính có thể khái quát hoá tri thức từ dữ liệu để thực hiện một chức năng nào đó giống như một chuyên gia trong lĩnh vực đó.
Trí tuệ nhân tạo là khả năng của con người có thể xây dựng các chương trình máy tính có thể học.
Hệ số tương quan của 2 biến là gì?
Là đại lượng biểu diễn mối quan hệ giữa các giá trị trung bình của hai biến được chuẩn hoá
Là đại lượng biểu diễn mối quan hệ giữa các giá trị của hai biến đã được chuẩn hoá.
Là đại lượng biểu diễn mối quan hệ giữa các giá trị trung bình của hai biến
Là đại lượng biểu diễn mối quan hệ giữa hai biến.
Chức năng của tập huấn luyện trong học máy là gì
Dùng để huấn luyện mô hình
Dùng để so sánh với các mô hình khác
Dùng để đánh giá mô hình
Dùng để kiểm tra độ chính xác của mô hình.
Quá trình xây dựng một mô hình học máy thường gồm các bước nào?
Tiền sử lý dữ liệu
Huấn luyện mô hình
Thu nhập dữ liệu
Tất cả các bước trên.
Trong quá trình kiểm định một mô hình học máy phần trăm dữ
Một mô hình học máy thường gồm các bước nào?
Tiền sử lý dữ liệu
Huấn luyện mô hình
Thu nhập dữ liệu
Tất cả các bước trên.
Trong quá trình kiểm định một mô hình học máy phần trăm dữ liệu dành cho tập kiểm tra thường là bao nhiêu?
10-20%
40-50%
30-40%
20-30%
Một mô hình hồi quy tuyến tính thường được sử dụng để làm gì?
Tìm ra mối quan hệ phi tuyến tính giữa các biến
Tìm ra các mẫu trong tập dữ liệu
Dự đoán một biến phụ thuộc từ một hoặc nhiều biến độc lập
Phân loại các điểm dữ liệu vào các nhóm khác nhau
Hệ số hồi quy trong một mô hình hồi quy tuyến tính thể hiện điều gì?
Mối quan hệ giữa biến phụ thuộc khi biến độc lập thay đổi
Mức độ biến động của biến phụ thuộc khi biến độc lập thay đổi
Giá trị trung bình của biến phụ thuộc
Giá trị trung bình của biến độc lập
Phát biểu nào sau đây đúng về quá trình tiền xử lí dữ liệu?
Là bước không quan trọng trong quá trình làm khoa học dữ liệu
Là bước cuối cùng trong quá trình làm khoa học dữ liệu
Là bước đầu tiên trong quá trình làm khoa học dữ liệu
Là bước có thể bỏ qua trong quá trình làm khoa học dữ liệu
Mô hình hồi quy tuyến tính có thể được kiểm tra bằng cách nào?
Bằng cách kiểm tra giá trị trung bình của biến phụ thuộc
Bằng cách kiểm tra số tương quan giữa giá trị thực và giá trị dự đoán
Bằng cách kiểm tra phương sai của các biến độc lập
Bằng cách kiểm tra hệ số hồi quy của các biến độc lập
Độ chính xác của một mô hình học máy tính là gì?
Độ lệch chuẩn của các giá trị dự đoán
Tỷ lệ phần trăm các dự đoán đúng so với tổng số dự đoán
Tỷ lệ phần trăm các dự đoán so với tổng số dự đoán
Sai số trung bình giữa các giá trị thực và giá trị dự đoán.
Phương pháp nào sau đây được sử dụng để kiểm định độ chính xác của một mô hình học máy?
Phương pháp nào sau đây được sử dụng để kiểm định độ chính xác của một mô hình học máy?
A.K-fold validation
B.Tất cả các phương pháp trên
C.Holdout validation
D.Cross-validation
Với mô hình: y = 2x + 3 Hệ số góc là số nào?
A.2
B.3
C.4
D.5
MAE là gì?
A.Giá trị trung bình của absolute error
B.Bình phương của error
C.Căn bậc 2 của lỗi
D.Không có phương án trả lời đúng
TÍnh phương sai chuỗi số: 7, 3, 9, 2, 8, 6
A.0
B.6.75
C.6.5
D.6.47
Mục tiêu chính của Data Science là gì?
A.Tạo ra các mô hình 3D chân thực
B.Thiết kế các trang web hấp dẫn
C.Khám phá các khuôn mẫu (patterns), thông tin hữu ích và đưa ra quyết định dựa trên dữ liệu
D.Phát triển các ứng dụng di động
Quá trình Data Science bao gồm các bước nào
A.Thiết kế đồ họa, tạo hoạt ảnh
B.Quảng cáo, bán hàng, tiếp thị
C.Thu thập dữ liệu, làm sạch dữ liệu, phân tích dữ liệu, trực quan hóa dữ liệu
D.Lập trình, gỡ lỗi, triển khai
Ứng dụng của Data Science trong lĩnh vực chăm sóc sức khỏe là gì?
A.Chẩn đoán bệnh, phát hiện thuốc mới, y học cá nhân hóa
B.Thiết kế các công trình kiến trúc
C.Phát triển trò chơi điện tử
D.Tạo hiệu ứng hình ảnh cho phim
Loại AI nào tập trung vào việc thực hiện các nhiệm vụ cụ thể?
A.AI hẹp (Narrow AI)
B.AI siêu việt (Super AI)
C.AI đa nhiệm (Multitask AI)
D. AI tổng quát (General AI)
Phương pháp học có giám sát (supervised learning) có đặc điểm gì?
A.Chỉ yêu cầu output
B.Yêu cầu cả input và output label
C. Chỉ yêu cầu input
D.Tự học được theo thời gian
Phương pháp học AI nào sau đây có đặc điểm là dễ thu thập dữ liệu huấn luyện nhất
Supervised learning
Reinforcement learning
Unsupervised learning
Công nghệ nhận diện khuôn mặt trong ứng dụng chuyển tiền ngân hàng thuộc phân loại AI nào?
Generative AI
Narrow AI
Artificial Superintelligence
Dữ liệu âm thanh thuộc loại là dữ liệu gì?
Phi cấu trúc
Bán cấu trúc
Có cấu trúc
Dữ liệu điểm danh lớp học là loại dữ liệu gì?
Có cấu trúc
Bán cấu trúc
Phi cấu trúc
Phần mềm nào sau đây ít có khả năng được sử dụng nhất trong khoa học dữ liệu?
Ngôn ngữ lập trình Python
Phần mềm excel
Phần mềm Photoshop
Ngôn ngữ lập trình C
Mục đích của việc của làm khoa học dữ liệu là gì?
Hỗ trợ nghiên cứu khoa học
Hỗ trợ trong đưa ra quyết định trong kinh doanh
Tất cả các phương án
Cung cấp gợi ý cho việc phát triển sản phẩm
Một mẫu trong cơ sở dữ liệu là gì?
Một ô trong bảng
Một hàng trong bảng
Một cột trong bảng
Một bảng dữ liệu
Thuộc tính của mẫu dữ liệu là gì?
Là hàng trong bảng
Là thông tin về cột trong bảng
Là ô giá trị trong bảng
Là bảng dữ liệu
Câu nào sau đây đúng?
Hồi quy tuyến tính mô hình hóa mối quan hệ giữa 1 biến phụ thuộc và 1 hoặc nhiều biến độc lập
Hồi quy tuyến tính mô hình hóa mối quan hệ giữa 1 biến phụ thuộc và 1 biến độc lập
Hồi quy tuyến tính mô hình hóa mối quan hệ giữa 1 biến độc lập và nhiều biến phụ thuộc
Hồi quy tuyến tính mô hình hóa mối quan hệ giữa nhiều biến phụ thuộc
Logic mệnh đề là gì?
Công cụ toán học logic, trong đó có các mệnh đề và các biểu thức.
Tập các ký hiệu và tập các luật xây dựng công thức
Câu nào dưới đây KHÔNG là một mệnh đề.
An là sinh viên khoa CNTT
An không phải học Trí Tuệ Nhân Tạo
X là sinh viên không phải học Trí tuệ nhân tạo.
An là sinh viên CNTT nhưng không phải học Trí tuệ nhân tạo.
Có mấy phép kết nối logic trong mệnh đề
2
3
4
5
Ai là người đề ra thuật ngữ “Trí tuệ nhân tạo”
John McCarthy
Alan Turing
Elon Musk
Bill Gates
Turing test là
Bài toán kiểm tra khả năng trí tuệ của máy tính
Bài toán kiểm tra khả năng giải thuật
Bộ câu hỏi lý thuyết về trí tuệ nhân tạo
Bộ câu hỏi lý thuyết về khoa học máy tính
Những mô hình tính toán có cách thức suy nghĩ giống con người được gọi là.
Mô hình mạng nơ-ron
Mô hình hồi quy tuyến tính
Mô hình cây lí thuyết
Mô hình hồi quy logistic
Đâu là ứng dụng của trí tuệ nhân tạo
Thị giác máy tính
Xử lý ngôn ngữ tự nhiên
Học máy
Tất cả đáp án trên
Hàm đánh giá dùng để
Tính toán mức độ tốt/xấu, khả năng về đích của trạng thái
Tính toán thời gian của thuật toán
Tính toán độ lớn của thuật toán
Tính toán sự sai lệch giữa trạng thái đầu và trạng thái đích của thuật toán
Mục tiêu chính của Data Science là gì?
Dữ liệu âm thanh thuộc loại là dữ liệu gì?
Mục đích của việc của làm khoa học dữ liệu là gì?
Một mẫu trong cơ sở dữ liệu là gì?
Thuộc tính của mẫu dữ liệu là gì?
Phần mềm nào sau đây KHÔNG phải là phần mềm hay được sử dụng trong khoa học dữ liệu
Đặc trưng của dữ liệu là gì?
Phát biểu nào sau đây không đúng?
Thuộc tính của mẫu dữ liệu là gì?
Phần mềm nào sau đây KHÔNG phải là phần mềm hay được sử dụng trong khoa học dữ liệu?
Đặc trưng của dữ liệu là gì?
Phát biểu nào sau đây không đúng?
Câu nào sau đây chính xác?
Cho tập dữ liệu X: 3, 4, 2, 5. Tính giá trị trung bình của dữ liệu là?
Cho dữ liệu về số đơn hàng bán theo từng ngày, biểu đồ nào sau đây là phù hợp nhất để thể hiện sự thay đổi của đơn hàng?
Cho biểu đồ tần suất như dưới đây. Hỏi độ tuổi được khảo sát trong dữ liệu là giá trị nào?
Cho biểu đồ tần suất như dưới đây. Số lượng người nữ có độ tuổi 40 là bao nhiêu?
Giá trị trung vị có ý nghĩa gì?
Biểu đồ phân tán có đặc điểm gì?
Nếu muốn thể hiện tỷ lệ Nam/Nữ trong 1 lớp chênh lệch như thế nào thì dùng biểu đồ nào phù hợp nhất?
Biểu đồ tần suất có tên tiếng Anh là gì?
Hệ số tương quan của biểu đồ sau là gì?
Hệ số tương quan của biểu đồ sau có thể là giá trị nào sau đây?
Hệ số tương quan của biểu đồ sau có thể là bao nhiêu?
Bước đầu tiên của việc làm khoa học dữ liệu là?
Mệnh đề nào sau đây đúng?
Một hãng bia muốn khảo sát thị trường, ai có thể là đối tượng?
Làm sạch dữ liệu để làm gì?
Biểu đồ boxplot thể hiện chính các giá trị gì?
Giá trị trung bình và trung vị khác gì nhau?
Tính độ lệch chuẩn của tập dữ liệu sau: -1,317 -3,059 -2,868 -0,314 -1,437
Giá trị phương sai của tập dữ liệu sau là? 2, 3, 1, 9 , 11
Linear regression được dùng để làm gì?
Đâu là công cụ thường dùng trong phân tích dữ liệu?
Tìm giá trị trung bình của tập dữ liệu
Tìm giá trị trung vị của tập dữ liệu
Tìm hệ số a, b của hồi quy tuyến tính y= a+bx
Tìm hệ số tương quan của 2 tập dữ liệu
Tìm độ lệch chuẩn của tập dữ liệu
Tìm phương sai của tập dữ liệu
Xác định hệ số tương quan dựa trên đồ thị scatter plot
Cho dữ liệu: 2, 4, 6, 8, 10. Tính mean (trung bình)=6
Cho giá trị thực tế: [1, 3, 5, 7, 9] và giá trị dự đoán: [2, 3, 4, 8, 8]. Tính Mean Absolute Error (MAE).=4/5
Sử dụng dữ liệu từ bài 2, tính MSE và RMSE. Mse= 4/5; rmse= 2/ căn 5
Mô hình A có MAE = 2.5, MSE =
Tính Mean Absolute Error (MAE).=4/5
Sử dụng dữ liệu từ bài 2, tính MSE và RMSE.
Mô hình A có MAE = 2.5, MSE = 8.2. Mô hình B có MAE = 3.1, MSE = 7.8. Mô hình nào tốt hơn? Giải thích.
Cho dữ liệu: x = [1, 2, 3, 4, 5], y = [2, 4, 6, 8, 10]. Tìm phương trình hồi quy y=ax+by.
Cho dữ liệu: 10, 12, 11, 13, 12, 45, 11, 10. a) Tính mean và standard deviation. b) Xác định outlier (sử dụng quy tắc 2 standard deviation). c) Tính lại mean và standard deviation sau khi loại bỏ outlier.
Cho y_actual = [10, 20, 30, 40, 50] và y_predicted = [12, 18, 32, 38, 52]. Tính hệ số xác định R².
Một mô hình có R² = 0.85 trên training set và R² = 0.65 trên test set. a) Mô hình có vấn đề gì? b) Đề xuất giải pháp.
Một cửa hàng ghi nhận dữ liệu bán hàng: Nhiệt độ (°C): x=[15, 20, 25, 30, 35]=>x mean= 25. Doanh thu (triệu): y=[50, 65, 80, 95, 110]=> y mean= 80. a) Tìm phương trình hồi quy.
Tìm phương trình hồi quy.
Dự đoán doanh thu khi nhiệt độ 28°C.
Tính R².
Phân tích ưu nhược điểm của từng mô hình và đưa ra khuyến nghị.
Model 1 tốt hơn
Model 2 tốt hơn
Model 3 tốt hơn
Đánh giá chất lượng mô hình.
Mô hình nào tốt hơn và tại sao?
Mô hình A tốt hơn
Mô hình B tốt hơn
Tính hệ số R².
Tìm mối quan hệ giữa chi phí quảng cáo (x) và doanh số (y).
Mối quan hệ giữa nhiệt độ (°C) và chi phí điện: Nhiệt độ: [-5, 0, 5, 10, 15]=> x mean=5 Chi phí điện (nghìn đồng): [200, 150, 120, 100, 90] => y mean= 132 Tìm phương trình hồi quy và tính R². Cov= -270,var= 50. A= -27/5, b= 159=> y= (-27/5)*x+159 Ssres= 0, sstot= 7880=> r bình= 1 hoàn hảo
Trong hồi quy tuyến tính đơn giản, hệ số R² (R-squared) thể hiện điều gì?
Tỷ lệ phương sai của biến phụ thuộc được giải thích bởi mô hình
Độ dốc của đường hồi quy
Sai số trung bình của mô hình
Hệ số tương quan giữa các biến độc lập
Trong mô hình phân loại, accuracy được tính như thế nào?
Tổng đáp án đúng / tổng dự đoán
Tổng đáp án sai / tổng dự đoán
Bình phương của tổng đáp án đúng / tổng dự đoán
Bình phương của tổng đáp án sai / tổng dự đoán đúng
Điểm khác biệt chính về kiểu dữ liệu đầu ra giữa hồi quy tuyến tính và mô hình phân loại là gì?
Hồi quy cho đầu ra liên tục, phân loại cho đầu ra rời rạc
Hồi quy cho đầu ra rời rạc, phân loại cho đầu ra liên tục
Cả hai đều cho đầu ra liên tục
Cả hai đều cho đầu ra rời rạc
Khi nào bạn sẽ chọn hồi quy tuyến tính thay vì mô hình phân loại?
Khi muốn dự đoán giá nhà dựa trên diện tích và vị trí
Khi muốn phân loại email spam hay không spam
Khi muốn nhận dạng chữ số viết tay
Khi muốn phân loại khách hàng tiềm năng
Phương pháp đánh giá nào KHÔNG phù hợp cho hồi quy tuyến tính nhưng quan trọng đối với mô hình phân loại?
Accuracy
Mean Absolute Error (MAE)
Root Mean Squared Error (RMSE)
Phương pháp đánh giá nào KHÔNG phù hợp cho hồi quy tuyến tính nhưng quan trọng đối với mô hình phân loại?
Accuracy
Mean Absolute Error (MAE)
Root Mean Squared Error (RMSE)
R-squared
Trong trường hợp nào sau đây, việc chuyển đổi từ bài toán hồi quy sang phân loại là hợp lý?
Dự đoán mức độ nhiệt độ (thấp/trung bình/cao) thay vì giá trị cụ thể
Dự đoán nhiệt độ chính xác trong ngày
Tính toán diện tích hình tròn từ bán kính
Ước lượng thời gian di chuyển giữa hai địa điểm
Nhược điểm chính của độ đo Accuracy khi đánh giá mô hình phân loại trên tập dữ liệu mất cân bằng (imbalanced dataset) là gì?
Accuracy có thể cho kết quả cao nhưng không phản ánh đúng hiệu suất mô hình
Accuracy không thể tính được trên dữ liệu mất cân bằng
Accuracy luôn cho kết quả thấp trên dữ liệu mất cân bằng
Accuracy tính toán quá phức tạp
So sánh giữa MAE (Mean Absolute Error) và MSE (Mean Squared Error), điều gì đúng về độ nhạy cảm với outliers?
MSE nhạy cảm hơn với outliers so với MAE
MAE nhạy cảm hơn với outliers so với MSE
Cả hai có độ nhạy cảm như nhau với outliers
Không có sự khác biệt về outliers giữa MAE và MSE
Tại sao Accuracy không phù hợp để đánh giá mô hình phát hiện bệnh hiếm (tỷ lệ mắc bệnh 1%)?
Vì mô hình có thể đạt 99% accuracy chỉ bằng cách dự đoán "không mắc bệnh" cho tất cả cases
Vì Accuracy không tính được trên dữ liệu y tế
Vì Accuracy quá phức tạp cho bài toán y tế
Vì Accuracy không phù hợp với dữ liệu số
