Font size
WorksheetsUntitled Quiz
Total questions: 150
Worksheet time: 1hrs 15mins
Trí tuệ nhân tạo (AI) là gì?
Hệ thống máy tính có khả năng thực hiện công việc cần đến trí tuệ con người
Một loại phần mềm xử lý văn bản
Một loại công nghệ phần cứng
Một phương pháp xử lý dữ liệu truyền thống
Ví dụ nào sau đây không phải là ứng dụng của trí tuệ nhân tạo?
Robot
Cảnh báo lỗi chính tả trong văn bản
Sinh giọng nói
Nhận diện giọng nói
AI được chia thành bao nhiêu loại chính?
1
2
3
4
Trong các loại AI, AI nào có khả năng thực hiện các tác vụ mà chỉ con người có thể làm được?
Generative AI
ANI (Artificial Narrow Intelligence)
AGI (Artificial General Intelligence)
Cả A và B
Machine Learning làm AI trở nên phổ biến như thế nào?
Dựa trên các quy tắc được định nghĩa tường minh bởi con người
Cho phép máy tính phân tích dữ liệu và cải thiện hiệu suất mà không cần lập trình rõ ràng
Dựa trên việc xử lý dữ liệu một cách thủ công
Dựa trên việc sử dụng các công cụ phần cứng tiên tiến
Học máy (Machine Learning) là gì?
Một phần mềm quản lý cơ sở dữ liệu
Một loại ngôn ngữ lập trình
Một công cụ phân tích dữ liệu thủ công
Một phương pháp cho phép máy tính học từ dữ liệu và cải thiện theo thời gian
Large Language Models (LLMs) hoạt động như thế nào?
Bằng cách phân tích dữ liệu hình ảnh
Bằng cách sử dụng thuật toán không có giám sát
Bằng cách dự đoán tuần tự các từ tiếp theo trong một câu
Bằng cách tương tác trực tiếp với con người
Big Data có các tính chất nào?
Variety, Value, Velocity, Veracity
Volume, Velocity, Variability, Visibility
Volume, Velocity, Variety, Variability
Volume, Value, Velocity, Veracity
Dữ liệu lớn (Big Data) là gì?
Dữ liệu có khối lượng lớn, bao gồm cả dữ liệu có cấu trúc và không có cấu trúc
Dữ liệu chỉ được thu thập từ internet
Dữ liệu được lưu trữ trong cơ sở dữ liệu quan hệ
Dữ liệu có khối lượng nhỏ
Những ví dụ nào dưới đây là dữ liệu bán cấu trúc?
JSON, XML, CSV
ERP, CRM, Database
Image, Sensor data, Radar info
Video, Audio, Document
Khoa học dữ liệu (Data Science) làm gì?
Áp dụng các phương pháp khoa học để phân tích dữ liệu và hỗ trợ ra quyết định
Chỉ phân tích dữ liệu có cấu trúc
Chỉ lưu trữ dữ liệu mà không phân tích
Quản lý hệ thống máy chủ dữ liệu
Công việc của một Data Scientist thường liên quan đến những gì?
Quản lý cơ sở dữ liệu
Lập trình web
Xử lý văn bản và tạo ra báo cáo
Phân tích thống kê và biểu diễn dữ liệu
Trí tuệ nhân tạo (AI) trong ngành công nghiệp ô tô có thể ứng dụng trong lĩnh vực nào?
Hệ thống lái tự động
Xử lý văn bản
Quản lý tài chính
Thiết kế website
Dữ liệu trong Khoa học dữ liệu có thể đến từ đâu?
Chỉ từ các ứng dụng di động
Chỉ từ máy tính cá nhân
Chỉ từ các hệ thống quản lý doanh nghiệp
Từ nhiều nguồn như điện thoại, internet, và các thiết bị cảm biến
Học máy (Machine Learning) cho phép hệ thống làm gì theo thời gian?
Tự cải thiện hiệu suất khi được cung cấp thêm dữ liệu
Tự động tạo ra các dữ liệu mới
Tự động quản lý hệ thống mạng
Tự động hóa các tác vụ văn phòng
Generative AI là gì?
Một loại AI có khả năng sáng tạo và tạo ra các nội dung mới
Một phương pháp tối ưu hóa dữ liệu
Một phần mềm quản lý cơ sở dữ liệu
Một công cụ phân tích dữ liệu thủ công
Ứng dụng của AI trong ngành ngân hàng và tài chính là gì?
Quản lý hệ thống mạng
Thiết kế giao diện người dùng
Phân tích rủi ro và phát hiện gian lận
Quản lý kho hàng
Cơ hội nghề nghiệp trong lĩnh vực Khoa học dữ liệu bao gồm những vị trí nào?
Sales manager, Marketing Coordinator, Customer service representative
Content writer, Graphic designer, SEO specialist
Data analyst, Machine learning engineer, Data scientist
Network administrator, Web developer, System engineer
Nguyên lý hoạt động của các mô hình ngôn ngữ lớn (LLMs) như thế nào?
Sử dụng học máy không có giám sát để phân tích hình ảnh
Dùng các thuật toán tối ưu hóa để tìm kiếm thông tin
Sử dụng học máy có giám sát để dự đoán tuần tự các từ tiếp theo
Dùng các quy tắc định nghĩa sẵn để xử lý văn bản
Các bài toán trong học máy thường bao gồm những loại nào?
Bài toán tìm kiếm, bài toán sắp xếp, bài toán tối ưu hóa
Bài toán hồi quy, bài toán phân loại dữ liệu, bài toán phân cụm dữ liệu
Bài toán xử lý hình ảnh, bài toán xử lý âm thanh, bài toán xử lý văn bản
Bài toán quản lý cơ sở dữ liệu, bài toán quản lý hệ thống mạng, bài toán lập trình
Những bước nào sau đây là một phần của quá trình phát triển sản phẩm AI/KHDL?
Thu thập dữ liệu, Tiền xử lý dữ liệu, Chuẩn bị dữ liệu
Phân tích yêu cầu người dùng, Kiểm thử phần mềm, Triển khai phần mềm
Thiết kế giao diện người dùng, Tạo báo cáo, Lập kế hoạch dự án
Đánh giá hiệu quả hệ thống, Báo trì phần mềm, Phát triển phần mềm
Định nghĩa bài toán AI/KHDL bao gồm những yếu tố nào?
Xác định dữ liệu đầu vào và đầu ra, Phân tích yêu cầu kinh doanh, Đánh giá rủi ro dự án
Xác định trường thông tin (features) và biến dự đoán (label), Xác định chiến lược thu thập dữ liệu, Đánh giá tính khả thi của sử dụng học máy
Lập kế hoạch dự án, Tạo mô hình dữ liệu, Xác định mục tiêu kinh doanh
Đánh giá hiệu quả dự án, Tạo mẫu thử nghiệm, Thu thập dữ liệu người dùng
Những vai trò nào sau đây thường tham gia trong một dự án AI/KHDL?
Nhà thiết kế UX/UI, Kỹ sư phần mềm, Quản lý dự án
Nhà phân tích thị trường, Chuyên gia tài chính, Nhân viên bán hàng
Kỹ sư hệ thống, Chuyên gia bảo mật, Kế toán viên
Chuyên gia về lĩnh vực, Nhà khoa học dữ liệu, Kỹ sư dữ liệu
Quá trình ETL trong xử lý dữ liệu bao gồm các bước nào?
Lưu trữ dữ liệu, Phân tích dữ liệu, Tạo báo cáo từ dữ liệu
Trích xuất dữ liệu, Biến đổi dữ liệu, Tải dữ liệu vào hệ thống lưu trữ
Trích xuất dữ liệu thô, Lọc dữ liệu, Phân loại dữ liệu
Tải dữ liệu vào hệ thống, Biến đổi dữ liệu, Trích xuất dữ liệu từ nguồn
Khi gặp dữ liệu thiếu trong quá trình tiền xử lý, bạn nên làm gì?
Thêm dữ liệu giả định để thay thế cho dữ liệu thiếu
Thay thế dữ liệu thiếu bằng giá trị 0 hoặc giá trị trung bình
Bỏ qua dữ liệu thiếu và tiếp tục với dữ liệu hiện có
Loại bỏ tất cả các hàng có dữ liệu thiếu
Tại sao việc xác định mục tiêu kinh doanh lại quan trọng trong dự án AI/KHDL?
Nó giúp tiết kiệm chi phí phát triển phần mềm
Nó đảm bảo rằng dự án sẽ hoàn thành đúng thời hạn
Nó giúp xác định rõ ràng vấn đề cần giải quyết và cách đánh giá thành công
Nó giúp xác định các yêu cầu kỹ thuật của hệ thống
Trong một dự án AI, ai là người chịu trách nhiệm chính về việc thu thập và xử lý dữ liệu?
Nhà khoa học dữ liệu
Chuyên gia về lĩnh vực
Kỹ sư phần mềm
Kỹ sư dữ liệu
Biến mục tiêu (target) trong bài toán nhận diện gian lận bảo hiểm thường là gì?
Số tiền yêu cầu bồi thường
Loại bảo hiểm mà khách hàng đã mua
Liệu yêu cầu bảo hiểm có phải là gian lận hay không (1: Có, 0: Không)
Độ tuổi của khách hàng
Dữ liệu nào sau đây thường được sử dụng để phát hiện gian lận bảo hiểm?
Lịch sử yêu cầu bồi thường, Hành vi bất thường, Điểm tín dụng
Địa điểm của khách hàng, Loại bảo hiểm, Tình trạng hôn nhân
Nghề nghiệp của khách hàng, Thời gian kể từ khi hợp đồng được cấp, Tần suất giao dịch
Tất cả các câu trên đều đúng
Khi nào bạn cần sử dụng quá trình ELT thay vì ETL?
Khi dữ liệu có cấu trúc và cần được phân tích ngay lập tức
Khi dữ liệu không có cấu trúc hoặc có cấu trúc và cần tải vào dạng thô trước khi biến đổi
Khi dữ liệu cần biến đổi trước khi tải vào hệ thống
Khi dữ liệu cần được lưu trữ trong cơ sở dữ liệu quan hệ
Giá trị Mode của dãy số [4,4,6,6,6,7,8,9] là gì?
4 và 6
6
4
7
Giá trị trung vị (Median) của dãy số [10, 20, 30, 40, 50] là gì?
30
20
40
25
Giá trị trung bình (Mean) của dãy số [10, 20, 30, 40, 50] là gì?
30
20
40
25
Hiệp phương sai (Covariance) giữa hai biến số X và Y với X = [1, 2, 3, 4, 5] và Y = [2, 4, 6, 8, 10] là gì?
4.0
2.5
3.0
5.0
Hệ số tương quan (Correlation coefficient) giữa hai biến số X và Y với X = [1, 2, 3, 4, 5] và Y = [2, 4, 6, 8, 10] là gì?
1.0
0.8
0.9
0.7
Standard deviation (Độ lệch chuẩn) của dãy số [3, 7, 5, 9, 2] là gì?
3.16
2.83
2.91
3.00
Phương sai (Variance) của dãy số [3, 7, 5, 9, 2] là gì?
8.0
6.8
7.2
6.0
Giá trị Mode của dãy số [3, 3, 7, 5, 9, 2, 3] là gì?
3
2
5
7
Giá trị trung vị (Median) của dãy số [3, 7, 5, 9, 2] là gì?
5
6
7
3
Giá trị trung bình (Mean) của dãy số [3, 7, 5, 9, 2] là gì?
5.2
4.2
5.2
6.0
Biểu đồ nào sau đây tốt nhất để hiển thị xu hướng theo thời gian?
Biểu đồ đường
Biểu đồ tròn
Biểu đồ thanh
Biểu đồ tán xạ
Biểu đồ nào thường được sử dụng để so sánh tỉ lệ của các danh mục khác nhau?
Biểu đồ tròn
Biểu đồ histogram
Biểu đồ đường
Biểu đồ hộp
Biểu đồ nào tốt nhất để hiển thị phân bố của một biến đơn?
Biểu đồ histogram
Biểu đồ hộp
Biểu đồ đường
Biểu đồ tròn
Trong biểu đồ tán xạ, mỗi điểm dữ liệu đại diện cho gì?
Quan hệ giữa hai biến
Giá trị trung bình của dữ liệu
Tần suất của một danh mục
Phân bố của dữ liệu
Biểu đồ hộp hiển thị những gì?
Trung vị hoặc/và phân bố của dữ liệu
Tần suất của một tập hợp dữ liệu
Biểu đồ nhiệt (heatmap) được sử dụng để làm gì?
Biểu thị mật độ hoặc cường độ của dữ liệu
So sánh tỉ lệ
Hiển thị dữ liệu phân cấp
Hiển thị dữ liệu thời gian
Biểu đồ nào thường được sử dụng để hiển thị dữ liệu phân cấp?
Là một loại biểu đồ khác
Biểu đồ đường
Biểu đồ tròn
Biểu đồ tán xạ
Biểu đồ nào tốt nhất để hiển thị mối quan hệ giữa hai biến liên tục?
Biểu đồ tán xạ
Biểu đồ thanh
Biểu đồ tròn
Biểu đồ đường
Dữ liệu dạng nào thường được biểu diễn tốt nhất bằng biểu đồ thanh?
Dữ liệu phân loại
Dữ liệu thời gian
Dữ liệu liên tục
Dữ liệu phân cấp
Biểu đồ nào thường được sử dụng để hiển thị tổng tích lũy theo thời gian?
Biểu đồ vùng (area chart)
Biểu đồ đường
Biểu đồ thanh
Biểu đồ tròn
Học máy (hay Machine learning) là gì?
Một ứng dụng của trí tuệ nhân tạo cho phép thiết bị học từ trải nghiệm mà không cần lập trình.
Một phương pháp lập trình trực tiếp cho thiết bị thực hiện nhiệm vụ.
Một loại phần mềm máy tính sử dụng thuật toán cố định.
Một cách để con người lập trình trực tiếp tất cả các nhiệm vụ.
Dữ liệu đầu vào và đầu ra trong huấn luyện mô hình học máy là gì?
Đầu vào: Dữ liệu và thông tin cần dự đoán; Đầu ra: các quy tắc (hay mô hình)
Đầu vào: Quy tắc; Đầu ra: Dữ liệu.
Đầu vào: Thông tin cần dự đoán; Đầu ra: Dữ liệu và quy tắc.
Đầu vào: Dữ liệu; Đầu ra: Quy tắc.
Tuần tự các bước chính của huấn luyện mô hình học máy?
thu thập dữ liệu, tiền xử lý dữ liệu, lựa chọn mô hình, huấn luyện mô hình, và đánh giá mô hình.
thu thập dữ liệu, lựa chọn mô hình, huấn luyện mô hình, và đánh giá mô hình.
lựa chọn mô hình, thu thập dữ liệu, tiền xử lý dữ liệu, huấn luyện mô hình, và đánh giá mô hình.
huấn luyện mô hình, lựa chọn mô hình, thu thập dữ liệu, tiền xử lý dữ liệu, và đánh giá mô hình.
Trong học máy, overfit là gì?
Mô hình học quá chi tiết và không thể tổng quát hóa
Mô hình không đủ phức tạp và không học được từ dữ liệu
Mô hình vừa đủ phức tạp để học từ dữ liệu
Mô hình không có khả năng học.
Một ví dụ về ứng dụng của không phải là học máy?
Hệ thống trả lời tự động ở máy bán hàng tự động Phenikaa
Ứng dụng nhận diện giọng nói của Google
Xe tự lái của Phenikaa-X
Hệ thống gợi ý khách hàng của Shopee
Trong học máy, mục tiêu của thuật toán hồi quy là gì?
Dự đoán giá trị liên tục
Phân loại dữ liệu vào các nhóm
Giảm số chiều của dữ liệu
Tìm kiếm các cụm trong dữ liệu
Thuật toán Gradient Descent dùng để làm gì trong học máy?
Tối ưu hóa hàm mất mát (hàm loss)
Phân loại dữ liệu
Giảm số chiều của dữ liệu
Chia dữ liệu thành các cụm
Trong học máy, hiện tượng Underfitt xảy ra khi nào?
Mô hình quá đơn giản và không phù hợp với dữ liệu huấn luyện
Mô hình quá phức tạp và phù hợp tốt với dữ liệu huấn luyện nhưng kém trên dữ liệu kiểm tra
Dữ liệu không đủ để huấn luyện mô hình
Mô hình có quá nhiều tham số
Ví dụ nào sau đây thuộc bài toán học máy không giám sát?
phân nhóm khách hàng dựa trên hành vi mua sắm của họ.
Phân loại thư đến có phải là thư rác hay không
Dự đoán giá cổ phiếu tăng giảm
Phân loại các quyền sách trong thư viện
Phát triển game tự chơi (ví dụ game Mario) thì nên sử dụng loại học máy nào?
Học tăng cường
Học giám sát
Học không giám sát
Học bán giám sát (kết hợp cả giám sát và không giám sát)
Cho biểu đồ bên dưới, hỏi biểu đồ này thuộc loại là gì?
Biểu đồ dạng cột
Biểu đồ phân tán
Biểu đồ tần suất
Biểu đồ dạng tròn
Cho 5 mẫu dữ liệu bất động sản có hai trường thông tin X = "lãi ngân hàng" và Y = "giá nhà đất/m2". Hãy tính Giá trị trung bình (Mean) của dữ liệu theo trường thông tin X.
7.1
6.8
7.5
7.0
Cho 5 mẫu dữ liệu bất động sản có hai trường thông tin X = "lãi ngân hàng" và Y = "giá nhà đất/m2". Hãy tính Trung vị (Median) của dữ liệu theo trường thông tin X.
7.5
7.1
6.0
8.0
Cho 5 mẫu dữ liệu bất động sản có hai trường thông tin X = "lãi ngân hàng" và Y = "giá nhà đất/m2". Hãy tính Giá trị trung bình (Mean) của dữ liệu theo trường thông tin Y.
9.62
9.50
8.40
10.00
Cho 5 mẫu dữ liệu bất động sản có hai trường thông tin X = "lãi ngân hàng" và Y = "giá nhà đất/m2". Hãy tính Trung vị (Median) của dữ liệu theo trường thông tin Y.
8.4
9.6
8.0
12.0
Dựa trên bảng dữ liệu 5 mẫu với X (lãi suất %) và Y (nghìn VNĐ/cổ), chọn Giá trị trung bình của X.
6.1
6.8
7.0
5.5
Với bảng dữ liệu 5 mẫu ở Câu 1, chọn Trung vị của X.
7
6
6.5
8
Với bảng dữ liệu 5 mẫu ở Câu 1, chọn Giá trị trung bình của Y.
11
10.6
12
9.8
Với bảng dữ liệu 5 mẫu ở Câu 1, chọn Trung vị của Y.
11
10
12
9
Với bảng dữ liệu 5 mẫu ở Câu 1, chọn Phương sai của X.
3.44
2.16
2.00
6.96
Với bảng dữ liệu 5 mẫu ở Câu 1, chọn Phương sai của Y.
2
2.24
2.96
6.96
Với bảng dữ liệu 5 mẫu ở Câu 1, chọn Độ lệch chuẩn của X.
1.855
1.47
1.414
2.64
Với bảng dữ liệu 5 mẫu ở Câu 1, chọn Độ lệch chuẩn của Y.
1.414
1.72
1.497
2.64
Với bảng dữ liệu 5 mẫu ở Câu 1, chọn Hiệp phương sai giữa X và Y.
2.6
2.04
-0.4
-1.94
Với bảng dữ liệu 5 mẫu ở Câu 1, chọn Hệ số tương quan giữa X và Y.
0.99
0.81
-0.70
-0.40
Kết quả thống kê cho dữ liệu sinh viên (X: điểm toán, Y: điểm anh văn) gồm 5 mẫu. Chọn Giá trị trung bình của X.
6.1
6.5
6.8
6.0
Với bảng dữ liệu 5 mẫu ở Câu 2, chọn Trung vị của X.
7
6
6.5
8
Với bảng dữ liệu 5 mẫu ở Câu 2, chọn Giá trị trung bình của Y.
6.4
6.0
6.8
5.6
Với bảng dữ liệu 5 mẫu ở Câu 2, chọn Trung vị của Y.
6
7
5
9
Với bảng dữ liệu 5 mẫu ở Câu 2, chọn Phương sai của X.
3.44
2.16
2.00
6.96
Với bảng dữ liệu 5 mẫu ở Câu 2, chọn Phương sai của Y.
2.24
2.00
2.96
6.96
Với bảng dữ liệu 5 mẫu ở Câu 2, chọn Độ lệch chuẩn của X.
1.855
1.47
1.414
1.72
Với bảng dữ liệu 5 mẫu ở Câu 2, chọn Độ lệch chuẩn của Y.
1.497
1.414
1.72
2.64
Với bảng dữ liệu 5 mẫu ở Câu 2, chọn Hiệp phương sai giữa X và Y.
-1.94
2.04
2.60
-0.40
Với bảng dữ liệu 5 mẫu ở Câu 2, chọn Hệ số tương quan giữa X và Y.
-0.7
0.81
0.99
-0.4
Cho 5 mẫu dữ liệu bất động sản với X = lãi ngân hàng (%) và Y = giá nhà đất/m2 (triệu VNĐ/m2). Chọn Giá trị trung bình của X.
6.8
6.5
7.0
6.1
Với bảng dữ liệu 5 mẫu ở Câu 3, chọn Trung vị của X.
6
7
6.5
5
Với bảng dữ liệu 5 mẫu ở Câu 3, chọn Giá trị trung bình của Y.
9.2
9.0
8.6
10.0
Với bảng dữ liệu 5 mẫu ở Câu 3, chọn Trung vị của Y.
9
8
10
7
Với bảng dữ liệu 5 mẫu ở Câu 3, chọn Phương sai của X.
2.16
3.44
2.00
2.96
Với bảng dữ liệu 5 mẫu ở Câu 3, chọn Phương sai của Y.
2.96
2.24
6.96
2.00
Với bảng dữ liệu 5 mẫu ở Câu 3, chọn Độ lệch chuẩn của X.
1.47
1.855
1.414
1.72
Với bảng dữ liệu 5 mẫu ở Câu 3, chọn Độ lệch chuẩn của Y.
1.72
1.497
1.414
2.64
Với bảng dữ liệu 5 mẫu ở Câu 3, chọn Hiệp phương sai giữa X và Y.
2.04
2.60
-0.40
-1.94
Với bảng dữ liệu 5 mẫu ở Câu 3, chọn Hệ số tương quan giữa X và Y.
0.81
0.99
-0.70
-0.40
Kết quả thống kê cho dữ liệu tài chính với X (lãi suất %) và Y (nghìn VNĐ/cổ) gồm 5 mẫu. Chọn Giá trị trung bình của X.
6.5
6.1
6.8
7.0
Với bảng dữ liệu 5 mẫu ở Câu 4, chọn Trung vị của X.
7
6
6.5
7.5
Với bảng dữ liệu 5 mẫu ở Câu 4, chọn Giá trị trung bình của Y.
11.8
11.0
12.0
10.6
Với bảng dữ liệu 5 mẫu ở Câu 4, chọn Trung vị của Y.
11
10
12
13
Với bảng dữ liệu 5 mẫu ở Câu 4, chọn Phương sai của X.
2
3.44
2.16
6.96
Với bảng dữ liệu 5 mẫu ở Câu 4, chọn Phương sai của Y.
6.96
2.24
2.96
2.00
Với bảng dữ liệu 5 mẫu ở Câu 4, chọn Độ lệch chuẩn của X.
1.414
1.855
1.47
2.64
Với bảng dữ liệu 5 mẫu ở Câu 4, chọn Độ lệch chuẩn của Y.
2.64
1.72
1.497
1.414
Với bảng dữ liệu 5 mẫu ở Câu 4, chọn Hiệp phương sai giữa X và Y.
-0.4
2.04
2.60
-1.94
Dữ liệu được biểu diễn bởi hình dưới đây cho thấy xu hướng gì: đồng biến (positive relationship), nghịch biến (negative relationship), hay không quan hệ (no relationship)?
Đồng biến (positive relationship)
Nghịch biến (negative relationship)
Không quan hệ (no relationship)
Tập dữ liệu có liên quan đến các lĩnh vực nào?
Chỉ liên quan đến công nghệ thông tin
Chỉ liên quan đến khoa học
Chỉ liên quan đến lĩnh vực xã hội
Liên quan đến nhiều lĩnh vực, chẳng hạn như khoa học, y tế, kinh tế và xã hội học
Tại sao khoa học dữ liệu quan trọng trong thời đại số hóa?
Tất cả các phương án trên
Vì khoa học dữ liệu giúp tạo ra giá trị cho doanh nghiệp thông qua phân tích dữ liệu
Vì khoa học dữ liệu giúp phát hiện và giải quyết các vấn đề liên quan đến dữ liệu trong thời đại số hóa
Vì khoa học dữ liệu chỉ hữu ích cho nghiên cứu học thuật
Sau khi thực hiện chuẩn hóa dữ liệu bạn sẽ có
Tất cả các phương án trên
Dữ liệu trở nên có tính thống nhất và chuẩn hóa
Dữ liệu trên có thể dễ dàng hơn trong việc truy xuất và phân tích
Dữ liệu trở nên đồng nhất và giảm thiểu lỗi
Bước nào sau đây không thuộc vòng đời xây dựng mô hình học máy
Đánh giá chất lượng mô hình
Định nghĩa bài toán kinh doanh thành bài toán học máy
Chuẩn bị dữ liệu cho mô hình
Đánh giá tính hiệu quả về mặt kinh tế của mô hình
Một doanh nghiệp có một tập lớn khách hàng với các thông tin như thu nhập, công việc, quê quán. Mô hình học máy được huấn luyện cho phép “tìm được các khách hàng tương tự nhau trong tập dữ liệu trên” thuộc loại mô hình học nào dưới đây?
Mô hình học có giám sát (supervised learning)
Mô hình học không giám sát (unsupervised learning)
Mô hình học tăng cường (Reinforcement learning)
Mô hình hồi quy (regression model)
Trong học máy, học có giám sát khác học không có giám sát ở điểm nào?
Trong học có giám sát cần lượng dữ liệu lớn, ngược lại dữ liệu trong phương pháp học không có giám cần ít dữ liệu
Trong học có giám sát dữ liệu không cần nhãn, ngược lại dữ liệu trong phương pháp học không có giám cần gián nhãn
Trong học có giám sát ứng dụng cho các bài toán AI, ngược lại phương pháp học không có giám ứng dụng trong các bài toán gợi ý sản phẩm
Trong học có giám sát dữ liệu cần gián nhãn, ngược lại dữ liệu trong phương pháp học không có giám không cần gián nhãn
Dữ liệu nào không thuộc loại dữ liệu không có cấu trúc?
Tệp văn bản
Đoạn phim
Bảng tính Excel
Tất cả các loại trên
Hình ảnh số
Ví dụ về dữ liệu có cấu trúc là gì?
Tập tin văn bản
Đoạn phim
Hình ảnh số
Bảng tính Excel
Từ mô hình dự đoán giá nhà như sau: giaˊ_nhaˋ=a×diện_tıˊch+b . Quá trình tối ưu của hàm mất mát sẽ được thực hiện bằng phương pháp Gradient descent (suy giảm độ dốc). Nếu quá trình tối ưu bắt đầu bằng dự đoán a=0.0 và b=0.0 , đạo hàm của hàm loss ở theo a và b tại 2 giá trị ban đầu này là −22.11 và 11.22 . Hỏi sau 1 bước tối ưu, với tốc độ học là 0.1 , giá trị mới của a và b là bao nhiêu?
a=2.211, b=−1.122
a=−22.11, b=11.22
a=−2.211, b=1.122
a=1.122, b=−2.211
Từ mô hình đoán giá tình hình kinh tế Việt Nam: thu_nhập=a×khoˆˊi_lượng_haˋng_xuaˆˊt_khẩu+b . Quá trình tối ưu của hàm mất mát sẽ được thực hiện bằng phương pháp Gradient descent. Nếu quá trình tối ưu bắt đầu bằng dự đoán a=0.0 và b=0.0 , đạo hàm của hàm loss ở theo a và b tại 2 giá trị ban đầu này là 32.11 và −12.11 . Hỏi sau 1 bước tối ưu, với tốc độ học là 0.1 , giá trị mới của a và b là bao nhiêu?
a=−1.211, b=3.211
a=3.211, b=−1.211
a=−3.211, b=1.211
a=−3.011, b=1.211
Giá trị R2 trong mô hình hồi quy tuyến tính biểu thị điều gì?
Độ dốc của đường hồi quy
Mức độ phù hợp của mô hình
Sai số chuẩn của ước lượng
Giá trị trung bình của biến độc lập
Điều kiện nào sau đây là cần thiết để mô hình hồi quy tuyến tính đơn giản hoạt động tốt?
Biến phụ thuộc phải là biến nhị phân
Mối quan hệ tuyến tính giữa biến độc lập và biến phụ thuộc
Phân phối chuẩn của các biến độc lập
Các biến độc lập không tương quan với nhau
Hồi quy tuyến tính đơn giản nhằm mục đích dự đoán giá trị của biến nào?
Biến phụ thuộc
Biến độc lập
Biến số dư
Biến dự đoán
Độ đo nào sau đây không phải là độ đo đánh giá mô hình hồi quy tuyến tính?
Precision
Mean Squared Error (MSE)
R-squared
Mean Absolute Error (MAE)
Hệ số β1 trong phương trình hồi quy tuyến tính y=β0+β1x+ε biểu thị điều gì?
Sai số ngẫu nhiên
Giá trị của biến độc lập
Độ dốc của đường hồi quy
Giá trị kỳ vọng của y
Hồi quy logistic và hồi quy tuyến tính khác nhau như thế nào?
Tất cả các phương án trên
Hồi quy logistic sử dụng hàm sigmoid để tính toán đầu ra, trong khi hồi quy tuyến tính không sử dụng hàm sigmoid
Hồi quy logistic được dùng cho bài toán phân loại, trong khi hồi quy tuyến tính được sử dụng cho bài toán dự báo giá trị
Hồi quy logistic có đầu ra dạng xác suất, trong khi hồi quy tuyến tính có đầu ra là giá trị liên tục
Các đặc trưng (features) trong bài toán phân loại được sử dụng để làm gì?
Để biểu diễn dữ liệu vào mô hình
Để xác định đầu ra của mô hình
Để tối ưu hàm mất mát
Để tính toán hàm mất mát
Hồi quy logistic có thể sử dụng các phương pháp tối ưu hóa nào để tìm nghiệm gần đúng?
Tất cả các phương pháp trên
Mini-batch gradient descent
Stochastic gradient descent
Gradient descent
Trong bài toán phân loại, hàm sigmoid được sử dụng để làm gì?
Chuyển đổi đầu ra thành xác suất
Tính toán hàm mất mát
Tối ưu hàm mất mát
Chuyển đổi đầu vào thành xác suất
Hồi quy logistic được sử dụng để giải quyết bài toán gì?
Bài toán phân loại
Bài toán hồi quy
Bài toán dự báo
Bài toán tối ưu hóa
Trong hình cây quyết định cho trước, node A là loại node gì?
Node root (node gốc)
Node decision (node quyết định)
Node leaf (node lá)
Node thuộc tính trung gian
Trong hình cây quyết định cho trước, node B là loại node gì?
Node root (node gốc)
Node decision (node quyết định)
Node leaf (node lá)
Node thuộc tính trung gian
Trong hình cây quyết định cho trước, node K là loại node gì?
Node root (node gốc)
Node decision (node quyết định)
Node leaf (node lá)
Node thuộc tính trung gian
Điều nào sau đây không phải là một metric phân loại?
Mean Squared Error
Precision
Recall
F1 score
Một mô hình phân loại xe có kết quả ma trận nhầm lẫn như sau: hàng là giá trị thực (ô tô, xe máy), cột là dự đoán (ô tô, xe máy). Ô tô dự đoán đúng 50, ô tô dự đoán nhầm sang xe máy 10; xe máy dự đoán nhầm sang ô tô 5, xe máy dự đoán đúng 35. Độ chính xác (accuracy) của mô hình là bao nhiêu?
0.85
0.90
0.75
0.95
Với cùng ma trận nhầm lẫn: Ô tô dự đoán đúng 50, dự đoán nhầm sang xe máy 10; xe máy dự đoán nhầm sang ô tô 5, dự đoán đúng 35. Độ chuẩn xác (precision) cho lớp Ô tô là bao nhiêu?
0.90
0.75
0.80
0.85
Với cùng ma trận nhầm lẫn: Ô tô dự đoán đúng 50, dự đoán nhầm sang xe máy 10; xe máy dự đoán nhầm sang ô tô 5, dự đoán đúng 35. Độ phủ (recall) cho lớp Ô tô là bao nhiêu?
0.83
0.85
0.90
0.75
Từ mô hình dự đoán giá nhà: giá_nhà = a*diện_tích + b. Quá trình tối ưu của hàm mất mát thực hiện bằng phương pháp Gradient descent. Bắt đầu với a=0.0 và b=0.0 , đạo hàm của hàm loss theo a và b tại giá trị ban đầu lần lượt là −22.11 và 11.22 . Với tốc độ học 0.1 , sau 1 bước tối ưu, giá trị mới của a và b là bao nhiêu?
a = 2.211, b = -1.122
a = -22.11, b = 11.22
a = -2.211, b = 1.122
a = 1.122, b = -2.211
Theo mô tả quy trình, những bước nào là một phần của việc tìm các thông số a và b cho mô hình giá_nhà = a*diện_tích + b? (chọn nhiều đáp án)
Thu thập dữ liệu diện tích nhà và giá nhà cho rất nhiều mẫu khác nhau
Chia tập mẫu dữ liệu trên thành tập huấn luyện và test theo tỷ lệ 80%:20%
Định nghĩa hàm mất mát (loss) theo a và b dựa trên các số liệu huấn luyện
Tối ưu hàm mất mát và xác định a và b ứng giá trị làm hàm mất mát cực tiểu
Đánh giá mô hình dựa trên tập mẫu test
Từ mô hình dự đoán thu nhập kinh tế Việt Nam: thu_nhập = a*khoi_luong_hang_xuat_khau + b. Quá trình tối ưu dùng Gradient descent. Bắt đầu với a=0.0 và b=0.0 , đạo hàm của hàm loss theo a và b tại giá trị ban đầu lần lượt là 32.11 và −12.11 . Với tốc độ học 0.1 , sau 1 bước tối ưu, giá trị mới của a và b là bao nhiêu?
a = -3.211, b = 1.211
a = 2.211, b = -1.211
a = -3.011, b = 1.211
a = -1.211, b = 3.211
Giá trị R2 trong mô hình hồi quy tuyến tính biểu thị điều gì?
Mối quan hệ tuyến tính giữa biến độc lập và biến phụ thuộc
Phân phối chuẩn của các biến độc lập
Các biến độc lập không tương quan với nhau
Biến phụ thuộc phải là biến nhị phân
Hệ số β1 trong phương trình hồi quy tuyến tính y=β0+β1x+e biểu thị điều gì?
Độ dốc của đường hồi quy
Giá trị kỳ vọng của y
Sai số ngẫu nhiên
Giá trị của biến độc lập
Mục tiêu của khoa học dữ liệu là gì?
Nghiên cứu để lưu trữ và quản lý dữ liệu
Tất cả các đáp án đều đúng
Để trực quan hóa dữ liệu và xây dựng báo cáo
Nghiên cứu để trích xuất các giá trị ẩn trong dữ liệu phục vụ việc đưa ra quyết định để giải quyết một bài toán nghiệp vụ nào đó
Phần mềm nào sau đây KHÔNG phải là công cụ chính của khoa học dữ liệu?
Các phần mềm xử lý bảng tính (spreadsheet – Excel)
Ngôn ngữ lập trình R
Ngôn ngữ lập trình Python
Microsoft Word
Định nghĩa của khoa học dữ liệu là gì?
Là lĩnh vực nghiên cứu liên ngành kết hợp toán thống kê khoa học dữ liệu và một số kiến thức chuyên môn sâu của dữ liệu để tìm kiếm các quy luật từ các tập dữ liệu
Là việc sử dụng các mô hình thống kê để phân tích dữ liệu
Là quá trình thu thập lưu trữ và quản lý dữ liệu
Là việc tạo ra các biểu đồ trực quan hóa dữ liệu để trình bày các quy luật trong dữ liệu
Vai trò của nhà khoa học dữ liệu là gì?
Xây dựng các mô hình bảo mật và thuật toán
Xây dựng các phương thức trao đổi thông tin tóm tắt bản chất của dữ liệu với các bên liên quan
Tất cả các phương án khác
Thu thập và làm sạch dữ liệu
Mục đích chính trong công việc của các nhà khoa học dữ liệu là gì?
Cải tiến quá trình xây dựng các quyết định trong kinh doanh
Tất cả các phương án khác
Hỗ trợ các nghiên cứu khoa học
Cung cấp các gợi ý cho việc phát triển sản phẩm và dịch vụ mới
Các kỹ năng cần có để thực thi một nhà phân tích dữ liệu cần có?
Kỹ năng lập trình
Kỹ năng phân tích thống kê dữ liệu
Tất cả các kỹ năng được liệt kê
Kỹ năng giao tiếp và trình bày
Một đặc trưng của các mẫu (đối tượng) trong tập dữ liệu là gì?
Là một hàng trong bảng dữ liệu
Là một thuộc tính của các mẫu trong dữ liệu
Là một đối tượng trong tập dữ liệu
Là một tập hợp các đối tượng được nghiên cứu
Phát biểu nào sau đây là KHÔNG chính xác?
Giá trị trung bình của một tập dữ liệu luôn nhỏ hơn giá trị lớn nhất
Phương sai là đại lượng đặc trưng cho độ phân tán của tập dữ liệu
Phương sai là đại lượng đo lường dữ liệu
Giá trị trung bình của một tập dữ liệu luôn lớn hơn giá trị nhỏ nhất
Đại lượng nào sau đây không được coi là đặc trưng thống kê về cân nặng của một đàn gà trong một doanh trại?
Giá trị trung vị (median)
Phương sai (Variance)
Giá trị trung bình (Mean)
Tên người chủ trại
Cho tập dữ liệu X=[x1 x2 … xm] biểu thức tính giá trị trung bình của tập dữ liệu là?
m+1x1+x2+…+xm
m−1x1+x2+…+xm
mx1+x2+…+xm
2mx1+x2+…+xm
Công cụ nào sau đây KHÔNG được dùng để biểu diễn trực quan hóa dữ liệu?
Scatter plot
Bar plot
Các mô hình hồi quy tuyến tính (linear regression)
Box plot
Cho histogram của dữ liệu về tuổi của khách hàng như sau: Hỏi trong tập dữ liệu trên tuổi nhỏ nhất và lớn nhất của khách hàng là bao nhiêu?
0 – 10 và 41 – 50
0 và 80
41 và 50
0 và 50
Giá trị trung vị là gì?
Là đại lượng chia đôi tập dữ liệu
Là trung bình cộng của tập dữ liệu
Là giá trị có tần suất xuất hiện nhiều nhất
Là giá trị trung bình của tập dữ liệu
