wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Ôn tập trí tuệ nhân tạo 3

Total questions: 154

Worksheet time: 4hrs 52mins

Name
Class
Date
1.

Đáp án đầy đủ nhất khi nói về khía cạnh chính của khoa học dữ liệu?

a)

Tiền sử lí dữ liệu

b)

Phân tích dữ liệu

c)

Tất cả các lựa chọn còn lại

d)

Thu thập dữ liệu

2.

Đại lượng nào sau đây KHÔNG được coi là đặc trưng thống kê về cân nặng của gà trong một trang trại?

a)

Giá trị trung vị (median)

b)

Giá trị trung bình (mean)

c)

Phương sai (Variance)

d)

Tên chủ trang trại

3.

Mục đích của trực quan trong dữ liệu trong khoa học dữ liệu là gì?

a)

Để chuẩn bị dữ liệu cho việc xây dựng các thuật toán học máy

b)

Để tìm kiếm các quy luật trong dữ liệu

c)

Để làm sạch và xử lí dữ liệu

d)

Để thực hiện việc trình bày thông tin bằng ngôn ngữ hình ảnh phục vụ việc trao đổi thông điệp và dữ liệu với các bên liên quan.

4.

Giá trị độ lệch chuẩn (std) của tập dữ liệu trên là?

a)

0.712

b)

0.127

c)

-0.127

d)

0.712

5.

Giá trị độ lệch chuẩn (std) của tập dữ liệu trên là?

a)

0.712

b)

0.127

c)

-0.127

d)

0.712

6.

Việc chuẩn hoá dữ liệu là gì?

a)

Là quá trình biến đổi dữ liệu theo phân phối Gaussian

b)

Là quá trình biến đổi dữ liệu sang một định dạng(format) chuẩn

c)

Là quá trình loại bỏ những điểm những dữ liệu bất thường

d)

Là quá trình thay đổi lại thang đo của các đại lượng trong tập dữ liệu để dùng trong học máy

7.

Giá trị trung vị (median) của tập dữ liệu trên là?

a)

-0.044

b)

-0.030

c)

-0.205

d)

-0.314

8.

Giá trị trung vị(median) của tập dữ liệu trên là?

a)

-0.426

b)

-0.207

c)

0.428

d)

-0.276

9.

Một hãng oto muốn nghiên cứu khả năng mua một loại xe mới của khách hàng, đối tượng nghiên cứu phù hợp nhất là:

a)

Tất cả các công nhân Việt Nam

b)

Những người trưởng thành có độ tuổ từ 18 đến 60

c)

Tất cả người dân sông tại TPHCM

d)

Tất cả những người dân sống tại TP HN

10.

Giá trị trung bình của tập dữ liệu trên là

a)

1.095

b)

-1.095

c)

-0.995

d)

2.092

11.

Mệnh đề nào sau đây ĐÚNG trong các mệnh đề sau:

a)

Trí tuệ nhân tạo là khả năng thích nghi của các loài động vật

b)

Trí tuệ nhân tạo là khả năng của con người có thể xây dựng các chương trình máy tính có thể học.

c)

Trí tuệ nhân tạo có thể được xem như một chương trình máy tính có thể khái quát hoá tri thức từ dữ liệu để thực hiện một chức năng nào đó giống con người.

d)

Trí tuệ nhân tạo là trí tuệ tự nhiên của con người.

12.

Biểu đồ tần suất(histogram) là gì?

a)

Là biểu đồ thể hiên sự phân phối của các điểm

b)

Là biểu đồ thể hiện tần suất xuất hiện của các điểm dữ liệu

c)

Là biểu đồ thể hiện giá trị trung bình của tập dữ liệu

d)

Là biểu đồ thể hiện mối quan hệ giữa các biến

13.

Giá trị trung bình của tập dữ liệu trên là?

a)

0.653

b)

-0.365

c)

0.365

d)

-0.635

14.

Cho tập dữ liệu sau: X=[-0.703, -0.344,-0.669, -0.636,-0.913] Giá trị trung bình của tập dữ liệu trên là?

a)

0.653

b)

-0.365

c)

0.365

d)

-0.635

15.

Cho tập dữ liệu sau: X=[-1.217, -2.059, -0.868, -0.341, -1.237] giá trị trung bình

a)

-0.615

b)

-0.651

c)

0.615

d)

-1.1444

16.

Phát biêu nào sau đây không chính xác

a)

Giá trị trung bình của một tập dữ liệu luôn lớn hơn giá trị nhỏ nhất

b)

Phương sai là đại lượng đặc trưng cho độ phân tán của tập dữ liệu

c)

Giá trị trung bình của một tập dữ liệu luôn nhỏ hơn giá trị lớn nhất

d)

Phương sai là đại lượng đo lường dữ liệu

17.

Đặc trưng thuộc tính của dữ liệu là gì

a)

Vector có số thành phần bằng tổng số điểm dữ liệu và số thuộc tính

b)

Là số đối tượng nghiên cứu trong tập dữ liệu

c)

Vector trong không gian 3 chiều

d)

Là tập hợp các thuộc tính của các đối tượng nghiên cứu

18.

Một tập dữ liệu là gì

a)

Tập hợp các thuật toán

b)

Tập hợp các công cụ để lưu trữ dữ liệu

c)

Tập hợp các mô hình toán học

d)

Tập hợp thông tin nguyên thuỷ của các đối tượng thoả mãn một điều kiện nghiên

19.

Một tập dữ liệu thường được coi là một bảng, trong đó:

a)

Số hàng bằng số điểm dữ liệu, số cột là số thuộc tính của các đối tượng dữ liệu

b)

Số hàng luôn bằng số cột và bằng số điểm dữ liệu

c)

Số hàng bằng số điểm dữ liệu , số cột là một đặc trưng(thuộc tính) của các điểm dữ liệu.

d)

Số hàng bằng số cột

20.

Để nghiên cứu khả năng mua hàng của một khách hàng thì các đặc trưng nào về khách hàng là phù hợp với đối tượng nghiên cứu?

a)

Tuổi, giới tính, thu nhập, địa chỉ, nghề nghiệp

b)

Địa chỉ, địa chỉ email, chiều cao, cân nặng

c)

Địa chỉ, số điện thoại, nhóm máu, nghề nghiệp

d)

Địa chỉ email, tên, giới tính, nhóm máu.

21.

Giá trị độ lệch chuẩn (std) của tập dữ liệu trên là

a)

-0.615

b)

-0.651

c)

0.615

d)

0.561

22.

Giá trị độ lệch chuẩn của tập dữ liệu

a)

0.712

b)

0.127

c)

-0.127

d)

0.712

23.

Mục đích chính của khoa học dữ liệu là gì

a)

Nghiên cứu để trích xuất các giá trị ấn trong dữ liệu phục vụ việc đưa ra các quyết định để giải quyết một bài toán nghiệp vụ nào đó.

b)

Tất cả các đáp án khác đều đúng

c)

Nghiên cứu để lưu trữ và quản lí dữ liệu

d)

Để trực quan hoá dữ liệu và xây dựng báo cáo

24.

Phần mềm nào sau đây Không phải là công cụ chính của khoa học dữ liệu?

a)

Ngôn ngữ lập trình R

b)

Các phần mềm xử lý bảng tính (spreadsheet – Excel)

c)

Microsoft Word

d)

Ngôn ngữ lập trình Python

25.

Định nghĩa của khoa học dữ liệu là gì

a)

Là việc sử dụng các mô hình thống kê để phân tích dữ liệu

b)

Là quá trình thu thập lưu trữ và quản lý dữ liệu

c)

Là lĩnh vực nghiên cứu

26.

Định nghĩa của khoa học dữ liệu là gì

a)

Là việc sử dụng các mô hình thống kê để phân tích dữ liệu

b)

Là quá trình thu thập lưu trữ và quản lý dữ liệu

c)

Là lĩnh vực nghiên cứu liên ngành kết hợp toán thống kê khoa học dữ liệu và một số kiến thức chuyên môn sâu của dữ liệu để tìm kiếm các quy luật từ các tập dữ liệu.

d)

Là việc tạo ra các biểu đồ trực quan hoá dữ liệu để trình bày các quy luật trong dữ liệu .

27.

Vai trò của nhà khoa học dữ liệu là gì?

a)

Xây dựng các mô hình dự báo và thuật toán

b)

Tất cả các phương án khác

c)

Thu thập và làm sạch dữ liệu

d)

Xây dựng các phương thức trao đổi thông tin tóm tắt bản chất của dữ liệu liên quan

28.

Mục đích chính trong công việc của các nhà khoa học dữ liệu là gì?

a)

Cung cấp các gợi ý cho việc phát triển sản phẩm và dịch vụ mới

b)

Cải tiến quá trình xây dựng các quyết định trong kinh doanh

c)

Tất cả các phương pháp nghiên cứu

d)

Hỗ trợ các nghiên cứu khoa học

29.

Các kĩ năng cần có để thực thi một nhà phân tích dữ liệu cần có?

a)

Kỹ năng phân tích thống kê dữ liệu

b)

Kỹ năng lập trình

c)

Kỹ năng giao tiếp và trình bày

d)

Tất cả các kĩ năng được liệt kê

30.

Các hàng trong một bảng dữ liệu thường chứa các thông tin gì?

a)

Là một tập con thuộc các thuộc tính của một dữ liệu

b)

Là một tập con của các trường thông tin

c)

Là một trường thông tin chứa giá trị của một thuộc tính của các mẫu (đối tượng) dữ liệu

d)

Là các mẫu (đối tượng) trong tập dữ liệu

31.

Một đặc trưng của các mẫu (đối tượng) trong tập dữ liệu là gì?

a)

Là một thuộc tính của các mẫu dữ liệu

b)

Là một đối tượng trong tập dữ liệu

c)

Là một hàng trong bảng dữ liệu

d)

Là một tập hợp các đối tượng được nghiên cứu

32.

Phát biểu nào sau đây là KHÔNG chính xác?

a)

Giá trị trung bình của một tập dữ liệu luôn lớn giá trị nhỏ nhất

b)

Phương sai là đại lượng đặc trưng cho độ ph

33.

Câu 37. Phát biểu nào sau đây là KHÔNG chính xác?

a)

A.Giá trị trung bình của một tập dữ liệu luôn lớn giá trị nhỏ nhất

b)

B.Phương sai là đại lượng đặc trưng cho độ phân tán của tập dữ liệu

c)

C.Giá trị trung bình của một tập dữ liệu luôn nhỏ hơn giá trị lớn nhất

d)

D.Phương sai là đại lượng đo lường dữ liệu

34.

Câu 38. Đại lượng nào sau đây KHÔNG được coi là đặc trưng thống kê về cân nặng của đàn gà trong một trang trại?

a)

A.Giá trị trung vị

b)

B.Phương sai

c)

C.Giá trị trung bình

d)

D.Tên người chủ trại

35.

Câu 39. Công cụ nào sau đây không dùng để biểu diễn trực quan hoá dữ liệu?

a)

A.Các mô hình hồi qui tuyến tính

b)

B.Box plot

c)

C.Bar plot

d)

D.Scatter plot

36.

Câu 40. Đại lượng trung vị là gì?

a)

A.Là đại lượng chia đôi tập dữ liệu

b)

B.Là trung bình cộng của tập dữ liệu

c)

C.Là giá trị có tần suất xuất hiện nhiều nhất

d)

D.Là giá trị trung bình của tập dữ liệu

37.

Câu 41. Một tập dữ liệu là gì?

a)

A.Tập các thuật toán

b)

B.Tập hợp thông tin nguyên thuỷ của các đối tượng thoả mãn một điều kiện nghiên cứu nào đó

c)

C.Tập hợp các công cụ để lưu trữ dữ liệu

d)

D.Tập hợp các mô hình toán học

38.

Câu 42. Bước đầu tiên trong một quá trình làm khoa học dữ liệu

a)

A.Phân tích dữ liệu

b)

B.Trực quan hoá dữ liệu

c)

C.Làm sạch dữ liệu

d)

D.Thu thập dữ liệu

39.

Câu 43. Mục tiêu chính của việc làm sạch dữ liệu là gì?

a)

A.Để loại bỏ những điểm dữ liệu bị thiếu và không phù hợp

b)

B.Để bảo đảm tính chính xác và tương thích của dữ liệu

c)

C.Cả 2 đáp án trên

40.

Câu 44. Một tập dữ liệu được coi là môt bảng:

a)

A.Số hàng bằng số điểm dữ liệu số cột là một đặc trưng (thuộc tính) của điểm dữ liệu

b)

B.Số hàng bằng số cột

c)

C.Số hàng luôn bằng số cột và bằng số điểm dữ liệu

d)

D.Số hàng bằng số mẫu (đối tượng) của tập dữ liệu số cột là số thuộc tính của các mẫu (đối tượng) dữ liệu

41.

Câu 45. Chương trình máy tính nào sau đây KHÔNG được coi là một ứng dụng của trí tuệ nhân tạo ?

(a)  

42.

Chương trình máy tính nào sau đây KHÔNG được coi là một ứng dụng của trí tuệ nhân tạo ?

a)

Chương trình điều khiển xe tự lái

b)

Chương trình quản lý sinh viên

c)

Chương trình gợi ý các sản phẩm hoặc dịch vụ cho khách hàng

d)

Chương trình nhận diện khuôn mặt

43.

Đặc trưng thuộc tính của tập dữ liệu là gì?

a)

Là tập hợp các thuộc tính (giá trị thuộc tính) của các đối tượng nghiên cứu

b)

Chính là số đối tượng nghiên cứu trong tập dữ liệu

c)

Vector có số thành phần bằng tổng số điểm dữ liệu và số thuộc tính

d)

Vector trong không gian 3 chiều

44.

Mệnh đề nào sau đây ĐÚNG?

a)

Trí tuệ nhân tạo là trí tuệ của con người

b)

Trí tuệ nhân tạo là khả năng thích nghi của các loài động vật

c)

Trí nhân tạo có thể được xem như một chương trình máy tính có thể khái quát hoá tri thức từ dữ liệu để thực hiện một chức năng nào đó giống như một chuyên gia trong lĩnh vực đó.

d)

Trí tuệ nhân tạo là khả năng của con người có thể xây dựng các chương trình máy tính có thể học.

45.

Hệ số tương quan của 2 biến là gì?

a)

Là đại lượng biểu diễn mối quan hệ giữa các giá trị trung bình của hai biến được chuẩn hoá

b)

Là đại lượng biểu diễn mối quan hệ giữa các giá trị của hai biến đã được chuẩn hoá.

c)

Là đại lượng biểu diễn mối quan hệ giữa các giá trị trung bình của hai biến

d)

Là đại lượng biểu diễn mối quan hệ giữa hai biến.

46.

Chức năng của tập huấn luyện trong học máy là gì

a)

Dùng để huấn luyện mô hình

b)

Dùng để so sánh với các mô hình khác

c)

Dùng để đánh giá mô hình

d)

Dùng để kiểm tra độ chính xác của mô hình.

47.

Quá trình xây dựng một mô hình học máy thường gồm các bước nào?

a)

Tiền sử lý dữ liệu

b)

Huấn luyện mô hình

c)

Thu nhập dữ liệu

d)

Tất cả các bước trên.

48.

Trong quá trình kiểm định một mô hình học máy phần trăm dữ

4 lines
49.

Một mô hình học máy thường gồm các bước nào?

a)

Tiền sử lý dữ liệu

b)

Huấn luyện mô hình

c)

Thu nhập dữ liệu

d)

Tất cả các bước trên.

50.

Trong quá trình kiểm định một mô hình học máy phần trăm dữ liệu dành cho tập kiểm tra thường là bao nhiêu?

a)

10-20%

b)

40-50%

c)

30-40%

d)

20-30%

51.

Một mô hình hồi quy tuyến tính thường được sử dụng để làm gì?

a)

Tìm ra mối quan hệ phi tuyến tính giữa các biến

b)

Tìm ra các mẫu trong tập dữ liệu

c)

Dự đoán một biến phụ thuộc từ một hoặc nhiều biến độc lập

d)

Phân loại các điểm dữ liệu vào các nhóm khác nhau

52.

Hệ số hồi quy trong một mô hình hồi quy tuyến tính thể hiện điều gì?

a)

Mối quan hệ giữa biến phụ thuộc khi biến độc lập thay đổi

b)

Mức độ biến động của biến phụ thuộc khi biến độc lập thay đổi

c)

Giá trị trung bình của biến phụ thuộc

d)

Giá trị trung bình của biến độc lập

53.

Phát biểu nào sau đây đúng về quá trình tiền xử lí dữ liệu?

a)

Là bước không quan trọng trong quá trình làm khoa học dữ liệu

b)

Là bước cuối cùng trong quá trình làm khoa học dữ liệu

c)

Là bước đầu tiên trong quá trình làm khoa học dữ liệu

d)

Là bước có thể bỏ qua trong quá trình làm khoa học dữ liệu

54.

Mô hình hồi quy tuyến tính có thể được kiểm tra bằng cách nào?

a)

Bằng cách kiểm tra giá trị trung bình của biến phụ thuộc

b)

Bằng cách kiểm tra số tương quan giữa giá trị thực và giá trị dự đoán

c)

Bằng cách kiểm tra phương sai của các biến độc lập

d)

Bằng cách kiểm tra hệ số hồi quy của các biến độc lập

55.

Độ chính xác của một mô hình học máy tính là gì?

a)

Độ lệch chuẩn của các giá trị dự đoán

b)

Tỷ lệ phần trăm các dự đoán đúng so với tổng số dự đoán

c)

Tỷ lệ phần trăm các dự đoán so với tổng số dự đoán

d)

Sai số trung bình giữa các giá trị thực và giá trị dự đoán.

56.

Phương pháp nào sau đây được sử dụng để kiểm định độ chính xác của một mô hình học máy?

4 lines
57.

Phương pháp nào sau đây được sử dụng để kiểm định độ chính xác của một mô hình học máy?

a)

A.K-fold validation

b)

B.Tất cả các phương pháp trên

c)

C.Holdout validation

d)

D.Cross-validation

58.

Với mô hình: y = 2x + 3 Hệ số góc là số nào?

a)

A.2

b)

B.3

c)

C.4

d)

D.5

59.

MAE là gì?

a)

A.Giá trị trung bình của absolute error

b)

B.Bình phương của error

c)

C.Căn bậc 2 của lỗi

d)

D.Không có phương án trả lời đúng

60.

TÍnh phương sai chuỗi số: 7, 3, 9, 2, 8, 6

a)

A.0

b)

B.6.75

c)

C.6.5

d)

D.6.47

61.

Mục tiêu chính của Data Science là gì?

a)

A.Tạo ra các mô hình 3D chân thực

b)

B.Thiết kế các trang web hấp dẫn

c)

C.Khám phá các khuôn mẫu (patterns), thông tin hữu ích và đưa ra quyết định dựa trên dữ liệu

d)

D.Phát triển các ứng dụng di động

62.

Quá trình Data Science bao gồm các bước nào

a)

A.Thiết kế đồ họa, tạo hoạt ảnh

b)

B.Quảng cáo, bán hàng, tiếp thị

c)

C.Thu thập dữ liệu, làm sạch dữ liệu, phân tích dữ liệu, trực quan hóa dữ liệu

d)

D.Lập trình, gỡ lỗi, triển khai

63.

Ứng dụng của Data Science trong lĩnh vực chăm sóc sức khỏe là gì?

a)

A.Chẩn đoán bệnh, phát hiện thuốc mới, y học cá nhân hóa

b)

B.Thiết kế các công trình kiến trúc

c)

C.Phát triển trò chơi điện tử

d)

D.Tạo hiệu ứng hình ảnh cho phim

64.

Loại AI nào tập trung vào việc thực hiện các nhiệm vụ cụ thể?

a)

A.AI hẹp (Narrow AI)

b)

B.AI siêu việt (Super AI)

c)

C.AI đa nhiệm (Multitask AI)

d)

D. AI tổng quát (General AI)

65.

Phương pháp học có giám sát (supervised learning) có đặc điểm gì?

a)

A.Chỉ yêu cầu output

b)

B.Yêu cầu cả input và output label

c)

C. Chỉ yêu cầu input

d)

D.Tự học được theo thời gian

66.

Phương pháp học AI nào sau đây có đặc điểm là dễ thu thập dữ liệu huấn luyện nhất

a)

Supervised learning

b)

Reinforcement learning

c)

Unsupervised learning

67.

Công nghệ nhận diện khuôn mặt trong ứng dụng chuyển tiền ngân hàng thuộc phân loại AI nào?

a)

Generative AI

b)

Narrow AI

c)

Artificial Superintelligence

68.

Dữ liệu âm thanh thuộc loại là dữ liệu gì?

a)

Phi cấu trúc

b)

Bán cấu trúc

c)

Có cấu trúc

69.

Dữ liệu điểm danh lớp học là loại dữ liệu gì?

a)

Có cấu trúc

b)

Bán cấu trúc

c)

Phi cấu trúc

70.

Phần mềm nào sau đây ít có khả năng được sử dụng nhất trong khoa học dữ liệu?

a)

Ngôn ngữ lập trình Python

b)

Phần mềm excel

c)

Phần mềm Photoshop

d)

Ngôn ngữ lập trình C

71.

Mục đích của việc của làm khoa học dữ liệu là gì?

a)

Hỗ trợ nghiên cứu khoa học

b)

Hỗ trợ trong đưa ra quyết định trong kinh doanh

c)

Tất cả các phương án

d)

Cung cấp gợi ý cho việc phát triển sản phẩm

72.

Một mẫu trong cơ sở dữ liệu là gì?

a)

Một ô trong bảng

b)

Một hàng trong bảng

c)

Một cột trong bảng

d)

Một bảng dữ liệu

73.

Thuộc tính của mẫu dữ liệu là gì?

a)

Là hàng trong bảng

b)

Là thông tin về cột trong bảng

c)

Là ô giá trị trong bảng

d)

Là bảng dữ liệu

74.

Câu nào sau đây đúng?

a)

Hồi quy tuyến tính mô hình hóa mối quan hệ giữa 1 biến phụ thuộc và 1 hoặc nhiều biến độc lập

b)

Hồi quy tuyến tính mô hình hóa mối quan hệ giữa 1 biến phụ thuộc và 1 biến độc lập

c)

Hồi quy tuyến tính mô hình hóa mối quan hệ giữa 1 biến độc lập và nhiều biến phụ thuộc

d)

Hồi quy tuyến tính mô hình hóa mối quan hệ giữa nhiều biến phụ thuộc

75.

Logic mệnh đề là gì?

a)

Công cụ toán học logic, trong đó có các mệnh đề và các biểu thức.

b)

Tập các ký hiệu và tập các luật xây dựng công thức

76.

Câu nào dưới đây KHÔNG là một mệnh đề.

a)

An là sinh viên khoa CNTT

b)

An không phải học Trí Tuệ Nhân Tạo

c)

X là sinh viên không phải học Trí tuệ nhân tạo.

d)

An là sinh viên CNTT nhưng không phải học Trí tuệ nhân tạo.

77.

Có mấy phép kết nối logic trong mệnh đề

a)

2

b)

3

c)

4

d)

5

78.

Ai là người đề ra thuật ngữ “Trí tuệ nhân tạo”

a)

John McCarthy

b)

Alan Turing

c)

Elon Musk

d)

Bill Gates

79.

Turing test là

a)

Bài toán kiểm tra khả năng trí tuệ của máy tính

b)

Bài toán kiểm tra khả năng giải thuật

c)

Bộ câu hỏi lý thuyết về trí tuệ nhân tạo

d)

Bộ câu hỏi lý thuyết về khoa học máy tính

80.

Những mô hình tính toán có cách thức suy nghĩ giống con người được gọi là.

a)

Mô hình mạng nơ-ron

b)

Mô hình hồi quy tuyến tính

c)

Mô hình cây lí thuyết

d)

Mô hình hồi quy logistic

81.

Đâu là ứng dụng của trí tuệ nhân tạo

a)

Thị giác máy tính

b)

Xử lý ngôn ngữ tự nhiên

c)

Học máy

d)

Tất cả đáp án trên

82.

Hàm đánh giá dùng để

a)

Tính toán mức độ tốt/xấu, khả năng về đích của trạng thái

b)

Tính toán thời gian của thuật toán

c)

Tính toán độ lớn của thuật toán

d)

Tính toán sự sai lệch giữa trạng thái đầu và trạng thái đích của thuật toán

83.

Mục tiêu chính của Data Science là gì?

4 lines
84.

Dữ liệu âm thanh thuộc loại là dữ liệu gì?

4 lines
85.

Mục đích của việc của làm khoa học dữ liệu là gì?

4 lines
86.

Một mẫu trong cơ sở dữ liệu là gì?

4 lines
87.

Thuộc tính của mẫu dữ liệu là gì?

4 lines
88.

Phần mềm nào sau đây KHÔNG phải là phần mềm hay được sử dụng trong khoa học dữ liệu

4 lines
89.

Đặc trưng của dữ liệu là gì?

4 lines
90.

Phát biểu nào sau đây không đúng?

4 lines
91.

Thuộc tính của mẫu dữ liệu là gì?

4 lines
92.

Phần mềm nào sau đây KHÔNG phải là phần mềm hay được sử dụng trong khoa học dữ liệu?

4 lines
93.

Đặc trưng của dữ liệu là gì?

4 lines
94.

Phát biểu nào sau đây không đúng?

4 lines
95.

Câu nào sau đây chính xác?

4 lines
96.

Cho tập dữ liệu X: 3, 4, 2, 5. Tính giá trị trung bình của dữ liệu là?

4 lines
97.

Cho dữ liệu về số đơn hàng bán theo từng ngày, biểu đồ nào sau đây là phù hợp nhất để thể hiện sự thay đổi của đơn hàng?

4 lines
98.

Cho biểu đồ tần suất như dưới đây. Hỏi độ tuổi được khảo sát trong dữ liệu là giá trị nào?

4 lines
99.

Cho biểu đồ tần suất như dưới đây. Số lượng người nữ có độ tuổi 40 là bao nhiêu?

4 lines
100.

Giá trị trung vị có ý nghĩa gì?

4 lines
101.

Biểu đồ phân tán có đặc điểm gì?

4 lines
102.

Nếu muốn thể hiện tỷ lệ Nam/Nữ trong 1 lớp chênh lệch như thế nào thì dùng biểu đồ nào phù hợp nhất?

4 lines
103.

Biểu đồ tần suất có tên tiếng Anh là gì?

4 lines
104.

Hệ số tương quan của biểu đồ sau là gì?

4 lines
105.

Hệ số tương quan của biểu đồ sau có thể là giá trị nào sau đây?

4 lines
106.

Hệ số tương quan của biểu đồ sau có thể là bao nhiêu?

4 lines
107.

Bước đầu tiên của việc làm khoa học dữ liệu là?

4 lines
108.

Mệnh đề nào sau đây đúng?

4 lines
109.

Một hãng bia muốn khảo sát thị trường, ai có thể là đối tượng?

4 lines
110.

Làm sạch dữ liệu để làm gì?

4 lines
111.

Biểu đồ boxplot thể hiện chính các giá trị gì?

4 lines
112.

Giá trị trung bình và trung vị khác gì nhau?

4 lines
113.

Tính độ lệch chuẩn của tập dữ liệu sau: -1,317 -3,059 -2,868 -0,314 -1,437

4 lines
114.

Giá trị phương sai của tập dữ liệu sau là? 2, 3, 1, 9 , 11

4 lines
115.

Linear regression được dùng để làm gì?

4 lines
116.

Đâu là công cụ thường dùng trong phân tích dữ liệu?

4 lines
117.

Tìm giá trị trung bình của tập dữ liệu

4 lines
118.

Tìm giá trị trung vị của tập dữ liệu

4 lines
119.

Tìm hệ số a, b của hồi quy tuyến tính y= a+bx

4 lines
120.

Tìm hệ số tương quan của 2 tập dữ liệu

4 lines
121.

Tìm độ lệch chuẩn của tập dữ liệu

4 lines
122.

Tìm phương sai của tập dữ liệu

4 lines
123.

Xác định hệ số tương quan dựa trên đồ thị scatter plot

4 lines
124.

Cho dữ liệu: 2, 4, 6, 8, 10. Tính mean (trung bình)=6

4 lines
125.

Cho giá trị thực tế: [1, 3, 5, 7, 9] và giá trị dự đoán: [2, 3, 4, 8, 8]. Tính Mean Absolute Error (MAE).=4/5

4 lines
126.

Sử dụng dữ liệu từ bài 2, tính MSE và RMSE. Mse= 4/5; rmse= 2/ căn 5

4 lines
127.

Mô hình A có MAE = 2.5, MSE =

4 lines
128.

Tính Mean Absolute Error (MAE).=4/5

4 lines
129.

Sử dụng dữ liệu từ bài 2, tính MSE và RMSE.

4 lines
130.

Mô hình A có MAE = 2.5, MSE = 8.2. Mô hình B có MAE = 3.1, MSE = 7.8. Mô hình nào tốt hơn? Giải thích.

4 lines
131.

Cho dữ liệu: x = [1, 2, 3, 4, 5], y = [2, 4, 6, 8, 10]. Tìm phương trình hồi quy y=ax+by.

4 lines
132.

Cho dữ liệu: 10, 12, 11, 13, 12, 45, 11, 10. a) Tính mean và standard deviation. b) Xác định outlier (sử dụng quy tắc 2 standard deviation). c) Tính lại mean và standard deviation sau khi loại bỏ outlier.

4 lines
133.

Cho y_actual = [10, 20, 30, 40, 50] và y_predicted = [12, 18, 32, 38, 52]. Tính hệ số xác định R².

4 lines
134.

Một mô hình có R² = 0.85 trên training set và R² = 0.65 trên test set. a) Mô hình có vấn đề gì? b) Đề xuất giải pháp.

4 lines
135.

Một cửa hàng ghi nhận dữ liệu bán hàng: Nhiệt độ (°C): x=[15, 20, 25, 30, 35]=>x mean= 25. Doanh thu (triệu): y=[50, 65, 80, 95, 110]=> y mean= 80. a) Tìm phương trình hồi quy.

4 lines
136.

Tìm phương trình hồi quy.

4 lines
137.

Dự đoán doanh thu khi nhiệt độ 28°C.

4 lines
138.

Tính R².

4 lines
139.

Phân tích ưu nhược điểm của từng mô hình và đưa ra khuyến nghị.

a)

Model 1 tốt hơn

b)

Model 2 tốt hơn

c)

Model 3 tốt hơn

140.

Đánh giá chất lượng mô hình.

4 lines
141.

Mô hình nào tốt hơn và tại sao?

a)

Mô hình A tốt hơn

b)

Mô hình B tốt hơn

142.

Tính hệ số R².

4 lines
143.

Tìm mối quan hệ giữa chi phí quảng cáo (x) và doanh số (y).

4 lines
144.

Mối quan hệ giữa nhiệt độ (°C) và chi phí điện: Nhiệt độ: [-5, 0, 5, 10, 15]=> x mean=5 Chi phí điện (nghìn đồng): [200, 150, 120, 100, 90] => y mean= 132 Tìm phương trình hồi quy và tính R². Cov= -270,var= 50. A= -27/5, b= 159=> y= (-27/5)*x+159 Ssres= 0, sstot= 7880=> r bình= 1 hoàn hảo

4 lines
145.

Trong hồi quy tuyến tính đơn giản, hệ số R² (R-squared) thể hiện điều gì?

a)

Tỷ lệ phương sai của biến phụ thuộc được giải thích bởi mô hình

b)

Độ dốc của đường hồi quy

c)

Sai số trung bình của mô hình

d)

Hệ số tương quan giữa các biến độc lập

146.

Trong mô hình phân loại, accuracy được tính như thế nào?

a)

Tổng đáp án đúng / tổng dự đoán

b)

Tổng đáp án sai / tổng dự đoán

c)

Bình phương của tổng đáp án đúng / tổng dự đoán

d)

Bình phương của tổng đáp án sai / tổng dự đoán đúng

147.

Điểm khác biệt chính về kiểu dữ liệu đầu ra giữa hồi quy tuyến tính và mô hình phân loại là gì?

a)

Hồi quy cho đầu ra liên tục, phân loại cho đầu ra rời rạc

b)

Hồi quy cho đầu ra rời rạc, phân loại cho đầu ra liên tục

c)

Cả hai đều cho đầu ra liên tục

d)

Cả hai đều cho đầu ra rời rạc

148.

Khi nào bạn sẽ chọn hồi quy tuyến tính thay vì mô hình phân loại?

a)

Khi muốn dự đoán giá nhà dựa trên diện tích và vị trí

b)

Khi muốn phân loại email spam hay không spam

c)

Khi muốn nhận dạng chữ số viết tay

d)

Khi muốn phân loại khách hàng tiềm năng

149.

Phương pháp đánh giá nào KHÔNG phù hợp cho hồi quy tuyến tính nhưng quan trọng đối với mô hình phân loại?

a)

Accuracy

b)

Mean Absolute Error (MAE)

c)

Root Mean Squared Error (RMSE)

150.

Phương pháp đánh giá nào KHÔNG phù hợp cho hồi quy tuyến tính nhưng quan trọng đối với mô hình phân loại?

a)

Accuracy

b)

Mean Absolute Error (MAE)

c)

Root Mean Squared Error (RMSE)

d)

R-squared

151.

Trong trường hợp nào sau đây, việc chuyển đổi từ bài toán hồi quy sang phân loại là hợp lý?

a)

Dự đoán mức độ nhiệt độ (thấp/trung bình/cao) thay vì giá trị cụ thể

b)

Dự đoán nhiệt độ chính xác trong ngày

c)

Tính toán diện tích hình tròn từ bán kính

d)

Ước lượng thời gian di chuyển giữa hai địa điểm

152.

Nhược điểm chính của độ đo Accuracy khi đánh giá mô hình phân loại trên tập dữ liệu mất cân bằng (imbalanced dataset) là gì?

a)

Accuracy có thể cho kết quả cao nhưng không phản ánh đúng hiệu suất mô hình

b)

Accuracy không thể tính được trên dữ liệu mất cân bằng

c)

Accuracy luôn cho kết quả thấp trên dữ liệu mất cân bằng

d)

Accuracy tính toán quá phức tạp

153.

So sánh giữa MAE (Mean Absolute Error) và MSE (Mean Squared Error), điều gì đúng về độ nhạy cảm với outliers?

a)

MSE nhạy cảm hơn với outliers so với MAE

b)

MAE nhạy cảm hơn với outliers so với MSE

c)

Cả hai có độ nhạy cảm như nhau với outliers

d)

Không có sự khác biệt về outliers giữa MAE và MSE

154.

Tại sao Accuracy không phù hợp để đánh giá mô hình phát hiện bệnh hiếm (tỷ lệ mắc bệnh 1%)?

a)

Vì mô hình có thể đạt 99% accuracy chỉ bằng cách dự đoán "không mắc bệnh" cho tất cả cases

b)

Vì Accuracy không tính được trên dữ liệu y tế

c)

Vì Accuracy quá phức tạp cho bài toán y tế

d)

Vì Accuracy không phù hợp với dữ liệu số