wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

PRISEE | P | Data Science Course | Quiz tổng kết module 1

Total questions: 54

Worksheet time: 22mins

Name
Class
Date
1.

Data Science kết hợp những lĩnh vực nào?

a)

Toán học và thống kê

b)

Trí tuệ nhân tạo và máy học

c)

Xử lý đồ họa

d)

Xây dựng web

2.

Mục tiêu của Data Science là:

a)

Tìm ra thông tin và trả lời câu hỏi

b)

Lưu trữ và xử lý dữ liệu khổng lồ

c)

Khám phá tri thức, xây dựng mô hình

3.

Bạn H là một người đam mê guitar, do đó bạn thường lên youtube tìm kiếm những video hướng dẫn dạy guitar. Dần dần, trang chủ youtube của bạn tràn ngập các video về guitar, đó là nhờ ứng dụng nào của Data Science?

a)
  • Tối ưu vận hành và logistics

b)

Tối ưu Hoạt động

c)

Phát hiện gian lận

d)
  • Cải thiện trải nghiệm khách hàng

4.

Các dữ liệu nào dưới đây là dữ liệu định tính?

a)

Học lực của học sinh

b)

Điểm kiểm tra cuối kì I

c)

Bản thu âm của hai bài hát

d)

Các món ăn bán ở căn tin

5.

Các dữ liệu nào dưới đây là dữ liệu định danh?

a)

Số thành viên trong PRISEE

b)

Đánh giá hạnh kiểm của học sinh

c)

Deadline nộp xét tuyển sớm vào đại học

d)

Các món ăn bán ở căn tin

6.

Các dữ liệu nào dưới đây là dữ liệu định lượng?

a)

Trình độ học vấn

b)

Tỷ lệ đậu đại học

c)

Lượng mưa trung bình của tháng

d)

Số món ăn bán ở căn tin

7.

Các dữ liệu nào dưới đây là dữ liệu thứ bậc?

a)

Số học sinh đạt giải Nhất, Nhì, Ba kì thi HSGQG

b)

Mức độ hoàn thành công việc

c)

Xếp hạng học sinh toàn khối

d)

Các món ăn bán ở căn tin

8.

Các dữ liệu nào dưới đây là dữ liệu liên tục?

a)

Đánh giá của khách hàng

b)

Thời gian cần để hoàn thành một công việc

c)

Điểm bài kiểm tra cuối kì I môn sinh học

d)

Tốc độ gió

9.

Các dữ liệu nào dưới đây là dữ liệu rời rạc?

a)

Số người mua hàng ở tiệm X

b)

Số môn học trên trường

c)

Số mét mà một chiếc xe đi được trong 1 phút

d)

Số món ăn bán ở căn tin

10.

Nói một cách đơn giản, metadata là "dữ liệu về __ ____"

(a)  

11.

Dữ liệu nào dưới đây có thể là metadata của một file pdf?

a)

Tên file

b)

Ngày tạo file

c)

Ý kiến của người đọc về file pdf đó

d)

Kích thước của file

12.

"chuyển đổi định dạng dữ liệu" là một phần của bước nào trong quy trình xử lý dữ liệu?

a)

Diễn giải và báo cáo kết quả (Interpretation and Reporting)

b)

Trực quan hóa dữ liệu (Data Visualization)

c)

Tiền xử lý dữ liệu (Data Preprocessing)

d)

Phân tích dữ liệu (Data Analysis)

13.

 Với SQL, làm thế nào để chọn tất cả các cột từ bảng có tên "Products"?

a)

SELECT [all] FROM Products

b)

SELECT All Products

c)

SELECT *.Products

d)

SELECT * FROM Products

14.

Thuật ngữ nào dưới đây được dùng để mô tả một cơ sở dữ liệu chiếm dung lượng lưu trữ từ tính ở mức terabyte, cũng như mô tả một cơ sở dữ liệu chứa hàng tỷ hàng bảng?

a)

Very Large Database

b)

Cold Fusion

c)

Holographic storage

d)

Big Data

15.

Câu lệnh SQL nào được sử dụng để lọc kết quả của một phép GROUP BY?

a)

FILTER BY

b)

HAVING

c)

WHERE

d)

GROUP WHERE

16.

Tableau có thể đọc được loại dữ liệu nào ?

a)

Word

b)

PDF

c)

Excel

d)

ipynb

17.

Tại sao cần sử dụng chỉ mục (INDEX) trong SQL?

a)

Để lưu trữ dữ liệu một cách an toàn hơn

b)

Để giảm dung lượng lưu trữ của cơ sở dữ liệu

c)

Để tăng tốc độ tìm kiếm và truy vấn dữ liệu

d)

Để ngăn chặn các lỗi xảy ra khi nhập dữ liệu

18.

Dùng chức năng nào của Tableau để thể hiện 10 căn hộ đắt đỏ nhất trong tập dữ liệu ?

a)

Sort and Filter

b)

Rank and Sort

c)

Filter and Rank

d)

Sort; Filter; Rank

19.

Chức năng của “Actions” trong Tableau dùng để làm gì ?

a)

Lọc dữ liệu

b)

Tương tác với nhiều Worksheets

c)

Thực thi truy vấn SQL trực tiếp

d)

Thực thi mô phỏng toán học phức tạp

20.

Thuật ngữ “Data Blending” có nghĩa là gì ?

a)

So sánh trực tiếp 2 tập dữ liệu khác nhau

b)

Một phương pháp để ghép dữ liệu khi có nhiều nguồn dữ liệu

c)

Gộp nhiều nguồn dữ liệu vào thành bảng duy nhất

d)

 Tự động làm sạch và chuyển đổi thô trước khi trực quan hóa

21.

Trực quan hóa dữ liệu trong Tableau là gì ?

a)

Trình bày dữ liệu dưới dạng hình ảnh, đồ thị hoặc bản đồ

b)

Tạo Dashboard tương tác để khám phá dữ liệu một cách linh hoạt

c)

Xây dựng mô hình Machine Learning trong Tableau

d)

Tự động phát hiện và sửa chữa lỗi trước khi hiển thị

22.

Làm sao để tìm ra được từ khóa trong một trường văn bản ( Textfield ) trong Tableau ?

a)

Dùng thực lực của mắt và sự kiên nhẫn

b)

Nhờ ChatGPT hoàn thành công việc

c)

Ctrl+ F

d)

Tạo bộ lọc ( Filter) và sử dụng tìm kiếm ký tự đại diện

23.

Trong Tableau khi dữ liệu của bạn không được rõ ràng, bạn xử lý như thế nào?

a)

Thêm dữ liệu ngẫu nhiên vào các ô

b)

Sử dụng các công cụ bên ngoài mà không cần kết nối lại với Tableau.

c)

Sử dụng tính năng Data Interpreter

d)

Dùng sức lực để xử lí thủ công

24.

Mục đích của thư viện math trong Python là gì?

a)

Hỗ trợ vẽ đồ thị.

b)

Xử lý các phép toán học.

c)

Làm việc với file.

d)

Quản lý cơ sở dữ liệu.

25.

Kí hiệu nào dùng để xác định các khối lệnh (khối lệnh của hàm, vòng lặp,...) trong Python?

a)

Dấu ngoặc nhọn { }

b)

Dấu ngoặc vuông [ ]

c)

Thụt lề

d)

Dấu ngoặc đơn ( )

26.

Khẳng định nào là đúng về chú thích trong Python?

a)

Chú thích giúp cho các lập trình viên hiểu rõ hơn về chương trình.

b)

Trình thông dịch Python sẽ bỏ qua những chú thích.

c)

Có thể viết chú thích trên cùng một dòng với lệnh/biểu thức hoặc viết trên nhiều dòng mà không vấn đề gì cả.

d)

Tất cả các đáp án trên.

27.

Đâu là quy tắc đúng khi đặt tên cho biến trong Python?

a)

Tên biến có thể bắt đầu bằng dấu gạch dưới " _ ".

b)

Có thể sử dụng keyword làm tên biến.

c)

Tên biến có thể bắt đầu bằng một chữ số.

d)

Tên biến có thể có các ký hiệu như !, @, #, $, %, ...

28.

n trong đoạn sau là kiểu dữ liệu nào? n = '5'

a)

integer

b)

string

c)

tuple

d)

operator

29.

Khẳng định nào sau đây là đúng?

a)

Lớp (class) là một kế hoạch chi tiết cho đối tượng.

b)

Chỉ có thể tạo một đối tượng duy nhất từ lớp đã cho.

c)

Cả hai đáp án trên đều đúng.

d)

Không có đáp án chính xác.

30.

Đâu là kết quả của đoạn code dưới đây?

class Foo:  

    def printLine(self, line = 'Python'):  

        print(line)  

o1 = Foo()  

o1.printLine('Java')


a)

Python

b)

line

c)

Java

d)

Java Python

31.

Câu nào dưới đây dùng để mở file data.txt trong chế độ đọc?

a)

open('data.txt', 'r')

b)

open('data.txt', 'w')

c)

open('data.txt', 'a')

d)

open('data.txt', 'x')

32.

AI là gì?

a)

Một loại phần cứng máy tính

b)

Hệ thống điều hành máy tính

c)

Trí tuệ nhân tạo mô phỏng khả năng tư duy của con người

d)

Một loại phần mềm văn phòng

33.

Mô tả quá trình sử dụng AI

a)

Cài đặt xong là sử dụng được ngay

b)

Thu thập dữ liệu → huấn luyện mô hình → đánh giá → sử dụng

c)

Lập trình bằng tay toàn bộ quy trình quyết định

d)

Chạy mô hình AI bằng cách mở tệp Word


34.

Đâu là những thông số dùng để đánh giá AI?

a)

Tên mô hình, hãng phát triển, giá tiền

b)

Độ chính xác, F1-score, MAE, MSE

c)

Tốc độ Wi-Fi, tốc độ gõ phím

d)

Dung lượng pin và hệ điều hành

35.

MAE có công thức tính như thế nào?

a)

Trung bình cộng các giá trị dự đoán

b)

(Dự đoán + Thực tế) / 2

c)

Trung bình bình phương sai số

d)

Trung bình giá trị tuyệt đối của sai số giữa dự đoán và thực tế


36.

Đâu là những ưu điểm của MAE?

a)

Dễ bị ảnh hưởng bởi giá trị ngoại lai

b)

Tính toán phức tạp

c)

Dễ hiểu, đơn giản, phản ánh sai số trung bình rõ ràng

d)

 Chỉ dùng được cho dữ liệu phân loại


37.

 MSE cho biết điều gì về độ hiệu quả của mô hình?

a)

Tốc độ xử lý dữ liệu của mô hình

b)

 Mức độ sai số trung bình bình phương giữa dự đoán và thực tế

c)

Số lớp trong mô hình

d)

Số lượng tham số cần huấn luyện


38.

Công thức tính MSE là gì?

a)

Trung bình cộng của tất cả sai số

b)

Trung bình của giá trị tuyệt đối sai số

c)

Trung bình của bình phương sai số giữa dự đoán và thực tế

d)

Tổng số điểm đúng chia cho tổng mẫu


39.

Điều khác nhau giữa MAE và MSE là gì?

a)

MAE bình phương sai số, MSE thì không

b)

MAE chia cho số mẫu, MSE không chia

c)

MAE dùng giá trị tuyệt đối, MSE dùng bình phương sai số

d)

 Không có sự khác biệt


40.

 MCE dùng để đánh giá gì của mô hình?

a)

Sai số tuyệt đối trung bình

b)

Tỷ lệ dự đoán sai trong mô hình phân loại

c)

Độ chênh lệch giữa hai mô hình

d)

Mức độ lặp lại của mô hình


41.

 Công thức để tính MCE là gì?

a)

Tổng các sai số chia cho số lượng mẫu

b)

Số lần dự đoán đúng chia tổng mẫu

c)

 Số lượng dự đoán sai chia cho tổng số mẫu

d)

Tổng độ lệch chia tổng lớp


42.

Công thức để tính CE là gì?

a)

|Thực tế - Dự đoán|

b)

Trung bình bình phương sai số

c)

 -∑(y * log(p)) với y là nhãn thực, p là xác suất dự đoán

d)

Số lần sai chia cho tổng số dự đoán

43.

CE thường được sử dụng để đánh giá loại mô hình nào?

a)

Hồi quy tuyến tính

b)

Mô hình phân loại (classification)

c)

Mô hình tạo ảnh

d)

Mô hình tăng cường


44.

F1-score dùng để đánh giá tiêu chí nào của mô hình?

a)

Độ lệch chuẩn

b)

Sai số tuyệt đối

c)

Sự cân bằng giữa Precision và Recall

d)

Mức độ tổn thất


45.

Công thức để tính F1-Score là gì?

(Với: TP = True Positive, FP = False Positive, FN = False Negative)


a)

(TP + TN) / (TP + FP + FN + TN)

b)

 2 × (Precision × Recall) / (Precision + Recall)


c)

Precision - Recall


d)

TP / (TP + FP)

46.

Điện toán phân tán là gì?

a)

Một hệ thống máy tính độc lập không liên quan đến nhau

b)

Một hệ thống gồm nhiều máy tính phối hợp để xử lý cùng một tác vụ

c)

Một loại phần mềm quản lý máy chủ

d)

Hệ thống chỉ hoạt động trong một máy tính duy nhất


47.

Ưu điểm lớn nhất của hệ thống phân tán là gì?

a)

Chi phí bảo trì cao

b)

Khả năng mở rộng và xử lý song song tốt

c)

Khó triển khai

d)

Dễ bị tấn công hơn hệ thống đơn


48.

Trong điện toán phân tán, "tính minh bạch" (transparency) có nghĩa là gì?

a)

Hệ thống sử dụng hoàn toàn phần mềm mã nguồn mở

b)

Người dùng không cần biết chi tiết về cách hệ thống phân tán hoạt động

c)

Dữ liệu luôn được mã hóa

d)

Máy chủ phải công khai mã nguồn

49.

MapReduce là gì?

a)

Một loại cơ sở dữ liệu phân tán

b)

Mô hình xử lý dữ liệu lớn theo cách song song và phân tán

c)

Giao thức truyền thông mạng

d)

Hệ điều hành mã nguồn mở

50.

MapReduce thường được dùng để làm gì?

a)

Tạo website thương mại điện tử

b)

Xử lý và phân tích dữ liệu lớn (Big Data)

c)

Thiết kế giao diện người dùng

d)

Lập trình trò chơi


51.

Công cụ nào sau đây phổ biến trong xử lý dữ liệu thời gian thực?

a)

MS Word và Excel

b)

Apache Kafka, Apache Storm, Apache Flink, Spark Streaming


c)

Photoshop và AutoCAD

d)

Notepad và Paint

52.

Ưu điểm của hệ thống lưu trữ Big Data là gì?

a)

Chi phí cao và khó triển khai

b)

Linh hoạt, mở rộng dễ, xử lý dữ liệu lớn hiệu quả

c)

 Chỉ phù hợp cho dữ liệu có cấu trúc

d)

Không hỗ trợ tích hợp với AI

53.

 Kể tên một số hệ thống lưu trữ phổ biến trong Big Data

a)

MySQL và Excel

b)

HDFS, NoSQL, Data Lake, Amazon S3

c)

RAM và USB

d)

 Email Server

54.

Công việc nào thích hợp cho việc sử dụng mô hình MapReduce?

a)

Thiết kế đồ họa 3D

b)

Ứng dụng thời gian thực như trò chơi online

c)

Phân tích log hệ thống, xử lý dữ liệu lớn, thống kê dữ liệu

d)

Soạn thảo văn bản