wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Data Science Course - Midterm Exam

Total questions: 30

Worksheet time: 27mins

Name
Class
Date
1.

Bạn hãy chỉ ra quan điểm đúng nhất về Big Data?

a)

Là tài sản chung có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng

b)

Là tài sản thông tin có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng

c)

Là tài sản có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng

d)

Là tài sản quốc gia có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng

2.

Chữ "V" quan trọng nhất trong các đặc tính của Big Data là gì?

a)

Volume: Khối lượng lớn

b)

Velocity: Tốc độ nhanh

c)

Variety: Đa dạng

d)

Value: Giá trị

3.

Một "block" trên HDFS của Hadoop v3.0 (trở lên) có kích thước mặc định là bao nhiêu?

a)

64 MB

b)

100 MB

c)

128 MB

d)

256 MB

4.

Bạn có thể thao tác với tệp tin trên HDFS bằng những cách nào sau đây (chọn 2)?

a)

Sử dụng cửa sổ lệnh

b)

Sử dụng giao diện Web

c)

Sử dụng phần mềm Word

d)

Sử dụng phần mềm Notepad

5.

Đâu là kiến trúc 3 Layers của Hadoop?

a)

Application Layer, Business Layer, Data Layer

b)

Application Layer, Business Layer, Data Access Layer

c)

Application Layer, Resource Management Layer, Storage Layer

d)

Presentation Layer, Business Layer, Data Access Layer

6.

Khi thêm một máy mới vào hệ thống Hadoop cần phải khởi động lại toàn bộ hệ thống?

a)

Đúng

b)

Sai

7.

Hadoop MapReduce có thể xử lý loại dữ liệu nào sau đây (chọn đúng nhất) ?

a)

Dữ liệu văn bản

b)

Dữ liệu hình ảnh

c)

Dữ liệu video

d)

Tất cả các đáp án đều đúng

8.

Những phát biểu nào sau đây là đúng (chọn 2/4)?

a)

Hadoop dựa trên Disk-based processing

b)

Hadoop dựa trên In-memory processing

c)

Spark dựa trên Disk-based Processing

d)

Spark dựa trên In-memory processing

9.

Phát biểu nào sau đây là sai về HDFS?

a)

Là tệp tin ảo

b)

Một tệp lớn được chia thành 128 block nhỏ theo mặc định

c)

Là một thành phần của Hadoop

d)

Hỗ trợ lưu trữ dữ liệu lớn phân tán

10.

Đâu không phải là thành phần của Hadoop?

a)

HDFS

b)

MapReduce

c)

Yarn

d)

MLlib

11.

Đâu là phát biểu đúng về MapReduce?

a)

Là mô hình lập trình song song phân tán

b)

Là hệ thống lưu trữ file phân tán của Hadoop

c)

Là ngôn ngữ lập trình xử lý dữ liệu lớn

d)

Là công cụ để chuyển dữ liệu giữa Hadoop và CSDL quan hệ

12.

Giả sử bạn đang dùng MapReduce cho bài toán tính doanh thu trên mỗi sản phẩm từ nhiều hóa đơn bán hàng. Đầu ra là tên sản phẩm và doanh thu. Hãy nhập từ còn thiếu trong "..." để hoàn thành khai báo sau:

Reducer<LongWritable, Text, ..., LongWritable> cho phù hợp?

(a)  

13.

Đâu là các phát biểu đúng về Apache NiFi (chọn 2)

a)

Là công cụ thu thập dữ liệu từ nhiều nguồn

b)

Là công cụ dùng để trực quan hóa dữ liệu

c)

Là công cụ xử lý tính toán phức tạp

d)

Là công cụ hỗ trợ thiết kế, điều khiển luồng dữ liệu

14.

Công cụ nào sau đây không có trong hệ sinh thái của Hadoop?

a)

Hive

b)

Spark

c)

HBase

d)

MySQL Server

15.

Apache Spark hỗ trợ những ngôn ngữ lập trình nào sau đây?

a)

Java

b)

Python

c)

Scala

d)

C#

16.

Apache Hive thường được sử dụng trong kịch bản nào?

a)

Real-time processing

b)

Data warehousing

c)

Stream processing

d)

Graph processing

17.

Giả sử bạn đang viết chương trình MapReduce.

Hãy điền từ còn thiếu vào chỗ "..." để hoàn thành đoạn lệnh sau:

public static class MyMapper extends Mapper< ... , Text, Text, IntWritable> {

public void map(LongWritable key, Text value, Context context )

(a)  

18.

Vai trò của Processor trong Apache NiFi là gì?

a)

Là nơi lưu trữ dữ liệu

b)

Áp dụng các biến đổi cho FlowFile để tạo ra FlowFile mới

c)

Tính toán phức tạp cho các dữ liệu lớn

d)

Là nơi để nhập liệu từ bên ngoài vào hệ thống

19.

Khoa học dữ liệu là khoa học về phân tích dữ liệu, là sự tổng hợp của ba lĩnh vực nào sau đây?

a)

Toán & Thống kê

b)

Khoa học máy tính

c)

Kiến thức chuyên ngành

d)

Dữ liệu lớn

20.

Kiểu phân tích dữ liệu nào giúp con người ra quyết định nhanh chóng nhất?

a)

Mô tả

b)

Chẩn đoán

c)

Dự đoán

d)

Đề xuất

21.

Nhóm kỹ năng cốt lõi của một nhà Khoa học dữ liệu là gì?

a)

Kỹ thuật

b)

Phân tích

c)

Nghiệp vụ

d)

Giao tiếp

22.

Giả sử bạn muốn đọc dữ liệu từ tệp CSV để tạo DataFrame dùng thư viện Pandas trong Python, bạn sẽ sử dụng hàm nào? Điền vào ô dưới đây, bỏ qua dấu "()" ?

(a)  

23.

Khai báo nào sau đây không đúng để tạo một DataFrame sử dụng Pandas?

a)

pd.DataFrame([[1, 2], [3, 4]], columns=['A', 'B'])

b)

pd.DataFrame({'A': [1, 2], 'B': [3, 4]})

c)

pd.DataFrame({'A': {1, 2}, 'B': {3,4}})

d)

pd.DataFrame(data={'A': [1, 2], 'B': [3, 4]})

24.

Trong Python bạn có thể sử dụng những thư viện nào để trực quan hóa dư liệu (chọn 2)?

a)

matplotlib

b)

seaborn

c)

matplot

d)

plotlib

25.

Trong Python, để vẽ biểu đồ tròn thể hiện tỉ lệ phần trăm giữa các đối tượng, bạn sử dụng hàm nào của thư viện matplotlib?

a)

pie

b)

pieplot

c)

bar

d)

line

26.

Đâu không phải là một thuật toán học máy dùng cho phát hiện bất thường?

a)

DBSCAN

b)

FP-GROWTH

c)

KNN

d)

SVM

27.

Các lớp thường có trong một mạng CNN là gì (chọn 3/4)?

a)

Lớp tích chập

b)

Lớp Pooling

c)

Lớp Fully Connected

d)

Lớp ứng dụng

28.

Thuật toán nào dưới đây khác với lớp các thuật toán còn lại?

a)

DBSCAN

b)

Fuzzy C-Means

c)

Hierarchical clustering

d)

K-nearest neighbors

29.

Để làm việc với DataFrame trong Python bạn sử dụng thư viện nào sau đây?

a)
pandas
b)
matplotlib
c)
numpy
d)
scikit-learn
30.

Trong một dự án Khoa học dữ liệu, bước tiền xử lý dữ liệu thường bao gồm những công việc gì (chọn 3)?

a)

Làm sạch dữ liệu

b)

Tích hợp dữ liệu

c)

Chuyển đổi dữ liệu

d)

Trực quan hóa dữ liệu