wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Khai phá dữ liệu lớn

Total questions: 20

Worksheet time: 20mins

Name
Class
Date
1.

Apache Hive là gì?

a)

Một ngôn ngữ lập trình dữ liệu lớn

b)

Một hệ thống quản trị cơ sở dữ liệu quan hệ

c)

Một hệ thống kho dữ liệu nguồn mở hỗ trợ truy vấn dữ liệu lớn

d)

Một công cụ trực quan hóa dữ liệu lớn

2.

Apache Hive hướng đến đối tượng người dùng nào?

a)

Người dùng quen thuộc với Java

b)

Người dùng quen thuộc với SQL

c)

Người dùng quen thuộc với Python

d)

Người dùng quen thuộc với NoSQL

3.

Điểm mạnh nào của Apache Hive làm cho nó trở nên phù hợp với việc xử lý dữ liệu lớn?

a)

Khả năng chỉ viết lệnh SQL phức tạp

b)

Không hỗ trợ kết nối qua JDBC/ODBC

c)

Khó khăn trong việc mở rộng lưu trữ và tính toán

d)

Dễ dàng mở rộng khả năng lưu trữ và tính toán

4.

Apache Spark hỗ trợ ngôn ngữ lập trình nào?

a)

Chỉ Scala

b)

Scala và Python

c)

Scala, Java và Python

d)

Scala, Java, Python và R

5.

Resilient Distributed Datasets (RDD) trong Spark là gì?

a)

Một tập hợp biến đổi của các đối tượng được lưu trữ trên một máy chủ đơ

b)

Một cơ sở dữ liệu quan hệ phân tán

c)

Một tập hợp bất biến phân tán của các đối tượng

d)

Một dạng cấu trúc dữ liệu cho phép thay đổi dữ liệu

6.

Transformation trong RDD có tính chất gì?

a)

Xử lý tức thời các thao tác

b)

Xử lý các thao tác một cách lazy

c)

Không thể kết hợp với các DataFrame

d)

Chỉ hoạt động với dữ liệu dạng cấu trúc

7.

Action trong RDD được xử lý như thế nào?

a)

Một cách lazy và không ngay lập tức

b)

Chỉ sau khi tất cả transformations hoàn thành

c)

Một cách tức thời khi được yêu cầu

d)

Chỉ khi có sự thay đổi trong dữ liệu

8.

Chữ "V" quan trọng nhất trong các đặc tính của Big Data là gì?

a)

Volume: Khối lượng lớn

b)

Velocity: Tốc độ nhanh

c)

Variety: Đa dạng

d)

Value: Giá trị

9.

Những phát biểu nào sau đây là đúng (chọn 2/4)?

a)

Hadoop dựa trên Disk-based processing

b)

Hadoop dựa trên In-memory processing

c)

Spark dựa trên Disk-based Processing

d)

Spark dựa trên In-memory processing

10.

Đâu không phải là thành phần của Hadoop?

a)

HDFS

b)

MapReduce

c)

Yarn

d)

MLlib

11.

Đâu là các phát biểu đúng về Apache NiFi (chọn 2)

a)

Là công cụ thu thập dữ liệu từ nhiều nguồn

b)

Là công cụ dùng để trực quan hóa dữ liệu

c)

Là công cụ xử lý tính toán phức tạp

d)

Là công cụ hỗ trợ thiết kế, điều khiển luồng dữ liệu

12.

Thuật toán nào dùng cho khai phá tập phổ biến và luật kết hợp?

a)

DBSCAN

b)

FP-GROWTH

c)

KNN

d)

SVM

13.

Chọn các thuật toán dụng cho phân lớp dữ liệu (chọn 2)?

a)

Decision Tree

b)

FP-Growth

c)

K-means

d)

KNN

14.

Chọn các thuật toán phân cụm dữ liệu (chọn 2)?

a)

K-means

b)

KNN

c)

Decision Tree

d)

DBScan

15.

Những thuật toán nào sau đây dùng để khai phá tập phổ biến và luật kết hợp?

a)

Apriori

b)

Association Rules

c)

FP-Growth

d)

Frequent Itemsets

16.

Phân cụm dữ liệu cần đạt được những mục tiêu gì?

a)

Khoảng cách giữa các phần tử trong cùng cụm là tối thiểu hóa

b)

Khoảng cách giữa các cụm là tối thiểu hóa

c)

Khoảng cách giữa các cụm là tối đa hóa

d)

Khoảng cách giữa các phần tử trong cùng cụm là tối đa hóa

17.

Thuật toán nào sau đây có thể hỗ trợ tìm ra các điểm bất thường trong dữ liệu?

a)

K-means

b)

DBScan

c)

Decision Tree

d)

LinearRegression

18.

Đâu là các kỹ thuật sử dụng trong xây dựng hệ gợi ý (chọn 2)?

a)

Content-based

b)

Collaborative Filtering

c)

Hierarchical Clustering

d)

Recommender

19.

Đâu không phải là một kiến trúc tổ chức lưu trữ dữ liệu ?

a)

Data Lake

b)

Data Lakehouse

c)

Data House

d)

Data Warehouse

20.

Cho đoạn code sau:

lr = LinearRegression(featuresCol='features', labelCol='price');

model = lr.fit(train_data)

Anh chị hãy hoàn thành lệnh cần viết vào dấu ... sau để đánh giá mô hình trên tập dữ liệu test_data

predictions = ...(test_data)

(a)