wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Test - Big Data Analytics (2)

Total questions: 20

Worksheet time: 10mins

Name
Class
Date
1.

Apache Hive là gì?

a)

Một ngôn ngữ lập trình dữ liệu lớn

b)

Một hệ thống quản trị cơ sở dữ liệu quan hệ

c)

Một hệ thống kho dữ liệu nguồn mở hỗ trợ truy vấn dữ liệu lớn

d)

Một công cụ trực quan hóa dữ liệu lớn

2.

Apache Hive hướng đến đối tượng người dùng nào?

a)

Người dùng quen thuộc với Java

b)

Người dùng quen thuộc với SQL

c)

Người dùng quen thuộc với Python

d)

Người dùng quen thuộc với NoSQL

3.

HiveQL là gì?

a)

Một biến thể của ngôn ngữ lập trình Java

b)

Một ngôn ngữ truy vấn dữ liệu tương tự SQL

c)

Một loại cơ sở dữ liệu NoSQL

d)

Một công cụ quản lý Hadoop cluster

4.

Điểm mạnh nào của Apache Hive làm cho nó trở nên phù hợp với việc xử lý dữ liệu lớn?

a)

Khả năng chỉ viết lệnh SQL phức tạp

b)

Không hỗ trợ kết nối qua JDBC/ODBC

c)

Khó khăn trong việc mở rộng lưu trữ và tính toán

d)

Dễ dàng mở rộng khả năng lưu trữ và tính toán

5.

Thành phần nào sau đây thuộc về Kiến trúc của Apache Hive (Chọn 3/4)

a)

Compiler

b)

Optimizer

c)

Execution Engine

d)

Catalyst Optimizer

6.

Hive Metastore thường được lưu trữ ở đâu?

a)

Trên hệ thống tập tin HDFS

b)

Trên cơ sở dữ liệu NoSQL

c)

Trên cơ sở dữ liệu quan hệ

d)

Trên một hệ thống cache tạm thời

7.

Lệnh nào trong HIVE sau đây khác với tập lệnh còn lại?

a)

CREATE

b)

INSERT

c)

SHOW

d)

DROP

8.

Lệnh nào sau đây khác với tập lệnh còn lại trong Apache Hive

a)

LOAD

b)

IMPORT

c)

CREATE

d)

INSERT

9.

Lệnh nào trong Apache Hive để đưa dữ liệu từ tập tin trên máy cục bộ lên kho dữ liệu trên HDFS?

a)

IMPORT

b)

INSERT

c)

LOAD

d)

ADD

10.

Dữ liệu thực tế (của người dùng) trong Apache Hive có thể được lưu trữ ở đâu ? Chọn 2/4

a)

Cơ sở dữ liệu quan hệ

b)

Cơ sở dữ liệu NoSQL

c)

HDFS

d)

HBase

11.

Apache Spark hỗ trợ ngôn ngữ lập trình nào?

a)

Chỉ Scala

b)

Scala và Python

c)

Scala, Java và Python

d)

Scala, Java, Python và R

12.

Apache Spark tối ưu hoá tính toán như thế nào?

a)

Sử dụng chế độ lưu trữ dữ liệu lên đĩa cứng

b)

Sử dụng mô hình lập trình Map-Reduce

c)

Sử dụng Directed Acyclic Graph (DAG) cho xử lý dữ liệu

d)

Chỉ sử dụng CPU để xử lý dữ liệu

13.

Chỉ ra 2 đặc tính đúng của Apache Spark?

a)

Tốc độ xử lý nhanh

b)

Làm việc tốt với các cơ sở dữ liệu quan hệ

c)

Hỗ trợ xử lý luồng dữ liệu theo thời gian thực

d)

Tính toán chủ yếu dựa trên dữ liệu lưu trên ổ đĩa

14.

Spark SQL gồm những thành phần nào sau đây?

a)

Catalyst Optimizer

b)

DataFrame API

c)

YARN

d)

MapReduce

15.

Spark MLLib hỗ trợ những bài toán nào sau đây?

a)

Các bài toán học máy

b)

Các bài toán liên quan đến đặc trưng của dữ liệu

c)

Các bài toán phân tích luồng dữ liệu thời gian thực

d)

Các bài toán liên quan đến dữ liệu phi cấu trúc

16.

Thành phần nào sau đây không thuộc Apache Spark?

a)

Spark SQL

b)

Spark Streaming

c)

Spark MLLib

d)

Spark Optimizer

17.

Resilient Distributed Datasets (RDD) trong Spark là gì?

a)

Một tập hợp biến đổi của các đối tượng được lưu trữ trên một máy chủ đơ

b)

Một cơ sở dữ liệu quan hệ phân tán

c)

Một tập hợp bất biến phân tán của các đối tượng

d)

Một dạng cấu trúc dữ liệu cho phép thay đổi dữ liệu

18.

Transformation trong RDD có tính chất gì?

a)

Xử lý tức thời các thao tác

b)

Xử lý các thao tác một cách lazy

c)

Không thể kết hợp với các DataFrame

d)

Chỉ hoạt động với dữ liệu dạng cấu trúc

19.

Action trong RDD được xử lý như thế nào?

a)

Một cách lazy và không ngay lập tức

b)

Chỉ sau khi tất cả transformations hoàn thành

c)

Một cách tức thời khi được yêu cầu

d)

Chỉ khi có sự thay đổi trong dữ liệu

20.

Hàm "filter" trong Spark RDD tương đương với thao tác nào trong SQL?

a)

SELECT

b)

WHERE

c)

INSERT

d)

JOIN