wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Data Science Course - Final Exam

Total questions: 30

Worksheet time: 30mins

Name
Class
Date
1.

Apache Hive là gì?

a)

Một ngôn ngữ lập trình dữ liệu lớn

b)

Một hệ thống quản trị cơ sở dữ liệu quan hệ

c)

Một hệ thống kho dữ liệu nguồn mở hỗ trợ truy vấn dữ liệu lớn

d)

Một công cụ trực quan hóa dữ liệu lớn

2.

Apache Hive hướng đến đối tượng người dùng nào?

a)

Người dùng quen thuộc với Java

b)

Người dùng quen thuộc với SQL

c)

Người dùng quen thuộc với Python

d)

Người dùng quen thuộc với NoSQL

3.

Điểm mạnh nào của Apache Hive làm cho nó trở nên phù hợp với việc xử lý dữ liệu lớn?

a)

Khả năng chỉ viết lệnh SQL phức tạp

b)

Không hỗ trợ kết nối qua JDBC/ODBC

c)

Khó khăn trong việc mở rộng lưu trữ và tính toán

d)

Dễ dàng mở rộng khả năng lưu trữ và tính toán

4.

Thành phần nào sau đây thuộc về Kiến trúc của Apache Hive (Chọn 3/4)

a)

Compiler

b)

Optimizer

c)

Execution Engine

d)

Catalyst Optimizer

5.

Hive Metastore thường được lưu trữ ở đâu?

a)

Trên hệ thống tập tin HDFS

b)

Trên cơ sở dữ liệu NoSQL

c)

Trên cơ sở dữ liệu quan hệ

d)

Trên một hệ thống cache tạm thời

6.

Lệnh nào trong HIVE sau đây khác với tập lệnh còn lại?

a)

CREATE

b)

INSERT

c)

SHOW

d)

DROP

7.

Lệnh nào sau đây khác với tập lệnh còn lại trong Apache Hive

a)

LOAD

b)

IMPORT

c)

CREATE

d)

INSERT

8.

Dữ liệu thực tế (của người dùng) trong Apache Hive có thể được lưu trữ ở đâu ? Chọn 2/4

a)

Cơ sở dữ liệu quan hệ

b)

Trên máy tính cục bộ cài Hive

c)

HDFS

d)

HBase

9.

Apache Spark hỗ trợ ngôn ngữ lập trình nào?

a)

Chỉ Scala

b)

Scala và Python

c)

Scala, Java và Python

d)

Scala, Java, Python và R

10.

Spark SQL gồm những thành phần nào sau đây?

a)

Catalyst Optimizer

b)

DataFrame API

c)

YARN

d)

MapReduce

11.

Thành phần nào sau đây không thuộc Apache Spark?

a)

Spark SQL

b)

Spark Streaming

c)

Spark MLLib

d)

Spark Optimizer

12.

Resilient Distributed Datasets (RDD) trong Spark là gì?

a)

Một tập hợp biến đổi của các đối tượng được lưu trữ trên một máy chủ đơ

b)

Một cơ sở dữ liệu quan hệ phân tán

c)

Một tập hợp bất biến phân tán của các đối tượng

d)

Một dạng cấu trúc dữ liệu cho phép thay đổi dữ liệu

13.

Transformation trong RDD có tính chất gì?

a)

Xử lý tức thời các thao tác

b)

Xử lý các thao tác một cách lazy

c)

Không thể kết hợp với các DataFrame

d)

Chỉ hoạt động với dữ liệu dạng cấu trúc

14.

Action trong RDD được xử lý như thế nào?

a)

Một cách lazy và không ngay lập tức

b)

Chỉ sau khi tất cả transformations hoàn thành

c)

Một cách tức thời khi được yêu cầu

d)

Chỉ khi có sự thay đổi trong dữ liệu

15.

Thành phần nào thuộc về kiến trúc của Kafka?

a)

HDFS

b)

Compiler

c)

YARN

d)

Broker

16.

Apache Kafka là gì?

a)

Hệ thống quản lý cơ sở dữ liệu

b)

Hệ thống tin nhắn pub/sub phân tán

c)

Phần mềm mã nguồn mở cho phát triển web

d)

Hệ thống bảo mật mạng

17.

Đặc tính nào của Kafka đảm bảo tính tin cậy của hệ thống?

a)

Tự động sao lưu dữ liệu

b)

Phân tán, phân mảnh, sao lưu và khả năng chịu lỗi

c)

Bảo mật thông tin liên lạc

d)

Tự động cân bằng tải

18.

Khả năng mở rộng của Kafka được thể hiện như thế nào?

a)

Mở rộng theo chiều dọc

b)

Tích hợp với các hệ thống lưu trữ đám mây

c)

Tự động điều chỉnh dung lượng lưu trữ

d)

Mở rộng theo chiều ngang

19.

Một "topic" trong Kafka được sử dụng để làm gì?

a)

Quản lý các node trong cluster

b)

Lưu trữ cấu hình hệ thống

c)

Chứa các bản ghi (dữ liệu) được publish (xuất bản)

d)

Đồng bộ hóa dữ liệu giữa các servers

20.

Một "topic" trong Kafka có thể có bao nhiêu subscriber?

a)

Hai

b)

Ba

c)

Nhiều

d)

Chỉ một

21.

Producers trong Kafka có nhiệm vụ gì?

a)

Đưa các messages vào một hoặc nhiều Kafka topics

b)

Đọc dữ liệu từ các topics

c)

Quản lý các partition trong topic

d)

Lưu trữ dữ liệu trong cơ sở dữ liệu

22.

Producers gửi dữ liệu đến thành phần nào trong Kafka?

a)

Consumer

b)

Database

c)

ZooKeeper

d)

Kafka brokers

23.

Consumers có thể đăng ký nhận dữ liệu từ bao nhiêu topics?

a)

Chỉ một

b)

Hai

c)

Ba

d)

Một hoặc nhiều

24.

ZooKeeper lưu trữ thông tin gì trong Kafka?

a)

Cấu hình của các Kafka clients

b)

Dữ liệu thô từ Kafka topics

c)

Thông tin metadata của Kafka như về topics, brokers, và consumer offsets

d)

Mã nguồn của Kafka

25.

Kafka có thể được sử dụng trong tình huống nào sau đây?

a)

Messaging, để giao tiếp giữa các hệ thống hoặc ứng dụng khác nhau

b)

Theo dõi hoạt động trên website

c)

Thu thập và phân tích các chỉ số (Metrics)

d)

Tất cả các phương án trên

26.

Cơ chế Replicas trong Kafka topic được sử dụng để đạt được mục tiêu nào sau đây?

a)

Tăng tốc độ xử lý dữ liệu

b)

Tự động tạo ra dữ liệu mới

c)

Đảm bảo khả năng chịu lỗi và tính sẵn sàng cao của dữ liệu

d)

Giảm dung lượng lưu trữ cần thiết cho dữ liệu

27.

Phát biểu nào sau đây đúng về Apache HBase?

a)

Cơ sở dữ liệu phân tán hướng dòng

b)

Cơ sở dữ liệu phân tán hướng cột

c)

Cơ sở dữ liệu quan hệ

d)

Cơ sở dữ liệu đồ thị

28.

Lệnh nào trong HBase để tạo bảng?

a)

create

b)

list

c)

scan

d)

drop

29.

Lệnh nào trong HBase dùng để đẩy một giá trị vào một bảng một hàng và một cột cụ thể?

a)

create

b)

get

c)

pop

d)

put

30.

Thuật toán nào sau đây khác loại với các thuật toán còn lại?

a)

DBSCAN

b)

Naive Bayes

c)

KNN

d)

Decision Tree