Font size
WorksheetsTest - Big Data Analytics (2)
Total questions: 20
Worksheet time: 10mins
Apache Hive là gì?
Một ngôn ngữ lập trình dữ liệu lớn
Một hệ thống quản trị cơ sở dữ liệu quan hệ
Một hệ thống kho dữ liệu nguồn mở hỗ trợ truy vấn dữ liệu lớn
Một công cụ trực quan hóa dữ liệu lớn
Apache Hive hướng đến đối tượng người dùng nào?
Người dùng quen thuộc với Java
Người dùng quen thuộc với SQL
Người dùng quen thuộc với Python
Người dùng quen thuộc với NoSQL
HiveQL là gì?
Một biến thể của ngôn ngữ lập trình Java
Một ngôn ngữ truy vấn dữ liệu tương tự SQL
Một loại cơ sở dữ liệu NoSQL
Một công cụ quản lý Hadoop cluster
Điểm mạnh nào của Apache Hive làm cho nó trở nên phù hợp với việc xử lý dữ liệu lớn?
Khả năng chỉ viết lệnh SQL phức tạp
Không hỗ trợ kết nối qua JDBC/ODBC
Khó khăn trong việc mở rộng lưu trữ và tính toán
Dễ dàng mở rộng khả năng lưu trữ và tính toán
Thành phần nào sau đây thuộc về Kiến trúc của Apache Hive (Chọn 3/4)
Compiler
Optimizer
Execution Engine
Catalyst Optimizer
Hive Metastore thường được lưu trữ ở đâu?
Trên hệ thống tập tin HDFS
Trên cơ sở dữ liệu NoSQL
Trên cơ sở dữ liệu quan hệ
Trên một hệ thống cache tạm thời
Lệnh nào trong HIVE sau đây khác với tập lệnh còn lại?
CREATE
INSERT
SHOW
DROP
Lệnh nào sau đây khác với tập lệnh còn lại trong Apache Hive
LOAD
IMPORT
CREATE
INSERT
Lệnh nào trong Apache Hive để đưa dữ liệu từ tập tin trên máy cục bộ lên kho dữ liệu trên HDFS?
IMPORT
INSERT
LOAD
ADD
Dữ liệu thực tế (của người dùng) trong Apache Hive có thể được lưu trữ ở đâu ? Chọn 2/4
Cơ sở dữ liệu quan hệ
Cơ sở dữ liệu NoSQL
HDFS
HBase
Apache Spark hỗ trợ ngôn ngữ lập trình nào?
Chỉ Scala
Scala và Python
Scala, Java và Python
Scala, Java, Python và R
Apache Spark tối ưu hoá tính toán như thế nào?
Sử dụng chế độ lưu trữ dữ liệu lên đĩa cứng
Sử dụng mô hình lập trình Map-Reduce
Sử dụng Directed Acyclic Graph (DAG) cho xử lý dữ liệu
Chỉ sử dụng CPU để xử lý dữ liệu
Chỉ ra 2 đặc tính đúng của Apache Spark?
Tốc độ xử lý nhanh
Làm việc tốt với các cơ sở dữ liệu quan hệ
Hỗ trợ xử lý luồng dữ liệu theo thời gian thực
Tính toán chủ yếu dựa trên dữ liệu lưu trên ổ đĩa
Spark SQL gồm những thành phần nào sau đây?
Catalyst Optimizer
DataFrame API
YARN
MapReduce
Spark MLLib hỗ trợ những bài toán nào sau đây?
Các bài toán học máy
Các bài toán liên quan đến đặc trưng của dữ liệu
Các bài toán phân tích luồng dữ liệu thời gian thực
Các bài toán liên quan đến dữ liệu phi cấu trúc
Thành phần nào sau đây không thuộc Apache Spark?
Spark SQL
Spark Streaming
Spark MLLib
Spark Optimizer
Resilient Distributed Datasets (RDD) trong Spark là gì?
Một tập hợp biến đổi của các đối tượng được lưu trữ trên một máy chủ đơ
Một cơ sở dữ liệu quan hệ phân tán
Một tập hợp bất biến phân tán của các đối tượng
Một dạng cấu trúc dữ liệu cho phép thay đổi dữ liệu
Transformation trong RDD có tính chất gì?
Xử lý tức thời các thao tác
Xử lý các thao tác một cách lazy
Không thể kết hợp với các DataFrame
Chỉ hoạt động với dữ liệu dạng cấu trúc
Action trong RDD được xử lý như thế nào?
Một cách lazy và không ngay lập tức
Chỉ sau khi tất cả transformations hoàn thành
Một cách tức thời khi được yêu cầu
Chỉ khi có sự thay đổi trong dữ liệu
Hàm "filter" trong Spark RDD tương đương với thao tác nào trong SQL?
SELECT
WHERE
INSERT
JOIN
