Font size
WorksheetsData Science Course - Final Exam
Total questions: 30
Worksheet time: 30mins
Apache Hive là gì?
Một ngôn ngữ lập trình dữ liệu lớn
Một hệ thống quản trị cơ sở dữ liệu quan hệ
Một hệ thống kho dữ liệu nguồn mở hỗ trợ truy vấn dữ liệu lớn
Một công cụ trực quan hóa dữ liệu lớn
Apache Hive hướng đến đối tượng người dùng nào?
Người dùng quen thuộc với Java
Người dùng quen thuộc với SQL
Người dùng quen thuộc với Python
Người dùng quen thuộc với NoSQL
Điểm mạnh nào của Apache Hive làm cho nó trở nên phù hợp với việc xử lý dữ liệu lớn?
Khả năng chỉ viết lệnh SQL phức tạp
Không hỗ trợ kết nối qua JDBC/ODBC
Khó khăn trong việc mở rộng lưu trữ và tính toán
Dễ dàng mở rộng khả năng lưu trữ và tính toán
Thành phần nào sau đây thuộc về Kiến trúc của Apache Hive (Chọn 3/4)
Compiler
Optimizer
Execution Engine
Catalyst Optimizer
Hive Metastore thường được lưu trữ ở đâu?
Trên hệ thống tập tin HDFS
Trên cơ sở dữ liệu NoSQL
Trên cơ sở dữ liệu quan hệ
Trên một hệ thống cache tạm thời
Lệnh nào trong HIVE sau đây khác với tập lệnh còn lại?
CREATE
INSERT
SHOW
DROP
Lệnh nào sau đây khác với tập lệnh còn lại trong Apache Hive
LOAD
IMPORT
CREATE
INSERT
Dữ liệu thực tế (của người dùng) trong Apache Hive có thể được lưu trữ ở đâu ? Chọn 2/4
Cơ sở dữ liệu quan hệ
Trên máy tính cục bộ cài Hive
HDFS
HBase
Apache Spark hỗ trợ ngôn ngữ lập trình nào?
Chỉ Scala
Scala và Python
Scala, Java và Python
Scala, Java, Python và R
Spark SQL gồm những thành phần nào sau đây?
Catalyst Optimizer
DataFrame API
YARN
MapReduce
Thành phần nào sau đây không thuộc Apache Spark?
Spark SQL
Spark Streaming
Spark MLLib
Spark Optimizer
Resilient Distributed Datasets (RDD) trong Spark là gì?
Một tập hợp biến đổi của các đối tượng được lưu trữ trên một máy chủ đơ
Một cơ sở dữ liệu quan hệ phân tán
Một tập hợp bất biến phân tán của các đối tượng
Một dạng cấu trúc dữ liệu cho phép thay đổi dữ liệu
Transformation trong RDD có tính chất gì?
Xử lý tức thời các thao tác
Xử lý các thao tác một cách lazy
Không thể kết hợp với các DataFrame
Chỉ hoạt động với dữ liệu dạng cấu trúc
Action trong RDD được xử lý như thế nào?
Một cách lazy và không ngay lập tức
Chỉ sau khi tất cả transformations hoàn thành
Một cách tức thời khi được yêu cầu
Chỉ khi có sự thay đổi trong dữ liệu
Thành phần nào thuộc về kiến trúc của Kafka?
HDFS
Compiler
YARN
Broker
Apache Kafka là gì?
Hệ thống quản lý cơ sở dữ liệu
Hệ thống tin nhắn pub/sub phân tán
Phần mềm mã nguồn mở cho phát triển web
Hệ thống bảo mật mạng
Đặc tính nào của Kafka đảm bảo tính tin cậy của hệ thống?
Tự động sao lưu dữ liệu
Phân tán, phân mảnh, sao lưu và khả năng chịu lỗi
Bảo mật thông tin liên lạc
Tự động cân bằng tải
Khả năng mở rộng của Kafka được thể hiện như thế nào?
Mở rộng theo chiều dọc
Tích hợp với các hệ thống lưu trữ đám mây
Tự động điều chỉnh dung lượng lưu trữ
Mở rộng theo chiều ngang
Một "topic" trong Kafka được sử dụng để làm gì?
Quản lý các node trong cluster
Lưu trữ cấu hình hệ thống
Chứa các bản ghi (dữ liệu) được publish (xuất bản)
Đồng bộ hóa dữ liệu giữa các servers
Một "topic" trong Kafka có thể có bao nhiêu subscriber?
Hai
Ba
Nhiều
Chỉ một
Producers trong Kafka có nhiệm vụ gì?
Đưa các messages vào một hoặc nhiều Kafka topics
Đọc dữ liệu từ các topics
Quản lý các partition trong topic
Lưu trữ dữ liệu trong cơ sở dữ liệu
Producers gửi dữ liệu đến thành phần nào trong Kafka?
Consumer
Database
ZooKeeper
Kafka brokers
Consumers có thể đăng ký nhận dữ liệu từ bao nhiêu topics?
Chỉ một
Hai
Ba
Một hoặc nhiều
ZooKeeper lưu trữ thông tin gì trong Kafka?
Cấu hình của các Kafka clients
Dữ liệu thô từ Kafka topics
Thông tin metadata của Kafka như về topics, brokers, và consumer offsets
Mã nguồn của Kafka
Kafka có thể được sử dụng trong tình huống nào sau đây?
Messaging, để giao tiếp giữa các hệ thống hoặc ứng dụng khác nhau
Theo dõi hoạt động trên website
Thu thập và phân tích các chỉ số (Metrics)
Tất cả các phương án trên
Cơ chế Replicas trong Kafka topic được sử dụng để đạt được mục tiêu nào sau đây?
Tăng tốc độ xử lý dữ liệu
Tự động tạo ra dữ liệu mới
Đảm bảo khả năng chịu lỗi và tính sẵn sàng cao của dữ liệu
Giảm dung lượng lưu trữ cần thiết cho dữ liệu
Phát biểu nào sau đây đúng về Apache HBase?
Cơ sở dữ liệu phân tán hướng dòng
Cơ sở dữ liệu phân tán hướng cột
Cơ sở dữ liệu quan hệ
Cơ sở dữ liệu đồ thị
Lệnh nào trong HBase để tạo bảng?
create
list
scan
drop
Lệnh nào trong HBase dùng để đẩy một giá trị vào một bảng một hàng và một cột cụ thể?
create
get
pop
put
Thuật toán nào sau đây khác loại với các thuật toán còn lại?
DBSCAN
Naive Bayes
KNN
Decision Tree
