Font size
WorksheetsTest - Big Data Analytics
Total questions: 20
Worksheet time: 21mins
Bạn hãy chỉ ra quan điểm đúng nhất về Big Data?
Là tài sản chung có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng
Là tài sản thông tin có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng
Là tài sản có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng
Là tài sản quốc gia có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng
Chữ "V" quan trọng nhất trong các đặc tính của Big Data là gì?
Volume: Khối lượng lớn
Velocity: Tốc độ nhanh
Variety: Đa dạng
Value: Giá trị
Một "block" trên HDFS của Hadoop v3.0 (trở lên) có kích thước mặc định là bao nhiêu?
64 MB
100 MB
128 MB
256 MB
Bạn có thể thao tác với tệp tin trên HDFS bằng những cách nào sau đây?
Sử dụng cửa sổ lệnh
Sử dụng giao diện Web
Sử dụng phần mềm Word
Sử dụng phần mềm Notepad
Đâu là kiến trúc 3 Layers của Hadoop?
Application Layer, Business Layer, Data Layer
Application Layer, Business Layer, Data Access Layer
Application Layer, Resource Management Layer, Storage Layer
Presentation Layer, Business Layer, Data Access Layer
Khi thêm một máy mới vào hệ thống Hadoop cần phải khởi động lại toàn bộ hệ thống?
Đúng
Sai
Hadoop MapReduce có thể xử lý loại dữ liệu nào sau đây (chọn đúng nhất) ?
Dữ liệu văn bản
Dữ liệu hình ảnh
Dữ liệu video
Tất cả các đáp án đều đúng
Những phát biểu nào sau đây là đúng (chọn 2/4)?
Hadoop dựa trên Disk-based processing
Hadoop dựa trên In-memory processing
Spark dựa trên Disk-based Processing
Spark dựa trên In-memory processing
Phát biểu nào sau đây là sai về HDFS?
Là tệp tin ảo
Một tệp lớn được chia thành 128 block nhỏ theo mặc định
Là một thành phần của Hadoop
Hỗ trợ lưu trữ dữ liệu lớn phân tán
Đâu không phải là thành phần của Hadoop?
HDFS
MapReduce
Yarn
MLlib
Đâu là phát biểu đúng về MapReduce?
Là mô hình lập trình song song phân tán
Là hệ thống lưu trữ file phân tán của Hadoop
Là ngôn ngữ lập trình xử lý dữ liệu lớn
Là công cụ để chuyển dữ liệu giữa Hadoop và CSDL quan hệ
Giả sử bạn đang dùng MapReduce cho bài toán tính doanh thu trên mỗi sản phẩm từ nhiều hóa đơn bán hàng. Đầu ra là tên sản phẩm và doanh thu. Hãy nhập từ còn thiếu trong "..." để hoàn thành khai báo sau:
Reducer<LongWritable, Text, ..., LongWritable> cho phù hợp?
(a)
Đâu là các phát biểu đúng về Apache NiFi (chọn 2)
Là công cụ thu thập dữ liệu từ nhiều nguồn
Là công cụ dùng để trực quan hóa dữ liệu
Là công cụ xử lý tính toán phức tạp
Là công cụ hỗ trợ thiết kế, điều khiển luồng dữ liệu
Công cụ nào sau đây không có trong hệ sinh thái của Hadoop?
Hive
Spark
HBase
MySQL Server
Apache Spark hỗ trợ những ngôn ngữ lập trình nào sau đây?
Java
Python
Scala
C#
Trong Apache Kafka, "Topic" đề cập đến điều gì?
Một kênh thông tin lưu trữ các tin nhắn gửi đến
Một tập hợp các cơ sở dữ liệu
Một giao thức mạng
Một API để giao tiếp giữa các microservices
Thành phần nào sau đây không liên quan đến trực tiếp đến Apache Kafka?
Broker
Producer
Consumer
Mapper
Các toán tử trễ (Lazy) trong Spark RDD hoạt động như thế nào?
Chúng thực hiện tính toán ngay khi được gọi
Chúng chỉ tính toán khi một action cần dữ liệu
Chúng lưu kết quả tính toán vào bộ nhớ cache ngay lập tức
Chúng tự động phân phối dữ liệu đến các node
Apache Hive thường được sử dụng trong kịch bản nào?
Real-time processing
Data warehousing
Stream processing
Graph processing
Giả sử bạn đang viết chương trình MapReduce.
Hãy điền từ còn thiếu vào chỗ "..." để hoàn thành đoạn lệnh sau:
public static class MyMapper extends Mapper< ... , Text, Text, IntWritable> {
public void map(LongWritable key, Text value, Context context )
(a)
