Font size
WorksheetsKhai phá dữ liệu lớn
Total questions: 20
Worksheet time: 20mins
Apache Hive là gì?
Một ngôn ngữ lập trình dữ liệu lớn
Một hệ thống quản trị cơ sở dữ liệu quan hệ
Một hệ thống kho dữ liệu nguồn mở hỗ trợ truy vấn dữ liệu lớn
Một công cụ trực quan hóa dữ liệu lớn
Apache Hive hướng đến đối tượng người dùng nào?
Người dùng quen thuộc với Java
Người dùng quen thuộc với SQL
Người dùng quen thuộc với Python
Người dùng quen thuộc với NoSQL
Điểm mạnh nào của Apache Hive làm cho nó trở nên phù hợp với việc xử lý dữ liệu lớn?
Khả năng chỉ viết lệnh SQL phức tạp
Không hỗ trợ kết nối qua JDBC/ODBC
Khó khăn trong việc mở rộng lưu trữ và tính toán
Dễ dàng mở rộng khả năng lưu trữ và tính toán
Apache Spark hỗ trợ ngôn ngữ lập trình nào?
Chỉ Scala
Scala và Python
Scala, Java và Python
Scala, Java, Python và R
Resilient Distributed Datasets (RDD) trong Spark là gì?
Một tập hợp biến đổi của các đối tượng được lưu trữ trên một máy chủ đơ
Một cơ sở dữ liệu quan hệ phân tán
Một tập hợp bất biến phân tán của các đối tượng
Một dạng cấu trúc dữ liệu cho phép thay đổi dữ liệu
Transformation trong RDD có tính chất gì?
Xử lý tức thời các thao tác
Xử lý các thao tác một cách lazy
Không thể kết hợp với các DataFrame
Chỉ hoạt động với dữ liệu dạng cấu trúc
Action trong RDD được xử lý như thế nào?
Một cách lazy và không ngay lập tức
Chỉ sau khi tất cả transformations hoàn thành
Một cách tức thời khi được yêu cầu
Chỉ khi có sự thay đổi trong dữ liệu
Chữ "V" quan trọng nhất trong các đặc tính của Big Data là gì?
Volume: Khối lượng lớn
Velocity: Tốc độ nhanh
Variety: Đa dạng
Value: Giá trị
Những phát biểu nào sau đây là đúng (chọn 2/4)?
Hadoop dựa trên Disk-based processing
Hadoop dựa trên In-memory processing
Spark dựa trên Disk-based Processing
Spark dựa trên In-memory processing
Đâu không phải là thành phần của Hadoop?
HDFS
MapReduce
Yarn
MLlib
Đâu là các phát biểu đúng về Apache NiFi (chọn 2)
Là công cụ thu thập dữ liệu từ nhiều nguồn
Là công cụ dùng để trực quan hóa dữ liệu
Là công cụ xử lý tính toán phức tạp
Là công cụ hỗ trợ thiết kế, điều khiển luồng dữ liệu
Thuật toán nào dùng cho khai phá tập phổ biến và luật kết hợp?
DBSCAN
FP-GROWTH
KNN
SVM
Chọn các thuật toán dụng cho phân lớp dữ liệu (chọn 2)?
Decision Tree
FP-Growth
K-means
KNN
Chọn các thuật toán phân cụm dữ liệu (chọn 2)?
K-means
KNN
Decision Tree
DBScan
Những thuật toán nào sau đây dùng để khai phá tập phổ biến và luật kết hợp?
Apriori
Association Rules
FP-Growth
Frequent Itemsets
Phân cụm dữ liệu cần đạt được những mục tiêu gì?
Khoảng cách giữa các phần tử trong cùng cụm là tối thiểu hóa
Khoảng cách giữa các cụm là tối thiểu hóa
Khoảng cách giữa các cụm là tối đa hóa
Khoảng cách giữa các phần tử trong cùng cụm là tối đa hóa
Thuật toán nào sau đây có thể hỗ trợ tìm ra các điểm bất thường trong dữ liệu?
K-means
DBScan
Decision Tree
LinearRegression
Đâu là các kỹ thuật sử dụng trong xây dựng hệ gợi ý (chọn 2)?
Content-based
Collaborative Filtering
Hierarchical Clustering
Recommender
Đâu không phải là một kiến trúc tổ chức lưu trữ dữ liệu ?
Data Lake
Data Lakehouse
Data House
Data Warehouse
Cho đoạn code sau:
lr = LinearRegression(featuresCol='features', labelCol='price');
model = lr.fit(train_data)
Anh chị hãy hoàn thành lệnh cần viết vào dấu ... sau để đánh giá mô hình trên tập dữ liệu test_data
predictions = ...(test_data)
(a)
