Font size
WorksheetsTÀI LIỆU : 100 CÂU HỎI TRẮC NGHIỆM BIG DATA (Ôn tập 63KHMT)
Total questions: 100
Worksheet time: 53mins
Đặc điểm nào sau đây KHÔNG thuộc về 5V của Dữ liệu lớn?
Velocity (Tốc độ)
Veracity (Tính xác thực)
Volatility (Tính biến động)
Volume (Khối lượng)
Dữ liệu lớn được định nghĩa là tập dữ liệu có đặc điểm gì mà các nền tảng lưu trữ và xử lý truyền thống không đáp ứng được?
Quá lớn hoặc quá phức tạp
Chỉ có cấu trúc
Chỉ tồn tại trên mạng xã hội
Dễ dàng lưu trữ bằng hệ thống tệp cục bộ
Khai thác dữ liệu lớn trong lĩnh vực giáo dục mang lại lợi ích gì theo các nguồn đã cung cấp?
Giảm chi phí điều trị
Khuyến nghị lộ trình học tập, sự nghiệp
Truyền thông bám đuổi mục tiêu hiệu quả
Dự đoán quy mô đại dịch
Tính chất nào của quản lý dữ liệu lớn yêu cầu khả năng chống chịu lỗi, đặc biệt khi tăng số lượng người dùng hoặc khi xảy ra hỏng hóc?
Scalability
Accessibility
Transparency
Availability
Theo nguồn, công việc nào thường chiếm khoảng 80% các công việc của nhà khoa học dữ liệu?
Khả năng quản lý lượng dữ liệu lớn không ngừng tăng lên theo thời gian được gọi là gì trong các tầng công nghệ cho dữ liệu lớn?
Accessibility
Scalability
Transparency
Availability
Một thách thức trong xử lý và tích hợp dữ liệu lớn là gì?
Dữ liệu có định dạng khác nhau
Chi phí hạ tầng rất rẻ
Xử lý dữ liệu không cần song song
Khả năng chịu lỗi tốt
Trong giáo dục, dữ liệu lớn có thể được khai thác để làm gì liên quan đến chương trình học?
Ngăn ngừa sớm các bệnh trong tương lai
Đánh giá học tập
Cá nhân hoá theo sở thích giải trí
Chương trình học tối ưu, tuỳ biến phù hợp cho người học
Để giải quyết bài toán các giải thuật phân tích dữ liệu khả mở, một kỹ thuật là làm nhỏ lại dữ liệu cho phù hợp với các giải thuật truyền thống. Ví dụ của kỹ thuật này là gì?
Scaling-up Support Vector Machines
Song song hoá các giải thuật học máy
Principal component analysis (PCA)
Sự bùng nổ số chiều trong dữ liệu
Các nguồn tạo ra dữ liệu lớn bao gồm những lĩnh vực nào?
Thương mại điện tử, Mạng xã hội, Internet vạn vật (IoT)
Chỉ từ các cơ sở dữ liệu quan hệ truyền thống
Chỉ từ các thử nghiệm dữ liệu lớn như vật lý lượng tử
Mục tiêu chính của Apache Hadoop là gì?
Lưu trữ dữ liệu khả mở, tin cậy, xử lý dữ liệu mạnh mẽ và trực quan hoá dữ liệu hiệu quả
Chỉ tập trung vào việc xử lý dữ liệu nhanh chóng
Chỉ tập trung vào việc lưu trữ dữ liệu khả mở
Thiết kế để vận hành trên phần cứng siêu máy tính, cấu hình mạnh
Hadoop giải quyết bài toán khả mở bằng kỹ thuật nào?
Scale-up (tăng cấu hình máy chủ)
Scale-out (tăng số lượng máy chủ)
Chỉ tập trung vào một máy chủ mạnh duy nhất
Sử dụng Zookeeper để quản lý Node
Cơ chế chịu lỗi của Hadoop được thực hiện chủ yếu thông qua kỹ thuật gì?
Kỹ thuật "dư thừa" (redundancy)
Sử dụng cơ chế RAID trên ổ cứng
Chỉ dựa vào việc lập lịch lại các tác vụ thất bại
Sử dụng phần cứng chuyên dụng, tin cậy cao
HDFS được tối ưu hóa để làm việc với loại tệp tin có kích thước như thế nào?
Rất nhỏ (vài KB)
Kích thước vừa phải (vài MB)
Kích thước lớn (từ vài trăm MB tới vài TB)
Kích thước cực lớn (vài trăm PB)
Điểm khác biệt chính giữa HDFS và hệ thống tệp tin trên UNIX là gì?
HDFS có không gian cây thư mục phân cấp
HDFS chỉ hỗ trợ thao tác ghi thêm dữ liệu vào cuối tệp (APPEND)
HDFS hỗ trợ cơ chế phân quyền như UNIX
HDFS hỗ trợ ghi nhiều lần và đọc nhiều lần
Trong kiến trúc Master/Slave của HDFS, Data node đóng vai trò gì?
Quản lý không gian tên
Quản lý siêu dữ liệu ánh xạ tệp tin tới vị trí các chunks
Giám sát các Data node
Trực tiếp thao tác I/O các chunks
Nguyên lý thiết kế cốt lõi của HDFS là phân tán dữ liệu bằng cách chia tệp thành các chunks lớn. Kích thước chunks thông thường là bao nhiêu?
1 MB
32 MB
64 MB
512 MB
Trong HDFS, mỗi chunk thông thường được sao làm bao nhiêu nhân bản (replication factor)?
1 nhân bản
2 nhân bản
3 nhân bản
5 nhân bản
Name node lưu trữ siêu dữ liệu (metadata) ở đâu để đảm bảo tốc độ truy xuất nhanh chóng?
Trong bộ nhớ trong (RAM)
Trên ổ đĩa cứng của Data node
Trên ổ đĩa cứng của Name node
Trong cơ sở dữ liệu quan hệ
Name node sử dụng cơ chế nào để phát hiện sự bất thường trên Data node?
Secondary Name Node
Yêu cầu Data node gửi Block Report liên tục
Định kỳ nhận nhịp đập (heartbeat) từ Data node
Sử dụng Zookeeper để giám sát trạng thái
Cơ chế tái nhân bản (Re-replication) trong HDFS được thực hiện khi nào?
Khi một bản sao dữ liệu bị mất hoặc hỏng.
Khi hệ thống khởi động lại.
Khi thêm một node mới vào cluster.
Khi dữ liệu được ghi mới vào HDFS.
Khi nào cần thực hiện việc tái nhân bản dữ liệu trong HDFS?
Khi tăng số lượng Data node lên một ngưỡng nhất định
Khi một Data node gặp lỗi và cần tái nhân bản dữ liệu ứng với node đó
Chỉ khi có yêu cầu thủ công từ người quản trị
Tỉ lệ % lắp đầy ổ cứng ở Data node đồng đều
Để đảm bảo tính đúng đắn của dữ liệu trong HDFS, cơ chế nào được sử dụng?
Mã hóa AES 256
Sử dụng checksum (ví dụ: CRC 32)
Cơ chế đồng bộ Merkle tree
Vector clock
Secondary Name Node (SNN) đóng vai trò gì trong HDFS?
Trực tiếp phục vụ các yêu cầu đọc/ghi dữ liệu cho client
Checkpointing bản sao mới nhất của FsImage và Transaction Log files
Thay thế Name node khi nó bị lỗi
Bầu cử leader cho cụm Data node
Định dạng tệp tin nào trong HDFS cung cấp cấu trúc dữ liệu bền vững cho các cặp khóa-giá trị nhị phân và thường được sử dụng để chuyển dữ liệu giữa các job MapReduce?
Text file
Avro
Sequence file
Parquet
Parquet là định dạng tệp tin kiểu gì, tối ưu cho hiệu suất I/O đĩa khi cần truy vấn các cột cụ thể?
Row-based (Dựa trên dòng)
Column-oriented binary file format (Định dạng nhị phân hướng cột)
JSON format
XML format
Trong HDFS, một Data node lưu trữ dữ liệu trên hệ thống tệp tin cục bộ của máy chủ (ví dụ, ext3) dưới dạng gì?
Các chunk của tệp tin
Các block của tệp tin
Các file nhỏ
Các thư mục
Cơ chế chịu lỗi của Data node trong HDFS là gì?
Namemode định kỳ hỏi hồi các datanode về trạng thái tồn tại của các datanode.
Sử dụng cơ chế heartbeat, định kỳ các datanode thông báo về trạng thái cho Namenode.
Sử dụng Zookeeper để quản lý các thành viên datanode trong cụm.
Secondary Namenode thực hiện tái nhân bản.
Trong HDFS, Name node giải quyết bài toán điểm hỏng hóc duy nhất (singlepoint-of-failure) bằng cách nào theo cơ chế Secondary Name node?
Sử dụng secondary namenode theo cơ chế active-passive. Secondary namenode chỉ hoạt động đồng khi có vấn đề với Namenode
Secondary Namenode tạo checkpoint bản sao mới nhất của FsImage và Transaction Log files.
Cả Name node và Secondary Name node cùng hoạt động online trong hệ thống.
Sử dụng cơ chế bầu cử leader
Các thành phần tiện ích chung hỗ trợ các thành phần của Hadoop được gọi là gì?
Hadoop YARN
Hadoop HDFS
Hadoop Common
MapReduce framework
Apache Hadoop được thiết kế để vận hành trên loại phần cứng nào?
Phần cứng chuyên dụng, tốc độ cao
Phần cứng phổ thông, có khả năng chống chịu lỗi phần cứng
Phần cứng siêu máy tính
Máy chủ cấu hình cao, độ tin cậy cao
Lý do chính khiến NoSQL ra đời là vì các ứng dụng Web ngày nay có nhu cầu gì?
Yêu cầu giao dịch ACID mạnh mẽ
Khả năng mở rộng theo chiều ngang (Horizontal scalability) và tính đàn hồi (Elasticity)
Chỉ cần lưu trữ dữ liệu cấu trúc
Luôn cần strong consistency
Theo định lý CAP, bất kỳ cơ sở dữ liệu phân tán nào có dữ liệu chia sẻ chỉ có thể có tối đa hai trong ba thuộc tính mong muốn là gì?
A. Atomicity, Consistency, Isolation
B. Consistency, Availability, Partition Tolerance
C. Availability, Durability, Transaction
D. Scalability, Simplicity, Flexibility
Các cơ sở dữ liệu truyền thống (RDBMS) được xây dựng dựa trên nguyên tắc nào?
BASE
Eventual Consistency
ACID (Atomicity, Consistency, Isolation, Durability)
High Availability, High Scalability
Các thuộc tính BASE (Basically Available, Soft-State, Eventual Consistency) thường được áp dụng cho loại cơ sở dữ liệu nào?
Cơ sở dữ liệu quan hệ (RDBMS)
Cơ sở dữ liệu phân tán với sự đảm bảo ACID bị nới lỏng
Hệ thống tệp tin cục bộ
Các hệ thống đòi hỏi strict consistency
Đặc điểm nào của NoSQL cho phép thêm vào dữ liệu mà không cần định nghĩa lược đồ trước đó?
Yêu cầu CSDL phải được định nghĩa trước khi thêm dữ liệu
Schema less, flexible schema (Lược đồ linh hoạt)
Phải hỗ trợ các truy vấn SQL phức tạp
Phải đáp ứng khả năng xử lý giao dịch với tính nhất quán chặt chẽ
Mô hình dữ liệu Key/value (Khóa/Giá trị) có đặc điểm gì nổi bật?
Hỗ trợ các phép toán Join phức tạp
Giao diện Key/value đơn giản (GET, PUT, DELETE) và dễ dàng mở rộng
Giá trị chỉ chứa dữ liệu cấu trúc
Được tối ưu hóa cho truy vấn đồ thị
DynamoDB của Amazon được mô tả là loại cửa hàng dữ liệu gì và ưu tiên thuộc tính nào theo CAP?
Column family store; ưu tiên Consistency
Scalable key-value store; hy sinh strong consistency cho availability
Graph data model; ưu tiên Strong consistency
Document store; ưu tiên Partition Tolerance
DynamoDB là một zero-hop DHT có nghĩa là gì?
DynamoDB là multiple-hop DHT
DynamoDB là one-hop DHT
DynamoDB là zero-hop DHT
DynamoDB sử dụng Merkle tree để phân vùng
Trong mô hình Quorum-like của DynamoDB, điều kiện nào phải thỏa mãn để đảm bảo tính nhất quán (Consistency) tiềm năng? (N là tổng số replicas, R là số nodes tối thiểu đọc thành công, W là số nodes tối thiểu ghi thành công)
A. R = W
B. R + W > N
C. R > N hoặc W > N
D. R + W = N
Kỹ thuật nào được DynamoDB sử dụng để đồng bộ hóa các bản sao phân kỳ trong nền (anti-entropy)?
Consistent Hashing
Sloppy Quorum
Merkle Tree (cây băm)
Vector clock
Mô hình dữ liệu Column family (Họ Cột) có đặc điểm gì về cấu trúc?
Dữ liệu được lưu trữ theo kiểu row-by-row
Có lược đồ động (Dynamic schema), là bản đồ đa chiều phân tán, thưa thớt
Luôn yêu cầu alter table khi thêm cột mới
Là Key/value đơn giản
Apache HBase là một CSDL cột mở rộng phân tán được xây dựng trên nền tảng nào?
MySQL
HDFS
MongoDB
Kafka
HBase có tính chất là NoSQL nên không có ngôn ngữ truy vấn mức cao như SQL. Nó phải sử dụng API để thực hiện những thao tác nào?
Put, Get, Scan
Join, Select phức tạp
Transaction ACID
Store Procedure
Apache Cassandra được biết đến với mô hình phân phối nào và ưu điểm chính về khả năng mở rộng là gì?
Mô hình Master-slave; tối ưu cho truy vấn đồ thị
Mô hình Peer-to-peer; nổi tiếng về khả năng mở rộng tuyến tính (linear scale out)
Mô hình Client-server; ưu tiên Consistency
Mô hình Document; hỗ trợ Full ACID
Graph database (CSDL Đồ thị) được tối ưu hóa cho loại truy vấn nào?
Tối ưu hóa cho các phép tổng hợp (aggregation)
Tối ưu hóa cho các kết nối (connections) và duyệt dữ liệu liên kết
Tối ưu hóa cho tra cứu đơn giản (simple look-ups)
Tối ưu hóa cho dữ liệu dạng "cây"
MongoDB là một ví dụ điển hình của mô hình dữ liệu nào, sử dụng định dạng JSON?
Document
Key-Value
Column-Family
Graph
MongoDB đạt được khả năng mở rộng và chịu lỗi bằng cách nào?
Replica set (cho tính sẵn sàng) và Sharding (cho khả năng mở rộng ngang)
Chỉ bằng cách tăng cấu hình máy chủ
Chỉ hỗ trợ một nút Master duy nhất
Yêu cầu giao dịch 2PC (Two-Phase Commit)
Trong DynamoDB, các nút ảo (Virtual nodes) mang lại lợi ích gì khi một nút vật lý không khả dụng?
Giảm chi phí I/O
Tải do nút đó xử lý được phân tán đồng đều qua các nút còn lại
Đảm bảo strong consistency
Giảm độ trễ giao tiếp mạng
Cơ chế nào được NoSQL sử dụng để tăng khả năng chịu lỗi?
Phân mảnh và phân tán dữ liệu ra nhiều máy chủ
Nhân bản (Replication)
Giao diện truy vấn đơn giản
Tăng cường giao dịch ACID
HBase là hệ thống quản lý cơ sở dữ liệu nào và nó có hỗ trợ truy vấn dạng SQL hay không?
HBase là một CSDL cột phân tán, không có ngôn ngữ truy vấn mức cao như SQL.
HBase có hỗ trợ truy vấn dạng SQL.
HBase hỗ trợ versioning.
HBase là hệ thống độc lập, không cần Zookeeper.
MapReduce được mô tả là gì?
Một mô hình lập trình để xử lý và tạo ra tập dữ liệu lớn với thuật toán song song trên cụm máy tính.
Một hệ quản trị cơ sở dữ liệu quan hệ.
Một phần mềm để quản lý mạng máy tính.
Một công cụ để thiết kế giao diện người dùng.
MapReduce là gì?
Một ngôn ngữ lập trình
Mô thức xử lý dữ liệu mặc định trong Hadoop
Một hệ thống tệp tin phân tán
Một công cụ trực quan hóa dữ liệu
Một công việc MapReduce (MR job) là một công việc được phân rã thành nhiều thành phần nào?
Các tiến trình đồng bộ
Các tác vụ độc lập (Isolated Tasks)
Các nodes máy chủ
Các bản ghi
Để lập trình với MapReduce, người dùng cần cài đặt hai hàm nào?
Read và Write
Map và Reduce
Filter và Sort
Gather và Product
Trong bước Map của MapReduce, số lượng các tác vụ Mapping được xác định theo yếu tố nào?
Số lượng Reducer
Lượng dữ liệu đầu vào (tương đương số chunks)
Số lượng node máy chủ
Số lượng bản ghi đầu ra
Bước nào trong MapReduce mà Hadoop tự động sắp xếp và gộp đầu ra của các Mappers theo các partitions, trong đó mỗi partition là đầu vào cho một Reducer?
Map phase
Reduce phase
Shuffle & sort phase
Input split phase
Khi nào MapReduce được sử dụng để xử lý dữ liệu lớn?
Xử lý dữ liệu lớn theo khối (Batch processing)
Xử lý dữ liệu nhỏ theo thời gian thực
Xử lý dữ liệu phi cấu trúc
Xử lý dữ liệu phân tán nhỏ lẻ
Trong ví dụ tìm kiếm (Search algorithm) bằng MapReduce, Mapper có nhiệm vụ gì?
Đếm số lần xuất hiện của từ
Nếu nội dung tệp tin khớp với "pattern" thì output (filename, _)
Tính tổng doanh số theo nhân viên
Sắp xếp dữ liệu
Trong thuật toán Search MapReduce, hàm Combiner được sử dụng để làm gì?
Tăng cường I/O mạng
Gộp các cặp (filename, _) dư thừa thành một cặp duy nhất để giảm I/O mạng
Tính tổng các giá trị
Phân tán dữ liệu tới các Reducer
TF-IDF (Term Frequency – Inverse Document Frequency) là giải thuật MapReduce liên quan đến lĩnh vực nào?
Tính toán trên đồ thị
Xử lý văn bản (text processing)
Tìm đường đi ngắn nhất
Sắp xếp
Đối với thuật toán Breadth-First Search (BFS) trên MapReduce, vấn đề chính khi cố gắng gửi toàn bộ đồ thị tới các map task là gì?
Độ trễ mạng thấp
Đòi hỏi một lượng lớn bộ nhớ
Tăng tính nhất quán
Không cần lặp lại
Câu 61: Trong phương pháp lặp lại (Iterated passes) của MapReduce để duyệt đồ thị (ví dụ: BFS), kết quả của một lần MapReduce được đưa vào đâu cho lần lặp tiếp theo?
Được đưa vào làm đầu vào cho lần MapReduce tiếp theo
Được lưu trữ trong bộ nhớ tạm thời
Được gửi đến hệ thống giám sát
Được loại bỏ sau mỗi lần lặp
Công cụ nào trong hệ sinh thái Hadoop cung cấp giao diện xử lý dữ liệu mức cao, đặc biệt tốt cho các phép toán Join và Transformation, sử dụng ngôn ngữ PigLatin và biến dịch thành MapReduce jobs?
Apache Hive
Apache Pig
Apache HBase
Apache Sqoop
Công cụ nào cung cấp ngôn ngữ HiveQL (SQL-like language) để chuyển đổi thành MapReduce jobs?
Apache Pig
Apache Hive
Apache Spark
Apache Presto
Apache Sqoop là công cụ được sử dụng để làm gì trong hệ sinh thái Hadoop?
Lập lịch luồng công việc
Trung chuyển dữ liệu theo khối giữa Apache Hadoop và các CSDL có cấu trúc (ví dụ: CSDL quan hệ)
Cung cấp chức năng phối hợp phân tán độ tin cậy cao
Phân tích dữ liệu theo luồng
Apache Oozie là một hệ thống được thiết kế cho mục đích gì?
Truy vấn SQL hiệu năng cao
Quản lý tài nguyên cụm Hadoop
Lập lịch luồng công việc để quản lý các công việc thực thi trên cụm Hadoop
Lưu trữ dữ liệu NoSQL
Nhược điểm chính của việc sử dụng chuỗi các job MapReduce lặp lại là gì, mà Spark đã tìm cách khắc phục?
MapReduce quá nhanh
Đòi hỏi thao tác I/O với dữ liệu trên HDFS, làm cho I/O trên ổ đĩa cứng rất chậm
Không hỗ trợ lập trình song song
Khả năng chịu lỗi kém
Spark khác MapReduce ở điểm nào về mặt lưu trữ và xử lý?
Spark chỉ sử dụng HDD
Spark sử dụng cả bộ nhớ trong (RAM) và HDD, hỗ trợ tốt hơn cho các giải thuật có tính lặp
Spark chỉ có hai thao tác Map và Reduce
MapReduce hỗ trợ Scala, Java, Python và R
RDDs (Resilient Distributed Datasets) trong Spark có đặc điểm nào sau đây?
Không có khả năng chịu lỗi
Là cấu trúc dữ liệu song song, có khả năng chịu lỗi và tự động tái tạo lại khi bị lỗi
Được thiết kế tối ưu cho các thao tác cập nhật quá chi tiết (fine-grained updates)
Là cấu trúc dữ liệu bất biến, không thể thay đổi
RDD được thiết kế tối ưu cho loại biến đổi nào?
Các thao tác cập nhật quá chi tiết
Các biến đổi thô, theo lô (coarse-grained transformations) như map, filter và join
Các phép toán chỉ tác động lên một đối tượng dữ liệu riêng lẻ
Các thao tác yêu cầu đồng bộ phức tạp giữa các nodes
Một RDD cơ sở có thể được tạo theo hai cách nào?
Biến đổi từ một DataFrame đã có hoặc từ pandas
Song song hóa một collection (ví dụ mảng trong Python) hoặc đọc dữ liệu từ một nguồn bên ngoài (S3, HDFS, etc)
Chỉ từ tệp tin cục bộ
Chỉ từ HDFS
Hai dạng thao tác chính trên RDD là gì?
Đọc và Ghi
Transformations (Biến đổi) và Actions (Hành động)
Put và Get
Map và Reduce
Đặc điểm của Transformations trong Spark là gì?
Luôn được tính toán ngay lập tức
Là lazy (không được tính toán ngay lập tức), chỉ thực thi khi một action được gọi
Luôn tạo ra RDD mới với cùng số partition với RDD đầu vào
Luôn yêu cầu Spark lưu RDD vào bộ đệm
Action nào sau đây được sử dụng để trả về tất cả các bản ghi (records) của DataFrame dưới dạng một list of Row?
show()
take(n)
count()
collect()
Dataframe được mô tả là gì trong Spark 2.0?
Một cấu trúc dữ liệu có thể thay đổi được (mutable)
Một lớp trừu tượng hóa dữ liệu chính, có tính bất biến
Một tập hợp các RDD có thể được cập nhật chi tiết
Một công cụ trực quan hóa dữ liệu
Trong các tham số Master của SparkContext, "local[K]" có nghĩa là gì?
Kết nối tới một Spark standalone cluster
Kết nối tới một YARN cluster
Chạy cục bộ, sử dụng song song K luồng tính toán
Chạy cục bộ, chỉ sử dụng 1 luồng tính toán
Narrow transformation (biến đổi hẹp) có đặc điểm gì?
Đòi hỏi dữ liệu phải buộc phân tán lại giữa các phân vùng
Không đòi hỏi dữ liệu phải buộc phân tán lại giữa các phân vùng
Chỉ áp dụng cho DataFrame
Chỉ áp dụng cho RDD
Không đòi hỏi dữ liệu phải được phân tán lại giữa các phân vùng
Luôn được nhóm lại thành một stage duy nhất
Không đòi hỏi dữ liệu phải được phân tán lại giữa các phân vùng
Ví dụ: reduceByKey
Trong Spark ML, Transformer là một lớp mà có thể tạo ra DataFrame mới bằng cách nào?
Bằng cách cài đặt phương thức fit()
Bằng cách biến đổi một DataFrame ban đầu, cài đặt phương thức transform()
Bằng cách tạo ra một Pipeline
Bằng cách tạo ra một Estimator
Trong Spark ML, Estimator là lớp mà lấy đầu vào là một DataFrame và trả về một đối tượng gì?
Một RDD mới
Một PipelineModel
Một Transformer
Một SparkContext
Pipeline trong Spark ML là gì?
Là một Transformer dùng để kiểm thử
Là một Estimator bao gồm một chuỗi các màn (stage) mà mỗi stage là estimator hoặc transformer
Là một chức năng để tính toán đại số tuyến tính
Là một công cụ trực quan hóa kết quả học máy
Công cụ nào trong hệ sinh thái Hadoop được sử dụng để cấp phát lượng tài nguyên (bộ nhớ và CPU cores) phù hợp cho các ứng dụng khi có yêu cầu?
HDFS
MapReduce
YARN (Yet Another Resource Negotiator)
Apache Zookeeper
Apache Kafka là hệ thống truyền thông điệp nào?
Hệ thống truyền thông điểm-tới-điểm (point-to-point)
Hệ thống publish-subscribe (xuất bản-đăng ký) nhanh, có khả năng mở rộng, bền vững và chịu lỗi
Hệ thống CSDL quan hệ
Hệ thống tệp tin phân tán
Trong Kafka, các tiến trình mà xuất bản message tới một Kafka topic được gọi là gì?
Consumers
Brokers
Producers
Zookeepers
Trong kiến trúc Kafka, Kafka Cluster được cấu thành từ những thành phần nào?
Nhiều Brokers và Zookeeper
Chỉ có Producers và Consumers
Chỉ có Topics và Partitions
Chỉ có Leader và Follower
Các Kafka Topics được chia thành các thành phần nào để phục vụ cho việc mở rộng Kafka trên nhiều servers?
Log files
Segments
Partitions
Consumer Groups
Trong Kafka, thứ tự (Order) của các bản ghi được duy trì ở cấp độ nào?
Toàn bộ Topic
Toàn bộ Kafka Cluster
Trong một partition duy nhất
Giữa các Consumer Group
Đối với một Partition trong Kafka, server nào xử lý tất cả các yêu cầu đọc và ghi?
Follower server
In-sync replica (ISR)
Leader server
Broker bất kỳ
Khi nào một bản ghi (Record) trong Kafka được coi là "committed"?
Khi Producer gửi thành công đến Broker
Khi tất cả các ISRs cho partition đã ghi vào log của chúng
Khi Consumer bắt đầu đọc bản ghi đó
Khi Zookeeper xác nhận
Kafka cluster giữ lại tất cả các bản ghi đã xuất bản (published records) dựa trên cơ chế nào?
Chỉ giữ lại đến khi tất cả Consumer đã tiêu thụ
Dựa trên thời gian (time-based) và kích thước (size-based)
Chỉ sử dụng cơ chế compaction
Chỉ giữ lại trong bộ nhớ trong
Một bản ghi trong Kafka được gửi đến Partition chính xác bằng cách nào?
Producer quyết định Partition, thường bằng "round-robin" hoặc "semantic partitioning" dựa trên key
Consumer quyết định Partition
Broker quyết định Partition
Zookeeper quyết định Partition
Consumer Group trong Kafka có vai trò gì?
Một Consumer Group là một Subscriber duy nhất.
Mỗi Consumer Group duy trì offset riêng của mình và load balance việc tiêu thụ bản ghi giữa các Consumers trong nhóm.
Tất cả các bản ghi được broadcast đến tất cả các Consumer instance trong nhóm.
Mỗi Consumer trong nhóm phải đọc từ tất cả các Partition.
Điều gì xảy ra khi số lượng Consumer instance trong một Consumer Group vượt quá số lượng Partition của Topic?
Tăng tốc độ xử lý
Các Consumer dư thừa sẽ ở trạng thái idle, có thể được dùng cho failover
Kafka tự động tạo thêm Partition
Dữ liệu sẽ bị mất
Spark Streaming sử dụng kỹ thuật nào để xem xét luồng dữ liệu như là một chuỗi liên tục của các RDDs?
Structured Streaming
DStream (Discretized Stream)
Batch processing & Dataframe
Các RDD trong DStream là gì?
Toàn bộ luồng dữ liệu đầu vào
Các phân đoạn dữ liệu (data segment) của luồng dữ liệu đầu vào
Kết quả cuối cùng của việc xử lý luồng
Các biến Broadcast
Output operations trên DStream có vai trò gì?
Biến đổi dữ liệu trên DStream
Kích hoạt sự thực thi của các DStream transformations và ghi dữ liệu ra các hệ thống bên ngoài
Giữ lại các bản ghi thỏa mãn điều kiện
Tạo ra một DStream mới
Trong Structured Streaming, dữ liệu đầu vào được xem như là loại bảng nào?
Bảng tĩnh (Static table)
Bảng chỉ thêm (Append-only table)
Bảng quan hệ
Bảng tạm thời
Câu 96: Ưu điểm chính của Structured Streaming so với DStreams là gì?
Structured Streaming cung cấp khả năng xử lý dữ liệu theo thời gian thực với đảm bảo tính nhất quán đầu ra.
Structured Streaming hỗ trợ ít nguồn dữ liệu hơn DStreams.
Structured Streaming yêu cầu cấu hình phức tạp hơn DStreams.
Structured Streaming không hỗ trợ tích hợp với Spark SQL.
Trong Structured Streaming, khi đọc dữ liệu từ nguồn dưới dạng luồng, phương thức nào được sử dụng thay cho load()?
write()
save()
stream()
startStream()
