WorksheetsKiểm tra dữ liệu lớn
Total questions: 55
Worksheet time: 33mins
Điền vào chỗ trống với câu trả lời đúng nhất: Định lý CAP phát biểu rằng tất cả cùng một lúc trong một hệ thống máy tính phân tán?
không thể có tính nhất quán, độ chính xác và khả năng chịu lỗi một phần
cần phải có tính nhất quán, độ chính xác và khả năng chịu lỗi một phần
không thể có tính nhất quán, tính khả dụng và khả năng chịu lỗi phân vùng
cần phải có tính nhất quán, tính khả dụng và khả năng chịu lỗi phân vùng
Cơ sở dữ liệu nào sẽ phù hợp nhất cho trường hợp sau: Một công ty bán buôn lớn đang cố gắng triển khai công cụ tìm kiếm cho các sản phẩm của họ.
Redis
Aerospike
Solr
Vertica
Trong số những điều sau đây, quy trình nào khái quát tốt nhất các quy trình dữ liệu lớn chẳng hạn như (nhưng không giới hạn) quy trình giảm bản đồ?
chia->sắp xếp->hợp nhất
chia->làm->hợp nhất
chia->ánh xạ->xáo trộn và sắp xếp->giảm
chia->xáo trộn và sắp xếp->ánh xạ->giảm
Phân cụm K-nghĩa là gì?
Chia các mẫu bằng k dòng.
Phân loại dữ liệu theo k quyết định.
Nhóm các mẫu thành k cụm.
Phân loại dữ liệu theo k hành động.
Kiến trúc lambda là gì?
Một phương pháp cụ thể để xử lý dữ liệu trực tuyến bằng cách sử dụng các quy trình thời gian thực đặc biệt.
Một kiến trúc phần cứng cụ thể cho máy chủ được tạo riêng để xử lý dữ liệu thời gian thực.
Một phương pháp để xử lý dữ liệu trực tuyến bằng cách sử dụng xử lý theo lô và xử lý thời gian thực.
What is schema-on-read? (Schema-on-read là gì?)
A. The process where formatted data is given structure when read. (Quá trình mà dữ liệu được định dạng có cấu trúc khi đọc.)
B. Another name for data lakes. (Một tên khác cho data lakes.)
C. Data is stored as raw data until it is read by an application where the application assigns structure. (Dữ liệu được lưu trữ dưới dạng dữ liệu thô cho đến khi nó được đọc bởi một ứng dụng, nơi ứng dụng gán cấu trúc.)
D. The process where data is pre-formatted prior to being read but the schema is loaded on read. (Quá trình mà dữ liệu được định dạng trước trước khi được đọc nhưng lược đồ được tải khi đọc.)
Which of the following data types are supported by Redis? (Redis hỗ trợ những kiểu dữ liệu nào sau đây?)
A. Sorted Sets (Tập hợp đã sắp xếp)
B. Images (Hình ảnh)
C. Lists (Danh sách)
D. Strings (Chuỗi)
In attribute grouping, how would one evaluate if two attributes should go together? (Trong nhóm thuộc tính, làm thế nào để đánh giá xem hai thuộc tính có nên đi cùng nhau không?)
A. Probability of Two Attributes Co-occurring (Xác suất hai thuộc tính cùng xuất hiện)
B. Integrated Views (Chế độ xem tích hợp)
C. Similarity of Attributes (Sự tương đồng của các thuộc tính)
D. Customer Interaction (Tương tác của khách hàng)
What is Apache Hadoop? (Apache Hadoop là gì?)
A. A distributed storage and batch processing framework (Một khung xử lý hàng loạt và lưu trữ phân tán)
B. A real-time in-memory processing engine (Một công cụ xử lý trong bộ nhớ thời gian thực)
C. A database for structured data (Một cơ sở dữ liệu cho dữ liệu có cấu trúc)
D. A cloud computing service (Một dịch vụ điện toán đám mây)
Which of the following is NOT one of the 5 P's of Data Science? (Điều nào sau đây KHÔNG phải là một trong 5 chữ P của Khoa học dữ liệu?)
People (Con người)
Problem (Vấn đề)
Profit (Lợi nhuận)
Process (Quá trình)
Which machine learning technique is best suited for customer segmentation in a retail business? (Kỹ thuật học máy nào phù hợp nhất để phân khúc khách hàng trong ngành bán lẻ?)
Clustering (Phân cụm)
Decision Tree (Cây quyết định)
Recommendation System (Hệ thống đề xuất)
Regression (Hồi quy)
Một ngân hàng muốn dự đoán liệu người nộp đơn xin vay có bị vỡ nợ hay không dựa trên lịch sử tài chính của họ. Họ nên sử dụng thuật toán học máy nào?
Clustering (Phân cụm)
Decision Tree (Cây quyết định)
Recommendation System (Hệ thống đề xuất)
Principal Component Analysis (PCA. (Phân tích thành phần chính)
Kỹ thuật nào phù hợp nhất để đề xuất sản phẩm cho người mua sắm trực tuyến dựa trên lịch sử duyệt web và mua hàng của họ?
Clustering (Phân cụm)
Decision Tree (Cây quyết định)
Recommendation System (Hệ thống đề xuất)
Reinforcement Learning (Học tăng cường)
Một công ty viễn thông muốn phát hiện các loại khách hàng khác nhau dựa trên thời lượng cuộc gọi, mức sử dụng dữ liệu và hoạt động SMS của họ. Họ nên sử dụng phương pháp nào?
Clustering (Phân cụm)
Decision Tree (Cây quyết định)
Recommendation System (Hệ thống đề xuất)
Time Series Analysis (Phân tích chuỗi thời gian)
Cái nào sau đây KHÔNG phải là một loại cơ sở dữ liệu NoSQL?
Document Store (Kho lưu trữ tài liệu)
Key-Value Store (Kho lưu trữ Key-Value)
Graph Database (Cơ sở dữ liệu đồ thị)
Relational Database (Cơ sở dữ liệu quan hệ)
Loại cơ sở dữ liệu NoSQL nào tốt nhất để lưu trữ các tài liệu linh hoạt giống như JSON?
Document Store (Kho lưu trữ tài liệu)
Key-Value Store (Kho lưu trữ Key-Value)
Relational Database (Cơ sở dữ liệu quan hệ)
Column-Family Store (Kho lưu trữ theo cột)
Sự khác biệt chính giữa cơ sở dữ liệu SQL và NoSQL là gì?
Cơ sở dữ liệu SQL không có lược đồ, trong khi NoSQL yêu cầu một lược đồ nghiêm ngặt.
Cơ sở dữ liệu NoSQL mở rộng theo chiều dọc, trong khi cơ sở dữ liệu SQL mở rộng theo chiều ngang.
Cơ sở dữ liệu SQL sử dụng các bảng có cấu trúc, trong khi cơ sở dữ liệu NoSQL có thể linh hoạt về lược đồ.
Loại cơ sở dữ liệu nào phù hợp nhất để xử lý các mối quan hệ phức tạp giữa dữ liệu, chẳng hạn như mạng xã hội?
Kho lưu trữ tài liệu
Kho lưu trữ Key-Value
Cơ sở dữ liệu đồ thị
Kho lưu trữ theo cột
Điều nào sau đây là lợi thế của cơ sở dữ liệu NoSQL so với cơ sở dữ liệu SQL?
Tuân thủ ACID mạnh mẽ hơn
Phù hợp hơn với dữ liệu có cấu trúc
Khả năng mở rộng và tính linh hoạt cao
Luôn nhanh hơn SQL
Một nền tảng truyền thông xã hội cần lưu trữ và phân tích các kết nối bạn bè, lượt thích và nội dung được chia sẻ một cách hiệu quả. Mô hình NoSQL nào là lựa chọn tốt nhất?
Kho lưu trữ Key-Value
Kho lưu trữ tài liệu
Cơ sở dữ liệu đồ thị
Kho lưu trữ theo cột
Một công ty thương mại điện tử lớn muốn lưu trữ giỏ hàng của người dùng với tốc độ đọc và ghi nhanh. Mỗi giỏ hàng có một số lượng mặt hàng và thuộc tính động. Họ nên sử dụng mô hình NoSQL nào?
Kho lưu trữ Key-Value
Kho lưu trữ tài liệu
Cơ sở dữ liệu đồ thị
Kho lưu trữ theo cột
Một trang web tin tức cần một cơ sở dữ liệu có thể lưu trữ và tìm kiếm các bài báo có cấu trúc khác nhau, chẳng hạn như blog, báo cáo tin tức và bài xã luận. Mô hình NoSQL nào phù hợp nhất?
Kho lưu trữ Key-Value
Kho lưu trữ tài liệu
Cơ sở dữ liệu đồ thị
Kho lưu trữ theo cột
Mô hình NoSQL nào phù hợp nhất?
Key-Value Store (Kho lưu trữ Key-Value)
Document Store (Kho lưu trữ tài liệu)
Graph Database (Cơ sở dữ liệu đồ thị)
Column-Family Store (Kho lưu trữ theo cột)
Họ nên sử dụng mô hình NoSQL nào?
Key-Value Store (Kho lưu trữ Key-Value)
Document Store (Kho lưu trữ tài liệu)
Column-Family Store (Kho lưu trữ theo cột)
Graph Database (Cơ sở dữ liệu đồ thị)
Họ nên sử dụng mô hình cơ sở dữ liệu nào?
Key-Value Store (Kho lưu trữ Key-Value)
Document Store (Kho lưu trữ tài liệu)
Graph Database (Cơ sở dữ liệu đồ thị)
Relational Database (Cơ sở dữ liệu quan hệ)
Mục đích chính của giai đoạn Map trong MapReduce là gì?
Aggregating data (Tổng hợp dữ liệu)
Filtering data (Lọc dữ liệu)
Processing and generating key-value pairs (Xử lý và tạo các cặp key-value)
Storing data (Lưu trữ dữ liệu)
Bộ ánh xạ sẽ xuất ra gì?
(word, 1) (từ, 1)
(1, word) (1, từ)
(word, count) (từ, số lượng)
(word, total) (từ, tổng)
Điều nào sau đây KHÔNG phải là lợi thế của việc sử dụng MapReduce?
Scalability (Khả năng mở rộng)
Fault tolerance (Khả năng chịu lỗi)
Real-time data processing (Xử lý dữ liệu thời gian thực)
Parallel processing (Xử lý song song)
Loại dữ liệu nào đang được xử lý?
Structured (Có cấu trúc)
Semi-structured (Bán cấu trúc)
Unstructured (Không có cấu trúc)
Loại dữ liệu nào đang được xử lý?
Có cấu trúc
Bán cấu trúc
Không có cấu trúc
Quan hệ
Đây là loại dữ liệu nào?
Có cấu trúc
Bán cấu trúc
Không có cấu trúc
Key-Value
Đây là loại dữ liệu nào?
Có cấu trúc
Bán cấu trúc
Không có cấu trúc
Chuẩn hóa
Điều này mô tả đặc điểm nào của dữ liệu lớn?
Sự đa dạng
Vận tốc
Khối lượng
Độ tin cậy
Điều này thể hiện đặc điểm nào của dữ liệu lớn?
Khối lượng
Vận tốc
Giá trị
Độ biến thiên
Kịch bản này thể hiện đặc điểm nào của dữ liệu lớn?
Độ tin cậy
Khối lượng
Sự đa dạng
Độ biến thiên
Đặc điểm nào của dữ liệu lớn?
Một công ty gặp khó khăn với các vấn đề về chất lượng dữ liệu do các giá trị bị thiếu và định dạng không nhất quán trong phản hồi của khách hàng. Đặc điểm nào của dữ liệu lớn là thách thức lớn nhất?
Variability (Độ biến thiên)
Veracity (Độ tin cậy)
Value (Giá trị)
Valence (Giá trị)
Cái nào sau đây là một ví dụ về dữ liệu lớn được tạo ra bởi máy móc?
Bài đăng trên mạng xã hội
Số đọc cảm biến IoT
Đánh giá của khách hàng
Báo cáo tài chính
Nguồn nào đóng góp vào dữ liệu lớn được tạo ra bởi con người?
Cảnh quay camera giám sát
Theo dõi GPS
Đánh giá và nhận xét trực tuyến
Tệp nhật ký từ máy chủ web
Cái nào sau đây KHÔNG phải là một trong 6 chữ V của Dữ liệu lớn?
Khối lượng
Sự đa dạng
Vận tốc
Ảo hóa
Hadoop sử dụng loại hệ thống lưu trữ nào?
Hệ thống quản lý cơ sở dữ liệu quan hệ
Kho lưu trữ Key-Value
Hệ thống tệp phân tán Hadoop
Bộ điều phối tài nguyên
Khung xử lý nào sau đây sử dụng tính toán trong bộ nhớ để có hiệu suất nhanh hơn?
Hadoop MapReduce
Spark
Hive
Pig
Một công ty thu thập cảnh quay video thô từ camera giám sát. Đây là loại dữ liệu nào?
Có cấu trúc
Bán cấu trúc
Không có cấu trúc
Siêu dữ liệu
Có bao nhiêu byte trong một exabyte (EB.?)
Tỷ
Nghìn tỷ
Triệu tỷ
Tỷ tỷ
Công nghệ Dữ liệu lớn nào
Công nghệ Dữ liệu lớn nào thường được sử dụng cho các hệ thống đề xuất như Netflix và Amazon?
Spark
Hadoop
Học máy
Pig
Một chiếc xe tự lái cần xử lý dữ liệu cảm biến theo thời gian thực để tránh va chạm. Thách thức lớn nhất là gì?
Khối lượng
Vận tốc
Độ tin cậy
Sự đa dạng
Nếu một tập dữ liệu là 5 terabyte (TB., thì nó xấp xỉ bao nhiêu gigabyte (GB.)?
5,000,000 GB
5,120 GB
51,200 GB
500 GB
Có bao nhiêu megabyte (MB. trong 1 gigabyte (GB.)?
100
512
1,000
1,024
Dữ liệu có cấu trúc thường được lưu trữ như thế nào?
Dưới dạng các cặp key-value
Trong cơ sở dữ liệu quan hệ
Dưới dạng tệp văn bản thô
Trong tệp excel
Một ổ cứng có dung lượng 5 TB. Xấp xỉ, nó có bao nhiêu megabyte (MB.)?
5,000 MB
51,200 MB
512,000 MB
5,120,000 MB
Cơ sở dữ liệu NoSQL nào được biết đến nhiều nhất với tính khả dụng cao và khả năng chịu lỗi trong môi trường phân tán?
MongoDB
Redis
Cassandra
MySQL
Cơ sở dữ liệu NoSQL nào chủ yếu được sử dụng để lưu trữ key-value và bộ nhớ đệm trong bộ nhớ?
Redis
MongoDB
Cassandra
PostgreSQL
Cơ sở dữ liệu NoSQL nào sử dụng mô hình hướng tài liệu với cấu trúc giống JSON?
Cassandra
Redis
MongoDB
Neo4j
Cơ sở dữ liệu NoSQL nào hỗ trợ các giao dịch ACID theo mặc định?
MongoDB
Redis
Cassandra
Không có cái nào ở trên
