Font size
WorksheetsData Science Course - Midterm Exam
Total questions: 30
Worksheet time: 27mins
Bạn hãy chỉ ra quan điểm đúng nhất về Big Data?
Là tài sản chung có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng
Là tài sản thông tin có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng
Là tài sản có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng
Là tài sản quốc gia có khối lượng lớn, tốc độ nhanh và/hoặc rất đa dạng
Chữ "V" quan trọng nhất trong các đặc tính của Big Data là gì?
Volume: Khối lượng lớn
Velocity: Tốc độ nhanh
Variety: Đa dạng
Value: Giá trị
Một "block" trên HDFS của Hadoop v3.0 (trở lên) có kích thước mặc định là bao nhiêu?
64 MB
100 MB
128 MB
256 MB
Bạn có thể thao tác với tệp tin trên HDFS bằng những cách nào sau đây (chọn 2)?
Sử dụng cửa sổ lệnh
Sử dụng giao diện Web
Sử dụng phần mềm Word
Sử dụng phần mềm Notepad
Đâu là kiến trúc 3 Layers của Hadoop?
Application Layer, Business Layer, Data Layer
Application Layer, Business Layer, Data Access Layer
Application Layer, Resource Management Layer, Storage Layer
Presentation Layer, Business Layer, Data Access Layer
Khi thêm một máy mới vào hệ thống Hadoop cần phải khởi động lại toàn bộ hệ thống?
Đúng
Sai
Hadoop MapReduce có thể xử lý loại dữ liệu nào sau đây (chọn đúng nhất) ?
Dữ liệu văn bản
Dữ liệu hình ảnh
Dữ liệu video
Tất cả các đáp án đều đúng
Những phát biểu nào sau đây là đúng (chọn 2/4)?
Hadoop dựa trên Disk-based processing
Hadoop dựa trên In-memory processing
Spark dựa trên Disk-based Processing
Spark dựa trên In-memory processing
Phát biểu nào sau đây là sai về HDFS?
Là tệp tin ảo
Một tệp lớn được chia thành 128 block nhỏ theo mặc định
Là một thành phần của Hadoop
Hỗ trợ lưu trữ dữ liệu lớn phân tán
Đâu không phải là thành phần của Hadoop?
HDFS
MapReduce
Yarn
MLlib
Đâu là phát biểu đúng về MapReduce?
Là mô hình lập trình song song phân tán
Là hệ thống lưu trữ file phân tán của Hadoop
Là ngôn ngữ lập trình xử lý dữ liệu lớn
Là công cụ để chuyển dữ liệu giữa Hadoop và CSDL quan hệ
Giả sử bạn đang dùng MapReduce cho bài toán tính doanh thu trên mỗi sản phẩm từ nhiều hóa đơn bán hàng. Đầu ra là tên sản phẩm và doanh thu. Hãy nhập từ còn thiếu trong "..." để hoàn thành khai báo sau:
Reducer<LongWritable, Text, ..., LongWritable> cho phù hợp?
(a)
Đâu là các phát biểu đúng về Apache NiFi (chọn 2)
Là công cụ thu thập dữ liệu từ nhiều nguồn
Là công cụ dùng để trực quan hóa dữ liệu
Là công cụ xử lý tính toán phức tạp
Là công cụ hỗ trợ thiết kế, điều khiển luồng dữ liệu
Công cụ nào sau đây không có trong hệ sinh thái của Hadoop?
Hive
Spark
HBase
MySQL Server
Apache Spark hỗ trợ những ngôn ngữ lập trình nào sau đây?
Java
Python
Scala
C#
Apache Hive thường được sử dụng trong kịch bản nào?
Real-time processing
Data warehousing
Stream processing
Graph processing
Giả sử bạn đang viết chương trình MapReduce.
Hãy điền từ còn thiếu vào chỗ "..." để hoàn thành đoạn lệnh sau:
public static class MyMapper extends Mapper< ... , Text, Text, IntWritable> {
public void map(LongWritable key, Text value, Context context )
(a)
Vai trò của Processor trong Apache NiFi là gì?
Là nơi lưu trữ dữ liệu
Áp dụng các biến đổi cho FlowFile để tạo ra FlowFile mới
Tính toán phức tạp cho các dữ liệu lớn
Là nơi để nhập liệu từ bên ngoài vào hệ thống
Khoa học dữ liệu là khoa học về phân tích dữ liệu, là sự tổng hợp của ba lĩnh vực nào sau đây?
Toán & Thống kê
Khoa học máy tính
Kiến thức chuyên ngành
Dữ liệu lớn
Kiểu phân tích dữ liệu nào giúp con người ra quyết định nhanh chóng nhất?
Mô tả
Chẩn đoán
Dự đoán
Đề xuất
Nhóm kỹ năng cốt lõi của một nhà Khoa học dữ liệu là gì?
Kỹ thuật
Phân tích
Nghiệp vụ
Giao tiếp
Giả sử bạn muốn đọc dữ liệu từ tệp CSV để tạo DataFrame dùng thư viện Pandas trong Python, bạn sẽ sử dụng hàm nào? Điền vào ô dưới đây, bỏ qua dấu "()" ?
(a)
Khai báo nào sau đây không đúng để tạo một DataFrame sử dụng Pandas?
pd.DataFrame([[1, 2], [3, 4]], columns=['A', 'B'])
pd.DataFrame({'A': [1, 2], 'B': [3, 4]})
pd.DataFrame({'A': {1, 2}, 'B': {3,4}})
pd.DataFrame(data={'A': [1, 2], 'B': [3, 4]})
Trong Python bạn có thể sử dụng những thư viện nào để trực quan hóa dư liệu (chọn 2)?
matplotlib
seaborn
matplot
plotlib
Trong Python, để vẽ biểu đồ tròn thể hiện tỉ lệ phần trăm giữa các đối tượng, bạn sử dụng hàm nào của thư viện matplotlib?
pie
pieplot
bar
line
Đâu không phải là một thuật toán học máy dùng cho phát hiện bất thường?
DBSCAN
FP-GROWTH
KNN
SVM
Các lớp thường có trong một mạng CNN là gì (chọn 3/4)?
Lớp tích chập
Lớp Pooling
Lớp Fully Connected
Lớp ứng dụng
Thuật toán nào dưới đây khác với lớp các thuật toán còn lại?
DBSCAN
Fuzzy C-Means
Hierarchical clustering
K-nearest neighbors
Để làm việc với DataFrame trong Python bạn sử dụng thư viện nào sau đây?
Trong một dự án Khoa học dữ liệu, bước tiền xử lý dữ liệu thường bao gồm những công việc gì (chọn 3)?
Làm sạch dữ liệu
Tích hợp dữ liệu
Chuyển đổi dữ liệu
Trực quan hóa dữ liệu
