wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Câu hỏi về Biểu đồ và Dữ liệu lớn

Total questions: 75

Worksheet time: 38mins

Name
Class
Date
1.

Stacked Bars Chart là loại biểu đồ gì?

a)

Biểu đồ phân tán

b)

Biểu đồ cột xếp chồng

c)

Biểu đồ nhiều đường xen kẽ

d)

Biểu đồ cột

2.

Biểu đồ nào có sự kết hợp giữa biểu đồ cột và biểu đồ đường?

a)

Biểu đồ Pareto

b)

Biểu đồ Box Pilot

c)

Biểu đồ Stacked Bars

d)

Biểu đồ Scatter

3.

Nhược điểm của Rừng ngẫu nhiên là gì?

a)

Yêu cầu tập dữ liệu lớn

b)

Yêu cầu tập dữ liệu nhỏ

c)

Yêu cầu tập dữ liệu phân loại và hồi quy

d)

Giảm thiểu overfitting

4.

Đường cong ROC (Receiver Operating Characteristic) là gì?

a)

Đường cong hiển thị độ chính xác so với độ nhạy

b)

Đường cong hiển thị tỷ lệ TP so với tỷ lệ FP

c)

Đường cong hiển thị tỷ lệ FP so với tỷ lệ TN

d)

Đường cong hiển thị tỷ lệ TN so với tỷ lệ FN

5.

Ảnh hưởng của việc chọn k lớn trong thuật toán k-NN là gì?

a)

Overfitting

b)

Tăng độ nhạy của mô hình

c)

Mô hình nhạy cảm với nhiễu

d)

Underfitting

6.

Data Warehouse được sử dụng để làm gì?

a)

Xử lý dữ liệu lớn

b)

Lưu trữ dữ liệu từ nhiều nguồn dữ liệu khác nhau

c)

Lưu trữ dữ liệu thô từ nhiều nguồn dữ liệu khác nhau

d)

Quản lý hệ thống Hadoop MapReduce

7.

Loại dữ liệu mà Hadoop có thể xử lý?

a)

Tất cả đều đúng

b)

Dữ liệu phi cấu trúc

c)

Dữ liệu có cấu trúc

d)

Dữ liệu bán cấu trúc

8.

Các mô hình phân loại đạt hiệu quả khi nào?

a)

Độ phủ FPR cao hơn TPR

b)

Đường cong ROC không tiệm cận với [0,1]

c)

FPR thấp và TPR cao

d)

AUC tiệm cận với [0,1]

9.

Quá trình tiền xử lý dữ liệu không bao gồm bước nào sau đây?

a)

Chuẩn hóa dữ liệu

b)

Làm sạch dữ liệu

c)

Loại bỏ dữ liệu nhiễu

d)

Mô hình hóa dữ liệu

10.

Dữ liệu lớn (BIG DATA) có mấy đặc trưng?

a)

5

b)

4

c)

6

d)

7

11.

Tính Entropy của tập dữ liệu con có 9 đúng, 6 sai:

(a)  

12.

Tính khoảng cách từ A(4,4) đến C(3,2):

(a)  

13.

Phương pháp rút gọn dữ liệu "chọn thuộc tính con" còn gọi là gì?

a)

data reduction

b)

subset selection

c)

subset attribute selection

d)

attribute selection

14.

Đâu là công nghệ xử lý dữ liệu lớn?

a)

Spark, PowerBI, Tableau

b)

Hadoop Yarn, HDFS, NoSQL

c)

Hadoop MapReduce, HDFS, NoSQL

d)

Hadoop MapReduce, Spark

15.

Mô tả mô hình Snowflake Schema của Data Warehouse:

a)

Tất cả đều đúng

b)

Mô hình được thiết kế để lưu trữ dữ liệu quan hệ với cáu trúc phân cấp và phân tách

c)

Snowflafe Schema là một phiên bản mở rộng của Star Schema

d)

Dimension Table được chia nhỏ thành các lớp Lookup Table

16.

Mô tả mô hình Snowflake Schema của Data Warehouse:

a)

Tất cả đều đúng

b)

Mô hình được thiết kế để lưu trữ dữ liệu quan hệ với cấu trúc phân cấp và phân tách

c)

Snowflake Schema là một phiên bản mở rộng của Star Schema

d)

Dimension Table được chia nhỏ thành các Lookup Table

17.

Chuẩn hóa dữ liệu thập phân là gì?

a)

z-score normalization

b)

min-max normalization

c)

decimal scaling normalization

d)

normalization by decimal scaling

18.

Biểu đồ nào thích hợp để hiển thị sự thay đổi của một biến số theo thời gian?

a)

Biểu đồ hộp

b)

Biểu đồ phân tán

c)

Biểu đồ diện tích

d)

Biểu đồ đường

19.

Nguyên lý "cây nào càng gọn thì càng tốt hơn" của cây quyết định do ai định nghĩa?

a)

Beckham Razor

b)

J. Ross Quinlan

c)

Ockham's Razor

d)

Shannon

20.

Phương pháp "inconsistent data" thuộc về giai đoạn nào của tiền xử lý dữ liệu?

a)

Data Cleaning

b)

Data Integration

c)

Data Reduction

d)

Data Transformation

21.

Quá trình làm sạch dữ liệu có thể thực hiện công việc nào sau đây?

a)

Thêm các biến ngẫu nhiên

b)

Xây dựng giá trị biên

c)

Xóa bỏ dữ liệu thiếu

d)

Thêm dữ liệu nhiễu

22.

Tên biểu đồ: 7810, 22, -4413

a)

Scatter Chart

b)

Box Pilot

c)

Pareto Chart

d)

Line Chart

23.

Dimension Table có thể được liên kết với Lookup Table thông qua?

a)

Tất cả đều sai

b)

Khóa liên kết

c)

Khóa ngoại

d)

Khóa chính

24.

Dữ liệu lớn (BIG DATA) có khối lượng dữ liệu như thế nào?

a)

Rất lớn và phức tạp

b)

Tốc độ xử lý rất nhanh

c)

Rất đa dạng

d)

Tương đối lớn

25.

Phương pháp học không giám sát sử dụng cho các mô hình nào?

a)

Hồi quy logistic

b)

Support Vector Machine (SVM)

c)

Phân cụm dữ liệu

d)

Phân lớp dữ liệu

26.

Mô hình Star Schema của Data Warehouse bao gồm:

a)

Dimension Table là trung tâm liên kết với các Fact Table

b)

Dimension Table là trung tâm liên kết với các Lookup Table

c)

Fact Table là trung tâm liên kết với các Lookup Table

d)

Fact Table là trung tâm liên kết với các Dimension Table

27.

Phương pháp phân chia nào chia dữ liệu thành nhiều tập con?

a)

AUC

b)

Hold-out

c)

K-fold cross validation

d)

Confunsion matrix

28.

Phương pháp phân chia nào chia dữ liệu thành nhiều tập con?

a)

AUC

b)

Hold-out

c)

K-fold cross validation

d)

Confusion matrix

29.

Thuật toán k-means dựa trên phương pháp nào?

a)

Phân phối

b)

Dự đoán

c)

Khoảng cách

d)

Tương quan

30.

Các đặc trưng của dữ liệu lớn (BIG DATA) là:

a)

Veracity, Variecity, Value, Volume, Velocity

b)

Volume, Value, Veracity, Variety, Varaiecity

c)

Variety, Volume, Velocity, Veracity, Value

d)

Volume, Velocity, Variable, Veracity, Variety

31.

Quy trình tiêu chuẩn công nghiệp chéo để khai phá dữ liệu là gì?

a)

SCRIPT-DM

b)

CRISP-DM

c)

Data Understanding

d)

Business Understanding

32.

Trong đánh giá mô hình, False Negative (FN) là gì?

a)

Dự đoán sự kiện xảy ra và thực tế nó xảy ra

b)

Dự đoán sự kiện không xảy ra và thực tế nó không xảy ra

c)

Dự đoán sự kiện không xảy ra nhưng thực tế nó xảy ra

d)

Dự đoán sự kiện xảy ra nhưng thực tế nó không xảy ra

33.

Thuật toán Naïve Bayes được sử dụng cho các bài toán nào?

a)

Giảm chiều dữ liệu

b)

Hồi quy tuyến tính

c)

Phân cụm dữ liệu

d)

Phân lớp dữ liệu

34.

Các máy trạm trong một hệ thống Hadoop được gọi là gì?

a)

Slave

b)

Node

c)

Master

d)

Root

35.

Data Lake được sử dụng để làm gì?

a)

Xử lý dữ liệu lớn

b)

Lưu trữ dữ liệu thô từ nhiều nguồn dữ liệu khác nhau

c)

Lưu trữ dữ liệu từ nhiều nguồn dữ liệu khác nhau

d)

Quản lý hệ thống Hadoop MapReduce

36.

Phương pháp "data cube aggregation" là gì?

a)

Rời rạc hóa

b)

Thu giảm lượng

c)

Kết hợp khối dữ liệu

d)

Chọn thuộc tính con

37.

Trong Hadoop MapReduce, hàm Reduce() dùng để làm gì?

a)

Xử lý các dữ liệu được phân tán từ các Node

b)

Sắp xếp lại các dữ liệu được xuất ra bởi hàm Map()

c)

Tổng hợp các kết quả được xuất ra bởi hàm Map() và Shuffle()

d)

Tạo cặp khóa hoàn chỉnh (key3,value3)

38.

Trong đánh giá mô hình, True Positive (TP) là gì?

a)

Dự đoán sự kiện xảy ra nhưng thực tế nó không xảy ra

b)

Dự đoán sự kiện không xảy ra và thực tế nó không xảy ra

c)

Dự đoán sự kiện xảy ra và thực tế nó xảy ra

d)

Dự đoán sự kiện không xảy ra nhưng thực tế nó xảy ra

39.

Dự đoán sự kiện xảy ra nhưng thực tế nó không xảy ra?

a)

Dự đoán sự kiện không xảy ra và thực tế nó không xảy ra

b)

Dự đoán sự kiện xảy ra và thực tế nó xảy ra

c)

Dự đoán sự kiện không xảy ra nhưng thực tế nó xảy ra

40.

Bước xử lý dữ liệu trong khoa học dữ liệu là gì?

a)

Data processing

b)

Data analysis

c)

Data Visualization

d)

Data preprocessing

41.

Chuẩn hóa "z-score" rất hữu dụng khi nào?

a)

Không biết giá trị lớn nhất, nhỏ nhất thực tế của thuộc tính A

b)

Không biết giá trị lớn nhất, nhỏ nhất thực tế của giá trị biên (outliers)

c)

Không biết giá trị lớn nhất, nhỏ nhất thực tế của chuẩn hóa min-max

d)

Các giá trị biên (outliers) chi phối chuẩn hóa dữ liệu thập phân

42.

Mô hình Star Schema không có loại bảng nào?

a)

Tất cả các bảng trên

b)

Fact Table

c)

Lookup Table

d)

Dimension Table

43.

AUC (Area Under Curve) đánh giá điều gì?

a)

Khả năng phân biệt giữa các lớp của mô hình

b)

Tỷ lệ lỗi của mô hình

c)

Độ chính xác của mô hình

d)

Đánh giá True Positive (TP) của mô hình

44.

Đâu là công nghệ xử lý dữ liệu lớn?

a)

Spark, PowerBI, Tableau

b)

Hadoop Yarn, HDFS, NoSQL

c)

Hadoop MapReduce, HDFS, NOSQL

d)

Hadoop MapReduce, Spark

45.

Giá trị F1-Score là gì?

a)

Trung bình cộng của Precision và Recall

b)

Trung bình nhân của Precision và Recall

c)

Trung bình điều hòa của Precision và Recall

d)

Độ phủ TPR (True Positive Rate)

46.

Kỹ thuật nào sau đây thường được sử dụng trong Data mining?

a)

Tất cả đều đúng

b)

Classification

c)

Regression

d)

Clustering

47.

Để phát hiện các ngoại lệ (outliers) trong dữ liệu, ta thường sử dụng biểu đồ nào?

a)

Box Pilot

b)

Line Chart

c)

Pareto Chart

d)

Scatter Chart

48.

Thuật toán Rừng ngẫu nhiên có tên là gì?

a)

Random Fogest

b)

Random Forest

c)

Random Forget

d)

Random Decision Tree

49.

Đặc trưng VELOCITY của dữ liệu lớn (BIG DATA) là gì?

a)

Tốc độ xử lý dữ liệu

b)

Khối lượng dữ liệu

c)

Sự đa dạng dữ liệu

d)

Tính xác thực dữ liệu

50.

Phương pháp "attribute construction" thuộc về giai đoạn nào của tiền xử lý dữ liệu?

a)

Data Integration

b)

Data Reduction

c)

Data Cleaning

d)

Data Transformation

51.

Trong Data mining, khái niệm "underfiting" ám chỉ điều gì ?

a)

Mô hình không đủ thông số

b)

Mô hình hoạt động tốt trên dữ liệu huấn luyện nhưng kém trên dữ liệu mới

c)

Mô hình hoạt động kém trên dữu liệu huấn luyện và kém trên dữ liệu mới

d)

Mô hình có quá nhiều thông số huấn luyện vượt mức

52.

Phương pháp "attribute construction" thuộc về giai đoạn nào của tiền xử lý dữ liệu?

a)

Data Integration

b)

Data Reduction

c)

Data Cleaning

d)

Data Transformation

53.

Trong Data mining, khái niệm "underfitting" ám chỉ điều gì?

a)

Mô hình không đủ thông số

b)

Mô hình hoạt động tốt trên dữ liệu huấn luyện nhưng kém trên dữ liệu mới

c)

Mô hình hoạt động kém trên dữ liệu huấn luyện và kém trên dữ liệu mới

d)

Mô hình có quá nhiều thông số huấn luyện vượt mức

54.

Tên biểu đồ: 00, 00, South Dakota

a)

Pareto Chart

b)

Scatter Chart

c)

Box Pilot

d)

Bubble Chart

55.

Thuật toán nào được sử dụng cho các bài toán phân cụm dữ liệu?

a)

K-Means

b)

Support Vector Machine (SVM)

c)

Cây quyết định

d)

K-NN

56.

Cấu trúc của Data Warehouse?

a)

Tầng phân tích thống kê, tầng dữ liệu đầu vào và tầng xử lý

b)

Tầng xử lý dữ liệu đầu vào, tầng thống kê và tầng phân tích

c)

Tầng dữ liệu đầu vào, tầng phân tích và tầng thống kê

d)

Tầng dữ liệu đầu vào, tầng xử lý và tầng phân tích

57.

HDFS là viết tắt của từ nào sau đây?

a)

Hadoop Data Final System

b)

Hadoop Digital File System

c)

Hadoop Distribute File System

d)

Hadoop Distributed File System

58.

Data Lake sử dụng quy trình nào?

a)

ETL

b)

OLAP

c)

ELT

d)

TCCP

59.

HDFS là gì?

a)

Hệ thống tập tin phân tán của Hadoop

b)

Hệ thống xử lý dữ liệu của Hadoop

c)

Hệ thống quản lý dữ liệu lớn của Hadoop

d)

Hệ thống thư viện của Hadoop

60.

Trong đánh giá mô hình, True Negative (TN) là gì?

a)

Dự đoán sự kiện xảy ra và thực tế nó xảy ra

b)

Dự đoán sự kiện không xảy ra và thực tế nó không xảy ra

c)

Dự đoán sự kiện xảy ra nhưng thực tế nó không xảy ra

d)

Dự đoán sự kiện không xảy ra nhưng thực tế nó xảy ra

61.

Khuyết điểm của thuật toán SVM?

a)

Không xử lý được dữ liệu phi tuyến

b)

Không xử lý được dữ liệu tuyến tính

c)

Nhạy cảm với nhiễu

d)

Tốn nhiều bộ nhớ

62.

Giá trị Precision trong đánh giá mô hình là gì?

a)

Độ chính xác của dự đoán

b)

Tỉ lệ dự đoán sai của mô hình

c)

Sự chính xác

d)

Tỉ lệ dự đoán đúng của mô hình

63.

Đâu là nguồn dữ liệu để hình thành nên dữ liệu lớn (BIG DATA)?

a)

Tất cả đều đúng

b)

Dữ liệu từ các thiết bị cảm biến

c)

Dữ liệu từ các trang mạng xã hội

d)

Dữ liệu từ các thiết bị IoT

64.

Đâu là nguồn dữ liệu để hình thành nên dữ liệu lớn (BIG DATA)?

a)

Tất cả đều đúng

b)

Dữ liệu từ các thiết bị cảm biến

c)

Dữ liệu từ người dùng

d)

Dữ liệu từ hoạt động thương mại

65.

Thành phần xử lý dữ liệu trong Hadoop là gì?

a)

HDFS

b)

Hadoop MapReduce

c)

Hadoop Yarn

d)

Hadoop Common

66.

Các đặc trưng của dữ liệu lớn (BIG DATA) là:

a)

Tốc độ, đa dạng, khối lượng, ý nghĩa, tin cậy

b)

Khối lượng, đa dạng, tốc độ, xử lý, tính xác thực

c)

Khối lượng, đa dạng, tốc độ, giá trị, tính xác thực

d)

Khối lượng, tốc độ, đa dạng, giá trị, chính xác

67.

Data Warehouse sử dụng quy trình nào?

a)

ELT

b)

OLAP

c)

TCCP

d)

ETL

68.

Nguyên lý Ockham's Razor phát biểu về mô hình cây quyết định như thế nào?

a)

Cây nào càng nhiều nhánh thì càng tốt hơn

b)

Cây nào càng phức tạp thì càng tốt hơn

c)

Cây nào càng gọn thì càng tốt hơn

d)

Cây nào có từ ba nhánh trở lên thì tốt

69.

Trong Hadoop MapReduce, hàm Map() dùng để làm gì?

a)

Tạo cặp khóa trung gian (key2,value2)

b)

Sắp xếp lại các dữ liệu được xuất ra bởi hàm Reduce()

c)

Xử lý các dữ liệu được phân tán từ các Node

d)

Tổng hợp các kết quả thành cặp khóa hoàn chỉnh (key3, value3)

70.

Ma trận nhầm lẫn (confusion matrix) dùng để làm gì?

a)

Đánh giá độ chính xác của mô hình

b)

Tìm độ lệch chuẩn của mô hình

c)

Đánh giá hiệu quả mô hình

d)

Đánh giá True Positive (TP) của mô hình

71.

Đặc trưng VOLUME của dữ liệu lớn (BIG DATA) là gì?

a)

Tính xác thực dữ liệu

b)

Tốc độ xử lý dữ liệu

c)

Sự đa dạng dữ liệu

d)

Khối lượng dữ liệu

72.

Biểu đồ nào thể hiện dữ liệu qua màu sắc đậm nhạt khác nhau?

a)

Box pilot

b)

Scatter Chart

c)

Pie Chart

d)

Heat map

73.

Phương pháp phân chia dữ liệu nào hiệu quả ở tập dữ liệu lớn?

a)

Hold-out

b)

K-fold cross validation

c)

Confusion matrix

d)

AUC

74.

Toàn bộ hệ thống Hadoop có bao nhiêu thành phần chính?

a)

2

b)

3

c)

5

d)

4

75.

CONCU MINH ANH MAU GI

a)

7MAU

b)

DO

c)

BAC

d)

HONG