Font size
WorksheetsCâu hỏi về Biểu đồ và Dữ liệu lớn
Total questions: 75
Worksheet time: 38mins
Stacked Bars Chart là loại biểu đồ gì?
Biểu đồ phân tán
Biểu đồ cột xếp chồng
Biểu đồ nhiều đường xen kẽ
Biểu đồ cột
Biểu đồ nào có sự kết hợp giữa biểu đồ cột và biểu đồ đường?
Biểu đồ Pareto
Biểu đồ Box Pilot
Biểu đồ Stacked Bars
Biểu đồ Scatter
Nhược điểm của Rừng ngẫu nhiên là gì?
Yêu cầu tập dữ liệu lớn
Yêu cầu tập dữ liệu nhỏ
Yêu cầu tập dữ liệu phân loại và hồi quy
Giảm thiểu overfitting
Đường cong ROC (Receiver Operating Characteristic) là gì?
Đường cong hiển thị độ chính xác so với độ nhạy
Đường cong hiển thị tỷ lệ TP so với tỷ lệ FP
Đường cong hiển thị tỷ lệ FP so với tỷ lệ TN
Đường cong hiển thị tỷ lệ TN so với tỷ lệ FN
Ảnh hưởng của việc chọn k lớn trong thuật toán k-NN là gì?
Overfitting
Tăng độ nhạy của mô hình
Mô hình nhạy cảm với nhiễu
Underfitting
Data Warehouse được sử dụng để làm gì?
Xử lý dữ liệu lớn
Lưu trữ dữ liệu từ nhiều nguồn dữ liệu khác nhau
Lưu trữ dữ liệu thô từ nhiều nguồn dữ liệu khác nhau
Quản lý hệ thống Hadoop MapReduce
Loại dữ liệu mà Hadoop có thể xử lý?
Tất cả đều đúng
Dữ liệu phi cấu trúc
Dữ liệu có cấu trúc
Dữ liệu bán cấu trúc
Các mô hình phân loại đạt hiệu quả khi nào?
Độ phủ FPR cao hơn TPR
Đường cong ROC không tiệm cận với [0,1]
FPR thấp và TPR cao
AUC tiệm cận với [0,1]
Quá trình tiền xử lý dữ liệu không bao gồm bước nào sau đây?
Chuẩn hóa dữ liệu
Làm sạch dữ liệu
Loại bỏ dữ liệu nhiễu
Mô hình hóa dữ liệu
Dữ liệu lớn (BIG DATA) có mấy đặc trưng?
5
4
6
7
Tính Entropy của tập dữ liệu con có 9 đúng, 6 sai:
(a)
Tính khoảng cách từ A(4,4) đến C(3,2):
(a)
Phương pháp rút gọn dữ liệu "chọn thuộc tính con" còn gọi là gì?
data reduction
subset selection
subset attribute selection
attribute selection
Đâu là công nghệ xử lý dữ liệu lớn?
Spark, PowerBI, Tableau
Hadoop Yarn, HDFS, NoSQL
Hadoop MapReduce, HDFS, NoSQL
Hadoop MapReduce, Spark
Mô tả mô hình Snowflake Schema của Data Warehouse:
Tất cả đều đúng
Mô hình được thiết kế để lưu trữ dữ liệu quan hệ với cáu trúc phân cấp và phân tách
Snowflafe Schema là một phiên bản mở rộng của Star Schema
Dimension Table được chia nhỏ thành các lớp Lookup Table
Mô tả mô hình Snowflake Schema của Data Warehouse:
Tất cả đều đúng
Mô hình được thiết kế để lưu trữ dữ liệu quan hệ với cấu trúc phân cấp và phân tách
Snowflake Schema là một phiên bản mở rộng của Star Schema
Dimension Table được chia nhỏ thành các Lookup Table
Chuẩn hóa dữ liệu thập phân là gì?
z-score normalization
min-max normalization
decimal scaling normalization
normalization by decimal scaling
Biểu đồ nào thích hợp để hiển thị sự thay đổi của một biến số theo thời gian?
Biểu đồ hộp
Biểu đồ phân tán
Biểu đồ diện tích
Biểu đồ đường
Nguyên lý "cây nào càng gọn thì càng tốt hơn" của cây quyết định do ai định nghĩa?
Beckham Razor
J. Ross Quinlan
Ockham's Razor
Shannon
Phương pháp "inconsistent data" thuộc về giai đoạn nào của tiền xử lý dữ liệu?
Data Cleaning
Data Integration
Data Reduction
Data Transformation
Quá trình làm sạch dữ liệu có thể thực hiện công việc nào sau đây?
Thêm các biến ngẫu nhiên
Xây dựng giá trị biên
Xóa bỏ dữ liệu thiếu
Thêm dữ liệu nhiễu
Tên biểu đồ: 7810, 22, -4413
Scatter Chart
Box Pilot
Pareto Chart
Line Chart
Dimension Table có thể được liên kết với Lookup Table thông qua?
Tất cả đều sai
Khóa liên kết
Khóa ngoại
Khóa chính
Dữ liệu lớn (BIG DATA) có khối lượng dữ liệu như thế nào?
Rất lớn và phức tạp
Tốc độ xử lý rất nhanh
Rất đa dạng
Tương đối lớn
Phương pháp học không giám sát sử dụng cho các mô hình nào?
Hồi quy logistic
Support Vector Machine (SVM)
Phân cụm dữ liệu
Phân lớp dữ liệu
Mô hình Star Schema của Data Warehouse bao gồm:
Dimension Table là trung tâm liên kết với các Fact Table
Dimension Table là trung tâm liên kết với các Lookup Table
Fact Table là trung tâm liên kết với các Lookup Table
Fact Table là trung tâm liên kết với các Dimension Table
Phương pháp phân chia nào chia dữ liệu thành nhiều tập con?
AUC
Hold-out
K-fold cross validation
Confunsion matrix
Phương pháp phân chia nào chia dữ liệu thành nhiều tập con?
AUC
Hold-out
K-fold cross validation
Confusion matrix
Thuật toán k-means dựa trên phương pháp nào?
Phân phối
Dự đoán
Khoảng cách
Tương quan
Các đặc trưng của dữ liệu lớn (BIG DATA) là:
Veracity, Variecity, Value, Volume, Velocity
Volume, Value, Veracity, Variety, Varaiecity
Variety, Volume, Velocity, Veracity, Value
Volume, Velocity, Variable, Veracity, Variety
Quy trình tiêu chuẩn công nghiệp chéo để khai phá dữ liệu là gì?
SCRIPT-DM
CRISP-DM
Data Understanding
Business Understanding
Trong đánh giá mô hình, False Negative (FN) là gì?
Dự đoán sự kiện xảy ra và thực tế nó xảy ra
Dự đoán sự kiện không xảy ra và thực tế nó không xảy ra
Dự đoán sự kiện không xảy ra nhưng thực tế nó xảy ra
Dự đoán sự kiện xảy ra nhưng thực tế nó không xảy ra
Thuật toán Naïve Bayes được sử dụng cho các bài toán nào?
Giảm chiều dữ liệu
Hồi quy tuyến tính
Phân cụm dữ liệu
Phân lớp dữ liệu
Các máy trạm trong một hệ thống Hadoop được gọi là gì?
Slave
Node
Master
Root
Data Lake được sử dụng để làm gì?
Xử lý dữ liệu lớn
Lưu trữ dữ liệu thô từ nhiều nguồn dữ liệu khác nhau
Lưu trữ dữ liệu từ nhiều nguồn dữ liệu khác nhau
Quản lý hệ thống Hadoop MapReduce
Phương pháp "data cube aggregation" là gì?
Rời rạc hóa
Thu giảm lượng
Kết hợp khối dữ liệu
Chọn thuộc tính con
Trong Hadoop MapReduce, hàm Reduce() dùng để làm gì?
Xử lý các dữ liệu được phân tán từ các Node
Sắp xếp lại các dữ liệu được xuất ra bởi hàm Map()
Tổng hợp các kết quả được xuất ra bởi hàm Map() và Shuffle()
Tạo cặp khóa hoàn chỉnh (key3,value3)
Trong đánh giá mô hình, True Positive (TP) là gì?
Dự đoán sự kiện xảy ra nhưng thực tế nó không xảy ra
Dự đoán sự kiện không xảy ra và thực tế nó không xảy ra
Dự đoán sự kiện xảy ra và thực tế nó xảy ra
Dự đoán sự kiện không xảy ra nhưng thực tế nó xảy ra
Dự đoán sự kiện xảy ra nhưng thực tế nó không xảy ra?
Dự đoán sự kiện không xảy ra và thực tế nó không xảy ra
Dự đoán sự kiện xảy ra và thực tế nó xảy ra
Dự đoán sự kiện không xảy ra nhưng thực tế nó xảy ra
Bước xử lý dữ liệu trong khoa học dữ liệu là gì?
Data processing
Data analysis
Data Visualization
Data preprocessing
Chuẩn hóa "z-score" rất hữu dụng khi nào?
Không biết giá trị lớn nhất, nhỏ nhất thực tế của thuộc tính A
Không biết giá trị lớn nhất, nhỏ nhất thực tế của giá trị biên (outliers)
Không biết giá trị lớn nhất, nhỏ nhất thực tế của chuẩn hóa min-max
Các giá trị biên (outliers) chi phối chuẩn hóa dữ liệu thập phân
Mô hình Star Schema không có loại bảng nào?
Tất cả các bảng trên
Fact Table
Lookup Table
Dimension Table
AUC (Area Under Curve) đánh giá điều gì?
Khả năng phân biệt giữa các lớp của mô hình
Tỷ lệ lỗi của mô hình
Độ chính xác của mô hình
Đánh giá True Positive (TP) của mô hình
Đâu là công nghệ xử lý dữ liệu lớn?
Spark, PowerBI, Tableau
Hadoop Yarn, HDFS, NoSQL
Hadoop MapReduce, HDFS, NOSQL
Hadoop MapReduce, Spark
Giá trị F1-Score là gì?
Trung bình cộng của Precision và Recall
Trung bình nhân của Precision và Recall
Trung bình điều hòa của Precision và Recall
Độ phủ TPR (True Positive Rate)
Kỹ thuật nào sau đây thường được sử dụng trong Data mining?
Tất cả đều đúng
Classification
Regression
Clustering
Để phát hiện các ngoại lệ (outliers) trong dữ liệu, ta thường sử dụng biểu đồ nào?
Box Pilot
Line Chart
Pareto Chart
Scatter Chart
Thuật toán Rừng ngẫu nhiên có tên là gì?
Random Fogest
Random Forest
Random Forget
Random Decision Tree
Đặc trưng VELOCITY của dữ liệu lớn (BIG DATA) là gì?
Tốc độ xử lý dữ liệu
Khối lượng dữ liệu
Sự đa dạng dữ liệu
Tính xác thực dữ liệu
Phương pháp "attribute construction" thuộc về giai đoạn nào của tiền xử lý dữ liệu?
Data Integration
Data Reduction
Data Cleaning
Data Transformation
Trong Data mining, khái niệm "underfiting" ám chỉ điều gì ?
Mô hình không đủ thông số
Mô hình hoạt động tốt trên dữ liệu huấn luyện nhưng kém trên dữ liệu mới
Mô hình hoạt động kém trên dữu liệu huấn luyện và kém trên dữ liệu mới
Mô hình có quá nhiều thông số huấn luyện vượt mức
Phương pháp "attribute construction" thuộc về giai đoạn nào của tiền xử lý dữ liệu?
Data Integration
Data Reduction
Data Cleaning
Data Transformation
Trong Data mining, khái niệm "underfitting" ám chỉ điều gì?
Mô hình không đủ thông số
Mô hình hoạt động tốt trên dữ liệu huấn luyện nhưng kém trên dữ liệu mới
Mô hình hoạt động kém trên dữ liệu huấn luyện và kém trên dữ liệu mới
Mô hình có quá nhiều thông số huấn luyện vượt mức
Tên biểu đồ: 00, 00, South Dakota
Pareto Chart
Scatter Chart
Box Pilot
Bubble Chart
Thuật toán nào được sử dụng cho các bài toán phân cụm dữ liệu?
K-Means
Support Vector Machine (SVM)
Cây quyết định
K-NN
Cấu trúc của Data Warehouse?
Tầng phân tích thống kê, tầng dữ liệu đầu vào và tầng xử lý
Tầng xử lý dữ liệu đầu vào, tầng thống kê và tầng phân tích
Tầng dữ liệu đầu vào, tầng phân tích và tầng thống kê
Tầng dữ liệu đầu vào, tầng xử lý và tầng phân tích
HDFS là viết tắt của từ nào sau đây?
Hadoop Data Final System
Hadoop Digital File System
Hadoop Distribute File System
Hadoop Distributed File System
Data Lake sử dụng quy trình nào?
ETL
OLAP
ELT
TCCP
HDFS là gì?
Hệ thống tập tin phân tán của Hadoop
Hệ thống xử lý dữ liệu của Hadoop
Hệ thống quản lý dữ liệu lớn của Hadoop
Hệ thống thư viện của Hadoop
Trong đánh giá mô hình, True Negative (TN) là gì?
Dự đoán sự kiện xảy ra và thực tế nó xảy ra
Dự đoán sự kiện không xảy ra và thực tế nó không xảy ra
Dự đoán sự kiện xảy ra nhưng thực tế nó không xảy ra
Dự đoán sự kiện không xảy ra nhưng thực tế nó xảy ra
Khuyết điểm của thuật toán SVM?
Không xử lý được dữ liệu phi tuyến
Không xử lý được dữ liệu tuyến tính
Nhạy cảm với nhiễu
Tốn nhiều bộ nhớ
Giá trị Precision trong đánh giá mô hình là gì?
Độ chính xác của dự đoán
Tỉ lệ dự đoán sai của mô hình
Sự chính xác
Tỉ lệ dự đoán đúng của mô hình
Đâu là nguồn dữ liệu để hình thành nên dữ liệu lớn (BIG DATA)?
Tất cả đều đúng
Dữ liệu từ các thiết bị cảm biến
Dữ liệu từ các trang mạng xã hội
Dữ liệu từ các thiết bị IoT
Đâu là nguồn dữ liệu để hình thành nên dữ liệu lớn (BIG DATA)?
Tất cả đều đúng
Dữ liệu từ các thiết bị cảm biến
Dữ liệu từ người dùng
Dữ liệu từ hoạt động thương mại
Thành phần xử lý dữ liệu trong Hadoop là gì?
HDFS
Hadoop MapReduce
Hadoop Yarn
Hadoop Common
Các đặc trưng của dữ liệu lớn (BIG DATA) là:
Tốc độ, đa dạng, khối lượng, ý nghĩa, tin cậy
Khối lượng, đa dạng, tốc độ, xử lý, tính xác thực
Khối lượng, đa dạng, tốc độ, giá trị, tính xác thực
Khối lượng, tốc độ, đa dạng, giá trị, chính xác
Data Warehouse sử dụng quy trình nào?
ELT
OLAP
TCCP
ETL
Nguyên lý Ockham's Razor phát biểu về mô hình cây quyết định như thế nào?
Cây nào càng nhiều nhánh thì càng tốt hơn
Cây nào càng phức tạp thì càng tốt hơn
Cây nào càng gọn thì càng tốt hơn
Cây nào có từ ba nhánh trở lên thì tốt
Trong Hadoop MapReduce, hàm Map() dùng để làm gì?
Tạo cặp khóa trung gian (key2,value2)
Sắp xếp lại các dữ liệu được xuất ra bởi hàm Reduce()
Xử lý các dữ liệu được phân tán từ các Node
Tổng hợp các kết quả thành cặp khóa hoàn chỉnh (key3, value3)
Ma trận nhầm lẫn (confusion matrix) dùng để làm gì?
Đánh giá độ chính xác của mô hình
Tìm độ lệch chuẩn của mô hình
Đánh giá hiệu quả mô hình
Đánh giá True Positive (TP) của mô hình
Đặc trưng VOLUME của dữ liệu lớn (BIG DATA) là gì?
Tính xác thực dữ liệu
Tốc độ xử lý dữ liệu
Sự đa dạng dữ liệu
Khối lượng dữ liệu
Biểu đồ nào thể hiện dữ liệu qua màu sắc đậm nhạt khác nhau?
Box pilot
Scatter Chart
Pie Chart
Heat map
Phương pháp phân chia dữ liệu nào hiệu quả ở tập dữ liệu lớn?
Hold-out
K-fold cross validation
Confusion matrix
AUC
Toàn bộ hệ thống Hadoop có bao nhiêu thành phần chính?
2
3
5
4
CONCU MINH ANH MAU GI
7MAU
DO
BAC
HONG
