Font size
WorksheetsPage 1
Total questions: 91
Worksheet time: 46mins
Thách thức lớn nhất trong lưu trữ dữ liệu lớn là gì?
Dữ liệu không còn giá trị
Khối lượng dữ liệu tăng nhanh và đa dạng
Thiếu người sử dụng dữ liệu
Không có công cụ phân tích
Vì sao dữ liệu thô thường chưa mang lại nhiều giá trị cho doanh nghiệp?
Dữ liệu bị lỗi
Không thể lưu trữ
Chưa được xử lý, phân tích
Dữ liệu quá nhỏ
Kho dữ liệu (Data Warehouse) là gì?
Nơi lưu trữ dữ liệu tạm thời
Kho lưu trữ dữ liệu tập trung từ nhiều nguồn
Hệ thống xử lý dữ liệu thời gian thực
Một cơ sở dữ liệu NoSQL
Quy trình ETL KHÔNG bao gồm bước nào sau đây?
Extract
Transform
Transfer
Load
Vai trò chính của tầng trên cùng trong Data Warehouse là gì?
Lưu trữ dữ liệu
Làm sạch dữ liệu
Nơi chứa các câu truy vấn, báo cáo, phân tích
Thu thập dữ liệu
Hạn chế lớn nhất của Data Warehouse là gì?
Không lưu trữ được dữ liệu
Chi phí thấp
Khó thay đổi, kém linh hoạt với dữ liệu phi cấu trúc
Không hỗ trợ phân tích
Data Lake cho phép lưu trữ loại dữ liệu nào?
Chỉ dữ liệu có cấu trúc
Chỉ dữ liệu phi cấu trúc
Dữ liệu bán cấu trúc
Tất cả các loại dữ liệu
Đặc điểm nổi bật của Data Lake là gì?
Phải xác định lược đồ trước
Dữ liệu được lưu trữ nguyên dạng
Tối ưu cho truy vấn phức tạp ngay từ đầu
Chỉ dành cho dữ liệu có cấu trúc
Nhược điểm của Data Lake là gì?
Không mở rộng được
Chi phí cao
Rủi ro về bảo mật và kiểm soát dữ liệu
Không lưu trữ được dữ liệu lớn
Điểm khác biệt quan trọng giữa Data Warehouse và Data Lake là gì?
Dung lượng lưu trữ
Giá thành phần cứng
Thời điểm xác định lược đồ
Số lượng người dùng
Nguyên tắc xử lý dữ liệu lớn cơ bản là gì?
Xử lý tuần tự
Chia nhỏ và xử lý song song
Xử lý thủ công
Xử lý trên một máy chủ
HDFS có chức năng gì?
Xử lý song song
Quản lý tài nguyên
Lưu trữ dữ liệu phân tán
Truy vấn SQL
MapReduce có vai trò gì trong Hadoop?
Lưu trữ dữ liệu
Xử lý dữ liệu song song
Quản lý bảo mật
Giao tiếp mạng
YARN dùng để làm gì?
Lưu trữ dữ liệu
Quản lý tài nguyên hệ thống
Truy vấn dữ liệu
Thu thập log
Hive trong hệ sinh thái Hadoop cho phép làm gì?
Xử lý streaming
Truy vấn dữ liệu bằng SQL-like
Lưu trữ NoSQL
Apache Spark ra đời nhằm khắc phục hạn chế nào của Hadoop?
Không chịu lỗi
Không mở rộng được
Xử lý chậm do phụ thuộc ổ đĩa
Không mã nguồn mở
Lý do chính giúp Spark xử lý nhanh hơn Hadoop là gì?
Dùng CPU mạnh hơn
Lưu dữ liệu trên RAM
Ít dữ liệu hơn
Ít người dùng hơn
Spark Streaming dùng để làm gì?
Xử lý batch
Truy vấn SQL
Xử lý dữ liệu thời gian thực
Vẽ đồ thị
Thành phần nào của Spark hỗ trợ học máy?
Spark Core
Spark SQL
MLlib
Điện toán đám mây là gì?
Mô hình sử dụng máy tính cá nhân
Mô hình điện toán sử dụng các công nghệ máy tính cho lưu trữ dữ liệu và phát triển dựa vào mạng Internet
Hệ thống lưu trữ cục bộ
Mạng LAN
Public Cloud có đặc điểm nào sau đây?
Chỉ dùng nội bộ
Dùng chung tài nguyên
Chi phí rất cao
Không mở rộng được
Mô hình Cloud nào có mức độ bảo mật cao nhất?
Public Cloud
Community Cloud
Private Cloud
Hybrid Cloud
Hybrid Cloud là gì?
Cloud dùng chung
Cloud nội bộ
Kết hợp Public và Private Cloud
IaaS cung cấp dịch vụ gì?
Phần mềm hoàn chỉnh
Môi trường phát triển
Hạ tầng CNTT (máy chủ, mạng, lưu trữ)
Ứng dụng người dùng
PaaS phù hợp nhất với đối tượng nào?
Người dùng cuối
Nhà phát triển phần mềm
Nhà quản lý
Người học
SaaS có đặc điểm nào?
Người dùng tự quản lý hạ tầng
Chỉ dùng nội bộ
Cung cấp phần mềm hoàn chỉnh qua Internet
Không cần Internet
Hạn chế lớn nhất của điện toán đám mây là gì?
Không mở rộng được
Phụ thuộc vào Internet và vấn đề riêng tư
Chi phí đầu tư cao
Mục tiêu chính của phân tích dữ liệu lớn là gì?
Lưu trữ dữ liệu lâu dài
Tìm insight và hỗ trợ ra quyết định
Giảm dung lượng dữ liệu
Tăng tốc độ Internet
Phân tích dữ liệu lớn được hiểu đúng nhất là:
Chỉ sử dụng thống kê mô tả
Một quy trình khám phá mẫu, xu hướng và mối tương quan từ dữ liệu lớn
Chỉ áp dụng cho dữ liệu có cấu trúc
Chỉ dùng cho dự báo
Vai trò quan trọng nhất của phân tích dữ liệu lớn trong doanh nghiệp là:
Giảm nhân sự
Tăng dung lượng lưu trữ
Hỗ trợ ra quyết định dựa trên dữ liệu
Thay thế con người
Phân tích mô tả (Descriptive Analysis) trả lời câu hỏi nào?
Điều gì sẽ xảy ra?
Tại sao điều đó xảy ra?
Điều gì đã xảy ra?
Nên làm gì tiếp theo?
Phân tích mô tả thường được thể hiện dưới dạng nào?
Thuật toán học sâu
Báo cáo, biểu đồ, dashboard
Luật kết hợp
Mô hình dự đoán
Phân tích chẩn đoán (Diagnostic Analysis) dùng để:
Dự đoán tương lai
Đưa ra hành động tối ưu
Giải thích nguyên nhân xảy ra trong quá khứ
Lưu trữ dữ liệu
Phân tích dự đoán (Predictive Analysis) thường sử dụng kỹ thuật nào?
Báo cáo BI
Thống kê và học máy
Lưu trữ phân tán
ETL
Phân tích đề xuất (Prescriptive Analysis) giúp trả lời câu hỏi nào?
Điều gì đã xảy ra?
Tại sao xảy ra?
Điều gì sẽ xảy ra?
Nên hành động như thế nào?
Tác vụ nào KHÔNG thuộc quá trình chuẩn bị dữ liệu?
Làm sạch dữ liệu
Tích hợp dữ liệu
Trực quan hóa kết quả
Chuyển đổi dữ liệu
Làm sạch dữ liệu (Data Cleaning) là gì?
Nén dữ liệu
Loại bỏ hoặc sửa dữ liệu lỗi, thiếu, trùng lặp
Phân tích dữ liệu
Lưu trữ dữ liệu
Dữ liệu bị thiếu, nhiễu, không nhất quán thuộc vấn đề nào?
Lưu trữ
Chất lượng dữ liệu
Phân tích
Trực quan hóa
Giải pháp nào KHÔNG dùng để xử lý dữ liệu bị thiếu?
Loại bỏ dòng/cột
Thay thế bằng giá trị phù hợp
Dự đoán giá trị
Nhân bản dữ liệu ngẫu nhiên
Tích hợp dữ liệu là gì?
Chuyển đổi định dạng dữ liệu
Hợp nhất dữ liệu từ nhiều nguồn
Giảm kích thước dữ liệu
Chuẩn hóa dữ liệu
Rời rạc hóa (Discretization) là:
Chuyển dữ liệu số thành khoảng có nhãn
Nén dữ liệu
Tăng số chiều
Tạo dữ liệu mới
Thu gọn dữ liệu nhằm mục tiêu nào?
Tăng độ chính xác tuyệt đối
Giảm dữ liệu nhưng giữ thông tin chính
Loại bỏ hoàn toàn dữ liệu
Chỉ để lưu trữ
PCA (Principal Component Analysis) là phương pháp dùng để:
Phân lớp
Phân cụm
Giảm chiều dữ liệu
Phát hiện luật kết hợp
Giảm mất cân bằng dữ liệu thường áp dụng trong bài toán nào?
Báo cáo BI
Phân lớp
Trực quan hóa
Lưu trữ dữ liệu
Phân lớp (Classification) thuộc loại học nào?
Học không giám sát
Học tăng cường
Học có giám sát
Học ngẫu nhiên
Đầu ra của bài toán phân lớp là gì?
Giá trị liên tục
Nhãn lớp rời rạc
Tập luật
Cụm dữ liệu
KNN, SVM, Naive Bayes là các mô hình của:
Phân cụm
Phân lớp
Hồi quy
Luật kết hợp
Phân cụm (Clustering) có đặc điểm nào?
Cần dữ liệu gắn nhãn
Là học có giám sát
Là học không giám sát
Chỉ áp dụng cho dữ liệu nhỏ
Mục tiêu của phân cụm là:
Dự đoán giá trị
Gán nhãn trước
Nhóm các đối tượng tương đồng
Hồi quy khác phân lớp ở điểm nào?
Không cần dữ liệu
Đầu ra là giá trị liên tục
Không cần mô hình
Không dự đoán
Hai độ đo quan trọng trong luật kết hợp là:
Accuracy và Recall
Precision và F1
Support và Confidence
Mean và Variance
Tableau chủ yếu được dùng để:
Huấn luyện mô hình AI
Trực quan hóa dữ liệu và BI
Lưu trữ Big Data
Viết thuật toán
RapidMiner là công cụ phù hợp với:
Người không làm dữ liệu
Lập trình hệ điều hành
Khai phá dữ liệu và Machine Learning
Quản trị mạng
KNIME có ưu điểm nổi bật nào?
Chỉ dùng cho lập trình viên
Giao diện trực quan, hỗ trợ Python/R
Không hỗ trợ ML
Không mở rộng được
Trực quan hóa dữ liệu (Data Visualization) là gì?
Quá trình lưu trữ dữ liệu
Trình bày dữ liệu dưới dạng hình ảnh/đồ họa để truyền đạt thông tin hiệu quả
Một phương pháp nén dữ liệu
Một dạng lập trình dữ liệu
Lý do chính khiến trực quan hóa dữ liệu hiệu quả là vì:
Máy tính xử lý nhanh
Bộ não con người xử lý hình ảnh nhanh hơn văn bản
Dữ liệu luôn chính xác
Ít tốn chi phí
Vai trò quan trọng nhất của trực quan hóa dữ liệu là:
Trang trí báo cáo
Chuyển dữ liệu thành thông tin dễ hiểu để hỗ trợ ra quyết định
Lưu trữ dữ liệu lâu dài
Thay thế phân tích dữ liệu
Biểu đồ nào phù hợp nhất để so sánh các giá trị giữa các nhóm?
Biểu đồ tròn
Biểu đồ đường
Biểu đồ cột/thanh ngang
Biểu đồ nhiệt
Biểu đồ đường (Line chart) thường dùng để:
So sánh tỷ trọng
Thể hiện xu hướng theo thời gian
Phân bố địa lý
Đo tần suất
Biểu đồ tròn (Pie chart) phù hợp nhất khi:
So sánh nhiều tập dữ liệu lớn
Hiển thị xu hướng theo thời gian
Thể hiện cơ cấu, tỷ lệ các thành phần trong tổng thể
Phân tích mối quan hệ hai biến
Biểu đồ phân tán (Scatter plot) chủ yếu dùng để:
Hiển thị tỷ trọng
Thể hiện mối quan hệ giữa hai biến
So sánh giá trị theo thời gian
Tổng hợp dữ liệu
Biểu đồ nhiệt (Heatmap) thể hiện điều gì?
Thứ tự thời gian
Tần suất hoặc mức độ tác động thông qua màu sắc
Cơ cấu phần trăm
Xu hướng tăng giảm
Biểu đồ bản đồ (Map chart) được sử dụng khi:
So sánh doanh thu theo thời gian
Nhấn mạnh dữ liệu theo khu vực địa lý
Phân tích mối quan hệ hai biến
Hiển thị cơ cấu dữ liệu
Biểu đồ vùng (Area chart) khác biểu đồ đường ở điểm nào?
Không thể hiện xu hướng
Không dùng cho chuỗi thời gian
Phần dưới đường được tô màu để nhấn mạnh độ lớn
Không thể so sánh
Biểu đồ chỉ báo (Indicator chart) thường có dạng:
Biểu đồ cột
Đồng hồ đo hoặc chỉ số trực quan
Biểu đồ tròn
Biểu đồ phân tán
Biểu đồ kết hợp là gì?
Biểu đồ chỉ dùng một loại dữ liệu
Biểu đồ tích hợp nhiều dạng biểu đồ khác nhau
Biểu đồ không có trục
Biểu đồ dùng cho bản đồ
Nguyên tắc đầu tiên trong trực quan hóa dữ liệu là:
Chọn màu sắc đẹp
Xác định rõ mục tiêu và đối tượng sử dụng
Dùng nhiều biểu đồ
Dùng công cụ đắt tiền
Nguyên tắc “tối giản” trong trực quan hóa dữ liệu có nghĩa là:
Giảm dữ liệu
Chỉ dùng một biểu đồ
Loại bỏ các yếu tố không cần thiết để làm rõ thông điệp
Không dùng chữ
Tiêu đề và bình luận trong báo cáo trực quan cần:
Dài và chi tiết
Ngắn gọn, rõ ràng, đúng chỗ
Dùng nhiều thuật ngữ chuyên ngành
Viết càng nhiều càng tốt
Nguyên tắc “chọn đúng công cụ” nhấn mạnh điều gì?
Chọn công cụ phổ biến nhất
Chọn công cụ rẻ nhất
Phù hợp với nhu cầu, chi phí và khả năng mở rộng
Chọn công cụ khó nhất
Nguyên tắc dữ liệu “đầy đủ, trung thực” nhằm tránh điều gì?
Tốn dung lượng
Biểu đồ khó nhìn
Hiểu sai lệch thông tin
Tableau là sản phẩm của công ty nào?
Microsoft
Salesforce
IBM
Tableau Desktop có ưu điểm nổi bật nào?
Chỉ dùng cho lập trình viên
Kéo-thả trực quan, hỗ trợ nhiều loại biểu đồ
Không kết nối được CSDL
Chỉ chạy trên Linux
Tableau Desktop có thể kết nối với:
Chỉ file Excel
Dưới 10 CSDL
Hơn 60 hệ quản trị cơ sở dữ liệu khác nhau
Chỉ dữ liệu nhỏ
Tính năng “Show Me” trong Tableau dùng để:
Viết code
Lưu dữ liệu
Gợi ý loại biểu đồ phù hợp với dữ liệu
Chia sẻ báo cáo
Power BI là sản phẩm của?
Amazon
Salesforce
Microsoft
Oracle
Phát biểu nào đúng nhất về trực quan hóa dữ liệu?
Chỉ là khoa học
Chỉ là nghệ thuật
Là sự kết hợp giữa khoa học dữ liệu và nghệ thuật kể chuyện
Không cần trong phân tích dữ liệu
Dữ liệu lớn (Big Data) trong kinh tế – kinh doanh chủ yếu được sử dụng để?
Lưu trữ dữ liệu kế toán
Trang trí báo cáo
Hỗ trợ ra quyết định và tạo lợi thế cạnh tranh
Thay thế hoàn toàn con người
Lợi ích quan trọng nhất của việc ứng dụng Big Data trong doanh nghiệp là?
Giảm hoàn toàn chi phí
Ra quyết định nhanh và chính xác hơn
Loại bỏ rủi ro kinh doanh
Không cần chiến lược
Big Data giúp doanh nghiệp hiểu khách hàng tốt hơn thông qua việc?
Phỏng vấn thủ công
Thu thập và phân tích hành vi, nhu cầu, sở thích
Giảm số lượng khách hàng
Chỉ dùng dữ liệu nội bộ
Ứng dụng Big Data trong marketing KHÔNG bao gồm nội dung nào sau đây?
Cá nhân hóa quảng cáo
Phân khúc khách hàng
Dự đoán hành vi mua sắm
Ghi sổ kế toán
Cá nhân hóa (Personalization) trong marketing dựa trên Big Data có nghĩa là:
Dùng một quảng cáo cho tất cả khách hàng
Điều chỉnh sản phẩm/nội dung theo từng nhóm hoặc từng cá nhân
Giảm dữ liệu khách hàng
Không cần phân tích
Phân khúc khách hàng (Customer Segmentation) là:
Chia khách hàng theo cảm tính
Nhóm khách hàng dựa trên đặc điểm và hành vi tương đồng
Loại bỏ khách hàng không tiềm năng
Chỉ dựa vào độ tuổi
Big Data giúp doanh nghiệp dự đoán nhu cầu thị trường thông qua:
Cảm nhận chủ quan
Phân tích dữ liệu lịch sử và xu hướng
Sao chép đối thủ
Quảng cáo đại trà
Tầng nào trong kiến trúc DWH thực hiện OLAP?
Tầng đáy
Tầng giữa
Tầng trên cùng
Tầng lưu trữ tạm
Hadoop là gì?
Một hệ quản trị CSDL quan hệ
Một công cụ trực quan hóa
Nền tảng mã nguồn mở cho xử lý dữ liệu lớn phân tán
Một dịch vụ Cloud
Phát hiện gian lận (Fraud Detection) dựa trên Big Data thường sử dụng:
Phân tích thủ công
Các mô hình học máy và phát hiện bất thường
Chỉ dữ liệu nhỏ
Không cần thuật toán
Thách thức lớn nhất khi ứng dụng Big Data trong doanh nghiệp là:
Dữ liệu quá ít
Chất lượng dữ liệu và nhân lực phân tích
Không có khách hàng
Không có máy tính
Dữ liệu khách hàng cần được thu thập và sử dụng theo nguyên tắc nào?
Tự do tuyệt đối
Minh bạch và tuân thủ pháp luật
Không cần xin phép
Chỉ phục vụ doanh nghiệp
Trong biểu đồ nhiệt, màu nóng thường biểu thị:
Giá trị nhỏ
Không có dữ liệu
Giá trị lớn / mức độ tương tác cao
Dữ liệu lỗi
Chuẩn hóa dữ liệu (Normalization) nhằm mục đích gì?
Tăng số lượng thuộc tính
Đưa dữ liệu về cùng miền giá trị
Xóa dữ liệu dư thừa
Gán nhãn dữ liệu
