NEW
Font size
WorksheetsData Mining and KDD Fundamentals
Total questions: 75
Worksheet time: 38mins
Khai phá dữ liệu (Data Mining) là:
Trích xuất thông tin hữu ích, chưa biết, từ dữ liệu lớn
Lưu trữ dữ liệu trong kho dữ liệu
Thu thập dữ liệu từ nhiều nguồn khác nhau
Sao lưu và phục hồi dữ liệu
Data Mining là giai đoạn nằm trong quá trình nào?
KDD (Knowledge Discovery in Databases)
ETL
OLAP
SQL
Giai đoạn tiền xử lý dữ liệu (data preprocessing) bao gồm:
Gộp luật kết hợp
Phân lớp và gom cụm dữ liệu
Tạo biểu đồ thống kê
Làm sạch, tích hợp, chuyển đổi và rút trích dữ liệu
Một mục tiêu chính của khai phá dữ liệu là:
Tăng tốc truy xuất dữ liệu
Tìm ra các mẫu hoặc quy luật có ý nghĩa
Tối ưu hóa phần mềm hệ thống
Giao tiếp với người dùng
Một ứng dụng của khai phá dữ liệu là:
Truy vấn dữ liệu bằng SQL
Phân đoạn thị trường và dự đoán hành vi khách hàng
Biểu đồ cột
Lưu trữ dữ liệu dạng bảng
Kỹ thuật nào sau đây KHÔNG phải là kỹ thuật khai phá dữ liệu?
Luật kết hợp
Phân mảnh
Phân lớp
Gom cụm
Đâu KHÔNG phải là một bước trong quy trình KDD?
Làm sạch dữ liệu
Trực quan hóa dữ liệu
Đánh giá mô hình
Viết báo cáo tài chính
Mục tiêu của đánh giá mô hình trong khai phá dữ liệu là:
In kết quả ra giấy
So sánh tốc độ chạy của thuật toán
Kiểm tra mức độ chính xác, độ phù hợp và tính hiệu quả của mô hình
Lưu mô hình ra file
Luật kết hợp có dạng:
A, A B → C
A → A
A → B
A ↔ B
Confidence phản ánh:
Mức độ phổ biến của luật
Sự tương quan giữa hai sản phẩm
Tỷ lệ A xuất hiện khi có B
Tỷ lệ A xuất hiện B khi A đã xuất hiện
Tập mục (itemset) là gì?
Tập hợp các luật
Một sản phẩm cụ thể
Danh sách khách hàng
Tập các mục thường xuất hiện cùng nhau trong giao dịch
Thuật toán Apriori được dùng để:
Phân loại dữ liệu
Chuẩn hóa dữ liệu
Tìm luật kết hợp dựa trên tập mục thường xuyên
Gom cụm dữ liệu
Mục tiêu của phân lớp dữ liệu là:
Tìm mối liên hệ giữa các mục
Dự đoán nhãn lớp cho dữ liệu chưa biết
Mã hóa dữ liệu đầu vào
Gom nhóm các dữ liệu tương tự nhau
Dữ liệu huấn luyện trong phân lớp bao gồm:
Chỉ thuộc tính đầu vào
Dữ liệu chưa gán nhãn
Dữ liệu lỗi và nhiễu
Các mẫu có cả thuộc tính và nhãn lớp
Thuật toán cây quyết định ID3 chọn thuộc tính dựa trên:
Độ tin cậy
Information Gain
Euclidean Distance
Độ hỗ trợ
Mục tiêu của PCA là:
Tăng số chiều dữ liệu
Xóa nhãn lớp khỏi dữ liệu
Phân loại dữ liệu
Giảm số chiều dữ liệu nhưng vẫn giữ lại thông tin quan trọng
PCA thường được sử dụng để:
Làm sạch dữ liệu
Giảm nhiễu và trực quan hóa dữ liệu
Sinh dữ liệu mới
Mã hóa dữ liệu
Phân cụm (gom cụm) là một kỹ thuật thuộc loại nào?
Học không giám sát
Xử lý thời gian thực
Học bán giám sát
Học có giám sát
Thuật toán K-Means yêu cầu gì?
Tập nhãn lớp
Cây phân lớp có sẵn
Số cụm k được xác định trước
Luật kết hợp đầu vào
Đánh giá chất lượng phân cụm thường dựa trên:
Số luật tìm được
Độ gắn kết và tách biệt
Tổng số thuộc tính
Support và Confidence
Mô hình dữ liệu phổ biến trong kho dữ liệu là:
Mô hình ER mở rộng
Mô hình sao (Star Schema)
Mô hình mạng
Mô hình cây
Công cụ OLAP dùng để:
Lưu trữ dữ liệu
Nhập dữ liệu
Tính toán độ tin cậy
Phân tích dữ liệu đa chiều
Xử lý ngôn ngữ tự nhiên (NLP) là sự kết hợp của các lĩnh vực nào?
Khoa học dữ liệu, nhận dạng mẫu và toán học
Thống kê, ngôn ngữ học, robot học
Trí tuệ nhân tạo, khoa học máy tính và ngôn ngữ học
Toán học, ngôn ngữ học, tin học
Mục tiêu của NLP là gì?
Tạo ra ngôn ngữ mới cho máy tính
Dịch ngôn ngữ từ tiếng Anh sang tiếng Việt
Máy tính hiểu và sinh ngôn ngữ tự nhiên giống con người
Tăng tốc độ tính toán của máy tính
Tác vụ POS Tagging trong NLP có nhiệm vụ:
Phân cụm từ theo ngữ nghĩa
Dịch ngôn ngữ tự động
Xác định loại từ trong câu
Kiểm tra lỗi chính tả
Ví dụ nào sau đây thể hiện rõ Spam Detection?
Xác định chủ thể trong câu
Tìm nhãn từ loại trong câu
Phân biệt email có nội dung đáng ngờ
Phân tích tâm lý người dùng
Các mô hình dịch máy truyền thống thường có đặc điểm:
Chỉ cần từ điển
Lớn và phức tạp
Không cần ngữ pháp
Có văn phạm rõ ràng
RNN (Recurrent Neural Network) được sử dụng trong dịch máy để:
Phân loại hình ảnh
Mã hóa và giải mã câu văn
Nhận dạng giọng nói
Gán nhãn dữ liệu
Trong sơ đồ RNN dịch máy, layer nào có vai trò giảm chiều dữ liệu đầu vào?
Embedding layer
Projection layer
Hidden layer
Loss layer
Ai là người đã đưa ra mô hình dữ liệu quan hệ (Relational Data Model)?
Tim Berners-Lee
Edgar F. Codd
Bill Gates
Larry Ellison
Trong mô hình dữ liệu quan hệ, thành phần nào của một quan hệ (Relation) được mô tả là thay đổi theo thời gian?
Tập hợp các dòng
Kiểu dữ liệu của các thuộc tính
Tập hợp các cột
Tên quan hệ
Một thuộc tính (Attribute) trong mô hình dữ liệu quan hệ có chức năng chính là gì?
Gắn liền với tập các giá trị nguyên tố
Biểu diễn một thực thể cụ thể
Mô tả ý nghĩa cho các giá trị tại cột đó
Tổng hợp các dòng dữ liệu
Trong khai phá dữ liệu, đâu là định nghĩa chính xác nhất của Thông tin theo tài liệu?
Là tập hợp những thông tin có liên hệ với nhau
Là chuỗi các biểu, là số ký tự hàng ngày
Là tập hợp của những mảnh dữ liệu đã được chắt lọc mô tả
Là các mẩu hữu ích chưa biết tiềm ẩn trong dữ liệu lớn
Quy trình KDD bao gồm nhiều công đoạn. Công đoạn nào dưới đây KHÔNG phải là một bước chính trong KDD?
Khai thác dữ liệu và đánh giá kết quả
Xác định vấn đề và tập hợp dữ liệu
Tiền xử lý làm sạch và mã hóa dữ liệu
Mã hóa dữ liệu thành các thuật toán phức tạp
Trong các kỹ thuật khai phá dữ liệu được liệt kê, kỹ thuật nào có mục tiêu xác định các cụm tiềm ẩn trong các tập đối tượng chưa được xếp lớp?
Dự đoán
Phân lớp
Luật kết hợp
Gom cụm
Ứng dụng nào sau đây KHÔNG được liệt kê là một ứng dụng điển hình của khai phá dữ liệu trong tài liệu?
Hỗ trợ chẩn đoán bệnh lý trong y học
Xác định gian lận trong giao dịch tài chính
Phân tích kết quả thử nghiệm trong sản xuất
Phân tích tâm lý cá nhân và tư vấn nghề nghiệp
Miền giá trị (Domain) của một thuộc tính trong mô hình quan hệ là gì?
Tập hợp các dòng dữ liệu trong một quan hệ
Mô tả ý nghĩa của dữ liệu trong một cột
Tập các giá trị nguyên tố gắn liền với một thuộc tính
Tên của thuộc tính trong lược đồ quan hệ
Sự khác biệt cốt lõi giữa Thông tin và Tri thức là gì theo tài liệu?
Thông tin là dữ liệu thô còn Tri thức là dữ liệu đã được xử lý đơn giản
Thông tin là dữ liệu đã chắt lọc dùng để mô tả còn Tri thức là sự kết tinh từ thông tin có liên hệ với nhau và thể hiện tư duy con người
Thông tin được thu thập hàng ngày còn Tri thức là kết quả của khai phá dữ liệu
Thông tin chỉ có trong cơ sở dữ liệu còn Tri thức chỉ có trên Internet
Theo định nghĩa của Fayyad, Piatetsky-Shapiro, Smyth (1996), KDD là gì?
Khai thác dữ liệu thủ công từ các tập dữ liệu nhỏ
Quản lý thông tin trong cơ sở dữ liệu
Tính dữ liệu bằng các cách sử dụng các công cụ thống kê truyền thống
Rút trích tự động các tri thức tiềm ẩn không rõ ràng từ khối lượng dữ liệu lớn
Đâu là một trong các lợi ích của khai phá dữ liệu được nêu?
Cung cấp khả năng hỗ trợ quyết định kinh doanh
Chỉ hỗ trợ các quyết định mang tính chiến thuật
Tự động hóa hoàn toàn quy trình ra quyết định
Giảm chi phí lưu trữ dữ liệu
Quy trình KDD bao gồm những công đoạn nào?
Chỉ phân tích dữ liệu và trình bày kết quả
Xác định vấn đề tập hợp và chọn lọc dữ liệu khai thác dữ liệu đánh giá kết quả giải thích dữ liệu áp dụng tri thức vào thực tế
Khám phá tri thức từ cơ sở dữ liệu phân lớp và gom cụm
Chỉ thu thập và làm sạch dữ liệu
Dữ liệu (Data) được định nghĩa là gì theo tài liệu?
Là các số liệu ký tự và biểu ghi nhận được
Là các mẩu hữu ích chưa biết tiềm ẩn trong khối dữ liệu lớn
Là tập hợp những thông tin có liên hệ với nhau thể hiện tư duy con người
Là các mô hình toán học mô tả thế giới
Lợi ích cốt lõi của khai phá dữ liệu khi chuyển từ EDP/MIS sang DSS là gì?
Tối ưu hóa vận hành hệ thống mạng
Hỗ trợ ra quyết định thông minh hơn
Loại bỏ hoàn toàn dữ liệu lịch sử
Giảm chi phí lưu trữ dữ liệu lớn
Mục đích của khai phá luật kết hợp trong dữ liệu là gì?
Dự đoán chuỗi sự kiện theo thời gian
Tìm mẫu phổ biến và mối quan hệ giữa đối tượng
Phân lớp dữ liệu theo nhãn có sẵn
Tối ưu hóa cấu trúc lưu trữ dữ liệu
Kỹ thuật phân lớp dữ liệu nhắm tới mục tiêu nào?
Xác định đặc trưng lớp và gán nhãn dữ liệu mới
Tìm tín hiệu phổ biến nhất từ sự kiện
Xác định cụm chưa có nhãn sẵn có
Xác định trật tự lưu trữ tối ưu
Sequential Pattern Mining chủ yếu nhằm vào nhiệm vụ nào?
Dự đoán giá trị liên tục theo thuộc tính khác
Tìm chuỗi sự kiện thường xuất hiện theo thứ tự
Tách dữ liệu thành nhóm tương tự nhau
Phát hiện đồng thời nhiều sự kiện trong giao dịch
Điểm khác nhau chính giữa gom cụm và phân lớp là gì?
Gom cụm cần huấn luyện mô hình có giám sát
Gom cụm chỉ áp dụng cho dữ liệu văn bản
Gom cụm dự đoán nhãn từ dữ liệu gắn nhãn
Gom cụm khám phá cấu trúc trong dữ liệu không nhãn
Trong kho dữ liệu, đặc tính 'Non-volatile' có nghĩa là gì?
Kho dữ liệu không cần bảo trì định kỳ
Dữ liệu không bao giờ cập nhật sau khi nạp
Thiết bị lưu trữ không cần điện năng duy trì
Người dùng chỉ truy cập dữ liệu trực tuyến
Đâu KHÔNG phải là một phép thao tác OLAP điển hình?
Roll up trên chiều tổng hợp
Normalized để chuẩn hóa bảng
Drill down vào cấp chi tiết
Slice và Dice theo các chiều
Trong mô hình dữ liệu chiều, vai trò của bảng chiều (Dimension) là gì?
Làm sạch và tích hợp dữ liệu nguồn
Cung cấp ngữ cảnh và mô tả chi tiết cho số liệu
Thực hiện phép toán phức tạp dữ liệu
Lưu trữ các số đo định lượng bán hàng
Phân lớp (classification) được hiểu đúng là gì?
Gom các điểm dữ liệu thành nhóm
Dự đoán giá trị liên tục theo thời gian
Gán nhãn dữ liệu theo các lớp đã biết
Tìm luật kết hợp giữa các mục
Thuật toán phân lớp nào hoạt động dựa trên nguyên lý xác suất có điều kiện?
Decision Tree với thông tin tăng ích
K‑NN với lân cận gần nhất
Naive Bayes giả định độc lập thuộc tính
K‑means tối ưu khoảng cách cụm
Trong cây quyết định, tiêu chí phổ biến dùng để chọn thuộc tính phân nhánh là gì?
Tốc độ học của mô hình
Khoảng cách Euclidean trung bình
Entropy hoặc Information Gain
Số lượng dòng dữ liệu lớn nhất
Giả định chính của Naive Bayes về các thuộc tính là gì?
Dữ liệu phải được chuẩn hóa chặt
Thuộc tính độc lập có điều kiện
Tập huấn luyện phải cân bằng tuyệt đối
Thuộc tính phụ thuộc lẫn nhau mạnh
Nhược điểm chính của K‑NN khi dự đoán là gì?
Không áp dụng cho dữ liệu hình ảnh
Tốn nhiều thời gian dựa vào toàn bộ dữ liệu
Dễ gây overfitting trên mọi tập
Không thể phân lớp nhiều lớp phức tạp
Precision trong phân lớp thường đo lường điều gì?
Tỷ lệ âm tính bị dự đoán sai
Tỷ lệ nhãn sai có thể chấp nhận
Tỷ lệ đúng trong số các dự đoán dương tính
Tỷ lệ dự đoán đúng trên tất cả mẫu
Overfitting xảy ra khi nào trong phân lớp?
Mô hình học quá sát dữ liệu huấn luyện
Tập kiểm tra giống hệt tập huấn luyện
Không sử dụng thuật toán tối ưu
Mô hình quá đơn giản tuyến tính
Thuật toán nào sau đây KHÔNG dùng cho phân lớp?
Naive Bayes xác suất đơn giản
Decision Tree theo entropy
K‑means tối ưu cụm khoảng cách
K‑Nearest Neighbors có giám sát
PCA thuộc loại phương pháp học nào?
Học sâu với mạng nơ-ron
Học tăng cường theo phần thưởng
Học không giám sát trích đặc trưng
Học có giám sát với nhãn
Mục tiêu chính của PCA là gì?
Dự đoán giá trị tương lai chuỗi
Xây dựng mô hình phân lớp tối ưu
Biến đổi dữ liệu về không gian mới theo thành phần chính
Loại bỏ toàn bộ thuộc tính tương quan
PCA thường được áp dụng ở bước nào của quy trình khai phá dữ liệu?
Thu thập dữ liệu ban đầu
Gán nhãn thủ công cho dữ liệu
Đánh giá mô hình bằng kiểm thử
Giảm chiều dữ liệu trong tiền xử lý
Gom cụm dữ liệu (clustering) chủ yếu nhằm mục tiêu nào?
Dự đoán giá trị liên tục chính xác
Nhóm các điểm dữ liệu tương đồng lại với nhau
Gán nhãn lớp có sẵn cho dữ liệu
Xây dựng cây quyết định nhanh hơn
Điều gì có thể xảy ra khi tăng số cụm k quá lớn trong K-means?
Cụm càng rõ ràng hơn
Tăng tính khái quát mạnh
Có thể gây overfitting, cụm không còn ý nghĩa
Giảm thời gian chạy đáng kể
Thuật toán Hierarchical Clustering tạo cụm bằng cách nào?
Dự đoán số cụm tối ưu trước
Chọn ngẫu nhiên cụm
Gộp dần các điểm thành cụm hoặc tách dần cụm
Dán nhãn thủ công cho dữ liệu
Trong gom cụm, silhouette score cao thường hàm ý điều gì?
Có nhiều nhiễu không kiểm soát
Cụm trùng nhau đáng kể
Cụm bị lệch mạnh về kích thước
Cụm tốt, tách biệt rõ ràng
Lược đồ quan hệ (Relational Schema) bao gồm thành phần nào?
Các giá trị cụ thể của dữ liệu
Chỉ bao gồm tên quan hệ trống
Tên quan hệ và tập hợp các thuộc tính
HUD các dòng dữ liệu
Doanh nghiệp cần kho dữ liệu chủ yếu để làm gì?
Tăng tốc độ mạng nội bộ
Hỗ trợ ra quyết định chính xác và toàn diện
Thay thế toàn bộ hệ thống ERP
Tối ưu phân loại khách hàng trực tiếp
Trong mô hình sao, bảng fact thường dùng để:
Làm bảng phụ trợ ít dùng
Chứa thông tin người dùng đăng ký
Lưu dữ liệu định lượng có thể đo lường
Lưu các thuộc tính mô tả văn bản
Vai trò chính của bảng fact là gì?
Ghi lại các sự kiện và chỉ số kinh doanh
Ghi dữ liệu metadata hệ thống
Làm khóa chính cho toàn bộ mô hình
Lưu công thức tính toán cố định
Dữ liệu đưa vào kho dữ liệu thường được xử lý như thế nào?
Lưu nguyên bản chưa xử lý
Làm sạch, chuyển đổi và tích hợp từ nhiều nguồn
Chỉ ghi tạm thời rồi xóa
Cập nhật liên tục mỗi giây
Trong một quan hệ, một 'bộ' (tuple) tương ứng với khái niệm nào?
Toàn bộ bảng dữ liệu
Tên của bảng dữ liệu
Một cột dữ liệu duy nhất
Một dòng dữ liệu cụ thể
Mục tiêu chính của kỹ thuật nén ảnh bằng gom cụm là gì?
Tăng số lượng cụm để giảm chất lượng
Lưu mỗi điểm ảnh với một số bit nhỏ hơn
Giảm số lượng màu sắc mà không mất dữ liệu
Tách ảnh thành các vùng phân giải cao
Khi số lượng cụm tăng lên trong nén ảnh bằng gom cụm, chất lượng bức ảnh thường:
Không đổi trong mọi trường hợp
Được cải thiện đến một mức rồi bão hòa
Giảm đi không thể tránh
Chỉ thay đổi nếu dữ liệu ban đầu lỗi
Thuật toán Apriori dựa trên nguyên lý nào?
Không cần quan tâm đến ngưỡng support
Nếu một tập con phổ biến thì tập siêu sẽ không phổ biến
Nếu một tập mục không thường xuyên thì mọi tập siêu của nó cũng không thường xuyên
Luôn chọn tập có support thấp nhất
Khi nào nên dùng Naive Bayes thay vì các thuật toán phân lớp khác?
Khi dữ liệu có nhiều thuộc tính gần độc lập
Khi số cụm rất lớn khó xác định
Khi cần tối ưu khoảng cách Euclid
Khi dự đoán giá trị liên tục phức tạp
