Font size
WorksheetsCâu hỏi trắc nghiệm về Khai phá dữ liệu (Data Mining)
Total questions: 85
Worksheet time: 43mins
Khai phá dữ liệu (Data Mining) là:
Lưu trữ dữ liệu trong kho dữ liệu
Thu thập dữ liệu từ nhiều nguồn khác nhau
Trích xuất thông tin hữu ích, chưa biết, từ dữ liệu lớn
Sao lưu và phục hồi dữ liệu
Data Mining là giai đoạn nằm trong quá trình nào?
OLAP
KDD (Knowledge Discovery in Databases)
ETL
SQL
Giai đoạn tiền xử lý dữ liệu (data preprocessing) bao gồm:
Gộp luật kết hợp
Làm sạch, tích hợp, chuyển đổi và rút trích dữ liệu
Tạo biểu đồ thống kê
Phân lớp và gom cụm dữ liệu
Một mục tiêu chính của khai phá dữ liệu là:
Giao tiếp với người dùng
Tối ưu hóa phần mềm hệ thống
Tăng tốc truy xuất dữ liệu
Tìm ra các mẫu (patterns) hoặc quy luật (rules) có ý nghĩa
Một ứng dụng của khai phá dữ liệu là:
Vẽ biểu đồ cột
Lưu trữ dữ liệu dạng bảng
Phân đoạn thị trường và dự đoán hành vi khách hàng
Truy vấn dữ liệu bằng SQL
Kỹ thuật nào sau đây KHÔNG phải là kỹ thuật khai phá dữ liệu?
Phân lớp
Gom cụm
Phân mảnh
Luật kết hợp
Khác biệt giữa khai phá dữ liệu và thống kê truyền thống là:
Khai phá dữ liệu không cần dữ liệu
Thống kê chỉ phân tích dữ liệu nhỏ
Cả hai đều giống nhau
Khai phá dữ liệu xử lý dữ liệu lớn và khám phá tự động
Đâu KHÔNG phải là một bước trong quy trình KDD?
Viết báo cáo tài chính
Trực quan hóa dữ liệu
Làm sạch dữ liệu
Đánh giá mô hình
Mục tiêu của đánh giá mô hình trong khai phá dữ liệu là:
Lưu mô hình ra file
Kiểm tra mức độ chính xác, độ phù hợp và tính hiệu quả của mô hình
Luật kết hợp có dạng:
A → A
A → B
A ∧ B → C
A ← B
Trong luật kết hợp, support được tính bằng:
Tần suất xuất hiện của A
Tổng số sản phẩm chia số luật
Tỷ lệ A và B cùng xuất hiện.
Số lần xuất hiện của luật
Confidence phản ánh:
Mức độ phổ biến của luật
Tỷ lệ A xuất hiện khi có B
Tỷ lệ xuất hiện B khi A đã xuất hiện
Sự tương quan giữa hai sản phẩm
Tập mục (itemset) là gì?
Một sản phẩm cụ thể
Tập hợp các luật
Danh sách khách hàng
Tập các mục thường xuất hiện cùng nhau trong các giao dịch
Thuật toán Apriori được dùng để:
Gom cụm dữ liệu
Tìm luật kết hợp dựa trên tập mục thường xuyên
Phân loại dữ liệu
Chuẩn hóa dữ liệu
Mục tiêu của phân lớp dữ liệu là:
Gom nhóm các dữ liệu tương tự nhau
Dự đoán nhãn lớp cho dữ liệu chưa biết
Tìm mối liên hệ giữa các mục
Mã hóa dữ liệu đầu vào
Dữ liệu huấn luyện trong phân lớp bao gồm:
Chỉ thuộc tính đầu vào
Dữ liệu chưa gán nhãn
Các mẫu có cả thuộc tính và nhãn lớp
Dữ liệu lỗi và nhiễu
Thuật toán cây quyết định ID3 chọn thuộc tính dựa trên:
Độ hỗ trợ
Độ tin cậy
Information Gain
Euclidean Distance
Mục tiêu của PCA là:
Giảm số chiều của dữ liệu trong khi vẫn giữ lại thông tin quan trọng nhất.
Tăng số chiều của dữ liệu để phân tích tốt hơn.
Loại bỏ hoàn toàn các biến phụ thuộc trong dữ liệu.
Tăng độ phức tạp của mô hình bằng cách thêm nhiều biến.
PCA thường được sử dụng để:
Giảm số chiều dữ liệu nhưng vẫn giữ lại thông tin quan trọng
Phân loại dữ liệu
Tăng số chiều dữ liệu
Xoá nhãn lớp khỏi dữ liệu
Phân cụm (gom cụm) là một kỹ thuật thuộc loại nào?
Học có giám sát
Giảm nhiễu và trực quan hóa dữ liệu
Sinh dữ liệu mới
Mã hóa dữ liệu
Thuật toán K-Means yêu cầu gì?
Số cụm K được xác định trước
Cây phân lớp có sẵn
Luật kết hợp đầu vào
Tập nhãn lớp
Đánh giá chất lượng phân cụm thường dựa trên:
Support và Confidence
Độ gắn kết và tách biệt
Số luật tìm được
Tổng số thuộc tính
Kho dữ liệu (Data Warehouse) là:
Cơ sở dữ liệu dùng để giao dịch hằng ngày
Hệ thống dùng để lưu trữ dữ liệu tập trung phục vụ phân tích
Bộ nhớ tạm
Nơi sao lưu hệ thống
Mô hình dữ liệu phổ biến trong kho dữ liệu là:
Mô hình cây
Mô hình mạng
Mô hình sao (Star Schema)
Mô hình ER mở rộng
Công cụ OLAP dùng để:
Nhập dữ liệu
Lưu trữ dữ liệu
Tính toán độ tin cậy
Phân tích dữ liệu đa chiều
Xử lý ngôn ngữ tự nhiên (NLP) là sự kết hợp của các lĩnh vực nào?
Toán học, ngôn ngữ học, tin học
Trí tuệ nhân tạo, khoa học máy tính và ngôn ngữ học
Thống kê, ngôn ngữ học, robot học
Mục tiêu của NLP là gì?
Tạo ra ngôn ngữ mới cho máy tính
Dịch ngôn ngữ từ tiếng Anh sang tiếng Việt
Máy tính hiểu và sinh ngôn ngữ tự nhiên giống con người
Tăng tốc độ tính toán của máy tính
Trong sơ đồ NLP, giai đoạn NLU là gì?
Nhận dạng câu sai
Hiểu ngôn ngữ tự nhiên
Phân tích cấu trúc dữ liệu
Sinh ra ngôn ngữ mới
Tác vụ POS Tagging trong NLP có nhiệm vụ:
Phân cụm từ theo ngữ nghĩa
Xác định loại từ (danh từ, động từ,...) trong câu
Kiểm tra lỗi chính tả
Dịch ngôn ngữ tự động
Ví dụ nào sau đây thể hiện rõ Spam Detection?
Tìm nhãn từ loại trong câu
Xác định chủ thể trong câu
Phân biệt email có nội dung đáng ngờ
Phân tích tâm lý người dùng
NER (Named Entity Recognition) dùng để:
Xác định thực thể như người, tổ chức, địa điểm trong văn bản
Tìm từ đồng nghĩa
Tạo câu ngẫu nhiên
Dịch văn bản
Các mô hình dịch máy truyền thống thường có đặc điểm:
Nhỏ và đơn giản
Không cần ngữ pháp
Lớn và phức tạp
Chỉ cần từ điển
RNN (Recurrent Neural Network) được sử dụng trong dịch máy để:
Phân loại hình ảnh
Mã hóa và giải mã câu văn
Nhận dạng giọng nói
Gắn nhãn dữ liệu
Trong hệ thống dịch máy dùng RNN, bước "encode" là gì?
Chuyển vector đầu ra về tiếng Anh
Biến câu input thành vector biểu diễn
Phân loại cảm xúc trong câu
Sinh ảnh từ văn bản
Trong sơ đồ RNN dịch máy, layer nào có vai trò giảm chiều dữ liệu đầu vào?
Embedding layer
Attention layer
Output layer
Dense layer
Ai là người đã đưa ra mô hình dữ liệu quan hệ (Relational Data Model)?
Tim Berners-Lee
Edgar F. Codd
Bill Gates
Larry Ellison
Trong mô hình dữ liệu quan hệ, thành phần nào của một 'quan hệ' (Relation) được mô tả là 'thay đổi theo thời gian'?
Tên quan hệ
Tập hợp các cột
Kiểu dữ liệu của các thuộc tính
Tập hợp các dòng
Một 'thuộc tính' (Attribute) trong mô hình dữ liệu quan hệ có chức năng chính là gì?
Biểu diễn một thực thể cụ thể
Gắn liền với tập các giá trị nguyên tố
Mô tả ý nghĩa cho các giá trị tại cột đó
Tổng hợp các dòng dữ liệu
Trong khai phá dữ liệu, đâu là định nghĩa chính xác nhất của 'Thông tin' theo tài liệu?
Là các mẫu hữu ích, chưa biết, tiềm ẩn trong khối dữ liệu lớn.
Là tập hợp của những mảnh dữ liệu đã được chất lọc dùng mô tả, giải thích đặc tính của một đối tượng nào đó.
Là chuỗi các bit, là số, ký tự mà chúng ta tập hợp hằng ngày trong công việc.
Là tập hợp những thông tin có liên hệ với nhau, có thể xem là sự kết tinh từ dữ liệu.
Quy trình Khám phá tri thức từ cơ sở dữ liệu (KDD) bao gồm nhiều công đoạn. Công đoạn nào dưới đây KHÔNG phải là một bước chính trong quy trình KDD?
Mã hóa dữ liệu thành các thuật toán phức tạp.
Tiền xử lý/làm sạch và mã hóa dữ liệu.
Xác định vấn đề và tập hợp dữ liệu.
Khai thác dữ liệu và đánh giá kết quả.
Trong các kỹ thuật khai phá dữ liệu được liệt kê, kỹ thuật nào có mục tiêu 'xác định các cụm tiềm ẩn trong các tập đối tượng chưa được xếp lớp'?
Gom cụm (Clustering)
Luật kết hợp (Association Rules)
Phân lớp (Classification)
Dự đoán (Prediction)
Ứng dụng nào sau đây KHÔNG được liệt kê là một ứng dụng điển hình của khai phá dữ liệu trong tài liệu?
Phân tích kết quả thử nghiệm trong sản xuất.
Xác định gian lận trong giao dịch tài chính.
Phân tích tâm lý cá nhân và tư vấn nghề nghiệp.
Hỗ trợ chẩn đoán bệnh lý trong y học.
Quy trình ETL trong Nhà kho dữ liệu (Data Warehouse) bao gồm các bước viết tắt là gì?
Evaluate, Test, Learn
Explore, Track, Link
Examine, Target, Locate
Extract, Transform, Load
'Miền giá trị' (Domain) của một thuộc tính trong mô hình quan hệ là gì?
Tên của thuộc tính trong lược đồ quan hệ.
Mô tả ý nghĩa của dữ liệu trong một cột.
Tập hợp các dòng dữ liệu trong một quan hệ.
Tập các giá trị nguyên tố gắn liền với một thuộc tính.
Sự khác biệt cơ bản giữa 'Thông tin' và 'Tri thức' là gì?
Thông tin được thu thập hàng ngày, còn Tri thức là kết quả của việc khai phá dữ liệu.
Thông tin là dữ liệu đã chất lọc dùng để mô tả, trong khi Tri thức là sự kết tinh từ thông tin có liên hệ với nhau và thể hiện tư duy con người.
Thông tin là dữ liệu thô, còn Tri thức là dữ liệu đã được xử lý đơn giản.
Thông tin chỉ có trong cơ sở dữ liệu, còn Tri thức chỉ có trên Internet.
Theo định nghĩa của Fayyad, Platetsky-Shapiro, Smyth (1996), KDD là gì?
Rút trích tự động các tri thức tiềm ẩn, không rõ ràng từ khối lượng dữ liệu lớn.
Phân tích dữ liệu bằng cách sử dụng các công cụ thống kê truyền thống.
Quản lý thông tin trong cơ sở dữ liệu.
Khai thác dữ liệu thủ công từ các tập dữ liệu nhỏ.
Đâu là một trong các lợi ích của khai phá dữ liệu được đề cập trong bài giảng?
Cung cấp khả năng hỗ trợ quyết định kinh doanh.
Giảm chi phí lưu trữ dữ liệu.
Chỉ hỗ trợ các quyết định mang tính chiến thuật.
Tự động hóa hoàn toàn quy trình ra quyết định.
Quy trình khai phá tri thức (KDD) bao gồm những công đoạn nào?
A. Xác định vấn đề, tập hợp và chọn lọc dữ liệu, khai thác dữ liệu, đánh giá kết quả, giải thích dữ liệu, áp dụng tri thức vào thực tế.
B. Khám phá tri thức từ cơ sở dữ liệu, phân lớp, và gom cụm.
C. Chỉ thu thập và làm sạch dữ liệu.
Dữ liệu (Data) được định nghĩa là gì?
Là tập hợp những thông tin có liên hệ với nhau, thể hiện tư duy con người.
Là các mẫu hữu ích, chưa biết, tiềm ẩn trong khối dữ liệu lớn.
Là tập hợp của những mảnh dữ liệu đã được chắt lọc dùng mô tả đặc tính của một đối tượng.
Là chuỗi các bit, là số, ký tự mà chúng ta tập hợp hằng ngày trong công việc.
Trong quy trình KDD, bước 'Tiền xử lý/Làm sạch và mã hóa dữ liệu' có mục đích chính là gì?
Loại bỏ nhiễu, xử lý dữ liệu thiếu, không nhất quán và định dạng dữ liệu cho phù hợp với thuật toán.
Áp dụng thuật toán khai phá để tìm ra các mẫu.
Xác định mục tiêu kinh doanh và phạm vi của dự án.
Trực quan hóa kết quả khai phá để người dùng dễ hiểu.
Khi nói về lợi ích của khai phá dữ liệu, sự chuyển đổi từ EDP sang MIS sang DSS (hệ thống hỗ trợ quyết định) thể hiện điều gì?
Sự thay đổi về công nghệ lưu trữ dữ liệu.
Sự gia tăng về chi phí vận hành hệ thống.
Sự tiến hóa từ xử lý dữ liệu thô sang quản lý thông tin và cuối cùng là hỗ trợ ra quyết định thông minh hơn.
Sự giám dẫn tầm quan trọng của dữ liệu lịch sử.
Mục đích của việc tìm các luật kết hợp là gì?
Xác định các cụm tiềm ẩn trong dữ liệu.
Dự đoán dữ liệu trong tương lai.
Tìm các mẫu phổ biến và mối quan hệ giữa các đối tượng dữ liệu.
Phân lớp dữ liệu mới.
Kỹ thuật phân lớp dữ liệu có mục tiêu gì?
Tìm các mẫu tín hiệu phổ biến nhất từ dữ liệu các sự kiện.
Xác định các cụm chưa được xếp lớp.
Xác định trật tự dữ liệu, cấu trúc lưu trữ phù hợp với tác vụ khai phá.
Xác định các đặc trưng của lớp các đối tượng và sử dụng để phân lớp dữ liệu mới.
Sự khác biệt chính giữa gom cụm (Clustering) và phân lớp (Classification) là gì?
Gom cụm nhằm khám phá cấu trúc ẩn trong dữ liệu không nhãn, còn phân lớp nhằm dự đoán nhãn cho dữ liệu mới dựa trên dữ liệu đã được gán nhãn.
Gom cụm sử dụng dữ liệu có nhãn, trong khi phân lớp sử dụng dữ liệu không có nhãn.
Gom cụm cần huấn luyện mô hình, còn phân lớp thì không.
Gom cụm là kỹ thuật chỉ áp dụng cho dữ liệu số, còn phân lớp chỉ áp dụng cho dữ liệu văn bản.
Đặc tính 'Non-volatile' (không thay đổi) của Kho dữ liệu có nghĩa là gì?
Dữ liệu trong kho dữ liệu không bao giờ được thay đổi hoặc cập nhật sau khi đã được nạp vào.
Kho dữ liệu không cần bảo trì định kỳ.
Dữ liệu được lưu trữ trên các thiết bị không cần điện năng.
Dữ liệu không thể truy cập trực tuyến.
Đâu KHÔNG phải là một hoạt động OLAP điển hình?
Roll up (Cuộn lên)
Normalized (Chuẩn hóa)
Drill down (Khoan sâu)
Slice and Dice (Cắt lát)
Trong mô hình dữ liệu chiều (Dimensional Model), bảng chiều (Dimension Table) có vai trò gì?
Thực hiện các phép tính toán phức tạp trên dữ liệu.
Cung cấp ngữ cảnh và mô tả chi tiết cho các chỉ số trong bảng Fact (ví dụ: thông tin về sản phẩm, khách hàng, thời gian).
Làm sạch và chuyển đổi dữ liệu từ các hệ thống nguồn.
Lưu trữ các chỉ số định lượng như doanh thu, số lượng bán hàng.
Phân lớp (classification) là gì?
Gom các điểm dữ liệu thành nhóm
Dự đoán giá trị liên tục
Gán nhãn cho dữ liệu theo các lớp đã biết
Tìm luật kết hợp giữa các mục
Thuật toán phân lớp nào sau đây hoạt động theo nguyên lý xác suất có điều kiện?
Decision Tree
K-NN
Naive Bayes
K-means
Trong cây quyết định, tiêu chí nào thường được dùng để chọn thuộc tính phân nhánh?
Số lượng dòng
Entropy / Gain
Khoảng cách Euclidean
Tốc độ học
Naive Bayes giả định điều gì?
Các thuộc tính phụ thuộc lẫn nhau
Các thuộc tính độc lập có điều kiện
Dữ liệu phải được chuẩn hóa
Tập huấn luyện phải cân bằng
Đâu là nhược điểm chính của K-NN?
Dễ gây overfitting
Tốn nhiều thời gian khi dự đoán (dựa vào tất cả dữ liệu)
Không áp dụng cho dữ liệu hình ảnh
Không thể dùng cho phân lớp nhiều lớp
Precision là gì trong phân lớp?
Tỷ lệ dự đoán đúng trên tất cả mẫu
Tỷ lệ dự đoán đúng trong số các dự đoán dương tính
Tỷ lệ âm tính bị dự đoán sai
Tỷ lệ nhận sai bị chấp nhận
Trong phân lớp, overfitting xảy ra khi:
Mô hình học quá sát dữ liệu huấn luyện và không tổng quát tốt
Mô hình quá đơn giản
Tập dữ liệu không đủ lớn
Tập kiểm tra giống hệt tập huấn luyện
Thuật toán nào sau đây KHÔNG dùng cho phân lớp?
Naive Bayes
Decision Tree
K-means
K-Nearest Neighbors (KNN)
PCA thuộc loại phương pháp học nào?
Học có giám sát
Học không giám sát
Học tăng cường
Học sâu
Mục tiêu chính của PCA là gì?
Loại bỏ tất cả các thuộc tính có tương quan
Biến đổi dữ liệu về không gian mới với các thành phần chính
Xây dựng mô hình phân lớp
Dự đoán giá trị đầu ra
Các thành phần chính (principal components) được chọn sao cho:
Có phương sai nhỏ nhất
Có phương sai lớn nhất
Có độ tương quan cao nhất
Có số chiều nhỏ nhất
PCA thường được dùng trong bước nào của quy trình khai phá dữ liệu?
Thu thập dữ liệu
Gán nhãn dữ liệu
Tiền xử lý dữ liệu (preprocessing)
Đánh giá mô hình
Gom cụm dữ liệu (clustering) là:
Gán nhãn lớp có sẵn cho dữ liệu
Nhóm các điểm dữ liệu tương đồng lại với nhau mà không cần nhãn
Xây dựng cây quyết định
Dự đoán giá trị liên tục
Điều gì xảy ra khi tăng số cụm (k) quá nhiều trong K-means?
Cụm càng rõ ràng hơn
Tăng tính khái quát
Có thể gây overfitting, cụm không còn ý nghĩa
Giảm thời gian chạy
Khoảng cách phổ biến dùng trong K-means để đo sự gần nhau là:
Manhattan
Euclidean (khoảng cách Euclide)
Cosine
Jaccard
Thuật toán Hierarchical Clustering tạo cụm bằng cách:
Chọn ngẫu nhiên
Gộp dần từng điểm thành cụm hoặc tách dần cụm ra
Dùng luật kết hợp
Gán nhãn thủ công
Trong gom cụm, silhouette score càng cao nghĩa là:
Cụm trùng nhau
Có nhiều nhiễu
Cụm tốt, tách biệt rõ ràng
Cụm bị lệch
Lược đồ quan hệ (Relational Schema) bao gồm những thành phần nào?
Tập hợp các dòng dữ liệu.
Tên quan hệ và tập hợp các thuộc tính.
Chỉ bao gồm tên quan hệ.
Các giá trị cụ thể của dữ liệu.
Một đặc trưng quan trọng của kho dữ liệu là:
Dữ liệu tích hợp từ nhiều nguồn khác nhau
Dữ liệu cập nhật theo thời gian thực
Chỉ lưu dữ liệu của 1 phòng ban
Lưu trữ tạm thời để xử lý
Vì sao doanh nghiệp cần kho dữ liệu?
Để tăng tốc độ mạng
Để hỗ trợ ra quyết định chính xác và toàn diện
Để thay thế hệ thống ERP
Để phân loại khách hàng
Trong mô hình sao, bảng fact là:
Lưu các thuộc tính mô tả
Lưu dữ liệu định lượng, có thể đo lường
Chứa thông tin người dùng
Bảng phụ trợ
Vai trò chính của bảng fact là gì?
Ghi lại các sự kiện, chỉ số kinh doanh (như doanh thu, số lượng)
Ghi dữ liệu metadata
Lưu công thức tính toán
Làm khóa chính
Dữ liệu trong kho dữ liệu thường được:
Làm sạch, chuyển đổi và tích hợp từ nhiều nguồn khác nhau
Lưu nguyên bản chưa xử lý
Ghi lại dữ liệu tạm thời
Cập nhật liên tục mỗi giây
Trong một quan hệ (bảng), một 'bộ' (tuple) tương ứng với khái niệm nào?
Toàn bộ bảng.
Tên của bảng.
Một cột dữ liệu.
Một dòng/hàng dữ liệu.
Mục tiêu chính của kỹ thuật nén ảnh bằng gom cụm được đề cập trong tài liệu là gì?
Tăng số lượng clusters để làm giảm chất lượng hình ảnh.
Lưu mỗi điểm ảnh với một số bit nhỏ hơn và chấp nhận mất dữ liệu ở một mức nào đó.
Giảm số lượng màu sắc trong ảnh mà không mất dữ liệu.
Tăng độ phân giải của ảnh gốc
Khi số lượng clusters (cụm) tăng lên trong nén ảnh bằng gom cụm, chất lượng bức ảnh sẽ thay đổi như thế nào?
Chất lượng bức ảnh không thay đổi.
Chất lượng bức ảnh chỉ thay đổi nếu dữ liệu ban đầu có lỗi.
Chất lượng bức ảnh giảm đi.
Chất lượng bức ảnh được cải thiện.
Thuật toán Apriori hoạt động dựa trên nguyên lý nào?
Luôn chọn tập có support thấp nhất
Nếu một tập mục không thường xuyên, thì mọi tập siêu của nó cũng không thường xuyên
Nếu một tập con phổ biến thì tập siêu sẽ không phổ biến
Khi nào nên dùng Naive Bayes thay vì các thuật toán phân lớp khác?
Khi dữ liệu có nhiều thuộc tính độc lập với nhau
Khi số cụm rất lớn
Khi cần dự đoán giá trị liên tục
Khi cần tối ưu khoảng cách
