wayground logo

Free Printable Worksheets

NEW

Font size

S
M
L
XL
Worksheets

Data Mining and KDD Fundamentals

Total questions: 75

Worksheet time: 38mins

Name
Class
Date
1.

Khai phá dữ liệu (Data Mining) là:

a)

Trích xuất thông tin hữu ích, chưa biết, từ dữ liệu lớn

b)

Lưu trữ dữ liệu trong kho dữ liệu

c)

Thu thập dữ liệu từ nhiều nguồn khác nhau

d)

Sao lưu và phục hồi dữ liệu

2.

Data Mining là giai đoạn nằm trong quá trình nào?

a)

KDD (Knowledge Discovery in Databases)

b)

ETL

c)

OLAP

d)

SQL

3.

Giai đoạn tiền xử lý dữ liệu (data preprocessing) bao gồm:

a)

Gộp luật kết hợp

b)

Phân lớp và gom cụm dữ liệu

c)

Tạo biểu đồ thống kê

d)

Làm sạch, tích hợp, chuyển đổi và rút trích dữ liệu

4.

Một mục tiêu chính của khai phá dữ liệu là:

a)

Tăng tốc truy xuất dữ liệu

b)

Tìm ra các mẫu hoặc quy luật có ý nghĩa

c)

Tối ưu hóa phần mềm hệ thống

d)

Giao tiếp với người dùng

5.

Một ứng dụng của khai phá dữ liệu là:

a)

Truy vấn dữ liệu bằng SQL

b)

Phân đoạn thị trường và dự đoán hành vi khách hàng

c)

Biểu đồ cột

d)

Lưu trữ dữ liệu dạng bảng

6.

Kỹ thuật nào sau đây KHÔNG phải là kỹ thuật khai phá dữ liệu?

a)

Luật kết hợp

b)

Phân mảnh

c)

Phân lớp

d)

Gom cụm

7.

Đâu KHÔNG phải là một bước trong quy trình KDD?

a)

Làm sạch dữ liệu

b)

Trực quan hóa dữ liệu

c)

Đánh giá mô hình

d)

Viết báo cáo tài chính

8.

Mục tiêu của đánh giá mô hình trong khai phá dữ liệu là:

a)

In kết quả ra giấy

b)

So sánh tốc độ chạy của thuật toán

c)

Kiểm tra mức độ chính xác, độ phù hợp và tính hiệu quả của mô hình

d)

Lưu mô hình ra file

9.

Luật kết hợp có dạng:

a)

A, A B → C

b)

A → A

c)

A → B

d)

A ↔ B

10.

Confidence phản ánh:

a)

Mức độ phổ biến của luật

b)

Sự tương quan giữa hai sản phẩm

c)

Tỷ lệ A xuất hiện khi có B

d)

Tỷ lệ A xuất hiện B khi A đã xuất hiện

11.

Tập mục (itemset) là gì?

a)

Tập hợp các luật

b)

Một sản phẩm cụ thể

c)

Danh sách khách hàng

d)

Tập các mục thường xuất hiện cùng nhau trong giao dịch

12.

Thuật toán Apriori được dùng để:

a)

Phân loại dữ liệu

b)

Chuẩn hóa dữ liệu

c)

Tìm luật kết hợp dựa trên tập mục thường xuyên

d)

Gom cụm dữ liệu

13.

Mục tiêu của phân lớp dữ liệu là:

a)

Tìm mối liên hệ giữa các mục

b)

Dự đoán nhãn lớp cho dữ liệu chưa biết

c)

Mã hóa dữ liệu đầu vào

d)

Gom nhóm các dữ liệu tương tự nhau

14.

Dữ liệu huấn luyện trong phân lớp bao gồm:

a)

Chỉ thuộc tính đầu vào

b)

Dữ liệu chưa gán nhãn

c)

Dữ liệu lỗi và nhiễu

d)

Các mẫu có cả thuộc tính và nhãn lớp

15.

Thuật toán cây quyết định ID3 chọn thuộc tính dựa trên:

a)

Độ tin cậy

b)

Information Gain

c)

Euclidean Distance

d)

Độ hỗ trợ

16.

Mục tiêu của PCA là:

a)

Tăng số chiều dữ liệu

b)

Xóa nhãn lớp khỏi dữ liệu

c)

Phân loại dữ liệu

d)

Giảm số chiều dữ liệu nhưng vẫn giữ lại thông tin quan trọng

17.

PCA thường được sử dụng để:

a)

Làm sạch dữ liệu

b)

Giảm nhiễu và trực quan hóa dữ liệu

c)

Sinh dữ liệu mới

d)

Mã hóa dữ liệu

18.

Phân cụm (gom cụm) là một kỹ thuật thuộc loại nào?

a)

Học không giám sát

b)

Xử lý thời gian thực

c)

Học bán giám sát

d)

Học có giám sát

19.

Thuật toán K-Means yêu cầu gì?

a)

Tập nhãn lớp

b)

Cây phân lớp có sẵn

c)

Số cụm k được xác định trước

d)

Luật kết hợp đầu vào

20.

Đánh giá chất lượng phân cụm thường dựa trên:

a)

Số luật tìm được

b)

Độ gắn kết và tách biệt

c)

Tổng số thuộc tính

d)

Support và Confidence

21.

Mô hình dữ liệu phổ biến trong kho dữ liệu là:

a)

Mô hình ER mở rộng

b)

Mô hình sao (Star Schema)

c)

Mô hình mạng

d)

Mô hình cây

22.

Công cụ OLAP dùng để:

a)

Lưu trữ dữ liệu

b)

Nhập dữ liệu

c)

Tính toán độ tin cậy

d)

Phân tích dữ liệu đa chiều

23.

Xử lý ngôn ngữ tự nhiên (NLP) là sự kết hợp của các lĩnh vực nào?

a)

Khoa học dữ liệu, nhận dạng mẫu và toán học

b)

Thống kê, ngôn ngữ học, robot học

c)

Trí tuệ nhân tạo, khoa học máy tính và ngôn ngữ học

d)

Toán học, ngôn ngữ học, tin học

24.

Mục tiêu của NLP là gì?

a)

Tạo ra ngôn ngữ mới cho máy tính

b)

Dịch ngôn ngữ từ tiếng Anh sang tiếng Việt

c)

Máy tính hiểu và sinh ngôn ngữ tự nhiên giống con người

d)

Tăng tốc độ tính toán của máy tính

25.

Tác vụ POS Tagging trong NLP có nhiệm vụ:

a)

Phân cụm từ theo ngữ nghĩa

b)

Dịch ngôn ngữ tự động

c)

Xác định loại từ trong câu

d)

Kiểm tra lỗi chính tả

26.

Ví dụ nào sau đây thể hiện rõ Spam Detection?

a)

Xác định chủ thể trong câu

b)

Tìm nhãn từ loại trong câu

c)

Phân biệt email có nội dung đáng ngờ

d)

Phân tích tâm lý người dùng

27.

Các mô hình dịch máy truyền thống thường có đặc điểm:

a)

Chỉ cần từ điển

b)

Lớn và phức tạp

c)

Không cần ngữ pháp

d)

Có văn phạm rõ ràng

28.

RNN (Recurrent Neural Network) được sử dụng trong dịch máy để:

a)

Phân loại hình ảnh

b)

Mã hóa và giải mã câu văn

c)

Nhận dạng giọng nói

d)

Gán nhãn dữ liệu

29.

Trong sơ đồ RNN dịch máy, layer nào có vai trò giảm chiều dữ liệu đầu vào?

a)

Embedding layer

b)

Projection layer

c)

Hidden layer

d)

Loss layer

30.

Ai là người đã đưa ra mô hình dữ liệu quan hệ (Relational Data Model)?

a)

Tim Berners-Lee

b)

Edgar F. Codd

c)

Bill Gates

d)

Larry Ellison

31.

Trong mô hình dữ liệu quan hệ, thành phần nào của một quan hệ (Relation) được mô tả là thay đổi theo thời gian?

a)

Tập hợp các dòng

b)

Kiểu dữ liệu của các thuộc tính

c)

Tập hợp các cột

d)

Tên quan hệ

32.

Một thuộc tính (Attribute) trong mô hình dữ liệu quan hệ có chức năng chính là gì?

a)

Gắn liền với tập các giá trị nguyên tố

b)

Biểu diễn một thực thể cụ thể

c)

Mô tả ý nghĩa cho các giá trị tại cột đó

d)

Tổng hợp các dòng dữ liệu

33.

Trong khai phá dữ liệu, đâu là định nghĩa chính xác nhất của Thông tin theo tài liệu?

a)

Là tập hợp những thông tin có liên hệ với nhau

b)

Là chuỗi các biểu, là số ký tự hàng ngày

c)

Là tập hợp của những mảnh dữ liệu đã được chắt lọc mô tả

d)

Là các mẩu hữu ích chưa biết tiềm ẩn trong dữ liệu lớn

34.

Quy trình KDD bao gồm nhiều công đoạn. Công đoạn nào dưới đây KHÔNG phải là một bước chính trong KDD?

a)

Khai thác dữ liệu và đánh giá kết quả

b)

Xác định vấn đề và tập hợp dữ liệu

c)

Tiền xử lý làm sạch và mã hóa dữ liệu

d)

Mã hóa dữ liệu thành các thuật toán phức tạp

35.

Trong các kỹ thuật khai phá dữ liệu được liệt kê, kỹ thuật nào có mục tiêu xác định các cụm tiềm ẩn trong các tập đối tượng chưa được xếp lớp?

a)

Dự đoán

b)

Phân lớp

c)

Luật kết hợp

d)

Gom cụm

36.

Ứng dụng nào sau đây KHÔNG được liệt kê là một ứng dụng điển hình của khai phá dữ liệu trong tài liệu?

a)

Hỗ trợ chẩn đoán bệnh lý trong y học

b)

Xác định gian lận trong giao dịch tài chính

c)

Phân tích kết quả thử nghiệm trong sản xuất

d)

Phân tích tâm lý cá nhân và tư vấn nghề nghiệp

37.

Miền giá trị (Domain) của một thuộc tính trong mô hình quan hệ là gì?

a)

Tập hợp các dòng dữ liệu trong một quan hệ

b)

Mô tả ý nghĩa của dữ liệu trong một cột

c)

Tập các giá trị nguyên tố gắn liền với một thuộc tính

d)

Tên của thuộc tính trong lược đồ quan hệ

38.

Sự khác biệt cốt lõi giữa Thông tin và Tri thức là gì theo tài liệu?

a)

Thông tin là dữ liệu thô còn Tri thức là dữ liệu đã được xử lý đơn giản

b)

Thông tin là dữ liệu đã chắt lọc dùng để mô tả còn Tri thức là sự kết tinh từ thông tin có liên hệ với nhau và thể hiện tư duy con người

c)

Thông tin được thu thập hàng ngày còn Tri thức là kết quả của khai phá dữ liệu

d)

Thông tin chỉ có trong cơ sở dữ liệu còn Tri thức chỉ có trên Internet

39.

Theo định nghĩa của Fayyad, Piatetsky-Shapiro, Smyth (1996), KDD là gì?

a)

Khai thác dữ liệu thủ công từ các tập dữ liệu nhỏ

b)

Quản lý thông tin trong cơ sở dữ liệu

c)

Tính dữ liệu bằng các cách sử dụng các công cụ thống kê truyền thống

d)

Rút trích tự động các tri thức tiềm ẩn không rõ ràng từ khối lượng dữ liệu lớn

40.

Đâu là một trong các lợi ích của khai phá dữ liệu được nêu?

a)

Cung cấp khả năng hỗ trợ quyết định kinh doanh

b)

Chỉ hỗ trợ các quyết định mang tính chiến thuật

c)

Tự động hóa hoàn toàn quy trình ra quyết định

d)

Giảm chi phí lưu trữ dữ liệu

41.

Quy trình KDD bao gồm những công đoạn nào?

a)

Chỉ phân tích dữ liệu và trình bày kết quả

b)

Xác định vấn đề tập hợp và chọn lọc dữ liệu khai thác dữ liệu đánh giá kết quả giải thích dữ liệu áp dụng tri thức vào thực tế

c)

Khám phá tri thức từ cơ sở dữ liệu phân lớp và gom cụm

d)

Chỉ thu thập và làm sạch dữ liệu

42.

Dữ liệu (Data) được định nghĩa là gì theo tài liệu?

a)

Là các số liệu ký tự và biểu ghi nhận được

b)

Là các mẩu hữu ích chưa biết tiềm ẩn trong khối dữ liệu lớn

c)

Là tập hợp những thông tin có liên hệ với nhau thể hiện tư duy con người

d)

Là các mô hình toán học mô tả thế giới

43.

Lợi ích cốt lõi của khai phá dữ liệu khi chuyển từ EDP/MIS sang DSS là gì?

a)

Tối ưu hóa vận hành hệ thống mạng

b)

Hỗ trợ ra quyết định thông minh hơn

c)

Loại bỏ hoàn toàn dữ liệu lịch sử

d)

Giảm chi phí lưu trữ dữ liệu lớn

44.

Mục đích của khai phá luật kết hợp trong dữ liệu là gì?

a)

Dự đoán chuỗi sự kiện theo thời gian

b)

Tìm mẫu phổ biến và mối quan hệ giữa đối tượng

c)

Phân lớp dữ liệu theo nhãn có sẵn

d)

Tối ưu hóa cấu trúc lưu trữ dữ liệu

45.

Kỹ thuật phân lớp dữ liệu nhắm tới mục tiêu nào?

a)

Xác định đặc trưng lớp và gán nhãn dữ liệu mới

b)

Tìm tín hiệu phổ biến nhất từ sự kiện

c)

Xác định cụm chưa có nhãn sẵn có

d)

Xác định trật tự lưu trữ tối ưu

46.

Sequential Pattern Mining chủ yếu nhằm vào nhiệm vụ nào?

a)

Dự đoán giá trị liên tục theo thuộc tính khác

b)

Tìm chuỗi sự kiện thường xuất hiện theo thứ tự

c)

Tách dữ liệu thành nhóm tương tự nhau

d)

Phát hiện đồng thời nhiều sự kiện trong giao dịch

47.

Điểm khác nhau chính giữa gom cụm và phân lớp là gì?

a)

Gom cụm cần huấn luyện mô hình có giám sát

b)

Gom cụm chỉ áp dụng cho dữ liệu văn bản

c)

Gom cụm dự đoán nhãn từ dữ liệu gắn nhãn

d)

Gom cụm khám phá cấu trúc trong dữ liệu không nhãn

48.

Trong kho dữ liệu, đặc tính 'Non-volatile' có nghĩa là gì?

a)

Kho dữ liệu không cần bảo trì định kỳ

b)

Dữ liệu không bao giờ cập nhật sau khi nạp

c)

Thiết bị lưu trữ không cần điện năng duy trì

d)

Người dùng chỉ truy cập dữ liệu trực tuyến

49.

Đâu KHÔNG phải là một phép thao tác OLAP điển hình?

a)

Roll up trên chiều tổng hợp

b)

Normalized để chuẩn hóa bảng

c)

Drill down vào cấp chi tiết

d)

Slice và Dice theo các chiều

50.

Trong mô hình dữ liệu chiều, vai trò của bảng chiều (Dimension) là gì?

a)

Làm sạch và tích hợp dữ liệu nguồn

b)

Cung cấp ngữ cảnh và mô tả chi tiết cho số liệu

c)

Thực hiện phép toán phức tạp dữ liệu

d)

Lưu trữ các số đo định lượng bán hàng

51.

Phân lớp (classification) được hiểu đúng là gì?

a)

Gom các điểm dữ liệu thành nhóm

b)

Dự đoán giá trị liên tục theo thời gian

c)

Gán nhãn dữ liệu theo các lớp đã biết

d)

Tìm luật kết hợp giữa các mục

52.

Thuật toán phân lớp nào hoạt động dựa trên nguyên lý xác suất có điều kiện?

a)

Decision Tree với thông tin tăng ích

b)

K‑NN với lân cận gần nhất

c)

Naive Bayes giả định độc lập thuộc tính

d)

K‑means tối ưu khoảng cách cụm

53.

Trong cây quyết định, tiêu chí phổ biến dùng để chọn thuộc tính phân nhánh là gì?

a)

Tốc độ học của mô hình

b)

Khoảng cách Euclidean trung bình

c)

Entropy hoặc Information Gain

d)

Số lượng dòng dữ liệu lớn nhất

54.

Giả định chính của Naive Bayes về các thuộc tính là gì?

a)

Dữ liệu phải được chuẩn hóa chặt

b)

Thuộc tính độc lập có điều kiện

c)

Tập huấn luyện phải cân bằng tuyệt đối

d)

Thuộc tính phụ thuộc lẫn nhau mạnh

55.

Nhược điểm chính của K‑NN khi dự đoán là gì?

a)

Không áp dụng cho dữ liệu hình ảnh

b)

Tốn nhiều thời gian dựa vào toàn bộ dữ liệu

c)

Dễ gây overfitting trên mọi tập

d)

Không thể phân lớp nhiều lớp phức tạp

56.

Precision trong phân lớp thường đo lường điều gì?

a)

Tỷ lệ âm tính bị dự đoán sai

b)

Tỷ lệ nhãn sai có thể chấp nhận

c)

Tỷ lệ đúng trong số các dự đoán dương tính

d)

Tỷ lệ dự đoán đúng trên tất cả mẫu

57.

Overfitting xảy ra khi nào trong phân lớp?

a)

Mô hình học quá sát dữ liệu huấn luyện

b)

Tập kiểm tra giống hệt tập huấn luyện

c)

Không sử dụng thuật toán tối ưu

d)

Mô hình quá đơn giản tuyến tính

58.

Thuật toán nào sau đây KHÔNG dùng cho phân lớp?

a)

Naive Bayes xác suất đơn giản

b)

Decision Tree theo entropy

c)

K‑means tối ưu cụm khoảng cách

d)

K‑Nearest Neighbors có giám sát

59.

PCA thuộc loại phương pháp học nào?

a)

Học sâu với mạng nơ-ron

b)

Học tăng cường theo phần thưởng

c)

Học không giám sát trích đặc trưng

d)

Học có giám sát với nhãn

60.

Mục tiêu chính của PCA là gì?

a)

Dự đoán giá trị tương lai chuỗi

b)

Xây dựng mô hình phân lớp tối ưu

c)

Biến đổi dữ liệu về không gian mới theo thành phần chính

d)

Loại bỏ toàn bộ thuộc tính tương quan

61.

PCA thường được áp dụng ở bước nào của quy trình khai phá dữ liệu?

a)

Thu thập dữ liệu ban đầu

b)

Gán nhãn thủ công cho dữ liệu

c)

Đánh giá mô hình bằng kiểm thử

d)

Giảm chiều dữ liệu trong tiền xử lý

62.

Gom cụm dữ liệu (clustering) chủ yếu nhằm mục tiêu nào?

a)

Dự đoán giá trị liên tục chính xác

b)

Nhóm các điểm dữ liệu tương đồng lại với nhau

c)

Gán nhãn lớp có sẵn cho dữ liệu

d)

Xây dựng cây quyết định nhanh hơn

63.

Điều gì có thể xảy ra khi tăng số cụm k quá lớn trong K-means?

a)

Cụm càng rõ ràng hơn

b)

Tăng tính khái quát mạnh

c)

Có thể gây overfitting, cụm không còn ý nghĩa

d)

Giảm thời gian chạy đáng kể

64.

Thuật toán Hierarchical Clustering tạo cụm bằng cách nào?

a)

Dự đoán số cụm tối ưu trước

b)

Chọn ngẫu nhiên cụm

c)

Gộp dần các điểm thành cụm hoặc tách dần cụm

d)

Dán nhãn thủ công cho dữ liệu

65.

Trong gom cụm, silhouette score cao thường hàm ý điều gì?

a)

Có nhiều nhiễu không kiểm soát

b)

Cụm trùng nhau đáng kể

c)

Cụm bị lệch mạnh về kích thước

d)

Cụm tốt, tách biệt rõ ràng

66.

Lược đồ quan hệ (Relational Schema) bao gồm thành phần nào?

a)

Các giá trị cụ thể của dữ liệu

b)

Chỉ bao gồm tên quan hệ trống

c)

Tên quan hệ và tập hợp các thuộc tính

d)

HUD các dòng dữ liệu

67.

Doanh nghiệp cần kho dữ liệu chủ yếu để làm gì?

a)

Tăng tốc độ mạng nội bộ

b)

Hỗ trợ ra quyết định chính xác và toàn diện

c)

Thay thế toàn bộ hệ thống ERP

d)

Tối ưu phân loại khách hàng trực tiếp

68.

Trong mô hình sao, bảng fact thường dùng để:

a)

Làm bảng phụ trợ ít dùng

b)

Chứa thông tin người dùng đăng ký

c)

Lưu dữ liệu định lượng có thể đo lường

d)

Lưu các thuộc tính mô tả văn bản

69.

Vai trò chính của bảng fact là gì?

a)

Ghi lại các sự kiện và chỉ số kinh doanh

b)

Ghi dữ liệu metadata hệ thống

c)

Làm khóa chính cho toàn bộ mô hình

d)

Lưu công thức tính toán cố định

70.

Dữ liệu đưa vào kho dữ liệu thường được xử lý như thế nào?

a)

Lưu nguyên bản chưa xử lý

b)

Làm sạch, chuyển đổi và tích hợp từ nhiều nguồn

c)

Chỉ ghi tạm thời rồi xóa

d)

Cập nhật liên tục mỗi giây

71.

Trong một quan hệ, một 'bộ' (tuple) tương ứng với khái niệm nào?

a)

Toàn bộ bảng dữ liệu

b)

Tên của bảng dữ liệu

c)

Một cột dữ liệu duy nhất

d)

Một dòng dữ liệu cụ thể

72.

Mục tiêu chính của kỹ thuật nén ảnh bằng gom cụm là gì?

a)

Tăng số lượng cụm để giảm chất lượng

b)

Lưu mỗi điểm ảnh với một số bit nhỏ hơn

c)

Giảm số lượng màu sắc mà không mất dữ liệu

d)

Tách ảnh thành các vùng phân giải cao

73.

Khi số lượng cụm tăng lên trong nén ảnh bằng gom cụm, chất lượng bức ảnh thường:

a)

Không đổi trong mọi trường hợp

b)

Được cải thiện đến một mức rồi bão hòa

c)

Giảm đi không thể tránh

d)

Chỉ thay đổi nếu dữ liệu ban đầu lỗi

74.

Thuật toán Apriori dựa trên nguyên lý nào?

a)

Không cần quan tâm đến ngưỡng support

b)

Nếu một tập con phổ biến thì tập siêu sẽ không phổ biến

c)

Nếu một tập mục không thường xuyên thì mọi tập siêu của nó cũng không thường xuyên

d)

Luôn chọn tập có support thấp nhất

75.

Khi nào nên dùng Naive Bayes thay vì các thuật toán phân lớp khác?

a)

Khi dữ liệu có nhiều thuộc tính gần độc lập

b)

Khi số cụm rất lớn khó xác định

c)

Khi cần tối ưu khoảng cách Euclid

d)

Khi dự đoán giá trị liên tục phức tạp