wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Khai phá dữ liệu

Total questions: 100

Worksheet time: 50mins

Name
Class
Date
1.

Chiều cao của sinh viên (cm) thuộc loại dữ liệu nào?

a)

A. Rời rạc

b)

B. Liên tục

c)

C. Định danh

d)

D. Nhị phân

2.

Số lượng môn học một sinh viên đăng ký trong học kỳ là:

a)

A. Liên tục

b)

B. Định danh

c)

C. Rời rạc

d)

D. Trật tự

3.

Mức độ xếp loại học lực: Yếu – Trung bình – Khá – Giỏi thuộc loại dữ liệu nào?

a)

A. Định danh

b)

B. Nhị phân

c)

C. Liên tục

d)

D. Trật tự

4.

Giới tính (Nam / Nữ) là dữ liệu:

a)

A. Trật tự

b)

B. Liên tục

c)

C. Định danh

d)

D. Nhị phân

5.

Trạng thái đơn hàng: Đã thanh toán / Chưa thanh toán thuộc loại nào?

a)

A. Định danh

b)

B. Nhị phân

c)

C. Trật tự

d)

D. Liên tục

6.

Màu sắc của sản phẩm (Đỏ, Xanh, Vàng, Đen) là dữ liệu:

a)

A. Trật tự

b)

B. Liên tục

c)

C. Rời rạc

d)

D. Định danh

7.

Bước đầu tiên trong quy trình khai phá dữ liệu là:

a)

A. Khám phá để hiểu tập dữ liệu

b)

B. Chuẩn bị dữ liệu

c)

C. Xác định mục tiêu và thu thập dữ liệu

d)

D. Xây dựng mô hình

8.

Sau khi xác định mục tiêu và thu thập dữ liệu, bước tiếp theo là:

a)

A. Chuẩn bị dữ liệu

b)

B. Khám phá để hiểu tập dữ liệu

c)

C. Đánh giá

d)

D. Xây dựng mô hình

9.

Bước nào được thực hiện ngay trước khi xây dựng mô hình?

a)

A. Khám phá dữ liệu

b)

B. Xác định mục tiêu

c)

C. Chuẩn bị dữ liệu

d)

D. Đánh giá

10.

Thứ tự đúng của các bước sau là gì?

  1. 1. Chuẩn bị dữ liệu

  2. 2. Đánh giá

  3. 3. Xây dựng mô hình

a)

A. 1 → 2 → 3

b)

B. 1 → 3 → 2

c)

C. 3 → 1 → 2

d)

D. 2 → 1 → 3

11.

Việc áp dụng thuật toán như K-means, Decision Tree, Regression được thực hiện ở bước nào?

a)

A. B5 – Đánh giá

b)

B. B3 – Chuẩn bị dữ liệu

c)

C. B4 – Xây dựng mô hình

d)

D. B2 – Khám phá dữ liệu

12.

Bước nào chiếm nhiều thời gian và nguồn lực nhất (~80%) trong toàn bộ quy trình khai phá dữ liệu?

a)

A. B2 – Khám phá dữ liệu

b)

B. B3 – Chuẩn bị dữ liệu

c)

C. B4 – Xây dựng mô hình

d)

D. B5 – Đánh giá

13.

Khi chọn 1 thuộc tính A để làm gốc cây quyết định và thuộc tính A có 3 giá trị thì cây quyết định sẽ có bao nhiêu nhánh?

a)

A. 6 nhánh

b)

B. 9 nhánh

c)

C. 3 nhánh

d)

D. 4 nhánh

14.

Thuật toán Apriori được sử dụng để thực hiện nhiệm vụ nào trong khai phá dữ liệu?

a)

A. tìm các luật kết hợp

b)

B. Thực hiện công việc khác

c)

C. tìm các tập mục thường xuyên

d)

D. tìm các tập mục có k - item

15.

giá trị "Gain" của thuộc tính A trong tập S ký hiệu là?

a)

A. Gain(A, S)

b)

B. Gain(entropy, S, A)

c)

C. Gain(S, A, entropy)

d)

D. Gain(S, A)

16.

Thuật toán K-means dễ bị ảnh hưởng bởi điều gì?

a)

A. Dữ liệu có outliers

b)

B. Dữ liệu có phương sai nhỏ

c)

C. Dữ liệu có phương sai lớn

d)

D. Dữ liệu có kích thước lớn

17.

Tập dữ liệu S gồm các thuộc tính A, B, C. Gain(S, A) = 0.3, Gain(S, B) = 0.6, Gain(S,C) = 0.14, Gain(S,D) = 0.99. Thuộc tính nào được chọn để phân nhánh?

a)

A. thuộc tính B

b)

B. thuộc tính A

c)

C. thuộc tính CD

d)

D. thuộc tính D

18.

Thuật toán phân cụm K-mean dừng khi nào?

a)

A. tâm cụm không thay đổi

b)

B. số cụm sinh ra là k

c)

C. tùy theo yêu cầu của người dùng

d)

D. khi tất cả các phần tử đã được gán vào k cụm

19.

Trong K-means, khoảng cách giữa các điểm dữ liệu được đo lường bằng phương pháp nào?

a)

A. Jaccard Distance

b)

B. Cosine Similarity

c)

C. Euclidean Distance

d)

D. Mahalanobis Distance

20.

Bộ dữ liệu kiểm tra sự liên quan giữa tuổi và sự béo phì của bệnh viên như sau:

Đâu là đáp án đúng tính hệ số tương quan giữa hai thuộc tính trên?

a)

A. 1

b)

B. -1

c)

C. 0.7

d)

D. 0.5

21.

Cho dữ liệu tuổi: 13, 15, 16, 16, 19, 20, 22, 22, 25, 30, 33, 33, 33, 36. Dùng kỹ thuật z-score chuyển giá trị 33 với độ lệch chuẩn là 10,2.

a)

A. 0.432

b)

B. 0.556

c)

C. 0.827

d)

D. 0.895

22.

Trong tiền xử lý dữ liệu, phương pháp "rời rạc hóa" được sử dụng để làm gì?

a)

A. biến đổi miền giá trị của các thuộc tính

b)

B. loại bỏ dữ liệu có giá trị thiếu

c)

C. giá trị số trong miền liên tục sẽ được chuyển về các khoảng số được gán nhãn hoặc các khoảng gán nhãn.

d)

D. xóa các mẫu dữ liệu không liên quan hoặc mâu thuẫn.

23.

Cho tập dữ liệu được xếp theo giá: 4, 8, 9, 15, 22, 22, 24, 28, 28, 34, 38. Chia tập dữ liệu trên thành 3 thùng theo chiều sâu. Kết quả chia thùng làm tròn theo trung bình là:

a)

A. Bin 1: 4, 4, 4, 15; Bin 2: 21, 21, 25, 25; Bin 3: 26, 26, 26, 34

b)

B. Bin 1: 4, 4, 4, 4; Bin 2: 21, 21, 21, 21; Bin 3: 26, 26, 26, 26, 26

c)

C. Bin 1: 15, 15, 15, 15; Bin 2: 23, 23, 23, 23; Bin 3: 29, 29, 29, 29

d)

A. Bin 1: 9, 9, 9, 9; Bin 2: 23, 23, 23, 23; Bin 3: 32, 32, 32, 32.

24.

Weka xử lý dữ liệu thiếu bằng bộ lọc chuẩn nào sau đây

a)

A. Set missing values

b)

B. Replace with mising value

c)

C. Filtering Attribute

d)

D. Tất cả đáp án đều đúng

25.

Cho tập ví dụ học sinh S như bảng. Entropy(S) là

a)

A. Entropy(S) = 1

b)

B. Entropy(S) = 0

c)

C. Entropy(S) = 1.8

d)

D. Entropy(S) = 0.4

26.

Dữ liệu đầu vào thông dụng trong Weka hỗ trợ định dạng file nào?

a)

A. .arff

b)

B. .csv

c)

C. json

d)

D. Tất cả các lựa chọn trên

27.

Dùng thuật toán K-means phân dữ liệu X = ({(2,3), (5,4), (9,6), (1,8), (8,2), (10,8)}) thành 2 cụm. Chọn C1 = (2,3), C2= (5,4) làm tâm cụm khởi tạo ban đầu.

a)

A. Cụm 1: {(2,3), (1,8),(10,8)};

Cụm 2: {(5,4), (9,6), (8,2)}

b)

B. Cụm 1: {(2,3), (1,8)};

Cụm 2: {(5,4), (9,6), (10,8), (8,2)}

c)

C. Cụm 1: {(9,6), (5,4), (8,2)};

Cụm 2: {(2,3), (1,8), (10,8)}

d)

D. Cụm 1: {(5,4), (1,8), (8,2)};

Cụm 2: {(2,3), (9,6), (10,8)}

28.

Nhiệm vụ của thuật toán ID3 là?

a)

A. xác định số nút trong cây

b)

B. tìm ra số cụm trong tập dữ liệu

c)

C. đưa ra cây quyết định từ một tập dữ liệu huấn luyện

d)

D. tìm ra một tập trong cây

29.

Weka cung cấp chức năng nào để xử lý dữ liệu thiếu?

a)

A. Data preprocessing

b)

B. classification

c)

C. Handling missing Values

d)

D. attribute Selection

30.

Chuẩn hóa Min-Max trong tiến trình xử lý dữ liệu thực hiện việc gì?

a)

A. chuyển đổi dữ liệu về khoảng giá trị [0,1]

b)

B. tất cả phương án trên

c)

C. chuẩn hóa dữ liệu thành các giá trị có trung bình bằng 0 và độ lệch chuẩn bằng 1

d)

D. chuẩn hóa dữ liệu thành các giá trị có phân phối chuẩn.

31.

Cho dữ liệu tuổi như sau: 13, 15, 16, 16, 19, 20, 22, 22, 25, 30, 33, 33, 33, 36. Sử dụng kỹ thuật min-max cho biết giá trị tuổi 22 trong khoảng [0,1].

a)

A. 0,2562

b)

B. 0,4323

c)

C. 0,5261

d)

D. 0,3913

32.

Kỹ thuật tiền xử lý nào giúp giảm kích cỡ của dữ liệu nhiều nhất mà không ảnh hưởng tới kết quả phân tích

a)

A. Kỹ thuật thu gọn dữ liệu

b)

B. Kỹ thuật chuyển dạng dữ liệu

c)

C. Kỹ thuật làm sạch dữ liệu

d)

D. Kỹ thuật tích hợp dữ liệu

33.

Thuật toán K-means giải quyết bài toán gì?

a)

A. Phân loại

b)

B. Dự đoán

c)

C. Phân cụm

d)

D. Tất cả các đáp án

34.

Trong tiền xử lý dữ liệu, công việc "xử lý dữ liệu thiếu" bao gồm:

a)

A. Điền giá trị thiếu bằng giá trị trung bình của thuộc tính

b)

B. Xóa các mẫu dữ liệu có giá trị thiếu

c)

C. Sử dụng các phương pháp dự đoán để điền giá trị thiếu

d)

D. Tất cả các phương án trên

35.

Công cụ nào trong Weka giúp khám phá các luật kết hợp từ dữ liệu

a)

A. Cluster

b)

B. Associate

c)

C. Classify

d)

D. Visualize

36.

Trong thuật toán phân cụm k-mean, ban đầu k trọng tâm được chọn:

a)

A. Chọn k phần tử nằm ở tâm

b)

B. Chọn k phần tử có giá trị bằng giá trị trung bình của các phần tử trong tập dữ liệu

c)

C. Chọn ngẫu nhiên

d)

D. Chọn k các phần tử có giá trị nhỏ nhất

37.

Cho tập ví dụ học (S) như bảng. Entropy(S) là

a)

A. Entropy(S) = 0

b)

B. Entropy(S) = 1

c)

C. Entropy(S) = 0.756

d)

D. Entropy(S) = 1.875

38.

Cho cơ sở dữ liệu giao dịch gồm N giao dịch. I là tập chứa tất cả các mục trong CSDL. X là tập chứa các mục thuộc I. Tập mục X được gọi là tập mục thường xuyên khi:

a)

A. Support(X) = Min_Supp

b)

B. Support(X) <= Min_Supp

c)

C. Support(X: Min_Supp/N)

d)

D. Support(X) >= Min_Supp

39.

Cho bản ghi dữ liệu, giá trị của các thuộc tính như sau: X=(6, 2, 5, 7, 5, ?). Dấu hỏi là giá trị của thuộc tính bị thiếu. Sử dụng phương pháp tính trung bình giá trị của các thuộc tính của bản ghi hiện có, hãy cho biết vị trí dấu hỏi điền giá trị là bao nhiêu

a)

A. 9

b)

B. 6

c)

C. 8

d)

D. 5

40.

Khi xử lý thiếu giá trị của các bản ghi dữ liệu, phương pháp 'Bỏ qua bản ghi có giá trị thiếu' chỉ thích hợp khi

a)

A. Các bản ghi có dữ liệu bị thiếu chiếm tỷ lệ lớn trong toàn bộ dữ liệu

b)

B. Không thể bỏ qua, phải tìm các giá trị để điền vào các bản ghi bị thiếu

c)

C. Có thể bỏ qua tất cả các bản ghi bị thiếu

d)

D. Các bản ghi có dữ liệu bị thiếu chiếm tỷ lệ nhỏ trong toàn bộ dữ liệu

41.

Trường hợp người bệnh không có thẻ BHYT sẽ được để trống mục thẻ BHYT. Khi đó dữ liệu này là

a)

A. Không có đáp án nào đúng

b)

B. Dữ liệu thiếu

c)

C. Dữ liệu bị lỗi

d)

D. Dữ liệu bị nhiễu

42.

Trong thuật toán k-mean, sau khi gán các đối tượng vào k cụm cần phải:

a)

A. Tìm một số phần tử đại diện của cụm

b)

B. Tính lại tâm của các cụm

c)

C. Tính khoảng cách giữa các phần tử trong cụm

d)

D. Trộn các cụm lại với nhau để số cụm sinh ra là ít nhất

43.

Cho cơ sở dữ liệu giao dịch gồm N giao dịch (bản ghi). I là tập chứa tất cả các mục (item) trong CSDL. X, Y là tập chứa các mục thuộc I. Độ tin cậy của luật kết hợp X -> Y được định nghĩa là:

a)

A. Confidence (X -> Y) = Số lượng giao dịch hỗ trợ cả X và Y / N

b)

B. Confidence (X -> Y) = Số lượng giao dịch hỗ trợ cả X và Y / Số lượng giao dịch hỗ trợ Y

c)

C. Confidence (X -> Y) = Số lượng giao dịch hỗ trợ cả X và Y / Số lượng giao dịch hỗ trợ X

d)

D. Confidence (X -> Y) = Số lượng giao dịch hỗ trợ X / Số lượng giao dịch hỗ trợ Y

44.

Cho CSDL giao dịch như hình vẽ với Min_Support = 2 (50%).

Sử dụng thuật toán Apriori, sau lần duyệt thứ hai, tập mục chứa 2-item bị loại bỏ là:

a)

A. {A,B}

b)

B. {A,C}

c)

C. {B,C}

d)

D. {B,E}

45.

Cho tập dữ liệu được xếp theo giá trị: 4, 8, 9, 15, 21, 21, 24, 25, 26, 28, 29, 34. Chia thành 3 thùng theo chiều sâu. Kết quả phương pháp chia thùng làm trơn theo biên là

a)

A. Bin 1: 15, 15, 15, 15; Bin 2: 23, 23, 23, 23; Bin 3: 29, 29, 29, 29

b)

B. Bin 1: 4, 4, 4, 15; Bin 2: 21, 21, 25, 25; Bin 3: 26, 26, 26, 34

c)

C. Bin 1: 4, 4, 4, 4; Bin 2: 21, 21, 21, 21; Bin 3: 26, 26, 26, 26

d)

D. Bin 1: 9, 9, 9, 9; Bin 2: 23, 23, 23, 23; Bin 3: 29, 29, 29, 29

46.

Kỹ thuật học máy trong khai phá dữ liệu là gì?

a)

A. Phân tích cú pháp và từ vựng trong văn bản

b)

B. Xác định mối quan hệ giữa các biến trong dữ liệu

c)

C. Tạo ra mô hình và dự đoán từ dữ liệu

d)

D. Tất cả các phương án trên

47.

Thuật toán K-means có thể bị ảnh hưởng bởi điều gì?

a)

Dữ liệu có quá nhiều giá trị ngoại lai (outliers)

b)

Các cụm có kích thước lớn

c)

Các cụm có mật độ đồng đều

d)

Số lượng điểm dữ liệu nhỏ

48.

Kết quả phân cụm dữ liệu tốt phải thỏa mãn điều kiện gì?

a)

Sự khác biệt giữa các cụm cần được cực đại hóa (1)

b)

Sự khác biệt giữa các đối tượng trong cùng một cụm cần được cực tiểu hóa (2)

c)

Số lượng đối tượng trong các cụm phải cân bằng nhau (3)

d)

Thỏa mãn (1) và (2)

49.

Tập dữ liệu cân nặng của 7 học sinh lớp 3A lần lượt là [23, 31, 27, 36, 21, 30, 42]. Hãy xác định giá trị trung bình (Mean) của tập?

a)

30

b)

31

c)

27

d)

23

50.

Tập dữ liệu S gồm các thuộc tính A, B, C, D. Gain (S, A) = 0.3, Gain (S, B) = 0.6, Gain (S, C) = 0.14, Gain (S, D) = 0.99. Thuộc tính nào được chọn để phân nhánh?

a)

Thuộc tính D

b)

Thuộc tính C

c)

Thuộc tính B

d)

Thuộc tính A

51.

Trong cây quyết định, mục đích của việc sử dụng "Entropy" là gì?

a)

Đo lường mức độ phân loại chính xác

b)

Đo lường sự phân tán của các thuộc tính

c)

Đo lường sự hỗn loạn trong dữ liệu tại mỗi nút

d)

Đo lường độ phức tạp của mô hình

52.

Trong thuật toán Apriori, điều kiện nào phải được thỏa mãn để một tập mục được coi là tập mục phổ biến?

a)

Có độ tin cậy cao hơn ngưỡng cho trước

b)

Có độ hỗ trợ thấp hơn ngưỡng tối thiểu

c)

Xuất hiện trong ít nhất một giao dịch

d)

Có độ hỗ trợ cao hơn ngưỡng tối thiểu

53.

Luật kết hợp (Association Rules) là gì?

a)

Kỹ thuật kết hợp các dữ liệu có đặc tính tương đồng thành từng cụm

b)

Kỹ thuật xử lý dữ liệu bằng các thuật toán học máy

c)

Kỹ thuật khai phá dữ liệu nhằm tìm kiếm mối quan hệ có ý nghĩa giữa các mục trong một cơ sở dữ liệu

d)

Kỹ thuật để trích xuất dữ liệu thô

54.

Trong cây quyết định, nếu nút không thể phân chia thêm, điều gì sẽ xảy ra?

a)

Tiếp tục phân chia cho đến khi có ít nhất 100 điểm dữ liệu

b)

Tạo một nút lá với quyết định cuối cùng

c)

Thực hiện việc huấn luyện lại

d)

Loại bỏ nút đó khỏi cây

55.

Weka là gì?

a)

Một công cụ mã nguồn mở để khai phá dữ liệu và học máy

b)

Một hệ thống Big Data

c)

Một thư viện Python cho xử lý dữ liệu

d)

Một ngôn ngữ lập trình cho học máy

56.

Trong số các loại dữ liệu sau, loại dữ liệu nào dễ dàng trong lưu trữ và phân tích nhất?

a)

Dữ liệu vật lý (Physical Data)

b)

Dữ liệu có cấu trúc (Structured Data)

c)
  • Dữ liệu phi cấu trúc (Unstructured Data)

d)

Dữ liệu bán cấu trúc (Semi-structured Data)

57.

Độ tin cậy (Confidence) của luật kết hợp {X} -> {Y} được tính thế nào?

a)

Tổng số giao dịch chứa cả X và Y

b)

Tỷ lệ giao dịch chứa cả X và Y so với tổng số giao dịch chứa X

c)

Tỷ lệ giao dịch chứa cả X và Y so với tổng số giao dịch

d)

Tỷ lệ giao dịch chứa X so với tổng số giao dịch chứa Y

58.

Giá trị min và max của thuộc tính thu nhập là $12000$ và $98000$, chuyển đổi về khoảng $[0, 1]$ khi đó thu nhập có giá trị $73600$ sẽ có giá trị mới là: (1 Point)

a)

0,716

b)

0,617

c)

0,167

d)

0,761

59.

Phương pháp nào dưới đây được sử dụng trong thuật toán Apriori để tạo ra các tập mục phổ biến?

a)

Tạo các tập mục ứng viên k-hạng mục

b)

Sắp xếp các dữ liệu thành các nhóm

c)

Phân chia dữ liệu thành các nhóm có đặc điểm tương đồng

d)

Tạo các tập mục n-gram

60.

Phép biến đổi nào khi những giá trị số trong miền liên tục sẽ được chuyển về các khoảng số được gán nhãn hoặc các khoảng gán nhãn?

a)

Chuẩn hóa

b)

Rời rạc hóa

c)

Làm mịn biên

d)

Tổng hợp

61.

Nếu số lượng cụm k quá lớn trong thuật toán K-means, điều gì có thể xảy ra?

a)

Mô hình sẽ bị underfitting

b)

Mô hình sẽ không thể hội tụ

c)

Mô hình sẽ quá phức tạp và dễ bị overfitting

d)

Dữ liệu sẽ không được phân chia chính xác

62.

Trong giải thuật ID3

a)

Mỗi thuộc tính chỉ được phép xuất hiện tối đa 1 lần đối với bất kỳ một đường đi nào trong cây

b)

Mỗi thuộc tính chỉ được phép xuất hiện tối thiểu 1 lần đối với bất kỳ một đường đi nào trong cây

c)

Mỗi thuộc tính được xuất hiện số lần bằng số nhánh của cây

d)

Mỗi thuộc tính được xuất hiện tùy theo giá trị có của thuộc tính kiểm tra

63.

Trong K-means, làm thế nào để xác định số lượng cụm k phù hợp

a)

Thử nghiệm với nhiều giá trị k và chọn giá trị tốt nhất

b)

Chọn k bằng cách tính trung bình độ đo khoảng cách giữa các điểm dữ liệu

c)

Sử dụng giá trị mặc định là 3

d)
  • Chọn k là số lớn nhất có thể để đảm bảo độ chính xác

64.

Giả sử giá trị thuộc tính tuổi như sau: 13, 16, 16, 18, 18, 19, 30

a)

18 là giá trị trung vị

b)

16 là giá trị trung vị

c)

30 là giá trị trung vị

d)

Không tồn tại giá trị trung vị

65.

Điền vào dấu ... Tỷ lệ các giao dịch chứa cả X và Y đổi với giao dịch chứa X

a)

Độ hỗ trợ

b)

Độ tin cậy

c)

Minsup

d)

Mincon

66.

Thuật toán ID3 sử dụng thông tin nào để xây dựng cây quyết định?

a)

Chỉ số Gini Index

b)

Information Gain

c)

Chi-squared

d)

Entropy

67.

Trong thuật toán K-Means, điều kiện nào để kết thúc thuật toán?

a)

A. Số cụm thay đổi qua mỗi vòng lặp

b)

B.Tâm cụm không thay đổi hoặc thay đổi rất ít giữa các vòng lặp

c)

C. Tổng khoảng cách trong cụm đạt giá trị cực đại

d)

D. Số lượng điểm dữ liệu trong cụm bằng nhau

68.

Đâu là độ đo tập trung của dữ liệu (chọn 2 phương án)

a)

Độ đo trung vị

b)

Phương sai

c)

Độ lệch chuẩn

d)

Độ đo trung bình

69.

Chỉ số nào thường được sử dụng để chọn thuộc tính tại mỗi nút trong cây quyết định?

a)

A.Min_supp và Min_conf

b)

B. giá trị trung bình của các thuộc tính

c)

C. Entropy và thu được thông tin (information gain)

d)

D. median, mode, range

70.

Phương pháp chuẩn hóa nào thường sử dụng khi không xác định được giá trị lớn nhất và nhỏ nhất của thuộc tính.

a)

Chuẩn hóa thay đổi tỷ lệ

b)

Chuẩn hóa z-score

c)

Chuẩn hóa min-max

d)

Chuẩn hóa binning

71.

Cho CSDL giao dịch T như bảng sau. Tính độ hỗ trợ của ( Lê, Nho)-> Cam

a)

0.4

b)

0.6

c)

0.67

d)

0.8

72.

Cho dữ liệu tuổi như sau: 13, 15,16,19,20,22, 25,30. Sử dụng kỹ thuật min-max cho biết giá trị tuổi 22 trong khoảng (0, 1)

a)

0.529

b)

0.925

c)

0.295

d)

0.259

73.

Nút trong của cây biểu diễn

a)

A. Một thuộc tính cần kiểm tra giá trị đối với các ví dụ

b)

B. Biểu diễn một phân lớp

c)

C. Giá trị có thể của thuộc tính gắn với nút đó

d)

D. Không có đáp án nào đúng

74.

Cho tập dữ liệu A(2, 3);B(5, 4);C(9, 6);D(4, 2). Sử dụng thuật toán

Kmean phân cụm với k = 2. Với tâm cụm khởi tạo ban đầu là A(2, 3); B(5,

4). Sau lần lặp thứ nhất C, D nằm ở tâm cụm nào?

a)

C nằm ở tâm cụm B,

D nằm ở tâm cụm A

b)

C nằm ở tâm cụm A,

D nằm ở tâm cụm B

c)

D đều nằm ở tâm cụm A

d)

D đều nằm ở tám cụm B

75.

Phát biểu nào sau đây đúng về học cây quyết định

a)

A. Một cây quyết định có thể được biểu diễn bằng một tập các luật IF-THEN

b)

B. Học cây quyết định có thể thực hiện ngay cả với các dữ liệu có chứa nhiễu/lỗi

c)

C. Là một trong các phương pháp học quy nạp được dùng phổ biến nhất

d)

D. Cả 3 đáp án đều đúng

76.

Khai phá dữ liệu giúp tìm ra những thông tin gì từ dữ liệu?

a)

A. Thông tin đã biết trước

b)

B. Thông tin tiềm ẩn và tri thức mới

c)

C. Thông tin về cú pháp và cấu trúc dữ liệu

d)

D. Tất cả các phương án trên

77.

Nhược điểm chính của thuật toán Apriori là gì?

a)

Tốn nhiều bộ nhớ và thời gian. Không thích hợp với các mẫu lớn. Chi phí để duyệt CSDL nhiều.

b)

Không tìm được các tập thường xuyên

c)

Kết quả của thuật toán không ứng dụng được trong các bài toán thực tế

d)

Thuật toán quá phức tạp, khó hiểu

78.

Trong thuật toán k-means, bước tính khoảng cách thường sử dụng độ đo nào

a)

Euclidean

b)

Manhattan

c)

Minkowski

d)

Cả 3 đáp án đều đúng

79.

Thuật toán K-Means dừng khi nào?

a)

Khi không thể gán (hoặc gán lại) từng điểm vào cụm khác

b)

Khi số cụm sinh ra là k

c)

Tùy theo yêu cầu của người dùng

d)

Khi tất cả các phần tử đã được gán vào k cụm

80.

Kỹ thuật tiền xử lý nào giúp giảm kích cỡ của dữ liệu nhiều nhất mà không ảnh hưởng tới kết quả phân tích

a)

Kỹ thuật tích hợp dữ liệu

b)

Kỹ thuật thu gọn dữ liệu

c)

Kỹ thuật chuyển dạng dữ liệu

d)

Kỹ thuật làm sạch dữ liệu

81.

Cho cây như hình vẽ, hãy chỉ ra đầu là nút trong của cây

a)

Humidity, Wind

b)

Outlook

c)

No, Yes

d)

Outlook, Wind

82.

Thuật ngữ Tiền xử lí dữ liệu bằng tiếng Anh

a)

Tiền xử lý dữ liệu (Data Preprocessing)

b)

Xử lý dữ liệu (Data Processing)

c)

Tiền xử lý trong cơ sở dữ liệu (Preprocessing in Database)

d)

Xử lý dữ liệu(Data Process)

83.

Mục tiêu chính của phân lớp dữ liệu (Classification) là gì?

a)

Phân các đối tượng vào từng nhóm riêng biệt

b)

Xác định mối quan hệ giữa các đối tượng trong cùng một lớp

c)

Gán nhãn cho dữ liệu mới dựa trên dữ liệu lịch sử

d)

Xác định mức độ xuất hiện cùng nhau của các đối tượng

84.

Đánh giá chất lượng phân nhóm theo tiêu chí nào

a)

Khoảng cách các nhóm cần cực đại hóa, khoảng cách bên trong nhóm cần cực tiểu hóa

b)

Khoảng cách các nhóm cần cực tiểu hóa, khoảng cách bên trong nhóm cần cực đại hóa

c)

Khoảng cách các nhóm và khoảng cách bên trong nhóm cần cực đại hóa

d)

Khoảng cách các nhóm và khoảng cách bên trong nhóm cần cực tiểu hóa

85.

Định nghĩa về khai phá dữ liệu là gì?

a)

Quá trình khám phá tri thức từ dữ liệu

b)

Quá trình tạo dự đoán từ dữ liệu

c)

Quá trình lưu trữ dữ liệu

d)

Quá trình chia sẻ dữ liệu

86.

Khi sử dụng thuật toán K-means, nếu số cụm k được chọn quá lớn, điều gì có thể xảy ra

a)

Tăng độ chính xác của phân loại

b)

Giảm độ chính xác của phân loại

c)

Không ảnh hưởng đến kết quả phân loại

d)

Dữ liệu sẽ trở nên khó khăn để phân loại

87.

Đâu là vấn đề hay xảy ra trong những nơi có trữ lượng dữ liệu lớn

a)

Dữ liệu không đầy đủ

b)

Dữ liệu bị nhiễu

c)

Dữ liệu không nhất quan

d)

Tất cả các phương án

88.

Độ hỗ trợ (Support) của luật kết hợp {x} - {y} được tính thế nào?

a)

A. tỷ lệ giao dịch chứa X so với tổng số giao dịch

b)

B. tỷ lệ giao dịch chứa cả X và Y so với tổng số giao dịch

c)

C. Tỷ lệ giao dịch chứa Y so với tổng số giao dịch

d)

D. Tổng số giao dịch chứa cả X và Y

89.

Điều gì xảy ra nếu ngưỡng độ hỗ trợ (min_supp) được đặt quá cao trong thuật toán Apriori?

a)

A. Nhiều luật có thể bị bỏ sót

b)

B.Sẽ tìm thấy nhiều tập mục phổ biến hơn

c)

C.Tất cả các tập mục đều được chọn

d)

D.Thuật toán không thể hoàn thành

90.

Support của tập mục A trong CSDL giao tác D là gì?

a)

Là tỷ lệ phần trăm số giao tác trong CSDL có chứa A trên tổng số các giao tác trong D

b)

Là tỷ lệ phần trăm số giao tác trong CSDL không chứa A trên tổng số các giao tác trong D

c)

Là chi số hỗ trợ trong A

d)

Là chi số hỗ trợ trong B

91.

Confidence của luật kết hợp X → Y là gì?

a)

Là tỷ lệ phần trăm giữa số giao tác chứa cả X và Y với số giao tác chửa X trong CSDL D

b)

Là tỷ lệ phần trăm giữa số giao tác Y và số giao tác chứa X trong CSDL D

c)

Là tỉ lệ phần trăm giữa số giao tác X và số giao tác chứa Y trong CSDL D

d)

Là chỉ số hỗ trợ trong CSDL

92.

Phần mềm Weka cài đặt một số thuật toán trong lĩnh vực nào?

a)

Data Mining

b)

Tìm kiếm văn bản

c)

Trí tuệ nhân tạo

d)

Học máy

93.

Tập mục thường xuyên là gì?

a)

Là tập mục có độ hỗ trợ lớn hơn hoặc bằng ngưỡng hỗ trợ hỗ trợ tối thiểu cho trước

b)

Là tập mục có độ hỗ trợ lớn hơn hoặc bằng 50%

c)

Là tập mục có độ hỗ trợ lớn hơn hoặc bằng 90%

d)

Là tập mục có độ hỗ trợ lớn hơn hoặc bằng 30%

94.

Đâu không phải là thuật toán khai phá dữ liệu bằng luật kết hợp?

a)

Thuật toán K-Mean

b)

Thuật toán Apriori

c)

Thuật toán AprioriTID

d)

Thuật toán FP -Growth

95.

Một số đo độ phân tán được sử dụng phổ biến nhất trong thống kê là gì?

a)

A. Trung bình (Mean)

b)

B. Phạm vi (Range), Phương sai (Variance), Độ lệch chuẩn (Standard Deviation)

c)

C. Trung vị (Median)

d)

D. Mốt (Mode)

96.

Cho tập dữ liệu B:
1, 2, 3, 4, 5, 6, 6, 7, 8, 9, 10, 11
Phạm vi (range) của tập dữ liệu B là bao nhiêu?

a)

A. 9

b)

B. 10

c)

C. 11

d)

D. 12

97.

Cho tập dữ liệu điểm kiểm tra của 10 học sinh:
55, 60, 62, 65, 68, 70, 72, 75, 78, 80. biết Q1 = 61, Q3= 76.5

Giá trị khoảng tứ phân vị (IQR) của tập dữ liệu trên là bao nhiêu?

a)

A. 14.5

b)

B. 15

c)

C. 15.5

d)

D. 16

98.

Cho tập dữ liệu:
55, 60, 62, 65, 68, 70, 72, 75, 78, 80

Giá trị Q1 của tập dữ liệu là bao nhiêu?

a)

A. 60

b)

B. 61

c)

C. 62

d)

D. 65

99.

Cho tập dữ liệu:
55, 60, 62, 65, 68, 70, 72, 75, 78, 80

Giá trị Q3 của tập dữ liệu là bao nhiêu?

a)

A. 75

b)

B. 76

c)

C. 76.5

d)

D. 78

100.

Tính Information Gain cho thuộc tính Quang cảnh. Biết Entropy(S) = 0.940. Hỏi Gain (S, Quang cảnh) = ?

a)

A. 0.246

b)

B. 0.642

c)

C. 0.3

d)

D. 0.21