Font size
WorksheetsKhai phá dữ liệu
Total questions: 100
Worksheet time: 50mins
Chiều cao của sinh viên (cm) thuộc loại dữ liệu nào?
A. Rời rạc
B. Liên tục
C. Định danh
D. Nhị phân
Số lượng môn học một sinh viên đăng ký trong học kỳ là:
A. Liên tục
B. Định danh
C. Rời rạc
D. Trật tự
Mức độ xếp loại học lực: Yếu – Trung bình – Khá – Giỏi thuộc loại dữ liệu nào?
A. Định danh
B. Nhị phân
C. Liên tục
D. Trật tự
Giới tính (Nam / Nữ) là dữ liệu:
A. Trật tự
B. Liên tục
C. Định danh
D. Nhị phân
Trạng thái đơn hàng: Đã thanh toán / Chưa thanh toán thuộc loại nào?
A. Định danh
B. Nhị phân
C. Trật tự
D. Liên tục
Màu sắc của sản phẩm (Đỏ, Xanh, Vàng, Đen) là dữ liệu:
A. Trật tự
B. Liên tục
C. Rời rạc
D. Định danh
Bước đầu tiên trong quy trình khai phá dữ liệu là:
A. Khám phá để hiểu tập dữ liệu
B. Chuẩn bị dữ liệu
C. Xác định mục tiêu và thu thập dữ liệu
D. Xây dựng mô hình
Sau khi xác định mục tiêu và thu thập dữ liệu, bước tiếp theo là:
A. Chuẩn bị dữ liệu
B. Khám phá để hiểu tập dữ liệu
C. Đánh giá
D. Xây dựng mô hình
Bước nào được thực hiện ngay trước khi xây dựng mô hình?
A. Khám phá dữ liệu
B. Xác định mục tiêu
C. Chuẩn bị dữ liệu
D. Đánh giá
Thứ tự đúng của các bước sau là gì?
1. Chuẩn bị dữ liệu
2. Đánh giá
3. Xây dựng mô hình
A. 1 → 2 → 3
B. 1 → 3 → 2
C. 3 → 1 → 2
D. 2 → 1 → 3
Việc áp dụng thuật toán như K-means, Decision Tree, Regression được thực hiện ở bước nào?
A. B5 – Đánh giá
B. B3 – Chuẩn bị dữ liệu
C. B4 – Xây dựng mô hình
D. B2 – Khám phá dữ liệu
Bước nào chiếm nhiều thời gian và nguồn lực nhất (~80%) trong toàn bộ quy trình khai phá dữ liệu?
A. B2 – Khám phá dữ liệu
B. B3 – Chuẩn bị dữ liệu
C. B4 – Xây dựng mô hình
D. B5 – Đánh giá
Khi chọn 1 thuộc tính A để làm gốc cây quyết định và thuộc tính A có 3 giá trị thì cây quyết định sẽ có bao nhiêu nhánh?
A. 6 nhánh
B. 9 nhánh
C. 3 nhánh
D. 4 nhánh
Thuật toán Apriori được sử dụng để thực hiện nhiệm vụ nào trong khai phá dữ liệu?
A. tìm các luật kết hợp
B. Thực hiện công việc khác
C. tìm các tập mục thường xuyên
D. tìm các tập mục có k - item
giá trị "Gain" của thuộc tính A trong tập S ký hiệu là?
A. Gain(A, S)
B. Gain(entropy, S, A)
C. Gain(S, A, entropy)
D. Gain(S, A)
Thuật toán K-means dễ bị ảnh hưởng bởi điều gì?
A. Dữ liệu có outliers
B. Dữ liệu có phương sai nhỏ
C. Dữ liệu có phương sai lớn
D. Dữ liệu có kích thước lớn
Tập dữ liệu S gồm các thuộc tính A, B, C. Gain(S, A) = 0.3, Gain(S, B) = 0.6, Gain(S,C) = 0.14, Gain(S,D) = 0.99. Thuộc tính nào được chọn để phân nhánh?
A. thuộc tính B
B. thuộc tính A
C. thuộc tính CD
D. thuộc tính D
Thuật toán phân cụm K-mean dừng khi nào?
A. tâm cụm không thay đổi
B. số cụm sinh ra là k
C. tùy theo yêu cầu của người dùng
D. khi tất cả các phần tử đã được gán vào k cụm
Trong K-means, khoảng cách giữa các điểm dữ liệu được đo lường bằng phương pháp nào?
A. Jaccard Distance
B. Cosine Similarity
C. Euclidean Distance
D. Mahalanobis Distance
Bộ dữ liệu kiểm tra sự liên quan giữa tuổi và sự béo phì của bệnh viên như sau:
Đâu là đáp án đúng tính hệ số tương quan giữa hai thuộc tính trên?
A. 1
B. -1
C. 0.7
D. 0.5
Cho dữ liệu tuổi: 13, 15, 16, 16, 19, 20, 22, 22, 25, 30, 33, 33, 33, 36. Dùng kỹ thuật z-score chuyển giá trị 33 với độ lệch chuẩn là 10,2.
A. 0.432
B. 0.556
C. 0.827
D. 0.895
Trong tiền xử lý dữ liệu, phương pháp "rời rạc hóa" được sử dụng để làm gì?
A. biến đổi miền giá trị của các thuộc tính
B. loại bỏ dữ liệu có giá trị thiếu
C. giá trị số trong miền liên tục sẽ được chuyển về các khoảng số được gán nhãn hoặc các khoảng gán nhãn.
D. xóa các mẫu dữ liệu không liên quan hoặc mâu thuẫn.
Cho tập dữ liệu được xếp theo giá: 4, 8, 9, 15, 22, 22, 24, 28, 28, 34, 38. Chia tập dữ liệu trên thành 3 thùng theo chiều sâu. Kết quả chia thùng làm tròn theo trung bình là:
A. Bin 1: 4, 4, 4, 15; Bin 2: 21, 21, 25, 25; Bin 3: 26, 26, 26, 34
B. Bin 1: 4, 4, 4, 4; Bin 2: 21, 21, 21, 21; Bin 3: 26, 26, 26, 26, 26
C. Bin 1: 15, 15, 15, 15; Bin 2: 23, 23, 23, 23; Bin 3: 29, 29, 29, 29
A. Bin 1: 9, 9, 9, 9; Bin 2: 23, 23, 23, 23; Bin 3: 32, 32, 32, 32.
Weka xử lý dữ liệu thiếu bằng bộ lọc chuẩn nào sau đây
A. Set missing values
B. Replace with mising value
C. Filtering Attribute
D. Tất cả đáp án đều đúng
Cho tập ví dụ học sinh S như bảng. Entropy(S) là
A. Entropy(S) = 1
B. Entropy(S) = 0
C. Entropy(S) = 1.8
D. Entropy(S) = 0.4
Dữ liệu đầu vào thông dụng trong Weka hỗ trợ định dạng file nào?
A. .arff
B. .csv
C. json
D. Tất cả các lựa chọn trên
Dùng thuật toán K-means phân dữ liệu X = ({(2,3), (5,4), (9,6), (1,8), (8,2), (10,8)}) thành 2 cụm. Chọn C1 = (2,3), C2= (5,4) làm tâm cụm khởi tạo ban đầu.
A. Cụm 1: {(2,3), (1,8),(10,8)};
Cụm 2: {(5,4), (9,6), (8,2)}
B. Cụm 1: {(2,3), (1,8)};
Cụm 2: {(5,4), (9,6), (10,8), (8,2)}
C. Cụm 1: {(9,6), (5,4), (8,2)};
Cụm 2: {(2,3), (1,8), (10,8)}
D. Cụm 1: {(5,4), (1,8), (8,2)};
Cụm 2: {(2,3), (9,6), (10,8)}
Nhiệm vụ của thuật toán ID3 là?
A. xác định số nút trong cây
B. tìm ra số cụm trong tập dữ liệu
C. đưa ra cây quyết định từ một tập dữ liệu huấn luyện
D. tìm ra một tập trong cây
Weka cung cấp chức năng nào để xử lý dữ liệu thiếu?
A. Data preprocessing
B. classification
C. Handling missing Values
D. attribute Selection
Chuẩn hóa Min-Max trong tiến trình xử lý dữ liệu thực hiện việc gì?
A. chuyển đổi dữ liệu về khoảng giá trị [0,1]
B. tất cả phương án trên
C. chuẩn hóa dữ liệu thành các giá trị có trung bình bằng 0 và độ lệch chuẩn bằng 1
D. chuẩn hóa dữ liệu thành các giá trị có phân phối chuẩn.
Cho dữ liệu tuổi như sau: 13, 15, 16, 16, 19, 20, 22, 22, 25, 30, 33, 33, 33, 36. Sử dụng kỹ thuật min-max cho biết giá trị tuổi 22 trong khoảng [0,1].
A. 0,2562
B. 0,4323
C. 0,5261
D. 0,3913
Kỹ thuật tiền xử lý nào giúp giảm kích cỡ của dữ liệu nhiều nhất mà không ảnh hưởng tới kết quả phân tích
A. Kỹ thuật thu gọn dữ liệu
B. Kỹ thuật chuyển dạng dữ liệu
C. Kỹ thuật làm sạch dữ liệu
D. Kỹ thuật tích hợp dữ liệu
Thuật toán K-means giải quyết bài toán gì?
A. Phân loại
B. Dự đoán
C. Phân cụm
D. Tất cả các đáp án
Trong tiền xử lý dữ liệu, công việc "xử lý dữ liệu thiếu" bao gồm:
A. Điền giá trị thiếu bằng giá trị trung bình của thuộc tính
B. Xóa các mẫu dữ liệu có giá trị thiếu
C. Sử dụng các phương pháp dự đoán để điền giá trị thiếu
D. Tất cả các phương án trên
Công cụ nào trong Weka giúp khám phá các luật kết hợp từ dữ liệu
A. Cluster
B. Associate
C. Classify
D. Visualize
Trong thuật toán phân cụm k-mean, ban đầu k trọng tâm được chọn:
A. Chọn k phần tử nằm ở tâm
B. Chọn k phần tử có giá trị bằng giá trị trung bình của các phần tử trong tập dữ liệu
C. Chọn ngẫu nhiên
D. Chọn k các phần tử có giá trị nhỏ nhất
Cho tập ví dụ học (S) như bảng. Entropy(S) là
A. Entropy(S) = 0
B. Entropy(S) = 1
C. Entropy(S) = 0.756
D. Entropy(S) = 1.875
Cho cơ sở dữ liệu giao dịch gồm N giao dịch. I là tập chứa tất cả các mục trong CSDL. X là tập chứa các mục thuộc I. Tập mục X được gọi là tập mục thường xuyên khi:
A. Support(X) = Min_Supp
B. Support(X) <= Min_Supp
C. Support(X: Min_Supp/N)
D. Support(X) >= Min_Supp
Cho bản ghi dữ liệu, giá trị của các thuộc tính như sau: X=(6, 2, 5, 7, 5, ?). Dấu hỏi là giá trị của thuộc tính bị thiếu. Sử dụng phương pháp tính trung bình giá trị của các thuộc tính của bản ghi hiện có, hãy cho biết vị trí dấu hỏi điền giá trị là bao nhiêu
A. 9
B. 6
C. 8
D. 5
Khi xử lý thiếu giá trị của các bản ghi dữ liệu, phương pháp 'Bỏ qua bản ghi có giá trị thiếu' chỉ thích hợp khi
A. Các bản ghi có dữ liệu bị thiếu chiếm tỷ lệ lớn trong toàn bộ dữ liệu
B. Không thể bỏ qua, phải tìm các giá trị để điền vào các bản ghi bị thiếu
C. Có thể bỏ qua tất cả các bản ghi bị thiếu
D. Các bản ghi có dữ liệu bị thiếu chiếm tỷ lệ nhỏ trong toàn bộ dữ liệu
Trường hợp người bệnh không có thẻ BHYT sẽ được để trống mục thẻ BHYT. Khi đó dữ liệu này là
A. Không có đáp án nào đúng
B. Dữ liệu thiếu
C. Dữ liệu bị lỗi
D. Dữ liệu bị nhiễu
Trong thuật toán k-mean, sau khi gán các đối tượng vào k cụm cần phải:
A. Tìm một số phần tử đại diện của cụm
B. Tính lại tâm của các cụm
C. Tính khoảng cách giữa các phần tử trong cụm
D. Trộn các cụm lại với nhau để số cụm sinh ra là ít nhất
Cho cơ sở dữ liệu giao dịch gồm N giao dịch (bản ghi). I là tập chứa tất cả các mục (item) trong CSDL. X, Y là tập chứa các mục thuộc I. Độ tin cậy của luật kết hợp X -> Y được định nghĩa là:
A. Confidence (X -> Y) = Số lượng giao dịch hỗ trợ cả X và Y / N
B. Confidence (X -> Y) = Số lượng giao dịch hỗ trợ cả X và Y / Số lượng giao dịch hỗ trợ Y
C. Confidence (X -> Y) = Số lượng giao dịch hỗ trợ cả X và Y / Số lượng giao dịch hỗ trợ X
D. Confidence (X -> Y) = Số lượng giao dịch hỗ trợ X / Số lượng giao dịch hỗ trợ Y
Cho CSDL giao dịch như hình vẽ với Min_Support = 2 (50%).
Sử dụng thuật toán Apriori, sau lần duyệt thứ hai, tập mục chứa 2-item bị loại bỏ là:
A. {A,B}
B. {A,C}
C. {B,C}
D. {B,E}
Cho tập dữ liệu được xếp theo giá trị: 4, 8, 9, 15, 21, 21, 24, 25, 26, 28, 29, 34. Chia thành 3 thùng theo chiều sâu. Kết quả phương pháp chia thùng làm trơn theo biên là
A. Bin 1: 15, 15, 15, 15; Bin 2: 23, 23, 23, 23; Bin 3: 29, 29, 29, 29
B. Bin 1: 4, 4, 4, 15; Bin 2: 21, 21, 25, 25; Bin 3: 26, 26, 26, 34
C. Bin 1: 4, 4, 4, 4; Bin 2: 21, 21, 21, 21; Bin 3: 26, 26, 26, 26
D. Bin 1: 9, 9, 9, 9; Bin 2: 23, 23, 23, 23; Bin 3: 29, 29, 29, 29
Kỹ thuật học máy trong khai phá dữ liệu là gì?
A. Phân tích cú pháp và từ vựng trong văn bản
B. Xác định mối quan hệ giữa các biến trong dữ liệu
C. Tạo ra mô hình và dự đoán từ dữ liệu
D. Tất cả các phương án trên
Thuật toán K-means có thể bị ảnh hưởng bởi điều gì?
Dữ liệu có quá nhiều giá trị ngoại lai (outliers)
Các cụm có kích thước lớn
Các cụm có mật độ đồng đều
Số lượng điểm dữ liệu nhỏ
Kết quả phân cụm dữ liệu tốt phải thỏa mãn điều kiện gì?
Sự khác biệt giữa các cụm cần được cực đại hóa (1)
Sự khác biệt giữa các đối tượng trong cùng một cụm cần được cực tiểu hóa (2)
Số lượng đối tượng trong các cụm phải cân bằng nhau (3)
Thỏa mãn (1) và (2)
Tập dữ liệu cân nặng của 7 học sinh lớp 3A lần lượt là [23, 31, 27, 36, 21, 30, 42]. Hãy xác định giá trị trung bình (Mean) của tập?
30
31
27
23
Tập dữ liệu S gồm các thuộc tính A, B, C, D. Gain (S, A) = 0.3, Gain (S, B) = 0.6, Gain (S, C) = 0.14, Gain (S, D) = 0.99. Thuộc tính nào được chọn để phân nhánh?
Thuộc tính D
Thuộc tính C
Thuộc tính B
Thuộc tính A
Trong cây quyết định, mục đích của việc sử dụng "Entropy" là gì?
Đo lường mức độ phân loại chính xác
Đo lường sự phân tán của các thuộc tính
Đo lường sự hỗn loạn trong dữ liệu tại mỗi nút
Đo lường độ phức tạp của mô hình
Trong thuật toán Apriori, điều kiện nào phải được thỏa mãn để một tập mục được coi là tập mục phổ biến?
Có độ tin cậy cao hơn ngưỡng cho trước
Có độ hỗ trợ thấp hơn ngưỡng tối thiểu
Xuất hiện trong ít nhất một giao dịch
Có độ hỗ trợ cao hơn ngưỡng tối thiểu
Luật kết hợp (Association Rules) là gì?
Kỹ thuật kết hợp các dữ liệu có đặc tính tương đồng thành từng cụm
Kỹ thuật xử lý dữ liệu bằng các thuật toán học máy
Kỹ thuật khai phá dữ liệu nhằm tìm kiếm mối quan hệ có ý nghĩa giữa các mục trong một cơ sở dữ liệu
Kỹ thuật để trích xuất dữ liệu thô
Trong cây quyết định, nếu nút không thể phân chia thêm, điều gì sẽ xảy ra?
Tiếp tục phân chia cho đến khi có ít nhất 100 điểm dữ liệu
Tạo một nút lá với quyết định cuối cùng
Thực hiện việc huấn luyện lại
Loại bỏ nút đó khỏi cây
Weka là gì?
Một công cụ mã nguồn mở để khai phá dữ liệu và học máy
Một hệ thống Big Data
Một thư viện Python cho xử lý dữ liệu
Một ngôn ngữ lập trình cho học máy
Trong số các loại dữ liệu sau, loại dữ liệu nào dễ dàng trong lưu trữ và phân tích nhất?
Dữ liệu vật lý (Physical Data)
Dữ liệu có cấu trúc (Structured Data)
Dữ liệu phi cấu trúc (Unstructured Data)
Dữ liệu bán cấu trúc (Semi-structured Data)
Độ tin cậy (Confidence) của luật kết hợp {X} -> {Y} được tính thế nào?
Tổng số giao dịch chứa cả X và Y
Tỷ lệ giao dịch chứa cả X và Y so với tổng số giao dịch chứa X
Tỷ lệ giao dịch chứa cả X và Y so với tổng số giao dịch
Tỷ lệ giao dịch chứa X so với tổng số giao dịch chứa Y
Giá trị min và max của thuộc tính thu nhập là $12000$ và $98000$, chuyển đổi về khoảng $[0, 1]$ khi đó thu nhập có giá trị $73600$ sẽ có giá trị mới là: (1 Point)
0,716
0,617
0,167
0,761
Phương pháp nào dưới đây được sử dụng trong thuật toán Apriori để tạo ra các tập mục phổ biến?
Tạo các tập mục ứng viên k-hạng mục
Sắp xếp các dữ liệu thành các nhóm
Phân chia dữ liệu thành các nhóm có đặc điểm tương đồng
Tạo các tập mục n-gram
Phép biến đổi nào khi những giá trị số trong miền liên tục sẽ được chuyển về các khoảng số được gán nhãn hoặc các khoảng gán nhãn?
Chuẩn hóa
Rời rạc hóa
Làm mịn biên
Tổng hợp
Nếu số lượng cụm k quá lớn trong thuật toán K-means, điều gì có thể xảy ra?
Mô hình sẽ bị underfitting
Mô hình sẽ không thể hội tụ
Mô hình sẽ quá phức tạp và dễ bị overfitting
Dữ liệu sẽ không được phân chia chính xác
Trong giải thuật ID3
Mỗi thuộc tính chỉ được phép xuất hiện tối đa 1 lần đối với bất kỳ một đường đi nào trong cây
Mỗi thuộc tính chỉ được phép xuất hiện tối thiểu 1 lần đối với bất kỳ một đường đi nào trong cây
Mỗi thuộc tính được xuất hiện số lần bằng số nhánh của cây
Mỗi thuộc tính được xuất hiện tùy theo giá trị có của thuộc tính kiểm tra
Trong K-means, làm thế nào để xác định số lượng cụm k phù hợp
Thử nghiệm với nhiều giá trị k và chọn giá trị tốt nhất
Chọn k bằng cách tính trung bình độ đo khoảng cách giữa các điểm dữ liệu
Sử dụng giá trị mặc định là 3
Chọn k là số lớn nhất có thể để đảm bảo độ chính xác
Giả sử giá trị thuộc tính tuổi như sau: 13, 16, 16, 18, 18, 19, 30
18 là giá trị trung vị
16 là giá trị trung vị
30 là giá trị trung vị
Không tồn tại giá trị trung vị
Điền vào dấu ... Tỷ lệ các giao dịch chứa cả X và Y đổi với giao dịch chứa X
Độ hỗ trợ
Độ tin cậy
Minsup
Mincon
Thuật toán ID3 sử dụng thông tin nào để xây dựng cây quyết định?
Chỉ số Gini Index
Information Gain
Chi-squared
Entropy
Trong thuật toán K-Means, điều kiện nào để kết thúc thuật toán?
A. Số cụm thay đổi qua mỗi vòng lặp
B.Tâm cụm không thay đổi hoặc thay đổi rất ít giữa các vòng lặp
C. Tổng khoảng cách trong cụm đạt giá trị cực đại
D. Số lượng điểm dữ liệu trong cụm bằng nhau
Đâu là độ đo tập trung của dữ liệu (chọn 2 phương án)
Độ đo trung vị
Phương sai
Độ lệch chuẩn
Độ đo trung bình
Chỉ số nào thường được sử dụng để chọn thuộc tính tại mỗi nút trong cây quyết định?
A.Min_supp và Min_conf
B. giá trị trung bình của các thuộc tính
C. Entropy và thu được thông tin (information gain)
D. median, mode, range
Phương pháp chuẩn hóa nào thường sử dụng khi không xác định được giá trị lớn nhất và nhỏ nhất của thuộc tính.
Chuẩn hóa thay đổi tỷ lệ
Chuẩn hóa z-score
Chuẩn hóa min-max
Chuẩn hóa binning
Cho CSDL giao dịch T như bảng sau. Tính độ hỗ trợ của ( Lê, Nho)-> Cam
0.4
0.6
0.67
0.8
Cho dữ liệu tuổi như sau: 13, 15,16,19,20,22, 25,30. Sử dụng kỹ thuật min-max cho biết giá trị tuổi 22 trong khoảng (0, 1)
0.529
0.925
0.295
0.259
Nút trong của cây biểu diễn
A. Một thuộc tính cần kiểm tra giá trị đối với các ví dụ
B. Biểu diễn một phân lớp
C. Giá trị có thể của thuộc tính gắn với nút đó
D. Không có đáp án nào đúng
Cho tập dữ liệu A(2, 3);B(5, 4);C(9, 6);D(4, 2). Sử dụng thuật toán
Kmean phân cụm với k = 2. Với tâm cụm khởi tạo ban đầu là A(2, 3); B(5,
4). Sau lần lặp thứ nhất C, D nằm ở tâm cụm nào?
C nằm ở tâm cụm B,
D nằm ở tâm cụm A
C nằm ở tâm cụm A,
D nằm ở tâm cụm B
D đều nằm ở tâm cụm A
D đều nằm ở tám cụm B
Phát biểu nào sau đây đúng về học cây quyết định
A. Một cây quyết định có thể được biểu diễn bằng một tập các luật IF-THEN
B. Học cây quyết định có thể thực hiện ngay cả với các dữ liệu có chứa nhiễu/lỗi
C. Là một trong các phương pháp học quy nạp được dùng phổ biến nhất
D. Cả 3 đáp án đều đúng
Khai phá dữ liệu giúp tìm ra những thông tin gì từ dữ liệu?
A. Thông tin đã biết trước
B. Thông tin tiềm ẩn và tri thức mới
C. Thông tin về cú pháp và cấu trúc dữ liệu
D. Tất cả các phương án trên
Nhược điểm chính của thuật toán Apriori là gì?
Tốn nhiều bộ nhớ và thời gian. Không thích hợp với các mẫu lớn. Chi phí để duyệt CSDL nhiều.
Không tìm được các tập thường xuyên
Kết quả của thuật toán không ứng dụng được trong các bài toán thực tế
Thuật toán quá phức tạp, khó hiểu
Trong thuật toán k-means, bước tính khoảng cách thường sử dụng độ đo nào
Euclidean
Manhattan
Minkowski
Cả 3 đáp án đều đúng
Thuật toán K-Means dừng khi nào?
Khi không thể gán (hoặc gán lại) từng điểm vào cụm khác
Khi số cụm sinh ra là k
Tùy theo yêu cầu của người dùng
Khi tất cả các phần tử đã được gán vào k cụm
Kỹ thuật tiền xử lý nào giúp giảm kích cỡ của dữ liệu nhiều nhất mà không ảnh hưởng tới kết quả phân tích
Kỹ thuật tích hợp dữ liệu
Kỹ thuật thu gọn dữ liệu
Kỹ thuật chuyển dạng dữ liệu
Kỹ thuật làm sạch dữ liệu
Cho cây như hình vẽ, hãy chỉ ra đầu là nút trong của cây
Humidity, Wind
Outlook
No, Yes
Outlook, Wind
Thuật ngữ Tiền xử lí dữ liệu bằng tiếng Anh
Tiền xử lý dữ liệu (Data Preprocessing)
Xử lý dữ liệu (Data Processing)
Tiền xử lý trong cơ sở dữ liệu (Preprocessing in Database)
Xử lý dữ liệu(Data Process)
Mục tiêu chính của phân lớp dữ liệu (Classification) là gì?
Phân các đối tượng vào từng nhóm riêng biệt
Xác định mối quan hệ giữa các đối tượng trong cùng một lớp
Gán nhãn cho dữ liệu mới dựa trên dữ liệu lịch sử
Xác định mức độ xuất hiện cùng nhau của các đối tượng
Đánh giá chất lượng phân nhóm theo tiêu chí nào
Khoảng cách các nhóm cần cực đại hóa, khoảng cách bên trong nhóm cần cực tiểu hóa
Khoảng cách các nhóm cần cực tiểu hóa, khoảng cách bên trong nhóm cần cực đại hóa
Khoảng cách các nhóm và khoảng cách bên trong nhóm cần cực đại hóa
Khoảng cách các nhóm và khoảng cách bên trong nhóm cần cực tiểu hóa
Định nghĩa về khai phá dữ liệu là gì?
Quá trình khám phá tri thức từ dữ liệu
Quá trình tạo dự đoán từ dữ liệu
Quá trình lưu trữ dữ liệu
Quá trình chia sẻ dữ liệu
Khi sử dụng thuật toán K-means, nếu số cụm k được chọn quá lớn, điều gì có thể xảy ra
Tăng độ chính xác của phân loại
Giảm độ chính xác của phân loại
Không ảnh hưởng đến kết quả phân loại
Dữ liệu sẽ trở nên khó khăn để phân loại
Đâu là vấn đề hay xảy ra trong những nơi có trữ lượng dữ liệu lớn
Dữ liệu không đầy đủ
Dữ liệu bị nhiễu
Dữ liệu không nhất quan
Tất cả các phương án
Độ hỗ trợ (Support) của luật kết hợp {x} - {y} được tính thế nào?
A. tỷ lệ giao dịch chứa X so với tổng số giao dịch
B. tỷ lệ giao dịch chứa cả X và Y so với tổng số giao dịch
C. Tỷ lệ giao dịch chứa Y so với tổng số giao dịch
D. Tổng số giao dịch chứa cả X và Y
Điều gì xảy ra nếu ngưỡng độ hỗ trợ (min_supp) được đặt quá cao trong thuật toán Apriori?
A. Nhiều luật có thể bị bỏ sót
B.Sẽ tìm thấy nhiều tập mục phổ biến hơn
C.Tất cả các tập mục đều được chọn
D.Thuật toán không thể hoàn thành
Support của tập mục A trong CSDL giao tác D là gì?
Là tỷ lệ phần trăm số giao tác trong CSDL có chứa A trên tổng số các giao tác trong D
Là tỷ lệ phần trăm số giao tác trong CSDL không chứa A trên tổng số các giao tác trong D
Là chi số hỗ trợ trong A
Là chi số hỗ trợ trong B
Confidence của luật kết hợp X → Y là gì?
Là tỷ lệ phần trăm giữa số giao tác chứa cả X và Y với số giao tác chửa X trong CSDL D
Là tỷ lệ phần trăm giữa số giao tác Y và số giao tác chứa X trong CSDL D
Là tỉ lệ phần trăm giữa số giao tác X và số giao tác chứa Y trong CSDL D
Là chỉ số hỗ trợ trong CSDL
Phần mềm Weka cài đặt một số thuật toán trong lĩnh vực nào?
Data Mining
Tìm kiếm văn bản
Trí tuệ nhân tạo
Học máy
Tập mục thường xuyên là gì?
Là tập mục có độ hỗ trợ lớn hơn hoặc bằng ngưỡng hỗ trợ hỗ trợ tối thiểu cho trước
Là tập mục có độ hỗ trợ lớn hơn hoặc bằng 50%
Là tập mục có độ hỗ trợ lớn hơn hoặc bằng 90%
Là tập mục có độ hỗ trợ lớn hơn hoặc bằng 30%
Đâu không phải là thuật toán khai phá dữ liệu bằng luật kết hợp?
Thuật toán K-Mean
Thuật toán Apriori
Thuật toán AprioriTID
Thuật toán FP -Growth
Một số đo độ phân tán được sử dụng phổ biến nhất trong thống kê là gì?
A. Trung bình (Mean)
B. Phạm vi (Range), Phương sai (Variance), Độ lệch chuẩn (Standard Deviation)
C. Trung vị (Median)
D. Mốt (Mode)
Cho tập dữ liệu B:
1, 2, 3, 4, 5, 6, 6, 7, 8, 9, 10, 11
Phạm vi (range) của tập dữ liệu B là bao nhiêu?
A. 9
B. 10
C. 11
D. 12
Cho tập dữ liệu điểm kiểm tra của 10 học sinh:
55, 60, 62, 65, 68, 70, 72, 75, 78, 80. biết Q1 = 61, Q3= 76.5
Giá trị khoảng tứ phân vị (IQR) của tập dữ liệu trên là bao nhiêu?
A. 14.5
B. 15
C. 15.5
D. 16
Cho tập dữ liệu:
55, 60, 62, 65, 68, 70, 72, 75, 78, 80
Giá trị Q1 của tập dữ liệu là bao nhiêu?
A. 60
B. 61
C. 62
D. 65
Cho tập dữ liệu:
55, 60, 62, 65, 68, 70, 72, 75, 78, 80
Giá trị Q3 của tập dữ liệu là bao nhiêu?
A. 75
B. 76
C. 76.5
D. 78
Tính Information Gain cho thuộc tính Quang cảnh. Biết Entropy(S) = 0.940. Hỏi Gain (S, Quang cảnh) = ?
A. 0.246
B. 0.642
C. 0.3
D. 0.21
