Font size
WorksheetsMờ lờ
Total questions: 51
Worksheet time: 26mins
Bạn muốn phân cụm 7 điểm thành 3 cụm bằng thuật toán K-Means (sử dụng khoảng cách Euclid). Giả sử sau lần lặp đầu tiên, các cụm C1, C2, C3 chứa các điểm như sau: C1: {(0,6), (6,0)} C2: {(2,2), (4,4), (6,6)} C3: {(5,5), (7,7)} Tâm cụm (centroid) được tính cho 3 cụm là gì?
C1: (3,3), C2: (4,4), C3: (6,6)
C1: (6,6), C2: (12,12), C3: (12,12)
C1: (0,0), C2: (48,48), C3: (35,35)
C1: (3,3), C2: (6,6), C3: (12,12)
Đếm hỗ trợ (support count) của tập mục A có nghĩa là gì?
Tổng số giao dịch không chứa A
Số giao dịch không chứa A / Tổng số giao dịch
Số giao dịch chứa A / Tổng số giao dịch
Tổng số giao dịch chứa A
Thuật toán Apriori thực hiện công việc gì?
Loại bỏ các luật có độ hỗ trợ nhỏ hơn ngưỡng hỗ trợ tối thiểu (minsup)
Loại bỏ các luật có độ hỗ trợ lớn hơn ngưỡng hỗ trợ tối thiểu (minsup)
Sinh các luật có độ tin cậy nhỏ hơn ngưỡng tin cậy tối thiểu (minconf)
Sinh các luật có độ tin cậy lớn hơn ngưỡng tin cậy tối thiểu (minconf)
Xét tập dữ liệu sau: A = (0,2), B = (0,1), C = (1,0). Thuật toán K-Means (với khoảng cách Euclid) được khởi tạo với tâm ban đầu tại A và B. Khi hội tụ, hai tâm cụm sẽ ở vị trí nào?
C và trung điểm của đoạn AB
A và B
A và C
A và trung điểm của đoạn BC
Một cụm (cluster) là gì?
Một nhóm các đối tượng tương tự nhau, khác biệt rõ rệt so với các đối tượng thuộc nhóm khác
Biểu diễn mang tính biểu tượng của các sự kiện hoặc ý tưởng từ đó có thể trích xuất thông tin
Một nhóm các đối tượng giống hoặc khác nhau
Một thao tác trên cơ sở dữ liệu để biến đổi hoặc đơn giản hóa dữ liệu nhằm chuẩn bị cho thuật toán học máy hoặc khai phá dữ liệu
Khi huấn luyện một mạng nơ-ron, chúng ta đang cố gắng tìm kiếm...
Một hàm trong tập hợp các hàm, ánh xạ từ một ví dụ đầu vào đến một đầu ra
Các trọng số tốt nhất trong không gian trọng số
Siêu tham số mang lại hiệu suất tốt nhất
Ước lượng sai số kiểm tra (testing error)
Một cấu hình của kiến trúc mạng nơ-ron
Một mạng nơ-ron có thể được xem là một hàm phi tuyến. Hàm này là phi tuyến theo gì?
Cả tín hiệu đầu vào x và trọng số
Trọng số
Tín hiệu đầu vào x
Hàm kích hoạt (activation function) là gì?
Nó tính toán đầu ra của toàn bộ mạng nơ-ron
Nó tính tổng có trọng số của các tín hiệu đầu vào của một nơ-ron
Nó tính đầu ra của một nơ-ron dựa trên đầu vào thuần (net input) của nó
Nó tính đầu ra của một nơ-ron dựa trên các tín hiệu đầu vào của nó
Điều nào sau đây là đúng về mạng nơ-ron?
A. Tối ưu một hàm mục tiêu tuyến tính
B. Chỉ có thể được huấn luyện bằng phương pháp gradient descent ngẫu nhiên (SGD)
C. Có thể sử dụng kết hợp nhiều hàm kích hoạt khác nhau
D. Có thể hoạt động tốt ngay cả khi số lượng tham số/trọng số lớn hơn nhiều so với số lượng điểm dữ liệu
Điều nào sau đây là đúng về cây quyết định (decision trees)?
A. Chúng chỉ có thể được sử dụng cho bài toán hồi quy
B. Cắt tỉa (pruning) thường đạt độ chính xác kiểm tra tốt hơn so với việc dừng sớm
C. Tất cả các điểm dữ liệu trong một lá phải thuộc cùng một lớp
Overfitting trong cây quyết định có thể được xử lý bằng cách...
A. Giảm số lượng thuộc tính đầu vào
B. Giảm số lượng ví dụ huấn luyện
C. Dừng việc phát triển cây sớm hơn
D. Chuyển đổi sang tập hợp các luật và cắt tỉa các luật
E. Phát triển một cây hoàn chỉnh
Cây quyết định là thuật toán...
học có giám sát (supervised learning)
vừa là học có giám sát vừa là học không giám sát
không phải học có giám sát cũng không phải học không giám sát
học không giám sát (unsupervised learning)
Thuật toán K-Means có đặc điểm nào sau đây?
Luôn hội tụ đến một phân cụm tối ưu hóa khoảng cách trung bình bình phương giữa các điểm và tâm cụm
Có thể hội tụ đến các kết quả phân cụm khác nhau tùy vào lựa chọn ban đầu của các tâm cụm
Nhạy cảm với các giá trị ngoại lai (outliers)
Luôn tìm được số cụm đúng nếu số cụm được đặt bằng số nhãn thực trong dữ liệu
Thuật toán K-Means...
yêu cầu số chiều của không gian đặc trưng không được lớn hơn số lượng mẫu
luôn tìm được kết quả giống nhau dù khởi tạo tâm cụm khác nhau
chỉ hoạt động tốt với dữ liệu phân bố cầu (spherical clusters)
không yêu cầu số cụm K được xác định trước
Dưới đây là bảng giả định gồm 6 giao dịch, mỗi giao dịch chứa các mặt hàng đã mua: T1 {A, B, E} T2 {B, D} T3 {B, C} T4 {A, B, D} T5 {A, C} T6 {B, C}
Với ngưỡng hỗ trợ tối thiểu là 33%, tập mục nào sau đây là tập mục phổ biến?
{A, B}
{B, C}
{A, C}
{B, D}
Dưới đây là bảng giả định gồm 6 giao dịch, mỗi giao dịch chứa các mặt hàng đã mua: T1 {A, B, E} T2 {B, D} T3 {B, C} T4 {A, B, D} T5 {A, C} T6 {B, C}. Từ bảng trên, luật kết hợp nào sau đây có độ tin cậy (confidence) bằng 100%?
{A} → {B}
{D} → {B}
{C} → {B}
{B} → {C}
Thuật toán học cây quyết định ID3 có thể được sử dụng cho...
hồi quy
cả phân loại và hồi quy
không phải phân loại cũng không phải hồi quy
phân loại
Điều nào sau đây sai về ước lượng Maximum A Posteriori (MAP)?
MAP không cần biết bất kỳ thông tin nào về tham số của mô hình
MAP cần biết một số thông tin về tham số của mô hình
MAP có thể ước lượng toàn bộ phân phối hậu nghiệm từ tập dữ liệu huấn luyện
MAP có thể được dùng để học một mô hình từ tập huấn luyện
MAP có thể suy luận hoặc dự đoán cho các ví dụ mới
Xác suất hậu nghiệm (posterior probability) có thể đề cập đến...
kiến thức của mô hình
xác suất của một quan sát cho trước mô hình/giả thuyết
xác suất của một mô hình/giả thuyết cho trước dữ liệu quan sát
Ước lượng hợp lý cực đại (Maximum Likelihood Estimation - MLE) có thể được sử dụng để:
suy luận hoặc dự đoán cho một ví dụ/quan sát mới
khám phá kiến thức trong một mô hình đã học
ước lượng khả năng cực đại của một mô hình
học một mô hình từ một tập dữ liệu huấn luyện đã cho
suy luận tính đúng đắn của một mô hình cho trước
Sử dụng thuật toán học dựa trên láng giềng gần nhất (k-NN) và khoảng cách Euclid, với 7 láng giềng gần nhất, điểm dữ liệu (1, 1) thuộc lớp nào?
Class c2: (-1, 1) (0, 2) (1, -1) (2, 2)
Class c1: (0, 1) (1, 0) (1, 2) (2, 3)
c2
Không xác định
c1
Phát biểu nào sau đây là đúng về thuật toán học dựa trên láng giềng gần nhất (k-NN)?
Trong trường hợp giá trị kkk quá nhỏ, nó rất nhạy với nhiễu (noise)
Trong trường hợp giá trị kkk quá lớn, nó có thể đưa các điểm dữ liệu từ lớp khác vào vùng lân cận
Chỉ A
Cả A và B
Không A cũng không B
Giá trị nào sau đây là khoảng cách Euclid giữa hai điểm dữ liệu X(1, 7) và Y(4, 3)?
3
1
9
7
5
Phát biểu nào sau đây là đúng đối với hàm khoảng cách Manhattan?
Nó có thể được sử dụng cho các biến liên tục
Nó có thể được sử dụng cho các biến định danh (nominal)
Nó không thể được sử dụng cho cả biến liên tục lẫn biến định danh
Nó có thể được sử dụng cho cả biến liên tục và biến định danh
Phát biểu nào sau đây là đúng về thuật toán học dựa trên láng giềng gần nhất (k-NN)?
Nó có thể được sử dụng cho cả phân loại và hồi quy
Nó chỉ có thể được sử dụng cho hồi quy
Nó chỉ có thể được sử dụng cho phân loại
Điều gì có thể xảy ra khi chúng ta sử dụng một số lượng láng giềng gần nhất quá lớn trong dự đoán bằng k-NN?
Dự đoán sẽ có xu hướng trở nên tầm thường
Dự đoán sẽ có xu hướng chính xác hơn
k-NN sẽ có xu hướng bị underfitting
k-NN sẽ có xu hướng bị overfitting
Điều gì có thể xảy ra khi chúng ta sử dụng một số lượng láng giềng gần nhất quá nhỏ trong dự đoán bằng k-NN?
Dự đoán sẽ rất nhạy cảm với nhiễu trong dữ liệu
Dự đoán sẽ trở nên chính xác hơn trong mọi trường hợp
k-NN sẽ có xu hướng bị overfitting
k-NN sẽ có xu hướng bị underfitting
Tập huấn luyện và tập kiểm tra trong học máy có mối quan hệ như thế nào?
Chúng là giống nhau
Chúng có thể chồng lấn lên nhau (overlapping)
Không thích hợp để nói rằng chúng chồng lấn hay rời rạc
Chúng là rời rạc (disjoint)
Phương pháp hồi quy tuyến tính bình phương tối thiểu chỉ áp dụng trong các trường hợp mà đường hồi quy ước lượng có hệ số góc hoặc độ chệch (bias) dương. Điều này có đúng không?
Không
Có
Mô hình hồi quy sau thuộc loại mô hình nào? f(x) = w0 + w1*x1 + ... + wn*xn, trong đó w0, w1, ..., wn là các hệ số hồi quy.
Mô hình phi tuyến (non-linear model)
Mô hình phi tham số (non-parametric model)
Mô hình tuyến tính (linear model)
Phát biểu nào sau đây là sai?
λ có thể giữ được chất lượng nghiệm của OLS
λ có thể giúp giảm hiện tượng overfitting
λ đóng vai trò trung tâm trong việc khái quát hóa hàm f(x)
Công việc của bạn là xây dựng một bộ phân loại có thể phân loại email là spam hay bình thường. Tuy nhiên, bạn chỉ thu thập được tập dữ liệu mất cân bằng nghiêm trọng, cụ thể là 99.9% email là spam. Vậy bạn nên dùng tiêu chí nào để đánh giá hiệu suất của bộ phân loại?
Độ chính xác (Accuracy)
Độ chính xác cho từng lớp (Precision for individual class)
Hold-out có phải là một phương pháp để tiền xử lý và hiểu dữ liệu không?
Không, nó là một chiến lược để đánh giá và chọn mô hình
Có, tất nhiên rồi
Không, nó là một phương pháp để huấn luyện mô hình từ tập dữ liệu cho trước
Có, vì nó giúp chia dữ liệu để làm sạch và chuẩn hóa
Điểm hạn chế nào của phương pháp Hold-out có thể được khắc phục bằng cách lấy mẫu phân tầng (stratified sampling) khi đánh giá?
Ảnh hưởng tiêu cực của tính ngẫu nhiên đến kết quả đánh giá, do kích thước dữ liệu nhỏ
Ảnh hưởng tiêu cực của sự mất cân bằng giữa các lớp
Ảnh hưởng tiêu cực đến thời gian đánh giá
Phát biểu nào sau đây là sai?
Đánh giá mô hình và chọn mô hình trong học máy là hai quá trình độc lập
Việc chọn mô hình là bắt buộc khi so sánh các mô hình hoặc phương pháp học máy khác nhau
Việc đánh giá mô hình thường yêu cầu chọn mô hình như một bước nội bộ
Vai trò của hàm mất mát/sai số (loss/error function) trong học máy là gì?
Không có vai trò gì trong quá trình học máy
Để đo sai số theo một cách nào đó và thường đóng vai trò là hàm mục tiêu khi huấn luyện mô hình
Để đo sai số/mất mát khi đưa ra dự đoán trong tương lai
Chuẩn hóa (Normalization) là quá trình gì?
A. Thay thế các giá trị bị thiếu
B. Loại bỏ các giá trị ngoại lai (outliers)
C. Chuyển dữ liệu từ không gian véc-tơ này sang một không gian khác
D. Chuyển đổi dữ liệu để nằm trong cùng một khoảng giá trị chung
"Mode" có nghĩa là gì?
A. Độ biến thiên
B. Xuất hiện lặp lại nhiều nhất
C. Trung vị
D. Giá trị trung bình
Rời rạc hóa dữ liệu (data discretization) là gì?
A. Chuyển thuộc tính rời rạc thành liên tục
B. Tìm giá trị ngoại lai (outliers)
C. Chuyển thuộc tính liên tục thành rời rạc
D. Scale dữ liệu
Giải pháp nào sau đây có thể được dùng để làm sạch dữ liệu nhiễu (noise)?
Phân lớp (Binning)
Phát hiện giá trị ngoại lai (Outlier detection)
Chuẩn hóa (Normalization)
Gộp nhóm dữ liệu (Aggregation)
Khám phá tri thức (Knowledge discovery) là...
quá trình tạo ra tri thức từ một tập dữ liệu
quá trình gom nhóm các đối tượng sao cho các đối tượng trong cùng nhóm thì giống nhau hơn so với các nhóm khác
quá trình chuyển đổi dữ liệu từ một định dạng (hoặc cấu trúc) sang một định dạng (hoặc cấu trúc) khác
quá trình tìm trong tập dữ liệu các điểm dữ liệu không có giá trị cho các biến đầu vào
Chọn phát biểu phù hợp nhất về hiện tượng underfitting:
Một thuật toán học được cho là underfit so với thuật toán khác nếu nó kém chính xác hơn trong việc mô phỏng dữ liệu đã biết
Một thuật toán học được cho là underfit khi nó khớp tốt với dữ liệu đã biết, nhưng kém chính xác trong việc dự đoán dữ liệu chưa thấy
Một thuật toán underfit là thuật toán không học được bất kỳ mô hình nào
Một thuật toán underfit là thuật toán có độ chính xác thấp cả trên dữ liệu huấn luyện và dữ liệu kiểm tra
Sự khác biệt giữa học có giám sát (supervised learning) và học không giám sát (unsupervised learning) nằm ở đâu?
Từ cách chúng ta huấn luyện mô hình, học có giám sát nghĩa là ta phải cung cấp các bước chi tiết để máy học
Từ dữ liệu huấn luyện, trong đó học có giám sát thường yêu cầu có nhãn/đáp án trong giai đoạn huấn luyện
Từ mục tiêu của thuật toán, học không giám sát thường không thực hiện dự đoán
Từ kiểu của đầu ra, vốn thường là một số thực trong học có giám sát
Chọn phát biểu phù hợp nhất về hiện tượng overfitting:
A. Một hàm được cho là overfit so với hàm khác nếu nó ít chính xác hơn trên dữ liệu đã biết, nhưng chính xác hơn khi dự đoán dữ liệu chưa thấy
B. Một hàm được cho là overfit nếu nó ít chính xác hơn cả trên dữ liệu đã biết và dữ liệu chưa thấy
C. Một hàm được cho là overfit nếu nó chính xác hơn trên dữ liệu đã biết, nhưng kém chính xác hơn khi dự đoán dữ liệu chưa thấy
D. Tất cả các phát biểu trên đều sai
Trong mạng nơ-ron, đâu là lợi ích của hàm kích hoạt ReLU so với hàm kích hoạt Sigmoid?
A. ReLU cho phép tính toán lan truyền ngược (gradient) nhanh hơn
B. ReLU có thể sử dụng cho tầng đầu ra, trong khi hàm sigmoid thì không thể
C. ReLU cho phép mô hình học một đường quyết định phi tuyến
Hàm đánh giá nào để chọn thuộc tính kiểm tra là phù hợp nhất đối với các biến (thuộc tính) kiểu định danh có nhiều giá trị?
A. Entropy
B. Gain Ratio
C. Information Gain
Cho trước tập dữ liệu không có nhãn gồm N điểm dữ liệu: {x₁, x₂, ..., xₙ}. Chúng ta chạy K-means với 50 lần khởi tạo ngẫu nhiên tâm cụm và thu được 50 bộ tâm cụm khác nhau. Đâu là cách được gợi ý để chọn 1 kết quả từ 50 kết quả trên để sử dụng?
A. Chỉ có cách duy nhất để chọn là yêu cầu dữ liệu phải có nhãn yᵢ
B. Chọn kết quả mà (1/N) * ∑(i=1→N) ||xᵢ - mᵢ||² đạt giá trị nhỏ nhất trong 50 lần, với mᵢ là tâm cụm mà xᵢ được gán vào
C. Luôn chọn lần cuối cùng (thứ 50), vì lần này có khả năng đã hội tụ thành một giải pháp tốt
D. Chọn kết quả có số lượng cụm đồng đều nhất
Những phát biểu nào sau đây là sai khi huấn luyện bộ phân loại SVM tuyến tính từ một tập huấn luyện kích thước m?
Có thể không có vector hỗ trợ
Số lượng vector hỗ trợ phụ thuộc vào chọn hằng số phạt C
Số lượng vector hỗ trợ phụ thuộc vào m
Bộ phân loại học được có thể đưa ra dự đoán sai cho tất cả tập dữ liệu huấn luyện
Số lượng vector hỗ trợ độc lập với m
Với soft-margin SVM, những mẫu nào sẽ có giá trị ξᵢ khác 0?
Tất cả các mẫu nằm trên siêu phẳng lề
Tất cả các mẫu nằm ngoài lề
Tất cả các mẫu bị sai lớp
Tất cả các mẫu nằm bên trong lề
Bạn đang dùng một mạng nơ-ron nhiều tầng và nhận thấy rằng lỗi huấn luyện đang giảm và hội tụ tới một cực tiểu cục bộ. Sau đó, khi kiểm tra trên dữ liệu mới, lỗi lại cao bất thường. Có thể điều gì đang xảy ra và ta nên làm gì?
Sử dụng cùng dữ liệu huấn luyện nhưng thêm nhiều tầng hơn
Kích thước dữ liệu huấn luyện không đủ lớn. Thu thập thêm dữ liệu huấn luyện là cần thiết
Sử dụng cách khởi tạo khác và huấn luyện mạng nhiều lần. Sử dụng kết quả dự đoán trung bình của các mạng đã huấn luyện để dự đoán cho dữ liệu kiểm thử
Thử nghiệm với các tốc độ học khác nhau (learning rate) và bổ sung thêm phần chính quy (regularization) vào hàm mục tiêu
Phát biểu nào sau đây là đúng về giải thuật học láng giềng gần nhất (k-NN)?
Khi số lượng các thuộc tính kiểu số là ít, giải thuật học láng giềng gần nhất đạt độ chính xác cao hơn nếu các thuộc tính kiểu số đó có cùng khoảng giá trị.
Bất kể số lượng các thuộc tính kiểu số, giải thuật học láng giềng gần nhất đạt độ chính xác cao hơn nếu các thuộc tính kiểu số đó có cùng khoảng giá trị.
Khi số lượng các thuộc tính kiểu số là nhiều, giải thuật học láng giềng gần nhất đạt độ chính xác cao hơn nếu các thuộc tính kiểu số đó có cùng khoảng giá trị.
