Font size
WorksheetsCâu hỏi về Học máy
Total questions: 110
Worksheet time: 55mins
Học máy là gì?
Là một tập con của trí tuệ nhân tạo, sử dụng neural networks để giải quyết các vấn đề phức tạp.
Là một lĩnh vực hẹp giúp máy móc bắt chước hành vi của con người.
Là một tập con của trí tuệ nhân tạo, liên quan đến lĩnh vực nghiên cứu nhằm giúp máy tính có khả năng tự động học bằng cách cung cấp dữ liệu cho nó mà không cần lập trình cụ thể.
Là một tập con của trí tuệ nhân tạo, liên quan đến lĩnh vực nghiên cứu nhằm giúp máy tính bắt chước hành vi của con người.
Học tăng cường là gì?
Học từ dữ liệu đã gán nhãn.
Học thông qua tương tác với môi trường để tối đa hóa phần thưởng.
Học mà không cần bất kỳ phản hồi nào.
Học từ các tập dữ liệu lớn không nhãn.
Mạng nơ-ron nhân tạo (ANN) mô phỏng theo cấu trúc nào của con người?
Bộ xương.
Hệ thần kinh.
Hệ tuần hoàn.
Hệ tiêu hóa.
Học máy bán giám sát là gì?
Học từ dữ liệu hoàn toàn có nhãn.
Học từ dữ liệu hoàn toàn không có nhãn.
Học từ cả dữ liệu có nhãn và không nhãn.
Học từ dữ liệu có nhãn.
Điều gì khiến học máy bán giám sát khác học máy có giám sát?
Không cần dữ liệu.
Sử dụng dữ liệu có nhãn và nhiều dữ liệu không nhãn.
Chỉ dùng dữ liệu không nhãn.
Không có thuật toán cụ thể.
Lợi ích chính của học bán giám sát là gì?
Không cần tính toán nhiều.
Không cần dữ liệu.
Tận dụng dữ liệu không nhãn để tăng hiệu suất mà không tốn nhiều chi phí gán nhãn.
Dễ thực hiện hơn học không giám sát.
Dữ liệu không được gán nhãn trong học bán giám sát có vai trò gì?
Vô dụng, chỉ để lưu trữ.
Làm tăng sai số.
Để thay thế dữ liệu có nhãn.
Giúp cải thiện mô hình bằng cách học cấu trúc phân bố.
Học bán giám sát thường được sử dụng trong lĩnh vực nào?
Nhận dạng hình ảnh, nhận dạng giọng nói.
Giải phương trình.
Tính diện tích hình học.
Xử lý số học trong bảng tính.
Kỹ thuật nào sau đây phổ biến trong học bán giám sát?
Self-training.
Gradient boosting.
Backpropagation.
Stochastic descent.
Trong học bán giám sát, mô hình ban đầu được huấn luyện trên dữ liệu nào?
Dữ liệu không nhãn.
Cả 2 loại cùng lúc.
Dữ liệu có nhãn.
Dữ liệu kiểm tra.
Khái niệm "Trí tuệ nhân tạo" (Artificial Intelligence) lần đầu tiên được đề xuất tại hội nghị nào?
Hội nghị Dartmouth năm 1956.
Hội nghị Turing năm 1950.
Hội nghị Loebner năm 1990.
Hội nghị Asilomar năm 1974.
Ai được coi là người đặt nền móng cho lĩnh vực Trí tuệ nhân tạo và đưa ra thuật ngữ "Trí tuệ nhân tạo"?
Alan Turing.
John McCarthy.
Marvin Minsky.
Allen Newell.
Mục tiêu chính của AI là gì?
Tạo ra các hệ thống máy tính có khả năng làm mọi thứ nhanh hơn con người.
Tạo ra các hệ thống máy tính có khả năng thực hiện các công việc trí tuệ của con người.
Tạo ra các hệ thống máy tính có thể thay thế hoàn toàn con người.
Tạo ra các hệ thống máy tính có thể chơi các trò chơi điện tử giỏi hơn con người.
Lĩnh vực nào sau đây không phải là một nhánh của AI?
Học máy (Machine Learning)
Thị giác máy tính (Computer Vision)
Xử lý ngôn ngữ tự nhiên (Natural Language Processing)
Lập trình web (Web Development)
Điều nào sau đây có thể cải thiện hiệu suất của một tác nhân AI?
Nhận thức.
Học tập.
Quan sát.
Tất cả các phương án trên.
"Mùa đông AI (AI winter) là thuật ngữ chỉ giai đoạn nào trong lịch sử AI?"
Giai đoạn phát triển mạnh mẽ và đạt được nhiều thành tựu đáng kể.
Giai đoạn suy giảm sự quan tâm và tài trợ cho nghiên cứu AI do những kỳ vọng không thực tế.
Giai đoạn bùng nổ các ứng dụng AI trong đời sống.
Giai đoạn tập trung nghiên cứu các thuật toán học máy.
Các thành phần cốt lõi của một hệ thống AI là gì?
Dữ liệu, con người, phần cứng, phần mềm.
Dữ liệu, con người, phần cứng.
Dữ liệu, con người, phần mềm.
Dữ liệu, con người, phần cứng, phần mềm, quy trình.
Lý thuyết được áp dụng trong Trí tuệ nhân tạo nhiều nhất là gì?
Lý thuyết giải bài toán và suy diễn thông minh.
Lý thuyết biểu diễn tri thức và hệ chuyên gia.
Lý thuyết nhận dạng và xử lý tiếng nói.
Lý thuyết tìm kiếm may rủi.
Học máy có giám sát là gì?
Là thuật toán dự đoán một dữ liệu mới chưa được gán nhãn dựa trên tập dữ liệu huấn luyện.
Là học thuộc các mẫu dữ liệu, sử dụng một phép đo độ tương đồng để so sánh với dữ liệu đã học.
Là thuật toán dự đoán nhân của một dữ liệu mới dựa trên tập dữ liệu chưa được gán nhãn.
Là thuật toán dự đoán một dữ liệu mới đã được gán nhãn dựa trên tập dữ liệu huấn luyện.
Học máy không giám sát là gì?
Là học thuộc các mẫu dữ liệu, sử dụng một phép đo độ tương đồng để so sánh với dữ liệu đã học.
Là thuật toán dự đoán nhân của một dữ liệu mới dựa trên tập dữ liệu chưa được gán nhãn.
Là thuật toán dự đoán nhân của một dữ liệu mới dựa trên tập dữ liệu đã được gán nhãn.
Là thuật toán dự đoán một dữ liệu mới đã được gán nhãn dựa trên tập dữ liệu huấn luyện.
Dữ liệu (data) là gì trong bối cảnh học máy?
Một loại phần mềm dùng cho AI
Thông tin mà máy có thể ghi nhận, lưu trữ và xử lý.
Một mô hình học sâu
Một ngôn ngữ lập trình cho AI
Vì dụ nào sau đây là dạng dữ liệu văn bản?
Ảnh chân dung
Email, bài viết, bình luận Facebook
Âm thanh cuộc gọi
Dữ liệu cảm biến tốc độ xe
Dữ liệu dạng số (số liệu) có thể là gì?
Ảnh mờ ẩn
Điểm thi, số lượt xem video, nhiệt độ
Bài hát
Video TikTok
Trong ví dụ phân loại trái cây (táo vs chuối), dữ liệu nào là 'dữ liệu huấn luyện'?
Ảnh chưa gắn nhãn để kiểm tra
Ảnh táo và chuối đã gắn nhãn đúng
Các đặc trưng do máy tự sinh
Kết quả dự đoán của mô hình
Tại sao dữ liệu 'không chất lượng' có thể làm máy học sai?
Vì mô hình cần ít dữ liệu hơn
Vì dữ liệu sai hoặc nhãn sai sẽ dạy mô hình theo hướng sai
Vì dữ liệu thừa lúc nào cũng tốt
Vì dữ liệu đa dạng làm mô hình dễ học hơn
Một ví dụ ứng dụng AI cần dữ liệu âm thanh là gì?
Nhận diện khuôn mặt
Nhận diện giọng nói
Nhận diện hình ảnh
Gợi ý video YouTube
Bước đầu tiên trong quy trình máy học thường là gì?
Triển khai mô hình lên production
Thu thập dữ liệu
Đánh giá mô hình
Tối ưu hyperparameter
Tiền xử lý dữ liệu không nhằm mục đích nào dưới đây?
Làm sạch dữ liệu
Chuẩn hóa dữ liệu
Làm cho dữ liệu thô hoàn toàn không thể đọc được
Mã hóa dữ liệu phân loại
Mã hóa dữ liệu phân loại thường là gì?
Đổi chữ thành số (ví dụ: Nam→1, Nữ→0)
Lưu ảnh dưới dạng JPEG
Tách tập huấn luyện và kiểm tra
Cân bằng ánh sáng
Bước nào sau đây là bước trong tiền xử lý ảnh khuôn mặt?
Cắt khuôn mặt (face detection & cropping)
Gắn nhãn tự động không kiểm soát
Tăng kích thước ảnh lên vô hạn
Xóa hoàn toàn thông tin về mặt
Trong tiền xử lý, chuẩn hóa pixel thường làm gì?
Chuyển giá trị pixel về khoảng nhỏ hơn, ví dụ chia cho 255
Chuyển ảnh sang PDF
Xóa mọi pixel có màu trắng
Tăng kích thước file để mô hình chậm hơn
Rút gọn chiều dữ liệu (dimensionality reduction) nhằm mục tiêu gì?
Tăng số đặc trưng vô hạn
Giảm số đặc trưng không cần thiết
Chuyển dữ liệu số thành văn bản
Chỉ dùng cho dữ liệu âm thanh
Tách tập dữ liệu thường để gì?
Chỉ dùng tập huấn luyện, không kiểm tra
Tách ra tập huấn luyện, kiểm tra, kiểm định
Xóa tập kiểm tra
Gắn nhãn dữ liệu tự động
Big Data thường có đặc điểm nào sau đây?
Lượng dữ liệu rất lớn, đa nguồn, đa định dạng
Luôn ở dạng văn bản thuần
Luôn nhỏ gọn và tĩnh
Không thể dùng cho học máy
Mối quan hệ giữa Big Data và Học Máy được ví như thế nào?
Big Data là động cơ, Học Máy là nhiên liệu
Big Data là nguyên liệu, Học Máy là công cụ xử lý
Hai thứ hoàn toàn tách rời
Học Máy sản xuất Big Data
Ứng dụng nào sau đây cần Big Data để đạt hiệu quả cao?
Nhận diện khuôn mặt trên quy mô lớn
Viết một email cá nhân
Vẽ tay một bức tranh nhỏ
Tạo một tài liệu Word
Vì dụ nhận diện chữ viết tay cần dữ liệu như thế nào?
Một vài ảnh chữ viết tay là đủ
Hàng ngàn ảnh chữ viết tay của nhiều người, có nhãn đúng
Chỉ dữ liệu âm thanh
Không cần nhãn
Face alignment (căn chỉnh khuôn mặt) nhằm mục tiêu gì?
Xoay khuôn mặt để mắt, miệng thẳng hàng
Loại bỏ mũi khỏi ảnh
Tăng nhiều trong ảnh
Chuyển ảnh sang video
Chuyển ảnh về mức xám (grayscale) có thể giúp xử lý việc gì?
Giảm độ phức tạp nếu màu không cần thiết
Làm mất thông tin kích thước
Tăng số kênh màu
Biến ảnh thành âm thanh
Vì dụ nào sau đây không phải là dữ liệu cảm biến?
Tốc độ xe
Áp suất không khí
Nhịp tim
Bài viết Facebook
AI tạo sinh (Generative AI) là phương án nào sau đây?
AI có khả năng tạo ra nội dung mới như văn bản, hình ảnh, âm thanh
AI có khả năng nhận dạng và phân loại dữ liệu
AI có khả năng tự động hóa các tác vụ
AI có khả năng học hỏi và thích nghi với môi trường mới
AI hẹp (Narrow AI) có đặc điểm nổi bật nào sau đây?
Tự nhận thức như con người
Chỉ thực hiện tốt một nhiệm vụ cụ thể
Sáng tạo nội dung mới liên tục
Phân tích cảm xúc con người
Hệ thống xe tự lái là ứng dụng của loại AI nào sau đây?
AI bộ nhớ giới hạn (Limited Memory)
AI phản ứng (Reactive Machines)
AI tự nhận thức (Self-aware AI)
AI tổng quát (General AI)
Chương trình máy tính Deep Blue của IBM đánh bại kỳ thủ cờ vua nổi tiếng Garry Kasparov là ứng dụng tiêu biểu của loại AI nào sau đây?
AI chuyên biệt (Narrow AI)
AI tự nhận thức (Self-aware AI)
AI phản ứng (Reactive Machines)
AI bộ nhớ hạn chế (Limited Memory)
Chương trình máy tính AlphaGo của Google DeepMind đánh bại nhà vô địch cờ vây số 1 thế giới Lee Sedol là ứng dụng tiêu biểu của loại AI nào sau đây?
AI chuyên biệt (Narrow AI)
AI tự nhận thức (Self-aware AI)
AI phản ứng (Reactive Machines)
AI bộ nhớ hạn chế (Limited Memory)
Quyền riêng tư trong AI liên quan đến vấn đề nào sau đây?
AI thu thập, lưu trữ và xử lý thông tin cá nhân của người dùng
Lương của kỹ sư AI
AI có thể học ngôn ngữ tự nhiên
Chi phí sử dụng AI
Đạo đức AI đề cập đến nội dung nào sau đây?
Phát triển AI có trách nhiệm, công bằng và minh bạch
Đảm bảo AI không bao giờ sai
Thiết kế AI biết phân biệt thiện ác
Lập trình AI giống cảm xúc con người
Trách nhiệm đạo đức trong quyết định của AI thuộc về ai?
Người thiết kế, huấn luyện và triển khai AI
Chính AI
Người dùng AI cuối cùng
Không ai cả
Một trong những rủi ro của AI là gì?
Tạo ra quyết định sai lệch gây ảnh hưởng đến con người
Làm tăng tốc độ mạng internet
Tự sửa lỗi phần mềm
Giảm tiêu thụ điện
AI có thể gây nguy cơ gì với quyền riêng tư?
Theo dõi và phân tích hành vi người dùng mà không xin phép
Không lưu lại thông tin nào
Giúp người dùng ăn đánh tốt hơn
Khi AI thay thế công việc, điều nào sau đây là đúng?
Một số nghề mất đi, một số nghề mới xuất hiện
Tất cả công việc sẽ biến mất
Chỉ có lao động chân tay bị ảnh hưởng
Tất cả mọi người sẽ thất nghiệp
Một trong những nghề nghiệp mới do AI tạo ra là gì?
Chuyên gia đạo đức AI
Kỹ thuật viên điện lạnh
Nông dân canh tác truyền thống
Thợ rèn
Kỹ năng liên quan đến dữ liệu nào được ưu tiên trong tương lai?
Phân tích dữ liệu lớn (big data)
Tìm kiếm Google
Nhập liệu Excel
In ấn báo cáo
AI có thể thay thế hiệu quả công việc nào dưới đây?
Nhân viên tổng hợp báo cáo
Nhà văn sáng tạo
Luật sư tòa án
Cố vấn tâm lý
AI phân tích dữ liệu để làm gì?
Ra quyết định tốt hơn
Dòán mô xu hướng
Tránh tiếp xúc AI
Viết văn sáng tạo hơn
Thành phần cơ bản nhất của mạng nơ-ron là gì?
Tập dữ liệu
Hàm mất mát
Nơ-ron nhân tạo (perceptron)
Màng hồi tiếp
Khi sử dụng ChatGPT để tạo ảnh, người dùng cần cung cấp nội dung nào dưới đây để đạt được kết quả tốt nhất?
Ảnh
Dữ liệu
một mô tả chi tiết
tất cả đều sai
Một trong những yếu tố quan trọng trong việc tạo ảnh là gì?
Dữ liệu của người dùng
Người dùng đưa ảnh mẫu vào
Một mô tả chi tiết của người dùng
Sự sáng tạo của người dùng
Tại sao việc cung cấp mô tả chi tiết lại quan trọng khi tạo ảnh bằng ChatGPT?
Để giao tiếp hiệu quả hơn
Để tăng tốc độ tạo ảnh
Để hình ảnh tạo ra phù hợp với mong muốn
Không quan trọng
Cấu trúc mô tả hình ảnh bao gồm những thành phần nào?
Hành động hoặc trạng thái, phong cách thể hiện, bối cảnh, chi tiết bổ sung, chất lượng ảnh.
Chủ thể chính, hành động hoặc trạng thái, chi tiết bổ sung, chất lượng ảnh.
Chủ thể chính, hành động hoặc trạng thái, phong cách thể hiện, bối cảnh, chi tiết bổ sung, chất lượng ảnh.
Hành động hoặc trạng thái, phong cách thể hiện, bối cảnh, đối tượng, chi tiết bổ sung, chất lượng ảnh.
Câu lệnh nào đúng để yêu cầu ChatGPT tạo kịch bản video với một chủ đề cụ thể?
Xin hãy viết cho tôi một phim.
Hãy cho tôi một câu chuyện hay với chủ đề: “...”
Tạo một video theo ý tôi.
Viết một kịch bản video bất kỳ.
Các thành phần nào cần xuất hiện trong mỗi đoạn nội dung của kịch bản video được tạo bởi ChatGPT?
Gợi ý hình ảnh và tiêu đề
Gợi ý lời thoại và gợi ý nội dung hình ảnh
Mô tả câu chuyện và nhân vật
Chỉ cần một lời thoại
Điền vào dấu … để được một kịch bản tạo video hoàn chỉnh: Hãy tạo cho tôi một câu chuyện hay với … mỗi đoạn nội dung cần kèm theo gợi ý lời thoại, gợi ý nội dung hình ảnh.
Tình huống
Chủ đề
Nội dung
Khán giả
Trong sáng tạo nội dung, thị trường mục tiêu được định nghĩa là gì?
Tất cả mọi người
Nhóm người cụ thể có nhu cầu và sở thích chung
Những người yêu thích nghệ thuật
Khán giả số một
Một trong những lợi ích của việc sử dụng nội dung đa dạng là gì?
Chỉ tốn nhiều thời gian
Giúp bảo đảm không ai quan tâm đến doanh nghiệp
Tăng cường khả năng tiếp cận và tạo sự thu hút
Tăng chi phí sản xuất nội dung
Để bắt đầu quá trình sáng tạo nội dung, điều gì là cần thiết nhất?
Công cụ thu âm
Nguồn cảm hứng
Kỹ năng viết
Phần mềm chỉnh sửa
Để sáng tác nhạc bằng AI ta sử dụng AI nào sau đây?
ChatGPT và Gamma
Gamma và Suno
ChatGPT và Suno
Không có đáp án đúng
Hãy nêu cấu trúc câu lệnh chi tiết để yêu cầu ChatGPT sáng tác nhạc?
Yêu cầu, nhiệm vụ, chủ đề, đối tượng người nghe, cảm xúc muốn truyền tải, ngôn ngữ.
Nhiệm vụ, chủ đề, đối tượng người nghe, cảm xúc muốn truyền tải, ngôn ngữ, yêu cầu khác.
Đóng vai, chủ đề, đối tượng người nghe, cảm xúc muốn truyền tải, ngôn ngữ.
Đóng vai, nhiệm vụ, chủ đề, đối tượng người nghe, cảm xúc muốn truyền tải, ngôn ngữ, yêu cầu khác.
Nội dung hình ảnh trong kịch bản video nên có chức năng gì?
Chỉ để trang trí
Làm cho video dài hơn
Hỗ trợ trực quan cho nội dung câu chuyện
Làm cho người xem thấy nhàm chán
Lời thoại trong kịch bản video có vai trò gì?
"Diễn tả cảm xúc nhân vật
Làm cho video dài hơn
Hỗ trợ trực quan cho nội dung câu chuyện
Làm cho người xem thấy nhàm chán
Thành phần nào sau đây KHÔNG phải là một phần của hệ thống học tăng cường?
Agent.
Environment.
Classifier.
Reward.
Trong học tăng cường, “chính sách” (policy) là gì?
Quy tắc chọn hành động tại mỗi trạng thái.
Cách tính phần thưởng.
Cách đo lường độ chính xác của mô hình.
Tập dữ liệu huấn luyện.
Thuật ngữ "hàm giá trị" (value function) thể hiện điều gì?
Tổng giá trị của tất cả hành động.
Giá trị kỳ vọng của phần thưởng nếu theo một chính sách.
Giá trị tối đa của trạng thái ban đầu.
Mức độ chính xác của mô hình.
Q-learning là một thuật toán học tăng cường dựa trên nội dung nào sau đây?
Dựa trên mô hình.
Không dựa trên mô hình (model-free).
Dựa trên phân cụm.
Có giám sát.
Chọn phát biểu đúng về học tăng cường sâu (Deep RL):
Sử dụng mạng nơ-ron để học chính sách hoặc giá trị.
Không sử dụng bất kỳ mô hình học máy nào.
Không áp dụng được vào trò chơi hoặc robot.
Chỉ dùng trong thị giác máy tính.
Lớp nào sau đây không thay đổi kích thước dữ liệu đầu ra?
Lớp ẩn (hidden layer).
Lớp đầu vào (input layer).
Lớp đầu ra (output layer).
Lớp trung gian (intermediate layer).
Hàm kích hoạt (activation function) có tác dụng gì trong ANN?
Tăng tốc độ tính toán.
Tạo ra tính phi tuyến.
Giảm số lượng nơ-ron.
Giảm độ phức tạp mô hình.
Hàm kích hoạt phổ biến nào sau đây thường dùng trong mạng sâu?
Linear.
Sigmoid.
ReLU.
Logarithmic.
Quá trình “lan truyền ngược” (backpropagation) dùng để làm gì?
Cập nhật trọng số của mạng nơ-ron.
Giảm số lượng lớp.
Phân loại đầu ra.
Tăng tốc độ học.
Thành phần nào điều chỉnh mức độ học của mô hình?
Epoch.
Learning rate.
Batch size.
Activation function.
Overfitting xảy ra khi nào?
Mô hình học quá tốt dữ liệu huấn luyện nhưng kém dữ liệu mới.
Mô hình không thể học.
Mô hình học quá ít.
Mô hình dự đoán hoàn hảo mọi trường hợp.
Tập dữ liệu validation dùng để làm gì?
Huấn luyện mô hình.
Kiểm tra sau khi huấn luyện.
Điều chỉnh siêu tham số và đánh giá mô hình trong quá trình huấn luyện.
Không có tác dụng gì.
Nếu ANN có quá nhiều lớp và nơ-ron, có thể gặp vấn đề gì?
Underfitting.
Mô hình sẽ bị lỗi ngay lập tức.
Mô hình học nhanh hơn.
Dễ bị overfitting và tốn tài
Self-training là kỹ thuật như thế nào?
Sử dụng mô hình học từ dữ liệu không nhãn.
Gắn nhãn giả cho dữ liệu không nhãn bằng chính mô hình hiện tại.
Không cần mô hình ban đầu.
Học bằng cách lặp lại dữ liệu.
Co-training trong học bán giám sát hoạt động thế nào?
Hai mô hình học song song, mỗi mô hình học từ một phần đặc trưng khác nhau.
Một mô hình học có cả có nhãn và không nhãn cùng lúc.
Mô hình không sử dụng bất kỳ dữ liệu có nhãn nào.
Mô hình chính học và truyền kiến thức cho mô hình phụ.
Điều kiện giúp học bán giám sát hoạt động hiệu quả nhất là gì?
Dữ liệu không nhãn giống hoàn toàn dữ liệu có nhãn.
Dữ liệu không nhãn có cấu trúc tương tự và hỗ trợ phân tách tốt các lớp.
Không cần quan tâm đến phân bố dữ liệu.
Sử dụng càng nhiều mô hình càng tốt.
Khi nào thì hạn chế của Machine Learning?
Không có khả năng sử dụng các thuật toán để phân tích những thông tin có liên quan.
Không có khả năng xử lý dữ liệu với số chiều lớn.
Không được huấn luyện.
Không có khả năng đưa ra quyết định.
Hãy nêu các bước xây dựng mô hình học máy?
Thu thập dữ liệu, chuẩn bị dữ liệu, lựa chọn mô hình, huấn luyện mô hình, đánh giá mô hình, thay đổi tham số, áp dụng mô hình.
Thu thập dữ liệu, chuẩn bị dữ liệu, đánh giá mô hình, thay đổi tham số, áp dụng mô hình.
Thu thập dữ liệu, chuẩn bị dữ liệu, lựa chọn mô hình, huấn luyện mô hình, đánh giá mô hình.
Lựa chọn mô hình, huấn luyện mô hình, đánh giá mô hình, thay đổi tham số, áp dụng mô hình.
Mục đích chính của học máy là gì?
Lập trình máy tính để thực hiện các nhiệm vụ cụ thể.
Huấn luyện máy tính để tự học từ dữ liệu.
Tạo ra máy tính có trí tuệ nhân tạo.
Tối ưu hóa các thuật toán máy học.
Khi dữ liệu có nhiều giá trị thiếu (missing), bước tiền xử lý phù hợp là gì?
Loại bỏ các mẫu dữ liệu có giá trị thiếu.
Điền giá trị trung bình vào chỗ thiếu.
Sử dụng mô hình dự đoán để điền giá trị thiếu.
Bỏ qua các giá trị thiếu trong quá trình huấn luyện.
Tại sao cần chuẩn hóa dữ liệu (normalization) trước khi huấn luyện?
Để tất cả đặc trưng có cùng thang đo, giúp thuật toán hội tụ nhanh và công bằng
Để làm cho dữ liệu dài hơn
Để chuyển dữ liệu sang ảnh
Để gán nhãn dữ liệu
One-hot encoding dùng cho loại biến nào?
Biến số liên tục
Biến phân loại dạng danh mục (categorical)
Dữ liệu ảnh
Chuỗi thời gian
Khi nào nên sử dụng giảm chiều dữ liệu (PCA)?
Khi muốn tăng số chiều để làm mô hình phức tạp hơn
Khi muốn giảm số đặc trưng, loại bỏ đa cộng tuyến và giảm nhiễu
Khi dữ liệu là văn bản thuần
Khi chỉ có một feature duy nhất
Nếu ý nghĩa của việc chia tập dữ liệu thành các tập train/test/validation?
Đánh giá khả năng tổng quát hóa của mô hình
Chỉ để tăng kích thước bộ nhớ
Làm cho mô hình luôn overfit
Xóa dữ liệu thừa
Trong tiền xử lý ảnh: vì sao cần resize ảnh về cùng kích thước như 112×112?
Để mô hình nhận đầu vào đồng đều và tiết kiệm bộ nhớ
Để ảnh mất toàn bộ chi tiết
Để tăng kích thước dữ liệu gốc
Để biến ảnh thành âm thanh
Hãy nêu hệ quả nếu nhãn trong dữ liệu bị gán sai nhiều (label noise)?
Mô hình học chính xác hơn
Mô hình có thể học sai và hiệu năng giảm
Dữ liệu trở nên sạch hơn
Không ảnh hưởng
Giúp khuôn mặt rõ ràng hơn, giảm sai số do điều kiện ánh sáng là mục tiêu của phương pháp nào?
Làm méo mô toàn bộ biểu cảm
Thay đổi nhân của dữ liệu
Giúp khuôn mặt rõ ràng hơn, giảm sai số do điều kiện ánh sáng
Không có ích
Trong bài toán nhận diện chữ viết tay, tác dụng của việc đa dạng dữ liệu là gì?
Giảm khả năng tổng quát hóa
Làm mô hình dễ overfit
Cải thiện khả năng mô hình nhận diện cho nhiều kiểu chữ khác nhau
Chậm chạp việc huấn luyện vô ích
Quá trình "Face detection & cropping" cần làm kỹ để tránh điều gì?
Nếu cắt sai vị trí, mô hình nhận diện sẽ gặp nhiều và sai
Cắt sai làm tăng dung lượng file
Cắt khuôn mặt không quan trọng
Chỉ để làm đẹp hình ảnh
Thách thức khi xử lý dữ liệu quá lớn (Big Data) là gì?
Chỉ việc lưu trữ là đủ, không cần xử lý
Hệ thống cần phân tán, đảm bảo chất lượng và bảo mật
Luôn để dàng xử lý bằng máy tính cá nhân
Luôn có nhân sẵn
"Bạn có một dataset lớn nhưng chứa nhiều nhãn sai (label noise). Phương án nào dưới đây là chiến lược hiệu quả để giảm ảnh hưởng của nhãn sai?
Sử dụng robust loss functions, lọc dữ liệu có nhãn khả nghi, kết hợp human-in-the-loop để sửa nhãn"
"Bỏ toàn bộ dataset lớn và thu dataset nhỏ hơn
"Luôn huấn luyện với learning rate cực lớn
"Không làm gì cả"
"So sánh trade-off giữa tăng kích thước đầu vào (higher resolution) và tốc độ huấn luyện trong bài toán nhận diện khuôn mặt. Đâu là nhận định chính xác?"
Higher resolution luôn tốt hơn và không có nhược điểm
Higher resolution cho nhiều chi tiết hơn nhưng tăng chi phí tính toán và có thể dẫn tới overfitting nếu không đủ dữ liệu
"Lower resolution luôn tốt hơn"
"Resolution không ảnh hưởng tới độ chính xác"
Khi làm face alignment, tại sao việc cân bằng (alignment) mắt và miệng lại giúp tăng độ chính xác của mô hình?
"Vì giúp chuẩn hóa góc và tỷ lệ khuôn mặt, giảm sự biến đổi không cần thiết và làm cho đặc trưng dễ học hơn"
Vì làm thay đổi nhãn"
Vì tăng nhiễu
"Không có lý do kỹ thuật
Bạn được giao nhiệm vụ xây dựng hệ thống gợi ý (recommendation) cho nền tảng video có hàng triệu người dùng. Vấn đề Big Data đặt ra và giải pháp khả dĩ là gì?
"Vấn đề: quy mô và tốc độ xử lý; Giải pháp: hệ thống lưu trữ phân tán, batch + real-time processing, feature store, sampling và học phân tán
Vấn đề: chỉ cần dùng spreadsheet; Giải pháp: không cần thay đổi
"Vấn đề: thiếu hình ảnh; Giải pháp: thu thập thêm ảnh
Vấn đề: tốc độ internet; Giải pháp: tăng băng thông
"Trong trường hợp dữ liệu bị phân phối không cân bằng (class imbalance), chiến lược giảm thiểu gồm:
" HC(5,1)= "Oversampling lớp thiểu số, undersampling lớp đa số, dùng loss điều chỉnh (class-weighted), tạo dữ liệu tổng hợp (SMOTE)
"Luôn xóa lớp thiểu số
Bỏ nhãn của lớp đa số
"Không có cách nào
"Giả sử bạn có dataset lớn nhưng thiếu tính đa dạng chủng tộc/góc độ; hệ quả cho mô hình nhận diện khuôn mặt là gì?
Mô hình có thể hoạt động kém với nhóm thiếu đại diện — gây bias và fairness issue
Mô hình sẽ tốt hơn cho mọi nhóm
Không ảnh hưởng
Chỉ ảnh hưởng tới kích thước file
"Khi làm tiền xử lý cho ảnh dùng cho học máy, việc sử dụng augmentation (ví dụ rotate, flip, color jitter) có tác dụng gì?
"Tăng tính đa dạng dữ liệu, giảm overfitting và cải thiện tổng quát hóa
"Luôn làm giảm accuracy
Chỉ áp dụng cho text
"Làm mất nhãn"
"So sánh supervised learning và unsupervised learning về nhu cầu nhãn dữ liệu
"Supervised cần nhãn cho huấn luyện; unsupervised không cần nhãn, dùng để khám phá cấu trúc dữ liệu
"Cả hai đều không cần nhãn
Unsupervised cần nhãn nhiều hơn
Supervised không dùng dữ liệu
Khi dataset có 'drift' (phân phối thay đổi theo thời gian), cách xử lý hiệu quả là
Giám sát hiệu năng, cập nhật mô hình định kỳ, thu thập dữ liệu mới và retrain hoặc dùng online learning
"Không thay đổi gì"
Xóa toàn bộ dữ liệu cũ
"Luôn dùng cùng mô hình mà không cần giám sát
Trong pipeline xử lý Big Data, 'feature store' có vai trò gì?"
Lưu trữ và chia sẻ các feature đã xử lý cho huấn luyện và production, đảm bảo consistency
Chỉ lưu raw data
Thay thế model
"Đóng vai trò như dataset test
