WorksheetsCâu hỏi về Học máy
Total questions: 100
Worksheet time: 50mins
Học máy là gì?
Là một tập con của trí tuệ nhân tạo, sử dụng neural networks để giải quyết các vấn đề phức tạp.
Là một lĩnh khoa học rộng lớn giúp máy móc bắt chước hành vi của con người.
Là một tập con của trí tuệ nhân tạo, liên quan đến lĩnh vực nghiên cứu nhằm giúp máy tính có khả năng tự động học bằng cách cung cấp dữ liệu cho nó mà không cần lập trình cụ thể.
Là một tập con của trí tuệ nhân tạo, liên quan đến lĩnh vực nghiên cứu nhằm giúp máy tính bắt chước hành vi của con người.
Học tăng cường là gì?
Học từ dữ liệu đã gán nhãn.
Học thông qua tương tác với môi trường để tối đa hóa phần thưởng.
Học mà không cần bất kỳ phản hồi nào.
Học từ các tập dữ liệu lớn không nhãn.
Mạng nơ-ron nhân tạo (ANN) mô phỏng theo cấu trúc nào của con người?
Bộ xương.
Hệ thần kinh.
Hệ tuần hoàn.
Hệ tiêu hóa.
Học máy bán giám sát là gì?
Học từ dữ liệu hoàn toàn có nhãn.
Học từ dữ liệu hoàn toàn không có nhãn.
Học từ cả dữ liệu có nhãn và không nhãn.
Học bằng cách thử và sai
Điều gì khiến học máy bán giám sát khác học máy có giám sát?
Không cần dữ liệu.
Sử dụng dữ liệu có nhãn và nhiều dữ liệu không nhãn.
Chỉ dùng dữ liệu không nhãn.
Không có thuật toán cụ thể.
Lợi ích chính của học bán giám sát là gì?
Không cần tính toán nhiều.
Không cần dữ liệu.
Tận dụng dữ liệu không nhãn để tăng hiệu suất mà không tốn nhiều chi phí gán nhãn.
Dễ thực hiện hơn học không giám sát.
Dữ liệu không được gán nhãn trong học bán giám sát có vai trò gì?
Vô dụng, chỉ để lưu trữ.
Làm tăng sai số.
Để thay thế dữ liệu có nhãn.
Giúp cải thiện mô hình bằng cách học cấu trúc phân bố.
Học bán giám sát thường được sử dụng trong lĩnh vực nào?
Nhận dạng hình ảnh, nhận dạng giọng nói.
Giải phương trình.
Tính diện tích hình học.
Xử lý số học trong bảng tính.
Kỹ thuật nào sau đây phổ biến trong học bán giám sát?
Self-training.
Gradient boosting.
Backpropagation.
Stochastic descent.
Trong học bán giám sát, mô hình ban đầu được huấn luyện trên dữ liệu nào?
Dữ liệu không nhãn.
Cả 2 loại cùng lúc.
Dữ liệu có nhãn.
Dữ liệu kiểm tra.
Khái niệm "Trí tuệ nhân tạo" (Artificial Intelligence) lần đầu tiên được đề xuất tại hội nghị nào?
Hội nghị Dartmouth năm 1956.
Hội nghị Turing năm 1950.
Hội nghị Loebner năm 1990.
Hội nghị Asilomar năm 1974.
Ai được coi là người đặt nền móng cho lĩnh vực Trí tuệ nhân tạo và đưa ra thuật ngữ "Trí tuệ nhân tạo"?
Alan Turing.
John McCarthy.
Marvin Minsky.
Allen Newell.
Mục tiêu chính của AI là gì?
Tạo ra các hệ thống máy tính có khả năng làm mọi thứ nhanh hơn con người.
Tạo ra các hệ thống máy tính có khả năng thực hiện các công việc trí tuệ của con người.
Tạo ra các hệ thống máy tính có thể thay thế hoàn toàn con người.
Tạo ra các hệ thống máy tính có thể chơi các trò chơi điện tử giỏi hơn con người.
Lĩnh vực nào sau đây không phải là một nhánh của AI?
Học máy (Machine Learning)
Thị giác máy tính (Computer Vision)
Xử lý ngôn ngữ tự nhiên (Natural Language Processing)
Lập trình web (Web Development)
Điều nào sau đây có thể cải thiện hiệu suất của một tác nhân AI?
Nhận thức.
Học tập.
Quan sát.
Tất cả các phương án trên.
"Mùa đông AI (AI winter)" là thuật ngữ chỉ giai đoạn nào trong lịch sử AI?
Giai đoạn phát triển mạnh mẽ và đạt được nhiều thành tựu đáng kể.
Giai đoạn suy giảm sự quan tâm và tài trợ cho nghiên cứu AI do những kỳ vọng không thực tế.
Giai đoạn bùng nổ các ứng dụng AI trong đời sống.
Giai đoạn tập trung nghiên cứu các thuật toán học máy.
Các thành phần cốt lõi của một hệ thống AI là gì?
Dữ liệu, con người, phần cứng, phần mềm.
Dữ liệu, con người, phần cứng.
Dữ liệu, con người, phần mềm.
Dữ liệu, con người, phần cứng, phần mềm, quy trình.
Lý thuyết được áp dụng trong Trí tuệ nhân tạo nhiều nhất là gì?
Lý thuyết giải bài toán và suy diễn thông minh.
Lý thuyết biểu diễn tri thức và hệ chuyên gia.
Lý thuyết nhận dạng và xử lý tiếng nói.
Lý thuyết tìm kiếm may rủi.
Học máy có giám sát là gì?
Là thuật toán dự đoán một dữ liệu mới chưa được gán nhãn dựa trên tập dữ liệu huấn luyện.
Là học thuộc các mẫu dữ liệu, sử dụng một phép đo độ tương đồng để so sánh với dữ liệu đã học.
Là thuật toán dự đoán nhân của một dữ liệu mới dựa trên tập dữ liệu huấn luyện chưa được gán nhãn.
Là thuật toán dự đoán một dữ liệu mới đã được gán nhãn dựa trên tập dữ liệu huấn luyện.
Học máy không giám sát là gì?
Là học thuộc các mẫu dữ liệu, sử dụng một phép đo độ tương đồng để so sánh với dữ liệu đã học.
Là thuật toán dự đoán nhân của một dữ liệu mới dựa trên tập dữ liệu huấn luyện chưa được gán nhãn.
Là thuật toán dự đoán nhân của một dữ liệu mới dựa trên tập dữ liệu huấn luyện đã được gán nhãn.
Là thuật toán dự đoán một dữ liệu mới đã được gán nhãn dựa trên tập dữ liệu huấn luyện.
Dữ liệu (data) là gì trong bối cảnh học máy?
Một loại phần mềm dùng cho AI
Thông tin mà máy có thể ghi nhận, lưu trữ và xử lý.
Một mô hình học sâu
Một ngôn ngữ lập trình cho AI
Vì sao sau đây là dạng dữ liệu văn bản?
Ảnh chân dung
Email, bài viết, bình luận Facebook
Âm thanh cuộc gọi
Dữ liệu cảm biến tốc độ xe
Dữ liệu dạng số (số liệu) có thể là gì?
Điểm thi, số lượt xem video, nhiệt độ
Ảnh món ăn
Bài hát
Video TikTok
Trong ví dụ phân loại trái cây (táo vs chuối), dữ liệu nào là 'dữ liệu huấn luyện'?
Ảnh táo và chuối đã gắn nhãn đúng
Ảnh chưa gắn nhãn để kiểm tra
Các đặc trưng do máy tự sinh
Kết quả dự đoán của mô hình
Tại sao dữ liệu 'không chất lượng' có thể làm máy học sai?
Vì dữ liệu sai hoặc nhãn sai sẽ dạy mô hình theo hướng sai
Vì mô hình cần ít dữ liệu hơn
Vì dữ liệu thừa lúc nào cũng tốt
Vì dữ liệu đa dạng làm mô hình dễ học hơn
Một ví dụ ứng dụng AI cần dữ liệu âm thanh là gì?
Nhận diện giọng nói
Nhận diện khuôn mặt
Gợi ý video YouTube
dự đoán điểm thi
Bước đầu tiên trong quy trình máy học thường là gì?
Thu thập dữ liệu
Triển khai mô hình lên production
Đánh giá mô hình
Tối ưu hyperparameter
Tiền xử lý dữ liệu không nhằm mục đích nào dưới đây?
Làm cho dữ liệu thô hoàn toàn không thể đọc được
Làm sạch dữ liệu
Chuẩn hóa dữ liệu
Mã hóa dữ liệu phân loại
Mã hóa dữ liệu phân loại thường là gì?
Đổi chữ thành số (ví dụ: Nam→1, Nữ→0)
Lưu ảnh dưới dạng JPEG
Tách tập huấn luyện và kiểm tra
Cân bằng ánh sáng
Bước nào sau đây là bước trong tiền xử lý ảnh khuôn mặt?
Cắt khuôn mặt (face detection & cropping)
Gắn nhãn từ động không kiểm soát
Tăng kích thước ảnh lên vô hạn
Xóa hoàn toàn thông tin về mặt
Trong tiền xử lý, chuẩn hóa pixel thường làm gì?
Chuyển giá trị pixel về khoảng nhỏ hơn, ví dụ chia cho 255
Chuyển ảnh sang PDF
Xóa mọi pixel có màu trắng
Tăng kích thước file để mô hình chậm hơn
Rút gọn chiều dữ liệu (dimensionality reduction) nhằm mục tiêu gì?
Giảm số đặc trưng không cần thiết
Tăng số đặc trưng vô hạn
Chuyển dữ liệu số thành văn bản
Chỉ dùng cho dữ liệu âm thanh
Tách tập dữ liệu thường để gì?
Tách ra tập huấn luyện, kiểm tra, kiểm định
Chỉ dùng tập huấn luyện, không kiểm tra
Xóa tập kiểm tra
Gắn nhãn dữ liệu tự động
Big Data thường có đặc điểm nào sau đây?
Lượng dữ liệu rất lớn, đa nguồn, đa định dạng
Luôn ở dạng văn bản thuần
Luôn nhỏ gọn và tĩnh
Không thể dùng cho học máy
Mối quan hệ giữa Big Data và Học Máy được ví như thế nào?
Big Data là nguyên liệu, Học Máy là công cụ xử lý
Big Data là động cơ, Học Máy là nhiên liệu
Hai thứ hoàn toàn tách rời
Học Máy sản xuất Big Data
Ứng dụng nào sau đây cần Big Data để đạt hiệu quả cao?
Nhận diện khuôn mặt trên quy mô lớn
Viết một email cá nhân
Vẽ tay một bức tranh nhỏ
Tạo một tài liệu Word
Ví dụ nhận diện chữ viết tay cần dữ liệu như thế nào?
Một vài ảnh chữ viết tay là đủ
Hàng ngàn ảnh chữ viết tay của nhiều người, có nhãn đúng
Chỉ dữ liệu âm thanh
Không cần nhãn
Face alignment (căn chỉnh khuôn mặt) nhằm mục tiêu gì?
Xoay khuôn mặt để mắt, miệng thẳng hàng
Loại bỏ mũi khỏi ảnh
Tăng nhiễu trong ảnh
Chuyển ảnh sang video
Chuyển ảnh về mức xám (grayscale) có thể giúp xử lý việc gì?
Giảm độ phức tạp nếu màu không cần thiết
Làm mất thông tin kích thước
Tăng số kênh màu
Biến ảnh thành âm thanh
Vì dụ nào sau đây không phải là dữ liệu cảm biến?
Tốc độ xe
độ rung
Nhịp tim
Bài viết Facebook
AI tạo sinh (Generative AI) là phương án nào sau đây?
AI có khả năng tạo ra nội dung mới như văn bản, hình ảnh, âm thanh
AI có khả năng nhận dạng và phân loại dữ liệu
AI có khả năng tự động hóa các tác vụ
AI có khả năng học hỏi và thích nghi với môi trường mới
AI hẹp (Narrow AI) có đặc điểm nổi bật nào sau đây?
Tự nhận thức như con người
Chỉ thực hiện tốt một nhiệm vụ cụ thể
Sáng tạo nội dung mới liên tục
Phân tích cảm xúc con người
Hệ thống xe tự lái là ứng dụng của loại AI nào sau đây?
AI bộ nhớ giới hạn (Limited Memory)
AI phản ứng (Reactive Machines)
AI tự nhận thức (Self-aware AI)
AI tổng quát (General AI)
Chương trình máy tính Deep Blue của IBM đánh bại kỳ thủ cờ vua nổi tiếng Garry Kasparov là ứng dụng tiêu biểu của loại AI nào sau đây?
AI chuyên biệt (Narrow AI)
AI tự nhận thức (Self-aware AI)
AI phản ứng (Reactive Machines)
AI bộ nhớ hạn chế (Limited Memory)
Chương trình máy tính AlphaGo của Google DeepMind đánh bại nhà vô địch cờ vây số 1 thế giới Lee Sedol là ứng dụng tiêu biểu của loại AI nào sau đây?
AI chuyên biệt (Narrow AI)
AI tự nhận thức (Self-aware AI)
AI phản ứng (Reactive Machines)
AI bộ nhớ hạn chế (Limited Memory)
Quyền riêng tư trong AI liên quan đến vấn đề nào sau đây?
AI thu thập, lưu trữ và xử lý thông tin cá nhân của người dùng
Lương của kỹ sư AI
AI có thể học ngôn ngữ tự nhiên
Chi phí sử dụng AI
Đạo đức AI đề cập đến nội dung nào sau đây?
Phát triển AI có trách nhiệm, công bằng và minh bạch
Đảm bảo AI không bao giờ sai
Thiết kế AI biết phân biệt thiện ác
Lập trình AI giống cảm xúc con người
Trách nhiệm đạo đức trong quyết định của AI thuộc về ai?
Người thiết kế, huấn luyện và triển khai AI
Chính AI
Người dùng AI cuối cùng
Không ai cả
Một trong những rủi ro của AI là gì?
Tạo ra quyết định sai lệch gây ảnh hưởng đến con người
Làm tăng tốc độ mạng internet
Tự sửa lỗi phần mềm
Giảm tiêu thụ điện
AI có thể gây nguy cơ gì với quyền riêng tư?
Theo dõi và phân tích hành vi người dùng mà không xin phép
Không lưu lại thông tin nào
Giúp người dùng ẩn danh tốt hơn
ngăn chặn xâm nhập từ dữ liệu
Khi AI thay thế công việc, điều nào sau đây là đúng?
Một số nghề mất đi, một số nghề mới xuất hiện
Tất cả công việc sẽ biến mất
Chỉ có lao động chân tay bị ảnh hưởng
Tất cả mọi người sẽ thất nghiệp
Một trong những nghề nghiệp mới do AI tạo ra là gì?
Chuyên gia đạo đức AI
Kỹ thuật viên điện lạnh
Nông dân canh tác truyền thống
Thợ rèn
Kỹ năng liên quan đến dữ liệu nào được ưu tiên trong tương lai?
Phân tích dữ liệu lớn (big data)
Tìm kiếm Google
Nhập liệu Excel
In ấn báo cáo
Ai có thể thay thế hiệu quả công việc nào dưới đây?
Nhân viên tổng hợp báo cáo
Nhà văn sáng tạo
Luật sư tòa án
Cố vấn tâm lý
AI phân tích dữ liệu để làm gì?
Ra quyết định tốt hơn
Đoán mỏ xu hướng
Tránh tiếp xúc AI
Viết văn sáng tạo hơn
Thành phần cơ bản nhất của mạng nơ-ron là gì?
Tầng dữ liệu
Hàm mất mát
Nơ-ron nhân tạo (perceptron)
Mạng hồi tiếp
Khi sử dụng ChatGPT để tạo ảnh, người dùng cần cung cấp nội dung nào dưới đây để đạt được kết quả tốt nhất?
Ảnh
Dữ liệu
một mô tả chi tiết
tất cả đều sai
Một trong những yếu tố quan trọng trong việc tạo ảnh là gì?
Dữ liệu của người dùng
Người dùng đưa ảnh mẫu vào
Một mô tả chi tiết của người dùng
Sự sáng tạo của người dùng
Tại sao việc cung cấp mô tả chi tiết lại quan trọng khi tạo ảnh bằng ChatGPT?
Để giao tiếp hiệu quả hơn
Để tăng tốc độ tạo ảnh
Để hình ảnh tạo ra phù hợp với mong muốn
Không quan trọng
Cấu trúc mô tả hình ảnh bao gồm những thành phần nào?
Hành động hoặc trạng thái, phong cách thể hiện, bối cảnh, chi tiết bổ sung, chất lượng ảnh.
Chủ thể chính, hành động hoặc trạng thái, chi tiết bổ sung, chất lượng ảnh.
Chủ thể chính, hành động hoặc trạng thái, phong cách thể hiện, bối cảnh, chi tiết bổ sung, chất lượng ảnh.
Chủ thể chính, hành động hoặc trạng thái, phong cách thể hiện, đối tượng, chi tiết bổ sung, chất lượng ảnh.
Câu lệnh nào đúng để yêu cầu ChatGPT tạo kịch bản video với một chủ đề cụ thể?
Xin hãy viết cho tôi một phim.
Hãy tạo cho tôi một câu chuyện hay với chủ đề: “…. ”
Tạo một video theo ý tôi.
Viết một kịch bản video bất kỳ.
Các thành phần nào cần xuất hiện trong mỗi đoạn nội dung của kịch bản video được tạo bởi ChatGPT?
Gợi ý hình ảnh và tiêu đề
Gợi ý lời thoại và gợi ý nội dung hình ảnh
Mô tả câu chuyện và nhân vật
Chỉ cần một lời thoại
Điền vào dấu … để được một kịch bản tạo video hoàn chỉnh: Hãy tạo cho tôi một câu chuyện hay với …, mỗi đoạn nội dung cần kèm theo gợi ý lời thoại, gợi ý nội dung hình ảnh.
Tình huống
Chủ đề
Nội dung
Khán giả
Trong sáng tạo nội dung, thị trường mục tiêu được định nghĩa là gì?
Tất cả mọi người
Nhóm người cụ thể có nhu cầu và sở thích chung
Những người yêu thích nghệ thuật
Khán giả số một
Một trong những lợi ích của việc sử dụng nội dung đa dạng là gì?
Chỉ tốn nhiều thời gian
Giúp bảo đảm không ai quan tâm đến doanh nghiệp
Tăng cường khả năng tiếp cận và tạo sự thu hút
Tăng chi phí sản xuất nội dung
Để bắt đầu quá trình sáng tạo nội dung, điều gì là cần thiết nhất?
Công cụ thu âm
Nguồn cảm hứng
Kỹ năng viết
Phần mềm chỉnh sửa
Để sáng tác nhạc bằng AI ta sử dụng AI nào sau đây?
ChatGPT và Gamma
Gamma và Suno
ChatGPT và Suno
Không có đáp án đúng
Hãy nêu cấu trúc câu lệnh chi tiết để yêu cầu ChatGPT sáng tác nhạc?
Yêu cầu, nhiệm vụ, chủ đề, đối tượng người nghe, cảm xúc muốn truyền tải, ngôn ngữ.
Nhiệm vụ, chủ đề, đối tượng người nghe, cảm xúc muốn truyền tải, ngôn ngữ, yêu cầu khác.
Đóng vai, chủ đề, đối tượng người nghe, cảm xúc muốn truyền tải, ngôn ngữ, yêu cầu khác.
Đóng vai, nhiệm vụ, chủ đề, đối tượng người nghe, cảm xúc muốn truyền tải, ngôn ngữ, yêu cầu khác.
Nội dung hình ảnh trong kịch bản video nên có chức năng gì?
Chỉ để trang trí
Làm cho video dài hơn
Hỗ trợ trực quan cho nội dung câu chuyện
Làm cho người xem thấy nhàm chán
Lời thoại trong kịch bản video có vai trò gì?
ghi lại âm thanh
diễn tả cảm xúc nhân vật
chỉ định thời gian
tạo nhạc nền
Thành phần nào sau đây KHÔNG phải là một phần của hệ thống học tăng cường?
Agent.
Environment.
Classifier.
Reward.
Trong học tăng cường, “chính sách” (policy) là gì?
Quy tắc chọn hành động tại mỗi trạng thái.
Cách tính phần thưởng.
Cách đo lường độ chính xác của mô hình.
Tập dữ liệu huấn luyện.
Thuật ngữ "hàm giá trị" (value function) thể hiện điều gì?
Tổng giá trị của tất cả hành động.
Giá trị kỳ vọng của phần thưởng nếu theo một chính sách.
Giá trị tại các trạng thái ban đầu.
Mức độ chính xác của mô hình.
Q-learning là một thuật toán học tăng cường dựa trên nội dung nào sau đây?
Dựa trên mô hình.
Không dựa trên mô hình (model-free).
Dựa trên phân cụm.
Có giám sát.
Chọn phát biểu đúng về học tăng cường sâu (Deep RL):
Sử dụng mạng nơ-ron để học chính sách hoặc giá trị.
Không sử dụng bất kỳ mô hình học máy nào.
Không áp dụng được vào trò chơi hoặc robot.
Chỉ dùng trong thị giác máy tính.
Lớp nào sau đây không thay đổi kích thước dữ liệu đầu ra?
Lớp ẩn (hidden layer).
Lớp đầu vào (input layer).
Lớp đầu ra (output layer).
cả 3 đều có thể thay đổi kích thước
Hàm kích hoạt (activation function) có tác dụng gì trong ANN?
Tạo ra tính phi tuyến.
Tăng tốc độ tính toán.
Giảm số lượng nơ-ron.
Giảm độ phức tạp mô hình.
Hàm kích hoạt phổ biến nào sau đây thường dùng trong mạng sâu?
ReLU.
Linear.
Sigmoid.
Logarithmic.
Quá trình “lan truyền ngược” (backpropagation) dùng để làm gì?
Cập nhật trọng số của mạng nơ-ron.
Giảm số lượng lớp.
Phân loại đầu ra.
Tăng tốc độ học.
Thành phần nào điều chỉnh mức độ học của mô hình?
Learning rate.
Epoch.
Batch size.
Activation function.
Overfitting xảy ra khi nào?
Mô hình học quá tốt dữ liệu huấn luyện nhưng kém dữ liệu mới.
Mô hình không thể học.
Mô hình học quá ít.
Mô hình dự đoán hoàn hảo mọi trường hợp.
Tập dữ liệu validation dùng để làm gì?
Kiểm tra sau khi huấn luyện.
Huấn luyện mô hình.
Điều chỉnh siêu tham số và đánh giá mô hình trong quá trình huấn luyện.
Không có tác dụng gì.
Nếu ANN có quá nhiều lớp và nơ-ron, có thể gặp vấn đề gì?
dễ bị overfitting và tốn tài nguyên
Underfitting.
Mô hình sẽ bị lỗi ngay lập tức.
Mô hình học nhanh hơn.
Self-training là kỹ thuật như thế nào?
Sử dụng mô hình học từ dữ liệu không nhãn.
Gắn nhãn giả cho dữ liệu không nhãn bằng chính mô hình hiện tại.
Không cần mô hình ban đầu.
Học bằng cách lặp lại dữ liệu.
Co-training trong học bán giám sát hoạt động thế nào?
Hai mô hình học song song, mỗi mô hình học từ một phần đặc trưng khác nhau.
Một mô hình học cả có nhãn và không nhãn cùng lúc.
Mô hình không sử dụng bất kỳ dữ liệu có nhãn nào.
Mô hình chính học và truyền kiến thức cho mô hình phụ.
Điều kiện giúp học bán giám sát hoạt động hiệu quả nhất là gì?
Dữ liệu không nhãn giống hoàn toàn dữ liệu có nhãn.
Dữ liệu không nhãn có cấu trúc tương tự và hỗ trợ phân tách tốt các lớp.
Không cần quan tâm đến phân bố dữ liệu.
Sử dụng càng nhiều mô hình càng tốt.
Điểm yếu khi áp hạn chế của Machine Learning là gì?
Không có khả năng sử dụng các thuật toán để phân tách những thông tin có liên quan.
Không có khả năng xử lý dữ liệu với số chiều lớn.
Không được huấn luyện.
Không có khả năng đưa ra quyết định.
Hãy nêu các bước xây dựng mô hình học máy?
Thu thập dữ liệu, chuẩn bị dữ liệu, lựa chọn mô hình, huấn luyện mô hình, đánh giá mô hình, thay đổi tham số, áp dụng mô hình.
Thu thập dữ liệu, chuẩn bị dữ liệu, đánh giá mô hình, thay đổi tham số, áp dụng mô hình.
Thu thập dữ liệu, chuẩn bị dữ liệu, lựa chọn mô hình, huấn luyện mô hình, đánh giá mô hình.
Lựa chọn mô hình, huấn luyện mô hình, đánh giá mô hình, thay đổi tham số, áp dụng mô hình.
Mục đích chính của học máy là gì?
Lập trình máy tính để thực hiện các nhiệm vụ cụ thể.
Huấn luyện máy tính để tự học từ dữ liệu.
Tạo ra máy tính có trí tuệ nhân tạo.
Tối ưu hóa các thuật toán máy học.
Khi gặp dữ liệu bị thiếu (missing data), phương pháp nào sau đây KHÔNG phải là cách xử lý phổ biến?
Bỏ hoàn toàn cột/thuộc tính nếu tỷ lệ missing cao
Thay thế bằng giá trị trung bình/median hoặc sử dụng imputation
Giữ nguyên giá trị missing và huấn luyện mô hình
Tăng số lượng dữ liệu gốc
Tại sao cần chuẩn hóa dữ liệu (normalization) trước khi huấn luyện mô hình?
Để tất cả đặc trưng có cùng thang đo, giúp thuật toán hội tụ nhanh và công bằng
Để làm cho dữ liệu dài hơn
Để chuyển dữ liệu sang ảnh
Để giản nhân dữ liệu
One-hot encoding dùng cho loại biến nào?
Biến số liên tục
Biến phân loại dạng danh mục (categorical)
Dữ liệu ảnh
Chuỗi thời gian
Khi nào nên sử dụng giảm chiều dữ liệu (PCA)?
Khi muốn tổng số chiều để làm mô hình phức tạp hơn
Khi muốn giảm số đặc trưng, loại bỏ đa cộng tuyến và giảm nhiễu
Khi dữ liệu là văn bản thuần
Khi chỉ có một feature duy nhất
Nêu ý nghĩa của việc chia tập dữ liệu thành các tập train/test/validation?
Đánh giá khả năng tổng quát hóa của mô hình
Chỉ để tăng kích thước bộ nhớ
Làm cho mô hình luôn overfit
Xóa dữ liệu thừa
Trong tiền xử lý ảnh: vì sao cần resize ảnh về cùng kích thước như 112×112?
Để mô hình nhận đầu vào đồng đều và tiết kiệm bộ nhớ
Để ảnh mất toàn bộ chi tiết
Để tăng kích thước dữ liệu gốc
Để biến ảnh thành âm thanh
Hãy nêu hệ quả nếu nhãn trong dữ liệu bị gán sai nhiều (label noise)?
Mô hình học chính xác hơn
Mô hình có thể học sai và hiệu năng giảm
Dữ liệu trở nên sạch hơn
Không ảnh hưởng
Cân bằng ánh sáng và độ tương phản trong ảnh giúp gì cho nhận diện khuôn mặt?
Giúp mô hình nhận diện khuôn mặt tốt hơn
Làm ảnh trở nên tối hơn
Giảm chất lượng ảnh
Tăng kích thước ảnh
Tác dụng của việc đa dạng dữ liệu (nhiều người, nhiều kiểu viết) trong bài toán nhận diện chữ viết tay là gì?
Cải thiện khả năng mô hình nhận diện cho nhiều kiểu chữ khác nhau
Giảm khả năng tổng quát hóa
Làm mô hình dễ overfit
Làm chậm việc huấn luyện vô ích
Trong pipeline preprocessing, 'loại bỏ trùng lặp' nhằm mục tiêu gì?
Giảm bias do bản ghi lặp
Tăng số lượng bản ghi
Thay đổi nhãn của dữ liệu
Phân tách tập huấn luyện
Một hệ thống gợi ý (recommendation) cần dữ liệu nào để cá nhân hoá tốt?
Lịch sử xem, lượt thích, thời gian xem của nhiều người
Một hình ảnh duy nhất
Dữ liệu không có nhân
Chỉ metadata của video
