Font size
WorksheetsCâu hỏi về Dữ liệu và Học máy
Total questions: 21
Worksheet time: 13mins
What is the primary challenge when working with unstructured data in AI projects?
Lack of labeled data
High cost of storage
Difficulty in data analysis
Complexity in data preprocessing
What is the primary goal of using deep learning techniques in AI?
To improve accuracy by using large neural networks
To perform real-time processing of structured data
To reduce the cost of hardware used for AI computations
To simplify the AI model structure
Which of the following tasks are typically performed during the model evaluation stage in an AI project?
Testing the model on validation data
Selecting the appropriate model for deployment
Adjusting hyperparameters
Collecting additional training data
Which of the following describes a neural network's ability to improve its performance as more data is provided during training?
Supervised learning
Reinforcement learning
Deep learning
Unsupervised learning
What is the key difference between supervised and unsupervised learning in machine learning?
Supervised learning uses labeled data, while unsupervised learning uses unlabeled data.
Supervised learning does not require data preprocessing, while unsupervised learning does.
Unsupervised learning is more accurate than supervised learning.
Lợi ích chính của việc sử dụng phương pháp tổng hợp trong học máy là gì?
Giảm độ phức tạp của mô hình
Cải thiện hiệu suất mô hình
Giảm thời gian huấn luyện
Ngăn ngừa overfitting
Phương pháp nào dưới đây thường được sử dụng để giảm chiều trong học máy?
Phân tích thành phần chính
Phân rã giá trị đặc biệt
Phân cụm K-means
Máy vector hỗ trợ
Những ứng dụng chính của học tăng cường là gì?
Chơi game
Robot học
Phân loại hình ảnh
Xử lý ngôn ngữ tự nhiên
Đâu là định nghĩa đúng nhất về "AI Tạo sinh"?
AI có thể tạo ra nội dung chất lượng cao, chẳng hạn như văn bản, hình ảnh và âm thanh.
Bất kỳ ứng dụng dựa trên web nào tạo ra văn bản.
Một dạng tìm kiếm trên web.
Các hệ thống trí tuệ nhân tạo có thể ánh xạ từ đầu vào A đến đầu ra B.
Đâu là mô tả chính xác nhất về một Mô hình Ngôn ngữ Lớn (LLM)?
Nó tạo ra văn bản bằng cách liên tục dự đoán từ tiếp theo.
Nó tạo ra văn bản bằng cách liên tục dự đoán các từ theo thứ tự ngẫu nhiên.
Nó tạo ra văn bản bằng cách tìm một đối tác viết lách để làm việc cùng bạn.
Nó tạo ra văn bản bằng cách sử dụng học có giám sát để thực hiện tìm kiếm trên web.
Tại sao chúng ta gọi AI là một công nghệ đa năng?
Bởi vì nó có thể trò chuyện.
Bởi vì nó hữu ích cho nhiều tác vụ khác nhau.
Bởi vì nó bao gồm cả học có giám sát và AI tạo sinh.
Bởi vì nó có thể được truy cập thông qua web nói chung.
Token là gì trong ngữ cảnh của một mô hình ngôn ngữ lớn (LLM)?
Một từ hoặc một phần của từ trong lời nhắc đầu vào hoặc đầu ra của LLM.
Một thiết bị vật lý hoặc mã kỹ thuật số để xác thực danh tính của người dùng.
Phần đầu ra của LLM chủ yếu mang giá trị tượng trưng hơn là thực chất (ví dụ: "tòa án đưa ra một khoản tiền phạt tượng trưng" hoặc "LLM tạo ra một đầu ra tượng trưng").
Một đơn vị tiền điện tử (như bitcoin hoặc các "token tiền điện tử" khác) mà bạn có thể sử dụng để thanh toán cho các dịch vụ LLM.
Một người bạn viết lời nhắc sau cho một LLM dựa trên web: "Hãy viết mô tả về sản phẩm thức ăn cho chó mới của chúng tôi." Đâu là những gợi ý hợp lý để cải thiện lời nhắc này?
Cung cấp cho LLM thêm ngữ cảnh về những điều thú vị hoặc độc đáo của sản phẩm để giúp nó tạo ra một mô tả tốt hơn.
Hướng dẫn về mục đích của mô tả (để dùng trong một bản ghi nhớ nội bộ của công ty, một trang web, một thông cáo báo chí?) để giúp nó sử dụng g
Bạn đang xây dựng một chatbot dịch vụ khách hàng. Tại sao việc giám sát hiệu suất của hệ thống sau khi triển khai lại quan trọng?
Trong trường hợp khách hàng nói điều gì đó khiến chatbot phản hồi theo cách không mong muốn, việc giám sát cho phép bạn phát hiện sự cố và khắc phục chúng.
Mọi sản phẩm đều nên được giám sát để theo dõi sự hài lòng của khách hàng -- đây là một thông lệ tốt cho tất cả phần mềm.
Do giới hạn kiến thức của LLM, chúng ta phải liên tục giám sát giới hạn kiến thức và cập nhật kiến thức của nó thường xuyên.
Điều này là sai. Miễn là việc đánh giá nội bộ được thực hiện tốt thì không cần giám sát thêm.
Bạn muốn xây dựng một ứng dụng để trả lời các câu hỏi dựa trên thông tin tìm thấy trong email của mình. Kỹ thuật nào sau đây là phù hợp nhất?
RAG, trong đó LLM được cung cấp ngữ cảnh bổ sung dựa trên việc truy xuất các email liên quan đến câu hỏi của bạn.
Tinh chỉnh một mô hình LLM trên email của bạn, theo đó chúng tôi lấy một mô hình LLM đã được đào tạo trước và đào tạo thêm trên email của bạn.
Nhắc lệnh (không có RAG), trong đó chúng tôi tinh chỉnh lặp đi lặp lại lời nhắc cho đến khi LLM đưa ra câu trả lời đúng.
Pretraining an LLM
Bạn đang chuẩn bị một bài thuyết trình về công nghệ và nhờ một LLM giúp bạn tìm một câu trích dẫn truyền cảm hứng. Nó đưa ra câu này: "Và đó là ý nghĩa của máy tính đối với tôi. Máy tính đối với tôi là công cụ đáng chú ý nhất mà chúng ta từng phát minh ra, và nó tương đương với một chiếc xe đạp cho trí óc của chúng ta. -Steve Jobs" Bạn nên tiến hành làm gì sau đây?
Kiểm tra lại câu trích dẫn này bằng cách nhắc LLM hỏi xem nó có thực sự chắc chắn Steve Jobs đã nói điều này không.
Kiểm tra lại câu trích dẫn này bằng cách tìm kiếm các nguồn khác (chẳng hạn như web) để xác minh xem Steve Jobs có thực sự nói điều này không.
Không sử dụng câu trích dẫn này vì LLM có thể tạo ra kết quả độc hại.
LLM đã học từ văn bản trên internet; vì vậy bạn có thể tin tưởng một cách an toàn rằng câu trích dẫn này được tìm thấy trên nhiều trang web và sử dụng nó trong bài thuyết trình của bạn.
Trong ví dụ của Coursera, chúng tôi đã mô tả việc sử dụng học có giám sát hoặc quy trình phát triển dựa trên lời nhắc để xây dựng một trình phân loại cảm xúc đánh giá nhà hàng. Phát biểu nào sau đây về phát triển dựa trên lời nhắc là đúng?
Phát biểu nào sau đây về phát triển dựa trên lời nhắc là đúng?
Phát triển dựa trên lời nhắc nói chung nhanh hơn nhiều so với học có giám sát.
Phát triển dựa trên lời nhắc yêu cầu bạn thu thập hàng trăm hoặc hàng nghìn ví dụ được gắn nhãn.
Phát triển dựa trên lời nhắc yêu cầu bạn thu thập hàng trăm hoặc hàng nghìn ví dụ không được gắn nhãn (nghĩa là các bài đánh giá không có nhãn B để cho biết đó là cảm xúc tích cực hay tiêu cực).
Nếu bạn muốn phân loại các bài đánh giá là tích cực, trung tính hoặc tiêu cực (3 kết quả đầu ra có thể có) thì không có cách nào để viết lời nhắc để làm như vậy: Một LLM chỉ có thể tạo ra 2 kết quả đầu ra.
Bạn đang làm việc với việc sử dụng LLM để tóm tắt các báo cáo nghiên cứu. Giả sử một báo cáo trung bình chứa khoảng 6.000 từ. Một LLM sẽ cần khoảng bao nhiêu token để xử lý 6.000 từ đầu vào?
8.000 token (khoảng 6000 * 1.333)
4.500 token (6000 * 3/4)
6.000 token (6.000 token)
14.000 token (khoảng 6000 * 1.333 + 6000 từ ban đầu)
Ý tưởng sử dụng LLM làm công cụ suy luận đề cập đến điều gì?
Điều này đề cập đến ý tưởng sử dụng LLM không phải như một nguồn thông tin, mà để xử lý thông tin (trong đó chúng tôi cung cấp cho nó ngữ cảnh cần thiết, thông qua các kỹ thuật như RAG).
Ý tưởng sử dụng LLM để chơi các trò chơi (như cờ vua) yêu cầu suy luận phức tạp, nhưng có đầu ra của nó trong trò chơi.
Bằng cách cung cấp các nguồn thông tin đáng tin cậy cho LLM thông qua RAG, chúng ta có thể giảm nguy cơ tạo ra thông tin sai lệch không?
Đúng
Sai
