Font size
WorksheetsCâu hỏi trắc nghiệm – Giới thiệu về Khoa học dữ liệu
Total questions: 90
Worksheet time: 45mins
Khoa học dữ liệu (KHDL) là lĩnh vực đa ngành, kết hợp các kiến thức và kỹ thuật từ những ngành nào sau đây?
Toán học, khoa học máy tính và khoa học xã hội.
Toán học, thống kê, khoa học máy tính, kinh tế, kinh doanh và các lĩnh vực khác.
Chỉ thống kê, khoa học máy tính và trí tuệ nhân tạo (AI).
Chỉ khoa học máy tính và khoa học xã hội.
Ai là người đã giới thiệu Khoa học dữ liệu như một ngành độc lập vào năm 2001?
DJ Patil và Jeff Hammerbacher
William S. Cleveland
Hội Kỹ sư Điện và Điện tử (IEEE)
Springer
Thuật ngữ "Khoa học dữ liệu" trở nên phổ biến khi nào và nhờ những nhân vật nào sử dụng nó để đặt tên cho công việc của họ tại LinkedIn và Facebook?
2001, William S. Cleveland
2008, DJ Patil và Jeff Hammerbacher
2013, Hội Kỹ sư Điện và Điện tử (IEEE)
2015, Springer
Khoa học dữ liệu giúp tạo ra giá trị bằng cách khai thác tri thức trong dữ liệu thu thập từ những nguồn nào?
Các trang web và cảm biến
Thiết bị di động và mạng xã hội
Cả a và b
Chỉ từ cơ sở dữ liệu truyền thống
Tầm quan trọng cốt lõi của Khoa học dữ liệu đối với xã hội và nền kinh tế hiện đại là gì?
Đơn giản hóa việc lưu trữ thông tin
Đưa ra quyết định dựa trên dữ liệu chính xác hơn
Tự động hóa hoàn toàn quy trình kinh doanh
Chỉ tập trung vào phân tích biến số kinh tế vĩ mô
Ứng dụng của Khoa học dữ liệu trong lĩnh vực tài chính bao gồm những hoạt động nào?
Quản lý rủi ro và dự đoán thị trường tài chính
Phân tích tín dụng
Định hình quyết định đầu tư thông minh
Tất cả các ý trên
Khoa học dữ liệu giúp cá nhân hóa sản phẩm và dịch vụ dựa trên việc phân tích hành vi nào của khách hàng?
Tương tác với trang web và ứng dụng di động
Lịch sử mua hàng và sở thích đọc tin
Tương tác trên mạng xã hội
Tất cả các ý trên
Mục tiêu chính của Khoa học dữ liệu so với Phân tích dữ liệu là gì?
Phân loại dữ liệu có cấu trúc
Tạo ra giá trị từ dữ liệu, dự đoán và tối ưu hóa quy trình
Diễn giải dữ liệu hiện có
Tập trung vào thống kê toán học
Amazon sử dụng KHDL để làm gì trong lĩnh vực bán lẻ và thương mại điện tử?
Tối ưu hóa chuỗi cung ứng
Dự đoán giá chứng khoán
Đề xuất sản phẩm phù hợp với sở thích khách hàng
Phân tích lịch sử truy cập mà không gợi ý gì
Trong lĩnh vực Y tế, KHDL giúp phát hiện dấu hiệu bệnh từ hình ảnh CT hoặc X-quang bằng cách nào?
Phân tích dữ liệu lịch sử bệnh lý
Xác định khối u tiềm ẩn
Dự đoán tác dụng thuốc
Tự động hóa hồ sơ bệnh án
Dữ liệu (Data) được hiểu là gì?
Thông tin đã được xử lý để ra quyết định
Các sự kiện, con số, hoặc quan sát thô chưa qua xử lý
Kết quả của phân tích thống kê
Kiến thức rút ra từ thông tin
Sự khác biệt giữa "Dữ liệu" và "Thông tin" là gì?
Không có sự khác biệt
Dữ liệu là kết quả cuối cùng, còn thông tin là đầu vào
Dữ liệu là đầu vào thô, thông tin là đầu ra sau khi xử lý dữ liệu
Dữ liệu là thông tin theo cấu trúc
Dữ liệu có thể được chia thành những loại chính nào?
Dữ liệu định tính và dữ liệu định lượng
Dữ liệu mô tả và dữ liệu số học
Dữ liệu nhỏ và dữ liệu sạch
Dữ liệu khoa học và dữ liệu xã hội
Dữ liệu định lượng bao gồm những loại nhỏ nào?
Liên tục và rời rạc
Danh mục và thứ bậc
Tự nhiên và nhân tạo
Lịch sử và hiện tại
Dữ liệu định tính thường được chia thành:
Dữ liệu mô tả và dữ liệu số học
Dữ liệu danh mục (nominal) và thứ bậc (ordinal)
Dữ liệu rời rạc và liên tục
Dữ liệu gốc và dữ liệu tổng hợp
Dữ liệu có thể được thu thập từ những nguồn nào?
Thí nghiệm và khảo sát
Thiết bị cảm biến, mạng xã hội
Cơ sở dữ liệu công khai và doanh nghiệp
Tất cả các ý trên
Trong quy trình khoa học dữ liệu, bước đầu tiên thường là gì?
Phân tích mô hình
Làm sạch dữ liệu
Thu thập dữ liệu
Trực quan hóa dữ liệu
Tại sao việc làm sạch dữ liệu lại quan trọng?
Vì dữ liệu luôn chính xác sẵn
Vì dữ liệu thô có thể chứa lỗi, giá trị thiếu hoặc không nhất quán
Vì làm sạch dữ liệu giúp mô hình trở nên phức tạp hơn
Vì dữ liệu bẩn không thể lưu trữ được
Dữ liệu có cấu trúc (structured data) là gì?
Dữ liệu được lưu trữ theo dạng bảng, có hàng và cột
Dữ liệu hình ảnh và âm thanh
Dữ liệu thu thập từ mạng xã hội
Dữ liệu phi ngôn ngữ
Dữ liệu phi cấu trúc (unstructured data) bao gồm ví dụ nào sau đây?
File Excel
Bảng cơ sở dữ liệu
Ảnh, video, bài đăng mạng xã hội
Danh sách sản phẩm có mã định danh
Thu thập dữ liệu là gì?
Chỉ là việc lấy thông tin thô.
Quá trình khám phá, chế biến và biến đổi dữ liệu thành thông tin có ý nghĩa.
Việc sao chép dữ liệu từ nguồn này sang nguồn khác.
Việc lưu trữ thông tin trên máy tính.
Mục đích chính của việc thu thập dữ liệu là gì?
Lưu trữ dữ liệu để dùng sau.
Hiểu rõ hơn về khách hàng và hành vi của họ.
Giảm chi phí vận hành.
Đảm bảo an toàn dữ liệu.
Phương pháp nào không yêu cầu tương tác trực tiếp với người tham gia?
Khảo sát.
Phỏng vấn.
Quan sát.
Thử nghiệm.
Ưu điểm nổi bật của phương pháp khảo sát là gì?
Thu được dữ liệu sâu sắc.
Có thể thu thập dữ liệu lớn từ nhiều người trong thời gian ngắn.
Hoàn toàn chính xác.
Không tốn chi phí.
Nhược điểm lớn của khảo sát là gì?
Tốn chi phí cao.
Không thể tự động hóa.
Dễ bị ảnh hưởng bởi sự không trung thực của người trả lời.
Không thu được dữ liệu số.
Điểm mạnh của phương pháp phỏng vấn là gì?
Khả năng thu thập thông tin sâu và chi tiết từ người tham gia.
Tự động hóa hoàn toàn quá trình thu thập dữ liệu.
Giảm thiểu thời gian và chi phí so với mọi phương pháp khác.
Chỉ phù hợp để thu thập dữ liệu định lượng.
Hạn chế của phương pháp quan sát là gì?
Không thu được dữ liệu định tính.
Thiếu tính thực tế.
Dữ liệu thu được luôn sai lệch.
Mất nhiều thời gian và dễ bị ảnh hưởng bởi yếu tố chủ quan.
Ưu điểm nổi bật nhất của thu thập dữ liệu số là gì?
Dễ thực hiện nhưng chậm.
Tự động hóa và thu thập dữ liệu lớn, nhanh, đa dạng.
Không cần thiết bị hỗ trợ.
Giới hạn về phạm vi.
Thách thức lớn trong quá trình thu thập dữ liệu là gì?
Chi phí lưu trữ.
Quá nhiều dữ liệu.
Bảo mật và quyền riêng tư của người tham gia.
Thiếu công nghệ thu thập.
Xu hướng nổi bật trong thu thập dữ liệu tương lai là gì?
Ứng dụng trí tuệ nhân tạo và blockchain để tăng hiệu quả và bảo mật.
Giảm dụng công nghệ.
Thu thập thủ công.
Ngưng thu thập dữ liệu người dùng.
Lưu trữ dữ liệu là gì?
Quá trình xóa bỏ thông tin cũ để tạo dữ liệu mới
Quá trình tổ chức, bảo quản và duy trì thông tin lâu dài
Chỉ là việc sao chép dữ liệu sang thiết bị khác
Việc chia sẻ dữ liệu qua mạng internet
Mục đích quan trọng nhất của việc lưu trữ dữ liệu là gì?
Giảm dung lượng lưu trữ
Tăng tốc độ truy cập internet
Đảm bảo tính toàn vẹn và an toàn của thông tin
Giảm chi phí phần mềm
Trong thời đại số hóa, lưu trữ dữ liệu trở nên quan trọng vì:
Dữ liệu dễ bị xóa mất
Dữ liệu ngày càng tăng về quy mô và đa dạng
Con người không thể nhớ hết dữ liệu
Máy tính không còn đủ bộ nhớ
Máy chủ ảo (Virtual Server) có ưu điểm nổi bật nào?
Linh hoạt, dễ mở rộng và tiết kiệm năng lượng,tối ưu hóa tài nguyên
Không cần kết nối mạng
Chạy nhanh hơn mọi máy chủ vật lý
Không cần phần cứng thật
Một công ty có nhân viên làm việc từ xa nên chọn hình thức lưu trữ nào?
Lưu trữ nội bộ (NAS/SAN)
Lưu trữ đám mây (Cloud Storage)
Lưu trữ bằng từ
Ổ cứng di động
Điểm khác biệt chính giữa NAS và SAN là gì?
NAS có tốc độ cao hơn SAN
SAN dùng cho mạng lớn, NAS đơn giản hơn
NAS chỉ lưu trữ trên đám mây
SAN không cần thiết bị vật lý
Khi cần kiểm soát chặt chẽ quyền truy cập dữ liệu, tổ chức nên dùng:
Lưu trữ nội bộ
Lưu trữ đám mây công cộng
Ổ USB cá nhân
Google Drive miễn phí
Điểm mạnh nổi bật của lưu trữ đám mây là gì?
Mở rộng linh hoạt và truy cập mọi nơi
Phụ thuộc hoàn toàn vào thiết bị vật lí
Không cần internet vẫn truy cập được
Không có biện pháp bảo mật
Yếu tố nào không phải là mục tiêu của việc lưu trữ dữ liệu?
Hỗ trợ phân tích và nghiên cứu
Tăng cường an toàn và toàn vẹn dữ liệu
Tăng dung lượng tiêu thụ năng lượng
Quản lý hiệu quả cơ sở dữ liệu
Khi tổ chức muốn đảm bảo cả an toàn, khả năng mở rộng, và chi phí tối ưu, giải pháp phù hợp nhất là:
Dùng hoàn toàn máy chủ vật lý
Không cần sao lưu dữ liệu
Sao chép dữ liệu sang USB định kỳ
Kết hợp lưu trữ nội bộ và lưu trữ đám mây (Hybrid Storage)
Xử lý dữ liệu là gì?
Quá trình thu thập và lưu trữ dữ liệu từ các nguồn khác nhau
Quá trình biến đổi dữ liệu thô thành dữ liệu có ý nghĩa và giá trị
Quá trình trình bày kết quả phân tích dưới dạng biểu đồ
Quá trình mã hóa dữ liệu để đảm bảo an toàn thông tin
Mục tiêu chính của xử lý dữ liệu là gì?
Làm cho dữ liệu có cấu trúc và lưu trữ lâu dài
Biến đổi thông tin thô thành dữ liệu có tổ chức và hữu ích
Giảm dung lượng dữ liệu để dễ lưu trữ
Đảm bảo dữ liệu luôn được bảo mật tuyệt đối
Bước đầu tiên trong quy trình xử lý dữ liệu là gì?
Lưu trữ dữ liệu
Phân tích dữ liệu
Thu thập dữ liệu
Trình bày dữ liệu
Bước nào trong quy trình xử lý dữ liệu liên quan đến việc phân loại, lọc và sắp xếp dữ liệu?
Lưu trữ dữ liệu
Sắp xếp dữ liệu
Phân tích dữ liệu
Trình bày dữ liệu
Phân tích dữ liệu nhằm mục đích gì?
Loại bỏ dữ liệu trùng lặp
Đánh giá và rút ra kết luận từ dữ liệu đã xử lý
Lưu trữ dữ liệu trong hệ thống
Chuyển đổi dữ liệu sang định dạng khác
Trong quy trình xử lý dữ liệu, bước nào giúp dữ liệu trở nên trực quan và dễ hiểu nhất?
Trình bày dữ liệu và kết luận
Sắp xếp dữ liệu
Lưu trữ dữ liệu
Xử lý dữ liệu
Một trong những mục tiêu quan trọng của xử lý dữ liệu là:
Giảm chi phí phần mềm phân tích dữ liệu
Tăng tính tương tác và khả năng chia sẻ dữ liệu
Giảm tốc độ truy xuất dữ liệu
Giữ nguyên dữ liệu thô ban đầu
Việc xử lý dữ liệu giúp giảm thiếu rủi ro bằng cách nào?
Tăng dung lượng lưu trữ của hệ thống
Loại bỏ thông tin sai lệch và đảm bảo độ chính xác
Mã hóa dữ liệu để tránh bị đánh cắp
Giảm tốc độ xử lý thông tin
Một lợi ích quan trọng của xử lý dữ liệu đối với học máy (machine learning) là gì?
Giúp mô hình học máy hoạt động nhanh và chính xác hơn
Giảm nhu cầu về dữ liệu đầu vào
Thay thế hoàn toàn quá trình huấn luyện mô hình
Tại sao xử lý dữ liệu được xem là bước quan trọng trong các dự án nghiên cứu và doanh nghiệp?
Vì nó giúp tiết kiệm thời gian thu thập dữ liệu
Vì nó đảm bảo chất lượng dữ liệu và hỗ trợ ra quyết định hiệu quả
Vì nó thay thế hoàn toàn việc phân tích dữ liệu
Vì nó làm giảm số lượng dữ liệu cần thiết
Trong khuôn khổ Phân tích mô tả, mục đích chính của việc sử dụng Biểu đồ hộp (Box Plot) là gì?
Minh họa xu hướng thay đổi của một biến qua thời gian
Thể hiện sự so sánh giữa các giá trị rời rạc hoặc nhóm dữ liệu
Hiển thị phân phối của dữ liệu và làm nổi bật các giá trị ngoại lệ
Thể hiện mối quan hệ giữa biến độc lập và biến phụ thuộc
Để đạt được mục tiêu "Hiểu rõ hơn về ngữ cảnh của câu trả lời, giúp tránh hiểu lầm và đảm bảo tính độc lập của dữ liệu" trong quá trình thu thập thông tin, cần áp dụng phương pháp thu thập dữ liệu nào?
Quan sát ngụy trang
Khảo sát trực tuyến với câu hỏi đóng
Phỏng vấn bán cấu trúc/không cấu trúc
Thu thập dữ liệu từ cảm biến IoT
Trong 4 loại hình phân tích, loại nào yêu cầu sử dụng các thuật toán máy học để thiết kế ngược các kết nối nhân quả trong dữ liệu để dự báo?
Phân tích theo quy định
Phân tích chẩn đoán
Phân tích dự đoán
Phân tích mô tả
Sự khác biệt cốt lõi giữa Khoa học dữ liệu và Thống kê nằm ở đâu?
Thống kê sử dụng dữ liệu có cấu trúc; Khoa học dữ liệu sử dụng dữ liệu không cấu trúc
Khoa học dữ liệu mở rộng và tích hợp thống kê vào một khung công việc rộng hơn để khám phá và tạo ra giá trị từ dữ liệu
Thống kê là tiền đề của thuật toán máy học; Khoa học dữ liệu ưu tiên các phương pháp thống kê kinh điển
Khoa học dữ liệu tập trung vào việc mô tả dữ liệu; Thống kê tập trung vào việc dự đoán tương lai
Mục tiêu nào sau đây là đặc trưng của Phân tích theo Quy định (Prescriptive Analysis) nhưng không phải là của Phân tích Dự đoán (Predictive Analysis)?
Sử dụng dữ liệu lịch sử và mô hình hóa
Áp dụng các thuật toán toán học
Đề xuất hướng hành động tốt nhất sau khi phân tích tác động tiềm ẩn của các lựa chọn khác nhau
Dự báo biến động giá cả trên thị trường chứng khoán
Ý nghĩa nào sau đây của Phân tích dữ liệu đóng vai trò quan trọng nhất trong việc cải thiện lòng trung thành của khách hàng và tăng doanh số bán hàng trong lĩnh vực thương mại điện tử?
Dự báo nhu cầu sản phẩm để tối ưu hóa chuỗi cung ứng
Hiểu rõ khách hàng để tối ưu hóa sản phẩm và dịch vụ, từ đó đưa ra quyết định cá nhân hóa
Giảm thiểu thất thoát và chi phí vận chuyển
Dựa ra quyết định dựa trên sự chắc chắn và thông tin chính xác
Công cụ nào sau đây được mô tả là hữu ích cho những người nghiên cứu muốn thực hiện các phân tích thống kê phức tạp và tạo ra biểu đồ chất lượng cao?
Python
SQL
Tableau
R
Kỹ thuật nào trong Phân tích chẩn đoán giúp xác định cách các biến tương tác và ảnh hưởng lẫn nhau, đồng thời kiểm tra sự thay đổi của chúng theo thời gian hoặc điều kiện khác nhau?
Lập mô hình dự đoán
Phân tích mối liên kết (Association Analysis)
Phân cụm (Clustering)
Phân tích theo quy định
Công cụ nào sau đây có chức năng chính là quản lý lịch trình và tự động hóa công việc trong chuỗi làm việc Khoa học dữ liệu?
Anaconda
Jupyter Notebooks
DVC (Data Version Control)
Apache Airflow
Mục tiêu nào sau đây là đặc trưng của Phân tích Dự đoán, đòi hỏi việc xây dựng mô hình toán học dựa trên dữ liệu lịch sử để mô tả mối liên quan giữa các biến?
Tối ưu hóa hiệu suất làm việc, giảm thiểu rủi ro lỗi
Tạo ra mô hình toán học dựa trên dữ liệu lịch sử để mô tả mối liên quan giữa các biến
Đánh giá sự chắc chắn trong các mẫu thống kê
Phân tích tác động tiềm ẩn của các lựa chọn khác nhau
Mục đích của Học máy (ML) là một nhánh của AI, mục tiêu cốt lõi của ML khác với mục tiêu tổng quát của AI ở điểm nào?
ML tập trung vào việc tạo ra giá trị từ dữ liệu; AI tập trung vào việc thiết kế cơ sở dữ liệu
ML ưu tiên dự đoán và phân loại dự liệu một cách tự động; AI hướng tới khả năng hiểu, quyết định và học tương tự con người
ML tập trung vào việc phát triển các thuật toán có khả năng tự học từ dữ liệu; AI tập trung vào việc xây dựng hệ thống có khả năng tự động hóa và linh hoạt thích nghi
ML chỉ sử dụng mô hình nơ-ron nhân tạo; AI sử dụng các phương pháp khác nhau
Trong Ứng dụng của AI, lĩnh vực nào đòi hỏi khả năng của hệ thống nhận diện và hiểu hình ảnh như tổ hợp phân loại các đối tượng có đặc tính ấn tượng?
Xử lý ngôn ngữ tự nhiên (NLP)
Học tăng cường (Reinforcement Learning)
Thị giác máy tính (Computer Vision)
Lập mô hình dự đoán (Predictive Modeling)
Loại học máy nào dưới đây được sử dụng để khám phá cấu trúc ẩn (ví dụ: phân cụm) trong dữ liệu khi không có nhãn đầu ra mong muốn được cung cấp?
Học tăng cường (Reinforcement Learning)
Học không giám sát (Unsupervised Learning)
Bán giám sát (Semi-supervised Learning)
Học giám sát (Supervised Learning)
Nếu một mô hình ML được sử dụng để dự đoán phản ứng của bệnh nhân đối với các phương pháp điều trị dựa trên dữ liệu lịch sử, mô hình đó thuộc dạng học máy nào?
Thông qua phản thưởng và hình phạt (Học tăng cường)
Thông qua việc khám phá cấu trúc ẩn trong dữ liệu không nhãn (Học không giám sát)
Thông qua việc cung cấp các cặp đầu vào (hồ sơ bệnh nhân) và đầu ra mong muốn (phản ứng) (Học giám sát)
Thông qua việc xử lý dữ liệu bởi trí tuệ nhân tạo nói chung
Trong học tăng cường (Reinforcement Learning) có cơ chế hoạt động cốt lõi nào?
Dựa trên việc phân tích mối liên kết nhân quả trong dữ liệu lịch sử
Tối ưu hóa hiệu suất bằng cách điều chỉnh tự dữ liệu có cấu trúc
Tương tác với môi trường, tự cải thiện thông qua các hành động và nhận phần thưởng/hình phạt từ môi trường
Mô phỏng quy trình kinh doanh và đề xuất chiến lược tối ưu
Cơ hội nào mà AI đem lại trong lĩnh vực Tài chính và Ngân hàng?
Tự động hóa việc cung cấp giáo trình tương tác cho nhân viên
Tối ưu hóa chuỗi cung ứng hàng hóa cho ngành hàng
Dự báo xu hướng thị trường, đánh giá rủi ro và tối ưu hóa quyết định giao dịch
Đưa ra quyết định về tuyển dụng dựa trên linh cảm
Thách thức về an sinh và đạo đức của AI chủ yếu xoay quanh vấn đề gì?
Sự phụ thuộc quá mức vào các framework lập trình như TensorFlow và PyTorch
Khó khăn trong việc xử lý và lưu trữ dữ liệu lớn (Big Data)
Nguy cơ mất việc làm do tự động hóa và thách thức về tính minh bạch và trách nhiệm của các quyết định do AI đưa ra
Sự thiếu hụt nguồn tài nguyên máy chủ vật lý và máy chủ ảo
AI hỗ trợ trong quá trình lập kế hoạch tuyến đường và dự báo nhu cầu vận tải thuộc lĩnh vực ứng dụng nào?
Sản xuất và quản lý chuỗi cung ứng
Bán lẻ và dịch vụ khách hàng
Giao thông và vận tải
An ninh và quốc phòng
Trí tuệ Nhân tạo giúp tối ưu hóa trải nghiệm mua sắm trực tuyến, dự đoán xu hướng mua hàng và tư vấn sản phẩm dựa trên lịch sử mua sắm của người dùng thuộc lĩnh vực ứng dụng nào?
Y tế và chăm sóc sức khỏe
Giáo dục
Bán lẻ và dịch vụ khách hàng
Tài chính và ngân hàng
Học máy (ML) dựa trên cơ sở lý thuyết nào để nhận diện các mô hình và quy luật ẩn sau dữ liệu?
Chủ yếu là các lý thuyết về cơ sở dữ liệu quan hệ (RDBMS)
Một loạt các phương pháp thống kê, toán học, và lý thuyết đồ thị
Các nguyên tắc cơ bản của lập trình hướng đối tượng
Các thuật toán phân tích chuỗi thời gian cổ điển
Bước đầu tiên trong quy trình Khoa học Dữ liệu là gì?
Thu thập dữ liệu từ nhiều nguồn
Xác định vấn đề kinh doanh cần giải quyết
Xây dựng mô hình dự đoán
Quy chuẩn hóa dữ liệu
Nguyên tắc SMART yêu cầu mục tiêu phải có yếu tố nào sau đây?
Secret (Bí mật)
Time-bound (Có thời hạn)
Technical (Kỹ thuật)
Universal (Phổ quát)
Khi xác định biến quan trọng cho dự án dự đoán giá nhà, biến nào dưới đây thường KHÔNG cần thiết?
Diện tích đất
Số phòng ngủ
Màu sơn tường phòng khách
Khoảng cách đến trung tâm thành phố
Trong tiền xử lý dữ liệu, kỹ thuật nào được dùng để xử lý giá trị thiếu (missing values)?
Chuẩn hóa min-max
Điền trung bình/median (imputation)
Vẽ biểu đồ phân tán
Huấn luyện mô hình XGBoost
Mục đích chính của bước "Thăm dò dữ liệu" là gì?
Dự báo doanh thu quý tới
Phát hiện mẫu hình và bất thường trong dữ liệu
Đánh giá độ chính xác của mô hình
Thiết kế dashboard cho lãnh đạo
Với bài toán phân loại khách hàng "rời bỏ" hay "giữ chân" (binary classification), mô hình nào phù hợp nhất nếu dữ liệu có mối quan hệ phi tuyến phức tạp?
Hồi quy tuyến tính
Logistic Regression
Random Forest
K-Means
Tại sao quy trình Khoa học Dữ liệu thường phải lặp lại (iterative)?
Vì dữ liệu luôn thay đổi theo thời gian thực
Vì lãnh đạo yêu cầu báo cáo hằng tuần
Vì mô hình đều luôn sai
Vì lập trình viên thích viết lại code
Khi đánh giá mô hình, chỉ số nào đo lường khả năng phân biệt đúng giữa “khách hàng rời bỏ” và “khách hàng ở lại”?
Mean Squared Error (MSE)
Accuracy
AUC-ROC
R-squared
Công cụ nào dưới đây giúp người dùng cuối tương tác trực tiếp với kết quả mô hình?
Jupyter Notebook thô
Báo cáo PDF tĩnh
Dashboard Tableau với filter thời gian
File CSV dữ liệu gốc
Trong dự án tối ưu hóa kho hàng, sau khi triển khai mô hình dự đoán nhu cầu, bước cuối cùng cần thực hiện là gì?
Xóa toàn bộ dữ liệu cũ
Theo dõi hiệu suất mô hình trong thực tế và cập nhật định kỳ
Chỉnh sửa màu sắc biểu đồ
In báo cáo và lưu kho
Trong các ngôn ngữ sau, ngôn ngữ nào được sử dụng phổ biến nhất trong lĩnh vực Khoa học Dữ liệu hiện nay?
Java
Python
C++
PHP
Trong Python, thư viện nào chuyên dùng để thao tác và phân tích dữ liệu dạng bảng (giống như Excel)?
NumPy
Matplotlib
Pandas
Scikit-learn
Công cụ nào sau đây thường được sử dụng để viết mã, chạy thử và trực quan hóa kết quả trong quá trình làm việc với dữ liệu bằng Python?
Jupyter Notebook
Visual Studio Code
PyCharm
Spyder
Trong Python, thư viện nào được sử dụng chủ yếu để trực quan hóa dữ liệu bằng biểu đồ, đồ thị?
NumPy
Matplotlib
Pandas
TensorFlow
Trong các công cụ sau, công cụ nào không phải là phần mềm hoặc môi trường thường được sử dụng trong Khoa học Dữ liệu?
Jupyter Notebook
RStudio
Tableau
Adobe Photoshop
Ngôn ngữ lập trình R thường được sử dụng nhiều nhất trong lĩnh vực nào sau đây?
Phát triển web
Phân tích thống kê và trực quan hóa dữ liệu
Lập trình hệ thống
Thiết kế đồ họa
Trong Python, thư viện NumPy chủ yếu được sử dụng để làm gì?
Trực quan hóa dữ liệu
Xử lý dữ liệu dạng bảng
Tính toán số học trên mảng và ma trận
Xây dựng mô hình học sâu (deep learning)
Công cụ nào sau đây không phải là phần mềm mã nguồn mở (open source) thường dùng trong Khoa học Dữ liệu?
Python
R
Excel
Jupyter Notebook
Thư viện Scikit-learn trong Python được sử dụng chủ yếu cho mục đích nào sau đây?
Vẽ biểu đồ và trực quan hóa dữ liệu
Xử lý và làm sạch dữ liệu
Xây dựng và huấn luyện các mô hình học máy (machine learning)
Kết nối cơ sở dữ liệu
Trong các phần mềm sau, công cụ nào thường được dùng để trực quan hóa dữ liệu tương tác và tạo dashboard (bảng điều khiển) trong Khoa học Dữ liệu?
Tableau
Jupyter Notebook
RStudio
Spyder
