WorksheetsChương 3 — Trắc nghiệm Big Data
Total questions: 90
Worksheet time: 45mins
Dữ liệu lớn (Big Data) là gì?
Dữ liệu nhỏ, dễ xử lý bằng Excel
Dữ liệu có kích thước lớn, tốc độ cao, đa dạng, khó xử lý bằng công cụ truyền thống
Dữ liệu chỉ gồm văn bản
Dữ liệu ít thay đổi
Theo Gartner, dữ liệu lớn được đặc trưng bởi mấy yếu tố chính?
2 yếu tố
3 yếu tố
4 yếu tố
5 yếu tố
Trong mô hình 3Vs của Big Data, “Velocity” thể hiện:
Dung lượng dữ liệu
Tốc độ tạo ra và xử lý dữ liệu
Độ tin cậy của dữ liệu
Mức độ chi tiết dữ liệu
“Variety” trong Big Data đề cập đến:
Tốc độ xử lý dữ liệu
Đa dạng nguồn và loại dữ liệu
Độ chính xác dữ liệu
Giá trị dữ liệu
Ngoài 3Vs, yếu tố thứ tư thường được thêm vào để mô tả Big Data là:
Validation
Value
Visualization
Virtualization
Một hệ thống giao thông thông minh phải xử lý hàng triệu tín hiệu đèn, camera và cảm biến mỗi giây. Đặc trưng nào của Big Data thể hiện rõ nhất trong tình huống này?
Variety
Velocity
Volume
Veracity
Dữ liệu cảm biến từ hàng nghìn thiết bị IoT truyền về trung tâm mỗi giây cho thấy thách thức chính về:
Tốc độ và dung lượng dữ liệu
Đa dạng loại dữ liệu
Giá trị thấp của dữ liệu
Dữ liệu chỉ ở dạng số
Vì sao nói “Big Data không chỉ là vấn đề kích thước”?
Vì dữ liệu lớn thường bị lỗi
Vì giá trị trích xuất từ dữ liệu mới là mục tiêu chính
Vì chỉ cần dữ liệu nhanh là đủ
Vì mọi dữ liệu lớn đều vô dụng nếu không được lưu trữ
Một công ty thương mại điện tử muốn phân tích hành vi người dùng theo thời gian thực để đề xuất sản phẩm phù hợp. Họ đang tập trung vào đặc trưng nào của Big Data?
Volume
Value
Velocity
Variety
Một tổ chức thu thập dữ liệu từ video, âm thanh, cảm biến và nhật ký web. Để tích hợp và phân tích hiệu quả, họ cần giải quyết đặc trưng nào của Big Data?
Variety
Volume
Velocity
Veracity
Thách thức lớn nhất của dữ liệu lớn (Big Data) là gì?
Thiếu dữ liệu để phân tích
Dữ liệu chỉ tồn tại ở dạng văn bản
Dữ liệu được lưu trữ quá dễ dàng
Dữ liệu có khối lượng, tốc độ và độ phức tạp cao
Tại sao các hệ thống truyền thống (ví dụ SQL) gặp khó khăn với Big Data?
Vì SQL không thể kết nối internet
Vì dữ liệu lớn vượt quá khả năng lưu trữ và xử lý của hệ thống truyền thống
Vì dữ liệu lớn không thể được lưu trong bảng
Vì SQL chỉ hỗ trợ dữ liệu văn bản
Loại dữ liệu nào gây khó khăn nhất trong việc phân tích dữ liệu lớn?
Dữ liệu có cấu trúc
Dữ liệu bán cấu trúc
Dữ liệu phi cấu trúc (video, âm thanh, văn bản tự do)
Dữ liệu số
Tốc độ sinh dữ liệu cao tạo ra thách thức nào sau đây?
Dữ liệu khó phân loại
Không thể xử lý và phân tích kịp thời theo thời gian thực
Làm giảm tính bảo mật dữ liệu
Tăng độ tin cậy của dữ liệu
“Veracity” trong đặc trưng của Big Data nói đến yếu tố nào?
Độ tin cậy và tính chính xác của dữ liệu
Kích thước dữ liệu
Tốc độ tăng trưởng dữ liệu
Dạng dữ liệu
Một trong những thách thức về nhân lực trong Big Data là gì?
Dư thừa chuyên gia dữ liệu
Thiếu chuyên gia có khả năng kết hợp kỹ thuật và phân tích dữ liệu
Không cần đến kiến thức về lập trình
Tất cả các công việc đều được tự động hóa
Tại sao bảo mật dữ liệu là vấn đề quan trọng trong Big Data?
Vì dữ liệu thường được lưu trữ cục bộ
Vì dữ liệu lớn dễ bị nhiễu
Vì dữ liệu đến từ nhiều nguồn, dễ bị lộ và khó kiểm soát
Vì hệ thống không có tường lửa
Hệ thống nào sau đây thường được sử dụng để xử lý dữ liệu lớn hiệu quả?
Microsoft Excel
Apache Hadoop hoặc Apache Spark
Google Docs
Access Database
Chất lượng dữ liệu kém có thể dẫn đến hậu quả nào?
Giảm chi phí lưu trữ
Cải thiện tốc độ phân tích
Kết quả phân tích sai lệch và ra quyết định không chính xác
Tăng hiệu quả khai thác dữ liệu
Khi tích hợp dữ liệu từ nhiều nguồn khác nhau, thách thức lớn nhất là gì?
Dữ liệu bị trùng lặp và khác định dạng
Dữ liệu luôn đồng nhất
Dữ liệu dễ bị mất giá trị
Dữ liệu luôn sạch và hoàn hảo
Phân tích dữ liệu lớn giúp doanh nghiệp chủ yếu trong việc nào sau đây?
Giảm chi phí vận hành cố định
Dự đoán xu hướng và ra quyết định chiến lược
Tăng số lượng nhân viên bán hàng
Tự động hoá toàn bộ quy trình sản xuất
Một trong những vai trò chính của phân tích dữ liệu lớn là:
Loại bỏ hoàn toàn rủi ro trong kinh doanh
Cung cấp khả năng dự báo xu hướng và hành vi người tiêu dùng
Giảm khối lượng dữ liệu cần xử lý
Thay thế hoàn toàn con người trong ra quyết định
Phân tích dữ liệu lớn giúp doanh nghiệp hiểu rõ hành vi khách hàng bằng cách:
Giới hạn dữ liệu thu thập được
Phân tích dữ liệu hành vi và lịch sử mua sắm
Xoá dữ liệu cũ định kỳ
Tự động tạo nhu cầu mới
Tiềm năng lớn nhất của phân tích dữ liệu lớn trong lĩnh vực y tế là gì?
Tăng số lượng bệnh viện
Dự đoán bệnh lý và hỗ trợ điều trị
Giảm chi phí thuốc men
Quản lý nhân sự y tế
Phân tích dữ liệu lớn có thể giúp phát hiện thông tin ẩn bằng cách:
Tự động xoá dữ liệu lỗi
Phân tích mối liên kết và mẫu tiềm ẩn trong dữ liệu lớn
Sắp xếp lại dữ liệu theo thời gian
Chuyển đổi định dạng dữ liệu
Trong kinh doanh, lợi ích trực tiếp của phân tích dữ liệu lớn là gì?
Tăng doanh thu thông qua hiểu biết sâu hơn về khách hàng
Giảm giá trị sản phẩm
Giảm thời gian quảng cáo
Tăng chi phí marketing
Tiềm năng của phân tích dữ liệu lớn trong lĩnh vực chính trị là:
Kiểm soát truyền thông
Dự đoán kết quả bầu cử và hành vi cử tri
Giảm số lượng cử tri
Giới hạn thông tin công khai
Một trong những ứng dụng của phân tích dữ liệu lớn trong marketing là:
Dự báo nhu cầu và tối ưu hoá chiến lược tiếp thị
Thay thế bộ phận bán hàng
Giảm chi phí quảng cáo bằng mọi giá
Tự động tạo sản phẩm mới
“Khả năng dự báo tương lai” là đặc trưng thuộc phần nào của phân tích dữ liệu lớn?
Vai trò
Thách thức
Tiềm năng
Giới hạn
Phân tích dữ liệu lớn mở ra tiềm năng nào cho tổ chức và xã hội?
Giảm nhu cầu lưu trữ dữ liệu
Tăng khả năng dự đoán, đổi mới và phát triển bền vững
Giảm sự tương tác của con người với dữ liệu
Loại bỏ hoàn toàn sai số dữ liệu
Trong một hệ thống xử lý dữ liệu lớn, điều gì xảy ra nếu chỉ dựa vào máy móc mà không có sự tham gia của con người?
Hệ thống vẫn đảm bảo khả năng sáng tạo và linh hoạt trong ra quyết định
Hiệu suất tăng cao nhưng thiếu khả năng diễn giải và tư duy chiến lược
Hệ thống sẽ hoạt động ổn định và chính xác tuyệt đối
Dữ liệu sẽ được xử lý nhanh hơn nhưng cũng đầy đủ hơn
Máy móc trong hệ thống xử lý dữ liệu lớn không có chức năng nào sau đây?
Tự động hóa và tối ưu hóa quá trình xử lý
Phân loại dữ liệu nhanh chóng và chính xác
Đưa ra dự báo và xu hướng tương lai
Thay thế hoàn toàn vai trò chiến lược của con người
Vai trò chính của con người trong hệ thống xử lý dữ liệu lớn là gì?
Thực hiện tính toán tốc độ cao
Quản lý hạ tầng phần cứng
Diễn giải dữ liệu và ra quyết định sáng tạo
Tự động hóa quá trình phân loại
Bước kiểm soát chất lượng dữ liệu trong quá trình xử lý nhằm mục tiêu:
Tăng dung lượng dữ liệu
Giảm tính chính xác để tiết kiệm thời gian
Đảm bảo dữ liệu chính xác, đầy đủ, nhất quán
Loại bỏ hoàn toàn dữ liệu trùng lặp
Trong chức năng cơ bản của hệ thống, chuyển đổi dữ liệu giúp:
Giảm lượng dữ liệu lưu trữ
Biến đổi dữ liệu giữa các định dạng để dễ sử dụng
Tăng tốc độ mạng
Xóa bỏ dữ liệu lỗi
Chức năng xác nhận và đảm bảo chất lượng dữ liệu chủ yếu nhằm:
Giảm bớt khối lượng công việc của máy
Đảm bảo dữ liệu đáng tin cậy và phản ánh đúng thực tế
Loại bỏ vai trò của con người trong hệ thống
Tăng số lượng dữ liệu thu thập
Phân loại và sắp xếp dữ liệu giúp doanh nghiệp đạt được lợi ích nào?
Tăng tính phức tạp của hệ thống
Giảm khả năng truy cập dữ liệu
Tổ chức thông tin có hệ thống, dễ phân tích
Giảm dung lượng lưu trữ
Tóm tắt dữ liệu giúp người sử dụng:
Xem chi tiết từng bản ghi
Nắm được thông tin chính và xu hướng quan trọng
Xóa bỏ dữ liệu thừa
Tự động hóa hoàn toàn quá trình xử lý
Ví dụ hệ thống ngân hàng ABC minh họa cho:
Ứng dụng thực tế của việc tóm tắt và phân loại dữ liệu trong quản lý tài chính
Cách lưu trữ dữ liệu dạng văn bản trong ngân hàng
Cách mã hóa dữ liệu bảo mật
Mô hình đào tạo máy học
Nếu một tổ chức không thường xuyên kiểm soát và làm mới dữ liệu, hậu quả có thể là gì?
Dữ liệu sẽ tự động đồng bộ
Các mô hình phân tích có thể dựa trên thông tin lỗi thời và sai lệch
Hệ thống trở nên nhanh hơn
Báo cáo trở nên chi tiết hơn
Theo nguồn tài liệu, xử lý dữ liệu phân tán liên quan đến khía cạnh nào của dữ liệu lớn?
Tập trung tất cả dữ liệu vào một hệ thống trung tâm
Tổ chức và quản lý dữ liệu trên nhiều nút hoặc máy tính khác nhau
Chỉ thực hiện các nhiệm vụ đồng thời trên một máy tính duy nhất
Giảm gánh nặng cho một điểm duy nhất bằng cách tăng cường phần cứng
Mục tiêu chính của kỹ thuật xử lý song song là gì?
Giảm thiểu các tác vụ thực hiện để tiết kiệm tài nguyên
Tập trung tất cả sức mạnh tính toán vào một lõi xử lý duy nhất
Tối ưu hóa hiệu suất bằng cách sử dụng đồng thời nhiều nguồn lực, giảm thời gian xử lý
Đảm bảo tính nhất quán dữ liệu thông qua đồng bộ hóa
Nguyên tắc cơ bản của kỹ thuật xử lý dữ liệu phân tán và song song là gì?
Tập trung và tuần tự
Mã hóa và bảo mật
Phân tán và đồng thời
Tối ưu hóa và kiểm thử
Trong kỹ thuật phân tán dữ liệu, phương pháp “Phân vùng dữ liệu” (Data Partitioning) hoạt động bằng cách nào để tối ưu hóa xử lý?
Nén toàn bộ dữ liệu để giảm áp lực lên các nút
Chia dữ liệu thành các phần nhỏ (phân vùng) và gán cho một nút cụ thể
Chỉ lưu trữ bản sao dữ liệu trên nút trung tâm
Sử dụng mã hóa để bảo vệ từng phần dữ liệu
Mục tiêu chính của kỹ thuật Sao chép dữ liệu (Replication) trong hệ thống phân tán là gì?
Giảm chi phí lưu trữ tổng thể
Đảm bảo tính sẵn có và tăng độ tin cậy của hệ thống
Đơn giản hóa quá trình truy vấn SQL
Tăng cường áp lực xử lý cho nút gốc
Ngoài việc giảm rủi ro mất mát dữ liệu, Replication còn mang lại lợi ích nào về mặt hiệu suất cho hệ thống phân tán?
Giảm chi phí băng thông mạng
Giảm tải cho nút chính (nút gốc) bằng cách phục vụ các yêu cầu đọc từ các bản sao
Đồng bộ hóa dữ liệu tức thì giữa tất cả các nút
Chỉ sử dụng một tài nguyên tính toán duy nhất
MapReduce được định nghĩa là mô hình gì trong xử lý dữ liệu lớn?
Một hệ thống lưu trữ đám mây
Mô hình lập trình và thuật toán xử lý dữ liệu
Một giao thức bảo mật dữ liệu
Một kỹ thuật giảm thiểu nhiễu trong dữ liệu thô
Apache Spark được mô tả là gì và hỗ trợ xử lý dữ liệu theo cách nào?
Một công cụ trực quan hóa dữ liệu lớn
Một hệ thống cơ sở dữ liệu quan hệ tối ưu hóa cho dữ liệu lớn
Một framework xử lý dữ liệu phân tán với hiệu suất cao, hỗ trợ xử lý dữ liệu trên bộ nhớ
Một ngôn ngữ lập trình thống kê tương tự như R
Sự tích hợp giữa kỹ thuật phân tán và song song giúp tối ưu hóa việc xử lý dữ liệu lớn như thế nào?
Bằng cách giảm áp lực cho từng nút và nâng cao khả năng mở rộng
Bằng cách giảm chi phí lưu trữ dữ liệu
Bằng cách loại bỏ hoàn toàn nhu cầu về replication
Bằng cách chỉ xử lý dữ liệu tuần tự
Ứng dụng thực tế nào sau đây được đề cập là nơi kỹ thuật xử lý dữ liệu phân tán và song song được sử dụng trong môi trường doanh nghiệp?
Phát triển phần mềm lập trình truyền thống
Phân tích hành vi người dùng trên các nền tảng trực tuyến
Chuyển đổi dữ liệu có cấu trúc thành dữ liệu không cấu trúc
Mã hóa Label cho các biến phân loại
Đặc điểm nào sau đây không phải của cơ sở dữ liệu phân tán?
Dữ liệu được lưu ở nhiều vị trí khác nhau
Người dùng cần biết dữ liệu nằm ở đâu để truy cập
Các nút trong hệ thống có thể xử lý song song
Dữ liệu được quản lý như một thể thống nhất
Ưu điểm nổi bật nhất của cơ sở dữ liệu phân tán là gì?
Giảm chi phí vận hành
Tăng hiệu suất và khả năng sẵn sàng của hệ thống
Giảm bảo mật dữ liệu
Dễ quản lý hơn cơ sở dữ liệu tập trung
Điện toán đám mây (Cloud Computing) cung cấp tài nguyên dưới dạng gì?
Các dịch vụ qua Internet
Phần cứng cài đặt nội bộ
Ổ cứng di động
Ứng dụng ngoại tuyến
Trong các mô hình dịch vụ sau, mô hình nào cho phép người dùng chạy ứng dụng mà không cần quản lý hạ tầng?
IaaS
PaaS
SaaS
DaaS
Mô hình nào trong điện toán đám mây cung cấp phần mềm hoàn chỉnh cho người dùng cuối?
IaaS
PaaS
SaaS
DaaS
Trong điện toán đám mây, ảo hóa (virtualization) có vai trò gì?
Tăng tốc độ xử lý vật lý của CPU
Cho phép nhiều máy ảo chia sẻ tài nguyên vật lý chung
Giảm kích thước dữ liệu lưu trữ
Xóa dữ liệu không cần thiết
Vì sao điện toán đám mây phù hợp cho xử lý dữ liệu lớn (Big Data)?
Vì dữ liệu được lưu trữ trên thiết bị cá nhân
Vì dễ mở rộng quy mô và xử lý song song
Vì không cần bảo mật dữ liệu
Vì chi phí cao nên ít người dùng
Ví dụ nào sau đây là hệ thống cơ sở dữ liệu phân tán?
Excel lưu trên máy tính cá nhân
MySQL chỉ trên một máy chủ duy nhất
Hadoop Distributed File System (HDFS)
Word lưu offline
Tính năng “trả phí theo mức sử dụng” là đặc trưng của mô hình nào?
Điện toán đám mây
Cơ sở dữ liệu tập trung
Lưu trữ nội bộ
Mạng ngang hàng (P2P)
Dịch vụ Google App Engine thuộc mô hình nào trong điện toán đám mây?
IaaS
PaaS
SaaS
DaaS
Công cụ nào dưới đây được xem là nền tảng phổ biến nhất cho việc lưu trữ và xử lý dữ liệu phân tán trong phân tích dữ liệu lớn?
Tableau
Apache Hadoop
Power BI
Python
Điểm nổi bật của Apache Spark so với Hadoop là gì?
Xử lý dữ liệu theo lô (batch processing)
Hỗ trợ ít ngôn ngữ lập trình hơn
Xử lý dữ liệu nhanh, tận dụng bộ nhớ hiệu quả
Không hỗ trợ Python
Công cụ nào dưới đây chuyên dùng cho xử lý dữ liệu thời gian thực (real-time processing)?
Apache Flink
Apache Hive
Power BI
Apache Pig
Công cụ nào trong Hadoop giúp người không chuyên lập trình viết truy vấn dữ liệu dễ dàng?
Hive và Pig
Spark và Flink
Tableau và Power BI
Java và Scala
Công cụ nào dưới đây chuyên về trực quan hóa và báo cáo dữ liệu?
Apache Hadoop
Tableau và Power BI
Apache Flink
R và Python
Ngôn ngữ nào sau đây phổ biến nhất trong phân tích dữ liệu lớn nhờ có nhiều thư viện hỗ trợ mạnh mẽ như Pandas, NumPy, Scikit-learn?
R
Python
Java
SQL
Ngôn ngữ nào chuyên dùng cho thống kê và đồ họa dữ liệu, phổ biến trong nghiên cứu khoa học?
Python
SQL
R
Java
Ngôn ngữ lập trình nào thường được sử dụng cùng với Apache Spark để tận dụng tối đa hiệu năng và tính tương thích của hệ thống?
Python
Java và Scala
R
Julia
SQL đóng vai trò quan trọng nhất trong công việc nào dưới đây?
Xây dựng mô hình học máy
Truy vấn và thao tác dữ liệu trong cơ sở dữ liệu lớn
Thiết kế giao diện người dùng
Phân tích ảnh và âm thanh
Trong quá trình chọn công cụ cho phân tích dữ liệu lớn, yếu tố nào sau đây giúp doanh nghiệp đảm bảo hệ thống có thể mở rộng linh hoạt trong tương lai?
Tốc độ xử lý hiện tại
Khả năng mở rộng và tương thích hệ thống
Giao diện thân thiện với người dùng
Số lượng biểu đồ có sẵn trong công cụ
Mục tiêu cốt lõi của việc kết hợp khám phá dữ liệu lớn (Big Data) với Trí tuệ nhân tạo (AI) là gì?
Chỉ tập trung vào việc chuẩn hóa và làm sạch dữ liệu để tránh lỗi
Giúp khai phá sâu sắc vào dữ liệu để tìm ra sự hiểu biết mới và giải mã những bí mật ẩn sau con số
Chủ yếu là tự động hóa các quy trình hành chính và quản lý
Giúp lưu trữ và quản lý hiệu quả các tập dữ liệu có cấu trúc
Trong lĩnh vực y tế, việc ứng dụng Khám phá dữ liệu lớn và AI mang lại lợi ích cụ thể nào?
Chủ yếu là theo dõi lượng thuốc tồn kho và tối ưu hóa lịch trình làm việc của bác sĩ
Chỉ sử dụng dữ liệu số (như cân nặng) để tính toán trung bình (Mean) và phương sai (Variance)
Giúp tự động hóa và phân tích hàng loạt dữ liệu lớn một cách nhanh chóng và chính xác, đồng thời giúp dự báo về quy mô và diễn biến của dịch bệnh
Giúp xác định và phân loại các biến khóa chính (key variables) trong hồ sơ bệnh án
Trí tuệ nhân tạo (AI) và Học máy (ML) đóng vai trò then chốt nào trong việc phân loại và xác định các dấu hiệu bệnh lý từ dữ liệu lớn (Big Data)?
Giúp tự động thu thập dữ liệu phi cấu trúc (như hình ảnh X-quang) và lưu trữ chúng
AI chỉ đơn thuần là công cụ trực quan hóa các mối quan hệ tuyến tính giữa các biến
AI giúp thiết lập các quy tắc kết hợp (Association Rules) trong dữ liệu dược phẩm
AI có thể học từ dữ liệu lớn để hiểu rõ các xu hướng, mối liên kết, và yếu tố nguy cơ của các bệnh lý; các mô hình ML tự động phân loại và xác định các biểu hiện tiềm ẩn của bệnh
Khi tận dụng sức mạnh của khám phá dữ liệu lớn và AI, đặc biệt trong lĩnh vực y tế, các thách thức lớn nhất thường là gì?
Thiếu công cụ thống kê cơ bản như phương sai và biểu đồ cột
Vấn đề bảo mật và quyền riêng tư đối với dữ liệu nhạy cảm, cùng với thách thức về đồng nhất dữ liệu từ nhiều nguồn khác nhau
Thiếu ngôn ngữ lập trình phù hợp (ví dụ: Python hoặc R)
Thách thức trong việc chọn giữa thuật toán hồi quy và thuật toán phân loại
Mối quan hệ giữa Phân tích dữ liệu lớn và Học máy (ML) mang lại lợi ích chung như thế nào?
Sự kết hợp giữa khả năng xử lý dữ liệu khổng lồ và sức mạnh của học máy cho phép tiến xa hơn trong việc hiểu rõ thông tin, tìm kiếm mối quan hệ phức tạp, và đưa ra dự đoán chính xác
Học máy chỉ là một công đoạn tiền xử lý dữ liệu đơn thuần
Học máy chỉ áp dụng cho dữ liệu có cấu trúc, còn phân tích dữ liệu lớn chỉ áp dụng cho dữ liệu phi cấu trúc
Phân tích dữ liệu lớn chỉ tập trung vào phân tích mô tả (Descriptive Analysis) còn học máy chỉ tập trung vào phân tích chẩn đoán (Diagnostic Analysis)
Trong lĩnh vực tài chính và ngân hàng, Phân tích dữ liệu lớn và Học máy thường được sử dụng để tạo ra những mô hình dự báo nào?
Phân loại email là spam hay không spam
Dự đoán biến động giá cổ phiếu, đánh giá xu hướng thị trường, phân tích rủi ro tài chính và tối ưu hóa quản lý tài sản
Dự đoán nhu cầu nguyên liệu và tối ưu hóa chuỗi cung ứng
Xây dựng mô hình phân tích cảm xúc (Sentiment Analysis) của người dùng trên mạng xã hội
Phân tích dữ liệu lớn và Học máy giúp lĩnh vực y tế xử lý những loại dữ liệu phức tạp nào và với mục tiêu gì?
Chỉ xử lý dữ liệu số từ các thiết bị IoT để tiết kiệm năng lượng
Xử lý dữ liệu dạng bảng (Tabular data) để phân loại khách hàng theo nhóm tuổi
Chỉ tập trung vào việc xác định các giá trị ngoại lệ trong kết quả xét nghiệm
Xử lý dữ liệu phi cấu trúc và dữ liệu lớn (như hồ sơ bệnh án, hình ảnh y khoa) để phân tích sâu rộng, dự đoán kết quả bệnh lý và quản lý tài nguyên y tế hiệu quả
Trong chiến lược tiếp thị và bán lẻ, sự kết hợp giữa phân tích dữ liệu lớn và học máy mang lại những tiến bộ nào?
Tối ưu hóa chiến lược quảng cáo, dự đoán xu hướng mua sắm và cá nhân hóa trải nghiệm khách hàng.
Thiết lập các giao diện tương tác để người dùng tự điều chỉnh mô hình.
Hỗ trợ dự báo thời tiết và mô hình hóa khí hậu.
Giúp xác định các điểm Core Points và Noise Points trong thuật toán DBSCAN.
Vai trò của Phân tích dữ liệu lớn và Học máy trong việc tìm kiếm cấu trúc ẩn trong nghiên cứu khoa học và trong lĩnh vực dịch vụ là gì?
Trong nghiên cứu khoa học, chỉ giúp thu thập dữ liệu từ các cảm biến IoT và lưu trữ chúng.
Trong dịch vụ, chỉ tập trung vào việc xử lý các giá trị thiếu và dữ liệu không hợp lý.
Trong khoa học, giúp khám phá các cấu trúc ẩn và mối quan hệ phức tạp trong dữ liệu, và trong dịch vụ, giúp đưa ra những dự đoán chính xác và cá nhân hóa trải nghiệm người dùng.
Giúp giảm chiều dữ liệu bằng phương pháp PCA.
Học máy và Phân tích dữ liệu lớn được áp dụng trong an ninh mạng như thế nào để tăng cường bảo mật?
Sử dụng dữ liệu lớn (như log hệ thống, thông tin người dùng) để nhận diện mô hình đe dọa an ninh mạng và áp dụng học máy để dự đoán hành vi tấn công dựa trên các mẫu đã xác định.
Bằng cách loại bỏ tất cả các thuật toán regularization khỏi mô hình.
Bằng cách thiết lập hệ thống ghi lại lịch sử mua hàng của người dùng.
Chủ yếu bằng cách sử dụng các mô hình hồi quy để dự đoán giá trị liên tục của các cuộc tấn công.
Mục tiêu chính của “dự báo” (forecasting) thường là gì?
Dự đoán một kết quả trong tương lai dựa trên chuỗi thời gian.
Phân nhóm dữ liệu thành từng cụm.
Tăng độ bảo mật dữ liệu.
Tạo mô hình giải thích nguyên nhân chính xác tuyệt đối.
Dự đoán (prediction) khác dự báo (forecasting) ở điểm nào?
Dự đoán chỉ áp dụng cho dữ liệu hình ảnh.
Dự báo luôn chính xác hơn.
Dự báo gắn với thời gian tương lai, dự đoán có thể không cần temporal.
Không khác nhau.
Bài toán “khách hàng có mua hàng trong tuần tới hay không?” thuộc loại gì?
Forecasting
Prediction (classification)
Clustering
Anomaly detection
Mô hình nào dưới đây chuyên dùng cho bài toán dự báo theo chuỗi thời gian?
Logistic Regression
ARIMA
K-means
PCA
Trong Big Data, lý do chính khiến việc dự báo trở nên khó khăn hơn là gì?
Dữ liệu quá nhỏ.
Dữ liệu đến theo thời gian thực với tốc độ cao.
Mô hình dự báo không tồn tại.
Không thể làm sạch dữ liệu.
Metric MAE, RMSE thường được dùng để đánh giá loại mô hình nào?
Phân lớp nhị phân
Hồi quy dự báo liên tục
Mã hóa dữ liệu
Gom cụm
Bài toán dự báo doanh thu theo từng tháng trong 12 tháng tới là dạng:
Classification
Time-series forecasting
Clustering
Association rules
Trong dữ liệu lớn, thuật ngữ “real-time prediction” nghĩa là:
Dự đoán trong quá khứ
Dự đoán ngay tại thời điểm dữ liệu vừa đến (streaming)
Chỉ dự đoán sau khi kết thúc thu thập dữ liệu
Không dự đoán được
Nếu cần dự báo “số lượng bệnh nhân nhập viện mỗi ngày” → nên dùng metric đánh giá nào?
Accuracy
Precision
RMSE hoặc MAPE
F1-score
Ví dụ nào dưới đây KHÔNG phải là dự báo?
Dự đoán tỷ giá USD tuần sau
Dự đoán thời tiết ngày mai
Phân loại email có phải spam hay không
Dự đoán lượng điện tiêu thụ tháng sau
