Font size
WorksheetsQuiz_Dữ liệu_Thống kê mô tả
Total questions: 31
Worksheet time: 27mins
Thống kê mô tả được ví như việc bác sĩ "đo nhiệt độ, huyết áp, nhịp tim...". Ẩn dụ này có ý nghĩa gì?
Thống kê mô tả là một quy trình phức tạp, đòi hỏi chuyên môn cao như bác sĩ phẫu thuật
Thống kê mô tả là bước ‘khám tổng quát’ ban đầu, cần thiết để hiểu tổng quan về ‘sức khỏe’ của dữ liệu trước khi phân tích sâu
Kết quả của thống kê mô tả luôn cho biết dữ liệu đang ‘tốt’ hay ‘xấu’ một cách rõ ràng
Thống kê mô tả chỉ hữu ích trong lĩnh vực y học, không áp dụng cho các ngành khác
Một nghiên cứu theo dõi chỉ số VN-Index mỗi ngày trong vòng 10 năm để phân tích xu hướng. Bộ dữ liệu này thuộc loại nào?
Dữ liệu chéo (Cross-sectional data)
Dữ liệu chuỗi thời gian (Time-series data)
Dữ liệu bảng (Panel data)
Dữ liệu thực nghiệm (Experimental data)
Loại dữ liệu được thu thập bằng cách theo dõi nhiều đối tượng khác nhau (ví dụ: các quốc gia) qua nhiều mốc thời gian khác nhau (ví dụ: nhiều năm) được gọi là gì?
(a)
Which of the following statements are correct when talking about the Mean value?
The mean is the sum of all values divided by the number of values.
It is very sensitive and easily affected by outliers.
It is the most appropriate measure of central tendency when the data is strongly skewed.
It is the main positional measure for a sorted data set.
Tại sao biến "Nhiệt độ đo bằng độ C" được xem là thang đo Khoảng (Interval) mà không phải là thang đo Tỷ lệ (Ratio)?
Vì nhiệt độ không thể sắp xếp theo thứ tự từ thấp đến cao.
Vì khoảng cách giữa 10°C và 20°C không bằng khoảng cách giữa 20°C và 30°C
Vì giá trị 0°C không có nghĩa là "không có nhiệt độ", do đó phép chia (ví dụ: 20°C không nóng gấp đôi 10°C) không có ý nghĩa toán học
Vì nhiệt độ là một biến định tính, không phải là một biến định lượng.
Phân phối thu nhập trong một quốc gia thường có dạng 'Lệch phải' (Positive Skewness). Điều này ngụ ý điều gì?
Mean < Median, và phần lớn người dân có thu nhập cao hơn mức trung bình
Mean ≈ Median, và thu nhập được phân phối đồng đều quanh mức trung tâm
Mean > Median, và phần lớn người dân có thu nhập tập trung ở mức thấp và trung bình
Mean < Median, và một số ít người có thu nhập rất thấp kéo đuôi đồ thị về bên trái.
Dữ liệu có cấu trúc (Structured Data) có những đặc điểm nào sau đây? (Chọn các đáp án đúng)
Thường được tổ chức trong các bảng có hàng và cột rõ ràng.
Rất dễ dàng cho máy tính xử lý, truy vấn và phân tích.
Các ví dụ điển hình bao gồm file Excel, cơ sở dữ liệu quan hệ (SQL).
Các file email, văn bản và hình ảnh là những ví dụ tiêu biểu.
Một nhà kinh tế sử dụng bộ dữ liệu VHLSS do Tổng cục Thống kê điều tra và công bố để phân tích về mức sống hộ gia đình. Đây là việc sử dụng loại dữ liệu nào?
Dữ liệu sơ cấp (Primary Data)
Dữ liệu thứ cấp (Secondary Data)
Dữ liệu thực nghiệm (Experimental Data)
Dữ liệu quan sát (Observational Data)
Khi phân phối dữ liệu có một cái đuôi dài kéo về bên trái (ví dụ: tuổi thọ), ta nói rằng phân phối này bị _____
Lệch trái (hoặc Negative Skewness)
Lệch phải (hoặc Positive Skewness)
Đối xứng hoàn toàn
Phân phối chuẩn
Biểu đồ Hộp (Boxplot) là một công cụ trực quan hóa mạnh mẽ vì nó cho phép người xem thấy được những thông tin nào sau đây?
Giá trị trung vị (Median) của dữ liệu. b
Sự phân tán của 50% dữ liệu ở giữa (thông qua chiều dài của hộp).
Các giá trị ngoại lai (outliers) nằm tách biệt
Hình dạng phân phối chi tiết (lệch, đối xứng) của toàn bộ dữ liệu.
Biểu đồ Hộp (Boxplot) là một công cụ trực quan hóa mạnh mẽ vì nó cho phép người xem thấy được những thông tin nào sau đây? (Chọn các đáp án đúng)
Giá trị trung vị (Median) của dữ liệu.
Sự phân tán của 50% dữ liệu ở giữa (thông qua chiều dài của hộp).
Các giá trị ngoại lai (outliers) nằm tách biệt.
Hình dạng phân phối chi tiết (lệch, đối xứng) của toàn bộ dữ liệu.
Một cửa hàng muốn xác định cỡ áo (S, M, L, XL) bán chạy nhất trong tháng. Phân tích này tương ứng với việc tìm kiếm thước đo thống kê nào?
Mean (Trung bình cộng)
Median (Trung vị)
Mode (Yếu vị)
Range (Khoảng biến thiên)
"Chiều cao của sinh viên" được đo bằng cm thuộc loại dữ liệu nào?
Định lượng - Rời rạc (Discrete)
Định lượng - Liên tục (Continuous)
Định tính - Thứ bậc (Ordinal)
Định tính - Định danh (Nominal)
Phương pháp định lượng có những đặc điểm nào sau đây? (Chọn các đáp án đúng)
Thường sử dụng mẫu lớn và được chọn ngẫu nhiên để tăng khả năng khái quát hóa.
Phân tích dữ liệu bằng các công cụ thống kê để xác định các mô hình và kiểm tra giả thuyết.
Các phát
Một email chứa nội dung trao đổi công việc được phân loại là loại dữ liệu gì?
Dữ liệu có cấu trúc (Structured Data)
Dữ liệu bán cấu trúc (Semi-structured Data)
Dữ liệu phi cấu trúc (Unstructured Data)
Dữ liệu định lượng (Quantitative Data)
Khi nào việc xử lý giá trị khuyết (missing value) bằng cách thay thế bằng giá trị trung bình (Series mean) là một lựa chọn hợp lý?
Khi biến bị khuyết dữ liệu là biến định tính như 'Khoa'.
Khi tỷ lệ dữ liệu bị khuyết trong biến đó là rất lớn (ví dụ: trên 50%).
Khi dữ liệu của biến đó có phân phối gần đối xứng và tỷ lệ khuyết thấp.
Khi biến đó có chứa nhiều giá trị ngoại lai (outliers) đáng kể.
Một nhà đầu tư xem xét 2 cổ phiếu. Cổ phiếu A có lợi nhuận trung bình 15%/năm, độ lệch chuẩn 5%. Cổ phiếu B có lợi nhuận trung bình 15%/năm, độ lệch chuẩn 20%. Diễn giải nào sau đây là chính xác nhất?
Có phiếu B tốt hơn vì có độ lệch chuẩn cao hơn, cho thấy tiềm năng lợi nhuận đột biến.
Cả hai cổ phiếu đều tốt như nhau vì có cùng lợi nhuận trung bình.
Có phiếu A tốt hơn vì có độ lệch chuẩn thấp hơn, cho thấy lợi nhuận ổn định hơn.
Những ví dụ nào sau đây thuộc về dữ liệu định tính?
Giới tính của sinh viên (Nam, Nữ, Khác).
Số lời trong một sản phẩm phần mềm.
Xếp hạng phim trên một trang web (1 sao, 2 sao, 3 sao, 4 sao, 5 sao).
Cân nặng của các vận động viên (đo bằng kg).
Trong SPSS, việc khai báo 'Measure' (thang đo) cho các biến có vai trò gì?
Chỉ là một thao tác hình thức, không ảnh hưởng đến các phân tích sau này.
Giúp SPSS hiểu đúng bản chất của dữ liệu để gợi ý và cho phép thực hiện các phân tích, biểu đồ phù hợp.
Để thay đổi cách dữ liệu được hiển thị, ví dụ như số chữ số thập phân.
Để mã hóa các giá trị của biến, ví dụ như 1='Nam', 2='Nữ'.
Tại sao trực quan hóa dữ liệu lại là một bước quan trọng trong thống kê mô tả?
Vì biểu đồ giúp nhanh chóng phát hiện các quy luật, xu hướng mà các bảng số có thể che giấu.
Vì biểu đồ là công cụ hiệu quả nhất để xác định các giá trị ngoại lai.
Vì biểu đồ giúp truyền tải thông điệp về dữ liệu một cách trực quan, dễ hiểu tới người đọc
Vì một báo cáo khoa học bắt buộc phải có đủ 4 loại biểu đồ: Cột, Tròn, Phân phối, Hộp.
Một phân phối có độ nhọn Kurtosis < 0 (Platykurtic) thường có đặc điểm gì?
Đỉnh rất cao và nhọn, đuôi đồ thị 'dày', cho thấy có nhiều giá trị ngoại lai.
Đỉnh đồ thị thấp và trải rộng như 'cao nguyên', cho thấy dữ liệu phân bố đều và có ít giá trị ngoại lai.
Đuôi đồ thị bị kéo dài về một phía, cho thấy phân phối không đối xứng.
Phân phối có hình chuông hoàn hảo, tuân theo quy luật phân phối chuẩn.
Hành vi nào sau đây có thể bị coi là đạo văn nếu không trích dẫn nguồn?
Sao chép nguyên văn một đoạn văn của người khác.
Diễn đạt lại ý tưởng của người khác bằng lời văn của mình.
Sử dụng từ đồng nghĩa để thay thế một vài từ nhưng giữ nguyên cấu trúc và ý tưởng.
Trình bày một thông tin mang tính phổ quát, ví dụ 'Hà Nội là thủ đô của Việt Nam'.
Dữ liệu từ các file XML hay JSON được phân loại là loại dữ liệu gì?
Dữ liệu có cấu trúc (Structured Data)
Dữ liệu bán cấu trúc (Semi-structured Data)
Dữ liệu phi cấu trúc (Unstructured Data)
Dữ liệu định tính (Qualitative Data)
So sánh biểu đồ Cột (Bar chart) và biểu đồ Tròn (Pie chart), khi nào nên ưu tiên sử dụng biểu đồ Cột?
Khi muốn nhấn mạnh tỷ trọng của từng phần trong một tổng thể 100%.
Khi có nhiều nhóm (ví dụ: trên 5-6 nhóm) và cần so sánh chính xác độ lớn giữa chúng.
Khi biến cần biểu diễn là một biến định lượng liên tục.
Khi muốn biểu đồ trông đẹp mắt và sinh động hơn.
Một nhà nghiên cứu tự thiết kế bảng hỏi và tiến hành khảo sát sinh viên. Dữ liệu thu về được gọi là gì?
Dữ liệu thứ cấp (Secondary Data)
Dữ liệu chéo (Cross-sectional Data)
Dữ liệu sơ cấp (Primary Data)
Dữ liệu bảng (Panel Data)
Trong SPSS, tại sao cần phải xử lý giá trị ngoại lai (outlier) như điểm 99 của SV06 trước khi phân tích?
Những ví dụ nào sau đây thuộc về dữ liệu định lượng?
Ngành học của sinh viên.
Điểm trung bình tích lũy hệ 10.
Số sinh viên trong một lớp.
Mức độ hài lòng về giảng viên.
Trong bảng kết quả Descriptives, nếu Mean của 'Diem_TB' là 7.8 và Median là 8.2, ta có thể suy luận sơ bộ điều gì về hình dạng phân phối của điểm?
Phân phối gần như đối xứng hoàn hảo.
Phân phối bị lệch trái (Negative Skewness).
Phân phối bị lệch phải (Positive Skewness).
Dữ liệu có độ phân tán rất lớn.
Thước đo "Khoảng biến thiên" (Range) được mô tả là "người đơn giản nhất". Tại sao nó thường ít được sử dụng trong các phân tích sâu về độ phân tán của dữ liệu?
Vì nó chỉ có thể áp dụng cho dữ liệu định tính, không dùng được cho dữ liệu định lượng.
Vì nó chỉ dựa vào hai giá trị ở hai cực (lớn nhất và nhỏ nhất) và hoàn toàn bỏ qua sự phân bố của phần lớn dữ liệu ở giữa.
Vì nó rất khó tính toán bằng tay và đòi hỏi phải có phần mềm thống kê chuyên dụng như SPSS.
Vì giá trị của nó bị ảnh hưởng rất mạnh bởi giá trị trung vị (Median) của bộ dữ liệu.
Trong bảng 'Report' so sánh điểm trung bình giữa các khoa, chỉ số 'Std. Deviation' (Độ lệch chuẩn) cho biết điều gì?
Khoa có độ lệch chuẩn cao nhất là khoa có chất lượng đào tạo tốt nhất.
Mức độ đồng đều hay không đồng đều về kết quả học tập trong nội bộ của mỗi khoa
Điểm trung bình thực tế của mỗi khoa sau khi đã loại bỏ các giá trị ngoại lai
Sự khác biệt về điểm trung bình giữa các khoa có ý nghĩa thống kê hay không.
Trong bảng kết quả "Descriptive Statistics" của SPSS, có hai chỉ số là "Variance" (Phương sai) và "Std. Deviation" (Độ lệch chuẩn). Những mệnh đề nào sau đây là đúng về mối quan hệ và cách sử dụng của chúng?
Độ lệch chuẩn là căn bậc hai của Phương sai.
Độ lệch chuẩn thường được ưu tiên để diễn giải vì nó có cùng đơn vị đo với dữ liệu gốc, giúp việc hiểu về độ phân tán trở nên trực quan hơn.
Phương sai luôn có giá trị nhỏ hơn Độ lệch chuẩn, giúp việc tính toán trở nên dễ dàng hơn.
Cả hai chỉ số đều được dùng để đo lường mức độ đối xứng của phân phối dữ liệu.
