WorksheetsQuiz về Dữ liệu và Nghiên cứu
Total questions: 65
Worksheet time: 33mins
Dữ liệu sơ cấp là:
Dữ liệu đã được thu thập trước bởi tổ chức/cá nhân khác
Dữ liệu thu thập trực tiếp phục vụ nghiên cứu hiện tại
Dữ liệu lấy từ sách báo, internet
Dữ liệu có sẵn trên các cơ sở dữ liệu
Ưu điểm lớn nhất của dữ liệu thứ cấp là:
Tốn thời gian và chi phí
Có sẵn, tiết kiệm thời gian và chi phí
Luôn chính xác hơn dữ liệu sơ cấp
Thu thập khó khăn
Ví dụ nào sau đây phù hợp dùng dữ liệu thứ cấp?
Khảo sát cảm nhận của SV về dịch vụ ngân hàng
Phân tích tác động GDP đến phát thải CO₂ của các nước
Khảo sát hành vi chi tiêu trên app mua sắm của giới trẻ
Điều tra mức độ hài lòng của khách hàng với ShopeeFood
Nguồn dữ liệu thuộc vĩ mô quốc tế:
FiinPro
Vietstock
World Bank WDI
S&P Global
Dữ liệu bảng (Panel data) là:
Chỉ theo thời gian
Chỉ theo nhiều đơn vị tại 1 thời điểm
Theo nhiều đơn vị trong nhiều thời điểm
Dữ liệu được mô tả bằng bảng biểu
Để lấy dữ liệu lãi suất điều hành của Việt Nam theo tháng, nên dùng:
WDI
IMF – IFS
FRED
Vietstock
Yếu tố không thuộc quy trình thu thập dữ liệu từ WDI:
Chọn Country, Series, Time
Chọn Orientation: Country – Time – Series
Chọn tần suất monthly
Tải file Excel
Khi thu thập dữ liệu trên FRED, cần:
Tạo tài khoản trả phí
Điều chỉnh mốc thời gian và tần suất
Chỉ được tải theo năm
Không thể tải Excel
Phỏng vấn chuyên sâu phù hợp khi:
Cần mẫu lớn để suy rộng thống kê
Muốn hiểu rõ cảm xúc, suy nghĩ, hành vi
Thu thập dữ liệu nhanh số lượng lớn
Đánh giá mức độ đồng ý qua thang đo
Số người phù hợp cho một focus group:
2–3 người
4–5 người
6–8 người
12–15 người
Bảng hỏi nên dùng khi:
Cần thông tin phức tạp, nhạy cảm
Đối tượng khó trả lời
Cần thu thập từ nhiều người trong thời gian ngắn
Cần đào sâu cảm xúc người tham gia
Câu hỏi dạng Likert (đồng ý – không đồng ý) là:
Câu hỏi mở
Câu hỏi định lượng
Câu hỏi chấm điểm/đánh giá
Câu hỏi nhị phân
Nguyên tắc validity (giá trị chuẩn) yêu cầu:
Câu hỏi phải dễ hiểu
Đo lường đúng khái niệm cần nghiên cứu
Ngắn gọn, tránh gây nhàm chán
Không trùng lặp thông tin
Điều không nên làm khi đặt câu hỏi:
Tránh câu hỏi dẫn dắt
Tránh câu phủ định kép
Dùng thuật ngữ chuyên môn khó để thể hiện kiến thức
Tránh hỏi nhiều ý trong 1 câu
Trong file Excel nhập liệu khảo sát, mỗi dòng tương ứng với:
Một biến
Một câu hỏi
Một đối tượng quan sát
Một nhóm biến
Chọn mẫu thuận tiện thuộc loại:
Probability sampling
Non-probability sampling
Stratified sampling
Systematic sampling
Chọn mẫu theo tỷ lệ từng nhóm trong dân số là:
Snowball
Quota
Convenient
Random
Chọn mẫu phân tầng là:
Lấy bất kỳ ai thuận tiện
Người trả lời giới thiệu người khác
Chia tổng thể thành nhóm rồi chọn ngẫu nhiên trong từng nhóm
Chọn toàn bộ nhân viên tại vài chi nhánh
Nghiên cứu “Ý định học Thạc sĩ ở nước ngoài của sinh viên HVNH” nên ưu tiên:
Dữ liệu WDI
Phỏng vấn chuyên sâu + bảng hỏi
BCTC trên Vietstock
Dữ liệu FRED
Một đề cương nghiên cứu tốt cần đảm bảo:
Gắn chặt với mục tiêu, cấu trúc rõ, logic và khả thi
Có thật nhiều câu hỏi nghiên cứu mở
Không cần liên kết giữa lý thuyết và thực nghiệm
Càng ngắn càng tốt
Phân tích định lượng giúp trả lời chủ yếu cho câu hỏi:
Tại sao?
Như thế nào?
Bao nhiêu?
Ở đâu?
Phân tích định lượng là quá trình:
Thu thập dữ liệu định tính và mô tả bằng văn bản
Đo lường và kiểm tra mối quan hệ giữa các biến bằng thống kê
Phỏng vấn để thu thập ý kiến chuyên gia
Không liên quan đến dữ liệu
Ví dụ sau thuộc phân tích định lượng:
“Sinh viên chăm học sẽ có điểm cao”
“Một giờ tự học thêm mỗi ngày làm tăng GPA trung bình 0.2 điểm”
“Sinh viên nghĩ rằng tự học rất quan trọng”
“Sinh viên nên học nhóm để đạt kết quả tốt”
Bước đầu tiên trong quy trình phân tích định lượng là:
Xử lý dữ liệu bằng phần mềm
Vẽ biểu đồ
Xác định mục tiêu phân tích
Sàng lọc dữ liệu
Dữ liệu chéo (cross-sectional data) là dữ liệu:
Theo nhiều đối tượng qua nhiều thời điểm
Theo một đối tượng trong nhiều thời điểm
Theo nhiều đối tượng tại một thời điểm
Không có yếu tố thời gian
Dữ liệu chuỗi thời gian (time-series data) được hiểu là:
Dữ liệu của nhiều quốc gia trong nhiều năm
Dữ liệu của một đối tượng qua nhiều thời điểm
Dữ liệu khảo sát của sinh viên cùng thời điểm
Dữ liệu kết hợp chéo và thời gian
Dữ liệu bảng (panel data) là:
Dữ liệu của 1 đối tượng tại 1 thời điểm
Sự kết hợp giữa dữ liệu chéo và chuỗi thời gian
Dữ liệu định tính
Không dùng cho phân tích hồi quy
Mean dùng để đo:
Độ phân tán
Xu thế trung tâm
Mối quan hệ giữa các biến
Mức độ lệch của phân phối
Hệ số biến thiên (CV) được tính bằng công thức:
Variance / Mean
Std.dev / Mean
Mean / Variance
(Xmax – Xmin)
Histogram dùng để:
Thể hiện mối quan hệ giữa hai biến
Mô tả phân phối của dữ liệu
So sánh hai nhóm dữ liệu
Thể hiện tỷ lệ phần trăm
Đồ thị phân tán (scatter plot) cho biết:
Phân phối lệch hay đối xứng
Số lượng mẫu
Xu hướng quan hệ giữa hai biến
Trung bình và trung vị
Hệ số tương quan r có giá trị nằm trong khoảng:
(-∞; +∞)
(0; 1)
(-10; 10)
(-1; 1)
Khi r gần 1, ta kết luận:
Hai biến không liên quan
Quan hệ tuyến tính thuận chặt
Quan hệ tuyến tính nghịch chặt
Quan hệ phi tuyến
Hồi quy đơn là mô hình:
Có 1 biến phụ thuộc và 1 biến độc lập
Có nhiều biến phụ thuộc
Có nhiều biến độc lập
Không có biến độc lập
Trong mô hình hồi quy đơn: Y = β0 + β1X + ε, β1 thể hiện:
Giá trị của Y khi X = 0
Sai số của mô hình
Mức thay đổi của Y khi X tăng 1 đơn vị
Hệ số tương quan
Trong hồi quy, ε (sai số) thể hiện:
Phần giải thích được bởi X
Các yếu tố khác ngoài X ảnh hưởng đến Y
Hệ số góc của X
Biến độc lập khác
Hồi quy bội khác hồi quy đơn ở điểm:
Không có biến phụ thuộc
Có từ 2 biến độc lập trở lên
Không dùng phương pháp OLS
Không dùng được để dự báo
Trong mô hình: Wage = 0.032 + 0.56edu + 0.02exp + 0.03*gender, biến gender là:
Biến phụ thuộc
Biến định lượng
Biến giả (dummy)
Biến nhiễu
Để lựa chọn biến đưa vào mô hình hồi quy bội, cần dựa vào:
Ý thích của người nghiên cứu
Các nghiên cứu trước và tính sẵn có của dữ liệu
Cảm nhận cá nhân
Dữ liệu dễ thu thập nhất
OLS chỉ áp dụng khi:
Các giả định của phương pháp được thỏa mãn
Mẫu rất lớn
Dữ liệu chỉ có 1 biến
Không có sai số
Thống kê mô tả dùng để:
Khám phá mối quan hệ giữa các biến
Đo lường độ tin cậy và tính nhất quán của thang đo
Tóm tắt và mô tả đặc điểm cơ bản của dữ liệu
Dự báo giá trị tương lai của biến
Biến tiềm ẩn (latent variable) là:
Biến đo lường trực tiếp bằng một câu hỏi
Biến không thể quan sát trực tiếp, được suy luận từ nhiều biến quan sát
Biến là số lượng cụ thể
Biến không có ý nghĩa với nghiên cứu
Cronbach’s Alpha dùng để đo:
Độ phù hợp mô hình
Mức độ tin cậy (nhất quán nội bộ) của thang đo
Độ lệch chuẩn của dữ liệu
Hệ số tương quan giữa biến phụ thuộc và độc lập
Cronbach’s Alpha có giá trị từ:
-1 đến 1
0 đến 10
0 đến 1
1 đến 100
Theo chuẩn Nunnally & Bernstein (1994), giá trị Cronbach’s Alpha chấp nhận được là:
> 0.3
> 0.5
0.7 – 0.95
> 0.98
Trong phân tích Cronbach’s Alpha, một câu hỏi nên bị loại bỏ khi:
Corrected item-total correlation thấp (gần 0)
Cronbach’s Alpha cao
Số câu hỏi nhiều
Mean của câu hỏi nhỏ
“Cronbach’s Alpha if item deleted” cho biết:
Số biến tiềm ẩn sẽ thay đổi bao nhiêu
Alpha sẽ bằng bao nhiêu nếu loại bỏ từng câu hỏi
Hệ số tương quan giữa hai biến
Kết quả hồi quy
Mục đích chính của EFA là:
Dự báo biến phụ thuộc
Khám phá cấu trúc tiềm ẩn giữa các biến
Kiểm định hồi quy bội
Kiểm tra phân phối dữ liệu
Điều kiện tối thiểu về kích thước mẫu khi làm EFA là:
N > 30
N > 100
N > 5 quan sát cho mỗi biến
N > 10 quan sát cho mỗi biến
Giá trị KMO dùng để đánh giá:
Độ tin cậy thang đo
Mức độ phù hợp của dữ liệu với EFA
Mối quan hệ giữa biến độc lập và phụ thuộc
Giá trị trung bình của dữ liệu
Giá trị KMO được xem là “rất tốt” khi:
> 0.3
> 0.5
> 0.7
> 0.8
Kiểm định Bartlett’s Test dùng để kiểm tra:
Tính nhất quán của dữ liệu
Dữ liệu có tương quan với nhau hay không đủ để làm EFA
Dữ liệu có phân phối chuẩn hay không
Số nhân tố phù hợp
Factor Loading tối thiểu được chấp nhận thường là:
0.1
0.3
0.5
0.8
Rotation (xoay nhân tố) trong EFA nhằm:
Giảm số biến
Làm rõ cấu trúc nhân tố
Loại bỏ đa cộng tuyến
Kiểm định ý nghĩa thống kê
Mục đích chính của phân tích hồi quy trong 5B là:
Kiểm tra tính phân phối chuẩn
Đánh giá tác động của các biến độc lập lên biến phụ thuộc
Tăng cỡ mẫu nghiên cứu
Gom nhóm biến
Đa cộng tuyến là hiện tượng:
Các biến độc lập không liên quan đến nhau
Các biến độc lập tương quan mạnh với nhau
Biến độc lập tương quan yếu với phụ thuộc
Mô hình không phù hợp
Sau EFA, bước tiếp theo trước hồi quy thường là:
Cronbach’s Alpha
Mô tả dữ liệu
Tạo biến tổng hợp cho từng nhân tố
Thu thập thêm mẫu
Phân tích định tính tập trung vào:
Các con số và kiểm định thống kê
Khám phá ý nghĩa, bản chất hiện tượng qua dữ liệu phi số
Dự báo bằng mô hình
Tính toán dữ liệu từ khảo sát
Khác với định lượng, thu thập và phân tích dữ liệu định tính diễn ra:
Tuần tự, tách biệt
Cố định ngay từ đầu
Song song, lặp lại đến khi đạt mức bão hòa
Không cần ghi chú
Công cụ thu thập dữ liệu định tính gồm:
Bảng hỏi online và thống kê mô tả
Thảo luận nhóm, phỏng vấn sâu, quan sát
SPSS và Excel
Chỉ bảng hỏi Likert
Mục tiêu của chọn mẫu trong nghiên cứu định tính là:
Đảm bảo tính đại diện thống kê
Càng nhiều càng tốt
Thể hiện được đặc điểm của đám đông (đa dạng góc nhìn)
Ngẫu nhiên hoàn toàn
“Điểm bão hòa” trong định tính là khi:
Không đủ dữ liệu để phân tích
Không còn thông tin mới xuất hiện từ dữ liệu
Người tham gia từ chối trả lời
Dữ liệu bị trùng lặp
Câu hỏi “Anh/chị có thể nói thêm về điều đó?” thuộc loại:
Câu giới thiệu
Câu đào sâu (probing)
Câu trực tiếp
Câu diễn giải
“Vì sao nhân viên ở đây thường nghỉ việc?” thuộc loại câu hỏi:
Giới thiệu
Đào sâu
Gián tiếp
. Diễn giải
Kết nối dữ liệu trong định tính nhằm:
Gom nhóm dữ liệu để bỏ bớt phần thừa
Kết nối hiện tượng để giải thích và dự báo hiện tượng khoa học
Tính toán giá trị trung bình
Xác định số nhân tố
