Font size
Worksheetschương 5 6 nctt
Total questions: 100
Worksheet time: 50mins
Mục tiêu chính của phân tích dữ liệu là gì?
Thu thập dữ liệu
Biến dữ liệu thô thành thông tin hữu ích
Xây dựng bảng câu hỏi
Lập kế hoạch marketing
Thống kê mô tả dùng để:
Xác định nguyên nhân
Tóm tắt và mô tả đặc điểm dữ liệu
Dự đoán tương lai
Kiểm nghiệm giả thuyết
Trung bình (mean) là:
Giá trị xuất hiện nhiều nhất
Giá trị ở giữa
Tổng các giá trị chia cho số lượng giá trị
Khoảng cách giữa giá trị lớn nhất và nhỏ nhất
Median (trung vị) là:
Giá trị lớn nhất
Giá trị trung bình cộng
Giá trị ở giữa khi các dữ liệu được sắp xếp
Giá trị xuất hiện nhiều nhất
Mode (mốt) là:
Giá trị trung bình
Giá trị trung vị
Giá trị xuất hiện nhiều nhất trong dữ liệu
Giá trị nhỏ nhất
Biến định lượng liên tục là:
Chỉ có vài giá trị rời rạc
Có thể nhận mọi giá trị trong một khoảng liên tục
Chỉ phân loại
Không đo lường được
Biến định lượng rời rạc là:
Chỉ nhận các giá trị riêng biệt, đếm được
Nhận mọi giá trị
Chỉ phân loại
Không đo lường được
Phương sai (variance) dùng để đo:
Trung bình dữ liệu
Mức độ phân tán của dữ liệu quanh trung bình
Trung vị
Mốt
Độ lệch chuẩn (standard deviation) là:
Trung bình cộng
Căn bậc hai của phương sai
Giá trị lớn nhất
Giá trị nhỏ nhất
Tần số tương đối (relative frequency) là:
Tỷ lệ phần trăm của mỗi giá trị trên tổng số
Số lần xuất hiện giá trị
Giá trị trung bình
Trung vị
Biểu đồ cột thích hợp cho:
Dữ liệu liên tục
So sánh tần số các nhóm rời rạc
Phân tích xu hướng
Dự đoán tương lai
Biểu đồ đường (line chart) dùng để:
Dữ liệu rời rạc
Theo dõi xu hướng dữ liệu theo thời gian
So sánh tần số
Tỷ lệ phần trăm
Hệ số tương quan Pearson r đo:
Sự khác biệt trung bình
Mối quan hệ tuyến tính giữa hai biến định lượng
Biến độc lập
Biến phụ thuộc
Nếu r = 0, điều đó nghĩa là:
Có mối quan hệ mạnh
Không có mối quan hệ tuyến tính
Mối quan hệ âm
Mối quan hệ dương
Hệ số xác định R² thể hiện điều gì?
Độ lệch chuẩn
Tỷ lệ biến thiên của biến phụ thuộc được giải thích bởi biến độc lập
Trung bình
Phương sai
Hồi quy tuyến tính đơn mô tả điều gì?
Một biến độc lập và một biến định tính
Mối quan hệ giữa một biến độc lập và một biến phụ thuộc
Nhiều biến độc lập
Không đo lường được
Khi phân tích nhiều biến, ta sử dụng phương pháp nào?
Hồi quy tuyến tính đơn
Hồi quy tuyến tính đa biến
Trung bình
Tần số
Kiểm định t-test dùng để làm gì?
Mô tả dữ liệu
So sánh trung bình của hai nhóm
Phân tích tần số
Xác định mode
Kiểm định ANOVA dùng để làm gì?
So sánh hai nhóm
So sánh trung bình của ba nhóm trở lên
Tính phương sai
Tính hệ số tương quan
Khi dữ liệu không phân phối chuẩn, nên dùng phương pháp kiểm định nào?
T-test chuẩn
Kiểm định phi tham số (non-parametric test)
Hồi quy
ANOVA chuẩn
Biến định tính thích hợp dùng phương pháp nào để phân tích?
Trung bình, phương sai
Tần số, tỷ lệ phần trăm
Hồi quy
Pearson r
Khi dữ liệu có ngoại lệ, nên dùng đại lượng nào để mô tả trung tâm?
Trung bình
Trung vị
Phương sai
Mode
Biểu đồ hình tròn (pie chart) dùng để làm gì?
Dữ liệu liên tục
Thể hiện tỷ lệ phần trăm các nhóm trong tổng thể
So sánh xu hướng
Phân tích phương sai
Phương pháp loại bỏ dữ liệu bất thường (outlier) giúp gì cho phân tích dữ liệu?
Tăng tần số
Kết quả phân tích ổn định hơn
Giảm mẫu
Tăng mode
Khi mẫu lớn, theo định lý trung tâm giới hạn, điều nào sau đây là đúng?
Trung bình mẫu gần với trung bình dân số
Phân phối mẫu gần với chuẩn
Không thể dự đoán
Tỷ lệ tăng
Khi hệ số tương quan r = 0.8, điều đó nghĩa là:
Mối quan hệ yếu
Mối quan hệ mạnh và dương
Không có quan hệ
Mối quan hệ âm
Kiểm định chi-square dùng để làm gì?
So sánh trung bình
Kiểm tra mối liên hệ giữa hai biến định tính
Tính phương sai
Hồi quy
Khi giá trị p < 0.05, điều đó nghĩa là:
Kết quả có ý nghĩa thống kê
Không ý nghĩa
Dữ liệu sai
Trung bình bằng 0
Hệ số tương quan âm nghĩa là:
Biến độc lập tăng, biến phụ thuộc tăng
Biến độc lập tăng, biến phụ thuộc giảm
Không quan hệ
Biến phụ thuộc không đổi
Khi muốn dự đoán biến phụ thuộc liên tục từ nhiều biến độc lập, phương pháp nào nên sử dụng?
Hồi quy đơn
Hồi quy đa biến
ANOVA
Chi-square
Hồi quy logistic dùng khi nào?
Biến phụ thuộc liên tục
Biến phụ thuộc nhị phân (0/1)
Biến độc lập định tính
Dữ liệu chuẩn
Trong phân tích dữ liệu, multicollinearity là gì?
Không có liên hệ giữa biến
Biến độc lập có mối quan hệ cao với nhau
Dữ liệu phân phối chuẩn
Hệ số tương quan = 0
Khi kiểm tra giả thuyết, giả thuyết không (H0) thường là gì?
Không có sự khác biệt hoặc mối quan hệ
Có sự khác biệt
Phương sai lớn
Trung bình = 100
Khi dữ liệu có phân phối chuẩn, nên dùng phương pháp nào?
Kiểm định phi tham số
Kiểm định t, ANOVA chuẩn
Hồi quy logistic
Mode
Scatter plot dùng để:
Biểu diễn tần số
Quan sát mối quan hệ giữa hai biến định lượng
Tỷ lệ phần trăm
Trung bình
Khi kiểm định t với hai mẫu độc lập, giả sử phương sai hai nhóm không bằng nhau, ta dùng:
T-test chuẩn
T-test Welch
ANOVA
Chi-square
Khi biến độc lập là định tính, biến phụ thuộc là định lượng, nên dùng:
Hồi quy tuyến tính
ANOVA
Chi-square
Hồi quy logistic
Khi dữ liệu bị missing values, cách xử lý hiệu quả là:
Bỏ dữ liệu mà không kiểm tra
Imputation hoặc loại bỏ có kiểm soát
Không quan tâm
Tăng mẫu
Trong phân tích dữ liệu, outlier có thể làm:
Giảm mode
Làm sai lệch trung bình và phương sai
Không ảnh hưởng gì
Tăng mẫu
Khi biến định lượng không phân phối chuẩn, nên sử dụng phương pháp nào?
Dùng t-test chuẩn
Dùng kiểm định phi tham số
Hồi quy đa biến
Mode
Correlation không chứng minh được điều gì?
Mối quan hệ tuyến tính
Nguyên nhân – kết quả
Mức độ quan hệ
Hướng quan hệ
Khi hệ số R² = 0.9, điều đó nghĩa là gì?
90% biến thiên biến phụ thuộc được giải thích bởi biến độc lập
10% được giải thích
Không có quan hệ
Kiểm định sai
Khi muốn xác định mức độ hài lòng khách hàng từ 1–5, loại biến là gì?
Định tính
Ordinal (thứ tự)
Ratio
Nominal
Khi phân tích dữ liệu survey, tỷ lệ phản hồi thấp gây ra điều gì?
Kết quả chuẩn
Sai lệch do mẫu không đại diện
Dễ phân tích
Mode thay đổi
Biểu đồ hộp (box plot) dùng để làm gì?
Tính trung bình
Nhìn thấy trung vị, tứ phân vị và outlier
So sánh tần số
Dự đoán
Khi dữ liệu lớn, kiểm định nào hiệu quả hơn?
Kiểm định phi tham số
Kiểm định tham số
Không kiểm định
Mode
Khi dữ liệu lệch phải (right-skewed), trung bình so với trung vị như thế nào?
Bằng nhau
Trung bình > trung vị
Trung bình < trung vị
Không xác định
Khi muốn dự đoán xác suất xảy ra sự kiện nhị phân từ nhiều biến, nên dùng phương pháp nào?
Hồi quy tuyến tính
Hồi quy logistic đa biến
ANOVA
Chi-square
Khi kết hợp nhiều nguồn dữ liệu khác nhau, cần làm gì?
Không kiểm tra
Đảm bảo tính tương thích và chuẩn hóa dữ liệu
Bỏ bớt dữ liệu
Chỉ dùng nguồn chính
Mục tiêu cuối cùng của phân tích dữ liệu thị trường là gì?
Thu thập dữ liệu
Hỗ trợ ra quyết định kinh doanh hiệu quả
Tăng chi phí nghiên cứu
Tìm mode
Mục đích của lấy mẫu là gì?
Thu thập toàn bộ dân số
Thu thập thông tin từ một phần đại diện để suy luận cho toàn bộ dân số
Giảm chất lượng dữ liệu
Thu thập dữ liệu sơ cấp
Mẫu xác suất (probability sampling) là:
Mẫu chọn theo ý muốn
Mỗi đối tượng trong dân số có xác suất được chọn biết trước và khác 0
Mẫu thuận tiện
Mẫu đánh giá chuyên gia
Mẫu phi xác suất (non-probability sampling) là:
Mẫu chọn theo thuận tiện, đánh giá chủ quan hoặc nhóm đặc thù
Mẫu ngẫu nhiên đơn
Mẫu hệ thống
Mẫu phân tầng
Lấy mẫu ngẫu nhiên đơn (simple random sampling) là gì?
Chọn theo thuận tiện
Mỗi đối tượng dân số có cơ hội bằng nhau được chọn
Chọn theo chuyên gia
Chọn theo nhóm đặc thù
Lấy mẫu hệ thống (systematic sampling) là gì?
Chọn ngẫu nhiên
Chọn theo khoảng cố định từ danh sách dân số
Chọn theo ý muốn
Chọn nhóm đặc thù
Lấy mẫu phân tầng (stratified sampling) là gì?
Chọn ngẫu nhiên toàn dân
Chia dân số thành các nhóm (strata) và lấy mẫu ngẫu nhiên từ từng nhóm
Chọn thuận tiện
Chọn theo nhóm đặc thù
Lấy mẫu cụm (cluster sampling) là gì?
Chọn từng cá thể ngẫu nhiên
Chọn ngẫu nhiên các nhóm (cluster) rồi khảo sát tất cả thành viên trong nhóm đó
Chọn thuận tiện
Chọn theo ý muốn
Khi nào nên dùng lấy mẫu phi xác suất?
Muốn kết quả chính xác tuyệt đối
Khi cần tiết kiệm thời gian và chi phí, không cần đại diện cho toàn dân số
Khi dân số nhỏ
Khi có đủ dữ liệu về toàn bộ dân số
Khung mẫu (sample frame) là gì?
Mẫu đã chọn
Danh sách các đơn vị dân số từ đó chọn mẫu
Bảng câu hỏi
Biến định lượng
Bias trong lấy mẫu là gì?
Sai lệch hệ thống khiến mẫu không đại diện dân số
Sai lệch ngẫu nhiên
Trung bình cộng
Mode
Non-response bias xảy ra khi nào?
Khi mọi người trả lời
Khi một số người không trả lời và khác biệt với người trả lời
Khi dùng bảng hỏi
Khi phân tích sai
Kích thước mẫu (sample size) ảnh hưởng đến yếu tố nào sau đây?
Chỉ phí và độ chính xác
Độ chính xác, khả năng khái quát hóa, và chi phí
Tần số
Trung bình
Sai số mẫu (sampling error) là:
Sai số đo lường
Sự khác biệt giữa đặc tính mẫu và dân số do chọn mẫu
Sai số phi mẫu
Mode
Sai số phi mẫu (non-sampling error) bao gồm yếu tố nào sau đây?
Sai số do lấy mẫu
Sai sót trong thu thập dữ liệu, phản hồi, nhập liệu
Trung bình
Phương sai
Phương pháp thu thập dữ liệu sơ cấp bao gồm hoạt động nào sau đây?
Báo cáo công ty
Khảo sát, phỏng vấn sâu, quan sát, thí nghiệm
Dữ liệu thống kê
Nghiên cứu trước
Phương pháp thu thập dữ liệu thứ cấp bao gồm hoạt động nào sau đây?
Khảo sát trực tiếp
Báo cáo nghiên cứu trước, số liệu thống kê công khai
Thí nghiệm tại hiện trường
Phỏng vấn sâu
Khi muốn khảo sát đại diện cho dân số lớn, nên chọn loại mẫu nào?
Mẫu thuận tiện
Mẫu xác suất, đặc biệt là phân tầng hoặc cụm
Mẫu phi xác suất
Mẫu ngẫu nhiên đơn nhỏ
Khi dân số nhỏ và dễ tiếp cận, có thể dùng phương pháp nào sau đây?
Mẫu phi xác suất
Toàn bộ dân số (census) hoặc mẫu nhỏ
Mẫu phân tầng
Mẫu cụm
Lấy mẫu thuận tiện là:
Chọn ngẫu nhiên
Chọn các đối tượng dễ tiếp cận nhất
Chọn theo chuyên gia
Chọn hệ thống
Quota sampling là:
Lấy mẫu ngẫu nhiên
Chọn mẫu theo tỷ lệ đặc trưng của dân số nhưng không ngẫu nhiên
Mẫu hệ thống
Mẫu toàn dân
Snowball sampling dùng khi:
Dân số dễ tiếp cận
Dân số khó tiếp cận hoặc đặc thù, người tham gia giới thiệu người khác
Mẫu ngẫu nhiên
Lấy mẫu phân tầng
Khi dùng bảng hỏi, điều quan trọng để giảm bias là:
Câu hỏi dài
Câu hỏi rõ ràng, trung lập, dễ hiểu
Dùng từ chuyên môn
Câu hỏi dẫn dắt
Khi dân số không đồng nhất, phương pháp lấy mẫu nào phù hợp?
Mẫu ngẫu nhiên đơn
Mẫu phân tầng
Mẫu thuận tiện
Mẫu hệ thống
Khi chi phí thu thập dữ liệu cao, nên làm gì?
Lấy toàn dân số
Lấy mẫu đại diện nhỏ hơn nhưng hợp lý
Mẫu phi xác suất vô tội vạ
Bỏ khảo sát
Khi khảo sát online, bias phổ biến là gì?
Sai số do lường
Người tham gia không đại diện toàn dân số (internet users)
Phương sai
Trung bình
Khi muốn so sánh nhiều nhóm theo đặc điểm, phương pháp lấy mẫu nào tốt nhất?
Mẫu thuận tiện
Mẫu phân tầng
Mẫu hệ thống
Mẫu phi xác suất
Khi muốn giảm chi phí di lại trong khảo sát toàn quốc, nên chọn phương pháp nào?
Lấy toàn dân số
Mẫu cụm (cluster sampling)
Mẫu phi xác suất
Mẫu ngẫu nhiên đơn
Khi tỷ lệ non-response cao, cách xử lý nào là phù hợp nhất?
Bỏ mẫu
Dùng trọng số (weighting) hoặc follow-up
Không quan tâm
Tăng mẫu phi xác suất
Khi dân số lớn, lấy mẫu quá nhỏ sẽ dẫn đến điều gì?
Tăng độ chính xác
Giảm độ chính xác
Không ảnh hưởng
Tăng chi phí
Khi muốn khảo sát ý kiến chuyên gia, nên dùng loại mẫu nào?
Mẫu ngẫu nhiên đơn
Mẫu đánh giá chuyên gia (judgmental sampling)
Mẫu phân tầng
Mẫu hệ thống
Nguy cơ lớn nhất khi dùng snowball sampling là gì?
Chi phí cao
Mẫu không độc lập, bias theo mối quan hệ
Dữ liệu chuẩn
Mẫu quá lớn
Câu hỏi mở trong bảng hỏi giúp đạt được điều gì?
Dễ phân tích
Thu thập ý kiến, cảm nhận chi tiết
Tính trung bình
Tỷ lệ phần trăm
Câu hỏi đóng trong bảng hỏi giúp đạt được điều gì?
Thu thập dữ liệu khó phân tích
Dữ liệu dễ định lượng và phân tích
Khó thống kê
Không chuẩn hóa
Khi cần khảo sát nhanh, chi phí thấp, dân số rộng, nên chọn loại mẫu nào?
Toàn bộ dân số
Mẫu xác suất hợp lý, có thể là cluster
Mẫu ngẫu nhiên đơn
Mẫu phân tầng
Khi dân số có nhiều đặc điểm khác nhau, nhưng muốn đại diện tỷ lệ, nên chọn phương pháp lấy mẫu nào?
Mẫu ngẫu nhiên đơn
Mẫu phân tầng theo tỷ lệ
Mẫu thuận tiện
Mẫu phi xác suất
Khi khảo sát qua điện thoại, bias thường gặp là gì?
Dữ liệu chính xác
Chỉ những người trả lời điện thoại mới tham gia
Chi phí thấp
Tỷ lệ cao
Khi muốn khảo sát một nhóm đặc thù hiếm, phương pháp tốt nhất là gì?
Mẫu ngẫu nhiên đơn
Snowball hoặc expert sampling
Mẫu phân tầng
Mẫu hệ thống
Khi dân số đồng nhất, phương pháp lấy mẫu nào hiệu quả nhất?
Mẫu phân tầng
Mẫu ngẫu nhiên đơn
Mẫu cụm
Snowball
Khi cần so sánh ý kiến nhóm theo giới tính, phương pháp nào tốt nhất?
Mẫu ngẫu nhiên đơn
Mẫu phân tầng theo giới tính
Mẫu cụm
Mẫu thuận tiện
Khi dữ liệu thu thập bị missing values, phương pháp nào sau đây không nên là:
Imputation
Bỏ qua tất cả dữ liệu còn lại mà không xử lý
Follow-up
Trọng số
Khi muốn giảm bias do non-response, nên:
Không follow-up
Theo dõi và khuyến khích phản hồi
Bỏ mẫu
Dùng mẫu phi xác suất
Khi muốn nghiên cứu nhóm đặc thù, dữ liệu khó tiếp cận, phương pháp nào phù hợp?
Mẫu ngẫu nhiên đơn
Snowball sampling
Mẫu phân tầng
Mẫu hệ thống
Khi muốn giảm chi phí và vẫn có đại diện, nên:
Lấy toàn bộ dân số
Mẫu cụm
Phi xác suất
Mẫu nhỏ không đại diện
Khi muốn khảo sát ý kiến khách hàng hiện tại, nên dùng:
Snowball
Mẫu thuận tiện hoặc quota
Mẫu ngẫu nhiên đơn
Mẫu phân tầng
Khi dân số quá lớn và chi phí hạn chế, không thể dùng toàn dân số, nên:
Bỏ khảo sát
Lấy mẫu đại diện xác suất
Lấy mẫu phi xác suất tùy tiện
Lấy toàn bộ dân số nhỏ
Khi thiết kế bảng hỏi, điều quan trọng để tăng tỷ lệ phản hồi là:
Câu hỏi dài
Câu hỏi ngắn gọn, rõ ràng, dễ trả lời
Câu hỏi phức tạp
Câu hỏi dẫn dắt
Khi dùng bảng hỏi online, bias thường là:
Không có bias
Người tham gia phải có internet và sẵn sàng trả lời online
Tất cả dân số đều trả lời
Không ảnh hưởng đến đại diện
Khi muốn lấy mẫu nhanh, chi phí thấp, nên dùng:
Toàn bộ dân số
Mẫu thuận tiện hoặc phi xác suất
Mẫu ngẫu nhiên lớn
Mẫu phân tầng
Khi muốn đại diện tất cả nhóm trong dân số, nên:
Mẫu ngẫu nhiên đơn
Mẫu phân tầng
Mẫu thuận tiện
Mẫu phi xác suất
Mục tiêu cuối cùng của thiết kế mẫu và lấy mẫu là:
Thu thập dữ liệu bất kỳ
Đảm bảo dữ liệu thu thập đại diện và đáng tin cậy để phân tích và ra quyết định
Giảm chi phí bất chấp chất lượng
Tăng số câu hỏi
