CCalculate.Studio
education · 7 min · Cập nhật lần cuối: 2026-07-07

Khoảng tin cậy là gì? Giải thích bằng ngôn ngữ đời thường

TL;DRKhoảng tin cậy là một dải giá trị được tính từ dữ liệu mẫu, dựng bằng một phương pháp được thiết kế sao cho chứa giá trị thật của tổng thể với một tỷ lệ phần trăm nhất định qua các lần lấy mẫu lặp lại -- phổ biến nhất là 95%. Một cách hiểu sai thường gặp là coi khoảng tin cậy 95% nghĩa là có xác suất 95% giá trị thật nằm trong một khoảng cụ thể đã tính ra; con số 95% thực ra mô tả mức độ đáng tin cậy của phương pháp qua nhiều mẫu lặp lại giả định. Với một mẫu có trung bình 50, độ lệch chuẩn 8 và n = 100, khoảng tin cậy 95% cho trung bình tổng thể là 48,432 đến 51,568, dựng từ sai số biên 1,568 quanh trung bình mẫu.

Khoảng tin cậy là gì

Khoảng tin cậy là một dải các giá trị hợp lý cho một tham số tổng thể chưa biết -- thường là trung bình hoặc tỷ lệ của tổng thể -- được tính từ một mẫu dữ liệu. Nó được dựng quanh một ước lượng điểm, chẳng hạn trung bình mẫu, và mở rộng ra hai phía một khoảng bằng sai số biên, sao cho toàn bộ khoảng được thiết kế để bắt được giá trị thật nhưng chưa biết của tổng thể với một tỷ lệ phần trăm xác định, nếu cùng quy trình lấy mẫu và tính toán ấy được lặp lại nhiều lần.

Tỷ lệ phần trăm được chọn, gọi là mức tin cậy, phổ biến nhất là 90%, 95% hoặc 99%. Khoảng rộng hơn cho ta nhiều tin cậy hơn rằng nó bắt được giá trị thật, nhưng đánh đổi bằng độ chính xác; khoảng hẹp hơn thì chính xác hơn nhưng đi kèm mức tin cậy thấp hơn, hoặc đòi hỏi mẫu lớn hơn để giữ nguyên mức tin cậy. Sự đánh đổi giữa độ chính xác và mức tin cậy này là không thể tránh và là điều then chốt để diễn giải đúng bất kỳ khoảng tin cậy nào được công bố.

Cách hiểu sai thường gặp về «mức tin cậy 95%»

Một cách hiểu sai phổ biến và đã được ghi nhận rõ là đọc khoảng tin cậy 95% như thể có xác suất 95% giá trị thật của tổng thể nằm trong một khoảng cụ thể đã tính ra. Cách hiểu này về mặt kỹ thuật là không đúng: một khi một khoảng cụ thể đã được tính từ một mẫu cụ thể, giá trị thật của tổng thể hoặc nằm trong đó hoặc không -- không còn yếu tố ngẫu nhiên nào để gắn một xác suất vào khoảng đơn lẻ đó. Con số 95% mô tả tỷ lệ thành công về lâu dài của phương pháp dùng để dựng khoảng, qua nhiều mẫu lặp lại giả định, chứ không phải một phát biểu xác suất về một khoảng cụ thể sau khi đã tính xong.

Hoekstra và cộng sự (2014), công bố trên Psychonomic Bulletin and Review, đã ghi nhận rằng sự phân biệt này bị hiểu nhầm rộng rãi, kể cả trong giới nghiên cứu và sinh viên thống kê, nhiều người trong số đó diễn giải khoảng tin cậy 95% như thể nó trực tiếp mô tả xác suất giá trị thật rơi vào chính khoảng đó. Cách diễn giải đúng về mặt kỹ thuật nói về độ tin cậy của phương pháp qua các lần lấy mẫu lặp lại, chứ không phải một phát biểu xác suất về một kết quả đã quan sát được.

Sai số biên: viên gạch xây nên khoảng tin cậy

Sai số biên là khoảng cách mà khoảng tin cậy mở rộng ra mỗi phía của ước lượng điểm, và nó được tính bằng một giá trị tới hạn (z, với khoảng dựa trên phân phối chuẩn) nhân với sai số chuẩn của ước lượng. Với một trung bình, sai số chuẩn là độ lệch chuẩn chia cho căn bậc hai của cỡ mẫu: sai số chuẩn = độ lệch chuẩn / sqrt(n). Mẫu lớn hơn làm sai số chuẩn nhỏ đi, và do đó cả sai số biên lẫn bề rộng chung của khoảng cũng nhỏ đi, theo tỷ lệ với căn bậc hai của n.

Giá trị tới hạn z phụ thuộc vào mức tin cậy được chọn: 1,6449 cho mức 90%, 1,96 cho mức 95%, và 2,5758 cho mức 99%, mỗi giá trị đại diện cho điểm trên phân phối chuẩn tắc để lại đúng tổng xác suất tương ứng ở hai đuôi. Mức tin cậy cao hơn đòi hỏi giá trị tới hạn lớn hơn, làm sai số biên rộng ra và do đó khoảng kết quả cũng rộng ra, khi mọi thứ khác giữ nguyên.

Ví dụ: dựng khoảng tin cậy 95% cho một trung bình

Giả sử một mẫu gồm n = 100 quan sát có trung bình 50 và độ lệch chuẩn 8, và ta cần khoảng tin cậy 95% cho trung bình tổng thể. Bước 1: tính sai số chuẩn, 8 / sqrt(100) = 8 / 10 = 0,8. Bước 2: tính sai số biên bằng giá trị tới hạn của mức 95%, 1,96 x 0,8 = 1,568. Bước 3: cộng và trừ sai số biên với trung bình mẫu: 50 - 1,568 = 48,432, và 50 + 1,568 = 51,568.

Khoảng tin cậy 95% thu được là 48,432 đến 51,568. Cách diễn giải đúng là: nếu cùng quy trình lấy mẫu và tính toán này được lặp lại nhiều lần trên các mẫu mới gồm 100 quan sát từ cùng tổng thể, thì khoảng 95% số khoảng dựng theo cách này sẽ chứa trung bình thật của tổng thể -- chứ không phải là có xác suất 95% trung bình thật nằm cụ thể giữa 48,432 và 51,568 trong lần tính duy nhất này.

Mức tin cậy và cỡ mẫu làm thay đổi khoảng ra sao

Giữ nguyên mẫu (trung bình 50, độ lệch chuẩn 8, n = 100), bảng dưới đây cho thấy cùng một bộ dữ liệu nền sinh ra các bề rộng khoảng khác nhau chỉ tùy theo mức tin cậy được chọn. Mức tin cậy cao hơn luôn làm khoảng rộng ra, vì một phương pháp đáng tin cậy hơn (thành công thường xuyên hơn qua các mẫu lặp lại) theo bản chất phải bao phủ một dải giá trị hợp lý rộng hơn.

Mức tin cậyGiá trị tới hạn zSai số biênKhoảng thu được
90%1,64491,31648,684 đến 51,316
95%1,961,56848,432 đến 51,568
99%2,57582,06147,939 đến 52,061

Câu hỏi thường gặp

Khoảng tin cậy 95% thực sự có nghĩa là gì?

Nó có nghĩa là nếu cùng quy trình lấy mẫu và tính toán được lặp lại nhiều lần, thì khoảng 95% số khoảng thu được sẽ chứa giá trị thật của tổng thể. Nó không có nghĩa là có xác suất 95% giá trị thật nằm trong một khoảng cụ thể đã tính ra -- một sự phân biệt được Hoekstra và cộng sự (2014) trên Psychonomic Bulletin and Review ghi nhận là bị hiểu nhầm rất rộng rãi.

Tính khoảng tin cậy 95% cho một trung bình như thế nào?

Tính sai số chuẩn (độ lệch chuẩn chia cho căn bậc hai của cỡ mẫu), nhân với giá trị tới hạn 1,96 của mức 95% để ra sai số biên, rồi cộng và trừ sai số biên đó với trung bình mẫu. Với một mẫu có trung bình 50, độ lệch chuẩn 8 và n = 100: sai số chuẩn = 0,8, sai số biên = 1,568, và khoảng là 48,432 đến 51,568.

Sai số biên là gì?

Sai số biên là lượng được cộng vào và trừ đi từ một ước lượng điểm, chẳng hạn trung bình mẫu, để tạo thành khoảng tin cậy. Nó được tính bằng một giá trị tới hạn (phụ thuộc vào mức tin cậy được chọn) nhân với sai số chuẩn của ước lượng. Sai số biên lớn hơn tạo ra khoảng rộng hơn, kém chính xác hơn; sai số biên nhỏ hơn tạo ra khoảng hẹp hơn, chính xác hơn.

Vì sao nói có xác suất 95% giá trị thật nằm trong khoảng này là sai?

Vì một khi một khoảng cụ thể đã được tính từ một mẫu cụ thể, giá trị thật của tổng thể hoặc nằm trong đó hoặc không -- không còn yếu tố ngẫu nhiên nào để gán xác suất. Con số 95% là một tính chất của phương pháp dùng để dựng khoảng, mô tả tần suất phương pháp đó thành công qua nhiều mẫu lặp lại giả định, chứ không phải một phát biểu xác suất về một khoảng đơn lẻ sau khi đã tính xong.

Cỡ mẫu lớn hơn có làm khoảng tin cậy hẹp lại không?

Có. Sai số chuẩn, và do đó cả sai số biên lẫn bề rộng chung của khoảng, được tính bằng cách chia độ lệch chuẩn cho căn bậc hai của cỡ mẫu. Vì cỡ mẫu nằm dưới dấu căn bậc hai, tăng cỡ mẫu lên gấp bốn lần sẽ làm bề rộng khoảng giảm một nửa, trong khi mẫu nhỏ hơn cho khoảng rộng hơn và kém chính xác hơn tương ứng ở cùng mức tin cậy.

Vì sao mức tin cậy cao hơn lại cho khoảng rộng hơn?

Mức tin cậy cao hơn, chẳng hạn 99% thay vì 95%, đòi hỏi giá trị tới hạn lớn hơn (2,5758 so với 1,96), làm tăng sai số biên và mở rộng khoảng thu được. Điều này phản ánh một đánh đổi không thể tránh: một phương pháp cần thành công thường xuyên hơn qua các mẫu lặp lại thì phải bao phủ một dải giá trị hợp lý rộng hơn để làm được điều đó.

Tài liệu tham khảo

  1. National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 7.1: Confidence intervals. nist.gov.
  2. Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (confidence intervals for a mean; z vs t procedures).
  3. Hoekstra R, Morey RD, Rouder JN, Wagenmakers EJ. "Robust misinterpretation of confidence intervals." Psychonomic Bulletin and Review, 2014;21(5):1157-1164.

Máy tính liên quan

🧩 Thêm công cụ tính vào trang web của bạn — miễn phí. Widgets →