본문 바로가기
ML&AI

통계적 가설검정: t검정·z검정·카이제곱 검정

by 혜룐 2026. 9. 23.

데이터를 분석하다 보면 이런 질문을 만나게 된다.

  • 두 집단의 평균이 정말 다른가?
  • A/B 테스트에서 B안이 더 좋은가?
  • 결제수단과 주문 취소 여부는 관련이 있는가?
  • 데이터에서 보이는 차이가 실제 현상인가, 아니면 우연히 생긴 것인가?

이때 사용하는 방법이 통계적 가설검정이다.

1. 통계적 가설검정은 왜 하는가?

데이터에서 차이가 보인다고 해서 그 차이가 반드시 실제 차이라는 뜻은 아니다.

예를 들어 정상 주문의 평균 배송일이 3.18일이고, 취소 주문의 평균 배송일이 2.95일이라고 하자.

3.18−2.95=0.233.18-2.95=0.23

정상 주문의 배송일이 평균 0.23일 더 길다.

그러나 이 결과만 보고 다음과 같이 결론 내릴 수는 없다.

취소 주문은 항상 배송일이 더 짧다.

왜냐하면 우리가 분석한 것은 전체 주문이 아니라 일부 표본일 수 있기 때문이다. 표본을 다르게 뽑으면 평균 차이도 달라질 수 있다.

관측된 차이
= 실제 차이
+ 표본 추출에 따른 우연한 흔들림
 

통계적 가설검정은 다음을 확인한다.

관측된 차이가 단순한 표본의 흔들림으로도 나타날 수 있는 정도인가?

2. 귀무가설과 대립가설

검정을 시작할 때 두 가지 가설을 세운다.

귀무가설 H0

귀무가설은 기본적으로

차이·효과·관계가 없다고 가정하는 주장

이다.

예를 들어 평균 배송일을 비교하면: H0:μ1=μ2 이는 두 모집단의 평균 배송일이 같다는 뜻이다.

A/B 전환율을 비교하면: H0:pA=pB 두 안의 전환율이 같다는 뜻이다.

결제수단과 주문상태의 관계를 보면:

H0:결제수단과 주문상태는 서로 독립이다

두 변수가 서로 관련이 없다고 가정한다.

대립가설 H1

대립가설은 우리가 확인하고 싶은 차이나 관계이다.

H1:μ1≠μ2
H1:pA≠pB

또는 H1:결제수단과 주문상태는 서로 독립이 아니다

검정은 보통 다음과 같이 진행된다.

귀무가설이 참이라고 가정
→ 현재 데이터가 귀무가설과 얼마나 잘 맞는지 확인
→ 너무 맞지 않으면 귀무가설을 기각
 

3. 검정통계량은 무엇인가?

검정통계량은 관측된 차이나 관계를 하나의 숫자로 바꾼 값이다.

쉽게 말하면

관측된 차이가 표본의 흔들림에 비해 얼마나 큰가?

를 나타낸다.

평균이나 비율을 비교하는 검정에서는 기본 구조가 다음과 같다.

검정통계량=관측된 차이/표준오차

표준오차는 표본을 다시 뽑았을 때 결과가 얼마나 흔들릴지를 나타낸다.

예를 들어 t=2.75 라면 관측된 차이가 표준오차의 약 2.75배라는 뜻이다.

검정통계량이 클수록 일반적으로

관측된 차이가 크다
→ 귀무가설과 잘 맞지 않는다
→ p-value가 작아진다
 

고 이해할 수 있다.

4. t검정·z검정·카이제곱 검정은 언제 사용하는가?

검정 주로 확인 하는것 데이터 형태 예시
t검정 평균 차이 연속형 숫자 평균 배송일
z검정 비율 차이 전환·클릭 여부 A/B 전환율
카이제곱 검정 범주형 변수의 연관성 범주·빈도 결제수단과 취소 여부

가장 간단히 기억하면 다음과 같다.

평균을 비교한다 → t검정
비율을 비교한다 → z검정
범주와 범주의 관계를 본다 → 카이제곱 검정
 

5. p-value와 유의수준

p-value란 무엇인가

p-value는 귀무가설이 참이라고 가정했을 때, 현재 관측된 결과와 같거나 그보다 더 극단적인 결과가 나올 확률이다.

예를 들어 A/B 테스트에서 p-value가 0.00596이라면 다음과 같이 해석한다.

A안과 B안의 전환율이 실제로 같다고 가정할 때,
현재 관측된 전환율 차이만큼 크거나 더 큰 차이가
우연히 나타날 확률이 약 0.596%이다.
 

p-value가 작다는 것은 귀무가설을 가정했을 때 현재 결과가 매우 드물다는 의미이다.

유의수준이란 무엇인가

유의수준은 귀무가설을 기각할지 판단하기 위해 분석 전에 정하는 기준이다.

가장 일반적으로 사용하는 유의수준은 다음과 같다.

유의수준 α = 0.05
 

이는 귀무가설이 참이라고 하더라도, 우연히 나타난 결과를 어느 정도까지 허용할지 정하는 기준이다.

p-value와 유의수준 비교

p-value < 0.05
→ 귀무가설 기각
→ 통계적으로 유의한 차이 또는 관계가 있다고 판단

p-value >= 0.05
→ 귀무가설을 기각하지 못함
→ 통계적으로 유의한 차이 또는 관계가 있다고 판단할 충분한 증거가 부족함
 

예를 들어 A/B 테스트의 결과가 다음과 같다고 하자.

z 통계량 = 2.75
p-value = 0.00596
유의수준 = 0.05
 

두 값을 비교하면 다음과 같다.

0.00596 < 0.05
 

따라서 귀무가설을 기각한다.

반대로 t검정 결과가 다음과 같다면:

t 통계량 = 1.22
p-value = 0.224
유의수준 = 0.05
 

다음과 같이 비교한다.

0.224 > 0.05
 

따라서 귀무가설을 기각하지 못한다.

중요한 점은 검정통계량 자체를 유의수준과 비교하지 않는다는 것이다.

잘못된 비교:
t 통계량 1.22와 유의수준 0.05를 비교함

올바른 비교:
t 통계량으로 계산한 p-value 0.224와 유의수준 0.05를 비교함
 

6. t검정·z검정·카이제곱 검정의 차이

세 검정은 모두 데이터에서 관측된 차이나 관계가 우연히 발생한 것인지 판단하는 방법이다. 다만 분석하려는 데이터의 형태와 목적이 다르다.

구분t검정z검정카이제곱 검정
주요 목적 평균 차이 검정 비율 차이 검정 범주형 변수의 연관성 검정
데이터 형태 연속형 숫자 비율·전환 데이터 범주형·빈도 데이터
검정통계량 t z 카이제곱
대표 사례 평균 배송일 비교 A/B 전환율 비교 결제수단과 취소 여부 비교
기준 분포 t분포 표준정규분포 카이제곱분포
자유도 필요함 일반적으로 사용하지 않음 필요함

가장 간단히 정리하면 다음과 같다.

평균을 비교한다 → t검정
비율을 비교한다 → z검정
범주와 범주의 관계를 본다 → 카이제곱 검정
 

7. 세 검정의 계산 구조

t검정

t검정은 두 평균의 차이를 평균 차이의 표준오차로 나누어 검정통계량을 계산한다.

t 통계량
= 평균 차이 / 평균 차이의 표준오차
 

수식으로는 다음과 같다.

t = (x̄1 - x̄2) / SE
 

여기서:

x̄1, x̄2 = 두 집단의 표본평균
SE = 두 평균 차이의 표준오차
 

Welch t검정에서 표준오차는 다음과 같이 계산한다.

SE = sqrt( (s1² / n1) + (s2² / n2) )
 
s1, s2 = 각 집단의 표본 표준편차
n1, n2 = 각 집단의 표본 크기
 

z검정

z검정은 두 비율의 차이를 비율 차이의 표준오차로 나누어 검정통계량을 계산한다.

z 통계량
= 비율 차이 / 비율 차이의 표준오차
 

수식으로는 다음과 같다.

z = (p̂B - p̂A) / SE
 

두 비율을 비교할 때 표준오차는 다음과 같이 계산한다.

SE = sqrt( p̂(1 - p̂) × (1/nA + 1/nB) )
 

여기서 공동 전환율은 다음과 같이 계산한다.

p̂ = (xA + xB) / (nA + nB)
 
xA, xB = A안과 B안의 전환 건수
nA, nB = A안과 B안의 전체 표본 수
p̂A, p̂B = A안과 B안의 표본 전환율
 

카이제곱 검정

카이제곱 검정은 관측도수와 기대도수의 차이를 계산한다.

카이제곱 통계량
= 각 칸의 차이 계산 결과를 모두 더한 값
 

수식은 다음과 같다.

χ² = Σ (O - E)² / E
 
O = 실제 데이터에서 관측된 도수
E = 귀무가설이 참일 때 기대되는 도수
Σ = 교차표의 모든 칸에 대해 계산한 값을 더함
 

기대도수는 다음과 같이 계산한다.

기대도수
= 행 합계 × 열 합계 / 전체 합계
 

8. 현업에서 실제로 많이 사용하는가

t검정, z검정, 카이제곱 검정은 현업에서도 많이 사용하는 기본적인 통계 검정 방법이다.

예를 들어 A/B 테스트 시스템에서는 다음과 같은 결과를 자동으로 제공한다.

A안 전환율
B안 전환율
전환율 차이
검정통계량
p-value
신뢰구간
통계적 유의성 여부
 

 

어떤 검정을 사용해야 하는가

평균을 비교해야 하는데 카이제곱 검정을 사용하거나, 범주형 변수 간 관계를 확인하면서 t검정을 사용하는 실수를 막아야 한다.

배송일 평균 비교 → t검정
구매 전환율 비교 → z검정
결제수단과 취소 여부의 관계 → 카이제곱 검정
 

결과를 어떻게 해석해야 하는가

p-value가 작다고 해서 항상 실무적으로 중요한 결과라는 뜻은 아니다. 표본이 매우 크면 아주 작은 차이도 통계적으로 유의하게 나타날 수 있다.

예를 들어 다음과 같은 결과가 있다고 하자.

A안 전환율 = 10.00%
B안 전환율 = 10.05%
p-value = 0.001
 

이 결과는 통계적으로 유의할 수 있다. 그러나 실제 전환율 차이는 0.05%p에 불과하므로 비즈니스 관점에서 의미가 작은 결과일 수도 있다.

따라서 현업에서는 p-value만 보지 않고 다음 항목을 함께 확인한다.

실제 차이의 크기
효과 크기
신뢰구간
표본 크기
데이터 품질
실험 기간
운영 비용
예상되는 비즈니스 효과
 

9. 통계적 유의성과 중요성

통계적 유의성은 다음을 의미한다.

관측된 차이가 단순한 우연으로 발생했다고 보기 어렵다.

그러나 이것이 곧 실무적으로 중요한 차이라는 뜻은 아니다.

예를 들어:

통계적으로 유의함
≠ 반드시 비즈니스적으로 중요함
 

반대로 p-value가 0.05보다 크다고 해서 차이가 완전히 없다는 뜻도 아니다.

정확한 해석은 다음과 같다.

p-value가 작음
→ 차이가 없다는 귀무가설과 데이터가 잘 맞지 않음

p-value가 큼
→ 차이가 없다는 귀무가설을 기각할 충분한 증거가 부족함
 

따라서 분석 결과를 해석할 때는 통계적 판단과 함께 실제 차이의 크기와 비즈니스 의미를 확인해야 한다.

10. 그래서

통계적 가설검정은 데이터에서 보이는 차이나 관계가 실제 현상인지, 표본 추출 과정에서 생긴 우연한 흔들림인지 판단하기 위한 방법이다.

전체 흐름은 다음과 같다.

1. 분석 질문을 정함
2. 귀무가설과 대립가설을 설정함
3. 데이터 형태에 맞는 검정을 선택함
4. 검정통계량을 계산함
5. 기준 분포에서 p-value를 계산함
6. p-value와 유의수준을 비교함
7. 결과를 통계적 의미와 실무적 의미로 나누어 해석함
 

검정 선택 기준은 다음과 같다.

평균 차이 → t검정
비율 차이 → z검정
범주형 변수 간 연관성 → 카이제곱 검정
 

결과 해석은 다음과 같다.

p-value < 0.05
→ 귀무가설 기각
→ 통계적으로 유의한 차이 또는 관계가 있다고 판단함

p-value >= 0.05
→ 귀무가설을 기각하지 못함
→ 차이 또는 관계가 있다고 판단할 충분한 증거가 부족함
 

현업에서는 도구가 검정통계량과 p-value를 계산해주지만, 어떤 검정을 선택하고 결과가 실제로 의미 있는지 판단하는 것은 분석가의 역할이다.

 
반응형