PE Notes · SW
A/B 테스팅
대조군·실험군의 가설 검정과 표본·유의수준을 정리하고, 피처 플래그 연계와 피킹·신기 효과·SRM 오류, 다변량 실험과의 차이를 비교합니다.
버튼 색을 직감으로 바꾸면 매출이 올랐는지 모릅니다. 은 두 변형을 실제 사용자에게 무작위로 보여 주고, 목표 지표 차이가 우연이 아닌지 통계로 가릅니다. 제품 실험의 기본 단위입니다.
정의와 통계 원리
A는 통제, B는 한 변수만 바꾼 실험입니다. 적용은 UI, 가격, 카피, 추천 알고리즘입니다. 목적은 가정 검증이지 배포 속도가 아닙니다.
귀무가설 H₀는 “A와 B 차이가 없다”, 대립은 “B가 낫다”입니다. 관례 유의수준 α=0.05, p값이 그보다 작으면 H₀를 기각합니다. 검정력(흔히 80%)에 맞는 표본이 필요합니다. 적은 표본으로 승자를 정하면 1종 오류가 큽니다.
은 버튼·색·문구를 동시에 조합합니다. 트래픽과 시간이 많이 듭니다. A/B는 변수 하나, 결론이 빠릅니다.
| 비교축 | A/B | MVT |
|---|---|---|
| 변수 | 하나 | 여러 조합 |
| 트래픽 | 적음 | 많음 |
| 해석 | 원인 명확 | 교호작용 |
| 속도 | 빠름 | 느림 |
고정 50:50과 달리, 성과가 나오는 팔에 트래픽을 붙이는 것이 멀티암드 밴딧입니다. 손실은 줄고 해석은 덜 깔끔합니다.
수행 절차와 피처 플래그
순서는 가설(전환율·클릭 등 North Star) → 단일 변수 변형 → 무작위 분배 → 요일·계절을 덮을 기간 → 유의성 확인 → 전체 적용 또는 기각입니다. 쿠키·ID로 한 사용자를 한 변형에 고정합니다.
중간에 그래프가 좋아 보여 끊으면 안 됩니다. 조기 종료는 거짓 양성을 올립니다.
는 런타임 ON/OFF입니다. 배포≠출시입니다. 플래그로 B만 일부 사용자에게 켜면 재배포 없이 실험합니다. 실험 플랫폼이 플래그와 통계를 같이 제공합니다.
오류 유형과 실험 문화
은 표본이 차기 전 중간 확인으로 승자를 선언하는 일입니다. 는 새 UI에 잠깐 반응이 오른 뒤 사라집니다. 기간을 늘려 가립니다. 은 A:B 비율이 설계와 다를 때입니다. 버그·편향 샘플링을 의심하고 결과를 버립니다.
문화는 HPPO(가장 높은 직급의 의견)를 실험으로 대체하고, 가설→측정→학습을 반복합니다. 다중 지표를 동시에 보면 보정이 필요합니다. 품질관리의 가설·측정과 같은 뼈대입니다.
답안은 절차 여섯 칸, α와 검정력, A/B≠MVT, 플래그, 피킹·SRM 세 오류를 한 장에 올립니다.