PE Notes · 확률통계
등분산성과 다중공선성
잔차 분산이 예측값 수준마다 일정한 등분산성과, 설명변수끼리 강하게 겹치는 다중공선성을 가르고, OLS 가정·VIF·완화 수단을 정리합니다.
계수가 하루아침에 부호를 바꾸면, 모델이 똑똑해진 것이 아닙니다. 잔차의 흩어짐이 구간마다 다르거나, 설명변수가 같은 이야기를 두 번 하고 있는 경우가 많습니다. 앞은 이 깨진 이고, 뒤는 입니다.
잔차가 고르게 흩어지는가
는 잔차 제곱합을 최소로 기울기를 찍습니다. 가우스-마코프가 최선선형불편추정량을 약속하려면, 잔차 분산이 예측값 수준마다 같아야 합니다. Var(ε|X)=σ²가 그 칸입니다. 흩어짐이 커지는 깔때기 모양이 보이면 표준오차가 왜곡되고, 유의성 판정이 흔들립니다. 계수 점 자체보다 신뢰구간과 t값이 먼저 상합니다.
눈으로 보려면 가로에 예측값, 세로에 잔차를 둡니다. 띠가 일정해야 합니다. 검정은 잔차 제곱을 설명변수에 다시 올리는 Breusch-Pagan, 그룹 분산을 비교하는 Levene, 더 일반적인 White가 있습니다. 고치면 로그로 스케일을 누르거나, 분산이 큰 점에 작은 무게를 주는 WLS, 분산 구조를 명시하는 GLS입니다.
| 가정 | 한 줄 | 깨지면 |
|---|---|---|
| 선형성 | Y = Xβ + ε | 곡선 잔차 |
| 외생성 | E(ε|X)=0 | 편의 계수 |
| 등분산 | Var(ε|X)=σ² | 잘못된 표준오차 |
| 무자기상관 | 잔차끼리 공분산 0 | t·F가 과장 |
| 비다중공선 | rank(X)=k | 계수 불안정 |
변수가 같은 말을 하면
다중공선성은 설명변수 사이에 강한 선형 관계가 있는 상태입니다. 집값에 방 수와 면적을 같이 넣으면, 누구 몫인지 가르기 어렵습니다. 계수는 크게 흔들리고 부호가 직관과 어긋나며, 개별 t는 약한데 모델 전체 F는 강한 착시가 납니다.
탐지는 가 정석입니다. VIFⱼ = 1/(1−R²ⱼ)이고, R²ⱼ는 j번째 변수를 나머지로 설명한 결정계수입니다. 1이면 겹침이 없고, 10을 넘으면 심각으로 봅니다. 상관계수 |r|이 0.8~0.9를 넘거나 조건수가 30을 넘어도 같은 경고입니다.
| 손보는 법 | 하는 일 |
|---|---|
| 변수 제거 | 겹치는 쪽 하나를 뺀다 |
| 주성분으로 축을 합친다 | |
| L2로 계수를 눌러 분산을 줄인다 | |
| VIF 선택 | 낮은 변수만 남긴다 |
Ridge는 약간의 편향을 사고 분산을 깎습니다. 해석이 목표면 변수를 빼는 편이 낫고, 예측이 목표면 정규화·주성분이 자주 이깁니다. 답안은 OLS 가정 다섯, 등분산 진단·완화, VIF 식과 기준, 공선성 처방을 한 표에 닫습니다.