PE Notes · AI
경사하강법 — 오버슈팅과 지역최소점
손실의 기울기 반대 방향으로 가중치를 갱신하는 경사하강법의 배치 유형, 오버슈팅·지역최소점·안장점, 그리고 학습률·모멘텀·적응형 옵티마이저로 막는 법을 정리합니다.
신경망 학습은 결국 를 줄이는 일입니다. 고차원 손실 곡면은 닫힌 식으로 풀리지 않으니, 기울기가 가리키는 반대쪽으로 파라미터를 조금씩 옮깁니다. 그 반복이 입니다.
정의
손실 L(W)의 기울기 ∂L/∂W를 구한 뒤, 그 반대 방향으로 가중치를 갱신합니다.
W ← W − η · ∂L/∂W
η는 입니다. 한 걸음이 너무 크면 골짜기를 건너뛰고, 너무 작으면 수렴이 늘어집니다. 순전파로 손실을 만들고, 로 기울기를 돌린 다음 위 식을 반복합니다.
배치 단위로 나눈 유형
한 번에 몇 개 샘플로 기울기를 보느냐가 유형을 가릅니다.
| 유형 | 기울기를 보는 범위 | 장점 | 단점 |
|---|---|---|---|
| 배치 경사하강법 (Batch GD) | 학습 데이터 전체 | 방향이 안정적이다 | 데이터가 크면 메모리·속도가 부담이다 |
| 확률적 경사하강법 (SGD) | 샘플 1개 | 갱신이 빠르고, 노이즈로 얕은 골을 빠져나오기 쉽다 | 진동이 크다 |
| 미니배치 경사하강법 | 소규모 배치 (흔히 32~512) | 속도와 안정의 절충. 실무 기본 | 배치 크기가 또 하나의 하이퍼파라미터가 된다 |
현대 학습은 미니배치에 Adam, RMSprop 같은 적응형 옵티마이저를 붙이는 경우가 많습니다. 파라미터마다 걸음 폭을 달리 줍니다.
오버슈팅
은 학습률이 커서 최솟값을 건너뛰고, 손실이 커지거나 발산하는 현상입니다.
막는 손은 세 가지로 적습니다.
- 학습률 스케줄링: 학습이 진행될수록 걸음 폭을 줄입니다. Step Decay, Cosine Annealing이 대표입니다.
- 적응형 옵티마이저: Adam, RMSprop처럼 파라미터별 기울기 크기에 맞춰 학습률을 조절합니다.
- : 기울기 노름이 임계를 넘으면 잘라, 폭주를 막습니다.
지역최소점과 안장점
손실 곡면은 볼록하지 않습니다. 에 갇히면 전역 최솟값보다 높은 곳에서 멈춥니다. 은 기울기가 0에 가깝지만 최소가 아닌 평탄한 고개입니다. 깊은 망에서는 안장점에 오래 머무르는 경우가 더 흔합니다.
| 비교축 | SGD 노이즈 | Adam | 학습률 재시작 (SGDR) | |
|---|---|---|---|---|
| 원리 | 샘플마다 기울기가 흔들려 얕은 골을 넘는다 | 이전 방향을 관성으로 누적해 평탄 구간을 통과한다 | 1·2차 모멘트로 걸음 폭을 적응시킨다 | 학습률을 주기적으로 올렸다가 다시 줄인다 |
| 탈출 | 중간 | 중간~높음 | 높음 | 높음 |
| 수렴 안정 | 낮음 | 중간 | 높음 | 중간 |
| 추가 비용 | 없음 | 속도 버퍼 | 모멘트 계산 | 스케줄만 |
기울기가 거의 0이 되는 은 최적화와 별개로, 배치정규화와 잔차 연결이 자주 붙습니다. 옵티마이저만으로 층을 살리지 못합니다.