PE Notes · AI
다층 신경망 설계 — FC 계층, One-Hot, Softmax
입력–은닉–출력의 완전연결 다층망에서 One-Hot 정답과 Softmax 확률, Cross-Entropy 손실이 어떻게 맞물리는지, 폭·깊이·정규화 설계 축을 정리합니다.
을 분류기에 올릴 때, 층 배치와 출력 형식부터 정합니다. 은 입력층–은닉층(1개 이상)–출력층의 쌓기입니다. 정답은 으로 두고, 출력은 로 확률 합 1을 만듭니다.
정의
완전연결은 앞 층 모든 뉴런이 다음 층 모든 뉴런과 붙는 구조입니다. 가중치 W와 편향 b로 가중합을 만든 뒤 를 겁니다. 은닉은 보통 , 다중 분류 출력은 Softmax입니다.
설계 예: 입력 784, 은닉 256·128, 클래스 10. 파라미터는 대략 입력→은닉1 200,960, 은닉1→은닉2 32,896, 은닉2→출력 1,290, 합 235,146입니다. 폭을 키우면 표현력과 과적합이 같이 커집니다.
순전파와 역전파
순전파는 한 줄입니다.
x → z₁=W₁x+b₁ → a₁=ReLU(z₁) → z₂=W₂a₁+b₂ → a₂=ReLU(z₂) → z₃=W₃a₂+b₃ → ŷ=Softmax(z₃)
Softmax는 exp(z_c) / Σ exp(z_k) 입니다. 음수 로짓도 양수 확률이 되고, argmax가 예측 클래스입니다. 정답 클래스 2, 클래스 수 4이면 One-Hot은 [0, 0, 1, 0]입니다.
는 L = −Σ y[c] · log(ŷ[c]) 입니다. One-Hot이면 정답 위치의 로그만 남습니다. 는 ∂L/∂W₃에서 앞으로 연쇄하고, 으로 W ← W − α·∂L/∂W를 반복합니다. 검증 손실이 올라가면 를 겁니다.
설계 축
은닉 뉴런 수는 입력과 출력 사이 점진 감소가 흔합니다. 과도한 폭·깊이는 입니다. 초기화는 Xavier/He로 분산을 맞추고, 은닉 뒤에 배치정규화를 두면 학습이 안정됩니다. 은 학습 중 일부를 꺼 의존을 줄입니다.
| 비교축 | Sigmoid | ReLU | Softmax |
|---|---|---|---|
| 자리 | 옛 은닉, 이진 출력 | 현대 은닉 기본 | 다중 분류 출력 |
| 범위 | 0~1 | 0 또는 양수 | 클래스 확률, 합=1 |
| 위험 | dying ReLU | 단독 은닉에는 쓰지 않는다 |
회귀 출력은 선형, 이진은 시그모이드 하나가 맞습니다. Softmax와 Cross-Entropy를 한 쌍으로 두는 이유가 학습 신호의 단순함입니다.
| 비교축 | 은닉 뉴런 | 활성화 | 정규화 |
|---|---|---|---|
| 너무 작음 | 표현 부족, 과소적합 | 선형에 가까움 | 과적합은 줄지만 용량도 줄어든다 |
| 적절 | 입력→출력으로 점진 감소 | 은닉 ReLU | Dropout + 배치정규화 |
| 너무 큼 | 파라미터 폭증, 과적합 | Softmax를 은닉에 두면 확률 강제 | 학습이 느리고 신호가 죽는다 |
클래스 수가 커지면 One-Hot이 희소해집니다. 그때는 임베딩이나 계층 소프트맥스를 검토합니다. 입력은 스케일을 맞춘 뒤에 넣는 것이 기본입니다.
관련 용어
관련 토픽
AI
인공신경망 (ANN)
입력·은닉·출력층과 가중치로 비선형 관계를 근사하는 인공신경망의 순전파·역전파, 활성화함수 선택, 딥러닝으로의 확장을 정리합니다.
AI
경사하강법 — 오버슈팅과 지역최소점
손실의 기울기 반대 방향으로 가중치를 갱신하는 경사하강법의 배치 유형, 오버슈팅·지역최소점·안장점, 그리고 학습률·모멘텀·적응형 옵티마이저로 막는 법을 정리합니다.
AI
강화학습
상태·행동·보상으로 정책을 익히는 강화학습을 가치 기반, 정책 경사, Actor-Critic으로 나누고, 이산·연속 행동에 따라 DQN·PPO·SAC를 고르는 기준을 정리합니다.