PE Notes · 확률통계
마르코프 특성과 벨만 방정식
다음 상태가 현재에만 의존하는 마르코프 특성과, 상태·행동·전이·보상·할인으로 적는 MDP, 가치를 재귀로 푸는 벨만 방정식을 정리합니다.
다음 칸은 지금까지의 경로가 아니라, 지금 서 있는 칸과 고른 행동으로 정해집니다. 은 미래가 현재 상태에만 의존한다는 압축입니다. 기억이 필요하면 그 기억을 상태 안에 넣습니다. 는 그 위에 행동과 보상을 올린 의사결정 틀이고, 의 무대입니다.
다섯 요소와 체인
상태는 지금 관측, 행동은 고를 조작, 전이 P(s′|s,a)는 다음 칸의 확률, 보상은 직후 점수, 는 먼 보상을 지금 가치로 당기는 0~1 계수입니다. 체인은 행동이 없는 마르코프입니다. 맑음→비의 전이 행렬만 있으면 장기 비율(정상분포)을 풀 수 있습니다. MDP는 그 행렬을 행동이 바꿉니다.
| 요소 | 기호 | 역할 |
|---|---|---|
| 상태 | S | 지금 칸 |
| 행동 | A | 고를 손 |
| 전이 | P(s′|s,a) | 다음 칸 확률 |
| 보상 | R | 직후 점수 |
| 할인 | γ | 미래 당김 |
| 비교축 | 마르코프 체인 | MDP |
|---|---|---|
| 행동 | 없음 | 있음 |
| 보상 | 없음 | 있음 |
| 목적 | 분포 | 최적 정책 |
벨만과 갱신
은 현재 가치가 지금 보상과 다음 가치의 할인 기댓값이라는 재귀입니다. 최적 가치는 V(s) = max_a [ R(s,a) + γ Σ P(s′|s,a) V(s′) ]입니다. 행동 가치는 Q(s,a) = R(s,a) + γ Σ P(s′|s,a) max_{a′} Q(s′,a′)입니다. π는 상태에서 행동으로 가는 규칙입니다. 결정론이면 하나, 확률론이면 분포입니다.
은 모형 없이 칸을 갱신합니다. Q(s,a) ← Q(s,a) + α [ r + γ max_{a′} Q(s′,a′) − Q(s,a) ]. α는 학습률, 대괄호는 벨만 오차입니다. 칸이 커지면 이 Q를 망으로 근사합니다. 답안은 특성 한 줄, 다섯 기호, V·Q 식, 갱신 한 줄을 한 장에 닫습니다.