PE Notes · AI
강화학습
상태·행동·보상으로 정책을 익히는 강화학습을 가치 기반, 정책 경사, Actor-Critic으로 나누고, 이산·연속 행동에 따라 DQN·PPO·SAC를 고르는 기준을 정리합니다.
정답이 매 순간 붙어 있지 않고, 지금 행동이 나중에야 점수로 돌아오는 문제가 있습니다. 게임, 로봇, 장기 추천이 그렇습니다. 은 에이전트가 환경과 주고받으며, 보상의 할인 합을 키우는 을 익힙니다. 레이블을 맞추는 지도, 구조를 찾는 비지도와 입력이 다릅니다.
루프와 기호
에이전트는 상태 s를 보고 행동 a를 고릅니다. 환경은 보상 r과 다음 상태 s'를 돌려줍니다. 목표는 누적 보상 G = Σ γᵗ r_t를 키우는 것입니다. γ는 먼 보상을 지금 가치로 얼마나 당길지입니다.
| 기호 | 역할 |
|---|---|
| 에이전트 | 학습하고 고르는 주체 |
| 환경 | 행동에 반응해 상태와 보상을 준다 |
상태 s |
지금 관측 |
행동 a |
고를 수 있는 조작 |
보상 r |
직후 피드백. 설계가 학습 방향을 정한다 |
정책 π |
s에서 a로 가는 규칙. 결정론 또는 확률 |
가치 V(s), Q(s,a) |
그 상태(또는 행동)에서 기대하는 누적 보상 |
할인 γ |
미래 보상의 현재 가치 (0과 1 사이) |
탐색과 활용은 같이 가야 합니다. 아는 최선만 고르면 더 나은 행동을 못 보고, 항상 새 행동만 고르면 점수가 안 쌓입니다. ε-greedy는 작은 확률로 무작위 행동을 남깁니다. 보상이 드물거나, 시도가 비싸거나, 위험한 환경이면 이 균형이 더 어렵습니다.
가치, 정책 경사, Actor-Critic
무엇을 학습 대상으로 두느냐로 계열이 갈립니다.
가치 기반은 Q(s,a)를 추정하고, 값이 큰 행동을 고릅니다. 은 으로 표를 갱신합니다. 은 그 표를 신경망으로 바꾸고, 경험 재생과 타깃 네트워크로 흔들림을 줄입니다. 이산 행동에는 잘 맞지만, 연속 토크처럼 행동이 실수 값이면 칸을 나눌 수 없습니다. Q를 과대평가하는 경향은 Double DQN 쪽이 완화합니다.
정책 기반은 π(a|s; θ)를 직접 파라미터화하고, 기대 보상의 기울기로 θ를 올립니다. 의 뼈대는 ∇J(θ) = E[ ∇log π(a|s; θ) · G_t ] 입니다. REINFORCE가 대표입니다. 연속 행동에 자연스럽고, 대신 분산이 커 샘플을 많이 씁니다. 기준선(Baseline)을 빼면 분산이 줄어듭니다.
은 정책을 익히는 Actor와 가치를 익히는 Critic을 같이 둡니다. Critic이 “이 행동이 기대보다 나았는지”를 알려 주어, 정책 경사만 쓸 때보다 흔들림이 줄어듭니다. 는 한 번에 정책을 너무 멀리 옮기지 못하게 갱신 폭을 자릅니다. SAC는 엔트로피를 같이 키워 탐색을 남깁니다. LLM 정렬의 RLHF는 보상모델을 환경처럼 두고 PPO로 정책을 옮기는 경로입니다.
| 비교축 | 가치 기반 | 정책 기반 | Actor-Critic |
|---|---|---|---|
| 학습 대상 | Q | π | Q 또는 V + π |
| 연속 행동 | 어렵다 | 가능하다 | 가능하다 |
| 안정 | 중간 | 분산이 커 낮기 쉽다 | 클리핑 등으로 높이기 쉽다 |
| 샘플 | Off-policy라 재사용에 유리 | On-policy라 낮기 쉽다 | 중간 |
| 예 | DQN | REINFORCE | PPO, SAC, A3C |
무엇으로 고를까
행동 공간이 버튼인지 토크인지, 샘플을 재사용할 수 있는지가 첫 질문입니다.
| 상황 | 자주 고르는 쪽 |
|---|---|
| 이산 행동 (키, 수) | DQN, Rainbow, PPO |
| 연속 제어 (관절, 속도) | PPO, SAC, TD3 |
| 여러 에이전트 | MAPPO 등 확장 |
| 안정이 우선 | PPO (온정책, 클리핑) |
| 샘플이 비싸다 | Off-policy (DQN, SAC) |
지도는 정적 데이터와 정답이 있고, 비지도는 정답 없이 구조를 찾으며, 강화는 환경과 붙어서 순차 결정을 익힙니다. 쓰임은 게임 AI, 로봇 조작, 경로, 장기 만족을 보는 추천, 그리고 보상모델로 LLM을 정렬하는 RLHF입니다. 보상 설계가 어긋나면 점수만 올리는 편법이 나오므로, 정렬 문항에서는 보상해킹을 같이 적습니다.
기술사 답안 포인트
관련 용어
관련 토픽
AI
환각현상, 모라벡의 역설, RLHF·RAFT, 과적합
LLM이 사실이 아닌 답을 자신 있게 내는 이유, 감각·운동이 기계에 더 어려운 이유, 인간 선호 정렬의 두 경로, 학습이 너무 맞거나 덜 맞는 상태를 한 장에서 구분합니다.
AI
인공신경망 (ANN)
입력·은닉·출력층과 가중치로 비선형 관계를 근사하는 인공신경망의 순전파·역전파, 활성화함수 선택, 딥러닝으로의 확장을 정리합니다.
AI
편향, 과적합 해결, 최적화 알고리즘, 차원축소
공정성 관점의 편향 유형, 과적합을 데이터·모델·학습 단계에서 줄이는 기법, GD에서 Adam까지의 옵티마이저, 선형·비선형 차원축소를 구분합니다.