요즘 Agentic AI 논문을 보다 보면 한 단어가 계속 다시 등장한다.
DeepSeek-R1은 대규모 RL로 reasoning behavior가 emerge할 수 있다는 강한 사례를 보여줬고, 이후 Web Agent, Tool-use Agent, Coding Agent, Search Agent처럼 환경과 상호작용하는 모델 자체를 RL로 학습하는 연구가 빠르게 늘었다.
그리고 2026년 8월 Microsoft Research의 Agent Lightning v1.0은 한 단계 더 나아간다.
이제는 모델만 따로 RL로 학습하는 게 아니라, 실제 배포 때 사용하는 Agent Harness 자체를 training loop 안으로 가져오는 “Harnessed Agentic RL”이라는 표현까지 등장했다.
AI의 단위가 “답변”에서 “행동”으로 바뀌었기 때문이다.
01. RL은 사실 다시 뜬 게 아니다 — 최적화 대상이 바뀌었다
강화학습은 오래된 기술이다.
PPO는 2017년에 나왔고, InstructGPT는 이미 2022년에 RLHF + PPO로 모델을 인간 선호에 맞췄다. 2023년 DPO는 이 복잡한 RLHF pipeline을 더 단순한 preference optimization으로 우회했고, 2024년 DeepSeekMath는 critic을 없앤 GRPO를 제안했다.
내가 보는 핵심 변화는 이것이다.
“이 답변이 사람 마음에 드는가?”
↓
Reasoning RL era
“정답에 도달했는가?”
↓
Agentic RL era
“환경 속에서 올바른 행동을 연속적으로 선택해
실제 목표를 달성했는가?”
바로 이 마지막 질문이 고전적인 RL의 문제 정의와 거의 정확히 겹친다.
02. 가장 처음부터: Supervised Learning과 RL은 뭐가 다른가?
Supervised Learning에서는 정답이 이미 있다.
Ground Truth y
↓
Prediction ŷ
↓
Loss(y, ŷ)
↓ Action
Environment
↓
Reward + Next State
SFT는 “좋은 행동이 무엇인지”를 예시로 보여준다.
RL은 여러 행동을 직접 시도하고 그 결과를 받아, 더 높은 장기 보상을 만드는 행동 확률을 높인다.
그래서 새로운 상황에서 단순 imitation만으로 해결하기 어려운 planning, exploration, retry, tool selection 같은 문제가 등장하면 RL이 매력적이 된다.
03. RL의 기본 세계관: MDP
강화학습의 가장 기본적인 수학적 틀은 Markov Decision Process(MDP)다.
S : State space
A : Action space
P : Transition dynamics
R : Reward function
γ : Discount factor
시점 t에서 Agent는 상태 st를 보고 정책 πθ(a|s)에 따라 action을 선택한다.
↓
πθ(at | st)
↓
at
↓
Environment
↓
rt, st+1
목표는 단순히 바로 다음 reward를 크게 만드는 게 아니라 미래 reward를 합친 Return을 최대화하는 것이다.
γ가 1에 가까우면 먼 미래의 결과도 중요하게 본다. Agentic AI에서 long-horizon task가 어려운 이유가 여기서 바로 나온다.
04. 실제 AI Agent는 MDP보다 POMDP에 더 가깝다
현실의 Agent는 세상의 전체 상태를 볼 수 없다.
Browser Agent는 현재 HTML 일부만 보고, 고객 서비스 Agent는 필요한 고객 정보 중 일부만 보고, Coding Agent는 repository 전체의 의도를 완벽히 알지 못한다.
그래서 더 정확한 모델은 Partially Observable Markov Decision Process(POMDP)다.
| RL 개념 | LLM Agent에서는 |
|---|---|
| Observation ot | User message · HTML · Tool result · Retrieved docs |
| State st | Context + memory + interaction history |
| Action at | Tool call · Search query · Click · Code patch · Message |
| Transition | Tool/API/Environment가 상태를 변경 |
| Reward | Task success · test pass · policy compliance · cost |
Microsoft Agent Lightning도 이 관점으로 Agent 실행을 추상화한다. 각 LLM call을 action으로 보고, 나머지 agent harness와 environment를 RL 환경으로 감싸는 방식이다.
05. Value, Q, Advantage — RL 논문 읽을 때 반드시 나오는 세 단어
RL은 “지금 이 행동이 좋은가?”를 미래까지 포함해 평가해야 한다.
Policy Gradient에서 중요한 건 이 Advantage다.
평균보다 좋았던 action은 확률을 올리고, 평균보다 나빴던 action은 확률을 내린다.
06. Bellman Equation — 미래 가치를 재귀적으로 본다
지금 상태의 가치는 지금 받는 reward + 다음 상태의 미래 가치다.
이 단순한 식이 RL 전체를 관통한다.
Agent에게도 똑같다.
지금 검색 버튼을 누르는 행동 자체는 reward가 없어도, 그 행동이 좋은 evidence를 가져오고 결국 task success를 만든다면 credit을 받아야 한다.
그리고 이 “나중에 성공했는데, 대체 어느 행동 덕분이었나?”가 Agentic RL에서 가장 큰 문제 중 하나다.
07. Policy Gradient — 확률 자체를 직접 학습한다
LLM은 본질적으로 다음 token에 대한 확률분포를 만든다.
= Πt πθ(yt | x, y<t)
RL에서는 높은 reward를 만든 sequence의 확률을 높인다.
직관은 간단하다.
→ 이 행동의 log-probability를 올린다
Advantage < 0
→ 이 행동의 log-probability를 내린다
문제는 RL gradient가 매우 noisy하다는 것이다. 그래서 baseline, critic, clipping 같은 장치들이 필요해진다.
08. Actor-Critic과 PPO — 왜 RLHF에서 PPO를 썼을까?
Actor-Critic은 역할을 둘로 나눈다.
PPO는 policy를 한 번에 너무 크게 바꾸지 않도록 old policy 대비 probability ratio를 clip한다.
LPPO = E[min( ratiotAt, clip(ratiot, 1−ε, 1+ε)At )]
한 번 좋은 reward를 받았다고 해당 response probability를 폭발적으로 올리는 걸 막는 셈이다.
PPO는 안정적이지만 LLM에서는 무겁다. policy만큼 큰 critic/value model을 운영하고, reference model, reward model까지 붙으면 GPU memory와 pipeline 복잡도가 커진다.
09. RLHF — RL이 LLM에 처음 대중적으로 들어온 방식
↓
SFT
Human demonstrations
↓
Reward Model
Human preference ranking
↓
PPO
Reward ↑ + KL constraint
↓
Aligned Policy
InstructGPT의 핵심 구조다.
여기서 reward는 정답/오답이 아니라 “사람이 어느 답변을 더 선호하는가”라는 상대적으로 주관적인 신호다.
그래서 별도의 Reward Model이 필요했다.
10. 잠깐, DPO는 왜 나왔지?
PPO-based RLHF는 너무 복잡했다.
DPO는 preference pair를 이용해 Reward Model + online RL loop를 명시적으로 돌리지 않고 policy를 직접 preference 방향으로 최적화한다.
현재 policy가 environment를 탐색하며 새로운 trajectory를 생성하고 reward를 받아 다시 policy를 업데이트하는 Agentic RL의 online interaction loop와는 성격이 다르다.
Agent 시대에 RL이 다시 주목받는 이유도 이 차이에 있다.
행동하면서 새 데이터를 만들어야 하기 때문이다.
11. GRPO — Critic을 없애고 “같은 문제의 다른 답”끼리 비교한다
2024년 DeepSeekMath가 소개한 Group Relative Policy Optimization(GRPO)는 2025년 DeepSeek-R1을 통해 아주 유명해졌다.
핵심은 PPO의 critic을 없애는 것이다.
↓
Response 1 → reward 0
Response 2 → reward 1
Response 3 → reward 0
Response 4 → reward 1
↓
같은 group 안에서 상대평가
같은 문제에서 다른 sample보다 잘한 response는 positive advantage를 받는다.
거대한 value model을 하나 더 두지 않아도 되니 LLM reasoning RL에서 굉장히 매력적이다.
12. DeepSeek-R1이 충격적이었던 이유: Reward만 줬는데 reasoning behavior가 나타났다
DeepSeek-R1-Zero는 SFT cold start 없이 base model에 대규모 RL을 직접 적용한 실험이었다.
Reward도 의외로 단순했다.
Code test / compiler result
별도의 neural outcome/process reward model을 쓰지 않았고, reasoning style을 세세하게 가르치지 않았는데도 RL 과정에서 reflection, alternative approach exploration, 더 긴 thinking 같은 행동이 나타났다.
AIME 2024 pass@1도 training 과정에서 15.6%에서 71.0%까지 올라갔다고 보고됐다.
아니면 좋은 outcome을 정의하면 모델이 행동 전략을 스스로 발견할 수 있을까?
13. RLVR — Reward Model보다 “검증 가능한 정답”을 쓴다
여기서 최근 많이 보이는 단어가 RLVR: Reinforcement Learning with Verifiable Rewards다.
Reward를 사람이 매번 라벨링하거나 learned reward model로 추정하는 대신, 프로그램적으로 검증할 수 있는 signal을 쓴다.
| Task | Verifier |
|---|---|
| Math | Exact / symbolic answer checker |
| Code | Unit tests · compiler · SWE benchmark |
| SQL | Execution result · expected table |
| Tool use | Environment task success |
이게 중요한 이유는 reward hacking 때문이다.
Reward Model이 imperfect하면 policy는 진짜 목적보다 reward model의 허점을 잘 공략하는 방법을 배울 수 있다.
검증 가능한 reward는 상대적으로 이 문제가 적다.
다만 RLVR도 만능은 아니다. “친절한 상담”, “좋은 투자 설명”, “적절한 보험 심사”처럼 정답이 하나가 아닌 업무에는 scalar verifier를 정의하는 순간 다시 어려움이 생긴다.
14. Outcome Reward vs Process Reward — 마지막만 채점하면 충분할까?
Task가 성공했나?
Tool 선택은 적절했나?
OpenAI의 Let's Verify Step by Step은 수학 reasoning에서 process supervision이 outcome supervision보다 더 강할 수 있음을 보여줬다.
하지만 process reward는 비용이 크다. 어느 step이 “한 단계”인지 정의해야 하고, step별 reward label도 필요하다.
DeepSeek-R1도 PRM을 대규모 RL에 적용하는 과정에서 step 정의의 어려움, annotation 비용, reward hacking 문제를 지적했다.
15. DAPO — GRPO를 실제 대규모 Long-CoT RL에 돌리면 생기는 문제를 고쳤다
2025년 DAPO는 꽤 engineering-heavy한 논문이라 재미있다.
“RL 이론을 하나 새로 만들었다”기보다는 실제 long reasoning training에서 GRPO가 망가지는 지점을 하나씩 고친다.
| Problem | DAPO Fix | 의미 |
|---|---|---|
| Entropy collapse | Clip-Higher | 좋은 rare token의 확률 상승을 더 허용 |
| 전부 정답/전부 오답 group | Dynamic Sampling | gradient signal 없는 prompt 제거 |
| 긴 CoT loss bias | Token-level PG Loss | response 길이에 따른 왜곡 완화 |
| 길이 초과 reward noise | Overlong Reward Shaping | hard penalty 대신 부드러운 길이 제어 |
이걸 보면 RL에서는 알고리즘 이름보다 reward variance, entropy, rollout distribution, sequence length 같은 training dynamics가 훨씬 중요하다는 걸 알 수 있다.
16. 그래서 Agentic AI가 되면 왜 RL의 필요성이 더 커질까?
Chatbot은 대체로 한 번의 response quality를 최적화하면 된다.
Agent는 다르다.
↓
Plan
↓
Search
↓
Tool Call
↓
Observe Result
↓
Re-plan
↓
Execute
↓
Verify
↓
Outcome
중간 단계마다 여러 action 후보가 존재한다.
“정답 trajectory”를 인간이 전부 만들어 SFT하는 것보다 Agent가 environment에서 여러 trajectory를 시도하고 outcome을 받아 스스로 좋은 전략을 찾도록 하는 게 자연스러워진다.
17. 2025 연구들: RL이 Tool 사용 자체를 학습하기 시작했다
WebAgent-R1
WebAgent-R1은 web environment에서 직접 multi-turn rollout을 생성하고, task success라는 binary reward만으로 end-to-end RL을 수행했다.
WebArena-Lite에서 Qwen2.5-3B의 task success가 6.1% → 33.9%, Llama-3.1-8B는 8.5% → 44.8%로 올라갔다고 보고했다.
흥미로운 건 “정답 web trajectory”를 전부 imitation한 게 아니라 실제 interaction 자체에서 학습했다는 점이다.
ToolRL / ReTool
ToolRL은 tool-use에서 reward design을 본격적으로 분석했고, tool 선택, parameter 사용, temporal reward가 얼마나 중요한지 보여준다.
ReTool은 reasoning 중 code interpreter를 실제로 호출하면서 RL을 통해 언제 Tool을 쓰고, 언제 자연어 reasoning을 계속할지를 스스로 학습하게 했다.
이건 Agent 시대의 핵심 변화다.
이제 Tool use는 prompt에 적어놓은 instruction이 아니라 학습 가능한 policy가 된다.
18. Agentic RL의 진짜 난제: Credit Assignment
수학 문제는 마지막 답이 맞으면 reward = 1을 줄 수 있다.
그런데 30-step Agent가 마지막에 실패했다고 해보자.
Step 2 · Search ✓
Step 3 · Select document ✓
...
Step 17 · Tool call ?
Step 18 · Wrong parameter ✗
...
Step 30 · Task failed reward = 0
모든 step에 똑같이 0이라는 signal을 주면 잘한 행동과 잘못한 행동을 구분하기 어렵다.
이것이 credit assignment problem이다.
2026년 HCAPO는 성공/실패가 끝난 뒤 trajectory를 뒤돌아보면서 어떤 intermediate action이 결과에 실제로 기여했는지 LLM 자체를 post-hoc critic으로 활용해 credit을 재분배하는 방향을 제안했다.
Qwen2.5-7B-Instruct 기준으로 GRPO 대비 WebShop에서 +7.7%p, ALFWorld에서 +13.8%p success rate 개선을 보고했다.
19. Multi-turn RL은 생각보다 잘 망가진다 — RAGEN의 Echo Trap
RAGEN 연구는 multi-turn Agent RL이 single-turn reasoning RL보다 훨씬 불안정하다는 걸 보여준다.
연구진은 reward variance가 급격히 사라지고 gradient가 튀는 Echo Trap이라는 training pathology를 관찰했다.
더 흥미로운 결과는, coarse outcome reward만으로 RL을 돌린다고 깊은 reasoning이 자동으로 생기는 건 아니라는 점이다.
Reward sparsity, environment noise, tool failure, state change가 추가되면서 훨씬 어려운 RL 문제가 된다.
20. 2026년 Long-Horizon Agent RL 연구가 말하는 의외의 것: Environment가 중요하다
2026년 3월 Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents는 TravelPlanner를 이용해 Agentic RL을 꽤 체계적으로 분해했다.
연구가 본 축은 다섯 가지였다.
특히 눈에 띈 결과는 환경의 안정성이 무너지면 policy 자체가 degradation될 수 있다는 점이다.
작은 모델은 staged reward와 exploration 보조가 더 유용했고, 큰 모델은 비교적 단순한 dense reward로도 빠르게 converge했다.
또 해당 환경에서는 난이도를 섞은 약 1K training samples가 in-domain과 out-of-domain 성능의 sweet spot으로 관찰됐다.
Simulator가 flaky하거나 tool 결과가 재현되지 않으면, reward noise가 모델 noise처럼 들어간다.
21. 그리고 2026년 8월: Harnessed Agentic RL
개인적으로 지금 가장 흥미로운 최신 흐름 중 하나다.
기존 Agent RL은 training engine이 environment interaction까지 어느 정도 통제하는 구조가 많았다.
Microsoft의 Agent Lightning v1.0은 실제 production-style Agent Harness가 interaction loop를 소유하고, trainer는 거기서 발생하는 LLM request-response trajectory를 관찰해 학습한다.
Tools · Context · Memory · Control Flow · Environment
Advantage · Policy Update · New Checkpoint
이게 중요한 이유는 Harness가 단순 inference wrapper가 아니라 model post-training의 일부가 되기 때문이다.
Agent Lightning v1.0 논문에서는 약 6K training examples와 비교적 제한된 compute로 Qwen3.5-9B의 SWE-bench Verified 성능을 41.8% → 56.4%로 끌어올린 coding-agent RL 결과를 보고했다.
앞으로 Agent product의 moat가 prompt나 model choice뿐 아니라 우리 Agent가 실제 업무에서 만들어낸 experience data가 될 수 있다는 뜻이다.
22. 그런데 RL에서 진짜 제품 요구사항은 Reward Function이다
Agent를 RL로 학습한다면 가장 중요한 질문은 “어떤 알고리즘?”보다 먼저 이것이다.
예를 들어 금융권 상담 Agent의 reward를 단순히 “상담을 빨리 끝냈다”로 만들면 질문을 적게 하고 빨리 종료하는 Agent가 최적일 수 있다.
그래서 reward는 보통 여러 signal의 조합이 된다.
+ 2.0 × task_success
+ 1.0 × groundedness
+ 0.5 × customer_resolution
− 0.2 × tool_cost
− 0.1 × latency
− 1.0 × unnecessary_escalation
− 5.0 × policy_violation
그런데 여기에도 함정이 있다.
policy violation에 -5를 주는 순간 Agent는 “보상이 충분히 크면 규칙을 위반해도 된다”고 수학적으로 해석할 수 있다.
“Soft Reward”로만 두면 안 된다.
23. Reward와 Constraint를 분리하자
| 종류 | 예시 | 처리 |
|---|---|---|
| Soft Objective | Latency · Cost · Answer quality | Reward scalarization |
| Hard Constraint | Unauthorized data access | Action blocked |
| Human Gate | Payment · Contract · Production change | Approval required |
이게 RL safety를 현실 시스템에 붙일 때 중요한 구분이다.
24. Exploration vs Exploitation — Agent가 새로운 방법을 시도해야 발전한다
RL의 고전적인 딜레마다.
Reasoning RL에서 entropy collapse가 문제인 이유도 모델이 너무 빨리 한 가지 reasoning pattern에 고정되기 때문이다.
Agentic RL에서는 더 중요하다. Search query, Tool selection, navigation route의 exploration이 필요하다.
하지만 production 금융 시스템에서 실제 고객 돈을 가지고 exploration할 수는 없다.
25. 금융권 Agentic RL은 Production에서 “시험”하면 안 된다
그래서 금융권에서는 RL training environment 설계가 모델보다 중요해질 수 있다.
Mock API · synthetic customer · historical scenario
Task · Grounding · Cost · Policy
실제 production은 exploration environment가 아니라 검증된 policy의 constrained execution environment여야 한다.
26. 금융권에서 RL을 붙이기 좋은 Agent / 아직 이른 Agent
| Use Case | RL Suitability | 이유 |
|---|---|---|
| Text-to-SQL Agent | HIGH | Execution reward가 명확 |
| RAG Search Agent | HIGH | Search trajectory + answer verifier |
| Internal Coding Agent | HIGH | Tests / sandbox verifier |
| Ops Triage Agent | MEDIUM | Replay 가능하나 reward 정의 필요 |
| Claims Final Decision | LOW | 고위험 · reward가 규제/책임을 대체 불가 |
| Investment Execution | VERY LOW | 실제 exploration 비용이 너무 큼 |
27. 모든 Agent에 RL이 필요한 건 아니다
RL이 유행한다고 모든 Agent를 RL fine-tuning할 필요는 없다.
✓ 성공 여부를 reasonably reliable하게 평가할 수 있다.
✓ Prompt / Harness 튜닝만으로 성능 ceiling이 보인다.
✓ 새로운 상태에서 generalization이 중요하다.
✓ Agent가 여러 action 중 전략을 선택해야 한다.
✓ Simulator 또는 safe rollout environment가 있다.
✗ reward를 정의할 수 없다.
✗ training trajectory가 거의 없다.
✗ 한 번의 오류 비용이 매우 크다.
✗ 아직 tracing/eval조차 없다.
이런 경우에는 SFT, prompt, retrieval, harness, deterministic workflow가 훨씬 싸고 안전하다.
28. 내가 보는 진짜 변화: Agent Trace가 이제 Training Data가 된다
앞에서 LangSmith observability 이야기를 했었다.
그때는 trace를 debug와 eval을 위한 데이터로 봤다.
Agentic RL까지 오면 하나가 더 붙는다.
↓
Trace / Trajectory
↓
Outcome / Feedback
↓
Evaluation
↓
RL Training Data
↓
Better Policy
↓
Production Agent ↺
즉 observability pipeline과 training pipeline이 연결된다.
기업이 가진 진짜 자산이 foundation model weight가 아니라 자기 조직에서 축적되는 고품질 interaction trajectory가 될 수 있다.
→ More Useful Work
→ Better Experience Data
→ Better Reward / Eval
→ Better Policy
→ Better Agent
29. 지금 읽어볼 만한 RL / Agentic RL 논문
30. 결국 Agentic AI 시대의 RL은 “모델 학습” 이상의 이야기다
지금 RL을 다시 공부하면서 가장 재미있는 부분은 예전에 배웠던 MDP, policy, reward, value 같은 개념이 갑자기 LLM Agent architecture와 그대로 연결된다는 것이다.
→ LLM / Agent Model
State
→ Context / Memory / Environment
Action
→ Tool / Search / API / Code
Reward
→ Task Outcome / Eval / Business KPI
Environment
→ Agent Harness + Enterprise Systems
그리고 여기서 중요한 건 RL algorithm만 잘 고르면 된다는 이야기가 아니다.
실제 Agentic RL의 품질은 Environment · Harness · Reward · Verifier · Trajectory Data의 품질에 크게 좌우된다.
SFT는 원하는 행동을 따라 하는 법을 가르쳤다면,
RL은 이제 Agent에게 직접 행동하고 결과에서 배우는 법을 가르치고 있다.
그래서 앞으로 기업 AI의 경쟁력도 “어떤 Foundation Model을 썼는가?”에서 조금 더 이동할 수 있다.
“우리 Agent는 실제 업무 경험에서 얼마나 잘 배우는가?”
이 질문이 중요해지는 순간, Agent Platform은 inference platform에서 Experience → Evaluation → Learning까지 포함하는 Improvement System으로 바뀐다.
Papers & References
00. University of Alberta — Rich Sutton, Professor of Computing Science
00-2. ACM — 2024 A.M. Turing Award: Andrew Barto & Richard Sutton
01. Schulman et al. — Proximal Policy Optimization Algorithms
02. OpenAI — InstructGPT / Aligning Language Models to Follow Instructions
03. Rafailov et al. — Direct Preference Optimization
04. Shao et al. — DeepSeekMath / Group Relative Policy Optimization
06. Kimi Team — Kimi k1.5: Scaling Reinforcement Learning with LLMs
07. Yu et al. — DAPO: An Open-Source LLM Reinforcement Learning System at Scale
08. Lightman et al. — Let's Verify Step by Step
11. Qian et al. — ToolRL: Reward is All Tool Learning Needs
12. Feng et al. — ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
13. Wang et al. — RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn RL
14. Wu et al. — Demystifying RL for Long-Horizon Tool-Using Agents
15. Tan et al. — Hindsight Credit Assignment for Long-Horizon LLM Agents
16. Microsoft Research — Agent Lightning
17. He et al. — Agent Lightning v1.0: Towards Harnessed Agentic RL
18. Cheng et al. — Efficient RL for Long-Horizon Tool-Use Agentic Tasks
'AI' 카테고리의 다른 글
| [AI] 왜 회의실에서는 Whisper가 갑자기 바보가 될까? STT의 원리와 Production 현실 (0) | 2026.09.04 |
|---|---|
| [AI] AI Engineer들이 Quant를 공부하기 시작했다 — AI와 퀀트의 경계가 무너지는 이유 (0) | 2026.09.04 |
| [AI] GPU가 다 하는 줄 알았는데, Agentic AI 시대에 CPU가 다시 중요해진 이유 (0) | 2026.09.04 |
| [AI] 85만원 내고 AI Summit Seoul 2026 다녀온 후기 — 결국 모델보다 시스템이었다 (0) | 2026.09.04 |
| [AI] 금융권 AI, 클라우드는 확산되는데 보안은 어떻게 (0) | 2026.09.04 |