AI

[AI] Agentic AI 시대, 강화학습이 다시 뜨는 이유 — RLHF에서 Agentic RL까지

rubrub 2026. 9. 4. 02:21

요즘 Agentic AI 논문을 보다 보면 한 단어가 계속 다시 등장한다.

개인적으로...
RL을 다시 공부하면서 조금 반갑게 느껴지는 이유가 있다. 나는 캐나다 University of Alberta를 나왔는데, 이 학교에는 강화학습 교과서로 유명한 Richard S. Sutton 교수가 있다. (Reinforcement Learning: An Introduction의 Sutton 교수님! Andrew Barto와 함께 현대 강화학습의 개념과 알고리즘적 토대를 만든 인물이고, 두 사람은 그 공로로 2024 ACM A.M. Turing Award까지 받았다. )
예전에 Sutton 교수님의 특강을 듣고 사진도 한 장 찍은 적이 있다. 당시엔 신기한 경험 정도였는데, 몇 년 뒤 Agentic AI 시대에 다시 RL을 이렇게 깊게 들여다보게 될 줄은 몰랐다ㅎㅎ
University of Alberta 특강 후 직접 찍은 사진
예전 University of Alberta 특강 후. 용기내서!!! 직접 촬영
THE COMEBACK KEYWORD
Reinforcement Learning.
강화학습. 한동안 RLHF 뒤편에 숨어 있던 것 같더니, Reasoning Model과 Agent 시대가 되면서 다시 전면으로 나오고 있다.

DeepSeek-R1은 대규모 RL로 reasoning behavior가 emerge할 수 있다는 강한 사례를 보여줬고, 이후 Web Agent, Tool-use Agent, Coding Agent, Search Agent처럼 환경과 상호작용하는 모델 자체를 RL로 학습하는 연구가 빠르게 늘었다.

그리고 2026년 8월 Microsoft Research의 Agent Lightning v1.0은 한 단계 더 나아간다.

이제는 모델만 따로 RL로 학습하는 게 아니라, 실제 배포 때 사용하는 Agent Harness 자체를 training loop 안으로 가져오는 “Harnessed Agentic RL”이라는 표현까지 등장했다.

MY TAKE
RL이 다시 뜨는 이유는 모델이 갑자기 게임을 하고 싶어져서가 아니다.
AI의 단위가 “답변”에서 “행동”으로 바뀌었기 때문이다.

01. RL은 사실 다시 뜬 게 아니다 — 최적화 대상이 바뀌었다

강화학습은 오래된 기술이다.

PPO는 2017년에 나왔고, InstructGPT는 이미 2022년에 RLHF + PPO로 모델을 인간 선호에 맞췄다. 2023년 DPO는 이 복잡한 RLHF pipeline을 더 단순한 preference optimization으로 우회했고, 2024년 DeepSeekMath는 critic을 없앤 GRPO를 제안했다.

2017PPO2022RLHF / InstructGPT2023DPO2024GRPO2025Reasoning RL / RLVR2026Agentic RLLong-horizon · Harnessed RLOutput preference→Reasoning outcome→Trajectory / Action / Outcome

내가 보는 핵심 변화는 이것이다.

RLHF era
“이 답변이 사람 마음에 드는가?”
↓

Reasoning RL era
“정답에 도달했는가?”
↓

Agentic RL era
“환경 속에서 올바른 행동을 연속적으로 선택해
실제 목표를 달성했는가?”

바로 이 마지막 질문이 고전적인 RL의 문제 정의와 거의 정확히 겹친다.

02. 가장 처음부터: Supervised Learning과 RL은 뭐가 다른가?

Supervised Learning에서는 정답이 이미 있다.

SUPERVISED LEARNING
정답을 따라 배운다
Input x
Ground Truth y
↓
Prediction ŷ
↓
Loss(y, ŷ)
REINFORCEMENT LEARNING
행동의 결과를 보고 배운다
State
↓ Action
Environment
↓
Reward + Next State

SFT는 “좋은 행동이 무엇인지”를 예시로 보여준다.

RL은 여러 행동을 직접 시도하고 그 결과를 받아, 더 높은 장기 보상을 만드는 행동 확률을 높인다.

그래서 새로운 상황에서 단순 imitation만으로 해결하기 어려운 planning, exploration, retry, tool selection 같은 문제가 등장하면 RL이 매력적이 된다.

03. RL의 기본 세계관: MDP

강화학습의 가장 기본적인 수학적 틀은 Markov Decision Process(MDP)다.

MDP = (S, A, P, R, γ)

S : State space
A : Action space
P : Transition dynamics
R : Reward function
γ : Discount factor

시점 t에서 Agent는 상태 st를 보고 정책 πθ(a|s)에 따라 action을 선택한다.

st
↓
πθ(at | st)
↓
at
↓
Environment
↓
rt, st+1

목표는 단순히 바로 다음 reward를 크게 만드는 게 아니라 미래 reward를 합친 Return을 최대화하는 것이다.

Gt = rt + γrt+1 + γ²rt+2 + ···

γ가 1에 가까우면 먼 미래의 결과도 중요하게 본다. Agentic AI에서 long-horizon task가 어려운 이유가 여기서 바로 나온다.

04. 실제 AI Agent는 MDP보다 POMDP에 더 가깝다

현실의 Agent는 세상의 전체 상태를 볼 수 없다.

Browser Agent는 현재 HTML 일부만 보고, 고객 서비스 Agent는 필요한 고객 정보 중 일부만 보고, Coding Agent는 repository 전체의 의도를 완벽히 알지 못한다.

그래서 더 정확한 모델은 Partially Observable Markov Decision Process(POMDP)다.

RL 개념 LLM Agent에서는
Observation ot User message · HTML · Tool result · Retrieved docs
State st Context + memory + interaction history
Action at Tool call · Search query · Click · Code patch · Message
Transition Tool/API/Environment가 상태를 변경
Reward Task success · test pass · policy compliance · cost

Microsoft Agent Lightning도 이 관점으로 Agent 실행을 추상화한다. 각 LLM call을 action으로 보고, 나머지 agent harness와 environment를 RL 환경으로 감싸는 방식이다.

05. Value, Q, Advantage — RL 논문 읽을 때 반드시 나오는 세 단어

RL은 “지금 이 행동이 좋은가?”를 미래까지 포함해 평가해야 한다.

Vπ(s)
State Value
이 상태에서 앞으로 평균적으로 얼마나 잘될까?
Qπ(s,a)
Action Value
이 상태에서 이 행동을 하면 앞으로 얼마나 잘될까?
A(s,a) = Q(s,a) − V(s)
Advantage
평균적인 행동보다 이 action이 얼마나 더 좋았나?

Policy Gradient에서 중요한 건 이 Advantage다.

평균보다 좋았던 action은 확률을 올리고, 평균보다 나빴던 action은 확률을 내린다.

06. Bellman Equation — 미래 가치를 재귀적으로 본다

Vπ(s) = Eπ[ rt + γVπ(st+1) | st=s ]

지금 상태의 가치는 지금 받는 reward + 다음 상태의 미래 가치다.

이 단순한 식이 RL 전체를 관통한다.

Agent에게도 똑같다.

지금 검색 버튼을 누르는 행동 자체는 reward가 없어도, 그 행동이 좋은 evidence를 가져오고 결국 task success를 만든다면 credit을 받아야 한다.

그리고 이 “나중에 성공했는데, 대체 어느 행동 덕분이었나?”가 Agentic RL에서 가장 큰 문제 중 하나다.

07. Policy Gradient — 확률 자체를 직접 학습한다

LLM은 본질적으로 다음 token에 대한 확률분포를 만든다.

πθ(y | x)
= Πt πθ(yt | x, y<t)

RL에서는 높은 reward를 만든 sequence의 확률을 높인다.

∇θJ(θ) ≈ E[ ∇θ log πθ(a|s) · A(s,a) ]

직관은 간단하다.

Advantage > 0
→ 이 행동의 log-probability를 올린다

Advantage < 0
→ 이 행동의 log-probability를 내린다

문제는 RL gradient가 매우 noisy하다는 것이다. 그래서 baseline, critic, clipping 같은 장치들이 필요해진다.

08. Actor-Critic과 PPO — 왜 RLHF에서 PPO를 썼을까?

Actor-Critic은 역할을 둘로 나눈다.

ACTOR
Policy πθ
어떤 action을 선택할지 결정
CRITIC
Value Vφ
현재 state의 미래 가치를 추정

PPO는 policy를 한 번에 너무 크게 바꾸지 않도록 old policy 대비 probability ratio를 clip한다.

ratiot(θ) = πθ(at|st) / πold(at|st)

LPPO = E[min( ratiotAt, clip(ratiot, 1−ε, 1+ε)At )]

한 번 좋은 reward를 받았다고 해당 response probability를 폭발적으로 올리는 걸 막는 셈이다.

PPO는 안정적이지만 LLM에서는 무겁다. policy만큼 큰 critic/value model을 운영하고, reference model, reward model까지 붙으면 GPU memory와 pipeline 복잡도가 커진다.

09. RLHF — RL이 LLM에 처음 대중적으로 들어온 방식

Pretrained LLM
↓
SFT
Human demonstrations
↓
Reward Model
Human preference ranking
↓
PPO
Reward ↑ + KL constraint
↓
Aligned Policy

InstructGPT의 핵심 구조다.

여기서 reward는 정답/오답이 아니라 “사람이 어느 답변을 더 선호하는가”라는 상대적으로 주관적인 신호다.

그래서 별도의 Reward Model이 필요했다.

10. 잠깐, DPO는 왜 나왔지?

PPO-based RLHF는 너무 복잡했다.

DPO는 preference pair를 이용해 Reward Model + online RL loop를 명시적으로 돌리지 않고 policy를 직접 preference 방향으로 최적화한다.

중요한 구분
DPO는 RLHF objective와 밀접한 관계가 있지만, 실무적으로는 offline preference optimization에 가깝다.

현재 policy가 environment를 탐색하며 새로운 trajectory를 생성하고 reward를 받아 다시 policy를 업데이트하는 Agentic RL의 online interaction loop와는 성격이 다르다.

Agent 시대에 RL이 다시 주목받는 이유도 이 차이에 있다.

행동하면서 새 데이터를 만들어야 하기 때문이다.

11. GRPO — Critic을 없애고 “같은 문제의 다른 답”끼리 비교한다

2024년 DeepSeekMath가 소개한 Group Relative Policy Optimization(GRPO)는 2025년 DeepSeek-R1을 통해 아주 유명해졌다.

핵심은 PPO의 critic을 없애는 것이다.

하나의 Prompt q
↓
Response 1 → reward 0
Response 2 → reward 1
Response 3 → reward 0
Response 4 → reward 1
↓
같은 group 안에서 상대평가
Ai = (ri − mean(r1:G)) / std(r1:G)

같은 문제에서 다른 sample보다 잘한 response는 positive advantage를 받는다.

거대한 value model을 하나 더 두지 않아도 되니 LLM reasoning RL에서 굉장히 매력적이다.

12. DeepSeek-R1이 충격적이었던 이유: Reward만 줬는데 reasoning behavior가 나타났다

DeepSeek-R1-Zero는 SFT cold start 없이 base model에 대규모 RL을 직접 적용한 실험이었다.

Reward도 의외로 단순했다.

ACCURACY REWARD
Math 정답 match
Code test / compiler result
FORMAT REWARD
정해진 output format 준수

별도의 neural outcome/process reward model을 쓰지 않았고, reasoning style을 세세하게 가르치지 않았는데도 RL 과정에서 reflection, alternative approach exploration, 더 긴 thinking 같은 행동이 나타났다.

AIME 2024 pass@1도 training 과정에서 15.6%에서 71.0%까지 올라갔다고 보고됐다.

여기서 나온 큰 질문
좋은 행동을 모두 demonstration으로 써줘야 할까?
아니면 좋은 outcome을 정의하면 모델이 행동 전략을 스스로 발견할 수 있을까?

13. RLVR — Reward Model보다 “검증 가능한 정답”을 쓴다

여기서 최근 많이 보이는 단어가 RLVR: Reinforcement Learning with Verifiable Rewards다.

Reward를 사람이 매번 라벨링하거나 learned reward model로 추정하는 대신, 프로그램적으로 검증할 수 있는 signal을 쓴다.

Task Verifier
Math Exact / symbolic answer checker
Code Unit tests · compiler · SWE benchmark
SQL Execution result · expected table
Tool use Environment task success

이게 중요한 이유는 reward hacking 때문이다.

Reward Model이 imperfect하면 policy는 진짜 목적보다 reward model의 허점을 잘 공략하는 방법을 배울 수 있다.

검증 가능한 reward는 상대적으로 이 문제가 적다.

다만 RLVR도 만능은 아니다. “친절한 상담”, “좋은 투자 설명”, “적절한 보험 심사”처럼 정답이 하나가 아닌 업무에는 scalar verifier를 정의하는 순간 다시 어려움이 생긴다.

14. Outcome Reward vs Process Reward — 마지막만 채점하면 충분할까?

OUTCOME REWARD
끝만 본다
최종 정답인가?
Task가 성공했나?
PROCESS REWARD
중간 과정도 본다
각 reasoning step은 타당한가?
Tool 선택은 적절했나?

OpenAI의 Let's Verify Step by Step은 수학 reasoning에서 process supervision이 outcome supervision보다 더 강할 수 있음을 보여줬다.

하지만 process reward는 비용이 크다. 어느 step이 “한 단계”인지 정의해야 하고, step별 reward label도 필요하다.

DeepSeek-R1도 PRM을 대규모 RL에 적용하는 과정에서 step 정의의 어려움, annotation 비용, reward hacking 문제를 지적했다.

15. DAPO — GRPO를 실제 대규모 Long-CoT RL에 돌리면 생기는 문제를 고쳤다

2025년 DAPO는 꽤 engineering-heavy한 논문이라 재미있다.

“RL 이론을 하나 새로 만들었다”기보다는 실제 long reasoning training에서 GRPO가 망가지는 지점을 하나씩 고친다.

Problem DAPO Fix 의미
Entropy collapse Clip-Higher 좋은 rare token의 확률 상승을 더 허용
전부 정답/전부 오답 group Dynamic Sampling gradient signal 없는 prompt 제거
긴 CoT loss bias Token-level PG Loss response 길이에 따른 왜곡 완화
길이 초과 reward noise Overlong Reward Shaping hard penalty 대신 부드러운 길이 제어

이걸 보면 RL에서는 알고리즘 이름보다 reward variance, entropy, rollout distribution, sequence length 같은 training dynamics가 훨씬 중요하다는 걸 알 수 있다.

16. 그래서 Agentic AI가 되면 왜 RL의 필요성이 더 커질까?

Chatbot은 대체로 한 번의 response quality를 최적화하면 된다.

Agent는 다르다.

Observe
↓
Plan
↓
Search
↓
Tool Call
↓
Observe Result
↓
Re-plan
↓
Execute
↓
Verify
↓
Outcome

중간 단계마다 여러 action 후보가 존재한다.

“정답 trajectory”를 인간이 전부 만들어 SFT하는 것보다 Agent가 environment에서 여러 trajectory를 시도하고 outcome을 받아 스스로 좋은 전략을 찾도록 하는 게 자연스러워진다.

핵심 변화
Static dataset → Interactive experience
Agent가 일을 수행하면서 만드는 trajectory 자체가 새로운 training data가 된다.

17. 2025 연구들: RL이 Tool 사용 자체를 학습하기 시작했다

WebAgent-R1

WebAgent-R1은 web environment에서 직접 multi-turn rollout을 생성하고, task success라는 binary reward만으로 end-to-end RL을 수행했다.

WebArena-Lite에서 Qwen2.5-3B의 task success가 6.1% → 33.9%, Llama-3.1-8B는 8.5% → 44.8%로 올라갔다고 보고했다.

흥미로운 건 “정답 web trajectory”를 전부 imitation한 게 아니라 실제 interaction 자체에서 학습했다는 점이다.

ToolRL / ReTool

ToolRL은 tool-use에서 reward design을 본격적으로 분석했고, tool 선택, parameter 사용, temporal reward가 얼마나 중요한지 보여준다.

ReTool은 reasoning 중 code interpreter를 실제로 호출하면서 RL을 통해 언제 Tool을 쓰고, 언제 자연어 reasoning을 계속할지를 스스로 학습하게 했다.

이건 Agent 시대의 핵심 변화다.

이제 Tool use는 prompt에 적어놓은 instruction이 아니라 학습 가능한 policy가 된다.

18. Agentic RL의 진짜 난제: Credit Assignment

수학 문제는 마지막 답이 맞으면 reward = 1을 줄 수 있다.

그런데 30-step Agent가 마지막에 실패했다고 해보자.

Step 1 · Query rewrite ✓
Step 2 · Search ✓
Step 3 · Select document ✓
...
Step 17 · Tool call ?
Step 18 · Wrong parameter ✗
...
Step 30 · Task failed reward = 0

모든 step에 똑같이 0이라는 signal을 주면 잘한 행동과 잘못한 행동을 구분하기 어렵다.

이것이 credit assignment problem이다.

2026년 HCAPO는 성공/실패가 끝난 뒤 trajectory를 뒤돌아보면서 어떤 intermediate action이 결과에 실제로 기여했는지 LLM 자체를 post-hoc critic으로 활용해 credit을 재분배하는 방향을 제안했다.

Qwen2.5-7B-Instruct 기준으로 GRPO 대비 WebShop에서 +7.7%p, ALFWorld에서 +13.8%p success rate 개선을 보고했다.

19. Multi-turn RL은 생각보다 잘 망가진다 — RAGEN의 Echo Trap

RAGEN 연구는 multi-turn Agent RL이 single-turn reasoning RL보다 훨씬 불안정하다는 걸 보여준다.

연구진은 reward variance가 급격히 사라지고 gradient가 튀는 Echo Trap이라는 training pathology를 관찰했다.

더 흥미로운 결과는, coarse outcome reward만으로 RL을 돌린다고 깊은 reasoning이 자동으로 생기는 건 아니라는 점이다.

Reasoning RL ≠ Agent RL
수학 문제에서는 “정답”이 강력한 verifier지만, Agent 환경에서는 행동이 길고 environment가 stochastic하다.

Reward sparsity, environment noise, tool failure, state change가 추가되면서 훨씬 어려운 RL 문제가 된다.

20. 2026년 Long-Horizon Agent RL 연구가 말하는 의외의 것: Environment가 중요하다

2026년 3월 Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents는 TravelPlanner를 이용해 Agentic RL을 꽤 체계적으로 분해했다.

연구가 본 축은 다섯 가지였다.

Reward Shaping Model Scale Data Composition RL Algorithm Environment Stability

특히 눈에 띈 결과는 환경의 안정성이 무너지면 policy 자체가 degradation될 수 있다는 점이다.

작은 모델은 staged reward와 exploration 보조가 더 유용했고, 큰 모델은 비교적 단순한 dense reward로도 빠르게 converge했다.

또 해당 환경에서는 난이도를 섞은 약 1K training samples가 in-domain과 out-of-domain 성능의 sweet spot으로 관찰됐다.

중요한 Insight
Agentic RL에서는 환경도 학습 시스템의 일부다.

Simulator가 flaky하거나 tool 결과가 재현되지 않으면, reward noise가 모델 noise처럼 들어간다.

21. 그리고 2026년 8월: Harnessed Agentic RL

개인적으로 지금 가장 흥미로운 최신 흐름 중 하나다.

기존 Agent RL은 training engine이 environment interaction까지 어느 정도 통제하는 구조가 많았다.

Microsoft의 Agent Lightning v1.0은 실제 production-style Agent Harness가 interaction loop를 소유하고, trainer는 거기서 발생하는 LLM request-response trajectory를 관찰해 학습한다.

HARNESSED AGENTIC RL
Deploy-time Agent Harness
Tools · Context · Memory · Control Flow · Environment
↓ emits trajectories
LLM Request / Response / Reward
↓
RL Trainer
Advantage · Policy Update · New Checkpoint
↓ redeploy
Improved Agent

이게 중요한 이유는 Harness가 단순 inference wrapper가 아니라 model post-training의 일부가 되기 때문이다.

Agent Lightning v1.0 논문에서는 약 6K training examples와 비교적 제한된 compute로 Qwen3.5-9B의 SWE-bench Verified 성능을 41.8% → 56.4%로 끌어올린 coding-agent RL 결과를 보고했다.

앞으로 Agent product의 moat가 prompt나 model choice뿐 아니라 우리 Agent가 실제 업무에서 만들어낸 experience data가 될 수 있다는 뜻이다.

22. 그런데 RL에서 진짜 제품 요구사항은 Reward Function이다

Agent를 RL로 학습한다면 가장 중요한 질문은 “어떤 알고리즘?”보다 먼저 이것이다.

무엇을 성공이라고 정의할 것인가?

예를 들어 금융권 상담 Agent의 reward를 단순히 “상담을 빨리 끝냈다”로 만들면 질문을 적게 하고 빨리 종료하는 Agent가 최적일 수 있다.

그래서 reward는 보통 여러 signal의 조합이 된다.

R =
+ 2.0 × task_success
+ 1.0 × groundedness
+ 0.5 × customer_resolution
− 0.2 × tool_cost
− 0.1 × latency
− 1.0 × unnecessary_escalation
− 5.0 × policy_violation

그런데 여기에도 함정이 있다.

policy violation에 -5를 주는 순간 Agent는 “보상이 충분히 크면 규칙을 위반해도 된다”고 수학적으로 해석할 수 있다.

금융권에서는 특히
Regulation / Permission / Security를
“Soft Reward”로만 두면 안 된다.
일부 조건은 reward가 아니라 Hard Constraint / Policy Gate여야 한다.

23. Reward와 Constraint를 분리하자

종류 예시 처리
Soft Objective Latency · Cost · Answer quality Reward scalarization
Hard Constraint Unauthorized data access Action blocked
Human Gate Payment · Contract · Production change Approval required

이게 RL safety를 현실 시스템에 붙일 때 중요한 구분이다.

24. Exploration vs Exploitation — Agent가 새로운 방법을 시도해야 발전한다

RL의 고전적인 딜레마다.

EXPLOITATION
아는 최선의 방법
안정적 · 당장 reward 높음
EXPLORATION
새로운 전략 시도
실패 가능 · 더 좋은 policy 발견 가능

Reasoning RL에서 entropy collapse가 문제인 이유도 모델이 너무 빨리 한 가지 reasoning pattern에 고정되기 때문이다.

Agentic RL에서는 더 중요하다. Search query, Tool selection, navigation route의 exploration이 필요하다.

하지만 production 금융 시스템에서 실제 고객 돈을 가지고 exploration할 수는 없다.

25. 금융권 Agentic RL은 Production에서 “시험”하면 안 된다

그래서 금융권에서는 RL training environment 설계가 모델보다 중요해질 수 있다.

FINANCIAL AGENTIC RL PIPELINE
Production Traces
↓ de-identify / curate
Offline Dataset + Replay
↓
Sandbox / Simulator / Digital Twin
Mock API · synthetic customer · historical scenario
↓ rollout
Verifier / Reward Engine
Task · Grounding · Cost · Policy
↓
RL Trainer
↓ eval gate
Offline Eval → Canary → Human-supervised Production

실제 production은 exploration environment가 아니라 검증된 policy의 constrained execution environment여야 한다.

26. 금융권에서 RL을 붙이기 좋은 Agent / 아직 이른 Agent

Use Case RL Suitability 이유
Text-to-SQL Agent HIGH Execution reward가 명확
RAG Search Agent HIGH Search trajectory + answer verifier
Internal Coding Agent HIGH Tests / sandbox verifier
Ops Triage Agent MEDIUM Replay 가능하나 reward 정의 필요
Claims Final Decision LOW 고위험 · reward가 규제/책임을 대체 불가
Investment Execution VERY LOW 실제 exploration 비용이 너무 큼

27. 모든 Agent에 RL이 필요한 건 아니다

RL이 유행한다고 모든 Agent를 RL fine-tuning할 필요는 없다.

RL을 고려할 신호
✓ 같은 업무 trajectory가 반복적으로 많이 발생한다.
✓ 성공 여부를 reasonably reliable하게 평가할 수 있다.
✓ Prompt / Harness 튜닝만으로 성능 ceiling이 보인다.
✓ 새로운 상태에서 generalization이 중요하다.
✓ Agent가 여러 action 중 전략을 선택해야 한다.
✓ Simulator 또는 safe rollout environment가 있다.
RL보다 먼저 다른 걸 할 신호
✗ workflow가 deterministic하다.
✗ reward를 정의할 수 없다.
✗ training trajectory가 거의 없다.
✗ 한 번의 오류 비용이 매우 크다.
✗ 아직 tracing/eval조차 없다.

이런 경우에는 SFT, prompt, retrieval, harness, deterministic workflow가 훨씬 싸고 안전하다.

28. 내가 보는 진짜 변화: Agent Trace가 이제 Training Data가 된다

앞에서 LangSmith observability 이야기를 했었다.

그때는 trace를 debug와 eval을 위한 데이터로 봤다.

Agentic RL까지 오면 하나가 더 붙는다.

Production Agent
↓
Trace / Trajectory
↓
Outcome / Feedback
↓
Evaluation
↓
RL Training Data
↓
Better Policy
↓
Production Agent ↺

즉 observability pipeline과 training pipeline이 연결된다.

기업이 가진 진짜 자산이 foundation model weight가 아니라 자기 조직에서 축적되는 고품질 interaction trajectory가 될 수 있다.

COMPOUNDING LOOP
Better Agent
→ More Useful Work
→ Better Experience Data
→ Better Reward / Eval
→ Better Policy
→ Better Agent

29. 지금 읽어볼 만한 RL / Agentic RL 논문

FOUNDATION
PPO — Schulman et al., 2017
Policy update를 clip해 안정화. RLHF 알고리즘 계보를 이해하려면 필수.
ALIGNMENT
InstructGPT — Ouyang et al., 2022
SFT → Reward Model → PPO라는 RLHF pipeline의 대표 사례.
VALUE-FREE RL
DeepSeekMath / GRPO — 2024
Critic 없이 group-relative reward로 advantage 계산.
REASONING RL
DeepSeek-R1 — 2025
Rule-based reward + 대규모 RL로 reasoning self-evolution을 보여준 대표 사례.
SCALE
Kimi k1.5 — 2025
Long-context RL scaling과 policy optimization을 결합. MCTS/PRM 없이 강한 reasoning 성능.
RL ENGINEERING
DAPO — 2025
Entropy collapse, dynamic sampling, long-CoT loss 같은 대규모 RL pathology를 실제로 고친다.
AGENTIC RL
WebAgent-R1 / ToolRL / RAGEN — 2025
Web navigation, tool use, multi-turn trajectory로 RL을 확장.
CREDIT ASSIGNMENT
HCAPO — 2026
Long-horizon sparse reward에서 hindsight로 step-level credit을 보강.
LATEST · AUG 2026
Agent Lightning v1.0
Deploy-time Harness가 직접 RL environment loop를 소유하는 Harnessed Agentic RL.

30. 결국 Agentic AI 시대의 RL은 “모델 학습” 이상의 이야기다

지금 RL을 다시 공부하면서 가장 재미있는 부분은 예전에 배웠던 MDP, policy, reward, value 같은 개념이 갑자기 LLM Agent architecture와 그대로 연결된다는 것이다.

Policy
→ LLM / Agent Model

State
→ Context / Memory / Environment

Action
→ Tool / Search / API / Code

Reward
→ Task Outcome / Eval / Business KPI

Environment
→ Agent Harness + Enterprise Systems

그리고 여기서 중요한 건 RL algorithm만 잘 고르면 된다는 이야기가 아니다.

실제 Agentic RL의 품질은 Environment · Harness · Reward · Verifier · Trajectory Data의 품질에 크게 좌우된다.

MY TAKE
Pretraining은 AI에게 세상을 읽는 법을 가르쳤고,
SFT는 원하는 행동을 따라 하는 법을 가르쳤다면,
RL은 이제 Agent에게 직접 행동하고 결과에서 배우는 법을 가르치고 있다.

그래서 앞으로 기업 AI의 경쟁력도 “어떤 Foundation Model을 썼는가?”에서 조금 더 이동할 수 있다.

“우리 Agent는 실제 업무 경험에서 얼마나 잘 배우는가?”

이 질문이 중요해지는 순간, Agent Platform은 inference platform에서 Experience → Evaluation → Learning까지 포함하는 Improvement System으로 바뀐다.


Papers & References

00. University of Alberta — Rich Sutton, Professor of Computing Science

00-2. ACM — 2024 A.M. Turing Award: Andrew Barto & Richard Sutton

01. Schulman et al. — Proximal Policy Optimization Algorithms

02. OpenAI — InstructGPT / Aligning Language Models to Follow Instructions

03. Rafailov et al. — Direct Preference Optimization

04. Shao et al. — DeepSeekMath / Group Relative Policy Optimization

05. DeepSeek-AI — DeepSeek-R1

06. Kimi Team — Kimi k1.5: Scaling Reinforcement Learning with LLMs

07. Yu et al. — DAPO: An Open-Source LLM Reinforcement Learning System at Scale

08. Lightman et al. — Let's Verify Step by Step

09. Wen et al. — Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning

10. Wei et al. — WebAgent-R1

11. Qian et al. — ToolRL: Reward is All Tool Learning Needs

12. Feng et al. — ReTool: Reinforcement Learning for Strategic Tool Use in LLMs

13. Wang et al. — RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn RL

14. Wu et al. — Demystifying RL for Long-Horizon Tool-Using Agents

15. Tan et al. — Hindsight Credit Assignment for Long-Horizon LLM Agents

16. Microsoft Research — Agent Lightning

17. He et al. — Agent Lightning v1.0: Towards Harnessed Agentic RL

18. Cheng et al. — Efficient RL for Long-Horizon Tool-Use Agentic Tasks

※ 2026년 논문 일부는 최신 preprint 단계입니다. 수치와 결론은 각 논문의 보고 결과이며, production 환경에 그대로 일반화하기보다 자체 task/environment에서 재검증하는 것이 필요합니다.
written by rubrub · AI / LLM / Agent Engineering