rubrub 님의 블로그

  • 홈
  • 태그
  • 방명록

RL 1

[AI] Agentic AI 시대, 강화학습이 다시 뜨는 이유 — RLHF에서 Agentic RL까지

요즘 Agentic AI 논문을 보다 보면 한 단어가 계속 다시 등장한다.개인적으로...RL을 다시 공부하면서 조금 반갑게 느껴지는 이유가 있다. 나는 캐나다 University of Alberta를 나왔는데, 이 학교에는 강화학습 교과서로 유명한 Richard S. Sutton 교수가 있다. (Reinforcement Learning: An Introduction의 Sutton 교수님! Andrew Barto와 함께 현대 강화학습의 개념과 알고리즘적 토대를 만든 인물이고, 두 사람은 그 공로로 2024 ACM A.M. Turing Award까지 받았다. )예전에 Sutton 교수님의 특강을 듣고 사진도 한 장 찍은 적이 있다. 당시엔 신기한 경험 정도였는데, 몇 년 뒤 Agentic AI 시대에 다시 ..

AI 2026.09.04
이전
1
다음
더보기
프로필사진

rubrub 님의 블로그

영-차. 현재 외국계 금융 회사에서 AI Engineer로 근무 중.

  • 분류 전체보기 (55)
    • Computer Vision (0)
    • LLM (13)
    • MLOps (3)
    • AI 논문 리뷰 (5)
    • Azure (1)
    • Responsible AI (RAI) (2)
    • AI (23)
    • AI 보안 (4)
    • 금융 (0)
    • 기타 (0)
    • 경제 (4)

Tag

graphrag, agenticai, langsmith, autogen, 금융AI, rag, Grpo, Agentic RAG, agentic ai, LLM, 생성형ai, 금융권 AI, aiagent, vllm, Azure, AzureML, RLHF, ai agent, MLOps, AI,

최근글과 인기글

  • 최근글
  • 인기글

최근댓글

공지사항

페이스북 트위터 플러그인

  • Facebook
  • Twitter

Archives

Calendar

«   2026/09   »
일 월 화 수 목 금 토
1 2 3 4 5
6 7 8 9 10 11 12
13 14 15 16 17 18 19
20 21 22 23 24 25 26
27 28 29 30

방문자수Total

  • Today :
  • Yesterday :

Copyright © Daum Corp. All rights reserved.

티스토리툴바