rubrub 님의 블로그

  • 홈
  • 태그
  • 방명록

HarnessEngineering 1

[AI] 하네스 엔지니어링 — 같은 모델인데 왜 성능이 18%p나 달라질까?

AI Agent 이야기를 하다 보면 결국 대화가 이쪽으로 흘러간다. THE DEFAULT QUESTION “그래서 어떤 모델이 제일 좋아요?” GPT냐 Claude냐 Gemini냐. Benchmark 몇 점인지, reasoning이 얼마나 좋은지, coding 성능이 몇 퍼센트인지 비교한다. 물론 모델은 중요하다. 그런데 2026년 Agent 생태계를 보다 보면, 모델만 비교하는 순간 시스템의 절반을 놓치고 있다는 느낌이 든다. 대표적인 사례가 Terminal-Bench다. SAME MODEL, DIFFERENT HARNESS Claude Opus 4.6는 그대로인..

AI 2026.09.03
이전
1
다음
더보기
프로필사진

rubrub 님의 블로그

영-차. 현재 외국계 금융 회사에서 AI Engineer로 근무 중.

  • 분류 전체보기 (55)
    • Computer Vision (0)
    • LLM (13)
    • MLOps (3)
    • AI 논문 리뷰 (5)
    • Azure (1)
    • Responsible AI (RAI) (2)
    • AI (23)
    • AI 보안 (4)
    • 금융 (0)
    • 기타 (0)
    • 경제 (4)

Tag

aiagent, Azure, 금융권 AI, Agentic RAG, agenticai, 금융AI, AI, ai agent, Grpo, rag, LLM, 생성형ai, RLHF, autogen, langsmith, agentic ai, MLOps, vllm, graphrag, AzureML,

최근글과 인기글

  • 최근글
  • 인기글

최근댓글

공지사항

페이스북 트위터 플러그인

  • Facebook
  • Twitter

Archives

Calendar

«   2026/09   »
일 월 화 수 목 금 토
1 2 3 4 5
6 7 8 9 10 11 12
13 14 15 16 17 18 19
20 21 22 23 24 25 26
27 28 29 30

방문자수Total

  • Today :
  • Yesterday :

Copyright © Daum Corp. All rights reserved.

티스토리툴바