AI Agent 이야기를 하다 보면 결국 대화가 이쪽으로 흘러간다. THE DEFAULT QUESTION “그래서 어떤 모델이 제일 좋아요?” GPT냐 Claude냐 Gemini냐. Benchmark 몇 점인지, reasoning이 얼마나 좋은지, coding 성능이 몇 퍼센트인지 비교한다. 물론 모델은 중요하다. 그런데 2026년 Agent 생태계를 보다 보면, 모델만 비교하는 순간 시스템의 절반을 놓치고 있다는 느낌이 든다. 대표적인 사례가 Terminal-Bench다. SAME MODEL, DIFFERENT HARNESS Claude Opus 4.6는 그대로인..