GPT‑6 Astra vs Claude Fable 5.1 vs Gemini 3.8 Flash
벤치마크 1등을 샀는데 왜 우리 서비스에서는 1등이 아닐까?
이번 주 모델 선정 회의에 이런 표가 올라왔다고 해보자.
“A 모델이 코딩 벤치마크 1등입니다. 이제 전부 A로 바꾸죠.”
그럴듯하지만, 위험한 결론이다. 벤치마크는 모델의 한 장면을 측정한다. 반면 실제 서비스는 프롬프트, 도구, 검색, 권한, 지연시간, 실패 복구, 토큰 비용이 한꺼번에 움직이는 긴 영화다. 오늘은 2026년 9월의 대표 모델인 OpenAI GPT‑6 Astra, Anthropic Claude Fable 5.1, Google Gemini 3.8 Flash를 놓고, 진짜로 비교해야 할 것이 무엇인지 살펴본다.
최고의 모델은 모델 단독의 속성이 아니다.
최종 성능 = 모델 × 프롬프트 × 도구 × 데이터 × 정책 × 운영 환경
1. 세 모델, 사실은 서로 다른 종목의 선수다
GPT‑6 Astra
컴퓨터 사용, 코딩 에이전트, 전문 업무 자동화에 무게를 둔 최상위 모델. 1M급 장문 컨텍스트와 강한 도구 사용이 핵심이다.
Claude Fable 5.1
복잡한 추론과 장시간 에이전트 작업을 겨냥한 플래그십. 적응형 사고가 항상 켜져 있고 1M 컨텍스트를 제공한다.
Gemini 3.8 Flash
속도와 처리량을 중시하는 Flash 계열 최신 모델. 대규모 멀티모달 입력과 반복 호출이 많은 서비스에 매력적이다.
문제는 이 셋을 자동차의 제로백처럼 한 숫자로 줄일 때 생긴다. Fable은 깊은 추론에 계산을 더 쓰는 방향이고, Flash는 이름부터 빠른 대량 처리를 겨냥한다. Astra는 화면 조작과 코딩 에이전트까지 넓게 밀고 있다. 서로 다른 목적함수를 가진 제품을 한 줄로 세우면, 숫자는 깔끔해져도 의사결정은 흐려진다.
2. 최신 점수표를 읽는 올바른 방법
OpenAI의 Astra 발표 페이지에는 세 모델을 같은 표에 놓은 결과가 있다. 아래는 그중 운영과 가까운 일부 항목이다.
| 평가 | GPT‑6 Astra | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|
| Terminal‑Bench 4.0 | 57.9% | 55.8% | 19.1% |
| DeepSWE v1.1 | 74.1% | 67.4% | 73.8% |
| GPQA Diamond | 96.0% | 93.7% | 95.3% |
| Artificial Analysis Coding Agent Index | 67.0 | — | 61.2 |
중요: 위 수치는 OpenAI가 자사 발표 페이지에서 보고한 결과다. 평가 하네스와 추론 설정, 도구 사용 조건에 따라 달라질 수 있으며, 독립적인 종합 순위로 읽으면 안 된다.
표만 보면 Astra가 앞선다. 하지만 DeepSWE에서는 Astra와 Gemini의 차이가 0.3%p다. 이 정도 차이는 프롬프트 한 줄, 샘플 구성, 실행 재시도 정책으로 뒤집힐 수 있다. 더구나 사용자가 좋아하는 답과 업무 정답은 다르다. 수백만 건의 사람 투표가 쌓인 LMArena는 대화 선호도를 보는 데 유용하지만, 금융 규정 해석이나 코드 배포 안전성을 직접 보증하지 않는다.
3. 벤치마크가 우리 서비스에서 깨지는 5가지 이유
발표 점수는 높은 추론 예산, 여러 번의 샘플링, 전용 도구 하네스를 쓸 수 있다. 운영의 기본 API 호출과 같은 조건인지 먼저 봐야 한다.
에이전트는 검색 정확도, 브라우저 제어, 코드 실행 환경, 재시도 로직에 크게 좌우된다. 같은 모델도 하네스가 달라지면 다른 제품처럼 행동한다.
저렴한 모델이 세 번 재시도하고 긴 답을 내면 더 비싸질 수 있다. 비교 단위는 ‘100만 토큰’이 아니라 ‘성공한 업무 한 건’이어야 한다.
입력창이 넓어도 중간 정보 회수, 지시 충돌, 관련 문서 선택이 약하면 성능은 떨어진다. 컨텍스트 크기와 유효 회수율은 별도 지표다.
규제가 강한 업무에서는 무조건 답하는 모델이 위험하다. 반대로 허용된 요청까지 자주 막으면 생산성이 무너진다. 정확도와 함께 과잉 거절률도 재야 한다.
4. 가격표에도 함정이 숨어 있다
| 모델 | 입력 / 1M tokens | 출력 / 1M tokens | 운영 메모 |
|---|---|---|---|
| GPT‑6 Astra | $10 | $50 | Fast 모드는 최대 2배 속도, 2배 가격 |
| Claude Fable 5.1 | $10 | $50 | 적응형 사고 상시 사용 |
| Claude Opus 5 | $5 | $25 | 플래그십과 비용 사이의 선택지 |
| Claude Sonnet 5 | $2 | $10 | 빠른 대량 작업용 후보 |
Anthropic은 Sonnet 5의 새 토크나이저가 같은 텍스트를 이전 세대보다 약 30% 더 많은 토큰으로 계산할 수 있다고 안내한다. 즉 ‘토큰당 가격이 내려갔다’와 ‘우리 청구액이 같은 비율로 내려간다’는 같은 문장이 아니다. Gemini도 모델과 구간, 캐시·배치 여부에 따라 가격이 달라지므로 현재 공식 가격표로 실제 입력 샘플을 계산하는 편이 안전하다.
Cost per successful task = (입력 + 출력 + 도구 호출 + 재시도 비용) ÷ 성공한 업무 수
구매 회의는 7분 만에 종료
답변은 길고 도구 호출도 반복
싼 토큰 ≠ 싼 업무
5. 그래서 어떤 모델을 어디에 써야 할까?
정답은 ‘하나를 고른다’가 아니라 업무별로 라우팅한다에 가깝다.
분류·요약·대량 처리
복잡 추론·코딩·에이전트
민감정보·승인된 리전
개념도이며 절대 순위가 아니다. 실제 위치는 업무와 설정에 따라 움직인다.
| 업무 | 우선 후보 | 꼭 확인할 지표 |
|---|---|---|
| 대량 분류·짧은 요약 | Gemini Flash / Sonnet | p95 지연, 건당 비용, 누락률 |
| 코딩 에이전트 | Astra / Fable | 테스트 통과율, 롤백률, 도구 오류 |
| 복잡한 문서 추론 | Fable / Astra / Opus | 근거 정확도, 인용 회수율, 재현성 |
| 긴 멀티모달 입력 | Gemini 계열 | 영상·음성 이해, 장문 중간 회수 |
| 고위험 금융 의사결정 | 승인된 배포 모델 + 검증기 | 오답 비용, 과잉 거절, 설명·감사 가능성 |
여기서 ‘후보’는 승자를 뜻하지 않는다. 여러분의 데이터로 결승전을 치를 선수 명단이다. 예를 들어 금융 상담에서 가장 말솜씨 좋은 모델보다, 근거 문장을 정확히 인용하고 모르면 멈추며 승인 경로를 지키는 모델이 더 좋은 모델이다.
6. 실무 평가: 일주일이면 여기까지 할 수 있다
- 실제 실패 사례 100~300개를 모은다. 예쁜 데모 질문보다 고객 문의, 장애 티켓, 규정 질의, 잘못된 코드 패치를 우선한다.
- 모든 모델에 같은 하네스를 준다. 시스템 프롬프트, 검색 결과, 도구 권한, 타임아웃, 재시도 횟수를 고정한다.
- 5개 축을 함께 잰다. 품질, p95 지연, 성공 업무당 비용, 거절률, 행동 안전성이다.
- 블라인드 쌍대 비교를 한다. 모델 이름을 가리고 현업 담당자가 A/B 결과를 선택한다.
- 처음에는 Shadow Mode로 운영한다. 실제 요청을 복제해 결과만 비교하고, 자동 실행 권한은 주지 않는다.
실패 사례 100~300개
도구·프롬프트 고정
모델명 가리고 평가
실서비스 복제 검증
Azure Foundry에서도 모델 사용 가능 리전과 배포 유형을 별도로 확인해야 한다. Global 배포는 추론 처리가 다른 Azure 리전에서 이뤄질 수 있고, Data Zone·Regional 배포는 처리 범위가 다르다. ‘Azure에서 제공된다’와 ‘우리 데이터 경계 요건을 만족한다’는 동의어가 아니다.
7. 아주 간단한 모델 라우터 예시
if request.contains_sensitive_data:
return approved_regional_model
if request.risk == "high":
answer = deep_reasoning_model(request)
return verifier.check(answer, require_human=True)
if request.is_bulk or request.latency_budget_ms < 1000:
return fast_model(request)
answer = default_model(request)
if answer.confidence < threshold:
return deep_reasoning_model(request)
return answer
핵심은 모델 이름을 코드 곳곳에 박아 넣지 않는 것이다. 정책 라우터 뒤에 모델을 배치하면 가격이 바뀌거나 새 모델이 나와도 업무 규칙은 유지된다. 오늘의 1등을 영구 계약하는 대신, 내일의 더 나은 모델이 들어올 자리를 만들어 두는 셈이다.
마무리: 승자를 뽑지 말고 팀을 구성하자
Astra가 모든 업무의 답도 아니고, Fable이 모든 추론의 답도 아니며, Flash가 모든 비용 문제의 답도 아니다.
가벼운 요청은 빠른 모델로, 복잡한 요청은 깊은 모델로, 고위험 요청은 검증기와 사람에게 보낸다. 결국 경쟁력은 ‘어떤 모델을 샀는가’보다 어떤 평가·라우팅·감사 체계를 만들었는가에서 나온다.
참고 자료
- OpenAI — Introducing GPT‑6 Astra
- Anthropic — Claude models overview
- Anthropic — What’s new in Claude Sonnet 5
- Google AI for Developers — Gemini models
- Google AI for Developers — Gemini API pricing
- Microsoft Learn — Models sold directly by Azure
- Microsoft Learn — Azure model region availability
- LMArena — Text leaderboard
※ 2026년 9월 5일 공개된 공식 문서를 기준으로 작성했습니다. 모델 사양·가격·가용 리전은 수시로 바뀔 수 있습니다. 벤치마크 결과는 각 제공사의 설정과 평가 방법에 영향을 받으므로, 실제 도입 전 자체 데이터 평가가 필요합니다.