Blog / Dev / Claude Fable 5 사용기 — 벤치마크와 실제 작업을 구분해 보기
Dev

Claude Fable 5 사용기 — 벤치마크와 실제 작업을 구분해 보기

Claude Fable 5를 직접 사용한 경험과 Anthropic 발표 수치를 나눠 정리하고, 조건이 다른 타사 벤치마크를 모델 선택 근거로 쓸 때의 한계를 설명한다.

2026년 7월 21일 업데이트: Fable 5는 6월 12일 미국의 수출통제 지시로 일시 중단됐다가 7월 1일 복구됐다. 6월 22일까지 무료 포함된다는 아래의 초기 정책은 현재 상태가 아니다. Anthropic의 6월 30일 발표 기준으로 7월 7일 이후에는 사용 크레딧이 필요하며, 실제 이용 가능 범위는 계정의 모델 선택 화면에서 다시 확인해야 한다.

Anthropic은 6월 9일 Claude Fable 5를 공개했다. Claude 5 패밀리의 첫 모델이자 Opus보다 위에 둔 Mythos급 모델이다. Fable 5와 Claude Mythos 5는 같은 기반 모델을 사용하지만, Fable에는 일반 공개를 위한 보안 장치가 추가되고 Mythos는 승인된 조직에 제한된다.

출시 당시 가격은 100만 토큰당 입력 10달러, 출력 50달러였다. 구독 포함 기간과 접근 정책은 출시 직후부터 여러 번 바뀌었다. 이런 정보는 글에 고정된 숫자보다 Anthropic의 현재 모델 페이지와 자신의 계정 화면을 확인하는 편이 정확하다.

무료 포함 기간에 직접 사용해 봤다. 아래에서는 두 종류의 근거를 섞지 않는다. Fable과 Opus의 작업 경험은 개인 체감이고, 모델 점수는 각 회사가 공개한 평가 자료다. GPT·Gemini·Grok은 같은 작업으로 직접 비교하지 않았다.

벤치마크는 문제 집합, 도구 사용, 계산 예산, 실행 횟수에 따라 달라진다. 같은 이름의 벤치마크라도 평가 설정이 다르면 숫자를 한 순위표에 놓을 수 없다. 모델을 고를 때는 자신의 저장소에서 같은 작업과 완료 조건으로 다시 비교해야 한다.


Anthropic 발표에서 Opus 4.8과 무엇이 달랐나

Anthropic의 출시 자료에서는 Fable 5가 장기 작업과 소프트웨어 엔지니어링 평가에서 Opus 4.8보다 높은 점수를 기록했다. 아래 표는 Anthropic이 같은 발표 안에서 제공한 수치이며, 독립 평가 결과로 읽으면 안 된다.

영역 Fable 5 Opus 4.8 차이
SWE-bench Pro 80.0% 69.2% +10.8p
SWE-bench Verified 95.0% 88.6% +6.4p
FrontierCode 약 2배 격차 최대

코딩 점수보다 흥미로운 건 장기 자율 작업이다. 파일 기반 지속 메모리를 줬을 때 Fable 5는 같은 설정의 Opus 4.8보다 성능 향상 폭이 3배 컸다. 이전 상태를 쌓아가며 며칠 단위로 이어지는 에이전트 작업에서 차이가 두드러진다는 뜻이다.

비전 능력도 눈에 띈다. 지도나 상태 정보 없이 게임 스크린샷만으로 포켓몬 파이어레드를 완료했는데, 이전 모델들은 같은 과제에 추가 보조 장치가 필요했다. 스크린샷에서 웹앱 소스코드를 복원하거나 과학 도표에서 수치를 추출하는 것도 가능하다.

지식·분석 쪽에서는 Hex 분석 벤치마크 90% 첫 돌파, Hebbia 금융 벤치마크 시니어급 금융 추론 부문 역대 최고 점수를 기록했다. 독립 평가에서도 Every팀이 실제 시니어 엔지니어 채용에 쓰는 테스트에서 91/100으로 Opus 4.8 대비 큰 폭의 상승을 보였다.

Anthropic은 일부 작업에서 더 적은 턴으로 완료했다고 설명했다. 트레이드오프는 가격과 보안 폴백이다. Fable이 제한된 요청을 거부하면 다른 Claude 모델이 대신 처리될 수 있으므로, 모든 영역에서 Fable 자체의 능력을 사용한다고 가정하면 안 된다.


직접 써본 체감 — 깔끔해졌고, 무엇보다 빨라졌다

벤치마크 표는 표고, 무료 기간에 실제 작업에 붙여본 체감을 적는다.

가장 먼저 느낀 건 결과물의 정돈됨이다. Opus도 결과 자체는 좋았지만, Fable은 같은 요청에 대해 군더더기가 적고 구조가 깔끔하게 잡힌 결과물을 내놓는다. 코드든 문서든 “이걸 다시 다듬어야겠다”는 후속 작업이 눈에 띄게 줄었다.

두 번째는 내 작업에서의 속도다. 응답 대기와 재작업이 모두 줄었다. 다만 시간과 작업 유형을 고정해 측정한 실험은 아니므로, 공개 자료의 25~30% 수치를 내 경험이 검증했다고 말할 수는 없다.

다만 아쉬운 점도 분명했다. 토큰 소모량이 엄청나다. 단가가 Opus의 2배라 같은 양을 작업해도 세션 한도가 2배 속도로 깎인다. 평소에는 여러 프로젝트를 한 번에 같이 돌리는 식으로 작업해왔는데, Fable로 같은 패턴을 돌렸더니 20분 만에 세션 토큰을 다 써버렸다. 구독 한도 안에서 쓰는 입장에서는 병렬 작업 습관을 그대로 가져가기 어렵다. Fable을 쓸 때는 무거운 작업 하나에 집중시키고, 나머지는 하위 모델로 돌리는 식으로 운용을 바꿔야 했다.

출시 당시에는 구독 포함 기간이 6월 22일까지로 안내됐다. 이후 수출통제로 접근이 중단되고 7월 1일 복구되면서 정책도 다시 바뀌었다. 모델의 품질과 별개로 가용성과 과금 방식이 짧은 기간에 변할 수 있다는 점이 실제 운용의 가장 큰 변수였다.

내 작업에서는 결과를 다듬는 횟수와 대기 시간이 줄었다. 반면 같은 요청을 여러 모델에 반복하고 성공 기준을 기록하지 않았으므로, 이 체감을 일반적인 우위로 확대해서는 안 된다. 비용과 접근 정책까지 포함해 판단해야 한다.


타사 모델 점수를 한 표에 놓을 때 생기는 문제

아래는 출시 당시 여러 공개 자료에서 가져온 수치를 한곳에 모은 표다. 하지만 각 행의 실행 환경과 계산 예산이 같지 않아 순위표로 사용할 수 없다. SWE-bench Pro는 실제 저장소 이슈 해결 능력을 재지만, 같은 문제 집합이라는 사실만으로 동일한 실험이 되지는 않는다.

모델 SWE-bench Pro 가격 (입력/출력, 1M 토큰) 강점
Claude Fable 5 80.3% $10 / $50 에이전트 코딩, 낮은 환각률
Grok 4 ~75% $3 / $15 비용 대비 코딩 가성비
GPT-5.5 58.6% $5 / $30 컴퓨터 사용(GUI 조작)
Gemini 3.1 Pro 54.2% $2 / $12 최저가, 멀티모달·롱컨텍스트

따라서 Fable과 2위의 차이가 11점이라는 식으로 해석하지 않는다. 비교에 쓰려면 각 점수의 원문에서 도구 사용 여부, 샘플 수, 추론 예산, 평가 날짜를 먼저 맞춰야 한다. 이 조건을 맞추기 어렵다면 후보를 좁히는 참고 자료로만 사용한다.

코딩 밖의 지표들도 챙겨볼 만하다.

  • 환각률: 평가마다 “모른다”고 답하는 경우와 틀린 답을 세는 방식이 다르다. 한 수치만으로 제품 전체의 사실 정확도를 판단하지 않는다.
  • 컴퓨터 사용: 브라우저·GUI 조작은 GPT-5.5가 앞선다. OSWorld Verified 78.7%로 인간 기준선(72.4%)을 넘었고 가격도 Fable의 절반이다.
  • 과학 추론: GPQA Diamond에서는 GPT-5.5(94.4%)와 Gemini 3.1 Pro(94.3%)가 거의 동률 선두다. 모든 영역에서 Fable이 1등인 건 아니다.
  • 컨텍스트: Fable 5와 Gemini 3.1 Pro 둘 다 1M 토큰급 컨텍스트 윈도우를 제공한다.

벤치마크를 읽을 때 함정 둘. 첫째, SWE-bench Pro는 Python, Go, TypeScript, JavaScript 4개 언어 41개 저장소 기반이라 이 언어권 밖에서는 점수가 그대로 적용된다는 보장이 없다. 둘째, 가장 화려한 일부 점수(공격적 사이버보안 평가 등)는 일반 구매가 불가능한 Mythos 5의 것이다. Fable 5 자체는 해당 영역이 차단되어 있다.


내 개발 작업에서는 이렇게 비교해야 한다

내가 주로 개발하면서 사용하는 것들 — 웹/앱은 React와 Flutter, 게임은 Unity, 서버는 Next.js — 을 기준으로 벤치마크를 해석하면:

  • React/Next.js: TS/JS가 평가에 포함되더라도 내 저장소의 프레임워크 버전과 규칙은 다르다. 같은 이슈를 후보 모델에 맡기고 테스트 통과와 수정량을 비교한다.
  • Flutter/Dart: 주요 코딩 벤치마크 밖이라 공개 순위로 판단하기 어렵다. 작은 실제 이슈를 같은 프롬프트와 테스트로 비교한다.
  • Unity/C#: 전용 벤치마크가 없다. C# 학습 데이터는 풍부해 일반 추론 우위가 이어질 가능성이 높지만, Unity 엔진 특수 지식은 변수라 직접 A/B 테스트가 답이다.

비용은 토큰 단가가 아니라 해결한 작업당 비용(cost per solved task)으로 봐야 한다. 단가는 2배지만 더 적은 턴으로 끝내서 재시도 비용이 상쇄될 수 있다. 실제로 써보면 재작업이 줄어드는 게 체감되기 때문에, 무거운 작업 한정으로는 단가 차이가 생각보다 아프지 않다. 반대로 멈춤 규칙이 약한 워크플로에서는 하네스가 끊을 때까지 계속 작업해 비싸지니, 잘 정의된 큰 작업을 통째로 맡기는 용도가 맞다.

Claude Code의 모델 선택 방식과 계정별 제공 범위는 바뀔 수 있다. 현재 모델 목록을 먼저 확인하고, 사용할 수 있다면 작은 검증 작업으로 비용과 결과를 측정한다.


정리

  • Anthropic의 발표에서 Fable 5는 Opus 4.8보다 장기 작업과 코딩 평가 점수가 높았다. 이것은 공급사 평가라는 출처를 붙여 읽어야 한다.
  • 내 작업에서는 결과를 다듬는 횟수와 대기 시간이 줄었지만, 통제된 A/B 테스트는 아니었다.
  • 출시 단가는 Opus 4.8의 두 배였고, 내 사용에서는 병렬 작업을 돌릴 때 한도가 빠르게 줄었다. 같은 현상이 모든 계정과 작업에서 재현된다고 단정할 수는 없다.
  • 과학 추론처럼 다른 모델의 발표 점수가 높은 영역도 있다. 서로 다른 발표 자료만으로 “만능 1등”을 정하지 않는다.
  • 모델은 6월 12일 중단됐다가 7월 1일 복구됐고 과금 정책도 바뀌었다. 실제 가용성과 비용은 사용 시점에 다시 확인해야 한다.

확인한 공식 자료

모델 선택에는 발표 점수보다 같은 저장소·같은 작업·같은 완료 조건에서 측정한 해결 비용이 더 유용하다.

댓글

블로그 목록으로
ACHIEVEMENT UNLOCKED
LOADING...
SCORE 000000
HITS
0