본문 바로가기

경제·재테크

Claude Fable 5 GPT-5.6 Sol 비교 벤치마크 코딩 가격 차이 완전정리 2026

 

2026년 하반기, AI 모델 시장에 이례적인 대결 구도가 펼쳐지고 있습니다. Anthropic이 Claude Fable 5를 공개하고, OpenAI가 GPT-5.6 Sol을 내놓으면서 두 회사는 서로 다른 벤치마크를 들고 나와 "우리 모델이 더 낫다"고 주장 중입니다.

문제는 양쪽 주장이 모두 사실이라는 점입니다. 어떤 기준으로 보느냐에 따라 승자가 달라집니다. 이 글에서는 실제 수치를 직접 비교해 용도별로 어느 모델이 더 유리한지 정리했습니다.

■ 종합 점수 — BenchLM 기준
독립 벤치마크 집계 사이트 BenchLM의 2026년 7월 11일 기준 평가 결과는 다음과 같습니다.

Claude Fable 5: 91점 (종합 2위)
GPT-5.6 Sol: 86점 (미순위)

5점 차이로 Fable 5가 앞서는 것처럼 보이지만, 이 숫자 뒤에 훨씬 복잡한 이야기가 숨어 있습니다. 두 모델이 공유하는 벤치마크가 8개뿐이어서 BenchLM도 "부분 증거 비교"임을 명시합니다. 카테고리별로 뜯어봐야 실체가 드러납니다.

■ 코딩 — Fable 5의 압도적 우위
가장 큰 격차가 나는 분야입니다. 코딩 카테고리 평균 점수는 Fable 5가 85.6점, Sol이 64.6점으로 21점 차이 납니다.

핵심 벤치마크인 SWE-bench Pro에서 Fable 5는 80%, Sol은 64.6%를 기록했습니다. SWE-bench Pro는 실제 오픈소스 프로젝트의 GitHub 이슈를 AI가 직접 수정하도록 하는 테스트로, 장난감 코딩 문제가 아닌 실제 소프트웨어 엔지니어링 현장과 가장 가까운 벤치마크로 평가받습니다.

또 다른 코딩 지표인 cursorBench32에서도 Fable 5가 70.5%, Sol이 67.2%로 Fable 5가 일관되게 앞섰습니다.

■ 에이전틱 작업 — Sol의 역전
터미널 자동화, 웹 탐색, 멀티스텝 에이전트 작업에서는 Sol이 역전합니다. 에이전틱 카테고리 평균에서 Sol이 92.0점, Fable 5가 85.3점으로 Sol이 6.7점 앞섭니다.

Terminal-Bench 2.0: Fable 5 84.3% vs Sol 91.9% (Sol +7.6%p)
BrowseComp: Fable 5 86.9% vs Sol 92.2% (Sol +5.3%p)

BrowseComp는 AI가 웹을 탐색하며 특정 정보를 찾아오는 능력을 측정합니다. 터미널과 브라우저 기반 자동화 에이전트를 구축하는 쪽이라면 Sol이 실질적으로 더 유리한 선택입니다.

■ 멀티모달 — Fable 5 우세
이미지·차트·도표를 이해하는 멀티모달 능력에서는 Fable 5가 다시 앞섭니다.

MMMU-Pro: Fable 5 92.7% vs Sol 83.0% (Fable 5 +9.7%p)

멀티모달 카테고리 평균도 Fable 5 92.9점, Sol 83.0점입니다. 시각 자료 분석, 차트 해석, 이미지 기반 UI 구현 등의 작업에서 Fable 5가 일관되게 높은 점수를 냅니다.

■ 수학·과학 — Fable 5 우세
USAMO 2026(고등 수학 올림피아드) 기준 Fable 5는 97.6%를 기록했습니다. 수학 카테고리 평균에서 Fable 5가 97.6점, Sol이 87.5점으로 10점 이상 앞섭니다.

■ 지식 — Sol의 우위 (단, 해석 주의)
흥미로운 역전이 일어나는 구간이 지식 카테고리입니다. 평균 점수가 Sol 94.6점, Fable 5 68.6점으로 Sol이 26점 앞섭니다. 다만 GPQA(박사 수준 과학 질문) 기준으로는 Sol 94.6% vs Fable 5 94.5%로 사실상 동점입니다. 카테고리 평균 격차의 상당 부분은 두 모델이 서로 다른 세트의 벤치마크를 측정한 탓이어서 그대로 받아들이기 어렵습니다.

■ 벤치마크 전쟁의 진실 — 각자 유리한 것만 내세운다
Anthropic은 Fable 5 발표 시 SWE-bench Pro(80%), SWE-bench Verified(95%), MMMU-Pro(92.7%)를 전면에 내세웠습니다. Sol이 앞서는 BrowseComp나 Terminal-Bench는 자사 보도자료에 포함됐지만 강조 수위가 달랐습니다.

OpenAI는 Sol 발표 시 Terminal-Bench 2.1(88.0%), BrowseComp(92.2%), GPQA(94.6%)를 강조했습니다. SWE-bench Pro에서 크게 뒤지는 점은 부각되지 않았습니다.

두 회사 모두 거짓말을 하는 게 아닙니다. 각자 자신이 이기는 벤치마크를 선택해 발표한 것뿐입니다. 독자 입장에서는 "어떤 벤치마크가 내 실제 용도와 맞는가"를 먼저 따져야 합니다.

■ 가격 — Sol이 절반
성능 격차만큼이나 중요한 변수가 가격입니다.

Claude Fable 5: 입력 100만 토큰당 $10 / 출력 100만 토큰당 $50
GPT-5.6 Sol: 입력 100만 토큰당 $5 / 출력 100만 토큰당 $30

Sol이 입력에서 절반, 출력에서 약 40% 저렴합니다. 월 100만 토큰 입출력을 사용하는 소규모 팀 기준으로 Fable 5는 월 $60, Sol은 월 $35입니다. 연간 $300 차이. 월 1,000만 토큰 규모의 스타트업이라면 Fable 5 월 $600 vs Sol 월 $350으로 연간 $3,000 차이가 발생합니다.

컨텍스트 창은 Fable 5가 100만 토큰 이상, Sol이 100만 토큰으로 사실상 동급입니다.

■ 용도별 실전 선택 가이드
시나리오 1 — 코드 리뷰·리팩토링 중심 개발자
SWE-bench Pro 기준 Fable 5가 15.4%p 앞섭니다. 대규모 코드베이스를 다루거나 복잡한 버그를 추적하는 작업이라면 Fable 5가 명확한 우위입니다. 비용이 2배 가까이 더 들더라도 코딩 정확도의 차이가 그 값어치를 한다는 평가가 많습니다.

시나리오 2 — 웹 자동화·에이전트 파이프라인 구축
BrowseComp와 Terminal-Bench에서 Sol이 일관되게 앞섭니다. 웹 탐색 에이전트, RPA(로봇 프로세스 자동화), 멀티스텝 작업 자동화가 주된 용도라면 Sol이 비용 절반에 더 높은 에이전틱 점수를 제공합니다.

시나리오 3 — 일반 사용자·API 스타트업
글쓰기·요약·번역 등 일반 용도에서는 두 모델 간 실사용 품질 차이가 체감하기 어렵습니다. 가격이 절반인 Sol이 합리적인 선택입니다. Claude.ai Pro 구독 중이라면 Fable 5를 추가 비용 없이 쓸 수 있으니 구독자에게는 그게 더 낫습니다.

■ 정리
코딩: Fable 5 (SWE-bench Pro 80% vs 64.6%, +15.4%p)
에이전틱 자동화: Sol (Terminal-Bench 91.9% vs 84.3%, BrowseComp 92.2% vs 86.9%)
멀티모달·이미지: Fable 5 (MMMU-Pro 92.7% vs 83%)
수학·과학: Fable 5 (카테고리 평균 97.6 vs 87.5)
가격: Sol (입력 50%, 출력 40% 저렴)
BenchLM 종합: Fable 5 91점, Sol 86점

"어떤 AI가 더 좋냐"는 질문에 단답은 없습니다. 코드를 짜야 한다면 Fable 5, 웹 에이전트를 돌려야 한다면 Sol, 비용을 아껴야 한다면 Sol이 답입니다. 양쪽이 내세우는 벤치마크가 다 사실인 이유가 바로 여기 있습니다.

(자료 출처: BenchLM 2026.7.11, Anthropic 공식 발표자료, OpenAI GPT-5.6 발표자료 종합)