본문 바로가기

경제·재테크

GPT-5.6 Sol Terra Luna 벤치마크 성능 클로드 파이블5 비교 분석 2026

 

GPT-5.6이 7월 9일 정식 출시됐습니다. Sol·Terra·Luna 세 가지 버전입니다. "드디어 클로드를 이겼다"는 말도 있고, "아직 클로드가 앞선다"는 말도 있습니다. 벤치마크 수치를 직접 확인했습니다.

■ GPT-5.6 패밀리 — 세 가지 버전의 차이
OpenAI가 이번에 단일 모델이 아닌 3단 구조로 출시했습니다.

Sol: 최고 성능 플래그십. 어려운 작업용. $5/$30 per 100만 토큰(입력/출력)
Terra: 균형형. 대부분의 업무에 적합. $2.50/$15 per 100만 토큰
Luna: 최저가·최고속. 대량 처리용. $1/$6 per 100만 토큰

세 모델 모두 컨텍스트 윈도우 105만 토큰, 최대 출력 12만8,000토큰, 지식 기준일 2026년 2월 16일로 동일합니다.

참고로 Claude Fable 5(클로드 파이블 5)는 $10/$50 per 100만 토큰입니다. Sol과 비교하면 Fable 5가 2배 비쌉니다.

■ 분야별 벤치마크 — Sol이 이기는 곳, 지는 곳
"Sol이 모든 걸 이겼다"는 말은 사실이 아닙니다. 분야별로 승자가 완전히 다릅니다. OpenAI 공식 발표 수치와 주요 독립 벤치마크를 직접 확인했습니다.

【전문 업무 — Sol 우위】
Agents' Last Exam(55개 분야 전문 업무): Sol 52.7% > Claude Fable 5 40.5%
실제 전문가 업무를 시뮬레이션하는 이 벤치마크에서 Sol이 12%p 이상 앞섭니다.

Management Consulting Tasks: Sol 43.2% > Claude Fable 5 35.5%
Big Finance Bench: Sol 53% > Claude Opus 4.8 44% (Fable 5 수치 미공개)

단, Artificial Analysis Intelligence Index v4.1에서는 Claude Fable 5 59.9 > Sol 58.9로 Fable 5가 근소하게 앞섭니다.

【코딩 — Claude Mythos 5 압도적 우위】
SWE-Bench Pro(실제 GitHub 이슈 해결): Claude Mythos 5 80.3%, Claude Fable 5 80% >> Sol 64.6%
이 부분이 가장 충격적입니다. 코딩 에이전트로 쓰려면 Sol보다 Claude Mythos 5가 압도적으로 앞섭니다.

Terminal-Bench 2.1(터미널 작업): Sol Ultra 91.9% > Claude Fable 5 83.1%
터미널 명령어·스크립트 작업은 Sol이 강합니다.

DeepSWE v1.1: Sol 72.7% > Claude Fable 5 69.7%

【브라우징·컴퓨터 사용 — Sol 명확한 우위】
BrowseComp(웹 정보 탐색): Sol Ultra 92.2% > Claude Mythos 5 88%
OSWorld 2.0(컴퓨터 화면 조작): Sol 62.6% >> Claude Opus 4.8 54.8%
BenchCAD(도면·설계 작업): Sol 70.6% >> Claude Fable 5 38.4%

브라우저를 직접 조작하거나 화면을 보며 작업하는 AI 에이전트 용도라면 Sol이 가장 앞섭니다.

【사이버보안 — 분야별 엇갈림】
CTF 챌린지(해킹 방어 과제): Sol 96.7% — 전체 최상위
SEC-Bench Pro(보안 분석): Sol Ultra 74.3% — 최상위
ExploitBench(취약점 익스플로잇): Claude Mythos 5 78% > Sol 73.5%

공격적 취약점 분석은 Claude Mythos 5가 앞서고, 방어·탐지 영역은 Sol이 강합니다.

【수학·추론 — 거의 비슷, Tier 4는 Claude 우위】
GPQA Diamond(대학원 수준 과학 문제): Sol 94.6% ≈ Claude Mythos 5 Preview 94.6% ≈ Gemini 3.1 Pro 94.3%
상위 모델들이 거의 동일합니다.

FrontierMath Tier 1-3(최고 난도 수학): Sol 89% > Claude Fable 5 87%
FrontierMath Tier 4(극한 수학): Claude Fable 5 87.8% > Sol 83%
최고 난도 수학 문제에서는 Fable 5가 앞섭니다.

ARC-AGI-3(추상적 적응 추론): Sol 7.78% > 전체. 하지만 모두 낮음 — AI 추상 추론은 아직 미해결 과제.

【과학·의학 — Sol 강세】
GeneBench Pro(유전체·생물학): Sol 28.7% >> Claude Opus 4.8 16%
(Claude Fable 5는 질문 대부분 거부로 측정 불가)
HealthBench Professional(의료 임상 업무): Claude Fable 5 60.9% ≈ Sol 60.5% — 사실상 동률.

■ 핵심 요약 — Sol이 앞서는 곳 vs 지는 곳
Sol이 앞서는 영역: 전문 업무 에이전트, 브라우징, 컴퓨터 조작, 사이버 방어, 생물과학, 터미널 작업
Claude가 앞서는 영역: 코딩 에이전트(SWE-Bench), 도구 사용(Toolathlon), 극한 수학(FrontierMath Tier 4), 종합 인텔리전스 지수(Artificial Analysis)

■ 가격 대비 성능 — 이게 진짜 핵심
성능만 봐서는 '어느 쪽이 낫다'고 단정할 수 없습니다. 그런데 가격을 보면 이야기가 달라집니다.

Claude Fable 5: $10/$50 per 100만 토큰
GPT-5.6 Sol: $5/$30 per 100만 토큰 → Fable 5 대비 절반 가격

비슷한 성능(일부 분야에서 Sol 우위, 일부에서 Fable 5 우위)을 절반 가격에 쓸 수 있다는 게 Sol 출시의 핵심 의미입니다.

더 놀라운 건 Terra입니다. Terra는 Sol보다 많은 벤치마크에서 Sol에 근접한 점수를 보이면서 가격은 Sol의 절반($2.50/$15)입니다. AI 서비스를 운영하는 개발자라면 Terra가 실제로 가장 합리적인 선택이 될 수 있습니다.

■ 내 상황별 — 어떤 모델을 써야 하나
일반 ChatGPT 사용자:
GPT-5.6 기반으로 업데이트됐거나 업데이트 예정입니다. 일상적인 글쓰기, 요약, 질문 답변 용도에서는 Sol이나 Terra나 큰 차이를 느끼기 어렵습니다. Claude나 ChatGPT 구독 중이라면 그대로 쓰면 됩니다.

코드를 주로 짜는 개발자:
SWE-Bench Pro 기준으로는 Claude Mythos 5(또는 Fable 5)가 GPT-5.6 Sol보다 훨씬 앞섭니다. 코딩 에이전트(Cursor, Windsurf 등)에서 Claude가 기본값인 데는 이유가 있습니다.

AI 서비스를 만드는 개발자·창업자:
Terra가 가장 현실적입니다. Sol 대비 절반 가격, 많은 업무에서 Sol에 근접한 성능. 분기별 AI 비용이 수천만 원 이상이라면 Sol → Terra 전환만으로도 비용이 크게 줄어듭니다. 아주 어려운 작업만 Sol로 라우팅하는 전략이 권장됩니다.

브라우징·리서치·보안 분석 에이전트:
Sol이 명확하게 가장 강합니다. BrowseComp, OSWorld, CTF 챌린지 전반에서 최상위입니다.

■ 마무리
GPT-5.6 Sol은 강력한 모델이지만 "모든 것을 이긴 모델"은 아닙니다. 코딩에서는 Claude Mythos 5·Fable 5가 여전히 앞서고, 수학 극한 문제는 Fable 5가 우위입니다. Sol이 진짜 빛나는 곳은 브라우징·컴퓨터 조작·과학·전문 에이전트 업무이고, 가격 대비 성능에서는 Sol과 Terra가 Fable 5를 명확히 압도합니다.

AI 모델 선택의 정답은 "가장 비싼 모델"이 아니라 "내 용도에 맞는 모델"입니다.

(자료 출처: Kingy.ai GPT-5.6 Benchmarks, OpenAI 공식 발표(2026.7.9), SWE-Bench Pro, Terminal-Bench 2.1, ARC-AGI-3, Artificial Analysis Intelligence Index v4.1 등)