본문 바로가기

인공지능

GPT-5.6 Sol, Terra, Luna 성능 분석: 더 높은 성능과 낮은 비용으로 AI 모델 경쟁력 강화

728x90
반응형
728x170

GPT-5.6 시리즈, 성능과 비용 효율을 동시에 잡다

OpenAI의 GPT-5.6 시리즈인 Sol, Terra, Luna가 공개되면서 AI 모델 경쟁 구도가 다시 한번 변화하고 있습니다. Artificial Analysis의 사전 평가 결과에 따르면 GPT-5.6 Sol은 Intelligence Index에서 최고 수준의 성능을 기록하면서도 경쟁 모델 대비 약 3분의 1 수준의 비용을 제공했으며, 코딩 에이전트 평가에서는 가장 높은 점수를 기록했습니다.

이번 글에서는 Artificial Analysis의 평가 결과를 기반으로 GPT-5.6 Sol, Terra, Luna의 성능과 비용 효율성, 그리고 주요 특징을 정리해보겠습니다.

반응형

Artificial Analysis Intelligence Index 결과

Artificial Analysis는 다양한 대규모 언어 모델을 동일한 기준으로 평가하는 벤치마크를 제공합니다.

GPT-5.6 시리즈의 주요 결과는 다음과 같습니다.

모델Intelligence Index

Claude Fable 5 (Max) 60
GPT-5.6 Sol (Max) 59
GPT-5.6 Terra (Max) 55
GPT-5.6 Luna (Max) 51

가장 주목할 부분은 GPT-5.6 Sol입니다.

Claude Fable 5(Max)보다 단 1점 낮은 59점을 기록하면서도 동일한 수준의 추론 능력을 훨씬 낮은 비용으로 제공하는 것이 특징입니다.

또한 Terra와 Luna 역시 각각 55점과 51점을 기록하며 다양한 가격대에서 선택할 수 있는 모델 라인업을 구성하고 있습니다.


약 3분의 1 수준의 비용으로 최고 수준의 성능 제공

Artificial Analysis Intelligence Index 기준으로 GPT-5.6 Sol(Max)은 작업(Task)당 약 1.04달러의 비용이 발생합니다.

이는 유사한 수준의 성능을 제공하는 Claude Fable 5(Max) 대비 약 3분의 1 수준의 비용입니다.

특히 GPT-5.6 시리즈는 성능과 비용의 균형(Pareto Frontier)을 고려한 모델 구성이 특징입니다.

  • GPT-5.6 Sol은 최고 수준의 성능 제공
  • GPT-5.6 Terra는 Sol 대비 약 50% 낮은 비용
  • GPT-5.6 Luna는 Sol 대비 약 80% 낮은 비용

또한 Luna(Max)는 GLM-5.2(Max)와 Gemini 3.5 Flash 이상의 성능을 보다 낮은 비용으로 제공하는 것으로 평가되었습니다.


Coding Agent 분야에서는 GPT-5.6 Sol이 가장 높은 평가

이번 평가에서 가장 눈에 띄는 결과는 Coding Agent Index입니다.

GPT-5.6 Sol(Max)은 80점을 기록하며 전체 모델 가운데 가장 높은 점수를 획득했습니다.

평가에는 다음과 같은 코딩 벤치마크가 사용되었습니다.

  • DeepSWE
  • Terminal-Bench v2
  • SWE-Atlas-QnA

GPT-5.6 Sol은 세 가지 평가 모두에서 가장 높은 수준의 결과를 기록했으며, SWE-Atlas-QnA에서는 Grok 4.5와 동일한 수준의 성능을 보였습니다.

또한 작업당 비용 역시 경쟁 모델 대비 낮은 수준입니다.

  • Claude Fable 5(Max) 대비 약 40% 저렴
  • Claude Opus 4.8(Max) 대비 약 10% 저렴

Terra와 Luna 역시 각각 77점, 75점을 기록하며 높은 성능을 유지하면서 비용을 크게 절감했습니다.


프레젠테이션 품질에서도 최고 수준 기록

Artificial Analysis의 AA-Briefcase 벤치마크는 실제 업무 환경을 가정하여 다양한 문서 생성 능력을 평가합니다.

GPT-5.6 Sol(Max)은 전체 순위에서는 Claude Fable 5 다음으로 평가되었지만, Presentation Elo에서는 가장 높은 점수를 기록했습니다.

특히 다음과 같은 문서 생성에서 높은 평가를 받았습니다.

  • PowerPoint
  • Excel
  • 다양한 문서 형식

평가 결과에 따르면 GPT-5.6 Sol은 시각적으로 가장 완성도 높은 결과물을 생성하는 모델로 평가되었습니다.

반면, 종합적인 프로젝트 수행 능력을 평가하는 Rubric Score와 Analytical Quality Elo에서는 Claude Fable 5가 다소 앞서는 결과를 보였습니다.


GPT-5.6의 새로운 Cache Write 요금 정책

GPT-5.6 시리즈는 OpenAI 최초로 Cache Write Pricing을 도입했습니다.

모델별 가격은 다음과 같습니다.

모델 입력 토큰 출력 토큰
Sol $5 / 1M Tokens $30 / 1M Tokens
Terra $2.5 / 1M Tokens $15 / 1M Tokens
Luna $1 / 1M Tokens $6 / 1M Tokens

새롭게 추가된 특징은 Cache Write 비용입니다.

기존과 동일하게 Cache Read는 입력 비용 대비 90% 할인 정책을 유지하지만, Cache Write는 입력 토큰 비용의 1.25배가 적용됩니다.

이는 캐시에 저장된 데이터가 메모리를 지속적으로 점유하기 때문에 이를 반영한 정책으로 설명되었습니다.

또한 GPT-5.6 시리즈는 최대 추론(Max Reasoning) 설정도 새롭게 지원합니다.


더 적은 토큰으로 높은 성능 구현

GPT-5.6 Sol은 토큰 효율성에서도 개선된 모습을 보였습니다.

Artificial Analysis 평가 기준으로 Intelligence Index 작업당 평균 출력 토큰은 다음과 같습니다.

  • GPT-5.5 : 약 16K Tokens
  • GPT-5.6 Sol : 약 15K Tokens

즉, GPT-5.6 Sol은 이전 세대보다 더 적은 토큰을 사용하면서도 더 높은 성능을 제공합니다.

또한 Claude Opus 4.8(Max), GLM-5.2(Max), Gemini 3.5 Flash(High)보다 적은 토큰을 사용하면서 더 높은 지능 수준을 기록한 것으로 평가되었습니다.


GPT-5.6 시리즈 핵심 특징

이번 GPT-5.6 시리즈의 주요 특징을 정리하면 다음과 같습니다.

  • Intelligence Index에서 최고 수준의 성능 제공
  • GPT-5.6 Sol은 Claude Fable 5와 유사한 성능을 약 3분의 1 비용으로 제공
  • Coding Agent Index에서 전체 모델 중 최고 점수 기록
  • 프레젠테이션 품질(Presentation Elo) 최고 수준 달성
  • Cache Write Pricing 도입으로 새로운 비용 정책 적용
  • 이전 세대보다 적은 출력 토큰으로 더 높은 성능 구현
  • Sol, Terra, Luna를 통해 성능과 비용에 따라 다양한 선택 가능

728x90

Artificial Analysis의 평가 결과를 보면 GPT-5.6 시리즈는 단순히 성능 향상에 그치지 않고 비용 효율성과 실제 활용성까지 함께 개선한 모델이라는 점이 가장 큰 특징입니다.

특히 GPT-5.6 Sol은 Intelligence Index에서 최상위 모델과 거의 동일한 수준의 성능을 제공하면서도 비용을 크게 낮췄으며, Coding Agent 분야에서는 가장 높은 평가를 받았습니다. Terra와 Luna 역시 성능 대비 비용 효율을 강화하여 다양한 활용 환경에 맞는 선택지를 제공합니다.

이번 GPT-5.6 시리즈는 고성능 AI 모델을 보다 경제적으로 활용하려는 기업과 개발자에게 새로운 기준을 제시하며, 앞으로 AI 서비스의 비용과 성능을 함께 고려하는 흐름을 더욱 가속화할 것으로 기대됩니다.

300x250

https://x.com/ArtificialAnlys/status/2075268970492657905'

 

X의 Artificial Analysis님(@ArtificialAnlys)

GPT-5.6 Sol comes close second to Claude Fable 5 in the Artificial Analysis Intelligence Index at one third of the cost, and leads the Artificial Analysis Coding Agent Index in OpenAI’s Codex harness We supported @OpenAI with pre-release evaluation of GP

x.com

728x90
반응형
그리드형