
Grok 4.6이 Artificial Analysis Intelligence Index(AAII)에서 61점을 기록하며 최상위권 모델에 이름을 올렸습니다. Claude Opus 5와 Fable 5가 각각 63점과 62점으로 앞선 가운데, Grok 4.6은 GPT-5.6 Sol과 같은 61점을 기록했습니다.
특히 주목할 부분은 단순한 지능 점수보다 에이전트 작업 성능과 비용 효율성입니다. Grok 4.6은 도구를 활용해 여러 단계를 수행하는 작업에서 높은 성능을 보였으며, GPT-5.6 Sol이나 Claude Opus 5보다 낮은 토큰 가격을 유지하고 있습니다. 장시간 작업에서도 상대적으로 적은 턴과 입력 토큰을 사용해 작업을 수행한 것으로 나타났습니다.
이번 평가를 통해 Grok 4.6의 AAII 점수와 주요 모델과의 성능 차이, 에이전트 작업에서의 강점, 가격 대비 성능, 장시간 작업에서의 토큰 효율성을 살펴보겠습니다.
Grok 4.6, AAII 61점으로 최상위권 진입
Artificial Analysis Intelligence Index 기준으로 주요 모델의 점수는 다음과 같습니다.
- Claude Opus 5: 63점
- Claude Fable 5: 62점
- Grok 4.6: 61점
- GPT-5.6 Sol: 61점
Grok 4.6은 Grok 4.5보다 한 달여 만에 5점 상승했으며, Grok 4.3과 비교하면 23점이나 높아졌습니다.
특히 같은 61점을 기록한 GPT-5.6 Sol과 나란히 평가된다는 점이 눈에 띕니다. 최고 점수 자체는 Claude Opus 5가 앞서지만, Grok 4.6은 높은 종합 성능에 더해 비용 효율성을 함께 보여주고 있습니다.
정적 추론보다 에이전트 작업에서 강점
Grok 4.6의 특징은 단순히 질문에 답하는 형태의 정적 추론보다 도구를 사용하고 여러 단계를 거쳐 작업을 수행하는 에이전트 작업에서 더욱 두드러집니다.
GDPval-AA v2에서는 Elo 1753을 기록했습니다. 이는 Claude Opus 5 다음 수준이며, Claude Fable 5와 Qwen3.8 Max와는 신뢰구간이 겹치는 수준입니다.
다중 턴 고객 서비스와 도구 사용 능력을 평가하는 τ³-Banking에서는 50.7%를 기록했습니다. Qwen3.8 Max의 51.3%와 함께 상위 2개 점수에 해당합니다.
Terminal-Bench v2.1에서도 88.4%를 기록해 선두 모델들과 비슷한 수준의 결과를 보였습니다.
즉, Grok 4.6은 단순히 높은 지능 점수를 기록한 모델이라기보다, 여러 단계의 작업을 수행하는 에이전트 환경에서 경쟁력을 보여주는 모델로 볼 수 있습니다.
가격은 GPT-5.6 Sol과 Claude Opus 5보다 낮아
Grok 4.6의 기본 토큰 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러입니다.
주요 모델과 비교하면 다음과 같습니다.
| 모델 | 입력 100만 토큰 | 출력 100만 토큰 |
| Grok 4.6 | $2 | $6 |
| Claude Opus 5 | $5 | $25 |
| GPT-5.6 Sol | $5 | $30 |
특히 Grok 4.6은 GPT-5.6 Sol과 동일한 AAII 61점을 기록하면서도 출력 토큰 가격은 1/5 수준입니다.
Artificial Analysis가 측정한 작업당 비용은 $0.84로, Kimi K3와 동일합니다. 따라서 동일한 수준의 Intelligence Index 점수를 가진 모델과 비교했을 때 비용 측면에서 상당한 차이를 보입니다.
Artificial Analysis는 Grok 4.6을 Intelligence Index에 포함된 에이전트 평가에서 비용 대비 성능 Pareto frontier에 위치한 모델로 평가했습니다.
장시간 작업에서는 토큰 효율성이 중요
장시간 지식 작업을 평가하는 비공개 벤치마크 AA-Briefcase에서도 Grok 4.6은 주목할 만한 결과를 기록했습니다.
Grok 4.6의 Elo는 1577로 Claude Fable 5급 성능을 보였습니다. 평가 기준 충족도와 프레젠테이션, 분석 품질에서도 고르게 강한 결과를 기록했습니다.
더 중요한 부분은 작업을 완료하는 데 사용한 자원입니다.
Grok 4.6은 평균적으로 약 53턴과 0.5B 입력 토큰을 사용했습니다. 반면 Claude Opus 5(max)는 약 103턴과 2.0B 입력 토큰을 사용했습니다.
장시간 에이전트 작업에서는 단순히 100만 토큰당 가격만 비교하기 어렵습니다. 작업 과정에서 대화와 컨텍스트가 계속 누적되기 때문입니다.
따라서 같은 작업을 수행하더라도 필요한 턴 수와 입력 토큰이 적다면 실제 비용 차이는 더욱 커질 수 있습니다.
Grok 4.6의 결과는 이런 관점에서 의미가 있습니다. 낮은 토큰 단가뿐 아니라 작업 자체에서 사용하는 토큰량도 상대적으로 적었다는 점이 비용 효율성에 영향을 줄 수 있기 때문입니다.
500k 토큰 컨텍스트 윈도우와 캐시 가격
Grok 4.6의 컨텍스트 윈도우는 Grok 4.5와 동일한 500k tokens입니다.
캐시 적중 입력 가격은 100만 토큰당 $0.5로 책정됐습니다. 이는 Grok 4.5의 $0.3보다 상승한 수준입니다.
따라서 Grok 4.6의 비용 경쟁력을 살펴볼 때는 기본 입력·출력 가격뿐 아니라 실제 작업에서 발생하는 토큰 사용량과 캐시 가격까지 함께 고려할 필요가 있습니다.
Grok 4.6의 핵심 경쟁력은 비용 대비 성능
Grok 4.6의 가장 큰 특징을 정리하면 세 가지로 볼 수 있습니다.
첫째, AAII 61점이라는 높은 종합 성능입니다. GPT-5.6 Sol과 같은 점수를 기록하면서 최상위권에 진입했습니다.
둘째, 에이전트 작업 성능입니다. GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1 등 도구 활용과 다중 단계 작업을 평가하는 벤치마크에서 높은 결과를 기록했습니다.
셋째, 비용 효율성입니다. GPT-5.6 Sol과 Claude Opus 5보다 낮은 기본 토큰 가격을 유지하고 있으며, 장시간 작업에서도 상대적으로 적은 턴과 입력 토큰을 사용했습니다.
결국 Grok 4.6의 경쟁력은 단순히 "가장 높은 점수를 받은 모델"이라는 데 있지 않습니다. 최고 점수는 Claude Opus 5가 앞서지만, Grok 4.6은 높은 Intelligence Index, 선두권 에이전트 성능, 낮은 가격을 함께 제공한다는 점에서 차별화됩니다.
Grok 4.6은 AAII 61점을 기록하며 AI 지능 평가에서 최상위권에 진입했습니다. Grok 4.5 대비 5점, Grok 4.3 대비 23점 상승하면서 성능 개선 폭도 확인됐습니다.
특히 에이전트 작업에서 높은 성능을 보였고, 장시간 지식 작업에서는 Claude Fable 5급 Elo를 기록하면서도 상대적으로 적은 턴과 입력 토큰을 사용했습니다.
여기에 입력 $2, 출력 $6이라는 가격 구조까지 더해지면서 Grok 4.6은 성능 자체뿐 아니라 비용까지 함께 고려해야 하는 AI 모델 시장에서 경쟁력을 갖춘 모델로 평가할 수 있습니다.
앞으로 AI 모델을 선택할 때는 단순히 가장 높은 벤치마크 점수를 가진 모델을 찾는 것보다, 실제 업무에서 필요한 작업을 얼마나 적은 비용과 자원으로 수행할 수 있는지를 함께 살펴보는 것이 중요합니다. Grok 4.6은 바로 이러한 Intelligence 대비 비용 효율성이라는 기준에서 주목할 만한 결과를 보여주고 있습니다.
https://artificialanalysis.ai/articles/grok-4-6-benchmarks-and-analysis
Grok 4.6 returns SpaceXAI to the intelligence frontier and leads on cost efficiency
SpaceXAI returns to the intelligence frontier with strengths in agentic performance and cost efficiency
artificialanalysis.ai

'인공지능' 카테고리의 다른 글
| AI 에이전트와 함께 영상 편집한다, macOS 오픈소스 편집기 palmier-pro (0) | 2026.08.18 |
|---|---|
| Wails v3 Beta, Go 데스크톱 앱 개발 구조를 다시 설계하다 (0) | 2026.08.18 |
| Replit이 만든 자율주행 기업, AI 에이전트로 조직의 업무 방식이 바뀌다 (0) | 2026.08.18 |
| Grok 4.6 출시, 500K 컨텍스트와 강화된 AI 에이전트 성능의 특징 (0) | 2026.08.18 |
| 에이전틱 코드 리뷰에서 인간과 AI는 어떻게 다를까? 27만 건의 실제 리뷰 대화가 보여준 역할 분담 (0) | 2026.08.18 |