
Kimi K3, AI 성능 경쟁의 새로운 강자로 등장
Moonshot AI가 공개한 Kimi K3가 Artificial Analysis Intelligence Index에서 57점을 기록하며 전체 3위에 올랐습니다. 이는 Claude Opus 4.8과 GPT-5.5에 필적하는 수준의 성능으로 평가되며, 현재는 Claude Fable 5와 GPT-5.6 Sol만이 Kimi K3보다 높은 성능을 기록하고 있습니다.
특히 Kimi K3는 에이전트 기반 작업(Agentic AI), 장기 지식 작업, 토큰 효율성, 멀티모달 지원 등 다양한 평가 항목에서 이전 모델인 K2.6 대비 큰 폭의 성능 향상을 보여주었습니다. 또한 향후 모델 가중치(Open Weights)가 공개될 예정이라는 점에서 오픈 웨이트 AI 시장에서도 높은 관심을 받고 있습니다.
이번 글에서는 Artificial Analysis의 평가 결과를 기반으로 Kimi K3의 주요 특징과 성능, 비용 효율성, 그리고 오픈 웨이트 모델로서의 의미를 정리해보겠습니다.
Kimi K3란 무엇인가
Kimi K3는 Moonshot AI가 개발한 최신 대규모 언어 모델(LLM)입니다.
Artificial Analysis의 평가 결과에 따르면 Kimi K3는 Intelligence Index에서 57점을 기록하며 Claude Opus 4.8, GPT-5.5와 비슷한 수준의 지능을 보여주었습니다. 다만 현재 최고 수준의 모델인 Claude Fable 5와 GPT-5.6 Sol에는 다소 뒤처지는 것으로 평가되었습니다.
또한 Moonshot AI는 향후 2.8조(2.8T) 파라미터 모델의 가중치를 공개할 계획을 밝히고 있어, 공개 시 가장 높은 성능의 오픈 웨이트 모델이 될 가능성이 높습니다.
Artificial Analysis Intelligence Index 성능
Artificial Analysis Intelligence Index는 다양한 AI 모델을 동일한 기준으로 평가하는 종합 지표입니다.
Kimi K3는 총 57점을 기록했습니다.
비교하면 다음과 같습니다.
- Kimi K3 : 57점
- Claude Opus 4.8 : 비슷한 수준
- GPT-5.5 : 비슷한 수준
- Claude Fable 5 : 더 높은 성능
- GPT-5.6 Sol : 더 높은 성능
이는 Kimi K3가 현재 최상위 AI 모델 그룹에 속하는 경쟁력을 확보했음을 의미합니다.
Agentic AI 성능의 큰 도약
Kimi K3의 가장 큰 강점 중 하나는 Agentic AI 작업 성능입니다.
GDPval-AA v2 평가에서 Kimi K3는 Elo 1668점을 기록했습니다.
이는 이전 모델인 K2.6의 1190점보다 크게 향상된 수치이며 다음 모델들을 모두 앞섰습니다.
- GLM-5.2 : 1514
- GPT-5.5 : 1494
- Claude Opus 4.8 : 1600
다만 Claude Fable 5의 1760점에는 미치지 못했습니다.
또한 Zapier의 Agentic SaaS Workflow 평가를 구현한 AutomationBench-AA에서는 53%를 기록하며 1위를 차지했습니다.
이는 실제 업무 자동화와 AI 에이전트 활용 측면에서 Kimi K3가 매우 뛰어난 성능을 제공한다는 의미입니다.
장기 지식 작업에서도 상위권 성능
장기간에 걸친 복잡한 지식 작업을 평가하는 AA-Briefcase에서도 Kimi K3는 뛰어난 결과를 보였습니다.
주요 결과는 다음과 같습니다.
- Elo 1547 기록
- K2.6 대비 +732점 향상
- Claude Fable 5 다음으로 높은 성능
평가 결과에 따르면 Kimi K3는
- 분석 품질
- 평가 기준(Rubric) 점수
에서 Claude Fable 5에 근접한 수준을 기록했습니다.
반면 프레젠테이션 품질에서는 GPT-5.6 Sol이 여전히 가장 높은 평가를 받았습니다.
오픈 웨이트 모델 시장의 새로운 경쟁자
Moonshot AI는 아직 Kimi K3의 모델 가중치를 공개하지 않았습니다.
하지만 공개 계획을 밝힌 만큼, 실제 공개가 이루어진다면 현재 공개 모델 가운데 가장 높은 성능을 가진 오픈 웨이트 모델이 될 것으로 예상됩니다.
비교 대상은 다음과 같습니다.
- GLM-5.2 : Intelligence Index 51
- DeepSeek V4 Pro : Intelligence Index 44
- Kimi K3 : Intelligence Index 57
다만 Kimi K3는 2.8조 파라미터 규모로, 경쟁 모델보다 훨씬 큰 모델입니다.
모델 크기를 비교하면 다음과 같습니다.
모델파라미터
| Kimi K3 | 2.8T |
| DeepSeek V4 Pro | 1.6T |
| GLM-5.2 | 753B |
| Kimi K2~K2.6 | 1T |
높은 성능을 위해 상당한 규모의 모델을 사용하는 것이 특징입니다.
비용 효율성은 어떨까
Kimi K3의 평균 작업 비용은 0.94달러입니다.
비교하면 다음과 같습니다.
| 모델 | 평균 작업 비용 |
| Kimi K3 | $0.94 |
| GPT-5.6 Sol | $1.04 |
| Claude Opus 4.8 | $1.80 |
| GLM-5.2 | $0.32 |
| DeepSeek V4 Pro | $0.04 |
즉,
- GPT-5.6 Sol과 비슷한 수준의 비용
- Claude Opus 4.8보다 약 절반 수준
- 오픈 웨이트 경쟁 모델보다는 높은 비용
이라는 특징을 가지고 있습니다.
또한 Moonshot AI는 K3의 출력 토큰 가격을 100만 토큰당 15달러로 책정했으며, 이는 이전 K2.6의 4달러보다 높은 가격입니다.
토큰 효율성도 크게 향상
성능 향상뿐 아니라 토큰 사용량도 감소했습니다.
전체 9개 평가를 수행하는 동안
- K2.6 : 약 1억6600만 출력 토큰
- Kimi K3 : 약 1억3200만 출력 토큰
을 사용했습니다.
이는 약 21% 적은 출력 토큰으로 더 높은 Intelligence Index 점수를 달성한 것입니다.
즉, 동일한 작업을 더 적은 토큰으로 수행하면서도 성능은 더욱 향상되었습니다.
정확도는 향상됐지만 환각은 증가
AA-Omniscience Index에서도 개선이 확인되었습니다.
주요 변화는 다음과 같습니다.
- Index : +6 → +18
- 정확도 : 33% → 46%
반면 환각(Hallucination) 비율은
- 39% → 51%
로 증가했습니다.
즉, 전반적인 성능은 향상되었지만 사실과 다른 정보를 생성하는 비율은 이전 모델보다 높아졌다는 점도 함께 확인되었습니다.
멀티모달 지원
Kimi K3는 이전 모델과 동일하게 텍스트와 이미지 입력을 기본 지원하는 네이티브 멀티모달 모델입니다.
주요 특징은 다음과 같습니다.
- 텍스트 입력 지원
- 이미지 입력 지원
- 출력은 텍스트만 제공
- 최대 100만(1M) 토큰 컨텍스트 지원
향후 오픈 웨이트가 공개된다면 멀티모달 기능까지 갖춘 고성능 공개 모델로 활용될 가능성이 있습니다.
Kimi K3 주요 사양
| 항목 | 내용 |
| Intelligence Index | 57 |
| 컨텍스트 길이 | 1M |
| 모델 크기 | 2.8T Parameters |
| 입력 | 텍스트, 이미지 |
| 출력 | 텍스트 |
| API 가격 | 입력 $3 / 출력 $15 (100만 토큰 기준) |
| 캐시 입력 | 90% 할인 ($0.30 / 100만 토큰) |
| 공개 여부 | API 제공, 모델 가중치는 미공개(공개 예정) |
Artificial Analysis의 평가 결과를 보면 Kimi K3는 단순히 이전 모델의 개선 버전을 넘어 최상위 AI 모델들과 직접 경쟁할 수 있는 수준까지 성능을 끌어올렸습니다.
특히 Agentic AI, 장기 지식 작업, 토큰 효율성 등 실무 활용과 밀접한 영역에서 큰 향상을 보였으며, 향후 모델 가중치가 공개될 경우 오픈 웨이트 AI 생태계에도 상당한 영향을 미칠 것으로 기대됩니다.
다만 환각 비율이 이전 모델보다 증가한 점과 경쟁 모델 대비 큰 모델 규모, 상대적으로 높은 비용은 실제 도입 시 함께 고려해야 할 요소입니다.
향후 Moonshot AI가 계획대로 Kimi K3의 오픈 웨이트를 공개한다면, 고성능 공개 AI 모델 시장의 경쟁 구도에도 의미 있는 변화가 나타날 것으로 예상됩니다.
https://www.linkedin.com/pulse/kimi-k3-launches-57-artificial-analysis-intelligence-clwlc/
Kimi K3 achieves #3 in the Artificial Analysis Intelligence Index, comparable to Opus 4.8 and GPT-5.5
Kimi K3 scores 57 on the Artificial Analysis Intelligence Index. Its intelligence is comparable to Opus 4.
www.linkedin.com

'인공지능' 카테고리의 다른 글
| Kimi Work로 살펴보는 차세대 데스크톱 AI 에이전트, 업무 자동화의 새로운 방식 (0) | 2026.07.21 |
|---|---|
| Git history 명령어 완전 정리: 과거 커밋 수정부터 브랜치 자동 재구성까지 (0) | 2026.07.20 |
| AI Agent의 자기 개선(Self-Improvement)과 온톨로지 파이프라인: 신뢰할 수 있는 AI를 위한 두 가지 핵심 기반 (0) | 2026.07.20 |
| AI 도입 5단계 로드맵, 조직이 다음 단계로 나아가지 못하는 이유와 해결 전략 (0) | 2026.07.20 |
| Claude Code Loop Engineering이란? 에이전트 루프의 종류와 활용 방법 한눈에 알아보기 (0) | 2026.07.20 |