본문 바로가기

인공지능

Kimi K3 공개 분석: 2.8조 매개변수 기반 오픈 멀티모달 AI 모델의 구조와 성능

728x90
반응형
728x170

Kimi K3, 오픈 웨이트 AI 모델의 새로운 기준

Moonshot AI가 Hugging Face를 통해 공개한 Kimi K3는 초대규모 오픈 웨이트(Open Weight) 네이티브 멀티모달 에이전트 모델입니다. 총 2.8조(2.8T) 매개변수약 104만 토큰(1,048,576 Token)의 컨텍스트를 지원하며, 장시간 코딩, 지식 탐색, 추론 작업을 수행하도록 설계되었습니다.

특히 새로운 Attention 구조와 MoE(Mixture of Experts) 아키텍처를 결합해 이전 Kimi K2 대비 약 2.5배 높은 스케일링 효율을 제공하며, 다양한 공개 벤치마크에서도 높은 성능을 기록했습니다.

이번 글에서는 Kimi K3의 구조와 특징, 주요 성능, 실행 방법, 그리고 사용할 때 고려해야 할 사항까지 입력된 정보를 기반으로 정리해보겠습니다.

반응형

Kimi K3란?

Kimi K3는 장시간의 복잡한 작업을 수행하기 위해 설계된 오픈 가중치(Open Weight) 네이티브 멀티모달 에이전트 모델입니다.

텍스트 생성뿐 아니라 이미지 이해까지 지원하며, 긴 컨텍스트를 활용하는 다양한 AI 작업을 목표로 합니다.

대표적인 활용 분야는 다음과 같습니다.

  • 장시간 프로그래밍 및 코드 작성
  • 대규모 프로젝트 분석
  • 복잡한 추론 작업
  • 심층 지식 탐색
  • 이미지 기반 이해
  • 에이전트 기반 자동화 작업

특히 최소한의 사용자 개입만으로 긴 엔지니어링 작업을 수행할 수 있도록 설계된 점이 특징입니다.


Kimi K3 모델 구조

Kimi K3는 초대규모 MoE(Mixture of Experts) 구조를 기반으로 구성됩니다.

주요 사양

항목 내용
총 매개변수 2.8T
활성 매개변수 104B
레이어 수 93
Context Length 1,048,576 Tokens
Vocabulary 160K
Attention Head 96
Attention Hidden Dimension 7,168

레이어 구성은 다음과 같습니다.

  • Dense Layer 1개
  • KDA Layer 69개
  • Gated MLA Layer 24개

비전 처리에는 401M 규모의 MoonViT-V2 비전 인코더가 사용됩니다.


핵심 기술

Kimi K3는 세 가지 핵심 기술을 중심으로 설계되었습니다.

1. Kimi Delta Attention(KDA)

기존 Attention 구조를 개선한 방식으로, 긴 컨텍스트에서도 효율적인 계산을 목표로 합니다.


2. Stable LatentMoE

MoE 구조에서는 896개의 전문가(Experts) 가운데 토큰마다 16개 전문가만 활성화됩니다.

추가로 공유 전문가(Shared Experts) 2개를 함께 사용합니다.

이를 통해 모델 전체 크기는 매우 크지만 실제 계산량은 효율적으로 유지할 수 있습니다.


3. Attention Residuals

Attention 계산의 안정성을 높이기 위한 구조로 소개되고 있습니다.

이 세 기술의 조합을 통해 Kimi K2 대비 약 2.5배 향상된 스케일링 효율을 제공한다고 설명합니다.


장시간 코딩 및 에이전트 작업 지원

Kimi K3는 일반적인 대화형 AI보다 장시간 작업을 목표로 설계되었습니다.

대표적인 활용 사례는 다음과 같습니다.

  • 대규모 저장소 탐색
  • 긴 개발 세션 유지
  • 터미널 도구 제어
  • GPU 커널 최적화
  • 컴파일러 개발
  • 게임 개발
  • CAD 작업
  • 칩 설계 지원

또한 에이전트 기반 지식 작업에서는

  • 심층 조사
  • 대화형 시각화
  • 위젯 생성
  • 대시보드 생성
  • 모션 디자인
  • 비디오 편집

등도 지원 범위에 포함됩니다.

코딩 에이전트 환경에서는 Kimi Code CLI 사용이 권장되며, 터미널에서 /model 명령으로 Kimi K3를 선택할 수 있습니다.


공개 벤치마크 성능

Kimi K3는 다양한 분야의 공개 평가에서 높은 점수를 기록했습니다.

추론 및 지식 평가

벤치마크 점수
GPQA Diamond 93.5
CritPt 23.4
AA-LCR 74.7
HLE-Full (도구 없음) 43.5
HLE-Full (도구 사용) 56.0

코딩 평가

벤치마크 점수
ProgramBench 77.8
Terminal-Bench 2.1 88.3
FrontierSWE 81.2
DeepSWE 67.5
SWE-Marathon 42.0
SciCode 58.7
Kimi Code Bench 2.0 72.9

에이전트 평가

벤치마크 점수
BrowseComp 91.2
DeepSearchQA 95.0
ResearchRubrics 76.2
MCPMark Verified 94.5
OSWorld Verified 84.8

비전 평가

벤치마크 점수
OmniDocBench 91.1
Video-MME 90.0
MMVU 82.1
MMMU-Pro 81.6
MathVision 94.3

도구를 사용하는 환경에서는 일부 벤치마크에서 성능이 추가로 향상되는 결과도 함께 공개되었습니다.


벤치마크 해석 시 고려해야 할 점

공개된 성능 수치는 매우 우수하지만, 단순 점수 비교만으로 모델의 우위를 판단하기는 어렵습니다.

공개 자료에서는 다음과 같은 비교 제약 사항도 함께 안내하고 있습니다.

  • 모델마다 평가 하네스가 다를 수 있음
  • 추론 설정(reasoning_effort, top-p)이 동일하지 않을 수 있음
  • 사용한 GPU 환경(H20, H100 등)이 서로 다를 수 있음
  • 일부 모델은 평가 과정에서 fallback 또는 요청 거부가 발생함
  • BrowseComp는 컨텍스트 압축 전략을 적용한 결과가 포함됨

따라서 공개 벤치마크는 참고 자료로 활용하되, 실제 사용 환경과 동일한 조건에서 성능을 검증하는 것이 중요합니다.


네이티브 양자화 지원

Kimi K3는 학습 단계부터 양자화 인식 학습(QAT) 을 적용했습니다.

지원 형식은 다음과 같습니다.

  • 가중치 : MXFP4
  • 활성값 : MXFP8

이를 통해 다양한 하드웨어 환경에서의 호환성을 목표로 합니다.


배포 및 실행 방법

Kimi K3는 여러 환경에서 실행할 수 있도록 지원됩니다.

지원 플랫폼은 다음과 같습니다.

  • Hugging Face Transformers
  • vLLM
  • SGLang
  • Docker Model Runner
  • HuggingChat
  • Google Colab
  • Kaggle

또한 OpenAI 및 Anthropic 호환 API를 제공하여 기존 애플리케이션과의 연동도 고려하고 있습니다.

간단한 실행 예시

Docker 환경에서는 다음과 같이 모델을 실행할 수 있습니다.

docker model run hf.co/moonshotai/Kimi-K3

Transformers 환경에서는 pipeline("image-text-to-text", ...) 또는 AutoModel.from_pretrained(...)를 사용할 수 있으며, 커스텀 모델 코드를 사용할 경우 trust_remote_code=True 설정이 필요합니다.


API 사용 시 주의사항

Kimi K3의 API는 사고 모드(Thinking Mode) 가 항상 활성화되어 있습니다.

따라서 API 응답에는 일반적인 content 외에도 다음 정보가 함께 반환됩니다.

  • reasoning_content
  • tool_calls

다중 턴 대화나 도구 호출을 수행할 경우에는 API가 반환한 assistant 메시지를 그대로 다음 요청의 messages에 포함해야 합니다.

즉, content뿐 아니라 reasoning_content와 tool_calls까지 모두 유지해야 추론 상태가 이어집니다.

또한 reasoning_effort는 다음 세 가지 옵션을 지원합니다.

  • low
  • high
  • max(기본값)

Kimi K3의 주요 특징 정리

Kimi K3의 핵심 특징을 정리하면 다음과 같습니다.

  • 2.8조 매개변수 기반의 오픈 웨이트 모델
  • 약 104만 토큰의 초장문 컨텍스트 지원
  • KDA와 Stable LatentMoE 기반의 효율적인 구조
  • 토큰당 16개 전문가를 활성화하는 MoE 아키텍처
  • 장시간 코딩 및 에이전트 작업에 최적화
  • 텍스트와 이미지 이해를 지원하는 네이티브 멀티모달 모델
  • MXFP4·MXFP8 기반의 네이티브 양자화 지원
  • OpenAI·Anthropic 호환 API 제공
  • 다양한 공개 벤치마크에서 높은 성능 기록

728x90

Kimi K3는 초대규모 매개변수와 약 104만 토큰의 긴 컨텍스트를 바탕으로 장시간 코딩, 지식 탐색, 추론 작업을 목표로 설계된 오픈 웨이트 멀티모달 AI 모델입니다.

특히 KDA, Stable LatentMoE, Attention Residuals를 결합한 새로운 구조와 네이티브 양자화 지원, 다양한 실행 환경 및 호환 API 제공은 활용 범위를 넓히는 요소로 볼 수 있습니다.

다만 공개된 벤치마크 결과는 평가 환경과 하네스, 추론 설정, 하드웨어 구성에 따라 달라질 수 있으므로, 실제 도입을 검토할 때에는 동일한 조건에서 성능을 검증하는 과정이 필요합니다.

Kimi K3의 공개는 오픈 웨이트 AI 생태계에서 초대규모 모델의 활용 가능성을 보여주는 사례로, 장시간 추론과 에이전트 기반 AI 활용을 고려하는 개발자와 기업에게 참고할 만한 모델 중 하나가 될 것으로 기대됩니다.

300x250

https://huggingface.co/moonshotai/Kimi-K3?fbclid=IwY2xjawTVN5VleHRuA2FlbQIxMABicmlkETFmWlZ4SG55YzdjajNiY0kxc3J0YwZhcHBfaWQQMjIyMDM5MTc4ODIwMDg5MgABHpfiwBVTypLcgeUfNM8iGOGYkoGEYkaV6QU9JwVlbfQbaG3Qx6Q0hU4Q_jNJ_aem_6P0P9y0XOBUI-IZmM0_Mnw%EF%BB%BF

 

moonshotai/Kimi-K3 · Hugging Face

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

huggingface.co

728x90
반응형
그리드형