본문 바로가기

인공지능

Kimi K3 로컬 실행 가이드, GGUF 양자화부터 Unsloth Studio와 llama.cpp 활용까지

728x90
반응형
728x170

Kimi K3를 로컬 환경에서 실행하려면 무엇을 준비해야 할까?

Kimi K3는 Moonshot AI가 공개한 최신 오픈 웨이트(Open-weight) AI 모델로, 코딩, 에이전트 작업, 초장문 컨텍스트 처리, 대화형 AI 등 다양한 작업에서 높은 성능을 제공하는 것이 특징입니다. 특히 최대 100만 토큰(Context Window)을 지원하고 비전(Vision) 기능까지 제공해 대규모 AI 모델을 직접 운영하려는 사용자들의 관심을 받고 있습니다.

다만 Kimi K3는 모델 크기가 매우 크기 때문에 실행 환경과 양자화(Quantization) 방식에 따라 필요한 메모리와 성능이 크게 달라집니다. 이번 글에서는 Kimi K3의 주요 특징부터 GGUF 양자화 옵션, 하드웨어 요구사항, 그리고 Unsloth Studio와 llama.cpp를 이용해 로컬에서 실행하는 방법까지 정리해보겠습니다.

반응형

Kimi K3란?

Kimi K3는 Moonshot AI에서 공개한 2.8T 파라미터 규모의 오픈 웨이트 AI 모델입니다. 활성 파라미터는 104B이며, 코딩과 에이전트 기반 작업, 장문 문맥 이해, 일반 대화 등 다양한 영역에서 활용할 수 있도록 설계되었습니다.

주요 특징은 다음과 같습니다.

  • 2.8T 파라미터 기반 오픈 웨이트 모델
  • 104B Active Parameters
  • 최대 1M Token 컨텍스트 지원
  • Vision 기능 기본 지원
  • MXFP4 기반 모델 구조
  • GGUF 양자화 모델 제공

전체 정밀도(Full Precision) 모델은 약 1.56TB의 저장 공간이 필요하지만, Dynamic 1-bit GGUF를 사용하면 약 594GB 수준으로 줄여 실행할 수 있습니다.


GGUF 양자화와 메모리 요구사항

Kimi K3는 다양한 양자화 버전을 제공합니다. 양자화를 적용하면 저장 공간과 메모리 요구사항을 크게 줄일 수 있으며, 대신 정확도가 일부 감소할 수 있습니다.

대표적인 옵션은 다음과 같습니다.

양자화필요 메모리
Dynamic 1-bit S 약 610GB
Dynamic 1-bit M 약 665GB
Dynamic 2-bit XXS 약 726GB
Dynamic 2-bit XL 약 880GB
Q8 (Lossless) 약 1.6TB

Dynamic 1-bit는 약 79% 수준의 Top-1 정확도를 제공하면서도 모델 크기를 크게 줄일 수 있는 것이 특징입니다.

반면 UD-Q8_K_XL은 MXFP4 기반 원본 모델과 동일한 수준의 손실 없는(Lossless) 양자화 방식으로 소개되고 있습니다.


Kimi K3 구현 특징

Kimi K3의 GGUF 구현은 llama.cpp를 기반으로 제작되었으며 일부 기능이 추가되었습니다.

대표적으로 다음과 같은 특징을 제공합니다.

  • Vision 지원 추가
  • Kimi 전용 Chat Template 적용
  • 대규모 Batch 처리 개선
  • Thinking Trace 유지
  • Jinja 기반 템플릿 적용

또한 Thinking 기능이 항상 활성화되어 있으며, 기본적으로 추론 과정을 유지하는 방식으로 동작합니다.


Thinking 모드와 추론 설정

Kimi K3는 Thinking 전용 모델입니다.

추론 강도는 다음과 같이 설정할 수 있습니다.

  • Low
  • High
  • Max

기본 설정은 Temperature 1.0이며, 일반 모드에서는 Top-p 0.95, 에이전트 모드에서는 Top-p 1.0을 사용합니다.

최대 컨텍스트 길이는 1,048,576 토큰까지 지원합니다.


Unsloth Studio에서 실행하기

Kimi K3는 Unsloth Studio를 통해 비교적 간편하게 실행할 수 있습니다.

Unsloth Studio에서는 다음과 같은 기능을 제공합니다.

  • GGUF 및 Safetensors 모델 검색 및 다운로드
  • RAM 자동 오프로딩
  • Multi GPU 자동 인식
  • Python 및 Bash 코드 실행
  • Tool Calling과 Web Search 지원
  • llama.cpp 기반 CPU·GPU 추론

설치 후 Model Hub에서 원하는 Kimi K3 모델과 양자화 버전을 선택하면 실행할 수 있습니다.

추론 파라미터 역시 대부분 자동으로 설정되며, 필요에 따라 Thinking 수준이나 Context Length 등을 변경할 수 있습니다.


llama.cpp에서 실행하기

llama.cpp를 이용하면 CPU 또는 GPU 환경에서 Kimi K3를 실행할 수 있습니다.

Kimi K3의 Vision 기능을 사용하려면 일반 llama.cpp가 아닌 Vision을 지원하는 전용 포크를 사용해야 합니다.

빌드 후에는 원하는 GGUF 모델을 다운로드하고 llama-cli를 통해 실행할 수 있으며, MMProj 파일을 함께 지정하면 이미지 입력도 사용할 수 있습니다.

또한 Hugging Face Hub를 이용해 GGUF 모델과 MMProj 파일을 직접 다운로드한 뒤 실행하는 방식도 지원됩니다.


이미지 입력도 지원

Kimi K3는 Vision 기능을 지원하기 때문에 텍스트뿐 아니라 이미지도 함께 입력할 수 있습니다.

예를 들어 이미지 파일을 입력한 뒤 이미지의 내용을 설명하거나, 이미지와 질문을 함께 전달해 분석 결과를 받을 수 있습니다.

이를 위해서는 MMProj 파일과 Vision을 지원하는 llama.cpp 환경이 필요합니다.


벤치마크 성능

자료에서는 다양한 벤치마크 결과도 함께 제공하고 있습니다.

Reasoning, Coding, Agentic, Vision 영역에서 여러 모델과 비교한 결과가 포함되어 있으며, 특히 DeepSWE, Terminal Bench, BrowseComp 등 다양한 테스트에서 높은 성능을 보여주는 것으로 소개됩니다.

이를 통해 Kimi K3는 대규모 오픈 모델 가운데서도 코딩과 추론, 에이전트 작업에 적합한 모델임을 확인할 수 있습니다.


728x90

Kimi K3는 초대형 오픈 웨이트 AI 모델로, 최대 100만 토큰 컨텍스트와 Vision 기능을 지원하며 다양한 추론 작업에 활용할 수 있도록 설계되었습니다.

특히 Dynamic 1-bit GGUF를 활용하면 모델 크기를 크게 줄이면서도 실용적인 성능을 확보할 수 있으며, Unsloth Studio와 llama.cpp를 이용하면 로컬 환경에서도 직접 실행할 수 있습니다.

다만 모델 규모가 매우 크기 때문에 양자화 방식에 따른 메모리 요구사항을 충분히 고려해야 하며, 실행 환경에 맞는 GGUF 버전을 선택하는 것이 중요합니다.

300x250

https://unsloth.ai/docs/models/kimi-k3

728x90
반응형
그리드형