
25GB 메모리에서도 초거대 AI 모델을 실행할 수 있을까?
대규모 언어 모델(LLM)의 성능이 빠르게 발전하면서 모델의 크기 역시 꾸준히 증가하고 있습니다. 하지만 수백억, 수천억 개의 파라미터를 가진 모델을 실행하기 위해서는 일반적으로 수백 GB 이상의 메모리와 고성능 GPU가 필요하다는 인식이 강했습니다.
이러한 한계를 해결하기 위해 등장한 colibrì는 기존 접근 방식과는 다른 아이디어를 제시합니다. 모델 전체를 메모리에 올리는 대신, 필요한 전문가(Expert)만 디스크에서 실시간으로 불러오는 스트리밍 방식을 활용하여 약 25GB RAM 환경에서도 GLM-5.2 744B Mixture-of-Experts(MoE) 모델을 실행할 수 있도록 설계되었습니다.
이번 글에서는 colibrì의 동작 방식과 핵심 기술, 그리고 기존 LLM 추론 방식과 어떤 차별점을 갖는지 살펴보겠습니다.
colibrì란 무엇인가?
colibrì는 GLM-5.2 744B MoE 모델을 일반적인 소비자용 PC에서도 실행할 수 있도록 개발된 C 기반 추론 엔진입니다.
런타임은 단일 C 소스 파일과 소규모 헤더 파일로 구성되어 있으며, 추론 과정에서 Python이나 BLAS 라이브러리, GPU가 필수적으로 요구되지 않습니다. 또한 GPU는 선택적으로 사용할 수 있도록 설계되어 있어 CPU 환경에서도 모델을 실행할 수 있습니다.
가장 큰 특징은 모델 전체를 메모리에 적재하지 않고 필요한 Expert만 선택적으로 불러오는 구조라는 점입니다.
MoE 구조를 활용한 메모리 최적화
GLM-5.2는 744B 규모의 Mixture-of-Experts 모델이지만, 실제 추론 시 모든 파라미터를 동시에 사용하는 것은 아닙니다.
토큰 하나를 생성할 때 실제 활성화되는 파라미터는 약 40B 수준이며, 이 가운데 공유되는 Dense 영역은 메모리에 상주시킵니다.
반면 각 레이어의 Routed Expert들은 SSD에 저장한 뒤 필요한 순간에만 읽어옵니다.
이 구조는 다음과 같이 구성됩니다.
- Dense 영역(Attention, Shared Expert, Embedding)은 RAM에 상주
- Routed Expert는 SSD에서 스트리밍 방식으로 로드
- Layer별 LRU Cache를 통해 반복적으로 사용하는 Expert를 메모리에 유지
- 운영체제의 Page Cache를 추가 캐시 계층으로 활용
이를 통해 거대한 모델을 모두 메모리에 올리지 않아도 추론이 가능하도록 설계되었습니다.
디스크 스트리밍 기반 추론 구조
colibrì의 핵심 아이디어는 SSD를 메모리처럼 활용하는 것입니다.
약 21,000개 이상의 Routed Expert를 모두 RAM에 적재하는 대신 SSD에 저장하고, 현재 토큰 생성에 필요한 Expert만 실시간으로 불러옵니다.
또한 단순히 디스크에서 읽는 데 그치지 않고 다양한 최적화 기법을 함께 적용합니다.
- Layer 단위 LRU Cache
- Hot Expert Pinning
- 운영체제 Page Cache 활용
- 비동기 Expert Prefetch
- Router 기반 다음 Layer 예측 Prefetch
이러한 구조는 SSD 입출력 병목을 줄이고 반복적으로 사용하는 Expert의 재사용률을 높이는 데 목적이 있습니다.
다양한 추론 최적화 기술
colibrì에는 단순한 디스크 스트리밍 외에도 다양한 최적화 기술이 적용되어 있습니다.
Compressed KV Cache
MLA Attention 구조를 활용하여 KV Cache 크기를 크게 줄였습니다.
기존 구조 대비 토큰당 저장해야 하는 데이터를 크게 감소시켜 긴 컨텍스트에서도 메모리 사용량을 줄일 수 있도록 설계되었습니다.
Native MTP Speculative Decoding
GLM-5.2가 제공하는 Multi-Token Prediction(MTP) 헤드를 활용하여 여러 토큰을 미리 생성하고 검증하는 방식을 제공합니다.
이를 통해 추론 효율을 높이며, MTP Head는 int8 형식을 사용할 것을 권장하고 있습니다.
DSA Sparse Attention
GLM-5.2의 DSA Sparse Attention 구조를 그대로 구현하여 필요한 Key만 선택적으로 참조하도록 지원합니다.
이를 통해 Attention 연산량을 줄이면서도 모델 구조를 충실하게 유지합니다.
Integer Quantization
추론 성능 향상을 위해 int8, int4, int2 양자화를 지원하며 AVX2 기반 Integer Dot Kernel을 활용하여 CPU 환경에서도 효율적인 연산을 수행하도록 구현되어 있습니다.
메모리와 저장 공간은 어떻게 구성될까?
colibrì는 모델을 다음과 같이 관리합니다.
| 구성 요소 | 특징 |
| Dense 영역 | RAM 상주 |
| Routed Expert | SSD 저장 후 필요 시 스트리밍 |
| Expert Cache | RAM 기반 LRU Cache |
| KV Cache | 압축 저장 |
| Hot Expert | 자주 사용하는 Expert를 RAM 또는 VRAM에 유지 |
이러한 구조 덕분에 약 370GB 규모의 int4 모델을 저장 공간에 보관하면서도 상대적으로 작은 메모리 환경에서 실행이 가능합니다.
설치와 실행 과정
프로젝트는 모델 변환과 실행 절차를 분리하여 제공합니다.
먼저 FP8 체크포인트를 int4 형식으로 변환한 뒤, 변환된 모델을 지정하여 추론을 수행합니다.
또한 다음과 같은 기능도 함께 제공합니다.
- 모델 변환 도구
- 자동 메모리 계획(Plan)
- 실행 환경 점검(Doctor)
- OpenAI 호환 API 서버
- Web UI
- Windows 11 네이티브 지원
- CUDA 기반 선택적 GPU 가속
이를 통해 개발 환경부터 API 서비스까지 다양한 형태로 활용할 수 있도록 구성되어 있습니다.
OpenAI 호환 API도 지원
colibrì는 단순한 CLI 도구에 그치지 않습니다.
OpenAI Chat Completions API와 호환되는 HTTP 서버를 제공하여 기존 OpenAI 기반 애플리케이션에서도 쉽게 연동할 수 있도록 지원합니다.
지원 기능은 다음과 같습니다.
- Chat Completions API
- Streaming 응답
- Reasoning 모드
- 모델 목록 조회
- KV Context 관리
- 다중 KV Slot 지원
이를 활용하면 기존 OpenAI API를 사용하는 애플리케이션을 큰 수정 없이 colibrì 기반 모델과 연동할 수 있습니다.
성능보다 가능성에 초점을 맞춘 프로젝트
공개된 성능 수치를 보면 초당 토큰 생성 속도는 최신 GPU 환경과 비교해 빠른 수준은 아닙니다.
특히 초기에는 SSD에서 많은 데이터를 읽어야 하므로 디스크 성능의 영향을 크게 받습니다.
하지만 캐시가 충분히 형성되고 자주 사용하는 Expert가 메모리에 유지되면 응답 속도가 개선될 수 있도록 설계되어 있습니다.
즉, colibrì의 핵심 목표는 최고 속도를 달성하는 것이 아니라, 일반적인 하드웨어에서도 수백억·수천억 규모의 MoE 모델을 실행할 수 있는 새로운 접근 방식을 제시하는 데 있습니다.
LLM의 규모가 점점 커지는 상황에서 모든 모델을 GPU 메모리에 올리는 방식은 높은 비용이라는 한계를 갖습니다.
colibrì는 이러한 문제를 해결하기 위해 Dense 영역은 메모리에 유지하고, Expert는 SSD에서 실시간으로 불러오는 디스크 스트리밍 구조를 채택했습니다. 여기에 Expert Cache, 비동기 Prefetch, KV Cache 압축, Speculative Decoding 등 다양한 최적화 기술을 결합하여 제한된 하드웨어에서도 초거대 MoE 모델을 실행할 수 있는 가능성을 보여주고 있습니다.
물론 디스크 성능과 캐시 효율에 따라 추론 속도의 차이는 존재하지만, GPU 중심의 기존 추론 방식과는 다른 방향성을 제시했다는 점에서 의미 있는 프로젝트입니다. 앞으로 스토리지와 CPU 성능이 지속적으로 향상된다면, 이러한 스트리밍 기반 추론 구조 역시 더욱 다양한 환경에서 활용될 가능성이 기대됩니다.
GitHub - JustVugg/colibri: Run GLM-5.2 (744B MoE) on a 25GB-RAM consumer machine — pure C, zero deps, experts streamed from di
Run GLM-5.2 (744B MoE) on a 25GB-RAM consumer machine — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 🐦 - JustVugg/colibri
github.com

'인공지능' 카테고리의 다른 글
| LangChain-Chatchat 기반 오프라인 RAG 구축 가이드와 주요 기능 (0) | 2026.07.13 |
|---|---|
| 스트리밍 없이 PC 게임을 안드로이드에서 실행하는 GameNative (0) | 2026.07.13 |
| Gemini API Managed Agents 업데이트: 백그라운드 실행부터 Remote MCP 연동까지 핵심 기능 정리 (0) | 2026.07.13 |
| GPT-5.6 Sol, Terra, Luna 성능 분석: 더 높은 성능과 낮은 비용으로 AI 모델 경쟁력 강화 (0) | 2026.07.10 |
| Meta Muse Spark 1.1 공개, 멀티모달 추론과 에이전트 AI를 한 단계 발전시킨 최신 AI 모델 (0) | 2026.07.10 |