본문 바로가기

인공지능

27B AI 모델을 휴대폰에서 실행하는 Bonsai 27B, 초저비트 압축으로 온디바이스 AI의 한계를 넘다

728x90
반응형
728x170

대규모 언어 모델(LLM)의 성능은 빠르게 발전하고 있지만, 높은 성능만큼이나 큰 모델 크기는 여전히 온디바이스 AI 확산의 가장 큰 제약 요소였습니다. 일반적인 27B 규모의 모델은 16비트 기준 약 54GB, 4비트 양자화만 적용해도 약 18GB의 메모리가 필요해 대부분의 스마트폰이나 일반 노트북에서는 실행이 어려웠습니다.

PrismML이 공개한 Bonsai 27B는 이러한 한계를 해결하기 위해 개발된 초저비트(Extreme Low-bit) AI 모델입니다. Qwen3.6 27B를 기반으로 하면서도 최대 3.9GB 수준까지 모델을 압축해 스마트폰에서도 실행 가능한 수준의 메모리 사용량을 구현했습니다. 단순히 모델 크기만 줄인 것이 아니라 추론, 비전, 도구 호출, 컴퓨터 사용 에이전트 기능까지 유지하면서도 높은 성능을 제공하는 것이 가장 큰 특징입니다.

이번 글에서는 Bonsai 27B가 기존 대규모 모델과 어떤 차별점을 가지는지, 어떤 기술을 통해 휴대폰에서 실행 가능한 AI를 구현했는지, 그리고 온디바이스 AI와 하이브리드 AI 환경에서 어떤 의미를 가지는지 살펴보겠습니다.

반응형

Bonsai 27B란?

Bonsai 27B는 Qwen3.6 27B를 기반으로 한 초저비트 AI 모델입니다.

기존의 모델 압축은 일부 계층만 낮은 비트로 변환하거나 성능 손실을 최소화하는 수준에 머물렀지만, Bonsai 27B는 언어 모델 전체를 저비트 형태로 구성하여 스마트폰에서도 실행 가능한 수준까지 메모리 사용량을 줄였습니다.

지원하는 주요 기능은 다음과 같습니다.

  • 다단계 추론
  • 구조화된 도구 호출
  • 비전(이미지) 이해
  • 컴퓨터 사용 에이전트
  • 멀티모달 처리
  • 장문 문맥(최대 262K 토큰)

즉, 단순한 경량 언어 모델이 아니라 최신 AI 에이전트가 요구하는 기능을 대부분 지원하는 것이 특징입니다.


기존 27B 모델과 무엇이 다른가?

기존 27B 모델은 다음과 같은 메모리를 필요로 합니다.

모델 형태필요 용량

16비트 약 54GB
일반 4비트 약 18GB
Bonsai 27B(Ternary) 약 5.9GB
Bonsai 27B(1-bit) 약 3.9GB

특히 스마트폰에서는 앱이 사용할 수 있는 메모리가 제한됩니다.

예를 들어 12GB 메모리를 가진 iPhone에서도 AI 모델이 실제 사용할 수 있는 메모리는 약 6GB 수준입니다. 여기에 KV Cache와 활성값(Activation)까지 포함되어야 하므로 단순히 모델 파일만 작다고 실행할 수 있는 것은 아닙니다.

Bonsai 27B는 이러한 메모리 제약을 고려하여 실제 스마트폰에서 실행 가능한 크기로 설계되었습니다.


두 가지 모델 구성

Bonsai 27B는 사용 환경에 따라 두 가지 버전으로 제공됩니다.

Ternary Bonsai 27B

Ternary 모델은 다음과 같은 가중치를 사용합니다.

{-1, 0, +1}

특징은 다음과 같습니다.

  • 가중치당 실효 1.71비트
  • 모델 크기 약 5.9GB
  • FP16 그룹별 스케일링 적용
  • 노트북 수준의 품질 목표
  • 추론, 도구 호출, 에이전트 기능 제공

성능 유지에 조금 더 초점을 둔 모델입니다.


1-bit Bonsai 27B

1-bit 모델은 다음과 같은 가중치를 사용합니다.

{-1, +1}

특징은 다음과 같습니다.

  • 가중치당 실효 1.125비트
  • 모델 크기 약 3.9GB
  • iPhone 메모리 예산에 맞춘 설계
  • 휴대폰 환경에 최적화

최대한 작은 용량으로 스마트폰에서 실행 가능한 것이 목표입니다.


모델 전체를 저비트화한 구조

Bonsai 27B의 가장 큰 특징 중 하나는 일부 계층만 압축한 것이 아니라 언어 모델 전체를 저비트 형태로 구성했다는 점입니다.

저비트 표현은 다음 구성 요소 전체에 적용됩니다.

  • 임베딩
  • Attention
  • MLP
  • LM Head

일부 구간만 높은 정밀도를 유지하는 방식이 아니라 전체 네트워크를 동일한 방식으로 압축했습니다.

또한 비전 타워 역시 4비트 형태로 제공되어 다음과 같은 입력을 로컬에서 처리할 수 있습니다.

  • 이미지
  • 문서
  • 스크린샷
  • 카메라 입력

성능은 얼마나 유지될까?

Bonsai 27B는 사고 모드 기반 15개 벤치마크를 통해 평가되었습니다.

모델 종합 점수
Qwen3.6 27B 85.0
Ternary Bonsai 27B 80.5
1-bit Bonsai 27B 76.1

이를 기준 모델과 비교하면 다음과 같습니다.

  • Ternary 모델: 약 95% 성능 유지
  • 1-bit 모델: 약 90% 성능 유지

특히 다음 영역에서는 성능 감소가 상대적으로 작았습니다.

  • 수학
  • 코딩
  • 추론

반면 도구 호출, 지시 이행, 비전 분야에서는 일부 성능 감소가 나타났지만, Ternary 모델은 비교적 높은 수준을 유지했습니다.


지능 밀도(Intelligence Density)라는 새로운 기준

PrismML은 단순히 모델 크기만 줄이는 것이 아니라 GB당 얼마나 높은 성능을 제공하는지를 '지능 밀도(Intelligence Density)'라는 기준으로 설명합니다.

1-bit Bonsai 27B는 다음과 같은 특징을 가집니다.

  • GB당 지능 밀도 0.53
  • 완전 정밀도 모델 대비 10배 이상 높은 효율
  • 기존 최상위 저비트 모델 대비 약 2.7배 높은 효율

이는 모델의 절대 성능뿐 아니라 어떤 기기에서 실행 가능한지를 결정하는 중요한 지표로 활용됩니다.


온디바이스 AI와 하이브리드 AI의 장점

AI 활용 방식은 단순 질의응답을 넘어 지속적으로 작업을 수행하는 에이전트 중심으로 발전하고 있습니다.

이러한 에이전트는 하나의 작업을 수행하는 동안 모델을 수십 번에서 수백 번까지 반복 호출합니다.

클라우드 기반 환경에서는 다음과 같은 제약이 발생할 수 있습니다.

  • 모든 단계가 네트워크를 통해 처리됨
  • 반복 호출에 따른 API 비용 증가
  • 사용자 데이터가 외부 서버를 거침

반면 로컬에서 Bonsai 27B를 실행하면 다음과 같은 장점이 있습니다.

  • 반복 호출 비용 없음
  • 사용자 데이터가 기기를 벗어나지 않음
  • 오프라인에서도 AI 활용 가능
  • 지속적인 에이전트 실행 가능

또한 민감하지 않은 작업은 로컬에서 처리하고, 높은 성능이 필요한 일부 작업만 클라우드로 전송하는 하이브리드 배포 구조도 구현할 수 있습니다.


실행 속도

Bonsai 27B의 최대 생성 속도는 다음과 같습니다.

플랫폼 1-bit Ternary
NVIDIA GeForce RTX 5090 163 tok/s 134 tok/s
M5 Max 87 tok/s 58 tok/s

또한 다음 기능도 함께 지원합니다.

  • 최대 262K 토큰 문맥
  • 추측 디코딩(Speculative Decoding)
  • 4비트 비전 타워

지원 플랫폼과 배포 환경

Bonsai 27B는 다양한 환경에서 실행할 수 있도록 설계되었습니다.

Apple 플랫폼에서는 MLX를 통해 다음 기기에서 네이티브 실행을 지원합니다.

  • Mac
  • iPhone
  • iPad

NVIDIA GPU 환경에서는 CUDA를 사용하며, 두 플랫폼 모두 하이브리드 어텐션 구조에 최적화된 사용자 정의 저비트 커널을 활용합니다.

또한 모델 가중치는 Apache 2.0 License로 제공되며, 개발자가 모델을 테스트할 수 있는 무료 개발자 프리뷰 API도 지원합니다.


간단한 활용 예시

Bonsai 27B는 온디바이스 AI 에이전트 구현에 활용할 수 있습니다.

예를 들어 다음과 같은 흐름을 구성할 수 있습니다.

  1. 스마트폰에서 문서와 이미지를 로컬로 분석합니다.
  2. 반복적인 추론과 도구 호출은 Bonsai 27B가 기기 내에서 수행합니다.
  3. 매우 복잡한 추론이나 고성능 처리가 필요한 단계만 클라우드 모델에 전달합니다.
  4. 결과를 다시 로컬에서 통합하여 사용자에게 제공합니다.

이러한 방식은 네트워크 비용을 줄이고 개인정보 보호를 강화하면서도 AI 에이전트의 활용 범위를 넓힐 수 있습니다.


728x90

Bonsai 27B는 단순히 대규모 언어 모델을 압축한 사례를 넘어, 27B급 AI 모델을 스마트폰에서 실행 가능한 수준으로 구현했다는 점에서 의미가 큽니다.

특히 1-bit와 Ternary 기반의 초저비트 압축 기술을 통해 모델 크기를 크게 줄이면서도 기준 모델 대비 90~95% 수준의 성능을 유지했으며, 추론, 비전, 도구 호출, 에이전트 기능까지 지원해 실사용 가능성을 높였습니다.

또한 로컬 AI와 클라우드 AI를 결합하는 하이브리드 구조를 지원함으로써 반복적인 에이전트 작업의 비용 절감, 개인정보 보호, 오프라인 활용 등 다양한 장점을 제공합니다.

앞으로 이러한 초저비트 압축 기술이 더욱 발전한다면, 고성능 AI는 더 이상 데이터센터에만 머무르지 않고 스마트폰, 태블릿, 노트북 등 일상적인 개인 기기에서도 자연스럽게 활용되는 환경으로 확장될 가능성이 높습니다.

300x250

https://prismml.com/news/bonsai-27b

 

PrismML — Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone

 

prismml.com

728x90
반응형
그리드형