
AngelSpec이란?
대규모 언어 모델(LLM)의 추론 속도를 높이기 위한 대표적인 기법 중 하나가 Speculative Decoding입니다. AngelSpec은 이러한 Speculative Decoding을 위한 Draft 모델을 학습하는 Torch 기반의 네이티브 프레임워크입니다.
AngelSpec은 Autoregressive 방식의 MTP(Multi-Token Prediction) Draft 모델과 Block-Parallel 방식의 DFlash 계열 모델을 모두 지원하며, AngelSpec 기술 보고서에서 소개된 모든 Draft 모델의 학습에 사용된 공식 프레임워크입니다.
특히 기술 보고서에 소개된 TTT 기반 MTP Drafter와 DFly 계열 모델 모두 AngelSpec을 통해 학습 및 공개되었습니다.
AngelSpec v0.1.0 출시
2026년 7월 29일 AngelSpec v0.1.0이 공개되었습니다.
이번 버전에서는 다음과 같은 기능을 제공합니다.
- MTP 기반 Speculative Decoding 학습 지원
- Block-Parallel Speculative Decoding 학습 지원
- AngelSpec 기술 보고서와 함께 공개
- Draft 모델 공개
AngelSpec의 주요 특징
하나의 학습 파이프라인으로 6가지 Draft 아키텍처 지원
AngelSpec은 다양한 Draft 모델을 하나의 통합된 학습 파이프라인에서 지원합니다.
지원되는 Draft 아키텍처는 다음과 같습니다.
- DFly
- DFlash
- DFlare
- Eagle3
- DSpark
- MTP
각 아키텍처는 별도의 학습 코드를 작성할 필요 없이 설정(Configuration) 변경만으로 전환할 수 있도록 설계되었습니다.
TTT 기반 MTP 학습 지원
AngelSpec은 TTT(Test-Time Training) 기반의 MTP 학습을 지원합니다.
주요 특징은 다음과 같습니다.
- On-policy Multi-depth Rollout
- 단일 Causal Pass와 유사한 수준의 메모리 사용
- Ulysses Sequence Parallelism을 활용한 최대 128K Long Context 학습 지원
이를 통해 긴 컨텍스트 환경에서도 효율적인 Draft 모델 학습이 가능합니다.
Acceptance-Aligned 학습 목표 제공
AngelSpec은 다양한 학습 목표(Objective)를 조합하여 사용할 수 있도록 구성되어 있습니다.
지원되는 학습 목표는 다음과 같습니다.
- Cross Entropy(CE)
- Top-k KL
- LK Loss
- D-PACE Weighting
- End-to-End TV
이러한 Objective는 설정만으로 자유롭게 조합하여 사용할 수 있습니다.
Document-Aware Sequence Packing
학습 데이터 처리 과정에서는 Document-Aware Sequence Packing 기능을 제공합니다.
특징은 다음과 같습니다.
- Megatron 스타일 Fixed-Length Packing
- 문서 간 Strict Cross-Document Isolation
- DFlash 및 MTP 학습 경로 모두 지원
이를 통해 문서 간 경계가 유지되는 형태로 데이터를 효율적으로 구성할 수 있습니다.
온라인 평가 기능 제공
AngelSpec은 학습 중 최신 체크포인트를 대상으로 실제 Speculative Decoding을 수행하는 온라인 평가 기능을 제공합니다.
평가 항목은 다음과 같습니다.
- Mean Accepted Length
- Position별 Acceptance
해당 결과는 실제 Serving Engine에서 측정된 값을 기반으로 보고됩니다.
AngelSpec 아키텍처 구성
AngelSpec은 추론(Inference) 과 학습(Training) 을 각각 별도의 GPU Worker Group에서 수행하는 구조를 사용합니다.
두 Worker Group은 Mooncake Tensor Store를 통해 연결되며,
- Hidden State 생성
- 모델 최적화
과정을 독립적으로 확장(Scale-Out)할 수 있도록 설계되었습니다.
이러한 분산 구조는 TorchSpec을 기반으로 하며, AngelSpec은 여기에 Draft 아키텍처와 학습 기능을 확장한 형태입니다.
지원하는 Draft 아키텍처
AngelSpec은 다음과 같은 Draft 모델을 지원합니다.
| 아키텍처 | 방식 | 핵심 아이디어 |
| DFly | Block-Parallel | Hybrid Target Conditioning + Hidden-Correction AR Head |
| DFlash | Block-Parallel | Anchor Sampling + Parallel Block Generation |
| DFlare | Block-Parallel | DFlash + Learnable Per-Layer Target Fusion |
| Eagle3 | Autoregressive TTT | Test-Time Training with Input Fusion |
| DSpark | Hybrid | DFlash Backbone + EAGLE 스타일 Autoregressive Head |
| MTP | Single-Head TTT | Full MoE Decoder Layer as Draft (Hy3-native) |
각 Draft 모델은 서로 다른 추론 방식과 설계 아이디어를 기반으로 구성되어 있으며, 사용 목적에 따라 선택하여 학습할 수 있습니다.
빠르게 시작하기
AngelSpec은 간단한 설치 과정을 통해 바로 사용할 수 있습니다.
1. AngelSpec 및 vLLM Backend 설치
pip install -e ".[vllm]"
pip install mooncake-transfer-engine
2. 단일 노드 실행
8개의 GPU 환경에서는 다음과 같이 실행할 수 있습니다.
- Inference GPU : 4개
- Training GPU : 4개
./examples/qwen3-8b-dfly/run.sh
3. 학습 설정 변경
명령행에서 학습 설정을 직접 변경할 수 있습니다.
예를 들어 Learning Rate와 학습 횟수를 변경하려면 다음과 같이 실행합니다.
./examples/qwen3-8b-dfly/run.sh training.learning_rate=5e-5 training.num_train_steps=500
4. Conda 환경 구성
Conda 환경을 사용하는 경우 다음과 같이 설치할 수 있습니다.
./tools/build_conda.sh 1 vllm
micromamba activate angelspec
sglang Backend도 선택 가능합니다.
제공되는 예제 및 학습 구성
AngelSpec은 다양한 학습 환경을 위한 예제를 제공합니다.
지원되는 예시는 다음과 같습니다.
- Multi-node (Hy3 Target)
- Single-node (Qwen3-8B Target)
또한 여러 종류의 학습 Configuration을 함께 제공하여 환경에 맞게 선택하여 사용할 수 있습니다.
공개된 Draft 모델
AngelSpec을 이용하여 학습된 다양한 Draft 모델이 함께 공개되었습니다.
이를 통해 사용자는 직접 학습을 수행하지 않고도 공개된 모델을 활용할 수 있으며, 필요에 따라 동일한 프레임워크를 이용해 새로운 Draft 모델을 학습할 수도 있습니다.
벤치마크 결과
AngelSpec은 오프라인과 실제 서비스 환경 모두에서 성능을 평가했습니다.
Offline Throughput
HY3-295B-A21B 환경(TP=8)에서 Output Token Throughput(Token/s)과 Autoregressive 방식 대비 속도 향상을 측정했습니다.
평가는 6개 데이터셋을 대상으로 수행되었으며, 각 결과는 세 번의 120초 측정 구간 평균을 사용했습니다.
Live Traffic Throughput (D-cut)
실제 Hy3 서비스 트래픽 환경에서도 성능을 검증했습니다.
평가 결과에서는
- Aggregate Throughput
- 사용자별 Decode Speed
- 동시성(Concurrency)
기준으로 성능을 비교했으며, D-cut은 동시성이 증가할수록 추가적인 부하를 처리하면서 처리량을 향상시키는 특성을 보여주었습니다.
AngelSpec은 Speculative Decoding을 위한 Draft 모델 학습을 하나의 통합된 프레임워크에서 지원하는 Torch 기반 학습 환경입니다.
MTP와 Block-Parallel 방식을 모두 지원하며, 6가지 Draft 아키텍처를 하나의 학습 파이프라인에서 관리할 수 있도록 설계되었습니다. 또한 TTT 기반 MTP 학습, Acceptance-Aligned Objective, Document-Aware Sequence Packing, Online Evaluation 등 다양한 학습 기능을 제공하여 Draft 모델 개발 과정을 효율적으로 지원합니다.
뿐만 아니라 추론과 학습을 분리한 GPU Worker 구조를 기반으로 확장성을 확보했으며, 다양한 예제와 공개된 Draft 모델을 함께 제공하여 실제 환경에서도 손쉽게 활용할 수 있도록 구성되어 있습니다. 이를 통해 AngelSpec은 Speculative Decoding 연구와 Draft 모델 학습을 위한 통합 프레임워크로 활용할 수 있는 기반을 제공합니다.
https://github.com/Tencent/AngelSpec
GitHub - Tencent/AngelSpec: A unified, torch-native training framework for MTP and block-parallel speculative decoding.
A unified, torch-native training framework for MTP and block-parallel speculative decoding. - Tencent/AngelSpec
github.com

'인공지능' 카테고리의 다른 글
| SANA 완전 정리: 고해상도 이미지·비디오 생성을 위한 오픈소스 AI 프레임워크 (0) | 2026.07.30 |
|---|---|
| FLUX 3 공개, 이미지·영상·오디오를 하나의 AI 모델로 학습하는 멀티모달 파운데이션 모델 (0) | 2026.07.30 |
| MAI-Cyber-1-Flash와 MDASH로 구현하는 AI 기반 차세대 사이버 보안 (0) | 2026.07.30 |
| Claude Opus 5 vs Claude Fable 5 비교 분석, 절반의 비용으로 어디까지 가능할까? (0) | 2026.07.30 |
| vLLM에서 Kimi K3를 효율적으로 서빙하는 방법과 주요 최적화 기술 (0) | 2026.07.30 |