본문 바로가기

인공지능

AngelSpec v0.1.0: Speculative Decoding 초안(Draft) 모델 학습 프레임워크 완벽 정리

728x90
반응형
728x170

AngelSpec이란?

대규모 언어 모델(LLM)의 추론 속도를 높이기 위한 대표적인 기법 중 하나가 Speculative Decoding입니다. AngelSpec은 이러한 Speculative Decoding을 위한 Draft 모델을 학습하는 Torch 기반의 네이티브 프레임워크입니다.

AngelSpec은 Autoregressive 방식의 MTP(Multi-Token Prediction) Draft 모델Block-Parallel 방식의 DFlash 계열 모델을 모두 지원하며, AngelSpec 기술 보고서에서 소개된 모든 Draft 모델의 학습에 사용된 공식 프레임워크입니다.

특히 기술 보고서에 소개된 TTT 기반 MTP DrafterDFly 계열 모델 모두 AngelSpec을 통해 학습 및 공개되었습니다.

반응형

AngelSpec v0.1.0 출시

2026년 7월 29일 AngelSpec v0.1.0이 공개되었습니다.

이번 버전에서는 다음과 같은 기능을 제공합니다.

  • MTP 기반 Speculative Decoding 학습 지원
  • Block-Parallel Speculative Decoding 학습 지원
  • AngelSpec 기술 보고서와 함께 공개
  • Draft 모델 공개

AngelSpec의 주요 특징

하나의 학습 파이프라인으로 6가지 Draft 아키텍처 지원

AngelSpec은 다양한 Draft 모델을 하나의 통합된 학습 파이프라인에서 지원합니다.

지원되는 Draft 아키텍처는 다음과 같습니다.

  • DFly
  • DFlash
  • DFlare
  • Eagle3
  • DSpark
  • MTP

각 아키텍처는 별도의 학습 코드를 작성할 필요 없이 설정(Configuration) 변경만으로 전환할 수 있도록 설계되었습니다.


TTT 기반 MTP 학습 지원

AngelSpec은 TTT(Test-Time Training) 기반의 MTP 학습을 지원합니다.

주요 특징은 다음과 같습니다.

  • On-policy Multi-depth Rollout
  • 단일 Causal Pass와 유사한 수준의 메모리 사용
  • Ulysses Sequence Parallelism을 활용한 최대 128K Long Context 학습 지원

이를 통해 긴 컨텍스트 환경에서도 효율적인 Draft 모델 학습이 가능합니다.


Acceptance-Aligned 학습 목표 제공

AngelSpec은 다양한 학습 목표(Objective)를 조합하여 사용할 수 있도록 구성되어 있습니다.

지원되는 학습 목표는 다음과 같습니다.

  • Cross Entropy(CE)
  • Top-k KL
  • LK Loss
  • D-PACE Weighting
  • End-to-End TV

이러한 Objective는 설정만으로 자유롭게 조합하여 사용할 수 있습니다.


Document-Aware Sequence Packing

학습 데이터 처리 과정에서는 Document-Aware Sequence Packing 기능을 제공합니다.

특징은 다음과 같습니다.

  • Megatron 스타일 Fixed-Length Packing
  • 문서 간 Strict Cross-Document Isolation
  • DFlash 및 MTP 학습 경로 모두 지원

이를 통해 문서 간 경계가 유지되는 형태로 데이터를 효율적으로 구성할 수 있습니다.


온라인 평가 기능 제공

AngelSpec은 학습 중 최신 체크포인트를 대상으로 실제 Speculative Decoding을 수행하는 온라인 평가 기능을 제공합니다.

평가 항목은 다음과 같습니다.

  • Mean Accepted Length
  • Position별 Acceptance

해당 결과는 실제 Serving Engine에서 측정된 값을 기반으로 보고됩니다.


AngelSpec 아키텍처 구성

AngelSpec은 추론(Inference)학습(Training) 을 각각 별도의 GPU Worker Group에서 수행하는 구조를 사용합니다.

두 Worker Group은 Mooncake Tensor Store를 통해 연결되며,

  • Hidden State 생성
  • 모델 최적화

과정을 독립적으로 확장(Scale-Out)할 수 있도록 설계되었습니다.

이러한 분산 구조는 TorchSpec을 기반으로 하며, AngelSpec은 여기에 Draft 아키텍처와 학습 기능을 확장한 형태입니다.


지원하는 Draft 아키텍처

AngelSpec은 다음과 같은 Draft 모델을 지원합니다.

아키텍처 방식 핵심 아이디어
DFly Block-Parallel Hybrid Target Conditioning + Hidden-Correction AR Head
DFlash Block-Parallel Anchor Sampling + Parallel Block Generation
DFlare Block-Parallel DFlash + Learnable Per-Layer Target Fusion
Eagle3 Autoregressive TTT Test-Time Training with Input Fusion
DSpark Hybrid DFlash Backbone + EAGLE 스타일 Autoregressive Head
MTP Single-Head TTT Full MoE Decoder Layer as Draft (Hy3-native)

각 Draft 모델은 서로 다른 추론 방식과 설계 아이디어를 기반으로 구성되어 있으며, 사용 목적에 따라 선택하여 학습할 수 있습니다.


빠르게 시작하기

AngelSpec은 간단한 설치 과정을 통해 바로 사용할 수 있습니다.

1. AngelSpec 및 vLLM Backend 설치

pip install -e ".[vllm]"
pip install mooncake-transfer-engine

2. 단일 노드 실행

8개의 GPU 환경에서는 다음과 같이 실행할 수 있습니다.

  • Inference GPU : 4개
  • Training GPU : 4개
./examples/qwen3-8b-dfly/run.sh

3. 학습 설정 변경

명령행에서 학습 설정을 직접 변경할 수 있습니다.

예를 들어 Learning Rate와 학습 횟수를 변경하려면 다음과 같이 실행합니다.

./examples/qwen3-8b-dfly/run.sh training.learning_rate=5e-5 training.num_train_steps=500

4. Conda 환경 구성

Conda 환경을 사용하는 경우 다음과 같이 설치할 수 있습니다.

./tools/build_conda.sh 1 vllm
micromamba activate angelspec

sglang Backend도 선택 가능합니다.


제공되는 예제 및 학습 구성

AngelSpec은 다양한 학습 환경을 위한 예제를 제공합니다.

지원되는 예시는 다음과 같습니다.

  • Multi-node (Hy3 Target)
  • Single-node (Qwen3-8B Target)

또한 여러 종류의 학습 Configuration을 함께 제공하여 환경에 맞게 선택하여 사용할 수 있습니다.


공개된 Draft 모델

AngelSpec을 이용하여 학습된 다양한 Draft 모델이 함께 공개되었습니다.

이를 통해 사용자는 직접 학습을 수행하지 않고도 공개된 모델을 활용할 수 있으며, 필요에 따라 동일한 프레임워크를 이용해 새로운 Draft 모델을 학습할 수도 있습니다.


벤치마크 결과

AngelSpec은 오프라인과 실제 서비스 환경 모두에서 성능을 평가했습니다.

Offline Throughput

HY3-295B-A21B 환경(TP=8)에서 Output Token Throughput(Token/s)과 Autoregressive 방식 대비 속도 향상을 측정했습니다.

평가는 6개 데이터셋을 대상으로 수행되었으며, 각 결과는 세 번의 120초 측정 구간 평균을 사용했습니다.


Live Traffic Throughput (D-cut)

실제 Hy3 서비스 트래픽 환경에서도 성능을 검증했습니다.

평가 결과에서는

  • Aggregate Throughput
  • 사용자별 Decode Speed
  • 동시성(Concurrency)

기준으로 성능을 비교했으며, D-cut은 동시성이 증가할수록 추가적인 부하를 처리하면서 처리량을 향상시키는 특성을 보여주었습니다.


728x90

AngelSpec은 Speculative Decoding을 위한 Draft 모델 학습을 하나의 통합된 프레임워크에서 지원하는 Torch 기반 학습 환경입니다.

MTP와 Block-Parallel 방식을 모두 지원하며, 6가지 Draft 아키텍처를 하나의 학습 파이프라인에서 관리할 수 있도록 설계되었습니다. 또한 TTT 기반 MTP 학습, Acceptance-Aligned Objective, Document-Aware Sequence Packing, Online Evaluation 등 다양한 학습 기능을 제공하여 Draft 모델 개발 과정을 효율적으로 지원합니다.

뿐만 아니라 추론과 학습을 분리한 GPU Worker 구조를 기반으로 확장성을 확보했으며, 다양한 예제와 공개된 Draft 모델을 함께 제공하여 실제 환경에서도 손쉽게 활용할 수 있도록 구성되어 있습니다. 이를 통해 AngelSpec은 Speculative Decoding 연구와 Draft 모델 학습을 위한 통합 프레임워크로 활용할 수 있는 기반을 제공합니다.

300x250

https://github.com/Tencent/AngelSpec

 

GitHub - Tencent/AngelSpec: A unified, torch-native training framework for MTP and block-parallel speculative decoding.

A unified, torch-native training framework for MTP and block-parallel speculative decoding. - Tencent/AngelSpec

github.com

728x90
반응형
그리드형