본문 바로가기

인공지능

Nemotron-Labs-3-Puzzle-75B-A9B란? 대규모 LLM을 2배 더 효율적으로 배포하는 모델 압축 기술

728x90
반응형
728x170

대규모 언어 모델 배포의 한계를 해결하는 Nemotron-Labs-3-Puzzle-75B-A9B

대규모 언어 모델(LLM)의 성능이 빠르게 발전하면서 실제 서비스 환경에서는 높은 추론 성능뿐만 아니라 낮은 지연 시간(Latency), 적은 메모리 사용량, 높은 처리량(Throughput)이 더욱 중요한 요소가 되고 있습니다. 아무리 뛰어난 성능의 모델이라도 실제 운영 환경에서 많은 사용자의 요청을 동시에 처리하지 못한다면 활용 가치가 크게 떨어질 수 있습니다.

이러한 문제를 해결하기 위해 공개된 Nemotron-Labs-3-Puzzle-75B-A9B는 기존 Nemotron-3-Super 모델을 효율적으로 압축하면서도 성능을 최대한 유지하도록 설계된 모델입니다. 특히 하드웨어를 고려한 모델 압축 기법과 다양한 최적화 기술을 적용하여 서버 처리량을 약 2배 향상시키고, 긴 컨텍스트 환경에서도 높은 동시 처리 성능을 제공합니다.

이번 글에서는 Nemotron-Labs-3-Puzzle-75B-A9B의 핵심 기술과 주요 특징, 그리고 성능 향상 방법에 대해 살펴보겠습니다.

반응형

Nemotron-Labs-3-Puzzle-75B-A9B란?

Nemotron-Labs-3-Puzzle-75B-A9B는 대규모 하이브리드 MoE(Mixture-of-Experts) 모델인 Nemotron-3-Super를 효율적인 서비스 환경에 맞게 압축한 모델입니다.

이 모델은 단순히 파라미터 수를 줄이는 것이 아니라 다음과 같은 배포 환경의 핵심 문제를 해결하는 것을 목표로 합니다.

  • 추론 지연 시간 감소
  • 메모리 사용량 절감
  • 서버 처리량 향상
  • 긴 컨텍스트 환경에서 높은 동시 처리 지원
  • 원본 모델 수준의 성능 유지

특히 단일 NVIDIA H100 GPU에서 기존에는 1개의 1M 토큰 요청만 처리 가능했던 환경을 최대 8개의 동시 요청까지 확장한 것이 대표적인 특징입니다.


핵심 기술: Iterative Puzzle 프레임워크

Nemotron-Labs-3-Puzzle-75B-A9B의 핵심은 기존 Puzzle 프레임워크를 발전시킨 Iterative Puzzle입니다.

기존 모델 압축은 한 번의 압축 과정으로 모델 크기를 줄이는 방식이 일반적입니다. 하지만 Iterative Puzzle은 압축과 성능 복구를 반복 수행하여 성능 저하를 최소화합니다.

전체 과정은 다음과 같습니다.

  1. 구조적 압축 수행
  2. Knowledge Distillation(KD)로 성능 복구
  3. 중요도 재계산
  4. 다시 구조적 압축 수행
  5. 최종 모델 완성

이러한 반복 구조를 통해 모델 내부 표현의 변화에 맞춰 중요도를 지속적으로 재평가하며 더욱 효율적인 모델 구조를 완성합니다.


구조적 압축 방식

Iterative Puzzle에서는 여러 가지 구조적 압축 기법이 함께 적용됩니다.

Heterogeneous MoE Pruning

MoE 모델은 모든 레이어가 동일한 전문가(Expert) 수를 사용할 필요는 없습니다.

Nemotron-Labs-3-Puzzle-75B-A9B는 각 레이어의 중요도를 분석하여 필요한 레이어에는 더 많은 전문가를 유지하고, 중요도가 낮은 레이어는 더 적극적으로 압축합니다.

이를 통해 동일한 모델 크기에서도 더욱 높은 효율을 얻을 수 있습니다.


Mamba SSM Pruning

Hybrid 구조에서 사용되는 Mamba SSM(State Space Model)의 상태 크기도 함께 최적화됩니다.

기존 상태 크기

  • 128

압축 후

  • 96

상태 공간을 축소하여 메모리 사용량과 연산량을 줄이면서도 모델 성능은 최대한 유지하도록 설계되었습니다.


Knowledge Distillation을 통한 성능 유지

모델을 압축하면 일반적으로 성능이 저하됩니다.

이를 방지하기 위해 Knowledge Distillation(KD)이 적용됩니다.

학습 데이터 구성은 다음과 같습니다.

  • 사전 학습 데이터 30%
  • 지도 미세조정(SFT) 데이터 70%

학생(Student) 모델은 원본 Super 모델의 출력(Logits)을 학습하여 압축 과정에서 발생할 수 있는 성능 손실을 최소화합니다.

이를 통해 모델 크기는 줄이면서도 원본 모델과 유사한 성능을 유지할 수 있습니다.


Reinforcement Learning을 통한 추가 성능 개선

압축 이후 일부 작업에서는 성능 저하가 발생할 수 있습니다.

특히 다음과 같은 영역에서 보완이 이루어졌습니다.

  • 소프트웨어 엔지니어링
  • 에이전트 기반 작업

이를 개선하기 위해 Reinforcement Learning(RL)을 추가 적용했습니다.

RL 과정에서는

  • 다중 Rollout
  • Sandbox 환경
  • RL Feedback

을 활용하여 실제 작업 수행 능력을 향상시켰습니다.


추론 속도를 높이는 추가 최적화

Nemotron-Labs-3-Puzzle-75B-A9B는 모델 압축뿐 아니라 추론 속도 향상을 위한 기술도 함께 적용했습니다.

FP8 및 NVFP4 양자화

모델을 FP8 및 NVFP4 형식으로 양자화하여 연산량과 메모리 사용량을 줄였습니다.

이를 통해 GPU 활용 효율을 높이고 추론 속도를 개선합니다.

Multi-Token Prediction(MTP)

공유된 MTP 헤드를 활용하여 여러 개의 토큰을 동시에 예측하는 Speculative Decoding을 강화했습니다.

기존에는 토큰을 하나씩 생성했다면, MTP는 여러 토큰을 동시에 예측하여 응답 속도를 더욱 향상시킵니다.


주요 성능 향상

Nemotron-Labs-3-Puzzle-75B-A9B는 모델 크기를 줄이는 것뿐 아니라 실제 서비스 환경에서 높은 효율을 제공합니다.

활성 파라미터 감소

  • 기존: 12.8B
  • 압축 후: 9.3B

활성 파라미터를 크게 줄여 연산량과 메모리 부담을 감소시켰습니다.

서버 처리량 향상

고성능 NVIDIA B200 환경에서는 원본 모델 대비 약 2배 높은 서버 처리량을 달성했습니다.

이는 동일한 하드웨어에서 더 많은 사용자 요청을 처리할 수 있음을 의미합니다.

긴 컨텍스트 처리 성능

1M 토큰 환경에서

기존

  • 단일 요청 처리

Puzzle-75B-A9B

  • 단일 H100 GPU에서 최대 8개의 요청 동시 처리

긴 문맥 기반 서비스에서도 높은 활용성을 제공합니다.

원본 모델 수준의 성능 유지

다양한 벤치마크에서 원본 모델과 유사한 성능을 유지했습니다.

대표적인 평가 항목은 다음과 같습니다.

  • MMLU-Pro
  • AIME25
  • LiveCodeBench

압축 모델임에도 불구하고 성능 저하를 최소화하면서 높은 배포 효율을 달성했습니다.


Nemotron-Labs-3-Puzzle-75B-A9B의 핵심 특징

정리하면 Nemotron-Labs-3-Puzzle-75B-A9B는 다음과 같은 특징을 갖습니다.

  • Iterative Puzzle 기반의 반복 압축 및 성능 복구
  • Heterogeneous MoE Pruning을 통한 레이어별 최적화
  • Mamba SSM 구조 최적화
  • Knowledge Distillation 기반 성능 유지
  • Reinforcement Learning 기반 성능 보완
  • FP8 및 NVFP4 양자화 적용
  • Multi-Token Prediction을 통한 추론 속도 향상
  • 서버 처리량 약 2배 향상
  • 1M 토큰 환경에서 최대 8개 동시 요청 처리 지원

728x90

Nemotron-Labs-3-Puzzle-75B-A9B는 단순히 모델의 크기를 줄인 압축 모델이 아니라, 하드웨어와 모델 구조를 함께 고려한 최적화 프레임워크를 적용한 사례입니다.

특히 Iterative Puzzle을 중심으로 구조적 압축과 Knowledge Distillation을 반복 수행하고, Reinforcement Learning, 양자화, Multi-Token Prediction까지 결합하여 성능과 효율을 동시에 확보했습니다.

그 결과 활성 파라미터를 크게 줄이면서도 원본 모델과 유사한 성능을 유지했으며, 서버 처리량 향상과 긴 컨텍스트 환경에서의 높은 동시 처리 능력을 확보했습니다.

이러한 접근 방식은 앞으로 대규모 생성형 AI 모델을 실제 서비스 환경에 효율적으로 배포하기 위한 중요한 방향성을 제시하는 사례로 평가할 수 있습니다.

300x250

https://arxiv.org/abs/2607.04371?fbclid=IwY2xjawS64DBleHRuA2FlbQIxMABicmlkETEwWVUzUDJLUjZzbWZtUmdlc3J0YwZhcHBfaWQQMjIyMDM5MTc4ODIwMDg5MgABHsY9VKFaLFYfUhuHKwEbz-xBd3PD9UR5wTNL-8Rcs0NjIr5jNOhVcC3MllLO_aem_aoq93uh6yVUQDPdJJr1XCw

 

Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs

We present Nemotron-Labs-3-Puzzle-75B-A9B, a compressed variant of Nemotron-3-Super optimized for interactive deployment. We designed the model to maximize server throughput under high user throughput constraints. In interactive serving workloads on a sing

arxiv.org

728x90
반응형
그리드형