본문 바로가기

인공지능

LongCat-2.0 대규모 MoE 언어 모델의 아키텍처와 초장문 컨텍스트 처리 전략

728x90
반응형
728x170

이 글에서는 1.6조 개의 파라미터를 가진 대규모 MoE(Mixture of Experts) 언어 모델 LongCat-2.0의 핵심 기술과 아키텍처를 정리합니다.
LongCat-2.0은 초장문 컨텍스트 처리, 희소 어텐션 구조, N-gram Embedding, 그리고 AI ASIC 기반 대규모 인프라 위에서의 학습과 서빙까지 전 과정을 포괄하는 모델입니다. 본문에서는 모델의 설계 배경부터 주요 기술 요소, 학습·추론 인프라, 그리고 실제 성능 평가 결과까지 단계적으로 살펴봅니다.

반응형

LongCat-2.0 개요

LongCat-2.0은 총 1.6조 파라미터를 가진 대규모 MoE 언어 모델로, 토큰당 약 480억 개의 파라미터만 활성화되는 구조를 채택했습니다.
전체 학습은 AI ASIC 슈퍼팟 환경에서 진행되었으며, 35조 개 이상의 토큰을 사용한 대규모 사전 학습을 안정적으로 완료했습니다.

특히 100만 토큰(1M context) 길이의 입력을 처리할 수 있도록 설계되어, 코드 분석, 에이전트 기반 작업, 장기 추론 작업에서 강점을 보이도록 학습되었습니다.


LongCat-2.0 아키텍처 설계

LongCat Sparse Attention(LSA)

LongCat-2.0은 기존 DeepSeek Sparse Attention을 확장한 LongCat Sparse Attention(LSA) 구조를 도입했습니다.
LSA는 장문 입력 처리 시 발생하는 메모리 접근 비효율과 인덱싱 비용 문제를 해결하기 위해 세 가지 독립적인 개선 전략을 적용합니다.

  • Streaming-aware Indexing(SI)
    연속적인 메모리 접근과 동적 랜덤 선택을 결합하여 HBM 접근 효율을 높이고, 예측 가능한 메모리 패턴을 형성합니다.
  • Cross-Layer Indexing(CLI)
    인접한 레이어 간 어텐션 중요도의 안정성을 활용해 하나의 인덱싱 결과를 여러 레이어에서 재사용합니다. 이를 통해 추론 시 인덱싱 비용을 크게 줄입니다.
  • Hierarchical Indexing(HI)
    블록 단위의 거친 후보 선택 후 세밀한 토큰 선택을 수행하는 2단계 구조로, 인덱서가 처리해야 할 후보 공간을 축소합니다.

이 세 가지 구성 요소는 독립적으로 활성화 또는 비활성화가 가능하도록 설계되었습니다.


N-gram Embedding을 통한 파라미터 효율 개선

LongCat-2.0은 MoE 구조와 직교하는 희소 차원에서 파라미터 활용도를 높이기 위해 N-gram Embedding을 적용합니다.
n-gram 크기는 5로 설정되었으며, 총 1,350억 개의 N-gram Embedding 파라미터가 포함되어 있습니다.

설계 원칙은 다음과 같습니다.

  • MoE 전문가 확장보다 N-gram Embedding 확장이 성능 향상에 더 효과적인 구간을 활용
  • 전체 파라미터 대비 N-gram Embedding 비중을 10% 이하로 제한하여 효율 유지

이 구조는 추론 시 대규모 배치 디코딩에서 메모리 I/O를 줄이는 데도 기여합니다.


AI ASIC 슈퍼팟 기반 학습 인프라

대규모 학습 환경

LongCat-2.0은 5만 개 이상의 AI ASIC 가속기를 활용해 학습되었습니다.
GPU 대비 상대적으로 메모리가 제한된 환경에서 학습을 안정화하기 위해 병렬화 전략과 메모리 관리 기법이 결합되었습니다.

  • 6차원 병렬화(TP, CP, EP, DP, PP, EMBP)
  • ZeRO-1, 선택적 재계산, OOM-aware 오프로딩
  • Muon 옵티마이저 적용

결정성 및 신뢰성 확보

생산 환경 재현성을 위해 통신과 연산 전반에 걸쳐 결정성을 강제했으며,
부동소수점 오차를 줄이기 위한 누산 방식 개선과 하드웨어 비트 플립 감지 메커니즘을 도입했습니다.


1M 컨텍스트 학습과 추론 최적화

초장문 컨텍스트 학습

1M 토큰 길이 학습을 위해 CP 병렬화를 512 이상으로 확장하고, 데이터 재분배 및 균형 전략을 적용했습니다.
연산과 통신의 오버랩을 극대화해 동기화 비용을 최소화한 구조도 특징입니다.

추론 및 서빙 최적화

1.6조 파라미터 모델을 1M 컨텍스트로 서빙하기 위해 다음과 같은 최적화가 적용되었습니다.

  • KV-cache 병렬화(KVP)
  • 프리필–디코드 분리(PD) 배포 구조
  • 슈퍼 커널과 가중치 프리패치
  • Expert-Parallel Load Balancing(EPLB)

이를 통해 TTFT와 TPOT의 균형을 유지하면서 안정적인 대규모 서빙이 가능해졌습니다.


다중 전문가 기반 사후 학습(MOPD)

LongCat-2.0은 사후 학습 단계에서 세 종류의 전문가 그룹을 통합합니다.

  • Agent Experts: 자율 작업 수행 및 도구 호출 안정성 강화
  • Reasoning Experts: 수학, STEM, 다단계 추론 능력 강화
  • Interaction Experts: 지시 이행 정확도 및 안전성 개선

이 전문가 그룹은 MOPD 아키텍처를 통해 결합되어, 복잡한 실제 작업을 안정적으로 수행할 수 있도록 설계되었습니다.


성능 평가 결과

LongCat-2.0은 코드 에이전트, 일반 에이전트, 기초 추론 벤치마크 전반에서 경쟁 모델과 유사하거나 일부 항목에서 우수한 성능을 기록했습니다.
특히 장문 코드 이해, 저장소 단위 편집, 에이전트 기반 자동화 작업에서 강점을 보입니다.


728x90

LongCat-2.0은 단순히 파라미터 규모를 확장한 모델이 아니라,
초장문 컨텍스트 처리, 희소 어텐션 구조, 파라미터 효율성, 그리고 대체 하드웨어 기반 인프라까지 포함한 종합적인 설계 결과물입니다.

이 모델은 향후 대규모 에이전트 시스템, 코드 자동화, 장기 추론 기반 애플리케이션에서 실질적인 활용 가능성을 보여주며,
비GPU 환경에서도 프론티어급 언어 모델 학습과 서빙이 가능하다는 점에서 중요한 기술적 시사점을 제공합니다.

300x250

https://longcat.chat/blog/longcat-2.0/

 

Introducing LongCat-2.0

1.6万亿总参大模型,训练全程由国产芯片完成

longcat.chat

728x90
반응형
그리드형