
MiniMax가 새롭게 공개한 M2.5는 단순한 성능 경쟁을 넘어, 실제 업무 환경에서의 생산성을 목표로 설계된 모델입니다. 코딩, 검색, 오피스 작업과 같이 경제적 가치가 높은 영역에서 최고 수준의 벤치마크 성과를 기록했으며, 속도와 비용 효율성까지 함께 개선했습니다. 이 글에서는 MiniMax M2.5의 핵심 개념부터 성능 지표, 비용 구조, 강화학습 기반 확장 전략, 그리고 실제 업무 적용 사례까지 체계적으로 정리합니다.
M2.5 개요 및 주요 성능
M2.5는 수십만 개의 복잡한 실제 환경에서 강화학습을 통해 훈련된 모델입니다. 단순 질의응답을 넘어, 코딩·도구 활용·검색·사무 작업 등 실질적인 업무 수행 능력을 목표로 개발되었습니다.
주요 벤치마크 성과
- SWE-Bench Verified: 80.2%
- Multi-SWE-Bench: 51.3%
- BrowseComp(컨텍스트 관리 포함): 76.3%
특히 SWE-Bench Verified 기준으로 이전 세대인 M2.1 대비 37% 더 빠른 속도를 기록했으며, Claude Opus 4.6과 동일한 처리 속도(약 22.8~22.9분)를 달성했습니다.
성능뿐 아니라 비용 효율성도 눈에 띕니다. 100TPS 기준 시간당 1달러, 50TPS 기준 0.3달러 수준으로 운영이 가능해 대규모 에이전트 운영 환경에서도 부담을 낮췄습니다.
코딩 성능: 아키텍트형 사고 구조
M2.5는 단순 코드 생성기를 넘어, 설계 중심의 사고 구조를 갖춘 모델입니다.
지원 언어 및 범위
Go, C, C++, TypeScript, Rust, Kotlin, Python, Java, JavaScript, PHP, Lua, Dart, Ruby 등 10개 이상의 언어에서 우수한 성능을 보입니다.
특징
- 코드 작성 전 시스템 설계, UI 구성, 기능 분해를 수행
- 200,000개 이상의 실제 환경에서 학습
- 설계 → 개발 → 기능 반복 → 테스트까지 개발 생애주기 전반 지원
SWE-Bench Verified 내 세부 평가에서도 Droid 79.7점, OpenCode 76.1점을 기록하며 Opus 4.6 대비 근소하게 높은 점수를 보였습니다.
즉, 단순한 코드 자동완성이 아니라 프로젝트 단위의 구조적 접근이 가능한 모델로 볼 수 있습니다.
검색 및 도구 호출 능력
M2.5는 복잡한 검색과 도구 기반 작업에서도 강점을 보입니다.
- BrowseComp, Wide Search에서 업계 최고 수준 성능
- RISE(Realistic Interactive Search Evaluation) 기반 실제 전문가 수준 검색 능력 검증
- 이전 세대 대비 20% 적은 검색 라운드로 동일 결과 도출
이는 단순히 답을 많이 찾는 것이 아니라, 정확한 탐색 경로와 효율적 추론을 통해 토큰 사용량까지 최적화했다는 의미입니다. 복잡한 에이전트 기반 자동화 업무에서 특히 강점을 발휘할 수 있는 구조입니다.
오피스 업무 수행 능력
M2.5는 Word, PowerPoint, Excel 등 오피스 도구 기반 업무도 강화되었습니다.
- 금융·법률·사회과학 전문가 협업 기반 데이터 구축
- 전문 문서 작성 및 재무 모델링 수행
- 내부 평가 프레임워크 GDPval-MM에서 평균 59.0% 승률 기록
토큰 비용 대비 생산성 향상을 실측해 실제 업무 효율성이 검증되었습니다. 단순 초안 작성이 아니라, 전문가 수준 문서 구조화와 데이터 모델링을 지원한다는 점이 특징입니다.
속도와 효율성: 37% 향상된 처리 성능
SWE-Bench Verified 기준 비교:
- M2.5: 평균 3.52M 토큰, 22.8분
- M2.1: 3.72M 토큰, 31.3분
동일 작업에서 더 적은 토큰과 더 짧은 시간으로 결과를 도출합니다. Claude Opus 4.6과 동일한 속도이면서 비용은 약 10% 수준에 불과합니다.
기본 처리 속도는 100TPS로, 일부 모델 대비 약 2배 빠른 수준입니다.
비용 구조 및 운영 전략
M2.5는 두 가지 버전으로 제공됩니다.
1. M2.5-Lightning (100TPS)
- 입력 100만 토큰당 $0.3
- 출력 100만 토큰당 $2.4
- 1시간 연속 실행 시 약 $1
2. M2.5 (50TPS)
- Lightning 요금의 절반
- 1시간 연속 실행 시 약 $0.3
출력 기준 비용은 Opus, Gemini 3 Pro, GPT-5 대비 1/10~1/20 수준입니다. 연간 10,000달러로 4개 인스턴스를 상시 운영할 수 있어, 대규모 에이전트 시스템 구축에도 적합합니다.
강화학습 확장 전략(RL Scaling)
M2.5의 핵심은 대규모 강화학습 확장 전략입니다.
Forge 프레임워크
MiniMax는 에이전트형 RL 프레임워크 Forge를 자체 개발했습니다.
- 훈련·추론 엔진과 에이전트 완전 분리
- 비동기 스케줄링 최적화
- 트리 병합 전략 도입
- 훈련 속도 40배 향상
또한 CISPO 알고리듬을 통해 대규모 MoE 모델의 안정성을 확보했고, 프로세스 보상 메커니즘으로 긴 컨텍스트 환경에서도 품질을 유지합니다.
지능과 응답 속도의 균형을 맞추기 위한 작업 시간 평가 체계도 도입되어, 실무 환경 중심의 최적화를 수행했습니다.
MiniMax Agent 통합 및 실제 활용
M2.5는 MiniMax Agent에 완전 통합되어 전문 직원 수준의 에이전트 경험을 제공합니다.
주요 특징
- Office Skills 자동 로드
- 산업별 전문 지식과 결합해 맞춤형 Expert 생성 가능
- 연구 보고서 자동 작성
- 재무 모델 자동 생성 및 검증
현재 10,000개 이상의 Expert가 구축되어 있으며 빠르게 증가 중입니다.
MiniMax 내부에서는 이미 전체 업무의 30%를 M2.5가 자동 수행하고 있으며, 신규 커밋 코드의 80%가 M2.5가 생성한 코드입니다. 이는 단순 벤치마크가 아니라 실제 운영 환경에서 생산성이 검증되었음을 의미합니다.
평가 방법 및 신뢰성
M2.5는 SWE-Bench, Terminal Bench 2, VIBE-Pro, BrowseComp, Wide Search, RISE, GDPval-MM, MEWC, Finance Modeling 등 다양한 내부·외부 벤치마크를 활용해 평가되었습니다.
모든 테스트는 통일된 파이프라인과 반복 실행 평균값으로 산출되었으며, 8코어 CPU, 16GB 메모리, 7200초 제한, 표준 도구 세트 환경에서 진행되었습니다.
이는 단일 데모가 아니라, 재현 가능한 환경에서의 체계적인 검증이라는 점에서 의미가 있습니다.
성능 경쟁을 넘어 ‘업무 중심’ 모델로의 전환
MiniMax M2.5는 단순히 더 똑똑한 모델이 아니라, 더 빠르고, 더 저렴하며, 실제 업무에서 바로 활용 가능한 모델을 지향합니다.
- 강화학습 기반의 대규모 실제 환경 훈련
- 코딩·검색·오피스 전 영역에서 SOTA 성능
- 37% 속도 향상
- 1/10 수준의 비용 구조
- 내부 업무 30% 자동화 및 코드 생성 80% 달성
이 모델은 “AI가 얼마나 똑똑한가”라는 질문을 넘어, “AI가 실제로 얼마나 일을 대신할 수 있는가”라는 질문에 답을 제시합니다.
앞으로 대규모 에이전트 기반 자동화 환경이 확대될수록, 성능과 비용을 동시에 만족하는 모델의 중요성은 더욱 커질 것입니다. M2.5는 그 방향성을 분명히 보여주는 사례라고 할 수 있습니다.
https://www.minimax.io/news/minimax-m25
MiniMax M2.5: 更快更强更智能,为真实世界生产力而生
Today we're introducing our latest model, MiniMax-M2.5. Extensively trained with reinforcement learning in hundreds of thousands of complex real-world environments, M2.5 is SOTA in coding, agentic tool use and search, office work, and a range of other econ
www.minimax.io

'인공지능' 카테고리의 다른 글
| Google 14년 경험에서 얻은 엔지니어링 조직 운영과 개발 문화에 대한 14가지 교훈 (0) | 2026.02.16 |
|---|---|
| ClawHost로 OpenClaw를 단 1분 만에 VPS에 배포하는 방법과 아키텍처 완전 정리 (0) | 2026.02.15 |
| Gemini 3 Deep Think 업그레이드: 과학·연구·엔지니어링 난제를 해결하는 전문 추론 모드 (0) | 2026.02.13 |
| OpenAI GPT-5.3-Codex-Spark: 초저지연 코딩을 위한 새로운 AI 모델 (0) | 2026.02.13 |
| GLM-5 로컬 실행 가이드: 744B 초대형 추론 모델을 내 장비에서 구동하는 방법 (0) | 2026.02.13 |