
MiniMax가 2026년 7월 31일 공개한 MiniMax H3는 텍스트를 영상으로 변환하는 기존 방식에 기능을 덧붙인 모델이 아니라, 텍스트·이미지·영상·오디오를 하나의 맥락으로 이해하고 영상을 생성하는 범용 멀티모달 생성 모델입니다.
최대 2K 해상도와 4~15초 영상 생성, 네이티브 스테레오 오디오를 지원하며, 텍스트·이미지·영상·오디오를 조합한 복합적인 지시도 자연어 프롬프트로 표현할 수 있다는 점이 핵심입니다.
이번 글에서는 MiniMax H3의 주요 기능과 기술적 특징, API 사용 방식, 입력 조건, 활용 분야와 가격 및 현재 시장에서의 위치까지 입력된 정보를 기반으로 정리합니다.
MiniMax H3는 어떤 모델인가
기존 영상 생성 서비스는 작업별로 서로 다른 모델이나 기능을 사용하는 경우가 많았습니다.
예를 들어 텍스트를 영상으로 만드는 Text-to-Video, 이미지를 영상으로 변환하는 Image-to-Video, 첫 프레임과 마지막 프레임을 지정하는 방식, 특정 인물을 유지하기 위한 레퍼런스 기능, 움직임을 참조하는 기능, 영상 편집 등이 각각 분리돼 있었습니다.
MiniMax H3는 이런 방식을 하나의 사전학습 패러다임으로 통합했습니다.
핵심은 텍스트, 이미지, 영상, 오디오를 각각 별개의 입력으로 처리하는 것이 아니라 하나의 통합된 컨텍스트로 이해한다는 점입니다.
예를 들어 다음과 같은 작업을 하나의 자연어 지시로 표현할 수 있습니다.
- Video 1의 카메라 움직임을 참고
- Image 2의 캐릭터가 노래하도록 설정
- Audio 3의 보컬과 캐릭터의 노래를 맞춤
즉, 단순히 "이 이미지를 영상으로 만들어줘"라는 수준을 넘어 여러 종류의 레퍼런스와 생성 결과 사이의 관계를 자연어로 설명할 수 있도록 설계된 것입니다.
MiniMax H3의 주요 사양
MiniMax가 공개한 주요 사양은 다음과 같습니다.
| 항목 | MiniMax H3 |
| 모델 유형 | 범용 멀티모달 생성 모델 |
| 입력 | 텍스트, 이미지, 영상, 오디오 |
| 최대 출력 해상도 | 2K |
| 영상 길이 | 4~15초 |
| 영상 길이 설정 | 정수 단위 |
| 오디오 | 네이티브 스테레오 |
| API 모델 ID | MiniMax-H3 |
| 현재 사용 방식 | API, Hailuo AI |
| 자체 하드웨어 배포 | 현재 불가 |
| 오픈 웨이트 | 공개 예정 |
현재 H3는 MiniMax 플랫폼 API와 소비자용 Hailuo AI 앱에서 이용할 수 있습니다.
반면 자체 하드웨어에 직접 배포할 수 있는 형태는 아니며, 오픈 웨이트 역시 공개된 것이 아니라 "coming days"로 예고된 상태입니다.
따라서 현재 시점에서 개발자가 H3를 활용하려면 API가 주요 경로라고 볼 수 있습니다.
2K 영상과 네이티브 스테레오 오디오 지원
MiniMax H3에서 눈에 띄는 부분은 2K 영상 생성과 네이티브 스테레오 오디오입니다.
영상 생성 모델에서는 해상도가 높아질수록 처리해야 할 데이터와 계산량이 증가합니다. 특히 영상은 이미지와 달리 시간축까지 함께 처리해야 하기 때문에 해상도와 영상 길이가 모델의 부담에 직접적인 영향을 줍니다.
H3는 최대 2K 해상도의 4~15초 영상을 생성할 수 있으며, 오디오도 영상 생성 이후 별도로 추가하는 방식이 아니라 모델이 생성하는 영상에 네이티브 스테레오 사운드를 포함합니다.
이러한 구조는 광고 영상이나 제품 영상처럼 영상과 사운드의 관계가 중요한 콘텐츠를 생성하는 데 활용할 수 있습니다.
텍스트·이미지·영상·오디오를 하나의 컨텍스트로 처리
H3의 가장 중요한 특징 중 하나는 멀티모달 입력을 통합하는 방식입니다.
기존 방식에서는 이미지, 영상, 오디오가 각각 특정 작업을 위한 별도 입력으로 취급되는 경우가 많았습니다.
반면 H3는 다양한 입력을 하나의 컨텍스트 안에서 해석하고, 각 입력이 생성 결과와 어떤 관계를 갖는지 자연어로 표현할 수 있도록 설계됐습니다.
이를 통해 단순한 생성 명령보다 복합적인 영상 제작 지시가 가능해집니다.
예를 들어 특정 영상의 움직임을 참고하면서 다른 이미지 속 캐릭터를 사용하고, 별도의 오디오를 영상 결과에 연결하는 식의 작업을 하나의 프롬프트로 구성할 수 있습니다.
이 구조는 영상 제작 과정에서 여러 모델과 도구를 번갈아 사용하는 복잡성을 줄이는 방향으로 이어질 수 있습니다.
API는 3가지 생성 방식 제공
MiniMax H3 API의 영상 생성 가이드에서는 크게 세 가지 입력 방식이 제공됩니다.
1. Text-to-Video
텍스트 프롬프트를 기반으로 영상을 생성하는 방식입니다.
영상의 장면, 캐릭터의 행동, 카메라 움직임 등을 자연어로 설명해 생성 요청을 보낼 수 있습니다.
2. First/Last-Frame Image-to-Video
영상의 첫 번째와 마지막 프레임에 사용할 이미지를 지정하고 그 사이의 움직임을 생성하는 방식입니다.
영상 시작과 끝의 상태를 어느 정도 통제하고 싶을 때 활용할 수 있습니다.
3. Reference Generation
이미지, 영상, 오디오 등의 레퍼런스를 활용해 원하는 결과를 생성하는 방식입니다.
H3가 가진 멀티모달 컨텍스트 처리 능력을 가장 적극적으로 활용할 수 있는 방식이라고 볼 수 있습니다.
API 호출 방식은 비동기 3단계로 구성
H3 API의 기본적인 사용 흐름은 복잡하지 않습니다.
전체 과정은 크게 세 단계로 구성됩니다.
작업 생성 → task_id 확인 및 상태 조회 → 결과 영상 다운로드
먼저 생성 요청을 보내 작업을 생성합니다.
이후 반환된 task_id를 이용해 작업 상태를 확인합니다.
생성이 완료되면 결과에 포함된 content.url을 이용해 생성된 영상을 가져오는 구조입니다.
즉, 영상을 요청하는 즉시 결과가 반환되는 동기 방식이 아니라 작업을 생성하고 완료 여부를 확인한 뒤 결과를 가져오는 비동기 방식입니다.
입력 데이터에는 제한 사항이 있다
H3를 API로 활용할 때는 입력 파일과 프롬프트에 대한 제한을 고려해야 합니다.
레퍼런스 이미지와 영상
레퍼런스 이미지는 최대 9개까지 사용할 수 있습니다.
레퍼런스 영상은 최대 3개이며, 각각 2~15초이고 전체 영상 길이의 합은 15초 이하여야 합니다.
레퍼런스 오디오는 최대 3개까지 사용할 수 있습니다.
다만 오디오만 단독으로 전달할 수는 없으며, 이미지 또는 영상이 함께 제공돼야 합니다.
전체 혼합 입력 파일은 최대 12개입니다.
프롬프트 및 요청 크기
프롬프트는 최대 7,000자까지 사용할 수 있으며, 요청 본문 크기는 64MB 이하입니다.
용량이 큰 파일을 사용하는 경우에는 URL 입력 방식이 권장됩니다.
파일별 크기 제한은 다음과 같습니다.
- 영상: 최대 50MB
- 이미지: 최대 30MB
- 오디오: 최대 15MB
지원 포맷은 영상의 경우 H.264/H.265, 이미지는 JPG·PNG·WEBP·HEIC·HEIF, 오디오는 WAV·MP3입니다.
따라서 여러 레퍼런스를 결합하는 프로젝트라면 생성 전에 파일 개수와 크기, 포맷을 먼저 확인하는 것이 필요합니다.
MiniMax H3의 핵심 기술 4가지
H3의 성능을 뒷받침하는 기술적 요소도 주목할 만합니다.
1. Contextual Omni Representation
첫 번째는 Contextual Omni Representation입니다.
기존 캡셔닝이 주로 생성하려는 영상 자체를 설명하는 데 초점을 맞췄다면, H3는 컨텍스트와 목표 영상 사이의 관계를 설명하는 방향으로 캡셔닝을 다시 설계했습니다.
MiniMax의 설명에 따르면 일부 소스 자료는 추론 과정에서 약 10만 토큰 수준의 정보가 필요하지만, 이를 평균 약 4,000토큰 수준으로 증류합니다.
여기서 언어는 단순한 프롬프트 입력 수단이 아니라 서로 다른 멀티모달 정보와 생성 목표를 연결하는 역할을 합니다.
2. H3-VAE
두 번째는 H3-VAE입니다.
MiniMax는 영상 토크나이저를 전면적으로 개선했으며, 높은 압축률을 통해 유효 시퀀스 길이를 4배 향상시켰다고 설명합니다.
이를 통해 학습과 추론 비용을 줄이고, 2K 해상도 영상을 처리할 수 있는 기반을 마련했다는 것이 MiniMax의 설명입니다.
즉, H3-VAE는 단순히 영상 데이터를 압축하는 요소가 아니라 높은 해상도의 영상을 경제적으로 처리하기 위한 핵심 기술로 볼 수 있습니다.
3. H3-Omni Transformer
세 번째는 H3-Omni Transformer입니다.
MiniMax는 H3에서 기존 Hailuo-02의 아키텍처를 그대로 사용하지 않고 새로운 구조를 선택했다고 설명합니다.
텍스트, 이미지, 영상, 오디오를 함께 처리하면서 시퀀스 길이의 변동성이 크게 증가하기 때문에, 모델의 이해 과정과 생성 과정을 분리해 각각의 작업과 하드웨어 활용을 최적화했습니다.
MiniMax가 공개한 결과에 따르면 이를 통해 엔드투엔드 학습 처리량이 최대 약 30% 향상됐습니다.
4. In-Context Regeneration
네 번째는 In-Context Regeneration입니다.
일반적인 영상 생성 과정에서는 낮은 해상도로 결과를 만든 다음 별도의 슈퍼 해상도 모듈을 사용해 해상도를 높이는 방법을 사용할 수 있습니다.
H3는 별도의 업스케일링 모듈을 추가하는 대신, 생성한 저해상도 결과를 원래의 멀티모달 컨텍스트와 함께 다시 읽고 모델 자체에서 재생성하는 방식을 사용합니다.
MiniMax는 이를 통해 작은 텍스트나 세밀한 요소를 단순히 추측하는 업스케일러보다 더 잘 보존할 수 있다고 설명합니다.
특히 브랜드 로고나 제품에 포함된 작은 텍스트처럼 정확한 디테일이 중요한 콘텐츠에서 의미가 있는 접근입니다.
광고부터 게임 시네마틱까지 활용 분야 확대
MiniMax는 H3의 활용 분야로 다음과 같은 영역을 제시합니다.
- 광고
- 브랜딩
- 이커머스
- 제품 디자인
- UI/UX
- 게임
- 영화 프리비주얼라이제이션
- 리테일 카탈로그 미디어
실제 적용 사례도 다양하게 구성할 수 있습니다.
예를 들어 광고에서는 하나의 제품을 기반으로 여러 광고 버전을 생성할 수 있습니다.
이커머스에서는 제품 및 상품 목록용 영상을 만들 수 있고, 웹사이트에서는 움직이는 히어로 루프를 제작할 수 있습니다.
게임 분야에서는 캐릭터의 일관성을 유지한 시네마틱을 만들거나, 기존 영상의 움직임을 다른 콘텐츠에 적용하는 영상 간 모션 전이에도 활용할 수 있습니다.
그 밖에도 애니메이션 포스터나 영화 타이틀 시퀀스 제작 등 짧은 영상 콘텐츠를 빠르게 제작해야 하는 영역에서 활용 가능성이 있습니다.
가격 경쟁력도 강조
MiniMax는 H3의 가격 경쟁력도 주요 특징으로 강조하고 있습니다.
MiniMax 자체 주장에 따르면 2K 해상도에서 초당 가격은 주요 경쟁 모델의 3분의 1 미만이며, 768p에서는 주요 720p 모델 가격의 절반 이하 수준입니다.
다만 입력된 자료에서 확인된 제3자 추적 및 출시 관련 보도에서는 2K 영상의 Pay-as-you-go 가격이 초당 약 0.13달러, 15초 영상 기준 약 1.95달러로 제시됐습니다.
여기서 중요한 점은 해당 가격이 MiniMax의 1차 가격 페이지에서 직접 확인된 가격이 아니라는 것입니다.
당시 MiniMax의 Pay-as-you-go 페이지에는 Hailuo 2.3 요금제만 표시돼 있었기 때문에, 이 가격은 보고된 수치로 참고하는 것이 적절합니다.
현재 시장에서 MiniMax H3의 위치
MiniMax H3가 모든 영상 생성 작업에서 가장 뛰어난 모델이라고 보기는 어렵습니다.
입력된 자료에서 SCMP가 Artificial Analysis를 인용해 보도한 내용에 따르면 H3는 영상 편집 분야에서는 선두에 있지만, 텍스트-투-비디오에서는 Google의 Gemini Omni Flash에 뒤처지고 이미지-투-비디오에서는 Seedance 2.0과 Gemini Omni Flash보다 뒤에 있는 것으로 평가됐습니다.
따라서 H3의 경쟁력을 단순히 "가장 좋은 영상 생성 모델"이라는 하나의 기준으로 판단하기보다는 멀티모달 입력을 활용한 영상 편집 및 복합적인 영상 생성 작업에 강점을 가진 모델로 바라보는 것이 적절합니다.
MiniMax H3가 주목받는 이유
MiniMax H3에서 가장 중요한 변화는 단순히 2K 영상을 생성한다는 사실에 있지 않습니다.
더 중요한 부분은 영상 생성 과정 자체를 멀티모달 컨텍스트 중심으로 통합했다는 점입니다.
텍스트를 입력하고 영상을 생성하는 작업뿐 아니라 이미지, 영상, 오디오를 함께 참고하면서 각 요소가 생성 결과에 어떤 역할을 해야 하는지 자연어로 표현할 수 있습니다.
여기에 H3-VAE의 시퀀스 효율 개선과 In-Context Regeneration을 결합해 고해상도 영상과 세부 요소를 처리하는 구조를 갖췄습니다.
결국 H3가 지향하는 방향은 영상 생성 도구를 여러 개 조합하는 방식에서 벗어나 하나의 모델 안에서 이해와 생성, 레퍼런스 활용과 편집을 함께 처리하는 것이라고 볼 수 있습니다.
MiniMax H3는 텍스트·이미지·영상·오디오를 하나의 컨텍스트로 처리하는 범용 멀티모달 생성 모델입니다.
최대 2K 해상도와 4~15초 영상, 네이티브 스테레오 오디오를 지원하며 Text-to-Video, First/Last-Frame Image-to-Video, Reference Generation 등 다양한 방식으로 활용할 수 있습니다.
기술적으로는 Contextual Omni Representation, H3-VAE, H3-Omni Transformer, In-Context Regeneration이 핵심 요소입니다. 특히 H3-VAE의 유효 시퀀스 길이 4배 향상과 In-Context Regeneration은 2K 영상과 제품·브랜드의 세부 요소를 처리하는 데 중요한 역할을 합니다.
현재는 API를 통해 사용할 수 있으며 자체 하드웨어 배포는 지원되지 않습니다. 오픈 웨이트 역시 공개 예정 단계입니다.
시장 평가에서는 영상 편집 분야에서 강점을 보이는 반면 텍스트-투-비디오와 이미지-투-비디오에서는 일부 경쟁 모델이 앞서는 것으로 나타났습니다.
따라서 MiniMax H3의 핵심 가치는 단순히 "더 높은 해상도의 영상을 생성하는 모델"이 아니라 다양한 멀티모달 자료를 하나의 컨텍스트로 이해하고 이를 영상 생성과 편집에 연결하는 통합형 접근 방식에 있다고 볼 수 있습니다.
특히 광고, 이커머스, 브랜딩, 게임, 제품 콘텐츠처럼 여러 레퍼런스를 조합하면서 짧은 영상을 반복적으로 제작해야 하는 환경에서 이러한 구조가 어떤 변화를 만들어낼지 주목할 필요가 있습니다.
MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio
MiniMax H3 generates 15-second 2K video with native stereo audio from unified text, image, video, and audio context
www.marktechpost.com

'인공지능' 카테고리의 다른 글
| ByteDance Seedance 2.5, 최대 3분 장편 영상 제작으로 확장된 AI 영상 생성 기술 (0) | 2026.08.03 |
|---|---|
| Grok Imagine, 텍스트만으로 영상 생성 지원…1080p·캐릭터 일관성까지 강화 (0) | 2026.08.03 |
| DeepSeek-V4-Flash-0731, 에이전트와 코딩 성능을 크게 높인 공식 업데이트 (0) | 2026.08.03 |
| AI 에이전트 구축 가이드: 설계 원칙부터 멀티 에이전트, 가드레일까지 한 번에 이해하기 (0) | 2026.07.31 |
| jcode란 무엇인가? 초고속 성능과 AI 멀티 에이전트 협업을 지원하는 차세대 AI 코딩 도구 (0) | 2026.07.31 |