본문 바로가기

인공지능

MiniMax H3, 33B 영상 생성 모델 가중치 공개…텍스트·이미지·영상·오디오를 하나로 활용

728x90
반응형
728x170

AI 영상 생성 기술이 텍스트를 영상으로 바꾸는 수준을 넘어 이미지, 영상, 오디오 등 다양한 입력 데이터를 함께 활용하는 방향으로 발전하고 있습니다.

중국 AI 기업 MiniMax는 이러한 흐름에 맞춰 최신 영상 생성 모델인 H3의 일부 가중치를 오픈소스로 공개했습니다. H3는 330억(33B) 파라미터 규모의 영상 생성 모델로, 텍스트뿐 아니라 이미지·영상·오디오를 입력으로 활용할 수 있다는 점이 특징입니다.

최대 15초 길이의 영상을 24FPS로 생성할 수 있으며 스테레오 오디오와 다양한 화면 비율, 11개 언어의 음성 생성도 지원합니다. 특히 이번 공개에서는 단순히 하나의 모델만 제공하는 것이 아니라, 일반적인 Text-to-Video부터 여러 이미지·영상·오디오 레퍼런스를 활용하는 방식까지 지원하는 두 가지 H3-Base 모델이 공개됐습니다.

다만 H3 전체가 공개된 것은 아닙니다. H3가 어떤 구조로 구성돼 있고 실제로 어떤 부분이 오픈소스로 제공됐는지 살펴보면 이번 공개의 의미를 보다 명확하게 이해할 수 있습니다.

반응형

MiniMax H3는 어떤 영상 생성 모델인가

MiniMax H3는 텍스트, 이미지, 영상, 오디오를 입력으로 받아 짧은 영상과 음성을 함께 생성할 수 있는 33B 규모의 영상 생성 모델입니다.

기존 Text-to-Video 방식에서는 사용자가 텍스트 프롬프트를 입력하고 그 내용을 기반으로 영상을 생성하는 방식이 중심이었다면, H3는 여러 종류의 데이터를 함께 활용할 수 있도록 구성됐습니다.

주요 특징을 정리하면 다음과 같습니다.

  • 330억(33B) 파라미터 규모
  • 최대 15초 영상 생성
  • 24FPS 지원
  • 스테레오 오디오 지원
  • 21:9부터 9:16까지 다양한 화면 비율 지원
  • 11개 언어 음성 생성 지원
  • 텍스트·이미지·영상·오디오를 활용한 영상 생성 지원

특히 입력 데이터의 종류가 다양하다는 점이 H3의 중요한 특징입니다. 단순히 텍스트를 입력하는 것뿐 아니라 이미지나 영상 등의 레퍼런스를 활용해 원하는 결과에 보다 가까운 영상을 생성할 수 있도록 구성됐습니다.

H3는 3단계 구조로 구성된다

H3는 크게 H3-Context-IR, H3-Base, H3-Regenerate-2K의 세 단계로 구성됩니다.

각 단계는 서로 다른 역할을 담당합니다.

1. H3-Context-IR, 다양한 입력 데이터를 분석

H3-Context-IR은 사용자가 입력한 데이터를 분석하고 내부 표현으로 변환하는 역할을 담당합니다.

텍스트뿐 아니라 이미지, 영상, 오디오 등 서로 다른 형태의 입력 데이터를 AI가 이해하기 쉬운 형태로 정리하는 단계라고 볼 수 있습니다.

즉, 실제 영상을 생성하기 전에 다양한 입력 데이터를 해석하고 영상 생성 모델이 활용할 수 있도록 준비하는 과정입니다.

2. H3-Base, 실제 영상을 생성하는 핵심 모델

H3-Base는 H3의 핵심적인 영상 생성 모델입니다.

입력된 정보를 바탕으로 실제 영상을 생성하며 768p 해상도의 영상 생성을 담당합니다.

이번 MiniMax의 오픈소스 공개에서 가중치가 공개된 부분도 바로 H3-Base입니다.

따라서 이번 공개를 H3 전체의 가중치가 공개된 것으로 이해해서는 안 됩니다.

3. H3-Regenerate-2K, 최종 영상 품질 향상

H3-Regenerate-2K는 생성된 영상을 2K 품질로 업스케일하는 후처리 단계입니다.

H3-Base에서 생성한 결과물을 그대로 사용하는 것이 아니라, 이후 업스케일링 과정을 거쳐 최종 영상의 품질을 향상시키는 역할을 합니다.

결국 H3의 전체적인 흐름은 다음과 같이 이해할 수 있습니다.

입력 데이터 분석 → 영상 생성 → 영상 품질 향상

여기서 중요한 부분은 이번 공개 범위입니다. H3-Base는 공개됐지만 H3-Context-IR과 H3-Regenerate-2K는 공개되지 않았습니다.

즉, H3의 모든 구성 요소가 오픈소스로 공개된 것은 아닙니다.

공개된 H3-Base는 두 가지 버전으로 제공

MiniMax는 이번 공개에서 H3-Base를 하나의 모델이 아니라 두 가지 버전으로 제공합니다.

바로 H3-Base-FL2VAH3-Base-Ref2VA입니다.

두 모델은 입력할 수 있는 데이터와 활용 방식에서 차이가 있습니다.

H3-Base-FL2VA, 기본적인 Text-to-Video와 이미지 기반 생성

H3-Base-FL2VA는 비교적 일반적인 영상 생성 방식에 초점을 맞춘 모델입니다.

텍스트만 입력하면 Text-to-Video 방식으로 영상을 생성할 수 있습니다.

또한 한 장 또는 두 장의 이미지를 입력해 해당 장면을 기준으로 영상을 생성하거나 두 장면을 연결하는 방식으로 활용할 수 있습니다.

예를 들어 특정 이미지를 기준으로 영상의 장면을 만들어야 한다면 이미지와 원하는 내용을 입력해 이미지 기반 영상 생성을 활용할 수 있습니다.

따라서 H3-Base-FL2VA는 기본적인 Text-to-Video와 Image-to-Video 활용을 위한 모델로 이해할 수 있습니다.

H3-Base-Ref2VA, 여러 레퍼런스를 활용한 영상 생성

H3-Base-Ref2VA는 보다 많은 레퍼런스를 활용할 수 있도록 구성됐습니다.

최대 다음과 같은 입력을 동시에 활용할 수 있습니다.

  • 이미지 최대 9장
  • 영상 최대 3개
  • 오디오 최대 3개

여러 개의 레퍼런스를 함께 활용할 수 있기 때문에 하나의 텍스트 프롬프트만 사용하는 것보다 원하는 영상의 조건을 보다 구체적으로 전달할 수 있습니다.

예를 들어 여러 이미지와 영상, 오디오를 레퍼런스로 제공하고 이를 기반으로 새로운 영상을 생성하는 방식으로 활용할 수 있습니다.

다만 한 가지 제한이 있습니다. 오디오만 단독으로 입력하는 방식은 지원하지 않습니다.

즉, 오디오를 활용할 수는 있지만 오디오만 입력해 영상을 생성하는 구조는 아닙니다.

두 모델의 차이는 무엇인가

H3-Base-FL2VA와 H3-Base-Ref2VA의 차이는 레퍼런스를 얼마나 다양하게 활용할 수 있는가에 있습니다.

구분 H3-Base-FL2VA H3-Base-Ref2VA
텍스트 입력 지원 지원
이미지 입력 1~2장 최대 9장
영상 입력 - 최대 3개
오디오 입력 - 최대 3개
주요 특징 Text-to-Video 및 기본 이미지 기반 생성 여러 레퍼런스를 활용한 정교한 영상 생성
오디오 단독 입력 - 지원하지 않음

따라서 단순한 텍스트 기반 영상 생성이나 한두 장의 이미지를 활용하는 경우에는 H3-Base-FL2VA가 적합한 형태이고, 여러 이미지·영상·오디오를 함께 활용해야 한다면 H3-Base-Ref2VA가 보다 적합한 구조입니다.

최대 15초, 24FPS 영상과 다양한 화면 비율 지원

H3는 최대 15초 길이의 영상을 24FPS로 생성할 수 있습니다.

영상 생성뿐 아니라 스테레오 오디오도 지원하기 때문에 영상과 음성을 함께 생성할 수 있다는 점도 특징입니다.

화면 비율 역시 한 가지 형태에 제한되지 않습니다.

21:9 와이드 화면부터 9:16 세로형 화면까지 다양한 화면 비율을 지원합니다.

따라서 영상의 목적이나 화면 구성에 따라 서로 다른 비율을 선택할 수 있습니다.

여기에 11개 언어의 음성 생성도 지원합니다.

결과적으로 H3는 단순히 움직이는 영상을 만드는 모델이 아니라 영상과 음성을 함께 생성하고, 여러 입력 데이터를 활용할 수 있는 모델이라는 점에서 특징을 갖습니다.

영상 편집부터 Text-to-Video까지 높은 평가

H3는 성능 측면에서도 높은 평가를 받고 있습니다.

입력된 정보에 따르면 Artificial Analysis 평가 기준으로 다음과 같은 순위를 기록했습니다.

  • Video Editing 분야 1위
  • Text-to-Video 분야 2위
  • Image-to-Video 분야 3위

특히 영상 편집 분야에서 1위를 기록했다는 점이 눈에 띕니다.

Text-to-Video와 Image-to-Video에서도 각각 2위와 3위를 기록하며 다양한 영상 생성 영역에서 높은 성능을 보여주고 있습니다.

다만 이러한 평가는 특정 평가 기준에 따른 결과이므로, 실제 활용 환경에서는 생성하려는 영상의 유형이나 입력 데이터에 따라 결과가 달라질 수 있다는 점을 함께 고려할 필요가 있습니다.

ComfyUI·Diffusers 등 주요 오픈소스 생태계 지원

H3의 또 다른 특징은 기존 오픈소스 AI 생태계와 연계할 수 있다는 점입니다.

현재 입력된 정보에 따르면 H3는 다음과 같은 주요 생태계를 지원합니다.

  • ComfyUI
  • Diffusers
  • vLLM
  • SGLang

또한 사용 가이드와 워크플로우도 함께 공개됐습니다.

이는 단순히 모델 가중치만 공개하는 것과는 차이가 있습니다.

개발자가 모델을 활용하려면 모델 자체뿐 아니라 실제 실행 환경과 연결하는 방법도 필요합니다. H3는 주요 오픈소스 생태계와 사용 가이드, 워크플로우를 함께 제공함으로써 개발자가 기존 환경에서 모델을 활용할 수 있는 기반을 제공하고 있습니다.

예를 들어 H3-Base-FL2VA를 활용한다면 텍스트를 기반으로 영상을 생성하거나 이미지와 함께 입력해 해당 장면을 기반으로 영상을 생성하는 방식으로 접근할 수 있습니다.

H3-Base-Ref2VA에서는 여기에 여러 이미지, 영상, 오디오 레퍼런스를 추가해 보다 복합적인 입력을 구성할 수 있습니다.

오픈소스 공개지만 라이선스 조건은 확인해야 한다

H3는 비교적 개방적인 라이선스를 제공하는 것으로 소개되고 있습니다.

특히 사용자가 보유한 데이터를 이용해 모델을 추가 학습하는 Fine-tuning이 가능하며, 캐릭터나 브랜드, 특정 스타일을 학습하는 용도로도 활용할 수 있습니다.

이 부분은 실제 활용 측면에서 중요한 특징입니다.

기본 모델을 그대로 사용하는 것과 달리 자신이 원하는 캐릭터나 브랜드, 스타일을 학습시킬 수 있다면 특정 목적에 맞춰 모델을 조정할 수 있기 때문입니다.

다만 상업적 사용에는 제한 조건이 있습니다.

입력된 정보에 따르면 연 매출 2천만 달러, 약 280억 원 이상인 기업은 상업적 사용이 제한됩니다.

따라서 H3를 기업 환경에서 활용하려는 경우 단순히 가중치가 공개됐다는 이유만으로 자유롭게 상업적 사용할 수 있다고 판단해서는 안 됩니다.

특히 기업에서 실제 서비스나 제품에 적용하려는 경우에는 해당 라이선스 조건을 확인해야 합니다.

이번 H3 공개에서 주목할 부분

이번 공개의 핵심은 H3 전체가 오픈소스로 제공됐다는 데 있지 않습니다.

오히려 H3의 핵심 영상 생성 모델인 H3-Base가 공개됐다는 점에 의미가 있습니다.

H3는 입력 데이터를 분석하는 H3-Context-IR, 실제 영상을 생성하는 H3-Base, 최종 결과물을 2K로 업스케일하는 H3-Regenerate-2K로 구성됩니다.

이 가운데 공개된 것은 H3-Base입니다.

따라서 이번 공개를 이해할 때는 다음과 같이 구분하는 것이 중요합니다.

공개

  • H3-Base
  • H3-Base-FL2VA
  • H3-Base-Ref2VA
  • 사용 가이드
  • 워크플로우

비공개

  • H3-Context-IR
  • H3-Regenerate-2K

이 차이를 이해하면 이번 공개가 어느 범위까지 이루어진 것인지 보다 명확하게 파악할 수 있습니다.

MiniMax H3가 보여주는 영상 생성 AI의 방향

MiniMax H3에서 눈여겨볼 부분은 영상 생성에 필요한 입력의 범위가 넓어졌다는 점입니다.

텍스트 하나를 입력해 영상을 만드는 방식에서 더 나아가 이미지, 영상, 오디오를 함께 활용할 수 있습니다.

특히 H3-Base-Ref2VA는 최대 9장의 이미지와 3개의 영상, 3개의 오디오를 동시에 활용할 수 있습니다.

이는 영상 생성 과정에서 여러 레퍼런스를 함께 활용할 수 있다는 의미입니다.

또한 영상 생성 모델의 활용 방식도 단순히 모델을 실행하는 수준에 머물지 않습니다. ComfyUI, Diffusers, vLLM, SGLang 등 주요 오픈소스 생태계와의 연계가 가능하고 사용 가이드와 워크플로우까지 제공되면서 실제 개발 환경에서 활용할 수 있는 기반도 함께 마련됐습니다.

728x90

MiniMax H3는 330억 파라미터 규모의 영상 생성 모델로, 텍스트뿐 아니라 이미지·영상·오디오를 활용해 최대 15초 길이의 영상을 생성할 수 있다는 점이 핵심 특징입니다.

24FPS와 스테레오 오디오를 지원하며 21:9부터 9:16까지 다양한 화면 비율과 11개 언어의 음성 생성도 지원합니다.

모델은 H3-Context-IR, H3-Base, H3-Regenerate-2K의 세 단계로 구성되지만 이번 공개에서 가중치가 공개된 것은 H3-Base입니다.

공개된 H3-Base는 다시 두 가지로 나뉩니다. H3-Base-FL2VA는 Text-to-Video와 한두 장의 이미지를 활용한 영상 생성에 초점을 맞추고, H3-Base-Ref2VA는 최대 9장의 이미지와 3개의 영상, 3개의 오디오를 활용해 보다 복합적인 영상 생성을 지원합니다.

성능 측면에서는 Artificial Analysis 평가 기준 Video Editing 1위, Text-to-Video 2위, Image-to-Video 3위를 기록했습니다.

여기에 ComfyUI, Diffusers, vLLM, SGLang 등 주요 오픈소스 생태계를 지원하고 사용 가이드와 워크플로우도 함께 제공한다는 점에서 개발자가 접근할 수 있는 기반을 갖추고 있습니다.

다만 오픈소스 공개와 상업적 활용은 별개의 문제입니다. Fine-tuning과 캐릭터·브랜드·스타일 학습을 지원하지만 연 매출 2천만 달러 이상 기업의 상업적 사용에는 제한이 있으므로 실제 활용 전 라이선스 조건을 확인해야 합니다.

결국 MiniMax H3는 텍스트 중심의 영상 생성에서 이미지·영상·오디오를 함께 활용하는 멀티모달 영상 생성으로 기술의 범위가 확장되고 있다는 흐름을 보여주는 모델이라고 볼 수 있습니다.

특히 여러 레퍼런스를 활용하는 H3-Base-Ref2VA와 오픈소스 생태계 지원은 영상 생성 모델을 단순한 콘텐츠 생성 도구가 아니라 개발 환경에 연결해 활용할 수 있는 기술로 확장하는 데 의미가 있습니다.

300x250

https://huggingface.co/MiniMaxAI/MiniMax-H3?fbclid=IwY2xjawTffFdleHRuA2FlbQIxMABicmlkETE4MG1BNTJpZEFRZFpVUWtlc3J0YwZhcHBfaWQQMjIyMDM5MTc4ODIwMDg5MgABHvQIW1DP-GTDZW_vy5ZyJ0brG8vosbjCE4Ruurli6xZuGxGJT_BqVXTIkDga_aem_dTEth35kZn6FSzYhHiL43g

 

MiniMaxAI/MiniMax-H3 · Hugging Face

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

huggingface.co

728x90
반응형
그리드형