
이미지, 영상, 오디오를 하나의 AI 모델로 통합한 FLUX 3
Black Forest Labs(BFL)가 새로운 멀티모달 파운데이션 모델 FLUX 3를 공개했습니다. 이번 모델은 이미지, 영상(Video), 오디오(Audio)를 하나의 아키텍처에서 동시에 학습하도록 설계됐으며, 하나의 모델 가중치만으로 영상 생성은 물론 오디오 생성과 로봇의 행동(Action) 예측까지 지원하는 것이 가장 큰 특징입니다.
기존에는 이미지, 영상, 오디오를 각각 별도의 모델로 학습하거나 여러 모델을 조합하는 방식이 일반적이었습니다. 반면 FLUX 3는 다양한 데이터를 하나의 모델에서 함께 학습함으로써 현실 세계를 보다 자연스럽게 이해하고 생성할 수 있도록 설계됐습니다.
이번 글에서는 FLUX 3가 어떤 개념으로 개발됐는지, 핵심 기술인 Self-Flow는 무엇인지, 그리고 지원하는 기능과 성능을 살펴보겠습니다.
FLUX 3란 무엇인가
FLUX 3는 Black Forest Labs가 공개한 멀티모달 파운데이션 모델입니다.
이 모델은 다음과 같은 데이터를 하나의 모델에서 함께 학습합니다.
- 이미지(Image)
- 영상(Video)
- 오디오(Audio)
또한 FLUX 시리즈 최초로 하나의 모델 가중치에서 다음 기능을 함께 제공합니다.
- 영상 생성
- 오디오 생성
- 행동(Action) 예측
즉, 하나의 모델이 여러 형태의 데이터를 동시에 이해하고 생성할 수 있도록 설계됐다는 점이 가장 큰 특징입니다.
왜 멀티모달 학습이 중요한가
BFL 연구팀은 현실 세계를 하나의 데이터만으로는 완전히 설명할 수 없다고 설명합니다.
각 데이터는 현실의 일부만 표현합니다.
- 이미지는 특정 순간의 공간 정보를 담습니다.
- 영상은 시간의 흐름과 물리적인 움직임을 보여줍니다.
- 오디오는 소리와 실제 사건 사이의 인과관계를 전달합니다.
연구팀은 이러한 각각의 데이터가 모두 현실을 부분적으로 표현하는 정보라고 설명합니다.
따라서 이미지, 영상, 오디오를 동시에 학습하면 서로가 서로를 보완하게 됩니다.
예를 들어,
- 충돌이 발생하면 그에 맞는 소리가 함께 생성되어야 하고,
- 물체의 움직임은 질량과 물리적인 특성을 반영해야 합니다.
FLUX 3는 이러한 원칙을 기반으로 설계된 첫 번째 FLUX 모델입니다.
FLUX 3의 핵심 기술, Self-Flow
FLUX 3는 BFL이 개발한 Self-Flow 기술을 기반으로 만들어졌습니다.
Self-Flow는 하나의 아키텍처에서 멀티모달 생성과 이해를 동시에 수행하기 위한 학습 방식입니다.
Self-Flow는 다음 두 가지 학습 방식을 결합합니다.
- Flow Matching Objective
- Self-Supervised Feature Reconstruction Objective
공개된 Self-Flow 구현은 다음과 같은 특징을 갖습니다.
- SiT-XL/2 기반 구현
- 토큰별(Time Step) 조건 적용
- 25% Per-token Mask Ratio 사용
- EMA Teacher와 Student 구조를 활용한 Self-Distillation 적용
다만 GitHub에 공개된 모델은 ImageNet 256×256 연구용 체크포인트이며 FLUX 3 자체는 아닙니다.
BFL은 동일한 접근 방식을 유지하면서 연산 자원과 학습 데이터를 크게 확장해 이미지, 영상, 오디오를 동시에 학습하는 FLUX 3를 개발했다고 설명했습니다.
즉, Self-Flow 자체는 새로운 기술이 아니라 이를 대규모 멀티모달 환경으로 확장한 것이 이번 공개의 핵심입니다.
FLUX 3 Video가 제공하는 기능
FLUX 3 Video는 최대 20초 길이의 영상을 한 번의 생성 과정으로 만들 수 있으며, 영상과 함께 기본적으로 오디오도 생성합니다.
지원하는 생성 방식은 다음과 같습니다.
- Text-to-Video
- Image-to-Video
- Reference Video 기반 Video-to-Video
- Keyframe-to-Video
- 입력 영상과 오디오를 기반으로 하는 Video-Audio Continuation
이 외에도 다음과 같은 기능을 제공합니다.
- 다국어 대화 생성
- 여러 영상을 연결하는 Agentic Chaining
- 애니메이션 타이포그래피 생성
BFL은 특히 다음 영역에서 강점을 보인다고 설명합니다.
- 사람의 표정 표현
- 물리적인 사건과 소리의 자연스러운 연결
FLUX 3 성능
BFL은 사람의 선호도(Human Preference) 기반 비교 결과도 함께 공개했습니다.
평가는 다음 조건에서 진행됐습니다.
- 10초 길이
- 720p 해상도
- 오디오 포함 Text-to-Video 생성
비교 결과는 다음과 같습니다.
| 비교 모델 | FLUX 3 선호도 |
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 최대 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
BFL이 공개한 결과에서는 여러 경쟁 모델 대비 높은 선호도를 기록했으며, Seedance 2.0과 Gemini Omni Flash와의 비교에서는 52% 수준으로 나타났습니다.
FLUX 3에서 주목할 점
이번 FLUX 3 공개에서 가장 눈에 띄는 부분은 단순히 영상 생성 모델이 아니라는 점입니다.
이미지와 영상, 오디오를 하나의 모델에서 함께 학습함으로써 현실 세계를 다양한 관점에서 이해하도록 설계됐으며, 하나의 모델 가중치만으로 영상 생성, 오디오 생성, 행동 예측까지 수행할 수 있도록 확장됐습니다.
또한 기존 Self-Flow 기술을 대규모 데이터와 연산 환경으로 확장해 멀티모달 학습을 구현한 것도 이번 모델의 중요한 특징입니다.
FLUX 3는 이미지, 영상, 오디오를 하나의 아키텍처에서 동시에 학습하는 멀티모달 파운데이션 모델로, FLUX 시리즈 최초로 영상 생성과 오디오 생성, 행동 예측을 하나의 모델에서 지원합니다.
핵심 기술인 Self-Flow를 기반으로 멀티모달 생성과 이해를 통합했으며, 최대 20초 길이의 영상 생성, 다양한 입력 방식 지원, 그리고 여러 경쟁 모델과 비교한 선호도 평가 결과도 함께 공개됐습니다.
이번 발표는 단순한 영상 생성 모델의 성능 향상을 넘어, 여러 형태의 데이터를 하나의 모델에서 통합적으로 학습하는 멀티모달 AI의 발전 방향을 보여주는 사례로 볼 수 있습니다.
Black Forest Labs Releases FLUX 3: A Multimodal Flow Model for Image, Video, Audio and Robot Action Prediction
Black Forest Labs releases FLUX 3, a multimodal flow model generating 20-second video with native audio and actions
www.marktechpost.com

'인공지능' 카테고리의 다른 글
| AngelSpec v0.1.0: Speculative Decoding 초안(Draft) 모델 학습 프레임워크 완벽 정리 (0) | 2026.07.30 |
|---|---|
| SANA 완전 정리: 고해상도 이미지·비디오 생성을 위한 오픈소스 AI 프레임워크 (0) | 2026.07.30 |
| MAI-Cyber-1-Flash와 MDASH로 구현하는 AI 기반 차세대 사이버 보안 (0) | 2026.07.30 |
| Claude Opus 5 vs Claude Fable 5 비교 분석, 절반의 비용으로 어디까지 가능할까? (0) | 2026.07.30 |
| vLLM에서 Kimi K3를 효율적으로 서빙하는 방법과 주요 최적화 기술 (0) | 2026.07.30 |