
Meta가 공개한 차세대 AI 미디어 생성 모델, Muse Image와 Muse Video
Meta가 Meta Superintelligence Labs를 통해 새로운 AI 미디어 생성 모델인 Muse Image와 Muse Video를 공개했습니다.
이번 발표는 단순히 이미지를 생성하는 AI 모델을 소개하는 데 그치지 않습니다. 기존 생성형 AI가 사용자의 프롬프트를 그대로 이미지로 변환하는 방식이었다면, Muse Image는 스스로 필요한 정보를 찾고, 코드를 실행하며, 결과를 검토하고 수정하는 에이전트(Agent) 기반 이미지 생성 모델이라는 점이 가장 큰 특징입니다.
또한 동일한 사전학습 기반을 활용한 영상 생성 모델인 Muse Video도 함께 공개되며, 이미지와 영상을 아우르는 AI 콘텐츠 생성 기술의 발전 방향을 제시했습니다.
이번 글에서는 Meta가 발표한 Muse Image와 Muse Video의 주요 기술과 특징을 살펴보겠습니다.
Muse Image란?
Muse Image는 Meta Superintelligence Labs가 개발한 최신 이미지 생성 AI 모델입니다.
기존 이미지 생성 모델은 사용자가 입력한 프롬프트를 기반으로 바로 이미지를 생성하는 구조였습니다. 반면 Muse Image는 이미지를 만들기 전에 필요한 작업을 스스로 수행하는 에이전트 방식으로 동작합니다.
예를 들어 정확한 QR 코드를 생성해야 한다면 먼저 QR 코드를 생성하는 코드를 작성하고 실행한 뒤, 결과를 검증하고 최종 이미지에 반영합니다. 최신 유행 패션 이미지를 생성해야 하는 경우에는 웹 검색을 통해 최신 정보를 확인한 후 이를 이미지 생성 과정에 활용합니다.
즉, 이미지를 단순히 생성하는 것이 아니라 정확도를 높이기 위해 필요한 작업을 직접 수행하는 것이 Muse Image의 핵심입니다.
에이전트 기반 이미지 생성
Muse Image의 가장 큰 차별점은 생성 과정에서 다양한 도구를 활용하는 것입니다.
이미지를 생성하기 전에 필요한 정보를 분석하고, 검색하거나 코드를 실행한 뒤 결과를 반영해 최종 이미지를 완성합니다.
이 과정에서 Muse Spark와 연동되어 공동으로 계획을 세우고 도구를 활용하는 것도 지원합니다.
기존 생성형 AI가 하나의 프롬프트에 대해 한 번의 추론으로 결과를 만드는 방식이었다면, Muse Image는 여러 단계를 거쳐 더 높은 품질의 결과를 만들어내도록 설계되었습니다.
Tool Use 기능으로 정확도 향상
코드 실행(Code)
Muse Image는 필요에 따라 직접 코드를 작성하고 실행할 수 있습니다.
이를 통해 다음과 같은 작업을 수행할 수 있습니다.
- 정확한 QR 코드 생성
- 그래프 및 차트 생성
- 수학적 도형 및 프랙탈 생성
- 코드 실행 결과를 이미지 생성에 활용
예를 들어 QR 코드가 포함된 포스터를 생성할 경우 먼저 QR 코드를 생성하고 정상적으로 인식되는지 확인한 뒤 최종 이미지에 삽입합니다.
또한 Muse Spark와 함께 코드와 이미지 생성을 결합하여 GIF, 웹사이트, 인터랙티브 콘텐츠 제작도 지원합니다.
웹 검색(Search)
이미지 생성에서 가장 어려운 부분 중 하나는 최신 정보를 반영하는 것입니다.
Muse Image는 필요한 경우 웹 검색을 수행하여 실시간 정보와 시각적 참고 자료를 활용합니다.
이를 통해 다음과 같은 작업의 정확도를 높일 수 있습니다.
- 최신 패션 트렌드
- 시사 및 현재 이벤트
- 과학적 사실
- 실제 제품 정보
- 최신 참고 이미지
Meta는 검색 기능을 활용할 경우 사실 기반 이미지 생성의 정확도가 향상된다고 설명했습니다.
Self-Refinement, 스스로 결과를 개선하는 AI
Muse Image는 이미지를 한 번 생성한 뒤 끝나는 것이 아닙니다.
생성된 결과를 다시 검토하고 문제가 발견되면 스스로 수정하는 Self-Refinement 기능을 수행합니다.
예를 들어
- 수식이 잘못 작성된 경우
- 텍스트가 틀린 경우
- 레이아웃이 부자연스러운 경우
- 일부 객체가 잘못 생성된 경우
필요에 따라 일부만 수정하거나 처음부터 다시 생성하는 방식으로 결과를 개선합니다.
Meta는 이러한 기능이 별도로 설계된 것이 아니라 강화학습(RL) 과정에서 자연스럽게 학습된 결과라고 설명했습니다.
Test-Time Compute Scaling
Muse Image는 추론 과정에서 더 많은 계산 자원을 사용할수록 결과 품질이 향상되는 구조를 제공합니다.
단순히 여러 장의 이미지를 생성한 뒤 가장 좋은 결과를 선택하는 방식(Best-of-N)보다,
- 더 많은 추론
- 더 많은 Tool Use
- 더 많은 Self-Refinement
과정을 수행하는 것이 더 높은 품질을 제공한다고 소개했습니다.
즉, 계산 자원을 이미지 생성 횟수에 사용하는 것이 아니라 사고 과정과 검증 과정에 사용하는 것이 더 효과적이라는 의미입니다.
정교한 이미지 편집 기능
Muse Image는 기존 이미지를 매우 정밀하게 편집할 수 있습니다.
예를 들어
- 안개 제거
- 특정 사물만 변경
- 문구 수정
- 전화번호 변경
- 배경 확장
- 여러 차례 편집을 통한 결과 개선
등과 같이 사용자가 요청한 부분만 선택적으로 수정할 수 있습니다.
또한 여러 번의 편집 요청에서도 이전 작업의 일관성을 유지하며 원하는 결과에 점진적으로 접근할 수 있도록 지원합니다.
여러 참조 이미지를 동시에 활용하는 Multi-Reference Image Composition
Muse Image는 하나의 이미지뿐 아니라 여러 장의 참조 이미지를 함께 활용할 수 있습니다.
예를 들어
- 사람 사진
- 의상 이미지
- 배경 이미지
- 사물 이미지
- 화풍 이미지
를 동시에 입력하면 각각의 특징을 조합하여 하나의 새로운 이미지를 생성합니다.
텍스트와 이미지를 혼합하여 프롬프트를 구성하는 것도 지원해 복잡한 이미지 구성 작업에도 활용할 수 있습니다.
이미지 생성 성능
Meta에 따르면 Muse Image는 발표 시점 기준으로 Arena 인간 선호도 평가(Elo Ranking)에서
- Text-to-Image
- Single Image Editing
- Multi Image Editing
부문 모두 상위권 성능을 기록했습니다.
이는 단순한 생성 능력뿐 아니라 편집과 다중 참조 이미지 처리에서도 높은 평가를 받았음을 의미합니다.
Muse Video, 차세대 AI 영상 생성 모델
Meta는 Muse Image와 함께 Muse Video도 공개했습니다.
Muse Video는 동일한 사전학습 기반을 활용하는 영상 생성 모델로 다음과 같은 특징을 제공합니다.
- 높은 프롬프트 이해도
- 뛰어난 영상 품질
- 자연스러운 시간적 일관성
- Native Audio 지원
공개된 예시에서는 동물 영상, 광고, 브이로그 스타일 영상, 자연 풍경 등 다양한 유형의 영상을 생성하는 모습을 확인할 수 있었습니다.
Meta는 현재 오디오와 영상의 동기화, 빠른 움직임의 물리적 표현 등에 대해서도 지속적으로 성능을 개선하고 있다고 밝혔습니다.
Content Seal로 AI 생성 콘텐츠 검증
AI 이미지 활용이 증가하면서 생성 여부를 확인하는 기술도 중요해지고 있습니다.
Muse Image에는 Content Seal이라는 보이지 않는 워터마크 기술이 적용됩니다.
Meta AI 앱과 meta.ai에서 생성된 이미지는 이미지가
- 잘리거나
- 압축되거나
- 크기가 변경되거나
- 스크린샷으로 저장되더라도
생성 정보를 유지하도록 설계되었습니다.
Meta는 향후 영상에도 동일한 기술을 적용할 계획이며, 이미지에 Content Seal이 포함되어 있는지 확인할 수 있는 검출 도구도 함께 공개했습니다.
Meta 서비스와의 연계
Muse Image는 Meta 생태계와 긴밀하게 연동됩니다.
현재는 다음 서비스에서 사용할 수 있습니다.
- Meta AI 앱
- meta.ai
- 미국 Instagram Stories
- 일부 국가의 WhatsApp
향후 Facebook에도 적용될 예정입니다.
또한 Instagram 사진을 활용한 이미지 생성, 친구와 함께 콘텐츠를 제작하는 기능 등 Meta 서비스와의 연계를 지속적으로 확대할 계획입니다.
이번에 공개된 Muse Image와 Muse Video는 단순히 이미지나 영상을 생성하는 AI를 넘어, 스스로 검색하고 코드를 실행하며 결과를 검증하는 에이전트 기반 생성 AI라는 새로운 방향을 제시했습니다.
특히 Tool Use, Self-Refinement, Test-Time Compute Scaling과 같은 기술은 생성 결과의 정확성과 완성도를 높이는 핵심 요소로 소개됐으며, 이미지 편집과 다중 참조 이미지 합성 기능까지 지원하면서 활용 범위도 더욱 넓어졌습니다.
앞으로 Muse Video의 정식 출시와 함께 Meta의 생성형 AI 기술이 이미지와 영상 제작 환경에 어떤 변화를 가져올지 주목할 필요가 있습니다.
https://ai.meta.com/blog/introducing-muse-image-muse-video-msl/
Introducing Muse Image and Muse Video
Like language models, Muse Image improves the more it thinks at inference time. With more test-time compute, the model reasons more, uses more tool calls, and uses more self-refinement steps to improve its generations. Increasing reasoning strength (and th
ai.meta.com

'인공지능' 카테고리의 다른 글
| Grok 4.5 출시, 코딩부터 지식 업무까지 강화된 SpaceXAI의 최신 AI 모델 (0) | 2026.07.09 |
|---|---|
| 언어 모델도 '속으로 생각'할까? Anthropic J-space 연구로 살펴보는 AI의 내부 사고 구조 (0) | 2026.07.08 |
| RAG 컨텍스트를 68% 줄이면서도 96%의 Recall을 유지한 방법: LLM 기반 Context Pruning (0) | 2026.07.08 |
| Meta가 공개한 오픈소스 디자인 시스템 'Astryx'란? 특징부터 아키텍처까지 한눈에 정리 (0) | 2026.07.08 |
| 로컬 환경에서 동작하는 의료 AI 플랫폼 OpenMed 기술 정리 (0) | 2026.07.07 |