
AI 영상 생성 기술이 이미지 중심에서 텍스트 중심으로 확장되고 있습니다. 스페이스XAI는 AI 영상 생성 서비스 Grok Imagine을 대폭 업그레이드하고, 시작 이미지 없이 텍스트만으로 영상을 생성할 수 있는 기능을 추가했습니다.
이번 업데이트는 최신 영상 생성 모델 Imagine Video 1.5를 기반으로 합니다. 기존 버전에서 움직임과 물리 표현, 음향 품질을 개선한 데 이어 텍스트-비디오(Text-to-Video) 생성, 이미지 및 음성 참조, 네이티브 1080p 영상 생성 등을 지원하면서 영상 제작 기능을 한층 확장했습니다.
특히 주목할 부분은 영상 제작에 필요한 시작 이미지가 없어도 된다는 점입니다. 원하는 장면을 텍스트로 설명하는 것만으로 영상을 생성할 수 있어 영상 제작 과정이 보다 간단해졌습니다.
텍스트만 입력해 영상 생성
이번 Grok Imagine 업데이트에서 가장 눈에 띄는 기능은 텍스트-비디오(Text-to-Video)입니다.
기존 이미지-비디오(Image-to-Video) 방식은 영상의 시작점으로 활용할 이미지가 필요했습니다. 반면 새롭게 추가된 텍스트-비디오 기능은 시작 이미지 없이 프롬프트만으로 영상을 생성할 수 있습니다.
예를 들어 사용자가 영상으로 만들고 싶은 장면을 텍스트 프롬프트로 입력하면 해당 내용을 기반으로 영상을 생성하는 방식입니다.
이 방식의 가장 큰 장점은 영상 제작을 시작하기 위해 별도의 이미지를 먼저 준비할 필요가 없다는 것입니다. 아이디어를 텍스트로 정리해 입력하는 것만으로 영상 생성 과정에 바로 접근할 수 있습니다.
또한 텍스트-비디오 기능은 기존 이미지-비디오 기능과 함께 제공됩니다. 따라서 이미지에서 영상을 만들어야 하는 경우와 텍스트만으로 영상을 만들어야 하는 경우를 각각 활용할 수 있습니다.
캐릭터와 음성의 일관성도 유지
AI로 여러 장면의 영상을 생성할 때 중요한 문제 가운데 하나는 장면마다 캐릭터의 모습이나 목소리가 달라지는 것입니다.
Grok Imagine은 이번 업데이트를 통해 이러한 영상 제작 과정에서의 일관성 유지 기능도 강화했습니다.
사용자는 Grok Imagine 에이전트에서 기존에 생성했던 캐릭터와 음성 참조 파일을 ‘@’ 태그로 불러올 수 있습니다. 이를 활용하면 여러 장면에서 동일한 인물과 목소리를 계속 사용할 수 있습니다.
예를 들어 하나의 캐릭터를 만든 뒤 배경이나 동작만 변경해 새로운 장면을 제작할 수 있습니다. 이때 캐릭터의 외형과 음색을 유지할 수 있어 여러 장면으로 이어지는 영상의 연속성을 확보하는 데 활용할 수 있습니다.
즉, 단순히 한 장의 영상을 생성하는 것을 넘어 여러 장면을 연결해 제작할 때 필요한 캐릭터와 음성의 일관성을 지원한다는 점이 특징입니다.
최대 7개 참조 이미지 활용 가능
이미지 참조 기능도 확대됐습니다.
참조 이미지는 얼굴, 제품, 장소 등 영상에서 특정 요소를 고정하는 용도로 사용할 수 있습니다. 이번 업데이트에서는 한 번의 생성 과정에서 최대 7개의 참조 이미지를 사용할 수 있습니다.
이를 활용하면 동일한 캐릭터를 여러 환경에 배치하거나, 같은 배경에 다른 인물을 등장시키는 방식으로 영상을 구성할 수 있습니다.
예를 들어 특정 캐릭터를 참조 이미지로 지정하고 새로운 배경을 적용하면 동일한 캐릭터를 다른 환경에 배치하는 방식의 영상 제작이 가능합니다. 반대로 특정 장소를 참조해 배경을 유지하면서 다른 인물을 등장시키는 방식도 활용할 수 있습니다.
따라서 이미지 참조 기능은 영상에 포함하고 싶은 특정 요소를 유지하면서 새로운 장면을 생성하는 데 초점을 맞추고 있습니다.
네이티브 1080p 영상 생성 지원
영상 해상도 역시 이번 업데이트의 주요 변화입니다.
Grok Imagine은 텍스트-비디오와 이미지-비디오 기능 모두에서 네이티브 1080p 영상 생성을 지원합니다.
특히 텍스트만으로 영상을 생성하는 기능과 1080p 영상 생성이 함께 제공된다는 점에 주목할 필요가 있습니다. 사용자는 시작 이미지를 준비하지 않고 텍스트 프롬프트만으로 영상 생성을 시작하면서 네이티브 1080p 해상도를 활용할 수 있습니다.
이번 업데이트는 단순히 영상 생성 방식을 추가하는 데 그치지 않고, 텍스트 기반 생성과 이미지 기반 생성을 모두 지원하면서 영상 품질과 제작 편의성을 함께 강화한 형태입니다.
웹·모바일·API에서 이용 가능
새로운 기능은 웹사이트뿐 아니라 iOS와 Android 앱에서도 사용할 수 있습니다.
API에서도 Imagine Video 1.5 모델을 통해 이미지 참조, 텍스트-비디오, 1080p 영상 생성 기능을 제공합니다. 음성 참조 기능은 API에서 별도 요청을 통해 이용할 수 있습니다.
따라서 Grok Imagine의 영상 생성 기능은 서비스에서 직접 사용하는 방식뿐 아니라 API를 활용하는 방식으로도 제공됩니다.
다만 새로운 기능은 처음에는 미국 지역의 SuperGrok Heavy와 SuperGrok Plus 구독자를 대상으로 제공됩니다. 이후 며칠 안에 모든 요금제로 확대될 예정이라고 밝혔습니다.
SuperGrok Plus도 새롭게 추가
이번 영상 생성 기능 업데이트와 함께 SuperGrok Plus 요금제도 발표됐습니다.
SuperGrok Plus는 기존 월 30달러의 SuperGrok과 월 300달러의 SuperGrok Heavy 사이에 위치하는 중간급 유료 요금제입니다. 월 100달러 또는 연간 1000달러에 이용할 수 있습니다.
기존 SuperGrok의 모든 기능을 포함하면서 채팅, 영상 생성, 음성, 앱 제작 기능의 사용 한도를 확대했습니다.
또한 응답 속도 향상, 이용량이 몰리는 시간대의 우선 접근 권한, 단일 프롬프트만으로 애플리케이션을 생성하고 원클릭으로 배포하는 기능, 신규 기능을 먼저 이용할 수 있는 Early Access 등의 혜택을 제공합니다.
Grok Imagine 업데이트가 의미하는 것
이번 Grok Imagine 업데이트에서 가장 중요한 변화는 영상 제작의 시작점이 확대됐다는 것입니다.
기존 이미지-비디오 방식에서는 먼저 영상의 기반이 될 이미지를 준비해야 했지만, 텍스트-비디오 기능을 이용하면 이러한 과정 없이 프롬프트만으로 영상 생성을 시작할 수 있습니다.
여기에 최대 7개의 참조 이미지, 캐릭터와 음성 일관성 유지, 네이티브 1080p 영상 생성까지 더해졌습니다.
정리하면 이번 업데이트의 핵심은 다음과 같습니다.
- 텍스트만으로 영상 생성 가능
- 이미지-비디오 기능과 텍스트-비디오 기능을 함께 지원
- 최대 7개 참조 이미지 활용
- 캐릭터 외형의 일관성 유지
- 음성의 일관성 유지
- 텍스트-비디오 및 이미지-비디오에서 네이티브 1080p 지원
- 웹, iOS, Android, API 지원
특히 텍스트만으로 영상을 생성할 수 있다는 변화는 영상 제작 과정 자체를 단순화한다는 점에서 의미가 있습니다. 영상으로 만들고 싶은 내용을 텍스트로 설명하고 생성하는 방식이 추가되면서 이미지 준비 단계 없이 영상 제작을 시작할 수 있기 때문입니다.
Grok Imagine은 이번 업데이트를 통해 AI 영상 생성 기능을 크게 확장했습니다. 핵심은 단순한 영상 품질 개선을 넘어 텍스트만으로 영상을 생성할 수 있는 텍스트-비디오 기능을 추가했다는 점입니다.
여기에 최대 7개 참조 이미지와 캐릭터·음성 일관성 유지 기능, 네이티브 1080p 영상 생성까지 지원하면서 영상 제작에 필요한 요소를 보다 폭넓게 다룰 수 있게 됐습니다.
특히 텍스트만 입력해 영상을 생성할 수 있다는 것은 영상 제작을 시작하기 위해 준비해야 하는 과정을 줄여준다는 점에서 주목할 만합니다. 이미지가 필요한 경우에는 이미지-비디오 기능을 활용하고, 별도의 시작 이미지 없이 아이디어를 영상으로 만들고 싶다면 텍스트-비디오 기능을 활용할 수 있기 때문입니다.
결국 이번 업데이트는 텍스트를 영상 제작의 직접적인 출발점으로 만들었다는 점에서 의미가 있습니다. 앞으로 Grok Imagine이 이러한 생성 기능을 바탕으로 영상 제작의 편의성과 일관성을 어느 수준까지 발전시켜 나갈지 주목할 필요가 있습니다.
https://grok.com/supergrok/imagine
Grok Imagine — AI Image & Video Generator
The world's fastest AI image and video generator.
grok.com

'인공지능' 카테고리의 다른 글
| Qwen-UI-Agent, GUI와 CLI를 통합한 차세대 실세계 AI 에이전트 (0) | 2026.08.03 |
|---|---|
| ByteDance Seedance 2.5, 최대 3분 장편 영상 제작으로 확장된 AI 영상 생성 기술 (0) | 2026.08.03 |
| MiniMax H3, 텍스트·이미지·영상·오디오를 하나로 이해하는 2K 영상 생성 모델 (0) | 2026.08.03 |
| DeepSeek-V4-Flash-0731, 에이전트와 코딩 성능을 크게 높인 공식 업데이트 (0) | 2026.08.03 |
| AI 에이전트 구축 가이드: 설계 원칙부터 멀티 에이전트, 가드레일까지 한 번에 이해하기 (0) | 2026.07.31 |