본문 바로가기

인공지능

Seedance 2.5, 최대 30초 영상 생성부터 정밀 편집까지 지원하는 차세대 AI 영상 모델

728x90
반응형
728x170

AI 영상 생성 기술은 짧은 클립을 만드는 단계를 넘어 하나의 완성된 콘텐츠를 제작하는 방향으로 발전하고 있습니다. 단순히 장면 하나를 생성하는 것보다 인물과 배경의 일관성을 유지하고, 여러 장면을 자연스럽게 연결하며, 카메라 움직임과 음성까지 원하는 방식으로 제어하는 것이 중요해지고 있습니다.

ByteDance Seed 팀의 Seedance 2.5는 이러한 흐름에 맞춰 영상 생성 범위를 확장한 차세대 영상 모델입니다. 최대 30초 분량의 영상과 음성을 한 번에 생성할 수 있고, 생성한 영상을 여러 차례 연장하면서 인물과 환경, 서사의 흐름을 유지할 수 있습니다.

여기에 이미지와 영상, 오디오를 함께 참조하는 멀티모달 생성, 클레이 렌더를 활용한 장면 제어, 타임스탬프 기반 수정, 그린 스크린과 카메라 시점 변경까지 지원하면서 영화와 광고 같은 전문적인 영상 제작 환경을 겨냥하고 있습니다.

이번 글에서는 Seedance 2.5가 어떤 방식으로 영상 생성 기능을 확장했는지, 주요 특징과 활용 분야, 그리고 아직 남아 있는 기술적 과제까지 살펴보겠습니다.

반응형

30초 영상 생성과 장편 서사 구성

Seedance 2.5의 가장 큰 특징 중 하나는 한 번에 생성할 수 있는 영상 길이가 최대 30초로 늘어났다는 점입니다.

Seedance 2.5는 Seedance 2.0의 통합 멀티모달 음성·영상 공동 생성 아키텍처를 기반으로 기초 생성과 참조 기반 생성을 강화했습니다. 기존 15초 수준에서 최대 30초까지 생성 범위를 확대하면서 단순한 하나의 장면이 아니라 여러 숏을 하나의 흐름으로 구성할 수 있도록 했습니다.

예를 들어 가수가 무대에 올라가는 장면만 생성하는 것이 아니라, 대기실에서 스태프와 대화하고 복도를 지나 댄서들과 만난 뒤 함께 공연을 시작하는 식으로 장면의 설정과 전개, 전환, 결말을 연결할 수 있습니다.

입력 정보에 제시된 Video 22 역시 핸드헬드 짐벌 원테이크 방식으로 대기실에서 공연장 전경까지 이어지는 사례를 보여줍니다.

생성한 영상을 계속 이어가는 방식

Seedance 2.5는 한 번 만든 영상을 끝내는 것이 아니라 기존 결과 뒤에 장면을 추가하는 방식으로 여러 차례 연장할 수 있습니다.

이 과정에서 주인공과 환경, 서사의 속도를 유지하는 것을 목표로 합니다. 기존처럼 영상을 여러 클립으로 나누고 반복적으로 이어 붙인 뒤 전환을 수정하는 작업을 줄일 수 있다는 의미입니다.

입력 정보에 따르면 Video 23에서는 지하철에서 거리로 이어지는 추격 장면을 30초 연장하는 사례가 제시됐습니다.

즉, Seedance 2.5에서 30초 생성은 단순히 영상 길이만 늘어난 것이 아니라 하나의 이야기를 이어가는 영상 생성 방식으로 범위를 확장했다는 데 의미가 있습니다.

영상과 음성의 연속성을 높이는 생성

영상이 길어질수록 생성 모델이 해결해야 하는 문제도 많아집니다. 한 장면에서는 자연스럽게 보이던 인물과 배경이 여러 장면을 거치면서 달라지거나, 카메라 이동 과정에서 피사체가 불안정해질 수 있기 때문입니다.

Seedance 2.5는 카메라 이동 사이의 전환을 부드럽게 처리하고 여러 컷에서도 주요 피사체의 안정성을 유지하는 것을 목표로 합니다.

또한 음성과 영상의 동기화도 함께 고려합니다.

입력 정보에서는 경극 장면을 하나의 사례로 제시합니다. 배우의 물소매를 따라 카메라가 원형으로 움직이는 상황에서도 주인공과 배경을 일관되게 유지하고, 소매가 실제 물리 현상에 가까운 자연스러운 호를 그리도록 생성합니다.

Video 24에서는 여러 배우의 동작과 카메라 이동을 하나의 연속 숏으로 구성한 사례가 소개됩니다.

AI 영상 특유의 인공적인 외관 개선

AI 영상은 장면이 자연스럽더라도 물체의 질감이나 피부, 눈, 조명, 색상 등이 실제 촬영 영상과 다르게 느껴질 수 있습니다.

Seedance 2.5는 이러한 인공적인 외관을 줄이기 위해 물체 질감과 피부, 눈, 조명, 색상 채도 등을 체계적으로 최적화합니다.

또한 통제되지 않은 자막과 배경음악이 발생하는 문제도 줄여 실사 영화에 가까운 결과를 목표로 합니다.

결국 영상의 길이뿐만 아니라 길어진 영상 전체에서 얼마나 자연스럽고 일관된 결과를 유지할 수 있는가가 중요한 특징이라고 볼 수 있습니다.

이미지·영상·오디오를 함께 활용하는 멀티모달 참조

Seedance 2.5는 한 번의 생성 과정에서 여러 종류의 참조 자료를 활용할 수 있습니다.

입력 정보에 따르면 최대 이미지 30개, 영상 10개, 오디오 10개까지 참조 자료로 사용할 수 있습니다.

각 자료의 화면 구성과 장면, 스타일, 인물, 소품 등을 이해하고 사용자의 지시에 따라 생성 결과에 반영합니다.

이 기능은 등장인물이 많거나 서로 다른 공간과 소품을 하나의 영상에 구성해야 하는 상황에서 특히 중요합니다.

예를 들어 공연 영상을 만든다고 가정해 보겠습니다. 공연장, 피아니스트, 악기, 가수, 오케스트라, 합창단, 관객석을 각각 다른 이미지로 참조할 수 있습니다. Seedance 2.5는 이러한 자료를 활용해 하나의 30초 콘서트 장면으로 구성할 수 있습니다.

입력 정보의 Video 25가 이러한 활용 사례입니다.

여러 인물이 등장하는 장면에서는 각 인물의 외모와 음성 특성을 안정적으로 유지하는 것이 중요합니다. Seedance 2.5는 여러 참조 자료를 활용해 복잡한 집단 서사에서도 이러한 특징을 유지하는 방향으로 기능을 강화했습니다.

클레이 렌더로 공간과 동작을 먼저 설계

영상 제작에서 복잡한 장면을 만들 때는 인물의 위치와 이동 경로, 카메라의 위치, 화면 구도를 먼저 결정해야 합니다.

Seedance 2.5는 이를 위해 클레이 렌더 참조를 활용할 수 있습니다.

클레이 렌더는 질감이나 세부적인 외형을 제외한 3D 모델 형태로 공간 구조와 인물 자세, 이동 경로, 카메라 각도, 블로킹 등을 먼저 정의하는 방식입니다.

이렇게 구성된 공간 정보를 바탕으로 실제 영상의 구도와 인물 배치를 제작 의도에 맞게 구성할 수 있습니다.

또한 클레이 렌더에서 확보한 공간 정보를 이용해 광원의 방향과 색온도, 강도, 그림자 투영 등 조명 효과도 생성합니다.

서로 다른 참조 자료를 조합하는 방식

클레이 렌더만 사용하는 것도 아닙니다.

입력 정보의 Video 26에서는 클레이 렌더를 통해 카메라 이동과 블로킹을 정하고, 별도의 이미지에서 인물과 재질, 조명, 색상, 분위기를 가져와 3D 애니메이션으로 변환하는 사례가 제시됩니다.

이 방식은 복잡한 장면에서 공간과 동작은 한 자료로 제어하고, 인물과 스타일은 다른 자료로 제어하는 방식으로 이해할 수 있습니다.

영상 제작자가 원하는 장면을 보다 구체적인 형태로 설계할 수 있다는 점이 특징입니다.

타임스탬프로 특정 구간을 정밀하게 제어

영상 전체를 한 번에 생성하는 것만으로 원하는 결과를 얻기 어려운 경우도 있습니다.

Seedance 2.5는 타임스탬프 기반 생성과 수정을 통해 특정 구간의 서사와 카메라 시점, 움직임, 전체 리듬을 프롬프트로 지정할 수 있습니다.

예를 들어 영상의 특정 시점에 인물이 등장하도록 하거나, 특정 구간에서 카메라가 이동하고 인물이 행동하도록 설정하는 식입니다.

생성 후에도 특정 클립의 인물이나 행동, 줄거리 요소만 선택적으로 수정할 수 있습니다. 이때 전후 장면의 연속성과 사실성을 유지하는 것을 목표로 합니다.

이러한 방식은 반복 생성 작업을 줄이는 데 도움이 됩니다.

특정 장면 하나가 마음에 들지 않는다고 전체 영상을 다시 만드는 대신 원하는 구간의 인물이나 행동, 카메라 움직임만 수정할 수 있기 때문입니다.

그린 스크린과 카메라 시점도 변경 가능

Seedance 2.5는 영상 생성뿐 아니라 기존 장면을 수정하는 기능도 강화했습니다.

그린 스크린 편집을 이용하면 주인공을 유지한 상태에서 배경을 교체해 새로운 이야기를 구성할 수 있습니다.

단순히 배경만 바꾸는 것이 아니라 새로운 환경에 맞춰 옷이 날리는 방향이나 머리카락의 상태, 걸음걸이, 조명과의 상호작용 등을 조정해 인물이 새로운 장면에 자연스럽게 융합되도록 합니다.

입력 정보의 Video 27에서는 그린 스크린 원본을 야외 훈련, 라커룸, 국제 경기 장면으로 변경하는 사례가 소개됩니다.

카메라 움직임만 변경하는 방식

인물과 행동, 시각적 스타일은 유지하면서 카메라 움직임만 바꾸는 것도 가능합니다.

예를 들어 기존 영상을 그대로 두고 특정 구간의 카메라를 FPV 이동 방식으로 변경하거나, 측면 추적과 탑다운, 핸드헬드 구도로 바꾸는 식입니다.

Video 28에서는 15초 영상을 구간별로 서로 다른 카메라 구도로 변경하는 사례가 제시됩니다.

이러한 기능은 영상 제작 과정에서 촬영 자체를 다시 하지 않고도 카메라 연출을 변경할 수 있는 방법을 제공한다는 점에서 의미가 있습니다.

교육 분야에서도 활용 가능성 확대

Seedance 2.5의 활용 범위는 영화나 광고에만 한정되지 않습니다.

교육 분야에서는 역사적 배경과 인물, 줄거리를 몰입감 있는 영상으로 바꾸거나 과학 원리와 역사적 사건, 실험 절차처럼 설명하기 어려운 내용을 동적인 영상으로 표현하는 데 활용할 수 있습니다.

이를 통해 교사가 수업 목적에 맞는 영상을 제작하는 데 필요한 작업 부담을 낮추고, 교육 내용에 맞춘 콘텐츠를 보다 유연하게 구성할 수 있습니다.

입력 정보에서는 Doubao Learning의 ‘Doubao Classroom’에서 남송 시대 Lin’an 거리와 Xin Qiji를 연속 장면으로 구성한 Video 29 사례가 제시됩니다.

즉, 글이나 설명만으로 전달하기 어려운 역사적 상황이나 과학적 개념 등을 영상으로 표현하는 방식으로 활용 범위를 확장할 수 있습니다.

제조·로봇·자율주행 분야의 활용

Seedance 2.5는 산업 제조와 체화 지능, 자율주행 분야에서도 활용되고 있습니다.

제조 분야에서는 산업 시뮬레이션이나 공정 교육, 장비 시연 등에 활용할 수 있습니다.

특히 로봇의 인지 및 조작 능력을 훈련하는 데 사용할 수 있는 고품질 합성 영상 데이터를 생성하는 방식도 제시되고 있습니다.

입력 정보의 Video 30에서는 클레이 렌더를 이용해 자동차의 조립 순서와 부품 이동 경로를 참조하고 이를 사실적인 자동차 조립 영상으로 생성하는 사례가 소개됩니다.

자율주행 시뮬레이션에도 활용

자율주행 분야에서는 일반적인 도로 상황뿐만 아니라 극한 기상이나 복잡한 교통 조건처럼 대응하기 어려운 상황을 시뮬레이션하는 데 활용할 수 있습니다.

이러한 롱테일 상황을 영상으로 구성하면 시스템 시험과 훈련에 활용할 수 있는 샘플을 확보하는 데 도움이 됩니다.

따라서 AI 영상 생성은 단순한 콘텐츠 제작을 넘어 산업용 시뮬레이션과 학습 데이터 생성으로도 활용 범위를 넓혀가고 있습니다.

Seedance 2.5는 어디에서 사용할 수 있을까?

입력 정보에 따르면 Seedance 2.5는 Jimeng AI와 Doubao Pro에서 순차적으로 제공되며, 각 서비스의 영상 생성 화면에서 선택할 수 있습니다.

또한 BytePlus ModelArk를 통한 API 접근도 제공될 예정입니다.

따라서 현재는 영상 생성 서비스를 통해 활용하는 방식에서 향후 API를 이용한 개발 및 서비스 연계까지 사용 범위가 확대될 가능성이 제시되고 있습니다.

아직 해결해야 할 기술적 과제

Seedance 2.5가 영상 생성과 편집 영역에서 다양한 기능을 제공하지만 해결해야 할 과제도 남아 있습니다.

가장 먼저 복잡한 움직임의 물리적 타당성이 과제로 제시됩니다.

영상에서 움직임이 자연스럽게 보이는 것과 실제 세계의 물리 법칙에 맞는 것은 다른 문제입니다. 복잡한 동작이 많아질수록 실제 물리 현상에 맞는 움직임을 안정적으로 생성하는 것이 중요합니다.

또 하나는 다수 피사체가 상호작용하는 장면의 안정성입니다.

여러 사람이 동시에 움직이거나 서로 상호작용하는 복잡한 장면에서는 각각의 인물과 행동을 지속적으로 일관되게 유지해야 합니다.

Seed 팀은 앞으로 서사의 일관성과 직관적인 생성·편집 경험, 현실 세계 물리에 대한 이해를 지속적으로 개선할 계획입니다.

728x90

Seedance 2.5는 AI 영상 생성의 범위를 단순한 짧은 클립 제작에서 아이디어부터 완성 영상까지 이어지는 종합적인 창작 워크플로로 확장하고 있습니다.

최대 30초 영상과 음성을 한 번에 생성하고, 여러 차례 영상을 연장하면서 인물과 환경, 서사의 흐름을 유지할 수 있습니다.

여기에 최대 이미지 30개, 영상 10개, 오디오 10개의 멀티모달 참조와 클레이 렌더, 동작 및 창의적 참조, 타임스탬프 기반 생성과 수정, 그린 스크린, 카메라 시점 변경 등의 기능을 결합했습니다.

특히 영화와 광고 같은 콘텐츠 제작뿐 아니라 교육, 제조, 로봇, 자율주행 등 다양한 분야의 활용 사례가 제시되고 있다는 점도 주목할 부분입니다.

다만 복잡한 움직임의 물리적 타당성과 다수 피사체의 상호작용 안정성은 여전히 해결해야 할 과제로 남아 있습니다.

결국 Seedance 2.5의 핵심은 단순히 “더 긴 영상을 생성한다”는 데 있지 않습니다. 여러 장면과 인물, 음성, 카메라, 참조 자료를 하나의 제작 과정 안에서 연결하고, 생성 이후에도 필요한 부분을 수정할 수 있도록 하면서 AI 영상 제작의 범위를 넓혔다는 데 의미가 있습니다.

앞으로 이러한 기술이 서사의 일관성과 물리적 현실성, 편집 제어 능력을 얼마나 더 발전시키느냐에 따라 AI 영상 생성은 단순한 콘텐츠 제작 보조를 넘어 보다 복잡한 영상 제작 환경으로 활용 범위를 넓혀갈 수 있을 것으로 기대됩니다.

300x250

https://seed.bytedance.com/en/blog/one-take-creation-flexible-referencing-introducing-seedance-2-5

 

Seed News - ByteDance Seed Team

One-take Creation, Flexible Referencing: Introducing Seedance 2.5 Today, we are officially launching Seedance 2.5, the new-generation video creation model. Since the release of Seedance 2.0, we have noticed a shift in what users expect from video creation

seed.bytedance.com

728x90
반응형
그리드형