본문 바로가기

인공지능

Wan 3.0 가이드: 주요 기능부터 프롬프트 작성법과 활용 예시까지

728x90
반응형
728x170

AI 영상 생성에서 중요한 것은 단순히 한 장의 이미지를 영상으로 만드는 것이 아닙니다. 영상이 재생되는 동안 피사체가 어떻게 움직이고, 카메라가 어디로 이동하며, 장면과 소리가 어떻게 이어지는지를 함께 설계해야 합니다.

Wan 3.0은 Alibaba Tongyi Lab의 Wan 영상 생성 라인의 차세대 모델로 예상되는 모델입니다. 초기 데모를 기준으로 약 30초 분량의 연속적인 영상, Native 1080p 출력, 영상과 오디오의 동시 생성, 참조 기반 영상 생성, 프롬프트 계획 등의 기능이 주목받고 있습니다.

특히 약 30초의 긴 단일 테이크와 Reference-to-Video 기능은 여러 장면을 따로 생성한 뒤 편집하는 방식에서 벗어나 하나의 장면 자체를 길게 설계할 수 있다는 점에서 의미가 있습니다. 이 글에서는 Wan 3.0의 주요 기능과 특징을 살펴보고, 실제 영상 생성에 활용할 수 있는 프롬프트 작성법과 예시, 주의해야 할 실수까지 정리합니다.

반응형

Wan 3.0의 주요 기능은 무엇인가

Wan 3.0에서 주목할 기능은 크게 긴 단일 테이크, Native 1080p, 오디오 동시 생성, Reference-to-Video, Prompt Planning으로 정리할 수 있습니다.

기능 특징 활용 분야
Long Single Takes 약 30초 동안 하나의 연속적인 장면 유지 광고, 짧은 장면, 긴 리빌
Native 1080p 별도의 업스케일링 없이 Full HD 출력 고화질 영상, 대형 화면
Audio in the Same Pass 영상과 오디오를 함께 생성 대사, 음악, 효과음이 필요한 장면
Reference-to-Video 캐릭터·제품·장소 등의 특징을 장면에 유지 시리즈 영상, 여러 장면, 브랜드 콘텐츠
Prompt Planning 생성 전 구성과 움직임을 계획 여러 요소가 포함된 복잡한 영상

이러한 기능의 핵심은 각각 따로 사용하는 것이 아니라 영상의 구조와 프롬프트를 함께 설계하는 데 있습니다.

약 30초의 긴 단일 테이크가 중요한 이유

Wan 3.0에서 가장 눈에 띄는 특징 중 하나는 약 30초 동안 하나의 연속적인 장면을 구성할 수 있다는 점입니다.

기존에는 긴 장면을 만들기 위해 여러 개의 짧은 영상을 생성하고 이를 편집 과정에서 연결해야 했다면, 긴 단일 테이크에서는 하나의 생성 안에 장면의 시작과 변화, 마무리를 담을 수 있습니다.

예를 들어 단순히 다음처럼 작성하는 것만으로는 충분하지 않습니다.

한 여성이 플랫폼에 서 있다.

이 프롬프트는 정적인 장면에 가까운 설명입니다. 긴 영상에서는 시간의 흐름이 필요합니다.

예를 들어 다음과 같이 장면의 변화를 설명할 수 있습니다.

빈 플랫폼을 비추던 카메라가 열차가 도착하는 모습을 따라가고, 여성이 열차에서 내려 카메라 앞을 지나간다.

핵심은 피사체가 무엇인지보다 영상 전체에서 어떤 일이 순서대로 발생하는지를 작성하는 것입니다.

긴 영상은 길이보다 구조가 중요하다

30초라는 시간이 주어진다고 해서 30초 동안 아무런 변화가 없는 영상이 좋은 결과를 만드는 것은 아닙니다.

긴 단일 테이크를 활용하려면 다음과 같은 구조를 생각하는 것이 좋습니다.

시작 → 변화 또는 전환 → 마무리

예를 들어 카메라가 빈 공간을 보여주다가 인물이 등장하고, 마지막에 인물이 카메라 앞을 지나가는 식입니다.

특히 긴 테이크에서는 장면 중간에 변화가 발생하도록 구성하는 것이 중요합니다. 빛이 바뀌거나, 문이 열리거나, 사람들이 이동하면서 시야가 확보되는 등의 변화가 하나의 장면에 흐름을 만들어줍니다.

카메라 움직임도 여러 번 바꾸기보다는 하나의 움직임을 의도적으로 사용하는 것이 좋습니다. 약 30초 동안 지속되는 하나의 느린 이동이 여러 방향으로 반복되는 카메라 움직임보다 명확한 연출로 이어질 수 있습니다.

Reference-to-Video로 영상의 연속성을 유지하는 방법

여러 장면으로 구성된 영상을 만들 때 중요한 요소 중 하나는 연속성입니다.

첫 번째 장면의 캐릭터와 두 번째 장면의 캐릭터가 서로 다르게 보이거나, 동일한 제품의 형태가 장면마다 달라지면 하나의 영상으로 연결하기 어렵습니다.

Wan 3.0의 Reference-to-Video는 캐릭터, 제품, 장소 등의 참조 이미지를 제공해 이러한 특징을 여러 장면에서 유지하는 데 활용할 수 있는 기능으로 소개됩니다.

예를 들어 캐릭터와 장소를 각각 참조 자료로 제공했다면 프롬프트에서도 역할을 분명하게 지정할 수 있습니다.

캐릭터 참조 이미지의 배달원이 장소 참조 이미지에 나온 광장을 가로질러 이동한다.

여기서 중요한 것은 단순히 참조 자료를 제공하는 것이 아닙니다. 각 참조 자료가 무엇을 의미하는지 명확하게 알려주는 것도 중요합니다.

캐릭터 참조는 인물을 결정하고, 장소 참조는 배경과 위치를 결정한다는 식으로 역할을 분리하면 모델이 어떤 요소를 기준으로 장면을 구성해야 하는지 이해하기 쉬워집니다.

참조 자료는 많이 넣는 것보다 명확하게 준비하는 것이 중요하다

참조 이미지를 여러 장 사용하는 것보다 몇 개의 깨끗하고 명확한 이미지를 사용하는 것이 좋습니다.

특히 여러 각도에서 동일한 대상을 인식해야 한다면 하나의 콜라주에 여러 각도를 넣기보다는 각각의 각도를 별도의 참조 자료로 제공하는 방식이 적합합니다.

영상 참조의 경우에도 대상을 파악하는 데 약 5~10초 정도의 영상이면 충분하다고 설명됩니다.

결국 Reference-to-Video를 효과적으로 활용하려면 참조 자료의 수보다 각 자료의 역할과 품질을 명확하게 관리하는 것이 중요합니다.

영상과 오디오를 한 번에 생성하는 방식

Wan 3.0에서는 영상과 오디오를 같은 생성 과정에서 다루는 기능도 주요 특징으로 제시됩니다.

일반적인 영상 제작에서는 영상을 먼저 만든 뒤 별도의 과정에서 효과음이나 대사, 음악 등을 추가할 수 있습니다.

반면 영상과 오디오가 함께 생성되는 방식에서는 소리도 영상의 일부로 보고 장면을 설계할 수 있습니다.

예를 들어 비가 내리는 골목 장면을 만든다면 다음처럼 표현할 수 있습니다.

낮은 빗소리가 배경에 깔리고 음악은 없다. 카메라가 문에 도착하는 순간 셔터가 닫히는 소리가 난다.

이처럼 단순히 “소리를 추가해줘”라고 요청하는 것보다 어떤 소리가 발생하는지, 언제 발생하는지를 구체적으로 지정하는 것이 중요합니다.

소리의 타이밍도 프롬프트에서 설계한다

영상과 소리가 함께 생성된다면 편집 단계에서 소리를 맞추는 것이 아니라 프롬프트 단계에서 타이밍을 지정할 수 있습니다.

예를 들어 문이 닫히는 순간 소리가 발생하도록 요청하면 영상 속 움직임과 오디오의 타이밍을 함께 설계할 수 있습니다.

반대로 아무 소리도 나지 않는 순간 역시 연출의 일부가 될 수 있습니다.

대사나 특정 효과음이 시작되기 전에 잠시 정적을 유지하도록 요청하는 것도 하나의 연출 방식입니다.

Prompt Planning이 중요한 이유

Wan 계열의 또 다른 특징으로 소개되는 것은 Prompt Planning입니다.

이는 프롬프트를 입력받은 뒤 바로 첫 프레임을 생성하는 것보다 영상의 구성과 움직임을 먼저 계획한 후 렌더링하는 방식으로 설명됩니다.

따라서 단순히 길게 작성한 프롬프트보다 우선순위가 분명하게 정리된 프롬프트가 중요합니다.

예를 들어 다음 순서로 작성할 수 있습니다.

장면과 피사체 → 움직임 → 카메라 → 의상과 조명 → 배경 요소 → 오디오

특히 영상 전체에서 반드시 유지되어야 하는 요소가 있다면 명확하게 지정하는 것이 좋습니다.

제품 영상이라면 다음처럼 작성할 수 있습니다.

브러시드 스틸 주전자가 스튜디오 조명 아래에서 회전한다. 회전하는 동안 제품의 로고는 계속 읽을 수 있는 상태로 유지된다.

이렇게 작성하면 모델이 단순히 제품을 회전시키는 것뿐 아니라 영상 전체에서 로고를 유지해야 한다는 조건도 고려할 수 있습니다.

Wan 3.0 프롬프트 작성법: SPACE 방식

Wan 3.0에서 효과적인 영상 프롬프트를 작성하려면 단순한 이미지 설명이 아니라 짧은 영상 촬영 지시서처럼 작성하는 것이 좋습니다.

제공된 자료에서는 이를 SPACE라는 방식으로 정리합니다.

요소 포함할 내용 예시
Subject 화면 속 대상 젖은 노란 재킷을 입은 배달원
Performance 대상의 행동과 움직임 문을 어깨로 열고 안으로 들어간다
Ambience 장소, 시간, 조명 밤의 좁은 골목, 젖은 벽돌에 비치는 네온
Camera 화면 구성과 카메라 움직임 미디엄 샷, 느린 푸시인
Extra Cues 오디오, 속도, 전환 빗소리, 음악 없음, 끊김 없는 단일 테이크

이 방식의 핵심은 영상의 대상과 움직임, 공간, 카메라, 추가 요소를 구체적으로 전달하는 것입니다.

Subject: 무엇을 보여줄 것인가

먼저 화면에 등장하는 대상을 구체적으로 작성합니다.

예를 들어 단순히 “배달원”이라고 적기보다 다음과 같이 특징을 지정할 수 있습니다.

젖은 노란색 재킷을 입은 배달원

대상이 명확할수록 모델이 장면의 중심을 잡기 쉬워집니다.

Performance: 무엇을 하는가

영상에서는 움직임이 중요합니다.

따라서 대상이 무엇을 하는지뿐 아니라 어떤 방식으로 움직이는지를 작성합니다.

배달원이 문을 어깨로 밀어 열고 안으로 들어간다.

정적인 대상 설명을 행동 중심의 설명으로 바꾸는 것이 핵심입니다.

Ambience: 어디에서 어떤 분위기로 움직이는가

장소와 시간, 조명도 함께 지정합니다.

밤의 좁은 골목, 젖은 벽돌에 네온 불빛이 번진다.

‘분위기 있게’, ‘영화처럼’처럼 추상적인 표현만 사용하는 것보다 실제 장면을 구성할 수 있는 정보를 제공하는 것이 좋습니다.

Camera: 카메라는 어떻게 움직이는가

카메라 움직임도 구체적으로 지정합니다.

미디엄 샷, 느린 푸시인

이처럼 촬영 구도와 하나의 카메라 움직임을 함께 작성하면 장면의 흐름을 보다 명확하게 설계할 수 있습니다.

Extra Cues: 오디오와 타이밍을 추가한다

마지막으로 오디오와 속도, 전환 등의 추가 정보를 지정합니다.

낮은 빗소리, 음악 없음, 끊김 없는 단일 테이크

이러한 방식으로 영상과 소리를 하나의 장면으로 구성할 수 있습니다.

Wan 3.0 프롬프트 예시: 약한 프롬프트와 강한 프롬프트

Wan 3.0의 기능을 제대로 활용하려면 같은 주제라도 어떻게 작성하느냐가 중요합니다.

1. 긴 단일 테이크

약한 프롬프트

바이올린 연주자가 바이올린을 연주한다.

대상의 행동은 있지만 장면이 어떻게 진행되는지 알기 어렵습니다.

강한 프롬프트

바이올린 연주자가 연주를 마치고 활을 내린 뒤 마지막 음이 사라질 때까지 잠시 멈춰 있으며, 카메라는 천천히 왼쪽으로 이동한다.

장면의 시작과 행동, 마무리, 카메라 움직임이 함께 들어가 있습니다.

2. 카메라 움직임

약한 프롬프트

밤에 비가 내리는 거리.

장소와 분위기는 있지만 카메라가 무엇을 촬영하는지 명확하지 않습니다.

강한 프롬프트

배달원을 미디엄 샷으로 촬영하고, 네온으로 빛나는 골목을 따라 카메라가 천천히 앞으로 이동한다. 빗물이 주요 조명 안으로 떨어진다.

피사체와 구도, 카메라 움직임, 환경이 구체적으로 들어갑니다.

3. Reference-to-Video

약한 프롬프트

이 참조 자료를 사용한다.

참조 자료가 무엇을 결정하는지 알 수 없습니다.

강한 프롬프트

캐릭터 참조 이미지의 배달원이 장소 참조 이미지에 나온 광장을 가로질러 이동한다.

각 참조 자료의 역할이 명확합니다.

4. 영상과 오디오

약한 프롬프트

소리를 추가한다.

어떤 소리인지, 언제 발생해야 하는지 알 수 없습니다.

강한 프롬프트

낮은 빗소리가 계속 들리고 음악은 없다. 카메라가 문에 도착하는 순간 셔터가 닫히는 소리가 난다.

소리와 타이밍까지 함께 지정합니다.

5. 제품 영상

약한 프롬프트

로고가 있는 제품 영상.

제품이 어떻게 촬영되는지 알 수 없습니다.

강한 프롬프트

브러시드 스틸 주전자를 스튜디오 조명 아래에서 회전시킨다. 회전하는 동안 제품의 로고는 계속 선명하게 읽을 수 있는 상태로 유지한다.

제품의 움직임과 조명, 그리고 영상 전체에서 유지해야 할 조건이 명확합니다.

Wan 3.0을 사용할 때 흔히 하는 실수

정적인 이미지를 설명하듯 작성하는 경우

영상 모델에 단순한 장면 하나만 설명하면 영상 전체의 움직임을 설계하기 어렵습니다.

“바이올린 연주자가 있다”보다는 “연주를 마치고 활을 내리며 마지막 음이 사라지는 동안 잠시 멈춘다”처럼 시간에 따른 행동을 작성해야 합니다.

30초 동안 아무 일도 일어나지 않는 경우

긴 영상은 단순히 길게 만드는 것만으로 의미가 생기지 않습니다.

장면의 시작과 변화, 마무리가 있어야 긴 시간이 하나의 장면으로 기능할 수 있습니다.

‘Cinematic’ 같은 표현만 사용하는 경우

‘시네마틱하게 만들어줘’와 같은 표현만으로는 카메라가 어떻게 촬영해야 하는지 구체적으로 전달하기 어렵습니다.

대신 미디엄 샷, 느린 푸시인처럼 실제 촬영 방식을 지정하는 것이 좋습니다.

하나의 프롬프트에 너무 많은 행동을 넣는 경우

하나의 영상 안에 여러 행동을 순서대로 넣으려고 하면 각 행동이 타협된 결과로 나타날 수 있습니다.

따라서 한 번의 테이크에는 하나의 명확한 행동을 중심으로 구성하고, 여러 장면이 필요하다면 참조 자료를 이용해 각각의 장면에서 연속성을 유지하는 방식이 적합합니다.

참조 자료의 역할을 설명하지 않는 경우

참조 이미지를 제공하면서 어떤 이미지가 캐릭터이고 어떤 이미지가 장소인지 설명하지 않으면 모델이 그 역할을 추측해야 합니다.

따라서 각 참조 자료의 역할을 프롬프트에 직접 지정하는 것이 좋습니다.

오디오를 나중에 생각하는 경우

영상과 오디오가 같은 생성 과정에서 만들어진다면 오디오 역시 프롬프트에서 설계할 수 있는 요소입니다.

배경음, 효과음, 대사뿐만 아니라 소리가 발생하는 타이밍과 정적까지 지정하는 것이 중요합니다.

Wan 계열의 오픈소스와 셀프 호스팅

Wan 계열을 살펴볼 때는 모델 세대에 따른 공개 방식도 구분할 필요가 있습니다.

제공된 정보에 따르면 Alibaba는 이전 Wan 계열 모델을 Apache 2.0 라이선스로 오픈소스화했으며, 해당 모델의 가중치는 다운로드해 직접 호스팅할 수 있습니다.

반면 이후 세대는 상용 API 모델로 제공됩니다.

따라서 직접 모델을 구축하고 운영하는 셀프 호스팅이 중요한 환경이라면 단순히 최신 모델의 기능만 비교하기보다 어떤 세대의 모델과 가중치를 실제로 사용할 수 있는지를 확인하는 것이 중요합니다.

Wan 3.0을 제대로 활용하려면 프롬프트가 중요하다

Wan 3.0의 주요 특징을 종합하면 중요한 것은 단순히 “좋은 영상을 만들어 달라”고 요청하는 것이 아닙니다.

긴 단일 테이크를 활용하려면 장면의 전체 흐름을 작성해야 합니다.

Reference-to-Video를 활용한다면 참조 자료의 역할을 분명히 지정해야 합니다.

영상과 오디오를 함께 생성한다면 소리와 타이밍까지 장면의 일부로 설계해야 합니다.

Prompt Planning을 고려한다면 프롬프트의 앞부분에 피사체와 카메라처럼 중요한 정보를 배치하고, 영상 전체에서 유지해야 할 조건을 명확하게 작성해야 합니다.

결국 좋은 프롬프트는 긴 설명이 아니라 명확한 영상 설계에 가깝습니다.

728x90

Wan 3.0이 보여주는 AI 영상 제작의 방향

Wan 3.0은 제공된 초기 정보 기준으로 약 30초의 긴 단일 테이크, Native 1080p, 영상과 오디오의 동시 생성, Reference-to-Video, Prompt Planning 등을 주요 특징으로 보여주고 있습니다.

특히 긴 단일 테이크는 영상 제작의 단위를 바꿀 수 있다는 점에서 의미가 있습니다. 짧은 클립을 여러 개 만들어 편집하는 방식뿐 아니라 하나의 생성 과정에서 광고나 짧은 장면의 흐름을 처음부터 끝까지 설계할 수 있기 때문입니다.

Reference-to-Video는 여러 장면에서 캐릭터와 제품, 장소의 연속성을 유지하는 데 활용할 수 있고, 영상과 오디오의 동시 생성은 사운드까지 프롬프트 단계에서 고려하는 제작 방식을 가능하게 합니다.

다만 이러한 기능을 제대로 활용하려면 프롬프트 역시 달라져야 합니다. 단순히 화면에 무엇이 있는지를 설명하는 것에서 벗어나 무엇이 등장하고, 어떻게 움직이며, 카메라가 어떻게 이동하고, 어떤 소리가 언제 발생하는지를 구체적으로 작성해야 합니다.

따라서 Wan 3.0을 활용할 때 가장 중요한 관점은 ‘더 긴 프롬프트’를 작성하는 것이 아니라 ‘더 명확한 장면’을 설계하는 것입니다.

앞으로 AI 영상 생성이 발전할수록 사용자가 해야 할 일은 단순히 이미지를 만드는 것이 아니라 장면의 흐름과 카메라, 움직임, 사운드까지 하나의 프롬프트 안에서 설계하는 방향으로 확장될 수 있습니다. Wan 3.0의 기능과 프롬프트 작성 방식은 이러한 영상 생성 환경에서 어떻게 접근해야 하는지를 보여주는 사례라고 할 수 있습니다.

300x250

https://morphic.com/resources/how-to/wan-3-0-guide

 

How to use Wan 3.0: prompts, features, and examples

How to use Wan 3.0: write prompts for 30-second single takes, lock a character with references, and direct the camera. With worked prompt examples.

morphic.com

728x90
반응형
그리드형