본문 바로가기

인공지능

MetaView: 단일 이미지 기반 대규모 시점 변환을 구현하는 Scale-Aware Novel View Synthesis 기술

728x90
반응형
728x170

단일 이미지에서 새로운 시점을 생성하는 MetaView 기술

최근 생성형 AI는 높은 품질의 이미지를 생성할 수 있을 정도로 발전했지만, 공간 구조를 정확하게 이해하는 능력은 여전히 한계가 있습니다. 특히 한 장의 이미지만으로 카메라 위치를 크게 변경한 새로운 시점을 생성하는 Novel View Synthesis(NVS) 분야에서는 공간 일관성과 자유로운 시점 변화 사이의 균형을 맞추는 것이 중요한 과제로 남아 있습니다.

ECCV 2026에서 발표된 MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors는 이러한 문제를 해결하기 위해 제안된 새로운 Diffusion 기반 프레임워크입니다. 기존 방식의 장점을 결합하면서도 대규모 시점 변화에서도 공간 구조를 유지하고 정확한 카메라 제어가 가능하도록 설계된 것이 가장 큰 특징입니다.

이번 글에서는 MetaView의 핵심 개념과 기존 기술의 한계, 주요 구조, 성능 그리고 새롭게 제안된 평가 지표까지 정리해보겠습니다.

반응형

Novel View Synthesis란?

Novel View Synthesis(NVS)는 하나 이상의 이미지로부터 존재하지 않는 새로운 카메라 시점의 이미지를 생성하는 기술입니다.

예를 들어 정면 사진 한 장만 있을 때,

  • 좌측에서 바라본 모습
  • 우측에서 바라본 모습
  • 위에서 내려다본 모습

등을 자연스럽게 생성하는 기술이라고 이해하면 됩니다.

최근에는 Diffusion Model의 발전으로 이미지 품질은 크게 향상되었지만, 카메라가 크게 이동하는 경우에는 다음과 같은 문제가 자주 발생합니다.

  • 공간 구조가 무너지는 현상
  • 물체의 형태가 뒤틀리는 현상
  • 카메라 이동 방향을 정확하게 제어하기 어려운 문제
  • 거리(Scale)가 일정하지 않은 문제

MetaView는 이러한 문제를 해결하는 것을 목표로 합니다.


기존 Novel View Synthesis의 한계

논문에서는 기존 접근 방식을 크게 두 가지로 구분합니다.

명시적(Explicit) Geometry 기반 방식

기존 연구들은 3D Geometry를 명시적으로 복원한 후 이를 기반으로 새로운 시점을 생성하는 방식을 사용했습니다.

장점

  • 공간 일관성이 높음
  • 구조가 안정적임

하지만 다음과 같은 한계가 있습니다.

  • 큰 시점 변화에 대한 일반화가 어려움
  • 복잡한 3D Reconstruction 과정이 필요
  • 새로운 장면에 대한 유연성이 떨어짐

암시적(Implicit) Scene Modeling 방식

최근에는 장면을 직접 3D로 복원하지 않고 내부 Feature만으로 Scene을 표현하는 방식도 많이 연구되고 있습니다.

장점

  • 다양한 장면에 잘 일반화됨
  • 유연한 생성 가능

반면 다음과 같은 문제가 존재합니다.

  • 카메라 제어 정확도가 낮음
  • Geometry Consistency가 부족함
  • 공간 구조가 쉽게 무너질 수 있음

MetaView는 이 두 접근법의 장점을 결합하는 방향으로 설계되었습니다.


MetaView의 핵심 아이디어

MetaView의 핵심은 암시적 Geometry Modeling을 유지하면서 최소한의 명시적 3D 정보를 함께 사용하는 것입니다.

논문에서는 이를 위해 두 가지 핵심 요소를 도입했습니다.

1. Implicit Geometry Prior

MetaView는 Feed-forward Geometry Perception Network에서 Geometry Prior를 추출합니다.

이 Geometry 정보는

  • Scene 구조 유지
  • 물체 형태 보존
  • 공간 일관성 향상

을 위한 규제(Regularization) 역할을 수행합니다.

기존처럼 복잡한 3D Reconstruction 과정을 거치지 않으므로 유연성도 함께 확보할 수 있습니다.


2. Metric Depth 기반 Scale 정보

또 하나의 핵심은 Metric Depth를 이용해 실제 거리 정보를 유지하는 것입니다.

기존 모델에서는 카메라가 이동하면서 거리 정보가 점점 왜곡되는 Scale Drift 문제가 자주 발생합니다.

MetaView는 Metric Depth를 활용하여 이러한 문제를 줄이고

  • 실제 거리 유지
  • 안정적인 시점 이동
  • 정확한 카메라 제어

를 가능하게 합니다.


MetaView의 구조

MetaView는 MM-DiT(Multi-Modal Diffusion Transformer)를 기반으로 설계되었습니다.

기존 DiT 구조에 새로운 Stream을 추가하여 Geometry Prior를 함께 학습합니다.

주요 구성은 다음과 같습니다.

Split Stream 구조

기존 이미지 Feature와 별도로 Geometry Feature를 처리하는 Stream을 추가합니다.

이를 통해 이미지 정보와 Geometry 정보를 각각 유지하면서 함께 활용할 수 있습니다.


Self-Attention 기반 Geometry Fusion

추출한 Geometry Prior는 Self-Attention을 통해 이미지 Feature와 자연스럽게 결합됩니다.

이를 통해

  • 구조 정보
  • 시각 정보

를 동시에 반영하는 Feature를 생성합니다.


Spatial-aware RoPE

논문에서는 Scale Drift 문제를 해결하기 위해 기존 RoPE(Rotary Positional Embedding)를 수정한 Spatial-aware RoPE를 적용했습니다.

이를 통해 공간 위치와 거리 정보를 함께 반영하여 보다 안정적인 시점 생성이 가능해집니다.


MetaView의 주요 특징

MetaView는 다음과 같은 특징을 제공합니다.

대규모 시점 변화 지원

단일 이미지에서도 큰 카메라 이동을 자연스럽게 생성할 수 있습니다.


Geometry Consistency 향상

장면 구조와 물체 형태를 보다 안정적으로 유지합니다.


정확한 카메라 제어

Metric Depth를 이용하여 원하는 카메라 위치를 보다 정확하게 제어할 수 있습니다.


높은 일반화 성능

복잡한 3D Reconstruction에 의존하지 않기 때문에 다양한 장면에서도 우수한 성능을 보입니다.


성능 비교

논문에서는 다음 세 가지 데이터셋에서 기존 최신 기법들과 비교 실험을 수행했습니다.

  • DL3DV
  • RealEstate10K
  • Sekai-Real-Walk-HQ

비교 대상은 다음과 같습니다.

  • ViewCrafter
  • GEN3C
  • Voyager
  • PE-Field
  • HY-World-1.5
  • Lingbot-World

실험 결과 MetaView는 대부분의 평가 지표에서 가장 우수한 성능을 기록했습니다.

대표적으로 DL3DV 데이터셋에서는 다음과 같은 결과를 보였습니다.

지표 MetaView
PSNR 15.18
SSIM 0.4456
LPIPS 0.2137
DMD 10.29

RealEstate10K에서도 PSNR 15.27, SSIM 0.5705, LPIPS 0.1980, DMD 6.44를 기록했으며, Sekai-Real-Walk-HQ에서도 낮은 DMD와 높은 구조 일관성을 유지했습니다.

특히 기존 방법 대비 DMD(Dense Matching Distance)가 크게 개선되어, 극단적인 시점 변화에서도 공간 정합성이 우수함을 보여주었습니다.


Dense Matching Distance(DMD)란?

논문에서는 기존 평가 지표의 한계를 해결하기 위해 Dense Matching Distance(DMD)라는 새로운 평가 지표를 제안했습니다.

기존 Novel View Synthesis에서는 다음과 같은 지표가 주로 사용되었습니다.

  • PSNR
  • SSIM
  • LPIPS

하지만 이러한 지표들은 카메라 이동이 큰 환경에서는 실제 품질을 충분히 반영하지 못하는 문제가 있습니다.

예를 들어 구조가 흐릿한 이미지는 저주파 성분이 원본과 유사해 높은 PSNR이나 SSIM을 얻을 수 있지만, 실제 공간 구조는 크게 왜곡될 수 있습니다.

DMD는 이러한 한계를 보완하기 위해 공간 정렬(Spatial Alignment)을 중심으로 평가하며, 논문에서는 사람의 주관적인 품질 평가와도 높은 일치성을 보인다고 설명합니다.

또한 DMD는 값이 낮을수록 더 우수한 성능을 의미합니다.


MetaView 활용 예시

MetaView는 단일 이미지를 입력으로 받아 새로운 시점을 생성하는 방식으로 동작합니다.

예를 들어 건물 정면 사진 한 장을 입력하면, 사용자는 구면(Spherical) 카메라 포즈를 지정하여 다양한 각도에서 바라본 이미지를 생성할 수 있습니다.

이 과정에서 MetaView는 Geometry Prior와 Metric Depth 정보를 함께 활용하여 큰 시점 변화에서도 장면 구조를 안정적으로 유지하고 자연스러운 결과를 생성하도록 설계되었습니다.


728x90

MetaView는 단일 이미지 기반 Novel View Synthesis에서 공간 일관성과 자유로운 시점 생성이라는 두 가지 과제를 동시에 해결하기 위해 제안된 Diffusion 기반 프레임워크입니다.

기존의 명시적 Geometry 기반 방식과 암시적 Scene Modeling 방식의 장점을 결합하고, Geometry Prior와 Metric Depth를 활용해 구조적 안정성과 정확한 카메라 제어를 동시에 달성한 것이 핵심입니다.

또한 MM-DiT 기반 구조와 Spatial-aware RoPE를 통해 Scale Drift 문제를 완화했으며, 새롭게 제안한 DMD(Dense Matching Distance) 지표를 통해 극단적인 시점 변화에서도 공간 정합성을 보다 정확하게 평가할 수 있도록 했습니다.

실험 결과에서도 다양한 데이터셋에서 기존 최신 기법 대비 우수한 성능을 보이며, 대규모 시점 변화 환경에서도 높은 일반화 성능과 구조 일관성을 확인했습니다. 이러한 접근은 향후 단일 이미지 기반 3D 장면 생성과 시점 합성 기술의 발전에 중요한 방향성을 제시하는 연구로 평가할 수 있습니다.

300x250

https://prototypenx.github.io/MetaView/?fbclid=IwY2xjawTNIMZleHRuA2FlbQIxMABicmlkETE4RUk2eWFMUVlTM2hIMnIzc3J0YwZhcHBfaWQQMjIyMDM5MTc4ODIwMDg5MgABHop7JovTRGklFMdneY1A-ZV92oz6_OtUBR_OACjPcp7hqNkeeEZX9p3dNlY2_aem_cPyN9HoJPuQGcNzeOwf4BA

 

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

Current visual generation models are capable of producing high-quality content, yet they lack a coherent perception of the spatial structure. Existing generative novel view synthesis methods typically introduce explicit geometry priors, which enforce spati

prototypenx.github.io

728x90
반응형
그리드형