
로봇이 사람처럼 주변 환경을 이해하고 자연스럽게 작업을 수행하기 위해서는 단순히 영상을 인식하는 것을 넘어, 환경 변화와 행동의 관계를 학습하는 능력이 필요합니다. 기존의 비디오 기반 AI 모델은 영상 생성 기술을 기반으로 발전해 왔지만, 실제 로봇 제어에서는 속도와 물리적 이해 측면에서 여러 한계를 가지고 있었습니다.
Ant Group의 로봇 AI 연구 조직인 Robbyant는 이러한 문제를 해결하기 위해 LingBot-VA 2.0을 공개했습니다. 이 모델은 기존 영상 생성 모델을 변형한 방식이 아니라, 물리 AI(Physical AI)를 위해 처음부터 설계된 Causal Video-Action Foundation Model이라는 점이 가장 큰 특징입니다.
이번 글에서는 LingBot-VA 2.0이 기존 접근 방식과 어떻게 다른지, 핵심 기술은 무엇인지, 그리고 실제 로봇 제어 환경에서 어떤 장점을 제공하는지 살펴보겠습니다.
LingBot-VA 2.0이란?
LingBot-VA 2.0은 일반적인 로봇 조작(Generalist Robot Manipulation)을 위한 비디오-액션 파운데이션 모델입니다.
기존 로봇 AI는 대부분 영상 생성 모델(Video Generation Model)을 기반으로 일부 기능만 추가하는 방식으로 개발되었습니다. 하지만 이러한 구조는 디지털 콘텐츠 생성에는 적합하지만 실제 물리 환경에서 동작하는 로봇에게는 여러 제약이 존재합니다.
LingBot-VA 2.0은 이러한 기존 방식을 벗어나 전체 모델 구조를 로봇 제어에 최적화하여 사전 학습(Pretraining) 했습니다.
핵심 목표는 다음과 같습니다.
- 영상과 행동을 하나의 통합된 표현 공간에서 학습
- 실시간 로봇 제어를 위한 인과적(Causal) 구조 적용
- 장시간 작업을 위한 계층적 계획(Hierarchical Planning) 지원
- 예측과 실행을 동시에 수행하는 비동기 제어 구현
기존 Video-Action 모델의 한계
기존 Video-Action 모델은 일반적으로 다음 두 가지 요소를 기반으로 구성됩니다.
- 영상 압축을 위한 VAE
- 양방향(Video Diffusion) 기반 백본
하지만 이러한 구조에는 다음과 같은 문제가 존재합니다.
1. 물리 정보를 충분히 표현하지 못함
기존 VAE는 영상의 외형을 잘 복원하는 데 초점을 맞추고 있습니다.
반면 실제 로봇은 다음과 같은 정보를 이해해야 합니다.
- 물체의 이동
- 힘의 전달
- 상태 변화
- 행동에 따른 결과
단순한 픽셀 정보만으로는 이러한 물리적 특성을 충분히 표현하기 어렵습니다.
2. 추론 속도가 느림
Diffusion 기반 모델은 반복적인 노이즈 제거 과정을 수행합니다.
이 과정은 고품질 영상을 생성하는 데는 적합하지만, 실시간으로 동작해야 하는 로봇 제어에는 속도가 충분하지 않습니다.
3. 행동(Action)에 대한 학습 부족
기존 영상 생성 모델은 "다음 프레임"을 예측하는 것이 목적입니다.
반면 로봇은
어떤 행동이 환경을 어떻게 변화시키는가
를 학습해야 합니다.
즉, 영상 생성과 로봇 제어는 근본적인 학습 목표가 다릅니다.
4. 시간 흐름과 맞지 않는 구조
기존 모델은 양방향(Bidirectional) Attention을 사용합니다.
하지만 실제 로봇은
현재 → 미래
순서로만 행동할 수 있습니다.
LingBot-VA 2.0은 이러한 특성을 반영하여 Causal DiT(Causal Diffusion Transformer) 구조를 처음부터 적용했습니다.
Semantic Visual-Action Tokenizer
LingBot-VA 2.0의 첫 번째 핵심 기술은 새로운 Tokenizer입니다.
기존 VAE 대신 Semantic Visual-Action Tokenizer를 사용하여 영상과 행동을 하나의 잠재 공간(Latent Space)에 표현합니다.
기존 방식은 영상 압축만 수행했다면, 새로운 Tokenizer는 추가적으로 다음을 학습합니다.
- 시각 의미(Semantic Alignment)
- 행동 정보(Latent Action)
- 상태 변화(Dynamics)
이를 위해 다음 모델이 함께 사용됩니다.
- Inverse Dynamics Model
- Forward Dynamics Model
결과적으로
- 현재 상태
- 행동
- 다음 상태
모두 동일한 Latent Space 안에서 표현됩니다.
이를 통해 웹에 존재하는 일반적인 영상 데이터도 행동 학습에 활용할 수 있게 됩니다.
Causal DiT와 Sparse MoE 구조
Tokenizer 위에는 새롭게 설계된 Causal DiT가 위치합니다.
이 구조는 두 개의 Expert가 함께 동작합니다.
- Video Expert
- Action Expert
두 Expert는 동일한 Self-Attention을 공유하지만, 각각 독립적인 Feed Forward Network를 사용합니다.
특히 Video Expert에는 Sparse Mixture of Experts(MoE) 구조가 적용되었습니다.
주요 특징은 다음과 같습니다.
- 128개의 Expert
- Top-8 Routing
- SwiGLU Expert
- Sparse Activation
전체 모델은 약 153억 개의 파라미터를 가지지만,
추론 시에는 약 25억 개의 파라미터만 활성화됩니다.
즉, 모델 규모는 매우 크지만 실제 연산량은 크게 줄일 수 있습니다.
Multi-Chunk Prediction(MCP)
일반적인 Teacher Forcing 방식은 다음 단계만 예측하도록 학습합니다.
이 경우 모델은 단순히 현재 화면을 복사하는 방향으로 학습될 가능성이 있습니다.
LingBot-VA 2.0은 이를 해결하기 위해 Multi-Chunk Prediction(MCP)을 적용했습니다.
MCP는
- 다음 Chunk
- 그다음 Chunk
- 이후 Chunk
까지 동시에 예측하도록 학습합니다.
실험 결과
기존 모델이 45,000 Step에서 달성한 성능을
약 20,000 Step 만에 달성하여
약 2.3배 빠른 학습 속도를 기록했습니다.
Hierarchical Planning
복잡한 작업은 단순한 저수준 제어만으로 수행하기 어렵습니다.
LingBot-VA 2.0은 상위 계획을 담당하는 Vision Language Model(VLM) Planner를 별도로 사용합니다.
Planner는 약 2Hz로 동작하며 다음과 같은 JSON 형태의 정보를 생성합니다.
- 작업 완료 여부
- 현재 수행할 작업
- 생성 명령
- 주변 환경 설명
정책 모델은 이를 참조하여 각 Chunk 단위의 행동을 생성합니다.
이를 통해 긴 작업도 안정적으로 수행할 수 있습니다.
Foresight Reasoning
LingBot-VA 2.0에서 가장 주목할 만한 기술 중 하나는 Foresight Reasoning입니다.
기존 방식에서는
행동 수행 → 결과 확인 → 다음 행동 생성
순서로 진행됩니다.
LingBot-VA 2.0은
행동을 수행하는 동안
동시에 다음 상태를 미리 예측합니다.
즉,
- 현재 행동 실행
- 다음 상태 예측
- 다음 행동 생성
이 모두 병렬로 수행됩니다.
실제 관측값이 들어오면 예측 결과를 실제 값으로 교체(Re-grounding)하여 누적 오차를 최소화합니다.
이 구조는 로봇 제어 지연 시간을 크게 줄이는 핵심 기술입니다.
성능 비교
RoboTwin 2.0 벤치마크에서 LingBot-VA 2.0은 이전 모델 대비 가장 높은 성능을 기록했습니다.
| 모델 | 평균 성능 |
| X-VLA | 72.9 |
| π0.5 | 79.8 |
| Motus | 87.9 |
| LingBot-VA | 92.2 |
| LingBot-VA 2.0 | 93.6 |
또한 추론 속도 역시 크게 개선되었습니다.
| 단계 | Chunk 지연 시간 |
| 기본 모델 | 927 ms |
| 최적화 이후 | 142 ms |
비동기 제어 성능은
- 35Hz → 225Hz
까지 향상되었습니다.
이는 약 6.5배 이상의 속도 개선에 해당합니다.
LingBot-VA 1.0과 2.0 비교
| 항목 | Version 1.0 | Version 2.0 |
| Tokenizer | VAE 기반 | Semantic Visual-Action Tokenizer |
| Backbone | Fine-tuning | 처음부터 Causal Pretraining |
| Video FFN | Dense | Sparse MoE |
| 추가 학습 | 없음 | MCP, In-context Learning, Human-Robot Co-training |
| 추론 | Async Execution | Foresight Reasoning |
| 최고 제어 속도 | 미공개 | 225Hz |
Version 2.0은 단순한 성능 개선이 아니라 모델 구조 전반을 새롭게 설계한 것이 가장 큰 차별점입니다.
실제 활용 사례
LingBot-VA 2.0은 다양한 로봇 작업에 활용될 수 있습니다.
적은 시연만으로 새로운 작업 학습
약 10~15회의 시연만으로 새로운 작업에 적응할 수 있으며, 실제 평가에서는 작업당 20개의 원격 조작 시연만으로 학습이 이루어졌습니다.
시연 기반 작업 수행
텍스트 명령 대신 사람이 수행한 시연 영상을 입력으로 사용할 수 있습니다.
예를 들어,
조롱박을 초록색 접시에 올려놓기
와 같은 작업을 시연 영상만으로 수행할 수 있습니다.
대규모 데이터 학습
사람의 손 움직임을 로봇 동작으로 변환하는 Human-Robot Co-training을 통해 약 6만 5천 개 이상의 에피소드를 학습 데이터로 활용했습니다.
동적인 환경 대응
Air Hockey나 컨베이어 벨트처럼 지속적으로 움직이는 환경에서도 다음 상황을 예측하며 실시간으로 대응할 수 있습니다.
핵심 특징 정리
LingBot-VA 2.0의 핵심 특징은 다음과 같습니다.
- 물리 AI를 위해 처음부터 설계된 Causal Video-Action 모델
- 영상과 행동을 하나의 잠재 공간으로 통합하는 Semantic Tokenizer
- Sparse MoE를 활용한 대규모 모델의 효율적인 추론
- Multi-Chunk Prediction을 통한 빠른 학습
- Hierarchical Planning 기반 장기 작업 수행
- Foresight Reasoning을 통한 예측과 실행의 병렬 처리
- 225Hz 수준의 고속 비동기 제어 지원
LingBot-VA 2.0은 기존의 영상 생성 기반 로봇 AI를 단순히 개선한 모델이 아니라, 물리 AI를 위한 전용 파운데이션 모델이라는 점에서 의미가 큽니다.
특히 Semantic Visual-Action Tokenizer, Causal DiT, Sparse MoE, Multi-Chunk Prediction, Hierarchical Planning, Foresight Reasoning과 같은 기술을 통합하여 로봇이 환경을 이해하고 행동을 계획하며 실시간으로 제어하는 전 과정을 하나의 프레임워크로 구현했습니다.
또한 성능과 추론 속도 모두에서 이전 버전을 크게 뛰어넘으며, 실제 로봇 환경에서도 높은 수준의 일반화 능력과 실시간 제어 성능을 보여주었습니다. 이러한 접근 방식은 앞으로 범용 로봇(Generalist Robot)과 Physical AI 기술 발전에 중요한 기반이 될 것으로 기대됩니다.
https://www.marktechpost.com/2026/07/11/ant-groups-robbyant-unveils-lingbot-va-2-0/
Ant Group's Robbyant Unveils LingBot-VA 2.0: A Causal Video-Action Model Built Natively for Physical AI
Robbyant's LingBot-VA 2.0 is a Physical AI model that predicts ahead with Foresight Reasoning and acts in real time
www.marktechpost.com

'인공지능' 카테고리의 다른 글
| AI 시대의 새로운 병목, 코드가 아니라 인간의 이해다 (0) | 2026.07.16 |
|---|---|
| AI는 이제 언어가 아닌 이미지를 이해한다? Elorian AI가 제시하는 차세대 AI 모델 (0) | 2026.07.16 |
| GPT-5.6, Grok 4.5, Claude, Muse Spark 앱 생성 성능 비교, 어떤 AI 모델을 선택해야 할까? (0) | 2026.07.13 |
| Git 함수 단위 변경 추적을 지원하는 시맨틱 버전 관리 도구 sem 완벽 정리 (0) | 2026.07.13 |
| 인간 중심 AI를 위한 새로운 접근, Thinking Machines Lab의 분산형 AI와 커스터마이징 모델 전략 (0) | 2026.07.13 |