
전신 제어부터 다중 로봇 협업까지, Gemini Robotics 2가 바꾸는 로봇 기술
Google DeepMind가 새로운 로봇 AI 모델군인 Gemini Robotics 2를 공개했습니다. 이번 모델은 단순히 로봇 팔을 움직이는 수준을 넘어, 시각과 언어 정보를 이해하고 이를 실제 움직임으로 연결해 휴머노이드의 전신을 제어할 수 있도록 설계된 것이 특징입니다.
또한 장시간 이어지는 복잡한 작업을 계획하는 AI, 인터넷 연결 없이 로컬에서 실행되는 경량 모델까지 함께 공개하며 다양한 로봇 환경에 대응할 수 있는 생태계를 제시했습니다.
이번 글에서는 Gemini Robotics 2가 어떤 기술인지, 기존 로봇과 무엇이 달라졌는지, 그리고 각 모델의 역할과 특징을 중심으로 살펴보겠습니다.
기존 로봇의 한계
기존 산업용 로봇은 대부분 특정 작업을 반복 수행하도록 미리 프로그래밍되어 있습니다. 따라서 다음과 같은 한계가 존재했습니다.
- 정해진 작업 순서 외의 상황에 대응하기 어려움
- 예상하지 못한 환경 변화에 적응하기 어려움
- 한 로봇에서 학습한 기술을 다른 형태의 로봇으로 이전하기 어려움
- 대부분 원격 제어나 사전 정의된 작업에 의존
이러한 문제를 해결하기 위해 Google DeepMind는 로봇이 스스로 주변 환경을 이해하고 판단하며 행동할 수 있도록 Gemini Robotics 2 모델군을 공개했습니다.
Gemini Robotics 2 모델군 구성
Gemini Robotics 2는 하나의 모델이 아니라 서로 다른 역할을 수행하는 세 가지 모델로 구성됩니다.
1. Gemini Robotics 2
Gemini Robotics 2는 비전-언어-행동(Vision-Language-Action, VLA) 모델입니다.
카메라로 인식한 정보와 사용자의 자연어 명령을 실제 모터 제어 명령으로 변환하여 로봇을 움직입니다.
주요 특징은 다음과 같습니다.
- 휴머노이드 전신 제어
- 양팔 로봇 제어
- 손과 그리퍼를 이용한 정교한 작업 수행
- 시각 정보와 언어 명령을 동시에 이해
즉, 사람이 "물뿌리개를 아래 선반의 초록색 상자에 넣어"라고 말하면 단순히 물건만 집는 것이 아니라,
- 목적지를 이해하고
- 걸어가며
- 균형을 유지하고
- 물건을 집은 뒤
- 지정된 위치까지 이동하여
- 정확하게 내려놓는 일련의 동작을 수행합니다.
2. Gemini Robotics ER 2
Gemini Robotics ER 2는 로봇의 고수준 의사결정 AI 역할을 수행하는 체화 추론(Embodied Reasoning) 모델입니다.
주요 역할은 다음과 같습니다.
- 사람과 자연스럽게 소통
- 물리 환경 이해
- 장시간 작업 계획
- 다단계 작업 관리
- 여러 로봇의 협업 조율
특히 수분 동안 이어지는 복잡한 작업을 계획하고 실행 상태를 지속적으로 확인할 수 있습니다.
또한 작업 도중 문제가 발생하면 스스로 수정하면서 목표를 달성하도록 설계되었습니다.
예를 들어,
- 공간을 분석하고
- 필요한 작업 순서를 계획하며
- 실제 동작은 VLA 모델에게 전달하고
- 완료 여부를 지속적으로 확인하는 방식으로 동작합니다.
3. Gemini Robotics On-Device 2
Gemini Robotics On-Device 2는 로봇 내부에서 직접 실행되는 경량 VLA 모델입니다.
인터넷 연결 없이 동작하도록 최적화되어 있으며 다음과 같은 특징을 제공합니다.
- 로컬 실행
- 네트워크 지연 없음
- 새로운 로봇 형태에 빠른 적응
- 적은 학습 데이터로 활용 가능
Google DeepMind에 따르면 일반적으로 200개 미만의 사례와 몇 시간의 적응 과정만으로 새로운 양팔 로봇에 적용할 수 있습니다.
또한 형태, 센서 구성, 자유도가 크게 다른 다양한 로봇 플랫폼에도 적용할 수 있도록 설계되었습니다.
휴머노이드 전신 제어의 진화
이전 세대 모델은 주로 상체와 팔을 움직이는 작업에 집중했습니다.
Gemini Robotics 2는 이를 넘어 휴머노이드 전체를 제어합니다.
대표적으로 다음과 같은 동작을 하나의 작업으로 연결합니다.
- 걷기
- 방향 전환
- 몸 굽히기
- 균형 유지
- 물체 집기
- 이동
- 정확한 위치에 배치
예를 들어 Apptronik Apollo 2에서는 물뿌리개를 집은 뒤 선반까지 이동하여 지정된 상자 안에 넣는 작업을 수행할 수 있습니다.
다만 Google DeepMind는 현재 이동 속도와 정밀도는 앞으로 추가 개선이 필요한 부분이라고 설명했습니다.
사람 손에 가까운 정교한 조작
Gemini Robotics 2는 단순히 로봇 팔을 움직이는 수준을 넘어 손가락까지 정밀하게 제어합니다.
예를 들어 Apollo 2에 장착된 SharpaWave 손은
- 22개의 자유도
- 다섯 손가락
를 활용하여 다음과 같은 작업을 수행할 수 있습니다.
- 매듭 묶기
- 지퍼백 밀봉
- 섬세한 물체 조작
또한 Franka Duo와 같은 2지 평행 그리퍼에서도 복잡한 포장 작업을 수행할 수 있습니다.
Google DeepMind는 사람 수준의 손재주를 구현하기 위해서는 속도와 정밀도를 지속적으로 향상시켜야 한다고 밝혔습니다.
장시간 작업과 다중 로봇 협업
Gemini Robotics ER 2의 가장 큰 특징 중 하나는 장시간 이어지는 복잡한 작업을 관리할 수 있다는 점입니다.
기존 로봇은 작업이 길어질수록 오류가 누적되는 경우가 많았습니다.
반면 ER 2는
- 작업 시작
- 현재 진행 상황
- 완료 여부
- 핵심 이벤트
등을 지속적으로 추적하면서 작업을 수행합니다.
또한 여러 종류의 로봇이 서로 역할을 나누어 협업할 수 있도록 지원합니다.
이를 통해 하나의 로봇으로 수행하기 어려운 복잡한 작업도 여러 로봇이 함께 처리할 수 있습니다.
새로운 로봇에도 빠르게 적용
로봇마다 구조는 크게 다릅니다.
- 관절 개수
- 센서
- 크기
- 자유도
등이 모두 다르기 때문에 기존에는 새로운 로봇마다 별도의 학습 과정이 필요했습니다.
Gemini Robotics On-Device 2는 이러한 문제를 줄이기 위해 적은 데이터만으로 새로운 로봇에 적응하도록 설계되었습니다.
Google DeepMind는 Dexmate, SO101, Trossen 플랫폼 등 서로 다른 형태의 로봇에서도 다양한 작업을 수행할 수 있다고 설명했습니다.
안전성을 고려한 다층 AI 구조
로봇의 자율성이 높아질수록 안전성 역시 중요한 요소입니다.
Gemini Robotics 2는 전통적인 물리 안전 장치와 AI 기반 안전 프레임워크를 함께 적용하는 다층 안전 접근 방식을 채택했습니다.
이를 위해 ASIMOV-Agentic이라는 새로운 안전 벤치마크를 활용합니다.
주요 평가 항목은 다음과 같습니다.
- 안전하지 않은 작업 요청 거부
- 작업 수행 가능성 예측
- 불확실한 상황에서 사람에게 도움 요청
- 안전 제약 준수 여부
Gemini Robotics ER 2는 Google DeepMind의 기존 로봇 모델 가운데 가장 높은 수준의 안전 성능을 보였다고 소개되었습니다.
특히
- 사람을 더욱 정확하게 감지하고
- 사람이 가까워질 경우 안전 기능을 호출하며
- 필요 시 로봇을 안전하게 정지시키는 기능
등을 지원해 사람과 함께 작업하는 환경을 고려한 설계가 적용됐습니다.
간단한 활용 예시
Gemini Robotics 2는 하나의 자연어 명령을 실제 작업으로 연결하는 구조를 제공합니다.
예를 들어 다음과 같은 명령이 입력되었다고 가정해 보겠습니다.
사용자 명령
"물뿌리개를 아래 선반의 초록색 상자에 넣어."
로봇은 다음과 같은 과정을 수행합니다.
- 사용자의 자연어 명령을 이해합니다.
- 카메라를 통해 물뿌리개의 위치를 인식합니다.
- 목적지인 초록색 상자를 찾습니다.
- 물뿌리개를 집습니다.
- 선반까지 이동합니다.
- 지정된 위치에 정확히 배치합니다.
- 작업 완료 여부를 확인합니다.
이처럼 하나의 명령을 여러 단계의 행동으로 계획하고 실행하는 것이 Gemini Robotics 2의 핵심 특징입니다.
Gemini Robotics 2는 로봇이 단순한 반복 작업을 수행하는 수준을 넘어, 주변 환경을 이해하고 스스로 판단하며 행동할 수 있도록 설계된 새로운 로봇 AI 모델군입니다.
특히 전신 제어를 담당하는 VLA 모델, 장기적인 작업을 계획하는 ER 모델, 그리고 인터넷 연결 없이 실행되는 On-Device 모델을 함께 제공함으로써 다양한 로봇 활용 환경을 지원하는 구조를 제시했습니다.
또한 정교한 손동작, 장시간 작업 수행, 다중 로봇 협업, 새로운 로봇으로의 빠른 적응, 그리고 안전성을 고려한 AI 프레임워크까지 포함하면서 범용 물리 AI를 향한 방향성을 보여주고 있습니다.
다만 Google DeepMind는 이동 속도와 정밀도는 아직 개선이 필요한 영역이라고 설명하고 있으며, 앞으로 이러한 기술이 얼마나 빠르게 발전하고 실제 산업 현장에 적용될지 주목할 필요가 있습니다.
https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
Gemini Robotics 2 brings whole body intelligence to robots
From feet to fingertips — we are teaching robots intelligent whole-body control, fine dexterity, and teamwork to complete a broad range of complex tasks.
deepmind.google

'인공지능' 카테고리의 다른 글
| Kimi K3 아키텍처 완전 분석 : 1M 토큰을 구현한 KDA, MoE, FlashKDA 그리고 AgentENV의 핵심 기술 (0) | 2026.07.31 |
|---|---|
| Openship란? 오픈소스 셀프 호스팅 CI/CD 배포 플랫폼의 특징과 동작 방식 (0) | 2026.07.31 |
| LG K-엑사원 2.0 공개, 국내 최대 7500억 매개변수 AI 모델의 성능과 특징 (0) | 2026.07.31 |
| AngelSpec v0.1.0: Speculative Decoding 초안(Draft) 모델 학습 프레임워크 완벽 정리 (0) | 2026.07.30 |
| SANA 완전 정리: 고해상도 이미지·비디오 생성을 위한 오픈소스 AI 프레임워크 (0) | 2026.07.30 |