AI의 다음 경쟁력은 '언어'가 아니라 '시각'일까?
지난 몇 년간 인공지능 기술은 대규모 언어 모델(LLM)을 중심으로 빠르게 발전해 왔습니다. 자연스러운 대화와 문서 작성, 프로그래밍까지 가능해지면서 많은 기업들이 더욱 크고 똑똑한 언어 모델 개발에 집중하고 있습니다.
하지만 모든 AI 연구자가 같은 방향을 바라보고 있는 것은 아닙니다. Google Brain과 DeepMind 출신 연구원인 Andrew Dai는 언어 중심 AI만으로는 범용 인공지능(AGI)에 도달하기 어렵다고 주장합니다. 그는 AI가 실제 세상을 이해하려면 사람처럼 이미지를 직접 이해하고 사고하는 능력이 반드시 필요하다고 보고 있습니다.
이번 글에서는 Andrew Dai가 설립한 Elorian AI가 기존 LLM과 어떤 점에서 다른 접근 방식을 선택했는지, 그리고 이미지 기반 추론이 앞으로 AI 발전에 어떤 변화를 가져올 수 있는지 살펴보겠습니다.
언어 중심 AI의 한계
현재 대부분의 생성형 AI는 텍스트를 기반으로 학습합니다. 이미지까지 처리하는 멀티모달 모델도 존재하지만, 실제 내부 동작 방식은 이미지 자체를 이해하는 것이 아니라 이미지를 문장으로 변환한 뒤 언어 모델이 이를 분석하는 방식에 가깝습니다.
예를 들어 엔진 설계도를 입력하면 모델은 먼저 설계도를 언어적으로 설명한 후, 그 설명을 바탕으로 구조나 문제점을 추론합니다.
이러한 방식은 다양한 작업을 수행할 수 있지만, 실제 공간이나 물리적 관계를 이해해야 하는 문제에서는 한계를 보일 수 있습니다.
Andrew Dai는 이러한 한계를 다음과 같이 설명합니다.
- 테이블 위 컵의 개수를 정확하게 세는 작업
- 물체 간의 거리와 위치 관계 판단
- 실제 공간에서의 이동 경로 계산
- 물리 법칙을 고려한 추론
이처럼 현실 세계를 이해해야 하는 문제에서는 단순한 언어 기반 추론만으로는 충분하지 않다는 것이 그의 주장입니다.
Elorian AI가 선택한 새로운 접근
Andrew Dai는 이러한 문제를 해결하기 위해 2026년 Elorian AI를 설립했습니다.
Elorian AI는 Google 출신 머신러닝 연구원 Yinfei Yang과 함께 개발되고 있으며, 기존 언어 모델과 달리 이미지 정보를 언어와 동일한 수준의 핵심 정보로 활용하는 AI 아키텍처를 구축하고 있습니다.
핵심 아이디어는 단순합니다.
기존 모델이 이미지를 텍스트로 바꾼 후 이해한다면, Elorian AI는 이미지를 그대로 이해하고 추론하는 것입니다.
즉, 이미지를 단순한 설명 문장으로 변환하지 않고, 내부적으로 공간 구조를 표현하는 시각적 표현(Visual Representation)을 생성해 사고하는 방식을 목표로 합니다.
사람처럼 3차원 공간을 이해하는 AI
Elorian AI가 지향하는 가장 큰 차별점은 3차원 공간 기반 사고입니다.
기존 멀티모달 모델은 이미지를 언어 토큰으로 변환하지만, Elorian AI는 이미지 내부 구조를 하나의 3D 공간처럼 표현하여 물체의 위치와 형태, 관계를 함께 이해하려고 합니다.
이를 통해 AI는 단순히 보이는 정보를 설명하는 수준을 넘어 다음과 같은 추론을 수행하는 것을 목표로 합니다.
- 물체 간의 공간적 관계 분석
- 입체적인 구조 이해
- 물리 법칙을 고려한 판단
- 복잡한 공간 문제 해결
- 내비게이션과 경로 탐색
이는 사람이 머릿속으로 공간을 상상하며 문제를 해결하는 방식과 유사한 접근이라고 볼 수 있습니다.
기존 멀티모달 AI와 무엇이 다를까?
현재의 멀티모달 AI 역시 이미지와 텍스트를 함께 처리할 수 있습니다.
하지만 Elorian AI는 이미지를 단순한 입력 데이터가 아니라 추론의 중심 요소로 활용한다는 점에서 차이가 있습니다.
| 기존 멀티모달 | AIElorian AI |
| 이미지를 텍스트로 변환 후 추론 | 이미지를 직접 표현하고 추론 |
| 언어 중심 구조 | 시각 정보와 언어를 동일하게 활용 |
| 텍스트 기반 의미 분석 | 공간 구조와 물리 관계까지 고려 |
| 언어 추론에 의존 | 시각적 사고 자체를 수행하는 구조 지향 |
이러한 접근은 특히 로봇공학, 자율주행, 공간 분석, 설계, 제조 등 실제 환경을 이해해야 하는 분야에서 새로운 가능성을 제시합니다.
AI 연구의 새로운 방향이 될 수 있을까?
현재 AI 산업은 더욱 큰 언어 모델을 만드는 경쟁을 이어가고 있습니다.
반면 Elorian AI는 모델의 크기보다 사고 방식 자체를 바꾸려는 시도를 하고 있습니다.
Andrew Dai는 언어만으로는 현실 세계를 충분히 이해하기 어렵다고 보고 있으며, 이미지와 공간 정보를 중심으로 사고하는 AI가 앞으로 중요한 연구 방향이 될 것으로 기대하고 있습니다.
물론 이러한 접근이 실제로 범용 인공지능으로 이어질지는 아직 검증되지 않았습니다. 하지만 기존 언어 중심 AI와는 다른 방향에서 문제를 해결하려는 새로운 시도라는 점에서 많은 관심을 받고 있습니다.
생성형 AI는 지금까지 언어를 중심으로 빠르게 발전해 왔습니다. 그러나 AI가 현실 세계를 더욱 정확하게 이해하기 위해서는 이미지와 공간 정보를 보다 깊이 활용해야 한다는 의견도 점차 힘을 얻고 있습니다.
Elorian AI는 이러한 관점에서 이미지를 직접 이해하고 추론하는 AI 모델을 개발하며 새로운 가능성을 제시하고 있습니다. 앞으로 이 접근 방식이 기존 LLM의 한계를 보완하고, 로봇공학이나 자율주행처럼 현실 세계와 밀접한 분야에서 어떤 성과를 만들어낼지 주목할 필요가 있습니다.

'인공지능' 카테고리의 다른 글
| Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8 비교: 성능, 가격, 벤치마크, 비용 효율까지 한눈에 (0) | 2026.07.16 |
|---|---|
| AI 시대의 새로운 병목, 코드가 아니라 인간의 이해다 (0) | 2026.07.16 |
| LingBot-VA 2.0: 물리 AI를 위해 처음부터 설계된 차세대 비디오-액션 파운데이션 모델 (0) | 2026.07.14 |
| GPT-5.6, Grok 4.5, Claude, Muse Spark 앱 생성 성능 비교, 어떤 AI 모델을 선택해야 할까? (0) | 2026.07.13 |
| Git 함수 단위 변경 추적을 지원하는 시맨틱 버전 관리 도구 sem 완벽 정리 (0) | 2026.07.13 |