
AI 모델의 발전으로 이제는 데스크톱이나 로컬 환경에서도 비교적 큰 모델을 실행할 수 있는 단계에 이르고 있습니다. 이에 따라 중요한 질문도 달라지고 있습니다. 단순히 “로컬에서 AI 모델을 실행할 수 있는가?”가 아니라 “어떤 작업을 어떤 모델에 맡기는 것이 가장 효율적인가?”가 핵심이 되고 있습니다.
NVIDIA의 생성형 AI 소프트웨어 담당 수석 디렉터 Joey Conway는 이러한 변화에 대해 로컬·오픈 모델과 프론티어 모델을 함께 활용하는 방향을 제시합니다. 간단한 작업은 빠르고 비용이 낮은 로컬 모델이 처리하고, 복잡한 작업은 더 강력한 프론티어 모델이 담당하는 방식입니다.
이 과정에서 중요한 역할을 하는 것이 모델 라우팅입니다. 사용자의 요청을 분석해 비용, 처리 속도, 작업 특성 등에 따라 적절한 모델로 연결하는 것입니다.
결국 사용자는 하나의 AI 서비스를 이용하는 것처럼 느끼지만, 실제 시스템 내부에서는 여러 모델과 전문 에이전트가 각자의 역할에 따라 작업을 나눠 처리하는 구조입니다. NVIDIA가 설명하는 ‘System of Models’는 바로 이러한 AI 활용 방식을 의미합니다.
하나의 거대 AI 모델만 사용하는 방식에서 벗어나다
지금까지 AI를 생각할 때는 하나의 강력한 대규모 모델이 다양한 작업을 처리하는 모습을 떠올리기 쉽습니다.
하지만 모든 작업이 높은 수준의 추론 능력을 필요로 하는 것은 아닙니다.
예를 들어 매우 간단한 질문에 대해서도 가장 강력한 모델을 호출한다면 처리 과정이 불필요하게 복잡해질 수 있습니다. NVIDIA의 Joey Conway는 이러한 작업을 빠르게 처리할 수 있는 로컬 모델과 복잡한 문제를 해결하는 고성능 모델을 구분해 사용하는 방식을 설명합니다.
핵심은 모델의 크기나 성능만 보는 것이 아니라 작업에 맞는 모델을 선택하는 것입니다.
간단한 작업은 상대적으로 작은 로컬 모델에 맡기고, 높은 수준의 추론이나 더 넓은 범위의 문제 해결이 필요한 작업은 프론티어 모델에 전달하는 것입니다.
이렇게 하면 처리 결과의 품질을 유지하면서 비용과 처리 시간을 낮추는 방향을 기대할 수 있습니다.
‘System of Models’는 여러 전문 모델을 하나의 시스템으로 묶는 방식
NVIDIA가 설명하는 구조에서는 모든 작업을 하나의 모델이 처리하지 않습니다.
대신 특정 작업에 특화된 여러 모델과 에이전트가 각각의 역할을 맡습니다.
예를 들어 어떤 모델은 특정 업무에 특화되고, 다른 모델은 또 다른 작업을 담당하는 방식입니다. 각각의 모델이 반복적으로 특정 작업을 수행하면서 해당 작업에 더욱 적합한 형태로 활용될 수 있다는 관점입니다.
여기서 중요한 점은 사용자가 내부 구조를 일일이 알 필요가 없다는 것입니다.
사용자 입장에서는 하나의 AI 인터페이스를 사용하지만, 실제로는 그 뒤에서 여러 모델이 작업을 나눠 처리할 수 있습니다.
즉, 겉으로는 하나의 AI 서비스지만 내부적으로는 여러 전문 모델이 연결된 형태입니다.
이를 간단하게 표현하면 다음과 같습니다.
사용자 요청 → 작업 판단 → 적절한 모델 선택 → 결과 생성
여기서 ‘적절한 모델 선택’을 담당하는 과정이 바로 라우팅입니다.
핵심은 모델 라우팅, 어떤 작업을 어디에 맡길 것인가
여러 모델을 사용하는 시스템에서는 모델 자체만큼이나 어떤 요청을 어떤 모델로 보낼 것인지가 중요합니다.
간단한 요청까지 항상 가장 강력한 모델로 전달할 필요는 없습니다. 반대로 복잡한 문제를 상대적으로 작은 모델에 맡긴다면 원하는 결과를 얻기 어려울 수 있습니다.
따라서 요청의 특성에 따라 모델을 선택하는 라우팅 구조가 필요합니다.
NVIDIA의 설명에 따르면 라우터는 예산, 지연시간, 작업의 형태 등을 고려해 어떤 모델을 사용할지 결정할 수 있습니다.
예를 들어 빠른 응답이 중요한 간단한 작업이라면 로컬 모델을 선택할 수 있습니다. 반대로 더 넓은 범위의 문제를 처리하거나 높은 수준의 성능이 필요한 경우에는 클라우드의 프론티어 모델을 사용할 수 있습니다.
이러한 구조를 활용하면 AI 시스템이 모든 요청을 동일한 방식으로 처리하지 않고, 요청의 특성에 맞춰 자원을 배분하는 형태로 발전할 수 있습니다.
NVIDIA Dynamo가 담당하는 역할
NVIDIA가 현재 제공하는 역할 중 하나는 모델 선택 그 자체보다는 추론 서비스를 효율적으로 운영하는 영역에 있습니다.
원문에서 소개된 NVIDIA의 오픈소스 추론 서빙 소프트웨어 Dynamo는 각 요청을 최근 해당 요청을 처리했던 GPU로 연결하는 방식으로 설명됩니다.
즉, AI 모델을 실제 인프라에서 실행할 때 어떤 GPU에서 요청을 처리할지 관리하는 역할입니다.
어떤 모델이 특정 작업에 가장 적합한지를 판단하는 영역은 더 넓은 라우터 생태계가 담당할 수 있습니다.
결국 앞으로의 AI 시스템에서는 단순히 좋은 모델을 선택하는 것뿐 아니라 어떤 요청을 어떤 모델과 어떤 하드웨어에서 처리할지 결정하는 구조가 더욱 중요해질 수 있습니다.
오픈 모델은 모델 자체뿐 아니라 활용 방식도 중요하다
NVIDIA가 제시한 사례 중 하나는 LangChain과의 협업입니다.
원문에 따르면 LangChain의 Deep Agents harness는 NVIDIA의 Nemotron 3 Ultra를 기반으로 실행됐으며, 비즈니스 작업에서 최고 수준의 폐쇄형 모델과 비교해 최대 10배 낮은 비용으로 성능을 보였다는 NVIDIA 측 설명이 있습니다.
여기서 주목할 부분은 모델을 다시 학습시키지 않았다는 점입니다.
성능 향상은 모델 자체를 재학습하는 방식이 아니라 다음과 같은 요소를 조정하는 방식으로 이뤄졌습니다.
- 프롬프트
- 도구 설명
- 미들웨어
즉, 동일한 모델이라도 어떤 방식으로 에이전트 환경을 구성하고 어떤 도구와 연결하며 어떤 지침을 제공하느냐에 따라 활용 결과가 달라질 수 있다는 것입니다.
이는 오픈 모델을 바라보는 관점에서도 의미가 있습니다.
단순히 “어떤 모델의 성능이 더 높은가”만 비교하는 것이 아니라, 주어진 모델을 실제 업무에 맞게 어떻게 구성하고 활용할 것인가 역시 중요한 요소가 될 수 있기 때문입니다.
로컬 AI의 핵심 가치는 비용보다 데이터 통제
로컬에서 AI 모델을 실행하는 이유를 생각하면 먼저 비용을 떠올릴 수 있습니다.
기업이 직접 모델을 운영하면 외부 서비스에 요청을 보낼 때 발생하는 비용을 줄일 가능성이 있기 때문입니다.
하지만 NVIDIA의 Joey Conway가 강조하는 부분은 비용보다 통제권에 가깝습니다.
기업은 이미 자사의 데이터가 어디에 저장되는지, 어떤 정보를 외부 업체에 제공할지 결정하고 있습니다.
AI 역시 마찬가지입니다.
기업의 데이터와 지식재산권을 외부 AI 서비스에 전달하는 대신 데이터가 존재하는 내부 환경에서 AI를 실행할 수 있다면 기업은 데이터에 대한 통제력을 더욱 확보할 수 있습니다.
Conway가 설명하는 핵심적인 방향은 “AI를 데이터가 있는 곳으로 가져가는 것”입니다.
이는 단순히 로컬 AI를 사용한다는 의미를 넘어섭니다.
기업이 보유한 데이터와 업무 환경에 맞춰 AI를 직접 운영하고, 필요에 따라 오픈 모델을 조정해 사용할 수 있다는 의미입니다.
NVIDIA는 이를 회사에 소속된 직원에 비유합니다. 기업이 직접 활용하고 관리하는 AI 모델을 회사의 업무 환경에 맞는 하나의 구성원처럼 바라보는 것입니다.
로컬 모델과 프론티어 모델은 경쟁 관계가 아니다
그렇다면 모든 AI 모델을 로컬에서 실행하면 되는 것일까요?
원문이 제시하는 방향은 그렇지 않습니다.
로컬 모델과 프론티어 모델은 서로 대체하는 관계라기보다 각각 잘하는 영역이 다른 모델로 볼 수 있습니다.
로컬 모델은 빠른 처리와 데이터 통제 측면에서 활용할 수 있고, 더 복잡하고 폭넓은 문제를 해결해야 한다면 클라우드의 프론티어 모델을 사용할 수 있습니다.
결국 중요한 것은 어느 한쪽을 선택하는 것이 아닙니다.
작업의 특성에 따라 가장 적합한 모델을 선택하는 것입니다.
이러한 관점에서는 로컬 AI와 클라우드 AI를 다음과 같이 구분해 볼 수 있습니다.
구분로컬·오픈 모델프론티어 모델
| 주요 활용 방향 | 비교적 간단하거나 특정 목적의 작업 | 더 복잡하고 폭넓은 문제 |
| 실행 환경 | 로컬 또는 기업 내부 환경 | 클라우드 |
| 주요 특징 | 데이터 통제, 빠른 처리 | 높은 수준의 모델 성능 활용 |
| 시스템에서의 역할 | 효율적인 로컬 처리 | 더 높은 성능이 필요한 작업 처리 |
다만 이 표의 핵심은 특정 모델이 항상 하나의 역할만 수행한다는 뜻이 아닙니다.
실제 시스템에서는 라우팅을 통해 작업별로 적합한 모델을 선택하는 구조가 중요합니다.
로컬 AI를 가능하게 하는 NVIDIA의 하드웨어
로컬에서 대규모 모델을 실행하려면 충분한 하드웨어가 필요합니다.
원문에서는 NVIDIA의 DGX Spark가 이러한 로컬 AI 환경의 사례로 소개됩니다.
DGX Spark는 128GB 통합 메모리를 갖춘 Grace Blackwell 기반 시스템으로, 원문 기준 약 2000억 개 파라미터 규모까지의 모델을 로컬에서 처리할 수 있는 환경으로 설명됩니다.
이보다 더 큰 모델을 실행하기 위한 시스템으로는 DGX Station도 소개됩니다. DGX Station은 748GB RAM을 제공하는 더 크고 비싼 시스템입니다.
이러한 하드웨어가 중요한 이유는 로컬 AI의 실행 범위를 넓혀주기 때문입니다.
기업이나 개발자가 모델을 직접 실행할 수 있는 환경을 갖추면 데이터가 외부로 이동하는 것을 줄이면서 AI 시스템을 운영할 수 있습니다.
또한 로컬에서 실행하면 네트워크 지연에 대한 부담도 줄일 수 있습니다.
즉, 로컬 AI 환경에서는 단순히 모델을 실행할 수 있다는 것뿐만 아니라 데이터가 있는 곳에서 AI를 실행한다는 구조적 장점을 확보할 수 있습니다.
NemoClaw는 로컬 에이전트를 위한 보안 구조를 제공
AI 에이전트를 로컬 환경에서 실행하려면 모델을 구동하는 것만으로 끝나지 않습니다.
에이전트가 여러 도구와 작업을 수행할 수 있기 때문에 이를 안전하게 실행하기 위한 환경과 정책 관리도 필요합니다.
NVIDIA는 이를 위해 NemoClaw라는 레퍼런스 스택을 제공합니다.
원문에 따르면 NemoClaw는 OpenClaw와 같은 오픈 에이전트 하니스를 OpenShell이라는 샌드박스로 감싸고, 정책 제어 기능과 로컬 Nemotron 추론을 결합하는 구조입니다.
이를 통해 로컬에서 에이전트를 실행할 때 필요한 실행 환경과 정책 통제를 함께 구성할 수 있습니다.
결국 로컬 AI가 확산되기 위해서는 모델의 성능뿐 아니라 모델을 안전하게 실행하고 관리할 수 있는 환경 역시 중요하다는 점을 보여주는 부분입니다.
실제로는 이렇게 모델을 나눠 사용할 수 있다
‘System of Models’의 개념을 단순한 예시로 생각해보겠습니다.
사용자가 AI 시스템에 여러 요청을 보낸다고 가정합니다.
첫 번째 요청은 비교적 간단한 작업입니다. 이 경우 시스템은 로컬 모델로 요청을 처리할 수 있습니다.
두 번째 요청은 더 복잡한 문제입니다. 로컬 모델보다 더 강력한 추론 능력이 필요하다면 라우터가 이를 프론티어 모델로 전달할 수 있습니다.
사용자는 이 과정에서 모델을 직접 선택할 필요가 없습니다.
전체 과정은 하나의 AI 인터페이스를 통해 진행되지만 내부적으로는 요청에 따라 서로 다른 모델이 호출되는 것입니다.
이를 구조로 표현하면 다음과 같습니다.
사용자 → 하나의 AI 인터페이스 → 라우터 → 로컬 모델 또는 프론티어 모델 → 결과
여기에서 중요한 것은 ‘항상 로컬’ 또는 ‘항상 클라우드’가 아니라는 점입니다.
작업에 따라 모델을 선택하기 때문에 비용과 처리 시간, 데이터 통제와 모델 성능 사이에서 균형을 맞출 수 있습니다.
AI 시스템의 경쟁력은 모델 하나가 아니라 전체 구조로 이동한다
이번 NVIDIA의 관점에서 주목할 부분은 AI의 경쟁력이 반드시 하나의 거대한 모델에서만 결정되지 않는다는 것입니다.
앞으로는 여러 모델을 어떻게 조합하고, 어떤 작업을 어느 모델에 맡기며, 모델과 도구를 어떻게 연결하는지가 중요해질 수 있습니다.
여기에는 여러 요소가 함께 포함됩니다.
- 작업별 모델 선택
- 모델 라우팅
- 추론 인프라
- 에이전트 구성
- 프롬프트와 도구 설명
- 미들웨어
- 데이터 통제
- 로컬 및 클라우드 인프라
따라서 AI 시스템을 구축할 때도 “가장 강력한 모델 하나를 선택한다”는 접근에서 벗어나 여러 모델을 하나의 시스템으로 연결하는 방식을 고려할 필요가 있습니다.
로컬과 프론티어 모델을 함께 활용하는 AI 환경
NVIDIA가 제시하는 ‘System of Models’의 핵심은 단순합니다.
모든 작업을 하나의 모델로 처리하지 않는 것입니다.
빠르게 처리할 수 있는 작업은 로컬 모델에 맡기고, 더 복잡한 문제는 프론티어 모델을 활용합니다. 그 사이에서 라우터가 작업에 적합한 모델을 선택합니다.
이러한 방식은 비용과 처리 시간을 낮추는 방향으로 활용할 수 있을 뿐 아니라, 기업이 AI와 데이터를 직접 통제하는 데에도 의미가 있습니다.
특히 기업 환경에서는 AI를 데이터가 존재하는 곳에서 실행할 수 있다는 점이 중요합니다. 오픈 모델을 기업의 업무에 맞게 활용하고, 로컬 인프라와 에이전트 실행 환경을 구성한다면 AI를 단순한 외부 서비스가 아니라 기업 환경에 맞춰 운영하는 시스템으로 바라볼 수 있습니다.
결국 로컬 모델과 프론티어 모델 중 하나를 선택하는 것이 핵심은 아닙니다.
간단한 작업에는 빠르고 효율적인 모델을, 복잡한 작업에는 더 강력한 모델을 사용하고, 이를 하나의 시스템으로 연결하는 것.
NVIDIA가 바라보는 ‘System of Models’는 이러한 모델 분업 구조를 통해 AI 활용 방식을 확장하려는 접근입니다.
앞으로 AI를 사용하는 방식도 가장 큰 모델 하나를 선택하는 것에서 벗어나, 어떤 작업에 어떤 모델을 배치하고 이를 어떻게 연결할 것인지를 고민하는 방향으로 변화할 가능성을 보여줍니다.
"We love the world where we can use both": How Nvidia thinks about local and frontier models
NVIDIA's Joey Conway on the rise of a 'system of models,' where small local models and frontier models split the work by cost, speed, and control.
thenewstack.io

'인공지능' 카테고리의 다른 글
| Seedance 2.5, 최대 30초 영상 생성부터 정밀 편집까지 지원하는 차세대 AI 영상 모델 (0) | 2026.08.03 |
|---|---|
| AI 에이전트의 인터넷 활용을 간소화하는 Agent Reach, 플랫폼별 접근 경로를 자동으로 연결하는 방법 (0) | 2026.08.03 |
| AI First 기업은 어떻게 일하는가? 0→1보다 1→2가 중요한 이유 (0) | 2026.08.03 |
| 8GB Mac에서 Gemma 4 26B를 약 2GB 메모리로 실행하는 TurboFieldfare (0) | 2026.08.03 |
| Qwen3.8-Max 공개, 2.4조 파라미터로 코딩부터 장기 자율 작업까지 확장된 AI 모델 (0) | 2026.08.03 |