본문 바로가기

인공지능

Gemini 3.6 Flash와 3.5 Flash-Lite 공개, 기업 AI 에이전트 비용과 성능을 동시에 개선하는 전략

728x90
반응형
728x170

AI 에이전트 운영 비용을 줄이기 위한 Google의 새로운 Gemini 전략

기업 환경에서 AI 에이전트를 운영할 때 가장 중요한 요소 중 하나는 성능과 비용의 균형입니다. AI 모델이 복잡한 작업을 정확하게 수행하는 것도 중요하지만, 작업 과정에서 생성되는 토큰(Token)이 많아질수록 비용과 응답 시간이 함께 증가하기 때문입니다.

Google은 이러한 문제를 해결하기 위해 Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, 그리고 보안 분야에 특화된 Gemini 3.5 Flash Cyber를 새롭게 발표했습니다.

이번 발표는 단순히 모델 성능을 높이는 것에 그치지 않고, 기업이 대규모 AI 에이전트를 운영할 때 발생하는 토큰 비용과 처리 속도까지 함께 고려한 것이 특징입니다. 이번 글에서는 각 모델의 특징과 성능, 활용 사례, 그리고 기업 환경에서 어떤 의미를 가지는지 살펴보겠습니다.

반응형

기업 AI 에이전트에서 토큰 비용이 중요한 이유

AI 에이전트는 단순한 챗봇과 달리 여러 단계를 거쳐 문제를 해결합니다.

예를 들어 하나의 업무를 수행하기 위해

  • 문서를 읽고
  • 필요한 정보를 추출하고
  • 데이터를 분석하며
  • 최종 보고서를 작성하는

과정을 반복하게 됩니다.

이 과정에서 생성되는 출력 토큰(Output Token)이 많을수록

  • API 비용 증가
  • 응답 지연
  • 대규모 운영 시 인프라 비용 증가

라는 문제가 발생합니다.

특히 기업에서는 이러한 작업이 시간당 수천 번 이상 실행될 수 있기 때문에, 토큰 사용량 감소는 곧 운영 비용 절감으로 이어지는 핵심 요소입니다.


Gemini 3.6 Flash의 핵심 특징

Google은 Gemini 3.6 Flash를 코딩과 멀티모달 추론을 위한 고성능 모델로 소개했습니다.

가장 눈에 띄는 변화는 출력 토큰 수가 이전 Gemini 3.5 Flash 대비 평균 17% 감소했다는 점입니다.

일부 테스트에서는 최대 65%까지 토큰 사용량이 감소한 것으로 보고되었습니다.

이는 동일한 작업을 수행하면서도

  • 더 적은 토큰을 생성하고
  • 더 낮은 비용으로
  • 더욱 빠르게 처리할 수 있다는 의미입니다.

가격

  • 입력 토큰 : 100만 개당 1.50달러
  • 출력 토큰 : 100만 개당 7.50달러

Google은 이러한 가격 정책을 지속적으로 실행되는 AI 에이전트 환경에 적합하도록 설계했다고 설명했습니다.


Gemini 3.6 Flash 성능 향상

Google은 여러 벤치마크 결과를 함께 공개했습니다.

DeepSWE

코드 생성 및 수정 성능을 평가하는 테스트에서

  • Gemini 3.6 Flash : 49%
  • Gemini 3.5 Flash : 37%

의 성공률을 기록했습니다.


MLE Bench

머신러닝 관련 문제 해결 능력을 평가하는 벤치마크에서는

  • 기존 모델 : 49.7%
  • Gemini 3.6 Flash : 63.9%

로 성능이 향상되었습니다.


GDPval-AA v2

실제 업무 환경과 유사한 지식 기반 작업을 평가하는 테스트에서는

  • 기존 모델 : 1349점
  • Gemini 3.6 Flash : 1421점

을 기록하며 향상된 성능을 보여주었습니다.


실제 기업에서는 어떻게 활용되고 있을까

Google은 이미 여러 기업이 Gemini 3.6 Flash를 활용하고 있다고 소개했습니다.

Figma

Figma는 프로토타입 제작 과정에 Gemini 3.6 Flash를 적용했습니다.

개발자는 디자인 반복 작업을 더욱 빠르게 수행할 수 있었으며, 결과물의 품질은 유지하면서 개발 속도를 높일 수 있었다고 설명했습니다.


Harvey

법률 AI 플랫폼 Harvey는

  • 법률 문서
  • 재무 문서
  • 보고서 초안 작성

등 다양한 문서를 분석하는 작업에 Gemini 3.6 Flash를 활용하고 있습니다.


Hebbia

Hebbia는

  • 금융 보고서 분석
  • 문서 구조 파악
  • 차트 해석
  • 보고서 생성

등 멀티모달 문서 처리 작업에 해당 모델을 적용하고 있습니다.


Gemini API에 추가된 Computer Use 기능

Google은 Gemini API와 Gemini Enterprise 플랫폼에 컴퓨터 사용 기능(Computer Use Tool)도 함께 통합했습니다.

기존에는 AI가 운영체제를 제어하기 위해 별도의 중간 프로그램이 필요했지만, 이제는 API 자체에서 이러한 기능을 지원합니다.

또한 OSWorld-Verified 평가에서는

  • 기존 : 78.4%
  • 개선 후 : 83.0%

의 성능을 기록했습니다.

Google은 화학, 생물학, 방사선, 핵 관련 악용을 방지하기 위한 안전장치도 강화했으며, 정상적인 요청에 대한 응답 거부율은 증가하지 않았다고 밝혔습니다.


Gemini 3.5 Flash-Lite, 대규모 작업을 위한 초고속 모델

Gemini 3.5 Flash-Lite는 복잡한 추론보다는

  • 문서 처리
  • 검색
  • 반복적인 AI 에이전트 작업

등을 빠르게 처리하는 데 초점을 맞춘 모델입니다.

Google에 따르면 Artificial Analysis Index 기준으로

초당 350개의 출력 토큰을 생성하며 3.5 시리즈 중 가장 빠른 모델입니다.


가격 경쟁력

Gemini 3.5 Flash-Lite는 더욱 저렴한 비용으로 제공됩니다.

  • 입력 토큰 : 100만 개당 0.3달러
  • 출력 토큰 : 100만 개당 2.5달러

기업은 단순한 작업에는 Flash-Lite를 사용하고,

복잡한 다단계 추론에는 Gemini 3.6 Flash를 사용하는 방식으로 비용을 최적화할 수 있습니다.


Gemini 3.5 Flash-Lite 성능

Google이 공개한 장문 컨텍스트 테스트(GDM-MRCR v2)에서는

  • 기존 모델 : 60.1%
  • Flash-Lite : 72.2%

를 기록했습니다.

GDPval-AA v2 테스트 역시

  • 기존 : 642점
  • Flash-Lite : 1140점

으로 크게 향상되었습니다.

또한 Gemini 3.6 Flash와 동일한 Computer Use 기능도 함께 제공합니다.


Gemini 3.5 Flash Cyber, 보안 취약점 대응 전용 모델

Google은 보안 분야를 위해 Gemini 3.5 Flash Cyber도 공개했습니다.

이 모델은

  • 코드 취약점 검증
  • 보안 취약점 수정
  • 패치 생성

등을 수행하도록 설계되었습니다.

Google은 CyberGym 벤치마크에서 최상위 수준 모델과 경쟁 가능한 성능을 보였다고 설명했지만, 구체적인 수치는 공개하지 않았습니다.


제한된 환경에서만 제공되는 이유

Gemini 3.5 Flash Cyber는 일반 사용자에게 공개되지 않습니다.

현재는

  • 정부 기관
  • 검증된 파트너

에게만 파일럿 프로그램 형태로 제공됩니다.

Google은 악성 코드나 공격용 익스플로잇 생성에 악용되는 것을 방지하기 위한 안전 조치라고 설명했습니다.

또한 Google의 보안 에이전트인 CodeMender에서는 여러 개의 Flash Cyber 인스턴스가 동시에 실행되어 서로의 분석 결과를 교차 검증한 뒤, 최종 수정 보고서를 생성하고 사람이 이를 검토하는 구조를 사용합니다.


새로운 Gemini 모델은 어디에서 사용할 수 있을까

Google은 새롭게 공개한 모델들을 다음 환경에서 사용할 수 있도록 지원합니다.

  • Gemini API
  • Google AI Studio
  • Android Studio
  • Gemini Enterprise Agent Platform
  • Gemini 앱

또한 Gemini 3.5 Flash-Lite는 Google 검색에도 순차적으로 적용될 예정입니다.


728x90

이번 Google의 Gemini 3.6 Flash 및 3.5 Flash-Lite 출시는 단순한 모델 성능 향상이 아니라 기업 환경에서 AI 에이전트를 보다 경제적으로 운영하기 위한 전략에 초점을 맞추고 있습니다.

Gemini 3.6 Flash는 출력 토큰을 줄이면서도 코딩과 멀티모달 추론 성능을 높여 지속적으로 실행되는 AI 에이전트에 적합하도록 설계되었습니다. 반면 Gemini 3.5 Flash-Lite는 초고속 처리와 낮은 비용을 바탕으로 대량의 반복 작업을 수행하는 환경에 적합한 선택지를 제공합니다.

여기에 보안 취약점 분석을 위한 Gemini 3.5 Flash Cyber까지 추가되면서, Google은 일반 업무 자동화부터 보안까지 다양한 기업 AI 활용 시나리오를 지원하는 모델 라인업을 구축했습니다.

이번 발표는 AI 모델의 성능 경쟁을 넘어 운영 비용, 처리 속도, 안전성까지 함께 고려하는 기업 중심 AI 전략이 더욱 중요해지고 있음을 보여주는 사례라고 할 수 있습니다.

300x250

https://www.artificialintelligence-news.com/news/googles-gemini-3-6-flash-targets-enterprise-agent-token-costs/?fbclid=IwY2xjawTOmXlleHRuA2FlbQIxMQBzcnRjBmFwcF9pZBAyMjIwMzkxNzg4MjAwODkyAAEetSOcI24HuONOk1O2EMioU6A_qkslpFoCIw6dCiEjMTvXU6MwRjNmbrD4m98_aem_gOZRcUkSB5ic60D3rvevzA

 

Google's Gemini 3.6 Flash targets enterprise agent token costs

Google has released Gemini 3.6 Flash and 3.5 Flash-Lite as new workhorses designed to cut latency and token costs for enterprise AI agents.

www.artificialintelligence-news.com

728x90
반응형
그리드형