본문 바로가기

인공지능

Qwen3.8 Max, Agentic Index 종합 1위… AI 모델 선택 기준이 지능에서 에이전트 성능으로 확대된다

728x90
반응형
728x170

AI 모델을 선택할 때 가장 먼저 확인하는 것은 보통 벤치마크 점수와 순위입니다. 하지만 실제 업무에 AI를 적용하려면 단순히 지능 점수가 높은 모델을 고르는 것만으로는 충분하지 않습니다. 도구를 얼마나 잘 사용하는지, 복잡한 작업을 어떻게 계획하고 수행하는지, 비용과 실행 시간은 어느 정도인지, API 제공 환경에서도 성능이 유지되는지까지 함께 살펴봐야 하기 때문입니다.

이러한 관점에서 주목할 만한 평가 결과가 공개됐습니다. Qwen3.8 Max가 Artificial Analysis의 Agentic Index에서 종합 1위를 기록했습니다. Agentic Index는 단순한 질문 답변 능력이 아니라 도구 사용, 계획, 자율성, 복합 문제 해결 등 에이전트 워크플로에서 중요한 능력을 평가하는 지표입니다.

이번 평가에서는 Agentic Index뿐 아니라 Intelligence Index, 비용, 실행 시간, 출력 토큰, 개방성, API 속도와 지연 시간, 제공자별 엔드포인트 정확도까지 다양한 지표가 함께 제시됩니다. 이를 통해 AI 모델을 선택할 때 단순한 순위보다 실제 사용 목적과 비용, 성능을 함께 비교해야 한다는 점을 확인할 수 있습니다.

반응형

Qwen3.8 Max가 Agentic Index 종합 1위를 기록한 이유

Qwen3.8 Max는 8월 5일 새로운 언어 모델 평가 대상으로 추가됐으며, Hacker News 제목 기준으로 Artificial Analysis Agentic Index 종합 1위에 올랐습니다.

Agentic Index는 AI 에이전트가 실제 작업을 수행하는 과정에서 필요한 능력을 측정합니다. 주요 평가 대상은 다음과 같습니다.

  • 도구 사용
  • 계획 수립
  • 자율성
  • 복합 문제 해결

즉, 단순히 질문을 받고 답변하는 모델의 능력보다는 여러 단계의 작업을 수행해야 하는 에이전트 환경에서 얼마나 효과적으로 기능하는지를 확인하는 평가입니다.

Agentic Index에는 총 24개 모델이 포함되며, 추론 모델은 별도로 구분됩니다. 또한 금융·회계, 전략·운영, 법률, 의료, 엔지니어링, 경제학 등 산업별 평가와 특정 역량을 측정하는 Capability Indices의 하나로 구성됩니다.

따라서 Qwen3.8 Max의 1위는 단순히 일반적인 언어 모델 성능이 높다는 의미를 넘어, 에이전트 형태의 작업에서 도구를 활용하고 복합적인 문제를 해결하는 능력이 높은 평가를 받았다는 점에서 의미가 있습니다.

Intelligence Index v4.1.1은 무엇을 평가할까?

Agentic Index와 별도로 Artificial Analysis는 Intelligence Index v4.1.1을 제공합니다.

Intelligence Index v4.1.1은 독립적으로 실행한 9개 평가를 결합해 모델의 지능을 비교합니다. 주요 평가 항목은 다음과 같습니다.

평가 주요 평가 영역
GDPval-AA v2 현실에서 경제적 가치가 있는 직무 과제
τ³-Banking 에이전트형 도구 사용
Terminal-Bench v2.1 에이전트형 코딩 및 터미널 사용
SciCode 코딩
Humanity's Last Exam 추론과 지식
GPQA Diamond 과학적 추론
CritPt 물리학 추론
AA-Omniscience 지식과 환각
AA-LCR 긴 문맥 추론

이처럼 하나의 평가만으로 모델의 능력을 판단하는 것이 아니라 서로 다른 영역의 평가를 결합합니다.

대시보드에서는 전체 595개 모델 가운데 선택된 26개 모델을 지능, 비용, 시간, 출력 토큰 기준으로 비교할 수 있습니다. 모델은 공개 가중치, 상업적 사용이 제한된 공개 가중치, 독점 모델로 구분되며 입력 유형과 국가별 필터도 제공됩니다.

여기서 주의할 점은 가중치가 공개됐다고 해서 반드시 자유롭게 상업적으로 사용할 수 있는 것은 아니라는 것입니다. 공개 가중치라도 상업적 이용에 유료 라이선스 등이 필요하다면 Commercial Use Restricted로 표시됩니다.

AI 모델은 지능 점수만으로 비교하기 어렵다

AI 모델을 실제 서비스나 업무에 적용할 때는 높은 지능 점수가 곧 최적의 선택을 의미하지 않습니다.

예를 들어 성능이 뛰어난 모델이라도 작업당 비용이 높거나 실행 시간이 길다면 대규모 업무 자동화에서는 부담이 될 수 있습니다. 반대로 지능 점수가 조금 낮더라도 비용과 속도 측면에서 유리하다면 특정 업무에는 더 적합할 수 있습니다.

Artificial Analysis는 이러한 비교를 위해 작업당 비용과 실행 시간, 출력 토큰 등을 함께 보여줍니다.

작업당 비용은 어떻게 계산할까?

작업당 비용은 평가에 사용된 입력, 캐시 적중, 캐시 쓰기, 추론, 답변 토큰 가격을 작업 수로 나눈 뒤 Intelligence Index의 가중치를 적용해 계산합니다.

비용 차트에서는 작업당 가중 평균 비용을 USD로 표시하며, 비용은 낮을수록 좋습니다.

또한 지능과 작업당 비용의 관계를 확인할 수 있도록 가장 매력적인 사분면과 Pareto 선도 표시합니다.

전체 Intelligence Index 실행 비용은 반복 실행을 제외하고 평가 과정에서 사용된 토큰 수와 입력·캐시·추론·답변 가격을 기준으로 계산합니다.

캐시 적중은 이미 처리된 프롬프트의 토큰에 적용되는 가격입니다. 일반 입력보다 보통 크게 할인되지만, 캐시 쓰기와 저장 비용은 별도로 청구되며 제공자마다 차이가 있습니다.

출력 토큰과 실행 시간도 중요한 기준

작업당 출력 토큰은 각 평가에서 생성된 출력 토큰 수에 상대 가중치를 적용하고 반복 실행을 제외한 작업 수로 나눠 계산합니다.

작업당 시간은 출력 토큰 수를 출력 속도로 나눈 뒤 각 벤치마크의 상대 가중치를 적용합니다. 다만 TTFT와 기타 오버헤드는 제외됩니다.

결국 모델 선택에서는 다음과 같은 질문을 함께 확인할 필요가 있습니다.

“가장 똑똑한 모델인가?”에서 끝나는 것이 아니라 “필요한 성능을 어느 정도의 비용과 시간으로 얻을 수 있는가?”까지 확인해야 하는 것입니다.

실제 업무에서는 용도별 평가가 더 중요할 수 있다

일반적인 Intelligence Index 외에도 다양한 업무와 에이전트 환경을 평가하는 독립 평가가 존재합니다.

주요 평가에는 다음과 같은 항목이 있습니다.

  • AA-Briefcase: 장기 지식 업무
  • AutomationBench-AA: 에이전트형 SaaS 워크플로
  • Harvey LAB-AA: 법률 에이전트 업무
  • EnterpriseOps-Gym-AA: 기업 운영
  • IFBench: 지시 준수
  • APEX-Agents-AA: 장기 에이전트 과제
  • ITBench-AA: Kubernetes 장애의 근본 원인 분석
  • MMMU-Pro: 시각적 추론

이러한 평가가 중요한 이유는 일반적인 지능이 모든 업무 성능을 동일하게 설명해주지는 않기 때문입니다.

예를 들어 기업 운영 자동화에 사용할 모델을 찾는다면 EnterpriseOps-Gym-AA와 같은 평가가 더 직접적인 참고 기준이 될 수 있습니다. Kubernetes 장애 분석이 목적이라면 ITBench-AA와 같은 평가가 더 관련성이 높을 수 있습니다.

따라서 모델을 선택할 때는 전체 순위를 먼저 확인하더라도 최종적으로는 실제 사용할 업무와 관련된 평가 결과를 함께 확인해야 합니다.

장기 지식 업무와 사실 신뢰성도 확인해야 한다

AI 모델이 실제 업무에 활용되면서 단순한 질문 답변뿐 아니라 문서와 프레젠테이션, 분석 결과물처럼 장시간에 걸쳐 만들어야 하는 결과물의 품질도 중요해지고 있습니다.

AA-Briefcase는 스프레드시트, 프레젠테이션, 메모와 같은 결과물을 요구하는 현실적인 비즈니스 워크플로에서 장기 지식 업무를 평가합니다.

AA-Briefcase Elo는 다음 요소를 결합합니다.

  • 루브릭 통과율
  • 분석 품질 Elo
  • 프레젠테이션 Elo

루브릭 성능은 합성 일대일 대결을 통해 Elo로 변환됩니다. Elo와 95% 신뢰구간 경계는 0 미만으로 내려가지 않도록 제한됩니다.

사실 신뢰성을 확인하는 AA-Omniscience Index도 있습니다.

이 지표는 정확한 답변에는 보상하고 환각에는 불이익을 주지만, 답변을 거부하는 것에는 불이익을 주지 않습니다. 점수 범위는 -100부터 100까지이며, 0은 정답과 오답 수가 같음을 의미합니다. 음수라면 오답이 정답보다 많다는 뜻입니다.

GDPval-AA v2는 다양한 직업에서 현실적이고 경제적 가치가 있는 과제를 평가하며, 인간 기준점은 Elo 1,000으로 고정됩니다.

이러한 평가는 AI 모델이 단순히 그럴듯한 답변을 생성하는 수준을 넘어 실제 업무 결과물을 얼마나 안정적으로 만들어내는지 살펴보는 데 활용할 수 있습니다.

코딩부터 이미지·영상·음성까지 평가 범위가 넓어진다

AI 모델의 활용 영역은 텍스트 생성에만 머물지 않습니다. Artificial Analysis는 코딩, 이미지, 영상, 음성 영역에 대한 평가도 제공합니다.

Coding Agent Index

Coding Agent Index는 종단 간 소프트웨어 엔지니어링 과제를 기준으로 성능, 비용, 실행 시간을 비교합니다.

DeepSWE, Terminal-Bench v2, SWE-Atlas-QnA의 pass@1 복합 평균을 사용하며, 총 52개 모델 가운데 선택된 15개 모델을 모델 또는 에이전트 기준으로 표시합니다.

이를 통해 코딩 모델을 평가할 때 단순히 코드 작성 능력만 보는 것이 아니라 실제 소프트웨어 엔지니어링 과제에서의 결과와 비용, 실행 시간을 함께 비교할 수 있습니다.

이미지·영상 평가

이미지와 영상 분야에서는 Image Arena와 Video Arena 결과를 제공하며 95% 신뢰구간도 함께 확인할 수 있습니다.

평가 유형은 다음처럼 구분됩니다.

  • 텍스트→이미지
  • 이미지 편집
  • 텍스트→영상
  • 이미지→영상
  • 영상 편집

텍스트→이미지의 경우 블라인드 선호 투표에서 얻은 Elo 점수를 사용합니다.

음성 평가

음성 영역에서는 다음과 같은 작업을 평가합니다.

  • 텍스트→음성
  • 음성→텍스트
  • 음성→음성

Speech Arena에서는 사용자 응답을 기반으로 상대적인 품질 Elo를 산출합니다. 충분한 표를 얻지 못한 모델은 표시되지 않을 수 있습니다.

모델의 개방성도 AI 선택 기준이 된다

AI 모델을 비교할 때 성능만큼 중요한 요소 중 하나가 모델의 개방성입니다.

Artificial Analysis Openness Index는 모델 구성 요소의 가용성과 투명성을 기준으로 개방성을 평가합니다.

주요 구성 요소는 다음과 같습니다.

  • 사전 학습 데이터 투명성
  • 사후 학습 데이터 투명성
  • 방법론 투명성
  • 모델 가용성

최대 점수는 18점이며 점수가 높을수록 더 개방적인 모델을 의미합니다.

또한 개방성 점수와 Intelligence Index의 관계도 비교할 수 있으며, 매력적인 사분면과 Pareto 선을 통해 두 요소의 관계를 살펴볼 수 있습니다.

따라서 모델을 선택할 때 단순히 “얼마나 똑똑한가?”만 확인하는 것이 아니라 “얼마나 투명하고 접근 가능한가?”까지 함께 살펴볼 수 있습니다.

API 속도와 지연 시간도 실제 서비스에서는 중요하다

모델의 성능이 아무리 높아도 응답이 지나치게 느리다면 실제 서비스에서 사용하기 어려울 수 있습니다.

Artificial Analysis는 API의 출력 속도와 지연 시간도 별도로 평가합니다.

출력 속도는 스트리밍을 지원하는 모델에서 첫 번째 API 청크를 받은 이후 생성되는 초당 출력 토큰 수로 측정합니다.

OpenAI의 o1처럼 자체 API가 있는 모델은 첫 번째 당사자 API 성능을 사용합니다. Meta의 Llama처럼 자체 API가 없는 모델은 여러 제공자의 중앙값을 적용합니다.

작업당 디코딩 시간은 출력 토큰 수와 출력 속도를 기반으로 계산하며, 낮을수록 좋습니다.

대시보드에서는 다음과 같은 관점으로 비교할 수 있습니다.

  • 지능 대비 속도
  • 시간 대비 비용
  • 종단 간 응답 시간

이러한 지표는 특히 실시간 응답이 필요한 서비스나 많은 작업을 반복 수행하는 환경에서 중요한 비교 기준이 될 수 있습니다.

같은 모델이라도 API 제공자에 따라 성능이 달라질 수 있다

AI 모델을 선택할 때 놓치기 쉬운 부분이 바로 API 제공자입니다.

같은 모델을 제공하더라도 실제 API 엔드포인트의 구성에 따라 정확도가 달라질 수 있습니다. 이를 확인하기 위해 Artificial Analysis는 Endpoint Accuracy Index를 제공합니다.

Endpoint Accuracy Index는 동일한 모델을 제공하는 각 API 엔드포인트가 기준 엔드포인트의 정확도를 얼마나 보존하는지를 측정합니다.

예를 들어 gpt-oss-120b(high)는 BFCL v4-500, HLE-250, AA-LCR-25를 결합해 17개 제공자를 비교합니다.

자체 호스팅 기준 엔드포인트가 존재하는 경우 해당 기준을 100으로 설정합니다.

  • 100: 기준 엔드포인트와 동일한 정확도
  • 낮은 점수: 기준 엔드포인트 대비 정확도 손실

성능이 낮아지는 이유로는 양자화, 기본 샘플링 설정 또는 기타 엔드포인트 구성 등이 있을 수 있습니다.

즉, 모델 이름이 같다고 해서 모든 API에서 동일한 결과가 나온다고 단정하기 어렵습니다.

따라서 실제 서비스에 사용할 API를 결정할 때는 모델 자체의 성능뿐 아니라 해당 제공자가 모델의 정확도를 얼마나 유지하는지도 확인할 필요가 있습니다.

Endpoint Accuracy Index는 특정 시점의 스냅샷이며, 측정 방식은 방법론에서 공개됩니다.

제공자 비교에서는 정확도뿐 아니라 다음 요소도 함께 확인할 수 있습니다.

  • 출력 속도
  • 혼합 토큰 가격
  • 캐시 가격
  • 입력 가격
  • 출력 가격
  • Pareto 선

특히 소규모 신흥 제공자도 높은 출력 속도와 경쟁력 있는 가격을 제공할 수 있기 때문에, 모델 자체의 순위만 보고 API 제공자를 결정하는 것보다 여러 지표를 함께 비교하는 것이 중요합니다.

AI 모델 선택의 기준은 ‘종합 1위’보다 ‘업무 적합성’이다

Qwen3.8 Max가 Artificial Analysis Agentic Index에서 종합 1위를 기록한 것은 에이전트 환경에서 주목할 만한 평가 결과입니다.

Agentic Index는 도구 사용, 계획, 자율성, 복합 문제 해결 등 실제 에이전트 워크플로와 관련된 능력을 평가하기 때문에, AI가 단순한 답변 생성 도구에서 복합적인 작업을 수행하는 형태로 발전하는 흐름을 보여주는 평가 기준으로 볼 수 있습니다.

하지만 Agentic Index 1위라는 결과만으로 모든 업무에서 해당 모델이 가장 적합하다고 판단해서는 안 됩니다.

AI 모델을 선택할 때는 다음과 같은 기준을 함께 살펴봐야 합니다.

첫째, 지능입니다.
여러 평가를 통해 일반적인 추론과 지식, 코딩, 과학적 추론, 긴 문맥 처리 등의 능력을 확인할 수 있습니다.

둘째, 실제 업무 성능입니다.
장기 지식 업무, 기업 운영, 법률, SaaS 워크플로, Kubernetes 장애 분석 등 실제 사용할 작업과 관련된 평가를 확인해야 합니다.

셋째, 비용입니다.
높은 성능을 제공하더라도 작업당 비용이 높다면 실제 운영 환경에서 부담이 될 수 있습니다.

넷째, 실행 시간과 출력 속도입니다.
작업 처리 속도와 API 응답 속도는 실제 서비스 경험에 직접적인 영향을 줄 수 있습니다.

다섯째, 개방성입니다.
모델의 데이터와 방법론, 가용성 등의 투명성을 함께 확인할 필요가 있습니다.

여섯째, API 엔드포인트 품질입니다.
같은 모델을 사용하더라도 제공자별 설정과 환경에 따라 정확도가 달라질 수 있으므로 실제 사용할 API의 성능을 별도로 확인해야 합니다.

결국 중요한 질문은 “어떤 AI 모델이 가장 높은 점수를 받았는가?”가 아니라 “내가 하려는 작업에 어떤 모델이 가장 적합한가?”입니다.

728x90

Artificial Analysis의 다양한 지표는 AI 모델을 단순한 순위표로 바라보는 방식에서 벗어나도록 합니다.

Qwen3.8 Max가 Agentic Index 종합 1위를 기록하면서 에이전트 환경에서의 도구 사용, 계획, 자율성, 복합 문제 해결 능력이 다시 주목받고 있습니다. 하지만 실제 모델 선택에서는 Agentic Index나 Intelligence Index의 순위 하나만으로 결론을 내리기 어렵습니다.

실제 업무에 적용하려면 지능과 함께 작업당 비용, 실행 시간, 출력 토큰, 개방성, API 속도, 엔드포인트 정확도 등을 함께 확인해야 합니다. 특히 일반적인 지능 평가보다 특정 업무에 직접 연결되는 평가가 더 중요한 경우도 있습니다.

앞으로 AI 모델을 선택하는 과정에서는 “가장 똑똑한 모델”을 찾는 것보다 성능과 비용, 속도, 개방성, 실제 업무 적합성을 균형 있게 갖춘 모델과 제공자를 찾는 것이 더욱 중요해질 수 있습니다.

AI 모델의 경쟁 기준도 단순한 벤치마크 점수에서 실제 업무를 얼마나 잘 수행하는지, 그리고 그 결과를 얼마나 효율적인 비용과 시간으로 만들어내는지까지 확장되고 있습니다.

300x250

https://artificialanalysis.ai/?intelligence=agentic-index

 

AI Model & API Providers Analysis | Artificial Analysis

Comparison and analysis of AI models and API hosting providers. Independent benchmarks across key performance metrics including quality, price, output speed & latency.

artificialanalysis.ai

728x90
반응형
그리드형