
Qwen3.8-Max가 공개됐다. Qwen 제품군 가운데 가장 높은 성능을 목표로 개발된 모델로, 2.4조 개의 파라미터와 950억 개의 활성 파라미터를 기반으로 코딩, 업무 자동화, 연구, 장기 작업, 멀티모달 에이전트 등 다양한 영역의 성능을 강화했다.
특히 이번 모델은 단순히 질문에 답하는 수준을 넘어 복잡한 작업을 처음부터 끝까지 수행하는 능력에 초점을 맞췄다. 실제 테스트에서는 수일에 걸쳐 코드를 작성하고 검증하거나, 논문을 재현한 뒤 새로운 방법을 탐색하고, 대회에서 반복적으로 결과를 개선하는 작업까지 수행했다.
Qwen3.8-Max의 또 다른 특징은 Qwen-Max 계열 모델 가운데 처음으로 오픈 웨이트 공개가 예정됐다는 점이다. 현재 QwenCloud를 통해 사용할 수 있으며, 모델 가중치는 다음 주 Hugging Face와 ModelScope에 공개될 예정이다.
Qwen3.8-Max의 핵심 특징
Qwen3.8-Max는 Qwen 3.5의 아키텍처 기반 위에서 확장된 모델이다. 2.4조 파라미터 규모로 확대됐으며, 코딩과 실제 업무뿐 아니라 연구 및 장기적인 자율 작업에서도 종합적인 개선을 목표로 한다.
특히 모델의 방향은 단순한 응답 생성보다 복잡한 목표를 장시간 유지하면서 실행하고, 결과를 확인하고, 문제가 발생하면 다시 개선하는 작업 방식에 맞춰져 있다.
주요 특징은 다음과 같이 정리할 수 있다.
- 2.4조 파라미터, 950억 활성 파라미터
- 코딩 및 소프트웨어 엔지니어링 성능 강화
- 장기간 이어지는 자율 코딩 지원
- 연구 논문 재현 및 개선 작업 수행
- 다양한 직무의 실제 업무 자동화
- 장기적인 의사결정 및 운영 능력 강화
- 멀티모달 이해와 시각적 피드백 기반 작업
- 코드 작성과 GUI 조작을 결합한 Hybrid Agent 지원
- QwenCloud API를 통한 활용
- 다음 주 오픈 웨이트 공개 예정
이 가운데 가장 눈에 띄는 부분은 모델이 하나의 정해진 작업을 처리하는 데 그치지 않고 피드백을 활용해 작업 과정 자체를 발전시키는 방식이다.
10일 이상 이어진 자율 코딩 프로젝트
Qwen3.8-Max의 코딩 능력을 보여주는 대표적인 사례는 oh-my-cli 프로젝트다.
모델은 프로젝트를 처음부터 구축하고 10일이 넘는 장기 자율 코딩 과정에서 스스로 발전하는 하네스를 구축했다. 이 하네스는 사용자와 커뮤니티의 피드백, 모델 자체의 테스트 결과를 하나의 엔지니어링 루프로 연결한다.
새로운 요구사항이 GitHub Issues에 들어오면 작업을 정규화하고, 에이전트가 이를 가져가 구현한다. 이후 코드 작성, 테스트, 미리보기, 로그 분석을 거쳐 문제가 발견되면 다시 해당 이슈나 PR로 돌아가 수정과 재검증을 진행한다.
핵심 구조는 크게 세 가지다.
작업 상태와 실행을 관리하는 루프
Qwen3.8-Max는 이슈 상태 머신, 디스패처, 모니터, 워치독을 하나의 실행 루프로 결합한다.
새 요구사항이 들어오면 작업은 ready → leased → active 단계로 이동하며, 구현이 끝나면 E2E 테스트와 CI 검사가 이어진다. 검증을 통과하면 PR이 병합되는 구조다.
지속적인 자체 테스트
업데이트가 발생할 때마다 Build, Unit Test, E2E, Desktop Lifecycle 검증을 실행한다.
문제가 발견되면 해당 문제를 관련 이슈나 PR로 연결해 수정하고 다시 검증한다. 즉, 코드를 작성하는 것만이 아니라 결과를 확인하고 유지보수하는 과정까지 작업 루프에 포함된다.
다양한 피드백을 통한 기능 발전
커뮤니티와 사용자, 개발자의 요구를 실행 가능한 작업으로 변환해 제품 개선에 반영한다.
/goal, /resume, Dynamic Workflow, Session Replay, Desktop 등의 기능도 이러한 방식으로 지속적으로 발전시킬 수 있다.
2026년 7월 30일 기준으로 약 16일 동안 완전히 자율적으로 운영된 저장소에는 265개의 커밋, 127개의 PR, 151개의 이슈가 누적됐다.
이는 장시간 실행되는 AI 코딩 에이전트가 단순히 코드를 생성하는 수준을 넘어 요구사항 수집부터 구현, 검증, 수정까지 이어지는 개발 사이클을 반복할 수 있음을 보여주는 사례다.
논문을 재현하고 기존 방법까지 개선
Qwen3.8-Max는 연구 작업에서도 장기적인 자율성을 보여줬다.
모델에게 Unified Data Selection for LLM Reasoning이라는 연구 논문을 제공하고 논문의 실험을 코드로 재현한 뒤, 더 나은 결과를 만들어보도록 요청했다.
문제는 시작점에 준비된 코드나 파이프라인이 없었다는 것이다. 논문과 GPU만 주어진 상황에서 데이터 처리 스크립트, 학습 코드, 평가 환경을 모두 직접 구성해야 했다.
약 5일, 약 125시간 동안 자율적으로 작업하면서 약 7,600줄의 코드를 작성했고 1,100회 이상의 작업을 수행했다. GPU 학습은 총 33라운드 진행됐다.
먼저 약 37시간 동안 논문의 전체 파이프라인을 처음부터 재구성하고 주요 결과 6가지를 재현했다. 이후 약 88시간 동안 스스로 개선 아이디어를 만들고 검증하는 연구 루프를 실행했다.
과정은 다음과 같은 방식으로 이어졌다.
가설 수립 → 코드 작성 → GPU 실행 → 결과 분석 → 다음 실험
총 4개 라운드에서 18개의 개선 아이디어를 탐색했고, 각각의 결과를 다음 가설에 반영했다. 그 결과 기존 논문의 접근법을 개선한 새로운 방법을 만들어냈으며, AIME24에서 2.7포인트 향상된 결과를 기록했다.
이 사례가 중요한 이유는 AI가 단순히 기존 연구를 설명하는 데 그치지 않고, 연구자가 수행하는 실험적 탐색 과정 자체를 반복했다는 점이다.
24시간 만에 526개 팀이 참가한 대회에서 성능 개선
Qwen3.8-Max는 실제 온라인 대회에서도 장기적인 문제 해결 능력을 테스트했다.
Alibaba Cloud Tianchi에서 열린 WWW2025 Multimodal Dialogue Intent Recognition Challenge에는 526개 인간 팀이 참가했다. 과제는 고객 상담 대화의 텍스트와 스크린샷을 분석해 고객의 의도를 파악하는 것이었다.
Qwen3.8-Max는 24시간이라는 제한된 시간 안에서 대회 규칙을 확인하고 전체 솔루션을 코드로 구성했다.
텍스트 처리를 위해 BERT, MacBERT, RoBERTa 계열 모델을 파인튜닝하고 앙상블했으며, 상품 스크린샷에는 Qwen2.5-VL-7B와 Chinese-CLIP을 활용했다.
이후 여러 모델의 결과를 가중 투표 방식으로 결합했다. 교차 검증을 통해 각 모델의 투표 비중을 조정하고, 이미지 모델을 추가해 판단이 갈리는 상황을 보완했다.
총 45회의 제출을 진행하면서 매 라운드의 피드백을 다음 학습과 가중치 조정에 반영했다.
그 결과 정확도는 0.60에서 최종 0.853까지 상승했고, 526개 인간 팀 가운데 458개 팀을 넘어 전체 참가자의 87%보다 높은 성과를 기록했다.
세 가지 사례에서 공통적으로 확인되는 특징은 명확하다.
Qwen3.8-Max는 주어진 계획을 그대로 실행하는 데 그치지 않고, 결과를 확인하고 그 결과를 다음 행동에 반영하는 피드백 루프를 스스로 구성한다.
실제 업무를 겨냥한 에이전트 능력 강화
코딩과 함께 Qwen3.8-Max가 집중한 영역은 실제 업무다.
실제 업무는 하나의 질문에 답하는 것과 다르다. 여러 파일을 확인하고, 도구를 사용하고, 중간 결과를 검증하고, 필요한 경우 다시 작업해야 한다.
Qwen3.8-Max는 이러한 업무를 지원하기 위해 RL 환경과 컴퓨팅 규모를 함께 확대했다.
여기에는 세 가지 핵심 과제가 있었다.
첫 번째는 실제 환경을 지속적으로 확장하는 것이다.
작업은 단일 작업에서 여러 작업, 여러 날에 걸친 작업으로 확대하고, 작업 공간은 여러 파일에서 계층형 폴더와 복잡하고 서로 다른 형태의 폴더 구조로 확장한다. 동시에 사용하는 하네스의 종류와 버전, 스킬까지 다양화한다.
두 번째는 Universal Reward System이다.
실행 결과를 기반으로 한 검증, 텍스트 및 렌더링된 시각 결과에 대한 평가, 에이전트 기반 검사 등 서로 다른 검증 방식을 하나의 보상 시스템으로 통합한다.
세 번째는 온라인 데이터 밸런서다.
작업, 난이도, 작업 공간, 하네스에 대한 데이터 분포를 균형 있게 유지해 배치 간 변화 폭을 줄이고 RL 학습을 안정적으로 확장할 수 있도록 한다.
이 세 요소를 통해 다양한 업무를 폭넓게 다루면서도 결과를 안정적으로 평가하고 지속적으로 학습할 수 있는 환경을 구축했다.
수백 개 전문 직무에서 업무 수행 능력 테스트
Qwen3.8-Max는 수백 개의 경제적 가치가 높은 직업과 실제 업무를 대상으로 작업 능력의 폭도 테스트했다.
대표적인 사례는 다음과 같다.
기업 컴플라이언스 검토
수백 개 문서로 구성된 자료에서 관련 조항 1,284개를 한 번에 찾아냈으며 전체 검토를 1시간 이내에 완료했다.
원문에서는 이러한 검토에 일반적으로 협업하는 법률 보조 인력이 약 일주일을 필요로 하는 작업으로 설명한다.
UI/UX 디자인
디지털 뱅킹 앱 NOVA를 위한 고품질 인터랙티브 프로토타입을 제작했다.
총 8개의 화면을 일관된 디자인 시스템으로 구성했으며, 사람의 수정 없이 한 번에 결과를 완성했다.
레스토랑 메뉴 개발
100개가 넘는 식재료 공급 자료를 분석하고 26개 메뉴로 구성된 완성형 메뉴를 한 번에 생성했다.
각 메뉴에는 평균 칼로리와 식재료 출처가 표시됐으며 식재료 원가 비율은 33.8%로 유지했다.
구조 엔지니어링
하나의 도면 세트에서 30층 오피스 타워의 내진 구조 모델을 브라우저에서 재구성했다.
고유 주기, 밑면 전단력, 층간 변위비 등을 실시간으로 확인할 수 있도록 구성했다.
재활 치료
2D 종이 평가 양식을 3D 인터랙티브 데모로 변환했다.
사용자가 다양한 각도에서 결과를 확인할 수 있고, 층별 해부학적 오버레이를 통해 부상 위치와 회복 과정을 확인할 수 있도록 구성했다.
스포츠 데이터 분석
선수별 약 8,400개의 공격 및 수비 포제션을 분석해 선수 전술 프로필과 코칭 보고서를 수십 분 안에 생성했다.
이처럼 Qwen3.8-Max는 특정 직군 하나에 특화하기보다는 서로 다른 업무의 형태를 이해하고 필요한 작업 과정을 구성하는 범용적인 에이전트 능력을 보여주는 데 초점을 맞추고 있다.
한 번의 세션에서 수행하는 자동화된 퀀트 연구
Qwen3.8-Max는 Dynamic Workflows를 활용해 퀀트 연구 작업도 자동화한다.
한 줄의 작업 설명만으로 복잡한 ETF 로테이션 전략을 계획하고 데이터 시스템 구축, 기본 팩터 생성, 반복적인 탐색, 백테스트 분석까지 수행한다.
특히 고정된 스크립트를 그대로 실행하지 않고 결과에 따라 작업 방식을 변경한다.
예를 들어 설계 기간의 지표와 검증 기간의 지표가 서로 맞지 않는 상황에서 과적합 신호를 발견하면 불필요한 팩터를 제거했다.
여러 연구 경로가 동일한 핵심 신호로 수렴하면 경로 의존성을 줄이기 위해 멀티 시드 유니온 검증을 추가했다.
또한 작은 단면 데이터에서 3개 모델 앙상블보다 고정 방향 합성이 더 안정적이라고 판단하면 전략 구조 자체를 변경했다.
팩터 탐색에서는 병렬화 능력을 활용했다.
모멘텀, 가치, 품질, 투자, 저위험, 감성이라는 6개 팩터 계열에서 각각 50개의 연구 방향을 만들고 약 330개의 서브 에이전트를 배치했다. 이를 통해 약 6,000회의 백테스트를 수행했다.
선택된 팩터의 초과 Sharpe ratio는 0.64~1.48이었으며 IC는 모두 양수로 0.010~0.014 범위에 있었다.
이 사례에서 핵심은 단순한 자동화가 아니다.
Dynamic Workflows를 통해 복잡한 연구의 오케스트레이션 로직을 재현 가능한 프로그램으로 만들면서, 기존에 수주에서 수개월이 걸릴 수 있었던 연속적인 퀀트 연구 과정을 하나의 대화 안에서 확장 가능한 자동화 루프로 구성했다는 점이다.
장기 작업에서 나타난 자율적인 최적화 능력
Qwen3.8-Max는 장기 작업에서도 행동과 피드백을 반복하면서 전략을 수정하는 능력을 보여준다.
대표적인 사례가 반도체 설계다.
모델은 GCD/RSA 암호화 하드웨어 가속기의 전체 실리콘 설계 과정을 자율적으로 수행했다. 논리 구조 변경, 여러 제약 조건을 고려한 최적화, 물리적 레이아웃 생성까지 이어지는 작업이다.
검증 환경에서는 4, 6, 8, 16비트 설정에서 정확성을 유지하면서 합성 게이트 수를 최소화해야 했다.
Qwen3.8-Max는 Iverilog, Yosys, OpenROAD가 통합된 환경에서 작업했다.
처음에는 기본 작업 설명과 비어 있는 RTL 모듈 템플릿, 검증 및 합성용 평가 스크립트만 주어졌다. 별도의 정답 설계나 사람의 개입은 없었다.
하나의 연속적인 자율 실행 과정에서 약 500턴과 71회의 평가를 수행하며 13개의 주요 마일스톤을 거쳤다.
처음 기능적으로 동작하는 설계의 게이트 수는 8,298개였다. 이후 반복적인 구조 변경과 최적화를 통해 최종 678개까지 낮췄다.
가장 큰 변화는 모듈러 곱셈에서 사용하던 하드웨어 모듈로 나눗셈기를 반복적인 shift-subtract 구조로 변경한 것이다. 이를 통해 게이트 수를 8,298개에서 2,010개로 줄였다.
이후 불필요한 로직과 비트 폭을 줄이고, 레지스터와 제어 FSM을 정리했으며, 모듈을 통합하고 로직을 공유하는 방식으로 추가 최적화를 진행했다.
최종적으로 678게이트까지 감소시킨 뒤 OpenROAD를 이용해 물리적 구현까지 확인했다.
초기 레이아웃은 106×106µm² 크기의 다이와 33,369µm의 총 배선 길이를 기록했으며 -4.46ns의 음수 슬랙을 보였다.
최종 레이아웃은 46×46µm²로 줄었고 총 배선 길이는 4,187µm까지 감소했다. 또한 500MHz에서 +0.66ns 슬랙으로 타이밍 클로저를 달성했다.
원문에서는 이를 통해 물리적 다이 면적이 81% 감소했다고 설명한다.
이 과정에서 확인할 수 있는 중요한 특징은 수백 번의 상호작용 이후에도 최적화 전략을 유지하면서 알고리즘 수준의 구조 변경까지 수행했다는 것이다.
365일 이커머스 운영 시뮬레이션에서의 지속적인 학습
장기적인 의사결정 능력은 E-Commerce Bench에서도 평가됐다.
이 벤치마크는 365일 동안 이커머스 사업을 운영하는 상황을 시뮬레이션한다.
실제 Taobao와 Tmall의 비식별화된 거래 데이터를 기반으로 12개 매장 유형, 60개 상품 카테고리, 약 600개 공급업체, 7,000개 상품으로 구성된 환경을 구현했다.
모델은 10만 위안의 초기 자본으로 여러 온라인 매장을 운영하며 상품 선정, 공급망 협상, 재고 관리, 동적 가격 설정, 반품 처리 등을 결정해야 한다.
공급업체와의 협상에서는 서로 다른 성향과 양보 전략을 가진 공급업체가 존재한다. Qwen3.8-Max는 동일한 상품과 공급업체에 대해 반복적으로 협상하면서 조달 가격을 낮추고 이익을 높이는 방향으로 성과를 개선했다.
또한 약 600개 공급업체 가운데 152개의 사기성 판매자가 포함돼 있었다. 회원비 함정, 지나치게 낮은 가격을 이용한 유인, 상품 설명과 실제 상품의 불일치 등 다양한 위험 유형이 존재했다.
Qwen3.8-Max는 장기 운영 과정에서 거래 피드백을 활용해 전략을 수정했다.
최종적으로 연말 총 잔액 416,252위안을 기록했으며 4.16배의 수익률을 달성했다. 이는 2위인 GLM 5.2보다 38% 높은 결과였으며, 이전 세대인 Qwen3.7-Max보다 152% 향상된 수치다.
원문에서는 이러한 결과를 장기간 일관된 의사결정을 유지하고 거래 결과로부터 적응적으로 학습하는 능력을 보여주는 사례로 설명한다.
이미지와 문서, 영상까지 연결하는 멀티모달 에이전트
Qwen3.8-Max의 멀티모달 능력은 단순히 이미지를 이해하는 데 머물지 않는다.
200페이지가 넘는 금융 보고서와 복잡한 PDF에서 텍스트뿐만 아니라 차트와 문서 레이아웃을 함께 이해하고 주요 정보를 추출해 구조화된 보고서나 실제 사용할 수 있는 웹 경험으로 변환할 수 있다.
100시간이 넘는 영상에서도 특정 장면을 찾고 질문에 답하는 것을 넘어 사람, 사건, 시간, 장면을 연결한 비디오 메모리 그래프를 구축할 수 있다.
이를 통해 긴 시간에 걸쳐 발생한 사건의 흐름과 인물 관계, 주요 순간을 재구성할 수 있다.
멀티모달 능력은 입력을 이해하는 데서 끝나지 않는다.
개인 영상을 브이로그로 편집하거나, 질문을 교육용 애니메이션으로 만들고, 하나의 인터페이스 스크린샷에서 프론트엔드 프로젝트를 재구성할 수 있다.
평면도를 Blender 기반 3D 인테리어 시각화로 변환하거나 자연어 요청으로 게임과 애플리케이션을 제작하는 작업도 가능하다.
특히 주목할 부분은 시각 정보를 결과 검증에도 활용한다는 점이다.
페이지 레이아웃, 객체 방향, 공간 관계, 애니메이션 품질, 인터랙션 결과 등을 확인하고 문제가 발견되면 계획을 수정하고 결과를 다시 개선한다.
따라서 비전은 단순한 입력 방식이 아니라 계획, 실행, 검증, 반복을 연결하는 피드백 루프로 활용된다.
코딩과 GUI를 결합한 Hybrid Agent
복잡한 디지털 작업을 수행하려면 코드를 작성하는 능력과 실제 인터페이스를 조작하는 능력이 함께 필요한 경우가 많다.
Qwen3.8-Max는 이 두 방식을 결합한 Hybrid Agent 능력을 지원한다.
코딩은 복잡한 로직을 빠르고 대규모로 처리하고, GUI 조작은 실제 사람이 보고 조작할 수 있는 인터페이스에 접근한다. 그리고 GUI에서 실제로 발생한 결과가 다시 모델의 피드백으로 들어간다.
이를 평가하기 위해 RecreationBench가 사용됐다.
이 벤치마크에서는 Ubuntu, macOS, Windows, Android, 웹 등 5개 플랫폼의 실제 애플리케이션을 대상으로 한다.
모델은 애플리케이션의 소스 코드나 인터넷에 접근할 수 없고 실행 중인 애플리케이션을 블랙박스로 관찰해야 한다. 이후 상호작용과 피드백만을 활용해 애플리케이션 전체를 처음부터 재구성한다.
Qwen3.8-Max는 반복적인 코딩과 인터랙션 피드백을 통해 원래 애플리케이션에 단계적으로 수렴하는 능력을 보여줬다.
Qwen-MM-Plugins로 멀티모달 에이전트 확장
Qwen3.8-Max의 멀티모달 에이전트 기능을 기존 시스템에 통합할 수 있도록 Qwen-MM-Plugins도 제공된다.
Qwen-MM-Plugins는 에이전트 프레임워크에 이미지 및 영상 처리, 멀티모달 메모리, 동적 해상도 지원, 시각적 도구 사용 기능 등을 추가할 수 있는 하네스 확장 라이브러리다.
또한 영상 편집, Blender, CAD와 같은 작업을 위한 전문 기능도 제공한다.
이를 활용하면 기존 에이전트 하네스를 보다 멀티모달 중심의 시스템으로 확장할 수 있다.
주요 벤치마크 결과
Qwen3.8-Max는 코딩 에이전트, 일반 에이전트, 일반 능력, 멀티모달 추론, 시각 에이전트 및 코딩 등 여러 영역에서 평가됐다.
코딩 에이전트 영역에서는 다음과 같은 결과를 기록했다.
| 벤치마크 | Qwen3.7-Max | Qwen3.8-Max |
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| DeepSWE 1.1 | 21.6 | 56.6 |
| NL2Repo-Bench | 47.2 | 55.9 |
| FrontierSWE | 40.7 | 73.5 |
| PaperBench | 64.8 | 93.0 |
| AndroidBench | 56.5 | 70.2 |
| QwenSWEBench | 63.4 | 80.7 |
| QwenQoderBench | 36.8 | 58.4 |
일반 에이전트 영역에서도 여러 벤치마크에서 이전 세대보다 높은 결과를 기록했다.
| 벤치마크 | Qwen3.7-Max | Qwen3.8-Max |
| CoWorkBench | 64.6 | 74.8 |
| WorkSpaceBench | 61.4 | 67.7 |
| JobBench | 31.3 | 53.4 |
| SkillsBench | 61.2 | 70.2 |
| WideSearch | 75.2 | 81.9 |
| HLE w/ tools | 53.5 | 56.2 |
멀티모달 영역에서는 MMMU-Pro 82.3, MathVision 95.2/97.7, BabyVision 82.0/91.3, LogicVista 91.9 등의 결과를 기록했다.
시각 에이전트와 코딩 영역에서는 OSWorld-Verified 86.1, ScreenSpot Pro 84.5, WebArena-Verified 66.8, AndroidWorld 85.3, MobileWorld 77.8을 기록했다.
다만 각 벤치마크의 평가 방식과 하네스, 실행 횟수, 시간 제한 등이 서로 다르므로 단순히 숫자만 비교하기보다는 각 벤치마크의 조건을 함께 확인할 필요가 있다.
QwenCloud API로 Qwen3.8-Max 사용하기
Qwen3.8-Max는 현재 QwenCloud를 통해 사용할 수 있다.
API에서는 reasoning_effort를 통해 추론 깊이를 조정할 수 있다.
지원되는 수준은 다음과 같다.
- xhigh: 복잡한 작업에서 높은 수준의 분석이 필요한 경우
- medium: 정확성과 속도의 균형
- low: 속도와 비용을 우선하는 효율적인 추론
기본값은 xhigh이며 preserve_thinking도 모든 작업에서 기본적으로 활성화된다.
QwenCloud는 OpenAI 사양과 호환되는 Chat Completions 및 Responses API를 지원하며 Anthropic API와 호환되는 인터페이스도 제공한다.
Python에서 API 호출
Python에서는 OpenAI 클라이언트를 활용해 QwenCloud의 호환 API를 호출할 수 있다.
from openai import OpenAI
import os
api_key = os.environ.get("DASHSCOPE_API_KEY")
client = OpenAI(
api_key=api_key,
base_url=os.environ.get(
"DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
),
)
messages = [
{
"role": "user",
"content": "Write a Python function to merge two sorted linked lists."
}
]
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=messages,
extra_body={
"enable_thinking": True,
},
reasoning_effort="xhigh",
stream=True,
)
이처럼 기존 OpenAI 호환 클라이언트 구조를 활용해 Qwen3.8-Max를 호출할 수 있으며, reasoning_effort 설정으로 작업의 추론 수준을 조정할 수 있다.
주요 코딩 도구와 에이전트 프레임워크 지원
Qwen3.8-Max는 여러 코딩 도구 및 에이전트 프레임워크와 연동할 수 있도록 구성됐다.
Claude Code
Qwen API의 Anthropic API 프로토콜 지원을 활용해 Claude Code에서 Qwen3.8-Max를 사용할 수 있다.
Codex
OpenAI Responses 프로토콜을 통해 Codex에서도 Qwen3.8-Max를 연결할 수 있다.
원문에서 제시한 설정에서는 Qwen3.8-Max를 모델로 지정하고 low, medium, xhigh 수준의 추론 단계를 사용할 수 있도록 구성한다.
Qoder CLI
Qoder는 Qwen과 함께 에이전트 코딩 기능을 발전시키는 방향으로 연동된다.
Qwen Code
Qwen Code는 Qwen 계열 모델에 최적화된 코딩 도구로 제공된다.
OpenClaw
QwenCloud를 OpenClaw와 연결해 Qwen3.8-Max를 에이전트 모델로 사용할 수 있다.
OpenClaw 설정에서는 Qwen3.8-Max를 기본 모델로 지정하고 텍스트와 이미지 입력, 추론, 100만 토큰의 컨텍스트 윈도우 등을 구성할 수 있다.
Qwen3.8-Max가 보여주는 AI 에이전트의 변화
Qwen3.8-Max의 공개 내용을 보면 모델의 성능을 평가하는 기준이 단순한 질문 응답에서 점차 실제 작업 수행으로 이동하고 있음을 확인할 수 있다.
기존의 모델 활용 방식에서는 사용자가 질문하고 모델이 답변을 제공하는 구조가 중심이었다.
하지만 Qwen3.8-Max가 제시한 사례에서는 작업 방식이 달라진다.
요구사항을 이해하고, 계획을 세우고, 코드를 작성하고, 도구를 실행하고, 결과를 검증하고, 문제가 있으면 다시 수정한다.
연구 작업에서는 가설을 세우고 실험하고 결과를 분석한 뒤 다음 실험으로 이어간다.
업무에서는 여러 문서와 도구를 연결하고, 장시간의 작업 과정에서 이전 결과를 바탕으로 다음 결정을 내린다.
멀티모달 작업에서는 이미지나 영상을 이해하는 것뿐 아니라 실제 결과를 시각적으로 확인하고 다시 수정한다.
즉, Qwen3.8-Max의 핵심은 단순히 더 큰 모델을 만드는 데만 있지 않다.
장기적인 목표를 유지하고, 행동과 결과 사이의 피드백을 연결하며, 작업이 끝날 때까지 반복하는 에이전트 능력을 강화했다는 점에 의미가 있다.
Qwen3.8-Max는 2.4조 파라미터 규모를 기반으로 코딩, 업무 자동화, 연구, 장기 작업, 멀티모달 에이전트까지 폭넓은 영역을 겨냥한 Qwen 계열의 최신 Max 모델이다.
특히 10일 이상 이어진 자율 코딩, 약 125시간에 걸친 논문 재현 및 개선, 24시간 동안 진행된 대회 최적화, 반도체 설계 최적화, 365일 이커머스 운영 시뮬레이션 등은 모델의 능력을 단순한 응답 정확도보다 실제 작업을 끝까지 수행하는 능력의 관점에서 보여준다.
또한 코딩과 GUI 조작을 결합한 Hybrid Agent, 이미지와 영상의 이해 및 결과 검증, Qwen-MM-Plugins를 통한 멀티모달 에이전트 확장 등은 AI가 텍스트를 생성하는 도구에서 실제 디지털 환경에서 작업하는 에이전트로 발전하는 흐름을 보여준다.
현재 Qwen3.8-Max는 QwenCloud에서 사용할 수 있으며, reasoning_effort를 활용해 작업의 추론 수준과 비용, 속도의 균형을 조절할 수 있다.
무엇보다 주목할 부분은 Qwen-Max 계열에서 처음으로 오픈 웨이트 공개가 예정됐다는 점이다. 원문 기준으로 모델 가중치는 다음 주 Hugging Face와 ModelScope에 공개될 예정이다.
결국 Qwen3.8-Max가 보여주는 방향은 분명하다. AI 모델의 경쟁력이 단순히 얼마나 정확하게 답하는지를 넘어 얼마나 복잡한 목표를 이해하고, 여러 도구를 사용하며, 장시간 작업을 지속하고, 결과에 따라 스스로 개선할 수 있는가로 확장되고 있다는 것이다.
Qwen3.8-Max는 이러한 장기 자율 작업을 코딩, 연구, 업무, 멀티모달 환경으로 확장하면서 AI 에이전트가 실제 업무를 수행하는 방식에 새로운 가능성을 제시하고 있다.
https://qwen.ai/blog?id=qwen3.8
Qwen Studio
qwen.ai

'인공지능' 카테고리의 다른 글
| AI First 기업은 어떻게 일하는가? 0→1보다 1→2가 중요한 이유 (0) | 2026.08.03 |
|---|---|
| 8GB Mac에서 Gemma 4 26B를 약 2GB 메모리로 실행하는 TurboFieldfare (0) | 2026.08.03 |
| qm, 조직 전체가 함께 사용하는 멀티플레이어 에이전트 하네스 (0) | 2026.08.03 |
| Qwen-UI-Agent, GUI와 CLI를 통합한 차세대 실세계 AI 에이전트 (0) | 2026.08.03 |
| ByteDance Seedance 2.5, 최대 3분 장편 영상 제작으로 확장된 AI 영상 생성 기술 (0) | 2026.08.03 |