
Qwen-Audio-3.0-TTS란? 생산 환경을 고려한 고성능 TTS 모델
텍스트를 자연스러운 음성으로 변환하는 Text-to-Speech(TTS) 기술은 AI 음성 비서, 콘텐츠 제작, 고객 상담, 교육 서비스 등 다양한 분야에서 활용되고 있습니다. 이러한 서비스에서는 단순히 음성을 생성하는 것을 넘어, 자연스러운 발화와 높은 음질, 다양한 언어 지원, 빠른 생성 속도, 그리고 원하는 스타일로 음성을 제어할 수 있는 기능이 중요합니다.
Qwen-Audio-3.0-TTS는 이러한 요구사항을 충족하기 위해 개발된 생산 환경(Production) 중심의 음성 합성 시스템입니다. 콘텐츠 일관성, 화자 유사도, 자연스러운 억양, 음질, 제어 기능, 다국어 지원, 추론 속도, 강인성까지 다양한 요소를 동시에 개선했으며, 여러 평가에서 최고 수준(State-of-the-Art)의 성능을 기록했습니다. 또한 Artificial Analysis Text-to-Speech Leaderboard에서 1위를 기록하며 생산 환경에서 활용 가능한 강력한 TTS 기반 모델임을 보여주었습니다.
Qwen-Audio-3.0-TTS의 핵심 특징
1. 추론 속도를 높이는 Low-frame-rate Speech Tokenizer
Qwen-Audio-3.0-TTS는 12.5Hz의 Low-frame-rate Speech Tokenizer를 적용했습니다.
기존 음성 생성 모델은 많은 음성 토큰을 생성해야 하므로 추론 시간이 길어질 수 있습니다. 반면 Qwen-Audio-3.0-TTS는 낮은 프레임률의 Speech Tokenizer를 활용하여 자동회귀(Autoregressive) 디코딩 비용을 줄이면서도 음성 내용과 화자 정보를 유지하도록 설계되었습니다.
이를 통해 다음과 같은 장점을 제공합니다.
- 추론 속도 향상
- 생성 비용 감소
- 음성 품질 유지
- 화자 특성 보존
즉, 빠른 음성 생성과 높은 품질을 동시에 달성할 수 있도록 설계된 것이 특징입니다.
2. 성능 향상을 위한 Progressive Training Paradigm
Qwen-Audio-3.0-TTS는 단순한 학습 방식이 아닌 5단계 Progressive Training 방식을 적용했습니다.
학습 과정은 다음과 같이 구성됩니다.
- LM(Language Model) 사전 학습
- FM(Flow Model) 사전 학습
- 고품질 데이터를 활용한 공동 학습
- LM 강화학습(Reinforcement Learning)
- FM 강인성 학습 및 강화학습
이러한 단계별 학습을 통해 다음 요소들을 지속적으로 개선했습니다.
- 콘텐츠 일관성
- 자연스러운 억양(Prosody)
- 화자 음성 유사도
- 음질
- 생성 안정성
각 모델을 개별적으로 최적화한 후 통합 학습을 수행하여 전체적인 음성 생성 품질을 높인 것이 특징입니다.
3. 자연어와 Inline Tag를 활용한 정교한 음성 제어
Qwen-Audio-3.0-TTS는 음성을 매우 세밀하게 제어할 수 있는 기능을 제공합니다.
자연어 기반 제어
사용자는 자연어만으로 다양한 음성 스타일을 지정할 수 있습니다.
예를 들어 다음과 같은 정보를 지시할 수 있습니다.
- 역할(Role)
- 감정(Emotion)
- 말투(Speaking Style)
- 말하는 속도
- 음색(Timbre)
- 억양 및 악센트
별도의 복잡한 설정 없이 자연어 명령만으로 원하는 음성 스타일을 생성할 수 있습니다.
Fine-grained Inline Tag
또한 새롭게 추가된 86개의 Inline Tag를 통해 문장 또는 단어 단위까지 세밀하게 제어할 수 있습니다.
지원하는 표현은 다음과 같습니다.
- 감정 변화
- 억양 전환
- 웃음
- 숨소리
- 기침
- 한숨
이러한 기능을 활용하면 실제 사람이 말하는 것과 유사한 자연스러운 표현을 구현할 수 있습니다.
4. 폭넓은 언어 및 배포 환경 지원
Qwen-Audio-3.0-TTS는 다양한 환경에서 활용할 수 있도록 폭넓은 언어 지원과 높은 강인성을 제공합니다.
주요 지원 기능은 다음과 같습니다.
- 16개 언어 지원
- 신규 추가된 7개 언어 지원
- 중국 20개 방언 지역 지원
- 최대 3분 길이의 음성을 한 번에 생성
- 복잡한 Text Normalization 처리
- 노이즈, 잔향, 불명확한 음성 프롬프트에서도 안정적인 생성
별도의 노이즈 제거(Denoising) 모드 없이도 품질 저하가 있는 음성 참조 데이터를 활용할 수 있도록 설계된 점도 특징입니다.
추가적으로 다음 기능도 제공합니다.
- 재현 가능한 Speaker Fine-tuning
- 목표 화자 음성 적응(Target Voice Adaptation)
- Vocoder Super-resolution 기반 48kHz 음성 출력
다양한 평가를 통한 성능 검증
Qwen-Audio-3.0-TTS는 다양한 음성 생성 시나리오에서 성능을 평가했습니다.
평가 항목은 다음과 같습니다.
- Zero-shot Voice Cloning
- 다국어 음성 생성
- Cross-lingual 음성 생성
- 자연어 지시 수행
- Fine-grained 음성 제어
- Text Normalization
- 장문 음성 생성
- 악조건 음성 프롬프트 대응
- 방언 음성 생성
또한 다음과 같은 평가 지표를 활용했습니다.
- SEED-TTS-Eval
- CV3-Eval
- Long-form Evaluation
- Acoustic Robustness Evaluation
- Arena 방식의 Human Evaluation
평가 결과, 여러 항목에서 최고 수준의 성능 또는 가장 우수한 종합 성능을 기록했으며, 독립적인 Artificial Analysis Text-to-Speech Leaderboard에서도 1위를 차지했습니다.
활용 예시
Qwen-Audio-3.0-TTS는 자연어 명령을 활용하여 원하는 스타일의 음성을 생성할 수 있습니다.
예를 들어 다음과 같이 음성 스타일을 지정할 수 있습니다.
- "차분하고 친절한 상담원처럼 천천히 읽어주세요."
- "밝고 활기찬 분위기로 발표하듯 읽어주세요."
- "감정을 담아 자연스럽게 이야기해주세요."
또한 Inline Tag를 활용하면 특정 단어나 문장 구간에 웃음, 호흡, 감정 변화 등 세밀한 표현을 적용하여 보다 사실적인 음성을 생성할 수 있습니다.
Qwen-Audio-3.0-TTS는 생산 환경에서 요구되는 다양한 요소를 종합적으로 개선한 차세대 음성 합성 시스템입니다.
낮은 프레임률 Speech Tokenizer를 통한 빠른 추론, 5단계 Progressive Training 기반의 성능 향상, 자연어 및 Inline Tag를 활용한 세밀한 음성 제어, 16개 언어와 다양한 중국 방언 지원, 최대 3분의 장문 음성 생성, 그리고 노이즈 환경에서도 안정적인 음성 생성까지 폭넓은 기능을 제공합니다.
또한 다양한 객관적 평가와 사람 중심의 평가에서 우수한 성능을 기록하며 생산 환경에서 활용 가능한 강력한 TTS 모델로 자리매김했습니다. 이러한 특징은 AI 음성 서비스, 콘텐츠 제작, 고객 응대 시스템, 교육 플랫폼 등 다양한 분야에서 자연스럽고 제어 가능한 음성 합성을 구현하는 기반 기술로 활용될 수 있는 가능성을 보여줍니다.
https://funaudiollm.github.io/qwen-audio-3.0-tts/
Qwen-Audio-3.0-TTS
Long-text Generation Continuous long-passage reading in Chinese and English. Language Prompt Text (excerpt) CosyVoice 3.0-0.5B CosyVoice 3.0-1.5B Qwen-Audio-3.0-TTS ENAs she passed through the crowd of squires and yeomen who already filled the lower end of
funaudiollm.github.io

'인공지능' 카테고리의 다른 글
| OpenWiki 0.2, OKF 지원으로 코드 문서 관리와 AI 에이전트 검색 효율 향상 (0) | 2026.07.23 |
|---|---|
| Graph Engineering이 RAG를 넘어서는 이유: Microsoft, Stanford, Anthropic이 선택한 차세대 AI 아키텍처 (0) | 2026.07.23 |
| 중국 오픈 웨이트 AI 모델이 바꾸는 경쟁 구도, AI 시장의 승부는 왜 '토큰'이 아니라 '지능'인가 (0) | 2026.07.22 |
| MetaView: 단일 이미지 기반 대규모 시점 변환을 구현하는 Scale-Aware Novel View Synthesis 기술 (0) | 2026.07.22 |
| Qwen-Image-3.0 핵심 기능과 특징 정리: 더욱 현실적인 AI 이미지 생성 모델의 진화 (0) | 2026.07.22 |