Qwen3 TTS Instruct Flash
공급사 정가. 플랫폼 마진 없음, 종량제. 아래는 공식 정가입니다. 로그인한 고객은 /console/pricing 에서 워크스페이스 할인이 반영된 실제 가격을 볼 수 있습니다.
30초 만에 Qwen3 TTS Instruct Flash 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3-tts-instruct-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3-tts-instruct-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-tts-instruct-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3-tts-instruct-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3-tts-instruct-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));스펙 및 제한
오디오
- 언어
- 중국어(표준어), 영어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어. language_type은 혼합 언어이거나 판별되지 않은 입력에 대해 Auto가 기본값이며, Alibaba는 이 값이 정확도를 보장하지 않는다고 문서화합니다. 단일 언어를 지정하면 합성 품질이 크게 향상된다고 명시되어 있습니다. Qwen3-TTS-Flash 시리즈와 달리 Instruct 시리즈에는 중국어 방언 보이스(베이징, 상하이, 쓰촨, 난징, 산시, 민난, 톈진, 광둥)가 없습니다.
- 오디오 제한
- HTTP 비실시간 음성 합성 API이며, -realtime 접미사가 WebSocket 형제 모델을 표시합니다. 입력 텍스트는 600자로 제한되고 다국어 혼합 입력이 허용됩니다. 비스트리밍은 24시간 동안 유효한 오디오 파일 URL을 반환하고, 스트리밍은 Base64로 인코딩된 PCM을 청크로 반환하면서 URL은 마지막 패킷에만 담으며 공식 샘플에서는 24 kHz 모노 16비트 오디오로 재생됩니다. 과금은 입력 텍스트 문자 수 기준이며 usage.characters로 보고됩니다(Qwen3-TTS 시리즈에서 input_tokens와 output_tokens는 항상 0입니다). 출력 오디오는 무료입니다.
실시간
- 보이스
- 한 줄짜리 페르소나와 함께 공개된 시스템 보이스로, Cherry(밝고 긍정적이며 친근하고 자연스러운 젊은 여성), Serena, Ethan, Chelsie, Momo, Vivian, Moon, Maia, Kai, Nofish(권설음을 발음하지 못하는 디자이너), Bella, Eldric Sage, Mia, Mochi, Bellona, Vincent, Bunny, Neil, Elias, Arthur, Nini, Seren, Pip, Stella가 있습니다. Qwen-TTS 보이스 목록은 각 보이스를 그 보이스를 받아들이는 정확한 모델 id와 짝지어 둡니다.
- 세션
-
- instructions는 자연어로 속도, 감정, 스타일을 조정하며 최대 1,600 토큰이고 중국어와 영어에 대해서만 문서화됨
- optimize_instructions(기본값 false)는 지시문을 합성에 더 적합한 지시로 다시 쓰며 instructions가 비어 있으면 효과가 없음
- 보이스 클로닝과 보이스 디자인은 이 모델 id에서 미지원으로 표기됨
모델
- 모달리티
- 텍스트 → 오디오
Model Studio에서 제공되는 Alibaba Qwen3-TTS 패밀리의 지시 제어 가능 티어로, 현재 qwen3-tts-instruct-flash-2026-01-26 스냅샷과 동일합니다. 오디오북 제작, 온라인 교육 보이스오버, 콘텐츠 제작처럼 지연에 관대한 작업에 포지셔닝되어 있습니다. 싱가포르 리전 기준 국제 배포 범위에서 입력 10,000자당 $0.115이며, Model Studio 활성화 후 90일간 유효한 110,000자 무료 쿼터가 함께 제공됩니다.
출처: Alibaba 공식 문서 ↗
Qwen3 TTS Instruct Flash 소개
Qwen3-TTS-Instruct-Flash는 Model Studio에서 제공되는 Alibaba Qwen3-TTS 패밀리의 지시 제어 가능 티어로, 싱가포르 리전 기준으로 가격이 매겨지며 현재 qwen3-tts-instruct-flash-2026-01-26 스냅샷과 동일합니다.
- Model Studio는 이 패밀리를 능력이 아니라 전송 방식으로 나눕니다. realtime 접미사가 붙은 id는 WebSocket을 사용하고, 접미사가 없는 이 모델은 Alibaba가 비실시간 음성 합성이라고 부르는 것을 담당하는 HTTP 모델로, 오디오북 제작, 온라인 교육 보이스오버, 콘텐츠 제작처럼 지연에 관대한 시나리오를 위해 설계되었습니다.
- 일반 qwen3-tts-flash 대신 이 모델을 고르는 이유는 지시 제어입니다.
- 원하는 발화 방식을 평이한 언어로 설명해 요청마다 속도, 감정, 스타일을 제어하며, 문서화된 예시는 더 느린 속도로 부드럽게 말하기와 들뜬 방송 스타일 쓰기입니다. instructions 필드는 최대 1,600 토큰을 받고 중국어와 영어에 대해서만 문서화되어 있으며, 기본적으로 꺼져 있는 optimize_instructions를 켜면 서비스가 작성한 문구를 합성에 더 적합한 지시문으로 다시 씁니다.
- 보이스는 이 패밀리의 이름 붙은 페르소나로, 밝고 긍정적이며 친근하고 자연스러운 젊은 여성인 Cherry와 권설음을 발음하지 못하는 디자이너인 Nofish 등이 있고, 보이스 목록에는 각 보이스를 받아들이는 모델 id가 명시되어 있습니다.
- 커버하는 언어는 중국어(표준어), 영어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어의 10가지이며, qwen3-tts-flash와 달리 Instruct 라인에는 중국어 방언 보이스가 전혀 없습니다.
- 통합을 좌우하는 제한이 둘 있습니다.
- 입력 텍스트는 600자로 제한되고, language_type의 기본값은 Auto인데 Alibaba는 이 값이 정확도를 보장하지 않는다고 밝히며 단일 언어 텍스트에는 명시적인 언어로 바꾸라고 권합니다.
- 비스트리밍은 24시간 동안 유효한 오디오 파일 URL을 반환하고, 스트리밍은 Base64로 인코딩된 PCM을 청크로 반환하면서 URL은 마지막 패킷에만 담으며, 공식 샘플은 그 스트림을 24 kHz 모노 16비트 오디오로 재생합니다.
- 과금은 입력 텍스트 문자 수로 이루어지며 국제 배포 범위에서 10,000자당 $0.115이고, 출력 오디오는 무료입니다.
- Synthorai는 OpenAI 호환 /v1/audio/speech 엔드포인트로 이 모델을 서빙합니다.
자주 묻는 질문
Qwen3 TTS Instruct Flash API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $11.5/M 기준으로, 이 크레딧만으로도 Qwen3 TTS Instruct Flash에 약 4K 토큰 규모의 요청을 대략 21회 보낼 수 있습니다.
Qwen3 TTS Instruct Flash는 무엇에 가장 강한가요?
평이한 언어 지시로 속도, 감정, 스타일 제어, 실시간이 아닌 오디오북과 보이스오버용 http 모델, 10개 언어, 입력 600자 상한. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
Qwen3 TTS Instruct Flash의 가격은 얼마인가요?
Synthorai에서 Qwen3 TTS Instruct Flash는 입력 토큰 100만 개당 $11.5, 출력 토큰 100만 개당 $0입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다.
Qwen3 TTS Instruct Flash는 프롬프트 캐싱을 지원하나요?
Qwen3 TTS Instruct Flash는 현재 Synthorai에서 캐시 읽기 할인이 없습니다. 게이트웨이의 다른 모델에는 프롬프트 캐싱이 여전히 적용됩니다. 캐싱을 지원하는 대안은 가격표에서 확인하세요. 공급사별 캐싱 비교 →
Qwen3 TTS Instruct Flash는 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="qwen3-tts-instruct-flash"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.