O Fun-ASR é o modelo de reconhecimento de fala por arquivo de gravação do Alibaba Cloud Model Studio para transcrição offline de áudio pré-gravado.
- Entrada
- áudio
- Saída
- texto
- Preço
- $0.0021/min
O preço em contexto
Posição do preço entre 11 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Áudio
| Idiomas | Multilíngue com dialetos: 30 idiomas: chinês (mandarim, cantonês, wu, hokkien, hakka, gan, xiang, jin e sotaques regionais), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco |
|---|---|
| Limites de áudio |
|
| Diarização | Sim |
| Transcrição em streaming | Não |
| Marcas de tempo | Sim |
Modelo
| Modalidades | áudio → texto |
|---|
- Reconhecimento de canto adicionado em 2025-12
- o Fun-ASR-Nano de código aberto é um modelo distinto destes pesos servidos
conforme documentação oficial da Alibaba ↗
Use o Fun-ASR em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Sobre o Fun-ASR
- Ele aceita arquivos de até 12 horas e 2 GB, lida com jobs de arquivo único e em lote, e reconhece chinês (mandarim mais muitos dialetos regionais como cantonês, wu e hokkien), inglês, japonês, coreano e dezenas de outros idiomas.
- A documentação oficial destaca a personalização de hotwords para terminologia de domínio e a diarização de locutores para gravações com múltiplos falantes.
- Ambos vêm com detalhes práticos que vale conhecer de antemão: uma tabela de hotwords comporta até 500 entradas e serve para terminologia que muda raramente, a diarização fica desligada até você ativá-la e permite declarar uma contagem esperada de locutores, e a Alibaba recomenda manter o áudio diarizado abaixo de cerca de duas horas, ou o job pode expirar.
- A transcrição é assíncrona (envie o arquivo, receba um id de tarefa, consulte o resultado), e timestamps por sentença e por palavra em milissegundos voltam como padrão, ao lado de filtragem de palavras sensíveis e seleção por canal para gravações multipista.
- A rotulagem de emoção não faz parte deste modelo; isso pertence à linha Qwen3-ASR.
- Dicas de idioma são aceitas, mas a documentação nota que apenas o primeiro valor da lista é lido.
- A Synthorai serve o Fun-ASR pelo seu endpoint compatível com OpenAI, então os clientes de transcrição existentes funcionam sem modificação.
Perguntas frequentes
A API do Fun-ASR é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Fun-ASR com sua carga de trabalho real antes de adicionar um meio de pagamento.
Em que o Fun-ASR é melhor?
Aceita arquivos de até 12 horas; personalização de hotwords para terminologia de domínio; diarização de locutores para gravações com múltiplos falantes. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Fun-ASR?
Na Synthorai, o Fun-ASR custa $0.0021 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.
Quais idiomas o Fun-ASR suporta?
O Fun-ASR suporta Multilíngue com dialetos: 30 idiomas: chinês (mandarim, cantonês, wu, hokkien, hakka, gan, xiang, jin e sotaques regionais), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.
Como obtenho acesso ao Fun-ASR?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="fun-asr" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.