O Fun-ASR Flash é a variante offline rápida da família de reconhecimento de fala Fun-ASR da Alibaba, criada para transcrever gravações curtas de até cinco minutos.
- Entrada
- áudio
- Saída
- texto
- Preço
- $0.0021/min
O preço em contexto
Posição do preço entre 11 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Áudio
| Idiomas | Multilíngue com dialetos: a mesma lista de 30 idiomas das versões principais do Fun-ASR: chinês (mandarim, cantonês, wu, hokkien, hakka, gan, xiang, jin e sotaques regionais), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco |
|---|---|
| Limites de áudio |
|
| Diarização | Não |
| Transcrição em streaming | Sim |
Modelo
| Modalidades | áudio → texto |
|---|
Nível síncrono rápido da família Fun-ASR.
conforme documentação oficial da Alibaba ↗
Use o Fun-ASR Flash em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Sobre o Fun-ASR Flash
- Seu recurso distintivo, segundo a documentação oficial, é a injeção de contexto por prompt: em vez de manter listas de hotwords, você fornece a terminologia de domínio diretamente em um prompt para guiar a precisão do reconhecimento.
- É o único modelo da família documentado para isso, aceitando até cinco rodadas de contexto com algumas centenas de caracteres cada, o que combina com terminologia que muda a cada chamada em vez de a cada projeto.
- Ele mantém a ampla cobertura de idiomas da família, abrangendo chinês com dialetos regionais, inglês, japonês, coreano e muitos idiomas europeus e do Sudeste Asiático.
- O resto da troca em relação ao modelo base é igualmente concreto: as chamadas são síncronas com resultados em streaming em vez de enviar e consultar, então um clipe curto retorna na própria requisição em vez de por um id de tarefa, mas o teto de cinco minutos substitui o de doze horas (o limite de 2 GB por arquivo permanece, então a duração é o que restringe aqui), e a diarização de locutores não está disponível.
- Lidas em conjunto, a escolha dentro da família fica limpa: Fun-ASR para arquivos longos, com múltiplos locutores e vocabulário estável; Fun-ASR Flash para clipes curtos que precisam de uma resposta rápida e de terminologia por requisição.
- Na Synthorai, está disponível pela superfície de API compatível com OpenAI padrão.
Perguntas frequentes
A API do Fun-ASR Flash é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Fun-ASR Flash com sua carga de trabalho real antes de adicionar um meio de pagamento.
Em que o Fun-ASR Flash é melhor?
Injeção de contexto por prompt em vez de hotwords; transcreve gravações curtas de até cinco minutos; cobertura ampla incluindo dialetos regionais chineses. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o Fun-ASR Flash?
Na Synthorai, o Fun-ASR Flash custa $0.0021 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.
Quais idiomas o Fun-ASR Flash suporta?
O Fun-ASR Flash suporta Multilíngue com dialetos: a mesma lista de 30 idiomas das versões principais do Fun-ASR: chinês (mandarim, cantonês, wu, hokkien, hakka, gan, xiang, jin e sotaques regionais), inglês, japonês, coreano, vietnamita, tailandês, indonésio, malaio, filipino, híndi, árabe, francês, alemão, espanhol, português, russo, italiano, holandês, sueco, dinamarquês, finlandês, norueguês, grego, polonês, tcheco, húngaro, romeno, búlgaro, croata, eslovaco. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.
Como obtenho acesso ao Fun-ASR Flash?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="fun-asr-flash" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.