Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Paraformer Realtime v2

transcription

O Paraformer-Realtime-v2 é o modelo de reconhecimento de fala em tempo real de geração anterior do Alibaba Cloud, transmitindo áudio em entrada e transcrições em saída por uma conexão bidirecional.

Entrada
áudio
Saída
texto
Preço
$0.002/min

O preço em contexto

Posição do preço entre 11 modelos comparáveis

Por minuto$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Áudio

Idiomas 7 idiomas: chinês (mandarim, além de cantonês, wu, hokkien e 15 sotaques regionais), inglês, japonês, coreano, alemão, francês, russo
Limites de áudio
  • Streaming WebSocket em tempo real, duração ilimitada
  • hotwords + language_hints
  • timestamps por palavra e por sentença
  • dialetos do chinês/EN/JA/KO/DE/FR/RU
Transcrição em streaming Sim
Marcas de tempo Sim

Modelo

Modalidades áudio → texto

Geração Paraformer voltada a streaming, com personalização de hotwords e cobertura multilíngue.

conforme documentação oficial da Alibaba ↗

Use o Paraformer Realtime v2 em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="paraformer-realtime-v2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Sobre o Paraformer Realtime v2

  • Ele reconhece mandarim chinês junto a um conjunto incomumente amplo de dialetos regionais (cantonês, wu, hokkien, sichuan e mais), além de inglês, japonês, coreano, alemão, francês e russo, e suporta um parâmetro language_hints para guiar a detecção.
  • Essa é uma adição exclusiva da v2, assim como a aceitação de taxas de amostragem arbitrárias, onde a versão anterior exigia 16 kHz.
  • A documentação da Alibaba agora recomenda o Fun-ASR ou o Qwen-ASR para novos projetos, posicionando este modelo para integrações existentes.
  • O que o mantém utilizável é uma superfície de parâmetros madura: tabelas de hotwords para vocabulário de domínio, normalização inversa de texto ativada por padrão, predição de pontuação ativada por padrão com pontuação semântica opcional, um silêncio máximo de sentença configurável que encerra um enunciado, e um filtro opcional de disfluências que remove palavras de preenchimento (um controle que o modelo Fun-ASR realtime não documenta).
  • Timestamps por sentença e por palavra são retornados em milissegundos, e a conexão aceita PCM, WAV, MP3, Opus, Speex, AAC e AMR.
  • A diarização de locutores não é oferecida no caminho de tempo real, e não há reconhecimento de emoção.
  • Trate-o como um endpoint estável para pipelines já ajustados a ele, e não como o ponto de partida para trabalho novo.
  • A Synthorai continua a servi-lo pelo endpoint compatível com OpenAI.

Perguntas frequentes

A API do Paraformer Realtime v2 é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. É o suficiente para testar o Paraformer Realtime v2 com sua carga de trabalho real antes de adicionar um meio de pagamento.

Em que o Paraformer Realtime v2 é melhor?

Transmite áudio na entrada, transcrições na saída; cobertura incomumente ampla de dialetos regionais chineses; parâmetro language_hints guia a detecção. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o Paraformer Realtime v2?

Na Synthorai, o Paraformer Realtime v2 custa $0.002 por minuto de áudio transcrito: pagamento por uso, sem margem da plataforma, sem assinatura.

Quais idiomas o Paraformer Realtime v2 suporta?

O Paraformer Realtime v2 suporta 7 idiomas: chinês (mandarim, além de cantonês, wu, hokkien e 15 sotaques regionais), inglês, japonês, coreano, alemão, francês, russo. Na Synthorai, você o chama via POST /v1/audio/transcriptions, no mesmo formato da API de transcrição da OpenAI.

Como obtenho acesso ao Paraformer Realtime v2?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="paraformer-realtime-v2" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →