Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

nova-2-sonic

Lançado em 2025-12-02

beta por convite Chamada de ferramentas

O Amazon Nova 2 Sonic é o modelo fundacional de voz para voz (speech-to-speech) da Amazon para construir aplicações de conversa por voz naturais e em tempo real, e o guia do usuário do Nova o direciona a assistentes de voz interativos, automação de atendimento ao cliente e aplicações conversacionais.

Entrada
áudio texto $0.06/M
Saída
áudio texto $0.24/M
Entrada de áudio
$3/M
Saída de áudio
$12/M

Benchmarks

nova-2-sonic: 8 publicados, mas nenhum benchmark em comum com modelos suficientes para comparar.

nova-2-sonic outros modelos medidos média dos modelos comparados ★ nenhum outro modelo teve pontuação maior
AMI near+far field (WER)
29.7%
Big Bench Audio
87%
BFCL v3 (single-turn, python only)
74.5%

Publicado pelos provedores: Amazon OpenAI

O preço em contexto

Posição do preço entre 6 modelos comparáveis

Entrada$0.06/M
$0.06 · nova-2-sonic GPT Realtime · $4
Saída$0.24/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Nas extremidades aparecem o mais barato e o mais caro. São as tarifas base; os descontos de batch, região e escrita de cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do provedor) 1.000.000
Saída máxima (especificação do provedor) 64.000

Áudio

Idiomas Inglês (EUA, Reino Unido, Índia, Austrália), francês, italiano, alemão, espanhol, português e híndi, com detecção e troca automática de idioma no meio da sessão
Limites de áudio
  • Streaming bidirecional via InvokeModelWithBidirectionalStream
  • audio/lpcm, 16 bits, mono, base64, com 16 kHz na entrada e 24 kHz na saída
  • limite de conexão de 8 minutos, com um padrão documentado de continuação de sessão para conversas mais longas
  • inferência apenas dentro da região (us-east-1, us-west-2, eu-north-1, ap-northeast-1)
Transcrição em streaming Sim

Tempo real

Vozes Vozes de sonoridade feminina e masculina por locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN e hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR); tiffany e matthew são vozes poliglotas que falam todos os idiomas suportados.
Sessão
  • Alternância inteligente de turnos com sensibilidade de endpointing configurável
  • tratamento gracioso de interrupções sem perder o contexto
  • function calling com tratamento assíncrono de ferramentas (o assistente continua falando enquanto as ferramentas rodam)
  • grounding por RAG
  • entrada mista de áudio e texto em uma mesma conversa
  • limite de conexão de 8 minutos

Modelo

Modalidades áudio + texto → áudio + texto
  • Modelo fundacional de fala-para-fala da Amazon para aplicações de voz em tempo real, acessado por uma API de streaming bidirecional em vez de uma API de requisição/resposta. Adapta a entrega à prosódia da fala recebida e alterna de idioma dentro de uma mesma frase
  • documentado como robusto a ruído de fundo e a sotaques nos idiomas suportados

conforme documentação oficial da Amazon ↗

Use o nova-2-sonic em 30 segundos

Compatível com OpenAI Realtime: conecte-se por WebSocket e transmita áudio nos dois sentidos. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Sobre o nova-2-sonic

  • Ele é alcançado por uma API de streaming bidirecional em vez de uma de requisição e resposta, o que é o que torna possível a conversa de múltiplos turnos com baixa latência; a documentação oficial lista uma janela de contexto de 1M tokens e 64K tokens de saída máxima, com áudio e texto aceitos na mesma conversa e áudio e texto retornados.
  • A cobertura de vozes abrange inglês nas variedades americana, britânica, indiana e australiana, além de francês, italiano, alemão, espanhol, português e hindi, oferecidos em vozes de sonoridade masculina e feminina, com detecção e troca automáticas de idioma; vozes poliglotas falam qualquer idioma suportado, de modo que a persona permanece constante quando quem liga muda de idioma no meio da sessão.
  • O comportamento conversacional é o argumento de venda: a entrega se adapta à prosódia da fala recebida, a alternância inteligente de turnos detecta quando alguém terminou de falar, as interrupções são tratadas com naturalidade sem perder o contexto, e a documentação afirma robustez a ruído de fundo e a sotaques nos idiomas suportados.
  • Function calling e fluxos de trabalho agênticos são suportados, junto com o grounding de conhecimento em dados empresariais por geração aumentada por recuperação, e o tratamento assíncrono de ferramentas deixa o assistente continuar falando enquanto uma ferramenta roda em segundo plano.
  • Um limite a considerar no design: as conexões são limitadas a oito minutos, com um padrão documentado de renovação e continuação de sessão no código de exemplo para conversas mais longas.
  • A disponibilidade é limitada a um pequeno conjunto de regiões.
  • A Synthorai o serve pelo endpoint WebSocket /v1/realtime compatível com OpenAI, então clientes do SDK oficial de Realtime conectam sem alterações.

Perguntas frequentes

A API do nova-2-sonic é gratuita para testar?

O nova-2-sonic está em beta por convite: o acesso depende de solicitação, e não de cadastro aberto. Peça pelo console da Synthorai; depois da aprovação, vale o preço normal de pagamento por uso, sem assinatura.

Em que o nova-2-sonic é melhor?

Modelo de voz para voz para conversa por voz em tempo real; vozes poliglotas mantêm uma persona nas trocas de idioma; conexões limitadas a oito minutos com padrão de renovação documentado. Veja na seção Sobre o quadro completo, tirado das notas de lançamento do próprio provedor.

Quanto custa o nova-2-sonic?

Na Synthorai, o nova-2-sonic custa $0.06 por milhão de tokens de entrada e $0.24 por milhão de tokens de saída. É o preço de tabela do provedor, sem markup da plataforma.

Como me conecto à API do nova-2-sonic?

O nova-2-sonic é um modelo de voz para voz (speech-to-speech): conecte-se por WebSocket a wss://synthorai.io/v1/realtime?model=nova-2-sonic com o SDK OpenAI Realtime (ou um WebSocket puro) e transmita o áudio nos dois sentidos. Não se trata de um upload de arquivo via POST /v1/audio/transcriptions. Autentique-se com a sua chave sk-syn e envie apenas o cabeçalho Authorization (o protocolo beta foi descontinuado).

Como obtenho acesso ao nova-2-sonic?

O nova-2-sonic está em beta por convite: solicite acesso pelo console da Synthorai. Após a aprovação, ele funciona como qualquer outro modelo: aponte seu SDK da OpenAI para base_url="https://synthorai.io/v1" e defina model="nova-2-sonic".

Modelos relacionados

Comparar

Cada valor desta página foi transcrito da documentação do provedor, com link acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; já as especificações que cada provedor define de um jeito aparecem com a diferença indicada, em vez de irem para um gráfico. Nada aqui foi medido por nós, e nada recebe nota.

Obtenha sua chave de API Compare seu custo →