🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

nova-2-sonic

Lançado em 2025-12-02

beta por convite Chamada de ferramentas

O Amazon Nova 2 Sonic é o modelo fundacional de voz para voz (speech-to-speech) da Amazon para construir aplicações de conversa por voz naturais e em tempo real, e o guia do usuário do Nova o direciona a assistentes de voz interativos, automação de atendimento ao cliente e aplicações conversacionais.

Entrada
áudio texto $0.06/M
Saída
áudio texto $0.24/M
Entrada de áudio
$3/M
Saída de áudio
$12/M

Preços de tabela do provedor: sem margem da plataforma, pagamento por uso. Estes são os preços de tabela oficiais. Clientes autenticados podem ver os preços efetivos com descontos do espaço de trabalho em /console/pricing.

Preço · posição entre 6 modelos comparáveis

Entrada$0.06/M
$0.06 · nova-2-sonic GPT Realtime · $4
Saída$0.24/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.000.000
Saída máxima (especificação do fornecedor) 64.000

Áudio

Idiomas Inglês (EUA, Reino Unido, Índia, Austrália), francês, italiano, alemão, espanhol, português e híndi, com detecção e troca automática de idioma no meio da sessão
Limites de áudio
  • Streaming bidirecional via InvokeModelWithBidirectionalStream
  • audio/lpcm, 16 bits, mono, base64, com 16 kHz na entrada e 24 kHz na saída
  • limite de conexão de 8 minutos, com um padrão documentado de continuação de sessão para conversas mais longas
  • inferência apenas dentro da região (us-east-1, us-west-2, eu-north-1, ap-northeast-1)
Transcrição em streaming Sim

Tempo real

Vozes Vozes de sonoridade feminina e masculina por locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN e hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR); tiffany e matthew são vozes poliglotas que falam todos os idiomas suportados.
Sessão
  • Alternância inteligente de turnos com sensibilidade de endpointing configurável
  • tratamento gracioso de interrupções sem perder o contexto
  • function calling com tratamento assíncrono de ferramentas (o assistente continua falando enquanto as ferramentas rodam)
  • grounding por RAG
  • entrada mista de áudio e texto em uma mesma conversa
  • limite de conexão de 8 minutos

Modelo

Modalidades áudio + texto → áudio + texto
  • Modelo fundacional de fala-para-fala da Amazon para aplicações de voz em tempo real, acessado por uma API de streaming bidirecional em vez de uma API de requisição/resposta. Adapta a entrega à prosódia da fala recebida e alterna de idioma dentro de uma mesma frase
  • documentado como robusto a ruído de fundo e a sotaques nos idiomas suportados

conforme documentação oficial da Amazon ↗

Use o nova-2-sonic em 30 segundos

Compatível com OpenAI Realtime: conecte-se por WebSocket, áudio de entrada e de saída. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Sobre o nova-2-sonic

  • Ele é alcançado por uma API de streaming bidirecional em vez de uma de requisição e resposta, o que é o que torna possível a conversa de múltiplos turnos com baixa latência; a documentação oficial lista uma janela de contexto de 1M tokens e 64K tokens de saída máxima, com áudio e texto aceitos na mesma conversa e áudio e texto retornados.
  • A cobertura de vozes abrange inglês nas variedades americana, britânica, indiana e australiana, além de francês, italiano, alemão, espanhol, português e hindi, oferecidos em vozes de sonoridade masculina e feminina, com detecção e troca automáticas de idioma; vozes poliglotas falam qualquer idioma suportado, de modo que a persona permanece constante quando quem liga muda de idioma no meio da sessão.
  • O comportamento conversacional é o argumento de venda: a entrega se adapta à prosódia da fala recebida, a alternância inteligente de turnos detecta quando alguém terminou de falar, as interrupções são tratadas com naturalidade sem perder o contexto, e a documentação afirma robustez a ruído de fundo e a sotaques nos idiomas suportados.
  • Function calling e fluxos de trabalho agênticos são suportados, junto com o grounding de conhecimento em dados empresariais por geração aumentada por recuperação, e o tratamento assíncrono de ferramentas deixa o assistente continuar falando enquanto uma ferramenta roda em segundo plano.
  • Um limite a considerar no design: as conexões são limitadas a oito minutos, com um padrão documentado de renovação e continuação de sessão no código de exemplo para conversas mais longas.
  • A disponibilidade é limitada a um pequeno conjunto de regiões.
  • A Synthorai o serve pelo endpoint WebSocket /v1/realtime compatível com OpenAI, então clientes do SDK oficial de Realtime conectam sem alterações.

Perguntas frequentes

A API do nova-2-sonic é gratuita para testar?

O nova-2-sonic está atualmente em beta por convite: o acesso é por solicitação, não por cadastro aberto. Solicite pelo console da Synthorai; após a aprovação, aplica-se o preço padrão de pagamento por uso, sem assinatura.

Em que o nova-2-sonic é melhor?

Modelo de voz para voz para conversa por voz em tempo real; vozes poliglotas mantêm uma persona nas trocas de idioma; conexões limitadas a oito minutos com padrão de renovação documentado. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o nova-2-sonic?

Na Synthorai, o nova-2-sonic custa $0.06 por milhão de tokens de entrada e $0.24 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.

Como chamar a API do nova-2-sonic?

nova-2-sonic é um modelo speech-to-speech: conecte-se por WebSocket a wss://synthorai.io/v1/realtime?model=nova-2-sonic com o SDK OpenAI Realtime (ou um WebSocket puro) e transmita áudio de entrada e de saída. Não é um upload de arquivo POST /v1/audio/transcriptions. Autentique-se com a sua chave sk-syn e envie apenas o cabeçalho Authorization (o protocolo beta foi descontinuado).

Como obtenho acesso ao nova-2-sonic?

O nova-2-sonic está em beta por convite: solicite acesso pelo console da Synthorai. Após a aprovação, ele funciona como qualquer outro modelo: aponte seu SDK da OpenAI para base_url="https://synthorai.io/v1" e defina model="nova-2-sonic".

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave de API gratuita Compare seu custo →