Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

nova-2-sonic

Veröffentlicht 2025-12-02

geschlossene Beta Tool-Aufrufe

Amazon Nova 2 Sonic ist Amazons Speech-to-Speech-Foundation-Modell zum Bau natürlicher Echtzeit-Sprachkonversationsanwendungen, und der Nova User Guide richtet es auf interaktive Sprachassistenten, Automatisierung im Kundenservice und dialogorientierte Anwendungen aus.

Eingabe
Audio Text $0.06/M
Ausgabe
Audio Text $0.24/M
Audio-Eingabe
$3/M
Audio-Ausgabe
$12/M

Benchmarks

nova-2-sonic: 8 veröffentlicht, aber kein Benchmark, den genug andere Modelle teilen.

nova-2-sonic weitere gemessene Modelle Durchschnitt der Vergleichsmodelle ★ kein anderes Modell war besser
AMI near+far field (WER)
29.7%
Big Bench Audio
87%
BFCL v3 (single-turn, python only)
74.5%

Anbieterangaben: Amazon OpenAI

Preis im Vergleich

Der Preis im Feld von 6 vergleichbaren Modellen

Eingabe$0.06/M
$0.06 · nova-2-sonic GPT Realtime · $4
Ausgabe$0.24/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Angegeben sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibzugriffe stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (laut Anbieter) 1.000.000
Max. Ausgabe (laut Anbieter) 64.000

Audio

Sprachen Englisch (US, UK, Indien, Australien), Französisch, Italienisch, Deutsch, Spanisch, Portugiesisch und Hindi, mit automatischer Spracherkennung und Sprachwechsel mitten in der Sitzung
Audio-Limits
  • Bidirektionales Streaming über InvokeModelWithBidirectionalStream
  • audio/lpcm, 16-Bit, mono, base64, mit 16 kHz Input und 24 kHz Output
  • Verbindungslimit von 8 Minuten, mit einem dokumentierten Muster zur Sitzungsfortführung für längere Gespräche
  • Inferenz nur innerhalb der Region (us-east-1, us-west-2, eu-north-1, ap-northeast-1)
Streaming-Transkription Ja

Echtzeit

Stimmen Weiblich und männlich klingende Stimmen je Locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN und hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR); tiffany und matthew sind polyglotte Stimmen, die jede unterstützte Sprache sprechen.
Sitzung
  • Intelligenter Sprecherwechsel mit konfigurierbarer Endpointing-Empfindlichkeit
  • elegante Unterbrechungsbehandlung ohne Kontextverlust
  • Function Calling mit asynchroner Tool-Abwicklung (der Assistent spricht weiter, während Tools laufen)
  • RAG-Grounding
  • gemischte Audio- und Texteingabe in einem Gespräch
  • Verbindungslimit von 8 Minuten

Modell

Modalitäten Audio + Text → Audio + Text
  • Amazons Speech-to-Speech-Foundation-Model für Echtzeit-Sprachanwendungen, erreichbar über eine bidirektionale Streaming-API statt über Request/Response. Es passt seinen Vortrag an die Prosodie der eingehenden Sprache an und wechselt die Sprache innerhalb eines einzigen Satzes
  • dokumentiert als robust gegenüber Hintergrundgeräuschen und gegenüber Akzenten in den unterstützten Sprachen

laut Offizielle Amazon-Dokumentation ↗

nova-2-sonic in 30 Sekunden nutzen

OpenAI-Realtime-kompatibel: per WebSocket verbinden, Audio rein, Audio raus. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Über nova-2-sonic

  • Es wird über eine bidirektionale Streaming-API statt über eine Request-Response-API erreicht, was mehrstufige Konversation mit niedriger Latenz erst möglich macht; die offizielle Dokumentation nennt ein Kontextfenster von 1M Token und 64K maximale Output-Token, wobei Audio und Text in derselben Konversation akzeptiert sowie Audio und Text zurückgegeben werden.
  • Die Stimmabdeckung umfasst Englisch in amerikanischer, britischer, indischer und australischer Ausprägung sowie Französisch, Italienisch, Deutsch, Spanisch, Portugiesisch und Hindi, angeboten in männlich und weiblich klingenden Stimmen, mit automatischer Spracherkennung und -umschaltung; polyglotte Stimmen sprechen jede unterstützte Sprache, sodass die Persona konstant bleibt, wenn eine anrufende Person mitten in der Sitzung die Sprache wechselt.
  • Das Konversationsverhalten ist das Verkaufsargument: Die Vortragsweise passt sich der Prosodie der eingehenden Sprache an, intelligentes Turn-Taking erkennt, wann eine sprechende Person fertig ist, Unterbrechungen werden ohne Kontextverlust sauber behandelt, und die Dokumentation beansprucht Robustheit gegenüber Hintergrundgeräuschen und gegenüber Akzenten in unterstützten Sprachen.
  • Function Calling und agentische Workflows werden unterstützt, ebenso Knowledge Grounding auf Unternehmensdaten per Retrieval-Augmented Generation, und asynchrone Tool-Behandlung lässt den Assistenten weitersprechen, während ein Tool im Hintergrund läuft.
  • Eine Grenze ist einzuplanen: Verbindungen sind auf acht Minuten begrenzt, mit einem im Beispielcode dokumentierten Muster für Erneuerung und Sitzungsfortsetzung bei längeren Gesprächen.
  • Die Verfügbarkeit ist auf wenige Regionen beschränkt.
  • Synthorai stellt es über den OpenAI-kompatiblen /v1/realtime WebSocket-Endpoint bereit, sodass offizielle Realtime-SDK-Clients unverändert verbinden.

FAQ

Lässt sich die nova-2-sonic API kostenlos testen?

nova-2-sonic ist derzeit in einer geschlossenen Beta: Den Zugang erhalten Sie auf Antrag, eine offene Registrierung gibt es nicht. Stellen Sie den Antrag in der Synthorai-Konsole. Nach der Freigabe gilt die übliche nutzungsbasierte Abrechnung ohne Abo.

Worin ist nova-2-sonic am besten?

Speech-to-Speech-Modell für Echtzeit-Sprachkonversation; polyglotte Stimmen halten eine Persona über Sprachwechsel hinweg; Verbindungen auf acht Minuten begrenzt, mit dokumentiertem Erneuerungsmuster. Mehr dazu im Über-Abschnitt, der auf den offiziellen Release Notes des Anbieters beruht.

Was kostet nova-2-sonic?

nova-2-sonic kostet auf Synthorai $0.06 pro Million Eingabe-Tokens und $0.24 pro Million Ausgabe-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattformaufschlag.

Wie rufe ich die nova-2-sonic-API auf?

nova-2-sonic ist ein Speech-to-Speech-Modell: Verbinden Sie sich mit dem OpenAI Realtime SDK (oder direkt per WebSocket) mit wss://synthorai.io/v1/realtime?model=nova-2-sonic und streamen Sie Audio in beide Richtungen. Ein Datei-Upload per POST /v1/audio/transcriptions ist das nicht. Authentifizieren Sie sich mit Ihrem sk-syn-Schlüssel und senden Sie nur den Authorization-Header (das Beta-Protokoll ist abgeschaltet).

Wie erhalte ich Zugang zu nova-2-sonic?

nova-2-sonic ist in einer geschlossenen Beta. Beantragen Sie den Zugang in der Synthorai-Konsole. Nach der Freigabe nutzen Sie es wie jedes andere Modell: im OpenAI SDK base_url="https://synthorai.io/v1" und model="nova-2-sonic" setzen.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite stammt aus der oben verlinkten Dokumentation des Anbieters und trägt das Datum, an dem wir ihn geprüft haben. Preise vergleichen wir über den gesamten Katalog. Spezifikationen, die Anbieter unterschiedlich definieren, zeigen wir mit einem Hinweis auf den Unterschied und nicht als Diagramm. Wir messen hier nichts selbst und vergeben keine Bewertungen.

API-Schlüssel erstellen Ihre Kosten vergleichen →