🎁 Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

nova-2-sonic

Veröffentlicht 2025-12-02

geschlossene Beta Tool-Aufrufe

Amazon Nova 2 Sonic ist Amazons Speech-to-Speech-Foundation-Modell zum Bau natürlicher Echtzeit-Sprachkonversationsanwendungen, und der Nova User Guide richtet es auf interaktive Sprachassistenten, Automatisierung im Kundenservice und dialogorientierte Anwendungen aus.

Eingabe
Audio Text $0.06/M
Ausgabe
Audio Text $0.24/M
Audio-Input
$3/M
Audio-Output
$12/M

Listenpreise der Anbieter, ohne Plattform-Aufschlag, nutzungsbasierte Abrechnung. Dies sind offizielle Listenpreise. Angemeldete Kunden sehen auf /console/pricing die effektiven Preise inklusive Workspace-Rabatten.

Preis · Position unter 6 vergleichbaren Modellen

Eingabe$0.06/M
$0.06 · nova-2-sonic GPT Realtime · $4
Ausgabe$0.24/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe) 1.000.000
Max. Output (Anbieter-Spezifikation) 64.000

Audio

Sprachen Englisch (US, UK, Indien, Australien), Französisch, Italienisch, Deutsch, Spanisch, Portugiesisch und Hindi, mit automatischer Spracherkennung und Sprachwechsel mitten in der Sitzung
Audio-Limits
  • Bidirektionales Streaming über InvokeModelWithBidirectionalStream
  • audio/lpcm, 16-Bit, mono, base64, mit 16 kHz Input und 24 kHz Output
  • Verbindungslimit von 8 Minuten, mit einem dokumentierten Muster zur Sitzungsfortführung für längere Gespräche
  • Inferenz nur innerhalb der Region (us-east-1, us-west-2, eu-north-1, ap-northeast-1)
Streaming-Transkription Ja

Realtime

Stimmen Weiblich und männlich klingende Stimmen je Locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN und hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR); tiffany und matthew sind polyglotte Stimmen, die jede unterstützte Sprache sprechen.
Sitzung
  • Intelligenter Sprecherwechsel mit konfigurierbarer Endpointing-Empfindlichkeit
  • elegante Unterbrechungsbehandlung ohne Kontextverlust
  • Function Calling mit asynchroner Tool-Abwicklung (der Assistent spricht weiter, während Tools laufen)
  • RAG-Grounding
  • gemischte Audio- und Texteingabe in einem Gespräch
  • Verbindungslimit von 8 Minuten

Modell

Modalitäten Audio + Text → Audio + Text
  • Amazons Speech-to-Speech-Foundation-Model für Echtzeit-Sprachanwendungen, erreichbar über eine bidirektionale Streaming-API statt über Request/Response. Es passt seinen Vortrag an die Prosodie der eingehenden Sprache an und wechselt die Sprache innerhalb eines einzigen Satzes
  • dokumentiert als robust gegenüber Hintergrundgeräuschen und gegenüber Akzenten in den unterstützten Sprachen

laut Offizielle Amazon-Dokumentation ↗

nova-2-sonic in 30 Sekunden nutzen

OpenAI-Realtime-kompatibel: per WebSocket verbinden, Audio rein, Audio raus. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

Über nova-2-sonic

  • Es wird über eine bidirektionale Streaming-API statt über eine Request-Response-API erreicht, was mehrstufige Konversation mit niedriger Latenz erst möglich macht; die offizielle Dokumentation nennt ein Kontextfenster von 1M Token und 64K maximale Output-Token, wobei Audio und Text in derselben Konversation akzeptiert sowie Audio und Text zurückgegeben werden.
  • Die Stimmabdeckung umfasst Englisch in amerikanischer, britischer, indischer und australischer Ausprägung sowie Französisch, Italienisch, Deutsch, Spanisch, Portugiesisch und Hindi, angeboten in männlich und weiblich klingenden Stimmen, mit automatischer Spracherkennung und -umschaltung; polyglotte Stimmen sprechen jede unterstützte Sprache, sodass die Persona konstant bleibt, wenn eine anrufende Person mitten in der Sitzung die Sprache wechselt.
  • Das Konversationsverhalten ist das Verkaufsargument: Die Vortragsweise passt sich der Prosodie der eingehenden Sprache an, intelligentes Turn-Taking erkennt, wann eine sprechende Person fertig ist, Unterbrechungen werden ohne Kontextverlust sauber behandelt, und die Dokumentation beansprucht Robustheit gegenüber Hintergrundgeräuschen und gegenüber Akzenten in unterstützten Sprachen.
  • Function Calling und agentische Workflows werden unterstützt, ebenso Knowledge Grounding auf Unternehmensdaten per Retrieval-Augmented Generation, und asynchrone Tool-Behandlung lässt den Assistenten weitersprechen, während ein Tool im Hintergrund läuft.
  • Eine Grenze ist einzuplanen: Verbindungen sind auf acht Minuten begrenzt, mit einem im Beispielcode dokumentierten Muster für Erneuerung und Sitzungsfortsetzung bei längeren Gesprächen.
  • Die Verfügbarkeit ist auf wenige Regionen beschränkt.
  • Synthorai stellt es über den OpenAI-kompatiblen /v1/realtime WebSocket-Endpoint bereit, sodass offizielle Realtime-SDK-Clients unverändert verbinden.

FAQ

Lässt sich die nova-2-sonic API kostenlos testen?

nova-2-sonic befindet sich derzeit in einer geschlossenen Beta. Der Zugang läuft über eine Bewerbung statt offener Registrierung. Beantragen Sie den Zugang in der Synthorai-Konsole; nach der Freigabe gilt die standardmäßige nutzungsbasierte Abrechnung ohne Abo.

Worin ist nova-2-sonic am besten?

Speech-to-Speech-Modell für Echtzeit-Sprachkonversation; polyglotte Stimmen halten eine Persona über Sprachwechsel hinweg; Verbindungen auf acht Minuten begrenzt, mit dokumentiertem Erneuerungsmuster. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet nova-2-sonic?

nova-2-sonic kostet auf Synthorai $0.06 pro Million Input-Tokens und $0.24 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.

Wie rufe ich die nova-2-sonic-API auf?

nova-2-sonic ist ein Speech-to-Speech-Modell: Verbinden Sie sich per WebSocket mit wss://synthorai.io/v1/realtime?model=nova-2-sonic über das OpenAI Realtime SDK (oder einen rohen WebSocket) und streamen Sie Audio ein und aus. Es ist kein POST /v1/audio/transcriptions Datei-Upload. Authentifizieren Sie sich mit Ihrem sk-syn-Key und senden Sie nur den Authorization-Header (das Beta-Protokoll ist abgeschaltet).

Wie erhalte ich Zugang zu nova-2-sonic?

nova-2-sonic ist in geschlossener Beta: Beantragen Sie den Zugang in der Synthorai-Konsole. Nach der Freigabe funktioniert es wie jedes andere Modell: Richten Sie Ihr OpenAI SDK auf base_url="https://synthorai.io/v1" und setzen Sie model="nova-2-sonic".

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

Kostenlosen API-Key holen Ihre Kosten vergleichen →