Amazon Nova 2 Sonic ist Amazons Speech-to-Speech-Foundation-Modell zum Bau natürlicher Echtzeit-Sprachkonversationsanwendungen, und der Nova User Guide richtet es auf interaktive Sprachassistenten, Automatisierung im Kundenservice und dialogorientierte Anwendungen aus.
- Eingabe
- Audio Text $0.06/M
- Ausgabe
- Audio Text $0.24/M
- Audio-Input
- $3/M
- Audio-Output
- $12/M
Listenpreise der Anbieter, ohne Plattform-Aufschlag, nutzungsbasierte Abrechnung. Dies sind offizielle Listenpreise. Angemeldete Kunden sehen auf /console/pricing die effektiven Preise inklusive Workspace-Rabatten.
Preis · Position unter 6 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 1.000.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 64.000 |
Audio
| Sprachen | Englisch (US, UK, Indien, Australien), Französisch, Italienisch, Deutsch, Spanisch, Portugiesisch und Hindi, mit automatischer Spracherkennung und Sprachwechsel mitten in der Sitzung |
|---|---|
| Audio-Limits |
|
| Streaming-Transkription | Ja |
Realtime
| Stimmen | Weiblich und männlich klingende Stimmen je Locale (tiffany/matthew en-US, amy en-GB, olivia en-AU, kiara/arjun en-IN und hi-IN, ambre/florian fr-FR, beatrice/lorenzo it-IT, tina/lennart de-DE, lupe/carlos es-US, carolina/leo pt-BR); tiffany und matthew sind polyglotte Stimmen, die jede unterstützte Sprache sprechen. |
|---|---|
| Sitzung |
|
Modell
| Modalitäten | Audio + Text → Audio + Text |
|---|
- Amazons Speech-to-Speech-Foundation-Model für Echtzeit-Sprachanwendungen, erreichbar über eine bidirektionale Streaming-API statt über Request/Response. Es passt seinen Vortrag an die Prosodie der eingehenden Sprache an und wechselt die Sprache innerhalb eines einzigen Satzes
- dokumentiert als robust gegenüber Hintergrundgeräuschen und gegenüber Akzenten in den unterstützten Sprachen
nova-2-sonic in 30 Sekunden nutzen
OpenAI-Realtime-kompatibel: per WebSocket verbinden, Audio rein, Audio raus. WS /v1/realtime
import asyncio, base64, json, websockets
URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"
# Send ONLY the Authorization header — the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}
async def main():
async with websockets.connect(URL, additional_headers=HEADERS) as ws:
# 1) configure the speech-to-speech session
await ws.send(json.dumps({
"type": "session.update",
"session": {
"type": "realtime",
"output_modalities": ["audio"],
"audio": {"output": {"voice": "alloy"}},
},
}))
# 2) send input audio (base64 PCM16), then request a spoken reply
await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
await ws.send(json.dumps({"type": "response.create"}))
# 3) stream the model's audio (and text) back
async for raw in ws:
ev = json.loads(raw)
if ev["type"] == "response.audio.delta":
play(base64.b64decode(ev["delta"])) # audio out
elif ev["type"] == "response.done":
break
asyncio.run(main())import WebSocket from "ws";
const ws = new WebSocket("wss://synthorai.io/v1/realtime?model=nova-2-sonic", {
// Send ONLY the Authorization header — the beta protocol is retired.
headers: { Authorization: "Bearer sk-syn-..." },
});
ws.on("open", () => {
// configure the speech-to-speech session
ws.send(JSON.stringify({ type: "session.update", session: {
type: "realtime", output_modalities: ["audio"], audio: { output: { voice: "alloy" } },
} }));
// send input audio (base64 PCM16), then request a spoken reply
ws.send(JSON.stringify({ type: "input_audio_buffer.append", audio: pcm16Base64 }));
ws.send(JSON.stringify({ type: "input_audio_buffer.commit" }));
ws.send(JSON.stringify({ type: "response.create" }));
});
ws.on("message", (raw) => {
const ev = JSON.parse(raw.toString());
if (ev.type === "response.audio.delta") playAudio(Buffer.from(ev.delta, "base64")); // audio out
else if (ev.type === "response.done") ws.close();
});# Realtime is a WebSocket protocol — use a WS client such as websocat.
# Each line below is one OpenAI Realtime event (JSON) sent to the session.
websocat -H 'Authorization: Bearer sk-syn-...' \
'wss://synthorai.io/v1/realtime?model=nova-2-sonic' <<'EOF'
{"type":"session.update","session":{"type":"realtime","output_modalities":["audio"],"audio":{"output":{"voice":"alloy"}}}}
{"type":"input_audio_buffer.append","audio":"<base64-pcm16>"}
{"type":"input_audio_buffer.commit"}
{"type":"response.create"}
EOF
# Responses stream back as response.audio.delta (base64 audio out) … response.donepackage main
import (
"net/http"
"github.com/gorilla/websocket"
)
func main() {
h := http.Header{}
h.Set("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
c, _, err := websocket.DefaultDialer.Dial("wss://synthorai.io/v1/realtime?model=nova-2-sonic", h)
if err != nil {
panic(err)
}
defer c.Close()
// configure the speech-to-speech session, send audio, request a spoken reply
c.WriteJSON(map[string]any{"type": "session.update", "session": map[string]any{
"type": "realtime", "output_modalities": []string{"audio"},
"audio": map[string]any{"output": map[string]any{"voice": "alloy"}}}})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.append", "audio": pcm16B64})
c.WriteJSON(map[string]any{"type": "input_audio_buffer.commit"})
c.WriteJSON(map[string]any{"type": "response.create"})
for {
var ev struct {
Type string `json:"type"`
Delta string `json:"delta"`
}
if err := c.ReadJSON(&ev); err != nil {
return
}
if ev.Type == "response.audio.delta" {
playAudio(ev.Delta) // base64 audio out
} else if ev.Type == "response.done" {
return
}
}
}import java.net.URI;
import java.net.http.HttpClient;
import java.net.http.WebSocket;
import java.util.concurrent.CompletionStage;
// JDK built-in WebSocket — no extra dependency needed.
WebSocket ws = HttpClient.newHttpClient().newWebSocketBuilder()
.header("Authorization", "Bearer sk-syn-...")
// Send ONLY the Authorization header — the beta protocol is retired.
.buildAsync(URI.create("wss://synthorai.io/v1/realtime?model=nova-2-sonic"), new WebSocket.Listener() {
public CompletionStage<?> onText(WebSocket w, CharSequence data, boolean last) {
// handle response.audio.delta (base64 audio out) / response.done here
w.request(1);
return null;
}
}).join();
// configure the session, send input audio, then request a spoken reply
ws.sendText("{\"type\":\"session.update\",\"session\":{\"type\":\"realtime\",\"output_modalities\":[\"audio\"],\"audio\":{\"output\":{\"voice\":\"alloy\"}}}}", true);
ws.sendText("{\"type\":\"input_audio_buffer.append\",\"audio\":\"<base64-pcm16>\"}", true);
ws.sendText("{\"type\":\"input_audio_buffer.commit\"}", true);
ws.sendText("{\"type\":\"response.create\"}", true);Über nova-2-sonic
- Es wird über eine bidirektionale Streaming-API statt über eine Request-Response-API erreicht, was mehrstufige Konversation mit niedriger Latenz erst möglich macht; die offizielle Dokumentation nennt ein Kontextfenster von 1M Token und 64K maximale Output-Token, wobei Audio und Text in derselben Konversation akzeptiert sowie Audio und Text zurückgegeben werden.
- Die Stimmabdeckung umfasst Englisch in amerikanischer, britischer, indischer und australischer Ausprägung sowie Französisch, Italienisch, Deutsch, Spanisch, Portugiesisch und Hindi, angeboten in männlich und weiblich klingenden Stimmen, mit automatischer Spracherkennung und -umschaltung; polyglotte Stimmen sprechen jede unterstützte Sprache, sodass die Persona konstant bleibt, wenn eine anrufende Person mitten in der Sitzung die Sprache wechselt.
- Das Konversationsverhalten ist das Verkaufsargument: Die Vortragsweise passt sich der Prosodie der eingehenden Sprache an, intelligentes Turn-Taking erkennt, wann eine sprechende Person fertig ist, Unterbrechungen werden ohne Kontextverlust sauber behandelt, und die Dokumentation beansprucht Robustheit gegenüber Hintergrundgeräuschen und gegenüber Akzenten in unterstützten Sprachen.
- Function Calling und agentische Workflows werden unterstützt, ebenso Knowledge Grounding auf Unternehmensdaten per Retrieval-Augmented Generation, und asynchrone Tool-Behandlung lässt den Assistenten weitersprechen, während ein Tool im Hintergrund läuft.
- Eine Grenze ist einzuplanen: Verbindungen sind auf acht Minuten begrenzt, mit einem im Beispielcode dokumentierten Muster für Erneuerung und Sitzungsfortsetzung bei längeren Gesprächen.
- Die Verfügbarkeit ist auf wenige Regionen beschränkt.
- Synthorai stellt es über den OpenAI-kompatiblen /v1/realtime WebSocket-Endpoint bereit, sodass offizielle Realtime-SDK-Clients unverändert verbinden.
FAQ
Lässt sich die nova-2-sonic API kostenlos testen?
nova-2-sonic befindet sich derzeit in einer geschlossenen Beta. Der Zugang läuft über eine Bewerbung statt offener Registrierung. Beantragen Sie den Zugang in der Synthorai-Konsole; nach der Freigabe gilt die standardmäßige nutzungsbasierte Abrechnung ohne Abo.
Worin ist nova-2-sonic am besten?
Speech-to-Speech-Modell für Echtzeit-Sprachkonversation; polyglotte Stimmen halten eine Persona über Sprachwechsel hinweg; Verbindungen auf acht Minuten begrenzt, mit dokumentiertem Erneuerungsmuster. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet nova-2-sonic?
nova-2-sonic kostet auf Synthorai $0.06 pro Million Input-Tokens und $0.24 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.
Wie rufe ich die nova-2-sonic-API auf?
nova-2-sonic ist ein Speech-to-Speech-Modell: Verbinden Sie sich per WebSocket mit wss://synthorai.io/v1/realtime?model=nova-2-sonic über das OpenAI Realtime SDK (oder einen rohen WebSocket) und streamen Sie Audio ein und aus. Es ist kein POST /v1/audio/transcriptions Datei-Upload. Authentifizieren Sie sich mit Ihrem sk-syn-Key und senden Sie nur den Authorization-Header (das Beta-Protokoll ist abgeschaltet).
Wie erhalte ich Zugang zu nova-2-sonic?
nova-2-sonic ist in geschlossener Beta: Beantragen Sie den Zugang in der Synthorai-Konsole. Nach der Freigabe funktioniert es wie jedes andere Modell: Richten Sie Ihr OpenAI SDK auf base_url="https://synthorai.io/v1" und setzen Sie model="nova-2-sonic".
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.