新帳號 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

nova-2-sonic

發布於 2025-12-02

邀請制測試 工具呼叫

Amazon Nova 2 Sonic 是 Amazon 用於打造自然、即時語音對話應用的語音對語音(speech-to-speech)基礎模型,Nova 使用者指南把它定位於互動式語音助理、客服自動化與對話式應用。

輸入
音訊 文字 $0.06/M
輸出
音訊 文字 $0.24/M
音訊輸入
$3/M
音訊輸出
$12/M

Benchmark 成績

nova-2-sonic:公布了 8 項,但每一項都沒有夠多其他模型的成績,無法比較。

nova-2-sonic 其他有成績的模型 其他模型平均 ★ 沒有模型分數更高
AMI near+far field (WER)
29.7%
Big Bench Audio
87%
BFCL v3 (single-turn, python only)
74.5%

供應商公布: Amazon OpenAI

價格在同類中的位置

價格在 6 個同類模型中的位置

輸入$0.06/M
$0.06 · nova-2-sonic GPT Realtime · $4
輸出$0.24/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

這條線標出這個模型的價格,在 Synthorai 的同類模型裡落在什麼位置;兩端分別是最便宜和最貴的模型。這裡列的是基礎價,批次、區域和快取寫入的折扣請見價格頁。

規格與限制

Token

上下文視窗(供應商規格) 1,000,000
最大輸出(供應商規格) 64,000

音訊

語言 英語(US、UK、印度、澳洲)、法語、義大利語、德語、西班牙語、葡萄牙語與印地語,並支援會話中途的自動語言偵測與切換
音訊限制
  • 透過 InvokeModelWithBidirectionalStream 進行雙向串流傳輸
  • audio/lpcm、16-bit、單聲道、base64,16 kHz 輸入與 24 kHz 輸出
  • 連線上限 8 分鐘,更長的對話可採用文件提供的會話接續模式
  • 僅支援區域內推理(us-east-1、us-west-2、eu-north-1、ap-northeast-1)
串流轉錄 支援

即時語音

聲音 每個 locale 都提供偏女聲與偏男聲的音色(tiffany/matthew 對應 en-US,amy 對應 en-GB,olivia 對應 en-AU,kiara/arjun 對應 en-IN 與 hi-IN,ambre/florian 對應 fr-FR,beatrice/lorenzo 對應 it-IT,tina/lennart 對應 de-DE,lupe/carlos 對應 es-US,carolina/leo 對應 pt-BR);tiffany 與 matthew 是能說所有支援語言的多語言音色。
工作階段功能
  • 智慧的輪次切換,端點偵測靈敏度可設定
  • 優雅的打斷處理,不會遺失上下文
  • 函式呼叫搭配非同步工具處理(工具執行期間助理會繼續說話)
  • RAG 事實依據
  • 同一段對話中混合音訊與文字輸入
  • 連線上限 8 分鐘

模型

模態 音訊 + 文字 → 音訊 + 文字
  • Amazon 面向即時語音應用的語音到語音基礎模型,透過雙向串流 API 而非請求/回應式 API 存取。
  • 它會依照輸入語音的韻律調整表達,並能在同一句話中切換語言
  • 文件記載其對背景噪音以及所支援語言中的口音都具有穩健性。

依據 Amazon 官方文件 ↗

30 秒上手 nova-2-sonic

相容 OpenAI Realtime:透過 WebSocket 連線,音訊進、音訊出。WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

關於 nova-2-sonic

  • 它透過雙向串流 API 而非請求-回應式 API 存取,這正是低延遲多輪對話得以成立的原因;官方文件列出 1M token 上下文視窗與 64K 最大輸出 token,同一段對話中可接受音訊與文字,也回傳音訊與文字。
  • 語音覆蓋美式、英式、印度與澳洲腔的英語,外加法語、義大利語、德語、西班牙語、葡萄牙語與印地語,每一種都提供偏男聲與偏女聲兩類音色,並具備自動語言偵測與切換;多語音色能說任何受支援的語言,因此當來電者在對話中途改用另一種語言時,人設仍維持不變。
  • 對話行為是它的賣點:語氣表達會隨輸入語音的韻律調整,智慧輪次切換能偵測說話者何時說完,打斷可被優雅處理而不丟失上下文,文件還聲稱它對背景噪音以及受支援語言中的口音具備穩健性。
  • 函式呼叫與智慧體工作流程受支援,並可透過檢索增強生成以企業資料為知識建立事實依據,非同步的工具處理讓助理在工具於背景執行時繼續說話。
  • 有一項限制需要在設計時繞開:連線上限為八分鐘,範例程式碼中有文件化的續連與會話延續模式可用於更長的對話。
  • 可用區域僅限少數幾個。
  • Synthorai 透過 OpenAI 相容的 /v1/realtime WebSocket 端點提供它,官方 Realtime SDK 用戶端無需修改即可連線。

常見問題

nova-2-sonic API 可以免費試用嗎?

nova-2-sonic 目前是邀請制測試,不開放直接註冊,需要先申請開通。請到 Synthorai 主控台提出申請,審核通過後就按一般的用量計費方式收費,不需訂閱。

nova-2-sonic 最擅長什麼?

面向即時語音對話的語音對語音模型、多語音色在語言切換時保持同一人設、連線上限八分鐘,附文件化的續連模式。完整介紹請見「關於」一節,內容取自供應商官方的發布說明。

nova-2-sonic 的價格是多少?

在 Synthorai 上,nova-2-sonic 的輸入價是每百萬 token $0.06,輸出價是每百萬 token $0.24。這就是供應商官網價,平台不加價。

如何呼叫 nova-2-sonic API?

nova-2-sonic 是語音對語音(speech-to-speech)模型:用 OpenAI Realtime SDK(或原生 WebSocket)連線到 wss://synthorai.io/v1/realtime?model=nova-2-sonic,音訊進、音訊出。它不走 POST /v1/audio/transcriptions 那種上傳檔案的方式。驗證用你的 sk-syn 金鑰,只需要帶 Authorization 標頭(beta 協定已停用)。

如何開通 nova-2-sonic?

nova-2-sonic 目前是邀請制測試,請到 Synthorai 主控台申請開通。審核通過後,用法和其他模型一樣:把 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 設為 "nova-2-sonic" 就可以了。

相關模型

比較

本頁每一個數值都摘錄自供應商自己的文件(連結見上方),並附上查核日期。價格是放在整個目錄裡比較;各家供應商定義不一樣的規格,只說明差異,不畫成圖表比較。這裡沒有任何數據是我們自己量測的,也不做評分。

取得 API 金鑰 算算你的成本 →