新規 無料登録で、呼び出し 10 回分(最大 $1)をお試しいただけます。カード登録は不要です。

nova-2-sonic

2025-12-02 リリース

招待制ベータ ツール呼び出し

Amazon Nova 2 Sonic は、自然でリアルタイムな音声会話アプリケーションを構築するための Amazon の speech-to-speech 基盤モデルで、Nova ユーザーガイドは対話型音声アシスタント、カスタマーサービスの自動化、会話型アプリケーションを対象としています。

入力
音声 テキスト $0.06/M
出力
音声 テキスト $0.24/M
音声入力
$3/M
音声出力
$12/M

ベンチマーク

nova-2-sonic:公表値は 8 件ありますが、比較できるだけの数のモデルが測定している項目がありません。

nova-2-sonic 測定された他モデル 他モデルの平均 ★ これを上回るモデルなし
AMI near+far field (WER)
29.7%
Big Bench Audio
87%
BFCL v3 (single-turn, python only)
74.5%

ベンダー公表値: Amazon OpenAI

価格の位置づけ

同種の 6 モデルの中での価格の位置

入力$0.06/M
$0.06 · nova-2-sonic GPT Realtime · $4
出力$0.24/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

このバーは、Synthorai の同種モデルの中で、このモデルの価格がどのあたりにあるかを示しています。両端には、最も安いモデルと最も高いモデルの名前を表示しています。表示しているのは基本料金で、バッチ、リージョン、キャッシュ書き込みに関する割引は料金ページに記載しています。

仕様と制限

トークン

コンテキストウィンドウ(ベンダー仕様) 1,000,000
最大出力(ベンダー仕様) 64,000

音声

言語 英語(US、UK、インド、オーストラリア)、フランス語、イタリア語、ドイツ語、スペイン語、ポルトガル語、ヒンディー語。セッション途中での自動言語検出と切り替えに対応
音声の制限
  • InvokeModelWithBidirectionalStream による双方向ストリーミング。
  • audio/lpcm、16-bit、モノラル、base64 で、入力 16 kHz・出力 24 kHz。
  • 接続は 8 分が上限で、より長い会話にはセッション継続のパターンが文書化されています。
  • 推論はリージョン内のみ(us-east-1, us-west-2, eu-north-1, ap-northeast-1)。
ストリーミング文字起こし 対応

リアルタイム

ボイス ロケールごとに女性的な声と男性的な声を用意(tiffany/matthew en-US、amy en-GB、olivia en-AU、kiara/arjun en-IN および hi-IN、ambre/florian fr-FR、beatrice/lorenzo it-IT、tina/lennart de-DE、lupe/carlos es-US、carolina/leo pt-BR)。tiffany と matthew は対応するすべての言語を話すポリグロットボイスです。
セッション
  • エンドポイント検出の感度を設定できるインテリジェントなターンテイキング
  • コンテキストを失わない自然な割り込み処理
  • 非同期のツール処理を伴う関数呼び出し(ツール実行中もアシスタントは話し続けます)
  • RAG グラウンディング
  • 1 つの会話での音声とテキストの混在入力
  • 8 分の接続上限

モデル

モダリティ 音声 + テキスト → 音声 + テキスト
  • リアルタイム音声アプリケーション向けの Amazon の音声から音声への基盤モデルで、リクエスト/レスポンス型ではなく双方向ストリーミング API 経由で利用します。
  • 入力音声のプロソディに合わせて話し方を調整し、1 文の中で言語を切り替えます。
  • 背景ノイズと、対応言語における訛りに強いと文書化されています。

出典:Amazon 公式ドキュメント ↗

30 秒で nova-2-sonic を使い始める

OpenAI Realtime 互換。WebSocket で接続し、音声を送りながら音声を受け取ります。WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=nova-2-sonic"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

nova-2-sonic について

  • リクエスト・レスポンス型ではなく双方向ストリーミング API 経由で利用し、これが低レイテンシのマルチターン会話を可能にしています。
  • 公式ドキュメントは 1M トークンのコンテキストウィンドウと 64K の最大出力トークンを掲載しており、同じ会話の中で音声とテキストを受け付け、音声とテキストを返します。
  • 音声のカバレッジは米国・英国・インド・オーストラリアの各英語変種に加えてフランス語、イタリア語、ドイツ語、スペイン語、ポルトガル語、ヒンディー語にわたり、男性的な声と女性的な声の両方が用意され、自動の言語検出と切り替えを備えます。
  • ポリグロット音声は対応するどの言語でも話すため、通話相手がセッションの途中で言語を変えてもペルソナは一定に保たれます。
  • 会話としての振る舞いが売りです。
  • 入力音声のプロソディに合わせて発話が適応し、話者が話し終えたことをインテリジェントなターンテイキングが検出し、割り込みはコンテキストを失うことなく適切に処理され、ドキュメントは背景ノイズと対応言語のアクセントに対する堅牢性をうたっています。
  • 関数呼び出しとエージェント的ワークフローに対応し、検索拡張生成によるエンタープライズデータへのナレッジグラウンディングも可能で、非同期のツール処理によりツールがバックグラウンドで動作する間もアシスタントは話し続けられます。
  • 設計時に織り込むべき制限が 1 つあります。
  • 接続は 8 分が上限で、より長い会話のための更新とセッション継続のパターンがサンプルコードに文書化されています。
  • 提供は少数のリージョンに限られます。
  • Synthorai は OpenAI 互換の /v1/realtime WebSocket エンドポイント経由で提供するため、公式の Realtime SDK クライアントは変更なしで接続できます。

よくある質問

nova-2-sonic API は無料で試せますか?

nova-2-sonic は現在招待制ベータです。オープン登録ではなく申請制で、Synthorai コンソールから申請できます。承認後は標準の従量課金が適用され、サブスクリプションは不要です。

nova-2-sonic は何が得意ですか?

リアルタイム音声会話向けの speech-to-speech モデル、ポリグロット音声は言語の切り替えをまたいでペルソナを維持、接続は 8 分が上限、更新パターンが文書化されています。詳しくは、ベンダー公式のリリースノートをもとにまとめた、このページのモデル紹介セクションをご覧ください。

nova-2-sonic の料金はいくらですか?

Synthorai での nova-2-sonic の料金は、入力 100 万トークンあたり $0.06、出力 100 万トークンあたり $0.24 です。プロバイダーの定価のままで、プラットフォーム手数料はかかりません。

nova-2-sonic API はどう呼び出しますか?

nova-2-sonic は音声対話(speech-to-speech)モデルです。OpenAI Realtime SDK(または素の WebSocket)で wss://synthorai.io/v1/realtime?model=nova-2-sonic に接続し、音声を送りながら音声を受け取ります。POST /v1/audio/transcriptions のようなファイルアップロード方式ではありません。認証には sk-syn キーを使い、送信するのは Authorization ヘッダーだけにしてください(beta プロトコルは廃止済みです)。

nova-2-sonic を利用するには?

nova-2-sonic は招待制ベータです。Synthorai コンソールから利用を申請してください。承認後の使い方は他のモデルと同じで、OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="nova-2-sonic" を指定するだけです。

関連モデル

比較

このページの値は、すべてベンダー自身のドキュメント(上部にリンクがあります)から転記したもので、確認した日付を添えています。価格はカタログ全体で比較しています。一方、ベンダーによって定義が異なる仕様値は、違いを明記するにとどめ、グラフでの比較はしていません。当社が測定した数値はなく、スコアも付けていません。

API キーを取得 コストを比較する →