신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

gemini-2.5-flash-native-audio

초대제 베타 도구 호출리즈닝

Gemini 2.5 Flash Native Audio는 Google의 네이티브 오디오 Live API 모델로, 모델 페이지는 Gemini 2.5 Flash와의 저지연 실시간 음성·영상 상호작용을 가능하게 한다고 설명합니다.

입력
텍스트 오디오 비디오 $0.5/M
출력
텍스트 오디오 $2/M
오디오 입력
$3/M
오디오 출력
$12/M
지식 컷오프
2025-01

벤치마크

gemini-2.5-flash-native-audio: 8개 공개되었지만, 비교할 만큼 다른 모델이 측정한 항목이 없다.

gemini-2.5-flash-native-audio 측정된 다른 모델 측정 대상 평균 더 높은 점수를 낸 모델 없음
AMI near+far field (WER)
63.8%
Big Bench Audio
71%
BFCL v3 (single-turn, python only)
69.4%

벤더 공개: Amazon OpenAI

가격의 위치

동종 6개 모델 중 가격 위치

입력$0.5/M
$0.06 · nova-2-sonic GPT Realtime · $4
출력$2/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

토큰

컨텍스트 윈도우(공급사 사양) 131,072
최대 출력(벤더 스펙) 8,192
지식 컷오프 2025-01

사고

공급사 파라미터 thinkingBudget
기본값 동적 사고 요청에서 지정하지 않을 때 적용
비활성화 가능 지원
사고 동작 Live API 가이드는 이 2.5 Live 모델이 수준(level)이 아니라 토큰 예산을 쓴다고 설명합니다: 동적 사고가 기본으로 켜져 있으며, thinkingBudget 0으로 끕니다.
파라미터 reasoning_effort
minimal · low · medium · high 허용 범위는 공급사가 정함

오디오

오디오 제한
  • Live API 세션: 원시 리틀 엔디언 16-bit PCM, 입력 16 kHz, 출력 24 kHz
  • 세션 관리로 연장하지 않는 한 오디오 전용 세션은 15분(영상 포함 시 2분)으로 제한
  • 128k 토큰 세션 컨텍스트
스트리밍 전사 지원

실시간

보이스 Gemini 텍스트 음성 변환 음성 세트의 모든 음성 사용 가능; 네이티브 오디오 출력 모델은 대화 도중 자연스럽게 언어를 전환합니다.
세션
  • 함수 호출 지원, NON_BLOCKING 함수 선언을 쓰면 도구가 실행되는 동안에도 모델이 계속 말할 수 있음
  • VAD 인터럽션은 진행 중인 생성을 취소하고 폐기
  • 검색 그라운딩과 사고 지원
  • 캐싱, 구조화 출력, 코드 실행, Batch API 없음

모델

모달리티 텍스트 + 오디오 + 비디오 → 텍스트 + 오디오

STT와 TTS를 연결하는 대신 원시 오디오를 종단 간으로 처리하는 네이티브 오디오 Live API 모델. Google 모델 페이지는 2025년 1월 지식 컷오프와 함께 131,072 토큰 입력 윈도우 대비 이례적으로 작은 8,192 토큰 출력 제한을 명시합니다.

출처: Google 공식 문서 ↗

30초 만에 gemini-2.5-flash-native-audio 사용하기

OpenAI Realtime 호환: WebSocket으로 연결해 오디오 입력·오디오 출력. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

gemini-2.5-flash-native-audio 소개

  • 오디오·영상·텍스트의 연속 스트림을 처리하고, 전사기와 합성기를 이어 붙이는 대신 즉각적이고 사람 같은 음성으로 답합니다.
  • 세션은 상태를 유지하는 WebSocket으로 실행되어 16 kHz의 16비트 raw PCM을 받아 24 kHz로 반환하며, 모델은 오디오·영상·텍스트를 받아 오디오와 텍스트를 반환합니다.
  • 토큰 제한은 입력 131,072, 출력은 이례적으로 작은 8,192이고, 네이티브 오디오 모델의 세션 컨텍스트 윈도우는 128k 토큰이며, 세션 관리로 연장하지 않으면 오디오 전용 세션은 15분, 영상이 있으면 2분간 지속됩니다.
  • 함수 호출, 검색 그라운딩, 사고는 지원되고 캐싱, 구조화 출력, 코드 실행, Batch API는 지원되지 않습니다.
  • 이 세대를 더 새로운 Live 모델과 구분 짓고 이 모델에 남을 이유가 되는 기능이 둘 있습니다.
  • 입력이 관련 없을 때 모델이 응답하지 않기로 결정할 수 있는 프로액티브 오디오, 그리고 화자의 표현과 어조에 맞춰 응답 스타일을 조정하는 감정 반응형 대화(affective dialog)입니다.
  • 여기서는 비동기 함수 호출도 지원되어, non-blocking으로 표시된 선언은 도구가 실행되는 동안 모델이 계속 말할 수 있게 합니다.
  • 보이스는 Google의 텍스트 음성 변환 세트에서 오고, 네이티브 오디오 출력은 대화 중 자연스럽게 언어를 바꾸며 명시적인 언어 코드를 받지 않습니다.
  • 지식 컷오프는 2025년 1월입니다.
  • Synthorai는 나머지 음성 카탈로그에 쓰이는 것과 동일한 OpenAI 호환 /v1/realtime WebSocket 엔드포인트로 이 모델을 노출합니다.

자주 묻는 질문

gemini-2.5-flash-native-audio API는 무료로 사용해 볼 수 있나요?

gemini-2.5-flash-native-audio는 현재 초대제 베타 단계로, 공개 가입이 아닌 신청 기반으로 이용할 수 있습니다. Synthorai 콘솔에서 신청하면 되며, 승인 후에는 구독 없이 표준 종량제 요금이 적용됩니다.

gemini-2.5-flash-native-audio는 무엇에 가장 강한가요?

Live API를 통한 저지연 실시간 음성·영상, 더 새로운 Live 모델에는 없는 프로액티브 오디오와 감정 반응형 대화, 오디오 전용 세션은 15분, 영상과 함께면 2분. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

gemini-2.5-flash-native-audio의 가격은 얼마인가요?

Synthorai에서 gemini-2.5-flash-native-audio는 입력 토큰 100만 개당 $0.5, 출력 토큰 100만 개당 $2입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다.

gemini-2.5-flash-native-audio API는 어떻게 호출하나요?

gemini-2.5-flash-native-audio는 음성 대화(speech-to-speech) 모델입니다. WebSocket으로 wss://synthorai.io/v1/realtime?model=gemini-2.5-flash-native-audio에 연결하고 OpenAI Realtime SDK(또는 원시 WebSocket)로 오디오 입력·오디오 출력을 처리합니다. POST /v1/audio/transcriptions 파일 업로드가 아닙니다. sk-syn 키로 인증하고 Authorization 헤더만 보내세요(beta 프로토콜은 종료되었습니다).

gemini-2.5-flash-native-audio는 어떻게 이용하나요?

gemini-2.5-flash-native-audio는 초대제 베타입니다: Synthorai 콘솔에서 액세스를 신청하세요. 승인되면 다른 모델과 동일하게 동작합니다. OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="gemini-2.5-flash-native-audio"로 설정하면 됩니다.

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →