신규 무료 가입, 10회 호출 제공. 최대 $1, 카드 불필요.

gemini-3.1-flash-live

2026-03-26 출시

초대제 베타 도구 호출리즈닝비전

Gemini 3.1 Flash Live는 실시간 대화와 음성 우선 애플리케이션을 위한 Google의 저지연 오디오 대 오디오 모델이며, 모델 페이지는 음향적 뉘앙스 감지, 수치 정확성, 멀티모달 인지를 강점으로 꼽습니다.

입력
텍스트 이미지 오디오 비디오 $0.75/M
출력
텍스트 오디오 $4.5/M
오디오 입력
$3/M
오디오 출력
$12/M

가격의 위치

동종 6개 모델 중 가격 위치

입력$0.75/M
$0.06 · nova-2-sonic GPT Realtime · $4
출력$4.5/M
$0.24 · nova-2-sonic GPT Realtime 2.1 · $24

이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.

스펙 및 제한

토큰

컨텍스트 윈도우(공급사 사양) 131,072
최대 출력(벤더 스펙) 65,536

사고

공급사 파라미터 thinkingLevel
허용 값 minimal · low · medium · high
기본값 minimal 요청에서 지정하지 않을 때 적용
비활성화 가능 미지원
사고 동작 지연을 최소화하도록 기본값이 minimal입니다. Gemini 3 Live 모델은 2.5 Live의 thinkingBudget을 수준(level) 방식으로 대체했습니다.
파라미터 reasoning_effort
minimal · low · medium · high 게이트웨이 측 파라미터 표면 - 위의 벤더 매핑이 적용됩니다

오디오

언어 실시간 멀티모달 대화를 위한 90개 이상 언어
오디오 제한
  • Live API 세션: 원시 리틀 엔디언 16-bit PCM, 입력 16 kHz, 출력 24 kHz
  • 세션 관리로 연장하지 않는 한 오디오 전용 세션은 15분(영상 포함 시 2분)으로 제한
  • 128k 토큰 세션 컨텍스트
스트리밍 전사 지원

실시간

보이스 Gemini 텍스트 음성 변환 음성 세트의 모든 음성 사용 가능; 네이티브 오디오 출력 모델은 대화 도중 자연스럽게 언어를 전환합니다.
세션
  • 함수 호출은 순차 실행만 가능하며, 도구 응답이 전송되기 전까지 모델은 응답을 시작하지 않음
  • 검색 그라운딩과 사고 지원
  • VAD 인터럽션이 진행 중인 생성을 취소
  • 캐싱, 구조화 출력, 코드 실행, Batch API 없음

모델

모달리티 텍스트 + 이미지 + 오디오 + 비디오 → 텍스트 + 오디오

보이스 우선 에이전트를 위한 저지연 오디오 대 오디오 모델로, 음향적 뉘앙스 감지, 수치 정확도, 멀티모달 인지가 문서화되어 있습니다. thinkingBudget 대신 thinkingLevel(minimal / low / medium / high)을 사용하며, 지연을 최소화하기 위해 기본값은 minimal입니다.

출처: Google 공식 문서 ↗

30초 만에 gemini-3.1-flash-live 사용하기

OpenAI Realtime 호환: WebSocket으로 연결해 오디오 입력·오디오 출력. WS /v1/realtime

import asyncio, base64, json, websockets

URL = "wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live"
# Send ONLY the Authorization header - the beta protocol is retired.
HEADERS = {"Authorization": "Bearer sk-syn-..."}

async def main():
    async with websockets.connect(URL, additional_headers=HEADERS) as ws:
        # 1) configure the speech-to-speech session
        await ws.send(json.dumps({
            "type": "session.update",
            "session": {
                "type": "realtime",
                "output_modalities": ["audio"],
                "audio": {"output": {"voice": "alloy"}},
            },
        }))
        # 2) send input audio (base64 PCM16), then request a spoken reply
        await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": pcm16_b64}))
        await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
        await ws.send(json.dumps({"type": "response.create"}))
        # 3) stream the model's audio (and text) back
        async for raw in ws:
            ev = json.loads(raw)
            if ev["type"] == "response.audio.delta":
                play(base64.b64decode(ev["delta"]))   # audio out
            elif ev["type"] == "response.done":
                break

asyncio.run(main())

gemini-3.1-flash-live 소개

  • 텍스트, 이미지, 오디오, 영상을 받아 Live API의 상태 유지 WebSocket으로 텍스트와 오디오를 반환하며, 입력 제한은 131,072 토큰, 출력 제한은 65,536 토큰으로 이 모델이 대체하는 2.5 네이티브 오디오 모델의 출력 상한보다 여덟 배 큽니다.
  • 함수 호출, 검색 그라운딩, 사고는 지원되고 캐싱, 구조화 출력, 코드 실행, Batch API는 지원되지 않으며, 사고 깊이는 2.5 세대가 쓰던 숫자형 thinkingBudget 대신 thinkingLevel의 minimal, low, medium, high로 설정하고 지연을 가장 낮추기 위해 기본값은 minimal입니다.
  • 이 업그레이드는 더하기만 하는 것이 아니라 빼기도 하기 때문에 마이그레이션 노트가 유용한 부분입니다.
  • 비동기 함수 호출은 아직 지원되지 않아 호출이 순차적으로 이루어지고 도구 응답이 도착할 때까지 모델이 응답을 시작하지 않습니다.
  • 프로액티브 오디오와 감정 반응형 대화(affective dialog)는 사라졌으므로 관련 설정을 걷어내야 합니다.
  • 이제 서버 이벤트 하나가 오디오 청크와 전사본처럼 여러 콘텐츠 파트를 한꺼번에 담을 수 있어, 첫 번째 파트만 읽는 클라이언트는 조용히 콘텐츠를 누락하게 됩니다.
  • 턴 커버리지는 이제 감지된 오디오 활동과 모든 영상 프레임을 포함하는 것이 기본이라 영상을 계속 스트리밍하는 애플리케이션에서는 비용이 올라갈 수 있고, 클라이언트 콘텐츠는 초기 히스토리를 채우는 용도로만 쓸 수 있습니다.
  • Synthorai는 OpenAI 호환 /v1/realtime WebSocket 엔드포인트로 이 모델을 서빙합니다.

자주 묻는 질문

gemini-3.1-flash-live API는 무료로 사용해 볼 수 있나요?

gemini-3.1-flash-live는 현재 초대제 베타 단계로, 공개 가입이 아닌 신청 기반으로 이용할 수 있습니다. Synthorai 콘솔에서 신청하면 되며, 승인 후에는 구독 없이 표준 종량제 요금이 적용됩니다.

gemini-3.1-flash-live는 무엇에 가장 강한가요?

실시간 대화와 음성 우선 애플리케이션을 위한 오디오 대 오디오 모델, 2.5 네이티브 오디오 모델 출력 상한의 여덟 배, 비동기 함수 호출이 없어 도구 호출은 순차적. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.

gemini-3.1-flash-live의 가격은 얼마인가요?

Synthorai에서 gemini-3.1-flash-live는 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $4.5입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다.

gemini-3.1-flash-live API는 어떻게 호출하나요?

gemini-3.1-flash-live는 음성 대화(speech-to-speech) 모델입니다. WebSocket으로 wss://synthorai.io/v1/realtime?model=gemini-3.1-flash-live에 연결하고 OpenAI Realtime SDK(또는 원시 WebSocket)로 오디오 입력·오디오 출력을 처리합니다. POST /v1/audio/transcriptions 파일 업로드가 아닙니다. sk-syn 키로 인증하고 Authorization 헤더만 보내세요(beta 프로토콜은 종료되었습니다).

gemini-3.1-flash-live는 어떻게 이용하나요?

gemini-3.1-flash-live는 초대제 베타입니다: Synthorai 콘솔에서 액세스를 신청하세요. 승인되면 다른 모델과 동일하게 동작합니다. OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="gemini-3.1-flash-live"로 설정하면 됩니다.

관련 모델

비교

이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.

API 키 받기 내 비용 비교하기 →