Gemini 3 Flash(프리뷰)는 Google 문서가 멀티모달 이해에서 세계 최고이며 “지금까지 가장 강력한 에이전틱·바이브 코딩 모델”이라고 설명하는 모델로, 더 큰 모델에 필적하는 프런티어급 성능을 그 일부의 비용으로 낸다는 약속과 함께 출시되었습니다.
- 입력
- 텍스트 이미지 비디오 오디오 $0.5/M
- 출력
- 텍스트 $3/M
- 오디오 입력
- $1/M
- 캐시 읽기
- $0.05/M
- 컨텍스트
- 1M
- GPT-4o 대비
- 약 90% 저렴
- 지식 컷오프
- 2025-01
벤치마크
벤더 공개: Alibaba (Qwen) Anthropic ByteDance Google MiniMax Moonshot OpenAI Tencent Z.ai
가격의 위치
동종 60개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
토큰
| 컨텍스트 윈도우(공급사 사양) | 1,048,576 |
|---|---|
| 최대 출력(벤더 스펙) | 65,536 |
| 지식 컷오프 | 2025-01 |
프롬프트 캐싱
| 캐싱 방식 | 자동 + 명시적 |
|---|---|
| 최소 프리픽스 | 4,096 |
사고
| 공급사 파라미터 | thinkingLevel |
|---|---|
| 허용 값 | minimal · low · medium · high |
| 기본값 | high 요청에서 지정하지 않을 때 적용 |
| 비활성화 가능 | 미지원 |
| 사고 동작 | Google은 Gemini 3 Flash가 사고 완전 끄기를 지원하지 않는다고 밝히고 있습니다. 따라서 minimal은 스위치가 아니라 하한이며, 모든 요청에서 사고 토큰이 출력 토큰으로 과금됩니다. thought signature는 그대로 되돌려 보내야 하고, 함수 호출에는 필수입니다. |
| 파라미터 | reasoning_effort |
| 값 | minimal · low · medium · high 게이트웨이 측 파라미터 표면 - 위의 벤더 매핑이 적용됩니다 |
모델
| 모달리티 | 텍스트 + 이미지 + 비디오 + 오디오 → 텍스트 |
|---|
- 프리뷰 모델
- 입력 1,048,576 토큰
- 컴퓨터 사용 지원
- 게이트웨이 역량 태그와 달리 이미지 생성은 지원하지 않음
출처: Google 공식 문서 ↗
30초 만에 Gemini 3 Flash 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3-flash-preview",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3-flash-preview",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-flash-preview",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3-flash-preview",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3-flash-preview")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Gemini 3 Flash 소개
- 텍스트·이미지·영상·오디오·PDF 입력을 1,048,576 토큰 컨텍스트 윈도우 안에서 받고 최대 65,536 출력 토큰을 생성합니다.
- 기능에는 함수 호출, 구조화 출력, 코드 실행, 컴퓨터 사용, 검색·지도 그라운딩, URL 컨텍스트, 파일 검색, 컨텍스트 캐싱, Batch API, Flex 및 Priority 추론이 포함됩니다.
- 사고는 thinking_level로 제어되며 minimal, low, medium, high를 받고 기본값은 high로 패밀리에서 가장 비싼 기본값입니다.
- 모든 Gemini 3 모델에서 minimal은 끄기 스위치가 아니라 하한이므로 요청마다 사고 토큰이 과금됩니다.
- 이 세대는 또한 멀티턴 연속성을 유지하려면 되돌려 보내야 하는, 내부 추론의 암호화된 흔적인 사고 서명(thought signatures)과 새로운 미디어 해상도 제어를 도입했는데, 2.5에서 올라올 때 둘 다 선택 사항이 아니라 마이그레이션 작업입니다.
- 프리뷰 채널이므로 안정성 보장이 없습니다.
- Google의 안정 후속 모델은 gemini-3.5-flash이며, 해당 모델 페이지는 이 ID를 자신의 프리뷰 별칭으로 표기합니다.
- Synthorai는 통합된 OpenAI 호환 chat completions 인터페이스로 이 모델을 제공합니다.
자주 묻는 질문
Gemini 3 Flash API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $0.5/M 기준으로, 이 크레딧만으로도 Gemini 3 Flash에 약 8K 토큰 규모의 요청을 대략 250회 보낼 수 있습니다.
Gemini 3 Flash는 무엇에 가장 강한가요?
멀티모달 이해 최고로 소개, 크리에이티브 코딩에 강한 최첨단 추론, 컴퓨터 사용과 Maps 그라운딩 지원. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
Gemini 3 Flash의 가격은 얼마인가요?
Synthorai에서 Gemini 3 Flash는 입력 토큰 100만 개당 $0.5, 출력 토큰 100만 개당 $3입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다. 캐시된 입력 토큰은 $0.05/M로 과금됩니다.
Gemini 3 Flash는 프롬프트 캐싱을 지원하나요?
네, 자동 캐싱이 기본으로 켜져 있고, 확정적 절감을 위한 명시적 모드도 있습니다. 캐시된 입력 토큰은 $0.05/M로 과금됩니다(미캐시 시 $0.5/M); 캐시되려면 프롬프트에 4,096 토큰 이상의 안정적인 프리픽스가 필요합니다. 프롬프트 캐싱 가이드 →
Gemini 3 Flash는 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="gemini-3-flash-preview"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
Gemini 3 Flash의 지식 컷오프는 언제인가요?
벤더 공식 문서에 따르면 Gemini 3 Flash의 지식 컷오프는 2025-01입니다(2026-07-09 기준).
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.