Gemini 2.5 Flash는 Google에서 가격 대비 성능이 가장 좋은 Gemini 2.5 모델로, 대규모 처리와 에이전틱 애플리케이션을 포함해 여전히 추론이 필요한 저지연·대용량 워크로드를 겨냥합니다.
- 입력
- 텍스트 이미지 비디오 오디오 $0.3/M
- 출력
- 텍스트 $2.5/M
- 오디오 입력
- $1/M
- 캐시 읽기
- $0.03/M
- 컨텍스트
- 1M
- GPT-4o 대비
- 약 94% 저렴
- 지식 컷오프
- 2025-01
벤치마크
벤더 공개: Alibaba (Qwen) Amazon Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
가격의 위치
동종 60개 모델 중 가격 위치
이 막대는 Synthorai에 있는 같은 종류의 모델 가운데 이 모델의 가격이 어디쯤인지 보여 줍니다. 양쪽 끝에는 가장 싼 모델과 가장 비싼 모델의 이름이 있습니다. 기본 요율 기준이며 배치·리전·캐시 쓰기 할인은 가격 페이지에 있습니다.
스펙 및 제한
토큰
| 컨텍스트 윈도우(공급사 사양) | 1,048,576 |
|---|---|
| 최대 출력(벤더 스펙) | 65,536 |
| 지식 컷오프 | 2025-01 |
프롬프트 캐싱
| 캐싱 방식 | 자동 + 명시적 |
|---|---|
| 최소 프리픽스 | 4,096 |
사고
| 공급사 파라미터 | thinkingBudget (generateContent) · thinking_level (Interactions API) |
|---|---|
| 허용 값 | thinkingBudget 0 to 24576, or -1 for dynamic · Interactions API: low, medium, high |
| 기본값 | 동적 사고(thinkingBudget -1) 요청에서 지정하지 않을 때 적용 |
| 비활성화 가능 | 지원 |
| 사고 동작 | thinkingBudget을 0으로 두면 사고가 꺼집니다. 사고 토큰은 출력 토큰으로 과금됩니다(thoughtsTokenCount). 2.5는 사고가 켜져 있고 요청이 함수를 선언한 경우에만 thought signature를 반환합니다. |
| 파라미터 | reasoning_effort |
| 값 | minimal · low · medium · high 게이트웨이 측 파라미터 표면 - 위의 벤더 매핑이 적용됩니다 |
모델
| 모달리티 | 텍스트 + 이미지 + 비디오 + 오디오 → 텍스트 |
|---|
- 첫 안정 버전 2.5 Flash 릴리스
- 입력 1,048,576 토큰 / 출력 65,536 토큰
- 텍스트+이미지+영상+오디오 입력
- 사고 지원
출처: Google 공식 문서 ↗
하나의 프롬프트 - 게이트웨이를 통해 측정됨
Gemini 2.5 Flash 통과 · 3 sentences
Enabling LLM reasoning means the model processes more complex thoughts, often requiring multiple steps or internal iterations to generate accurate answers. This translates directly to higher token consumption per query, as the model "thinks" more deeply and generates more internal and external text for each request. While increasing cost, this deeper processing significantly enhances output quality and reliability, delivering more robust solutions for critical business functions.
출력 368 tok (+290 추론) 지연 시간 3.1 s
지시 준수(정확히 세 문장 - 셀 수 있음), 독자 맞춤(CFO 어조), 그리고 아래 토큰 계량기가 드러내는 숨은 사고 과금 격차.
Gemini 2.5 Flash 통과 · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 # Initialize best to 1, as a non-empty list always has at least one run of length 1 cur = 1 # Initialize current run length to 1 for the first element for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 # Extend the current run else: cur = 1 # Start a new run of length 1 with the current element xs[i] best = max(best, cur) # Always update best after processing the current element return best ``` **Explanation of the bug:** The original code had two primary flaws. First, it initialized `best` to 0 and `cur` to 0. For single-element inputs (e.g., `[1]`), the loop `range(1, len(xs))` would be empty, causing the function to incorrectly return 0 instead of 1. […]
출력 3871 tok (+3463 추론) 지연 시간 19.8 s
수정이 실제로 옳은지(실행 가능한지), 설명의 밀도, 그리고 범위가 정해진 작업에서의 토큰 효율.
Gemini 2.5 Flash 통과 · 5/5 fields, guidance "withheld pending the Q4 close for Meridi"
```json { "company": null, "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld pending the Q4 close for Meridian Robotics" } ```
출력 380 tok (+314 추론) 지연 시간 2.5 s
스키마 준수(없는 필드를 지어내지 않기), 환각 압력(guidance는 명시적으로 보류됨), 그리고 구조화 출력 경로의 차이.
Gemini 2.5 Flash 통과 · 111 words, 0 banned, 1 question
Introducing our latest API Gateway enhancement: **Cross-Provider Prompt Caching**. This new feature intelligently stores and reuses frequently used prompts across all your integrated AI services, regardless of the underlying provider. Eliminate redundant API calls and unnecessary expenses from sending identical requests repeatedly. By intelligently serving cached responses, your applications will experience significantly reduced latency and improved operational efficiency, leading to faster user interactions. This update ensures consistent, rapid delivery of AI-generated content, optimizing resource utilization across your entire AI infrastructure. Are you ready to accelerate your AI-driven workflows and reduce operational spend? Experience substantial performance gains and smarter resource management with this advanced capability, bolstering your AI strategy for greater effectiveness.
출력 1242 tok (+1108 추론) 지연 시간 7.3 s
제약 준수(단어 예산, 금지어 목록, 단 하나의 의문문), 문체 지문, 그리고 길이 제어.
30초 만에 Gemini 2.5 Flash 사용하기
OpenAI 호환. base_url만 바꾸면 SDK는 그대로. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-2.5-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-2.5-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-2.5-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-2.5-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Gemini 2.5 Flash 소개
- Google 모델 페이지는 이 모델을 “가격 대비 성능 측면에서 최고의 모델이며 두루 균형 잡힌 능력을 제공”한다고 표현하는데, 비용을 위해 추론 깊이를 포기하는 Flash-Lite와 깊이를 위해 지연을 포기하는 2.5 Pro 사이의 중간 선택지입니다.
- 1,048,576 토큰 컨텍스트 윈도우와 65,536 토큰 출력 제한을 갖춘 사고 모델이며, 텍스트·이미지·영상·오디오 입력을 받아 텍스트를 반환합니다.
- 지원 기능에는 함수 호출, 구조화 출력, 코드 실행, 검색·지도 그라운딩, URL 컨텍스트, 컨텍스트 캐싱, Batch API, Flex 및 Priority 추론이 포함되고, Live API, 이미지 생성, 오디오 생성, 컴퓨터 사용은 지원되지 않습니다.
- 사고는 기본적으로 동적으로 동작하며, 2.5 Flash는 사고를 아예 끌 수 있는 몇 안 되는 Gemini 모델 중 하나입니다. thinkingBudget은 0부터 24,576까지를 받고 -1은 동적, 0은 사고를 완전히 비활성화합니다.
- 요약만 반환되더라도 사고 토큰이 출력 토큰으로 과금되므로 이 설정은 의도적으로 고를 만합니다.
- Google의 새로운 Interactions API는 같은 제어를 숫자 예산 대신 low, medium, high의 thinking_level 문자열로 노출하므로, 어느 인터페이스를 호출하느냐에 따라 요청 방식이 달라집니다.
- 지식 컷오프는 2025년 1월입니다.
- 개발자는 Synthorai에서 익숙한 OpenAI 호환 chat completions API로 이 모델에 접근합니다.
자주 묻는 질문
Gemini 2.5 Flash API는 무료로 사용해 볼 수 있나요?
네, 신규 계정에는 10회의 체험 호출과 최대 $1의 무료 크레딧이 제공되며, 카드 등록이 필요 없습니다. 입력 토큰 $0.3/M 기준으로, 이 크레딧만으로도 Gemini 2.5 Flash에 약 8K 토큰 규모의 요청을 대략 416회 보낼 수 있습니다.
Gemini 2.5 Flash는 무엇에 가장 강한가요?
대용량 추론에 최고의 가격 대비 성능, 1,048,576 토큰 컨텍스트의 사고 모델, 코드 실행과 검색 그라운딩 내장. 전체 내용은 벤더의 공식 릴리스 노트를 정리한 소개 섹션을 참고하세요.
Gemini 2.5 Flash의 가격은 얼마인가요?
Synthorai에서 Gemini 2.5 Flash는 입력 토큰 100만 개당 $0.3, 출력 토큰 100만 개당 $2.5입니다. 공급사 정가 그대로이며 플랫폼 마진이 없습니다. 캐시된 입력 토큰은 $0.03/M로 과금됩니다.
Gemini 2.5 Flash는 프롬프트 캐싱을 지원하나요?
네, 자동 캐싱이 기본으로 켜져 있고, 확정적 절감을 위한 명시적 모드도 있습니다. 캐시된 입력 토큰은 $0.03/M로 과금됩니다(미캐시 시 $0.3/M); 캐시되려면 프롬프트에 4,096 토큰 이상의 안정적인 프리픽스가 필요합니다. 프롬프트 캐싱 가이드 →
Gemini 2.5 Flash는 어떻게 이용하나요?
기존 OpenAI SDK의 base_url을 "https://synthorai.io/v1"로 지정하고 model="gemini-2.5-flash"로 설정하면 끝입니다. API 키 하나로 게이트웨이의 모든 모델을 사용할 수 있습니다.
Gemini 2.5 Flash의 지식 컷오프는 언제인가요?
벤더 공식 문서에 따르면 Gemini 2.5 Flash의 지식 컷오프는 2025-01입니다(2026-07-09 기준).
관련 모델
비교
이 페이지의 모든 값은 벤더 자체 문서(위 링크)에서 전사했으며 확인 날짜를 함께 표기합니다. 가격은 카탈로그 전체와 비교하지만, 벤더마다 정의가 다른 사양 값은 차이를 명시할 뿐 도표로 비교하지 않습니다. 저희가 측정한 수치는 없으며 점수도 매기지 않습니다.