Gemini 2.5 Flash è il modello Gemini 2.5 di Google con il miglior rapporto prezzo-prestazioni, mirato a carichi di lavoro a bassa latenza e ad alto volume che richiedono comunque ragionamento, tra cui l'elaborazione su larga scala e le applicazioni agentiche.
- Input
- testo immagine video audio $0.3/M
- Output
- testo $2.5/M
- Input audio
- $1/M
- Lettura cache
- $0.03/M
- Contesto
- 1M
- vs GPT-4o
- ~94% più economico
- Cutoff di conoscenza
- 2025-01
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Amazon Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.048.576 |
|---|---|
| Output massimo (specifica del vendor) | 65.536 |
| Cutoff di conoscenza | 2025-01 |
Caching prompt
| Modalità | automatico + esplicito |
|---|---|
| Prefisso min. | 4.096 |
Ragionamento
| Parametro del fornitore | thinkingBudget (generateContent) · thinking_level (Interactions API) |
|---|---|
| Valori accettati | thinkingBudget 0 to 24576, or -1 for dynamic · Interactions API: low, medium, high |
| Valore predefinito | thinking dinamico (thinkingBudget -1) applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | thinkingBudget 0 disattiva il thinking; i token di thinking vengono fatturati come token di output (thoughtsTokenCount); la 2.5 restituisce le thought signature solo quando il thinking è attivo e la richiesta dichiara delle funzioni. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video + audio → testo |
|---|
- Primo rilascio stabile di 2.5 Flash
- 1.048.576 token in input / 65.536 in output
- input di testo+immagini+video+audio
- thinking supportato
Un solo prompt, misurato attraverso il gateway
Gemini 2.5 Flash superato · 3 sentences
Enabling LLM reasoning means the model processes more complex thoughts, often requiring multiple steps or internal iterations to generate accurate answers. This translates directly to higher token consumption per query, as the model "thinks" more deeply and generates more internal and external text for each request. While increasing cost, this deeper processing significantly enhances output quality and reliability, delivering more robust solutions for critical business functions.
out 368 tok (+290 ragionamento) latenza 3.1 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Gemini 2.5 Flash superato · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 # Initialize best to 1, as a non-empty list always has at least one run of length 1 cur = 1 # Initialize current run length to 1 for the first element for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 # Extend the current run else: cur = 1 # Start a new run of length 1 with the current element xs[i] best = max(best, cur) # Always update best after processing the current element return best ``` **Explanation of the bug:** The original code had two primary flaws. First, it initialized `best` to 0 and `cur` to 0. For single-element inputs (e.g., `[1]`), the loop `range(1, len(xs))` would be empty, causing the function to incorrectly return 0 instead of 1. […]
out 3871 tok (+3463 ragionamento) latenza 19.8 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Gemini 2.5 Flash superato · 5/5 fields, guidance "withheld pending the Q4 close for Meridi"
```json { "company": null, "quarter": "September", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld pending the Q4 close for Meridian Robotics" } ```
out 380 tok (+314 ragionamento) latenza 2.5 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Gemini 2.5 Flash superato · 111 words, 0 banned, 1 question
Introducing our latest API Gateway enhancement: **Cross-Provider Prompt Caching**. This new feature intelligently stores and reuses frequently used prompts across all your integrated AI services, regardless of the underlying provider. Eliminate redundant API calls and unnecessary expenses from sending identical requests repeatedly. By intelligently serving cached responses, your applications will experience significantly reduced latency and improved operational efficiency, leading to faster user interactions. This update ensures consistent, rapid delivery of AI-generated content, optimizing resource utilization across your entire AI infrastructure. Are you ready to accelerate your AI-driven workflows and reduce operational spend? Experience substantial performance gains and smarter resource management with this advanced capability, bolstering your AI strategy for greater effectiveness.
out 1242 tok (+1108 ragionamento) latenza 7.3 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Gemini 2.5 Flash in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-2.5-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-2.5-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-2.5-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-2.5-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Gemini 2.5 Flash
- La pagina del modello di Google lo definisce il "miglior modello in termini di rapporto prezzo-prestazioni, con capacità ben bilanciate", la scelta intermedia tra Flash-Lite, che rinuncia alla profondità di ragionamento per il costo, e 2.5 Pro, che rinuncia alla latenza per la profondità.
- È un modello thinking con una finestra di contesto da 1.048.576 token e un limite di output da 65.536 token, che accetta input di testo, immagini, video e audio e restituisce testo.
- Le capacità supportate includono function calling, output strutturati, esecuzione di codice, grounding con Search e Maps, contesto da URL, caching del contesto, la Batch API e l'inferenza Flex e Priority; Live API, generazione di immagini, generazione di audio e computer use no.
- Il thinking è dinamico di default, e 2.5 Flash è uno dei pochi modelli Gemini in cui può essere disattivato del tutto: thinkingBudget accetta da 0 a 24.576, con -1 per il dinamico e 0 che disabilita interamente il thinking.
- Vale la pena scegliere quell'impostazione deliberatamente, perché i token di thinking sono fatturati come token di output anche quando viene restituito solo un riepilogo.
- La più recente Interactions API di Google espone lo stesso controllo come stringa thinking_level a low, medium o high anziché come budget numerico, quindi la superficie che chiami cambia il modo in cui lo si richiede.
- Il cutoff di conoscenza è gennaio 2025.
- Gli sviluppatori lo raggiungono su Synthorai tramite la familiare chat completions API compatibile OpenAI.
FAQ
L'API di Gemini 2.5 Flash si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.3/M token in input, quel credito da solo copre circa 416 richieste da ~8K token verso Gemini 2.5 Flash.
In cosa eccelle Gemini 2.5 Flash?
Miglior prezzo-prestazioni per ragionamento ad alto volume; modello thinking con contesto da 1.048.576 token; esecuzione di codice e grounding di ricerca integrati. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Gemini 2.5 Flash?
Su Synthorai, Gemini 2.5 Flash costa $0.3 per milione di token in input e $2.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.03/M.
Gemini 2.5 Flash supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.03/M contro $0.3/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 4,096 token. Guida al caching dei prompt →
Come ottengo l'accesso a Gemini 2.5 Flash?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gemini-2.5-flash" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di Gemini 2.5 Flash?
Il cutoff di conoscenza di Gemini 2.5 Flash è 2025-01, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.