Gemini 3.1 Pro (preview) è l'iterazione raffinata da parte di Google della linea Gemini 3 Pro, e la sua pagina del modello evidenzia un thinking migliore, una maggiore efficienza sui token e un'esperienza più ancorata ai fatti e coerente; la model card di DeepMind lo definisce il modello più avanzato di Google per compiti complessi.
- Input
- testo immagine video audio $2/M
- Output
- testo $12/M
- Input audio
- $4/M
- Lettura cache
- $0.2/M
- Contesto
- 1M
- vs GPT-4o
- ~60% più economico
- Cutoff di conoscenza
- 2025-01
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.048.576 |
|---|---|
| Output massimo (specifica del vendor) | 65.536 |
| Cutoff di conoscenza | 2025-01 |
Caching prompt
| Modalità | automatico + esplicito |
|---|---|
| Prefisso min. | 4.096 |
Ragionamento
| Parametro del fornitore | thinkingLevel |
|---|---|
| Valori accettati | low · medium · high (minimal is not supported) |
| Valore predefinito | high applicato se la richiesta non specifica nulla |
| Disattivabile | No |
| Comportamento del ragionamento | L'unico livello Gemini 3 privo del livello minimal, e Google afferma esplicitamente che per 3.1 Pro il thinking non può essere disattivato; i token di thinking vengono fatturati come token di output e le thought signature devono essere restituite per il function calling. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine + video + audio → testo |
|---|
- 1.048.576 token in input
- grounding su Search/Maps ed esecuzione di codice supportati
- generazione di immagini NON supportata nonostante il tag di capacità del gateway
Un solo prompt, misurato attraverso il gateway
Gemini 3.1 Pro superato · 3 sentences
Enabling the AI's reasoning capability forces the model to generate a massive amount of invisible "thought" tokens to logically work through complex problems before delivering its final answer. Because our vendor's pricing model charges us for total computational effort—including all of these hidden background tokens—our billable usage effectively doubled per request. While this directly increases our upfront software expenses, we are trading this higher compute cost for a drastic reduction in expensive downstream errors and manual human rework.
out 1412 tok (+1318 ragionamento) latenza 12.7 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Gemini 3.1 Pro superato · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The original function initializes `cur` and `best` to 0 and only increments `cur` when two adjacent elements are equal. This effectively counts the number of *matching consecutive pairs* (or transitions) rather than the actual number of *elements* in the run, causing all calculated lengths to be […]
out 4092 tok (+3933 ragionamento) latenza 31.1 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Gemini 3.1 Pro superato · 5/5 fields, guidance "withheld"
```json { "company": "Meridian Robotics", "quarter": "September", "revenue_usd_m": 412, "growth_pct": "11 and change", "guidance": "withheld" } ```
out 1806 tok (+1743 ragionamento) latenza 14.1 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Gemini 3.1 Pro superato · 120 words, 0 banned, 1 question
We are excited to announce universal prompt caching for our API gateway. Handling multiple AI models usually means paying for redundant prompts across various platforms. Why should you pay twice for identical queries? Now, our gateway automatically stores and retrieves exact prompt matches regardless of the backend provider you select. This reduces latency and significantly cuts your inference costs. Whether you route a request to one service today or a different vendor tomorrow, our intelligent caching layer intercepts the call and serves the saved response instantly. Developers can configure cache expiration times and specify matching criteria directly in the control panel. Experience faster response times and optimized resource usage starting today. Upgrade your software client to version two right now.
out 4060 tok (+3929 ragionamento) latenza 28.6 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Gemini 3.1 Pro in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gemini-3.1-pro-preview",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gemini-3.1-pro-preview",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.1-pro-preview",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gemini-3.1-pro-preview",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gemini-3.1-pro-preview")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Gemini 3.1 Pro
- Google indica come suoi usi migliori le prestazioni agentiche, il coding avanzato, la comprensione di contesto lungo e multimodale, lo sviluppo algoritmico, gli agent basati su strumenti e l'esecuzione multi-step che richiede un uso preciso degli strumenti.
- Accetta input di testo, immagini, video, audio e PDF in una finestra di contesto da 1.048.576 token con 65.536 token di output, e supporta function calling, output strutturati, esecuzione di codice, grounding con Search e Maps, contesto da URL, caching del contesto e la Batch API; computer use e la Live API non sono supportati.
- Il thinking è controllato da thinking_level, e la linea Pro accetta solo low, medium e high, senza l'impostazione minimal che offrono i modelli Flash, con predefinito high; il ragionamento non può essere disabilitato, quindi va messo a budget il costo dei token di thinking fatturati alla tariffa di output a ogni richiesta, e vanno restituite le thought signature che Gemini 3 emette se si vuole continuità multi-turno.
- Una variante gemini-3.1-pro-preview-customtools dà priorità agli strumenti definiti dallo sviluppatore, e il precedente identificatore gemini-3-pro-preview è stato ritirato in favore di questo.
- Synthorai lo espone con una chat completions API compatibile OpenAI.
FAQ
L'API di Gemini 3.1 Pro si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $2/M token in input, quel credito da solo copre circa 62 richieste da ~8K token verso Gemini 3.1 Pro.
In cosa eccelle Gemini 3.1 Pro?
Thinking migliore ed efficienza sui token migliorata; ottimizzato per l'ingegneria del software e gli agent; variante custom-tools dà priorità agli strumenti dello sviluppatore. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Gemini 3.1 Pro?
Su Synthorai, Gemini 3.1 Pro costa $2 per milione di token in input e $12 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.2/M.
Gemini 3.1 Pro supporta il caching dei prompt?
Sì: il caching automatico è attivo di default, con una modalità esplicita per risparmi garantiti. I token di input in cache si fatturano a $0.2/M contro $2/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 4,096 token. Guida al caching dei prompt →
Come ottengo l'accesso a Gemini 3.1 Pro?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gemini-3.1-pro-preview" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di Gemini 3.1 Pro?
Il cutoff di conoscenza di Gemini 3.1 Pro è 2025-01, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.