GPT-4o Transcribe è un modello speech-to-text che usa GPT-4o per trascrivere l'audio ed è l'offerta di trascrizione premium di OpenAI.
- Input
- audio testo $2.5/M
- Output
- testo $10/M
- Input audio
- $6/M
- Contesto
- 16K
- Cutoff di conoscenza
- 2024-06
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) ByteDance Google OpenAI
Il prezzo nel contesto
Posizione del prezzo tra 3 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Output massimo (specifica del vendor) | 2.000 |
|---|---|
| Cutoff di conoscenza | 2024-06 |
Audio
| Lingue | 57 lingue elencate per l'endpoint di trascrizione (un unico elenco condiviso da tutti i modelli di trascrizione); codici ISO 639-1 / 639-3 accettati per i modelli basati su GPT-4o |
|---|---|
| Limiti audio |
|
| Diarizzazione | No |
| Trascrizione in streaming | Sì |
| Timestamp | No |
Modello
| Modalità | audio + testo → testo |
|---|
Usa GPT-4o Transcribe in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Informazioni su GPT-4o Transcribe
- La pagina ufficiale gli attribuisce miglioramenti nel word error rate e un riconoscimento e un'accuratezza linguistica migliori rispetto ai modelli Whisper originali.
- Le richieste portano una finestra di contesto da 16K token con fino a 2K token di output, e il modello è servito su endpoint di trascrizione e realtime.
- Gli upload seguono i limiti condivisi della transcription API: mp3, mp4, mpeg, mpga, m4a, wav o webm, fino a 25MB per file, con le registrazioni più lunghe da suddividere lato client.
- A differenza di Whisper accetta un prompt, che OpenAI descrive come un modo per migliorare la qualità della trascrizione dando al modello contesto aggiuntivo, allo stesso modo in cui si formula un prompt per qualsiasi altro modello GPT-4o, il che è utile per nomi, gergo e grafie di prodotto.
- La trascrizione in streaming è supportata, così come le log probability per pipeline consapevoli della confidenza.
- Due limiti danno forma alle integrazioni: l'output è disponibile solo come JSON o testo semplice, senza SRT, VTT o verbose JSON, e su questo modello non sono offerte granularità dei timestamp a livello di parola o di segmento.
- La copertura linguistica segue l'elenco pubblicato dalla transcription API di più di settanta lingue, che OpenAI vincola a una soglia di word error rate anziché rivendicare un supporto universale, e il cutoff di conoscenza è giugno 2024.
- OpenAI lo inquadra come la scelta a più alta accuratezza quando lo streaming non è la priorità.
- Su Synthorai si inserisce senza modifiche nella rotta compatibile OpenAI /v1/audio/transcriptions.
FAQ
L'API di GPT-4o Transcribe si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare GPT-4o Transcribe sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle GPT-4o Transcribe?
Livello di trascrizione premium; miglior riconoscimento della lingua rispetto a Whisper originale; servito su endpoint di trascrizione e realtime. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa GPT-4o Transcribe?
Su Synthorai, GPT-4o Transcribe costa $2.5 per milione di token in input e $10 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.
Quali lingue supporta GPT-4o Transcribe?
GPT-4o Transcribe supporta 57 lingue elencate per l'endpoint di trascrizione (un unico elenco condiviso da tutti i modelli di trascrizione); codici ISO 639-1 / 639-3 accettati per i modelli basati su GPT-4o. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.
Come ottengo l'accesso a GPT-4o Transcribe?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gpt-4o-transcribe" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.