Whisper v1 è il modello di riconoscimento vocale generalista di OpenAI, addestrato su un ampio dataset di audio diversificato.
- Input
- audio
- Output
- testo
- Prezzo
- $0.006/min
Il prezzo nel contesto
Posizione del prezzo tra 11 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Audio
| Lingue | Addestrato su 98 lingue; 57 indicate come supportate, ossia quelle che rientrano nella soglia di word error rate sotto il 50% fissata da OpenAI, sugli endpoint di trascrizione e traduzione |
|---|---|
| Limiti audio |
|
| Diarizzazione | No |
| Trascrizione in streaming | No |
| Timestamp | Sì |
Modello
| Modalità | audio → testo |
|---|
Whisper large-v2 open source servito tramite API; prompt limitato a 224 token.
Usa Whisper v1 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="whisper-1",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "whisper-1",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="whisper-1" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "whisper-1",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("whisper-1")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Informazioni su Whisper v1
- È un sistema multitask che esegue trascrizione, riconoscimento vocale multilingue, traduzione del parlato e identificazione della lingua, ed è fatturato semplicemente al minuto di audio elaborato.
- Nonostante i più recenti modelli di trascrizione basati su GPT-4o, per diversi compiti resta l'unica opzione nello stack audio di OpenAI.
- È l'unico modello servito sull'endpoint di traduzione, che rende il parlato in inglese, e l'unico a supportare le granularità dei timestamp a livello di segmento o di parola.
- Ha anche il supporto ai formati di risposta più ampio della famiglia, coprendo JSON, testo semplice, verbose JSON, SRT e VTT, che è ciò di cui hanno bisogno le pipeline di sottotitolazione.
- I compromessi sono altrettanto concreti: la trascrizione in streaming non è supportata, i prompt guidano lo stile più che il contenuto (il modello tende a rispecchiare la punteggiatura e l'uso delle maiuscole del prompt), e vengono considerati solo gli ultimi 224 token di un prompt.
- Valgono i limiti di trascrizione condivisi, con mp3, mp4, mpeg, mpga, m4a, wav e webm accettati fino a 25MB.
- La documentazione di OpenAI ora lo inquadra in chiave storica, anche se la pagina del modello non porta alcun avviso di deprecazione.
- Synthorai accetta i job Whisper sulla sua rotta compatibile OpenAI /v1/audio/transcriptions, così i client esistenti funzionano così come sono.
FAQ
L'API di Whisper v1 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Whisper v1 sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle Whisper v1?
Multitask: trascrizione, traduzione, identificazione della lingua; fatturato semplicemente al minuto di audio; compatibile su endpoint di trascrizione e traduzione. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Whisper v1?
Su Synthorai, Whisper v1 costa $0.006 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.
Quali lingue supporta Whisper v1?
Whisper v1 supporta Addestrato su 98 lingue; 57 indicate come supportate, ossia quelle che rientrano nella soglia di word error rate sotto il 50% fissata da OpenAI, sugli endpoint di trascrizione e traduzione. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.
Come ottengo l'accesso a Whisper v1?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="whisper-1" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.