Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Whisper v1

Rilasciato 2023-03-01

transcription

Whisper v1 è il modello di riconoscimento vocale generalista di OpenAI, addestrato su un ampio dataset di audio diversificato.

Input
audio
Output
testo
Prezzo
$0.006/min

Il prezzo nel contesto

Posizione del prezzo tra 11 modelli comparabili

Al minuto$0.006/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Audio

Lingue Addestrato su 98 lingue; 57 indicate come supportate, ossia quelle che rientrano nella soglia di word error rate sotto il 50% fissata da OpenAI, sugli endpoint di trascrizione e traduzione
Limiti audio
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, fino a 25MB
  • timestamp a livello di parola e di segmento (verbose_json), output srt/vtt
  • nessuno streaming
  • unico modello supportato sull'endpoint di traduzione (verso l'inglese)
Diarizzazione No
Trascrizione in streaming No
Timestamp

Modello

Modalità audio → testo

Whisper large-v2 open source servito tramite API; prompt limitato a 224 token.

fonte: documentazione ufficiale OpenAI ↗

Usa Whisper v1 in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="whisper-1",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Informazioni su Whisper v1

  • È un sistema multitask che esegue trascrizione, riconoscimento vocale multilingue, traduzione del parlato e identificazione della lingua, ed è fatturato semplicemente al minuto di audio elaborato.
  • Nonostante i più recenti modelli di trascrizione basati su GPT-4o, per diversi compiti resta l'unica opzione nello stack audio di OpenAI.
  • È l'unico modello servito sull'endpoint di traduzione, che rende il parlato in inglese, e l'unico a supportare le granularità dei timestamp a livello di segmento o di parola.
  • Ha anche il supporto ai formati di risposta più ampio della famiglia, coprendo JSON, testo semplice, verbose JSON, SRT e VTT, che è ciò di cui hanno bisogno le pipeline di sottotitolazione.
  • I compromessi sono altrettanto concreti: la trascrizione in streaming non è supportata, i prompt guidano lo stile più che il contenuto (il modello tende a rispecchiare la punteggiatura e l'uso delle maiuscole del prompt), e vengono considerati solo gli ultimi 224 token di un prompt.
  • Valgono i limiti di trascrizione condivisi, con mp3, mp4, mpeg, mpga, m4a, wav e webm accettati fino a 25MB.
  • La documentazione di OpenAI ora lo inquadra in chiave storica, anche se la pagina del modello non porta alcun avviso di deprecazione.
  • Synthorai accetta i job Whisper sulla sua rotta compatibile OpenAI /v1/audio/transcriptions, così i client esistenti funzionano così come sono.

FAQ

L'API di Whisper v1 si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Whisper v1 sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle Whisper v1?

Multitask: trascrizione, traduzione, identificazione della lingua; fatturato semplicemente al minuto di audio; compatibile su endpoint di trascrizione e traduzione. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Whisper v1?

Su Synthorai, Whisper v1 costa $0.006 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.

Quali lingue supporta Whisper v1?

Whisper v1 supporta Addestrato su 98 lingue; 57 indicate come supportate, ossia quelle che rientrano nella soglia di word error rate sotto il 50% fissata da OpenAI, sugli endpoint di trascrizione e traduzione. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.

Come ottengo l'accesso a Whisper v1?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="whisper-1" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →