Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Seed ASR

transcription

seed-asr-bigmodel è il servizio di riconoscimento vocale con large model Seed-ASR di ByteDance su BytePlus, esposto tramite l'API di riconoscimento su file audio come motore bigmodel.

Input
audio
Output
testo
Prezzo
$0.002/min

Il prezzo nel contesto

Posizione del prezzo tra 11 modelli comparabili

Al minuto$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Audio

Lingue Con `language` vuoto il modello copre mandarino, inglese, cantonese, shanghainese, minnan e i dialetti del Sichuan e dello Shaanxi; 39 chiavi di lingua possono essere fissate esplicitamente (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), oltre al rilevamento automatico opzionale (enable_auto_lang)
Limiti audio
  • Modalità asincrona su file audio: <512MB, <5 ore, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (accettato anche il PCM grezzo), risultati restituiti entro 3 ore e conservati 7 giorni
  • diarizzazione dei parlanti tramite enable_speaker_info (solo API su file audio, resa migliore con <=10 parlanti, nessuna diarizzazione sull'API di streaming)
  • segmentazione in frasi e parole con start_time/end_time tramite show_utterances
  • identificazione della lingua tramite enable_lid
  • hotword/contesto fino a 800 token e 20 round
  • fatturazione per chiamata
Diarizzazione
Trascrizione in streaming
Timestamp

Modello

Modalità audio → testo

Non esiste un id ufficiale del modello 'seed-asr-bigmodel': BytePlus Seed Speech usa model_name 'bigmodel' con i resource id volc.bigasr.auc (Seed ASR 1.0) / volc.seedasr.auc (Seed ASR 2.0).

fonte: documentazione ufficiale ByteDance ↗

Usa Seed ASR in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="seed-asr-bigmodel",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Informazioni su Seed ASR

  • Trascrive le registrazioni in modo asincrono con un flusso di invio-e-interrogazione adatto a carichi di lavoro batch e offline: il chiamante fornisce il proprio request ID, che funge anche da ID del task, e poi interroga finché il codice di stato non segnala il completamento, con risultati prodotti entro tre ore e recuperabili per sette giorni.
  • L'audio può arrivare a cinque ore e 512 MB nei formati OPUS, WAV, MP3, OGG, AMR, AAC e M4A, in mono o stereo.
  • Riconosce di default mandarino, inglese, cantonese e diversi dialetti cinesi, con decine di lingue impostabili dal giapponese all'arabo e rilevamento automatico della lingua opzionale, che ha la precedenza su una lingua indicata esplicitamente quando sono impostati entrambi.
  • Il biasing con hotword e il contesto conversazionale migliorano l'accuratezza, con le liste di hotword limitate a 5.000 parole e il contesto di dialogo a 800 token o venti turni, e Seed ASR 2.0 estende quel contesto a un'immagine di accompagnamento, una per richiesta.
  • Diarizzazione dei parlanti, separazione dei canali, timestamp a livello di enunciato e di parola con confidenza, filtro delle parole sensibili e varianti in cinese tradizionale sono tutti flag opzionali; da notare che la punteggiatura è disattivata di default mentre la normalizzazione inversa del testo è attiva, e che la diarizzazione è una funzionalità della modalità file che le modalità in streaming non offrono.
  • Synthorai lo avvolge in un endpoint di trascrizione compatibile OpenAI.

FAQ

L'API di Seed ASR si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Seed ASR sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle Seed ASR?

Trascrizione batch asincrona invio-e-interrogazione; decine di lingue impostabili con rilevamento automatico; il contesto conversazionale si estende a un'immagine di accompagnamento. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Seed ASR?

Su Synthorai, Seed ASR costa $0.002 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.

Quali lingue supporta Seed ASR?

Seed ASR supporta Con `language` vuoto il modello copre mandarino, inglese, cantonese, shanghainese, minnan e i dialetti del Sichuan e dello Shaanxi; 39 chiavi di lingua possono essere fissate esplicitamente (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), oltre al rilevamento automatico opzionale (enable_auto_lang). Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.

Come ottengo l'accesso a Seed ASR?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="seed-asr-bigmodel" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →