seed-asr-bigmodel è il servizio di riconoscimento vocale con large model Seed-ASR di ByteDance su BytePlus, esposto tramite l'API di riconoscimento su file audio come motore bigmodel.
- Input
- audio
- Output
- testo
- Prezzo
- $0.002/min
Il prezzo nel contesto
Posizione del prezzo tra 11 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Audio
| Lingue | Con `language` vuoto il modello copre mandarino, inglese, cantonese, shanghainese, minnan e i dialetti del Sichuan e dello Shaanxi; 39 chiavi di lingua possono essere fissate esplicitamente (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), oltre al rilevamento automatico opzionale (enable_auto_lang) |
|---|---|
| Limiti audio |
|
| Diarizzazione | Sì |
| Trascrizione in streaming | Sì |
| Timestamp | Sì |
Modello
| Modalità | audio → testo |
|---|
Non esiste un id ufficiale del modello 'seed-asr-bigmodel': BytePlus Seed Speech usa model_name 'bigmodel' con i resource id volc.bigasr.auc (Seed ASR 1.0) / volc.seedasr.auc (Seed ASR 2.0).
Usa Seed ASR in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="seed-asr-bigmodel",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "seed-asr-bigmodel",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="seed-asr-bigmodel" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "seed-asr-bigmodel",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("seed-asr-bigmodel")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Informazioni su Seed ASR
- Trascrive le registrazioni in modo asincrono con un flusso di invio-e-interrogazione adatto a carichi di lavoro batch e offline: il chiamante fornisce il proprio request ID, che funge anche da ID del task, e poi interroga finché il codice di stato non segnala il completamento, con risultati prodotti entro tre ore e recuperabili per sette giorni.
- L'audio può arrivare a cinque ore e 512 MB nei formati OPUS, WAV, MP3, OGG, AMR, AAC e M4A, in mono o stereo.
- Riconosce di default mandarino, inglese, cantonese e diversi dialetti cinesi, con decine di lingue impostabili dal giapponese all'arabo e rilevamento automatico della lingua opzionale, che ha la precedenza su una lingua indicata esplicitamente quando sono impostati entrambi.
- Il biasing con hotword e il contesto conversazionale migliorano l'accuratezza, con le liste di hotword limitate a 5.000 parole e il contesto di dialogo a 800 token o venti turni, e Seed ASR 2.0 estende quel contesto a un'immagine di accompagnamento, una per richiesta.
- Diarizzazione dei parlanti, separazione dei canali, timestamp a livello di enunciato e di parola con confidenza, filtro delle parole sensibili e varianti in cinese tradizionale sono tutti flag opzionali; da notare che la punteggiatura è disattivata di default mentre la normalizzazione inversa del testo è attiva, e che la diarizzazione è una funzionalità della modalità file che le modalità in streaming non offrono.
- Synthorai lo avvolge in un endpoint di trascrizione compatibile OpenAI.
FAQ
L'API di Seed ASR si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Seed ASR sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle Seed ASR?
Trascrizione batch asincrona invio-e-interrogazione; decine di lingue impostabili con rilevamento automatico; il contesto conversazionale si estende a un'immagine di accompagnamento. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Seed ASR?
Su Synthorai, Seed ASR costa $0.002 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.
Quali lingue supporta Seed ASR?
Seed ASR supporta Con `language` vuoto il modello copre mandarino, inglese, cantonese, shanghainese, minnan e i dialetti del Sichuan e dello Shaanxi; 39 chiavi di lingua possono essere fissate esplicitamente (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), oltre al rilevamento automatico opzionale (enable_auto_lang). Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.
Come ottengo l'accesso a Seed ASR?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="seed-asr-bigmodel" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.