Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Seed ASR

transcription

seed-asr-bigmodel ist ByteDances Seed-ASR-Großmodell-Spracherkennungsdienst auf BytePlus, über die Audio-Datei-Erkennungs-API als bigmodel-Engine bereitgestellt.

Eingabe
Audio
Ausgabe
Text
Preis
$0.002/min

Preis im Vergleich

Preisposition unter 11 vergleichbaren Modellen

Pro Minute$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Audio

Sprachen Bei leerem `language` deckt das Modell Mandarin, Englisch, Kantonesisch, Shanghainesisch, Minnan sowie die Dialekte von Sichuan und Shaanxi ab; 39 Sprachschlüssel lassen sich explizit festlegen (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), dazu optionale automatische Erkennung (enable_auto_lang)
Audio-Limits
  • Asynchroner Audiodatei-Modus: <512MB, <5 Stunden, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (rohes PCM wird ebenfalls akzeptiert), Ergebnisse werden innerhalb von 3 Stunden zurückgegeben und 7 Tage aufbewahrt
  • Sprecher-Diarisierung über enable_speaker_info (nur Audiodatei-API, am besten mit <=10 Sprechern, keine Diarisierung über die Streaming-API)
  • Satz- und Wortsegmentierung mit start_time/end_time über show_utterances
  • Sprachidentifikation über enable_lid
  • Hotwords und Kontext bis zu 800 Token und 20 Runden
  • Abrechnung pro Aufruf
Sprecher-Diarisierung Ja
Streaming-Transkription Ja
Zeitstempel Ja

Modell

Modalitäten Audio → Text

Eine offizielle Modell-id 'seed-asr-bigmodel' gibt es nicht: BytePlus Seed Speech verwendet model_name 'bigmodel' mit den Ressourcen-ids volc.bigasr.auc (Seed ASR 1.0) / volc.seedasr.auc (Seed ASR 2.0).

laut Offizielle ByteDance-Dokumentation ↗

Seed ASR in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="seed-asr-bigmodel",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Über Seed ASR

  • Es transkribiert Aufnahmen asynchron über einen Submit-and-Query-Ablauf, der sich für Batch- und Offline-Workloads eignet: Die aufrufende Seite liefert ihre eigene Request-ID, die zugleich als Task-ID dient, und fragt dann ab, bis der Statuscode den Abschluss meldet, wobei Ergebnisse innerhalb von drei Stunden entstehen und sieben Tage lang abrufbar sind.
  • Audio kann bis zu fünf Stunden und 512 MB umfassen, in OPUS, WAV, MP3, OGG, AMR, AAC und M4A, in Mono oder Stereo.
  • Es erkennt standardmäßig Mandarin, Englisch, Kantonesisch und mehrere chinesische Dialekte, mit Dutzenden einstellbaren Sprachen von Japanisch bis Arabisch und optionaler automatischer Spracherkennung, die Vorrang vor einer ausdrücklich benannten Sprache hat, wenn beides gesetzt ist.
  • Hotword-Biasing und konversationeller Kontext verbessern die Genauigkeit, wobei Hotword-Listen auf 5.000 Wörter und der Dialogkontext auf 800 Token oder zwanzig Runden begrenzt sind, und Seed ASR 2.0 erweitert diesen Kontext um ein begleitendes Bild, eines pro Anfrage.
  • Sprecher-Diarisierung, Kanaltrennung, Zeitstempel auf Äußerungs- und Wortebene mit Konfidenz, Filterung sensibler Wörter und traditionelle chinesische Varianten sind allesamt optionale Flags; beachten Sie, dass Interpunktion standardmäßig aus ist, während die inverse Textnormalisierung an ist, und dass die Diarisierung eine Funktion des Dateimodus ist, die die Streaming-Modi nicht bieten.
  • Synthorai kapselt es in einem OpenAI-kompatiblen Transkriptions-Endpoint.

FAQ

Lässt sich die Seed ASR API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Seed ASR mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist Seed ASR am besten?

Asynchrone Submit-and-Query-Batch-Transkription; Dutzende einstellbare Sprachen mit Auto-Erkennung; konversationeller Kontext erstreckt sich auf ein begleitendes Bild. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Seed ASR?

Seed ASR kostet auf Synthorai $0.002 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.

Welche Sprachen unterstützt Seed ASR?

Seed ASR unterstützt Bei leerem `language` deckt das Modell Mandarin, Englisch, Kantonesisch, Shanghainesisch, Minnan sowie die Dialekte von Sichuan und Shaanxi ab; 39 Sprachschlüssel lassen sich explizit festlegen (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), dazu optionale automatische Erkennung (enable_auto_lang). Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.

Wie erhalte ich Zugang zu Seed ASR?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="seed-asr-bigmodel", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →