Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Whisper v1

Veröffentlicht 2023-03-01

transcription

Whisper v1 ist OpenAIs Allzweck-Spracherkennungsmodell, trainiert auf einem großen Datensatz vielfältiger Audiodaten.

Eingabe
Audio
Ausgabe
Text
Preis
$0.006/min

Preis im Vergleich

Preisposition unter 11 vergleichbaren Modellen

Pro Minute$0.006/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Audio

Sprachen Trainiert auf 98 Sprachen; 57 sind als unterstützt gelistet, nämlich jene Sprachen, die an den Transkriptions- und Translations-Endpoints OpenAIs Schwellenwert einer Wortfehlerrate unter 50% erreicht haben
Audio-Limits
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, bis 25MB
  • Zeitstempel auf Wort- und Segmentebene (verbose_json), srt/vtt-Output
  • kein Streaming
  • einziges Modell, das am Translations-Endpoint unterstützt wird (ins Englische)
Sprecher-Diarisierung Nein
Streaming-Transkription Nein
Zeitstempel Ja

Modell

Modalitäten Audio → Text
  • Quelloffenes Whisper large-v2, bereitgestellt über die API
  • der Prompt ist auf 224 Token begrenzt

laut Offizielle OpenAI-Dokumentation ↗

Whisper v1 in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="whisper-1",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Über Whisper v1

  • Es ist ein Multitask-System, das Transkription, mehrsprachige Spracherkennung, Sprachübersetzung und Sprachidentifikation ausführt und schlicht pro verarbeiteter Audiominute abgerechnet wird.
  • Trotz der neueren Transkriptionsmodelle auf GPT-4o-Basis ist es für mehrere Aufgaben weiterhin die einzige Option in OpenAIs Audio-Stack.
  • Es ist das einzige Modell, das auf dem Translations-Endpoint bereitgestellt wird, der Sprache ins Englische überträgt, und das einzige, das Zeitstempel-Granularitäten auf Segment- oder Wortebene unterstützt.
  • Es hat außerdem die breiteste Unterstützung für Antwortformate in der Familie und deckt JSON, reinen Text, Verbose-JSON, SRT und VTT ab, was Untertitel-Pipelines brauchen.
  • Die Kompromisse sind ebenso konkret: Gestreamte Transkription wird nicht unterstützt, Prompts steuern Stil statt Inhalt (das Modell neigt dazu, Interpunktion und Großschreibung des Prompts zu spiegeln), und nur die letzten 224 Token eines Prompts werden berücksichtigt.
  • Es gelten die gemeinsamen Transkriptionsgrenzen, mit mp3, mp4, mpeg, mpga, m4a, wav und webm bis 25MB.
  • OpenAIs Dokumentation rahmt es inzwischen historisch, obwohl die Modellseite keinen Deprecation-Hinweis trägt.
  • Synthorai nimmt Whisper-Jobs auf seiner OpenAI-kompatiblen Route /v1/audio/transcriptions entgegen, sodass bestehende Clients unverändert funktionieren.

FAQ

Lässt sich die Whisper v1 API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Whisper v1 mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist Whisper v1 am besten?

Multitask: Transkription, Übersetzung, Sprachidentifikation; schlicht pro Audiominute abgerechnet; kompatibel über Transkriptions- und Übersetzungs-Endpoints. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Whisper v1?

Whisper v1 kostet auf Synthorai $0.006 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.

Welche Sprachen unterstützt Whisper v1?

Whisper v1 unterstützt Trainiert auf 98 Sprachen; 57 sind als unterstützt gelistet, nämlich jene Sprachen, die an den Transkriptions- und Translations-Endpoints OpenAIs Schwellenwert einer Wortfehlerrate unter 50% erreicht haben. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.

Wie erhalte ich Zugang zu Whisper v1?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="whisper-1", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →