Whisper v1 ist OpenAIs Allzweck-Spracherkennungsmodell, trainiert auf einem großen Datensatz vielfältiger Audiodaten.
- Eingabe
- Audio
- Ausgabe
- Text
- Preis
- $0.006/min
Preis im Vergleich
Preisposition unter 11 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Audio
| Sprachen | Trainiert auf 98 Sprachen; 57 sind als unterstützt gelistet, nämlich jene Sprachen, die an den Transkriptions- und Translations-Endpoints OpenAIs Schwellenwert einer Wortfehlerrate unter 50% erreicht haben |
|---|---|
| Audio-Limits |
|
| Sprecher-Diarisierung | Nein |
| Streaming-Transkription | Nein |
| Zeitstempel | Ja |
Modell
| Modalitäten | Audio → Text |
|---|
- Quelloffenes Whisper large-v2, bereitgestellt über die API
- der Prompt ist auf 224 Token begrenzt
Whisper v1 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="whisper-1",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "whisper-1",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="whisper-1" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "whisper-1",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("whisper-1")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Über Whisper v1
- Es ist ein Multitask-System, das Transkription, mehrsprachige Spracherkennung, Sprachübersetzung und Sprachidentifikation ausführt und schlicht pro verarbeiteter Audiominute abgerechnet wird.
- Trotz der neueren Transkriptionsmodelle auf GPT-4o-Basis ist es für mehrere Aufgaben weiterhin die einzige Option in OpenAIs Audio-Stack.
- Es ist das einzige Modell, das auf dem Translations-Endpoint bereitgestellt wird, der Sprache ins Englische überträgt, und das einzige, das Zeitstempel-Granularitäten auf Segment- oder Wortebene unterstützt.
- Es hat außerdem die breiteste Unterstützung für Antwortformate in der Familie und deckt JSON, reinen Text, Verbose-JSON, SRT und VTT ab, was Untertitel-Pipelines brauchen.
- Die Kompromisse sind ebenso konkret: Gestreamte Transkription wird nicht unterstützt, Prompts steuern Stil statt Inhalt (das Modell neigt dazu, Interpunktion und Großschreibung des Prompts zu spiegeln), und nur die letzten 224 Token eines Prompts werden berücksichtigt.
- Es gelten die gemeinsamen Transkriptionsgrenzen, mit mp3, mp4, mpeg, mpga, m4a, wav und webm bis 25MB.
- OpenAIs Dokumentation rahmt es inzwischen historisch, obwohl die Modellseite keinen Deprecation-Hinweis trägt.
- Synthorai nimmt Whisper-Jobs auf seiner OpenAI-kompatiblen Route /v1/audio/transcriptions entgegen, sodass bestehende Clients unverändert funktionieren.
FAQ
Lässt sich die Whisper v1 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Whisper v1 mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.
Worin ist Whisper v1 am besten?
Multitask: Transkription, Übersetzung, Sprachidentifikation; schlicht pro Audiominute abgerechnet; kompatibel über Transkriptions- und Übersetzungs-Endpoints. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Whisper v1?
Whisper v1 kostet auf Synthorai $0.006 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.
Welche Sprachen unterstützt Whisper v1?
Whisper v1 unterstützt Trainiert auf 98 Sprachen; 57 sind als unterstützt gelistet, nämlich jene Sprachen, die an den Transkriptions- und Translations-Endpoints OpenAIs Schwellenwert einer Wortfehlerrate unter 50% erreicht haben. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.
Wie erhalte ich Zugang zu Whisper v1?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="whisper-1", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.