Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

Chirp 3 vs Fun-ASR Flash

vs

Welches Modell wofür

Beide rechnen pro Audiominute ab, und fun-asr-flash ist 7.6x günstiger, $0.0021 gegenüber $0.016 - aber es ist das engere Werkzeug: nur synchrone Erkennung, bis zu 5 Minuten oder 2GB je Datei, 30+ Sprachen, keine Sprechertrennung. chirp-3 deckt 29 GA- plus 82 Vorschau-Locales ab, verarbeitet Stapel bis zu einer Stunde und Echtzeitströme und trennt Sprecher in 14 Sprachen. Nehmen Sie fun-asr-flash für kurze Clips in Menge; nehmen Sie chirp-3, wenn Sie Trennung, lange Dateien oder die breitere Locale-Liste brauchen.

Preise

Chirp 3 Fun-ASR Flash Δ
Pro Audiominute $0.016 $0.0021 7.6×

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Einordnung: Preis pro Audiominute aller 12 Speech-to-Text-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Chirp 3 · $0.016 Fun-ASR Flash · $0.0021

Fähigkeiten

Chirp 3 Fun-ASR Flash
Sprecherdiarisierung ja nein
Streaming ja ja
Zeitstempel ja -

Spezifikationen

Chirp 3 Fun-ASR Flash
Eingabemodalitäten Audio Audio
Ausgabemodalitäten Text Text
Veröffentlicht 2025-10-13 2026-06
Limits

Auto-detected audio decoding

sync Recognize <1 min, BatchRecognize 1 min - 1 hr (<=20 min with word timestamps), StreamingRecognize for real-time

speaker diarization in BatchRecognize and Recognize (14 languages)

utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported

language-agnostic transcription

29 GA + 82 preview locales

Synchronous fast recognition, <=5 min / <=2GB per audio

context injection for domain terms

30+ languages

no diarization

Sprachen

29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize

diarization covers 14 of them

Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: Chirp 3 · Fun-ASR Flash

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    # model="fun-asr-flash",  # diese Zeile einkommentieren, die darüberliegende auskommentieren
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: Chirp 3 oder Fun-ASR Flash?

Fun-ASR Flash ist bei Pro Audiominute günstiger ($0.0021 vs. $0.016, Faktor 7.6). Bei anderen Zeilen kann es umgekehrt sein. Die Tabelle oben zeigt alle Preise, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich Chirp 3 gegen Fun-ASR Flash A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Unterstützen Chirp 3 und Fun-ASR Flash Sprecherdiarisierung?

Das beantwortet die Tabelle der Fähigkeiten oben für jedes Modell einzeln, direkt aus der Dokumentation des jeweiligen Anbieters. Diarisierung, Streaming und Zeitstempel stehen dort getrennt, weil sich die Modelle in allen drei Punkten unterscheiden.

Verwandte Vergleiche

Aus unseren Studien mit eigenen Messungen