🎁 Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Chirp 3 vs Fun-ASR Flash

vs

Welches und wann — kuratiertes Fazit, keine Benchmark-Tabelle

Beide rechnen pro Audiominute ab, und fun-asr-flash ist 7.6x günstiger, $0.0021 gegenüber $0.016 — aber es ist das engere Werkzeug: nur synchrone Erkennung, bis zu 5 Minuten oder 2GB je Datei, 30+ Sprachen, keine Sprechertrennung. chirp-3 deckt 29 GA- plus 82 Vorschau-Locales ab, verarbeitet Stapel bis zu einer Stunde und Echtzeitströme und trennt Sprecher in 14 Sprachen. Nehmen Sie fun-asr-flash für kurze Clips in Menge; nehmen Sie chirp-3, wenn Sie Trennung, lange Dateien oder die breitere Locale-Liste brauchen.

Preise

Chirp 3 Fun-ASR Flash Δ
Pro Audiominute $0.016 $0.0021 7.6×

Preise aus dem Live-Katalog zum Zeitpunkt des Builds; jede Modellseite enthält die aktuelle Übersicht.

Wo sie stehen — Preis pro Audiominute über alle 11 Speech-to-Text-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Chirp 3 · $0.016 Fun-ASR Flash · $0.0021
$0.002 · Fun-ASR Realtime $0.016 · Chirp 2

Fähigkeiten

Chirp 3 Fun-ASR Flash
Sprecherdiarisierung ja nein
Streaming ja ja
Zeitstempel ja

Spezifikationen

Chirp 3 Fun-ASR Flash
Input-Modalitäten Audio Audio
Ausgabemodalitäten Text Text
Veröffentlicht 2025-10-13 2026-06
Limits

Auto-detected audio decoding

sync Recognize <1 min, BatchRecognize 1 min–1 hr (<=20 min with word timestamps), StreamingRecognize for real-time

speaker diarization in BatchRecognize and Recognize (14 languages)

utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported

language-agnostic transcription

29 GA + 82 preview locales

Synchronous fast recognition, <=5 min / <=2GB per audio

context injection for domain terms

30+ languages

no diarization

Sprachen

29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize

diarization covers 14 of them

Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak

Die Spezifikationen sind aus der Dokumentation der jeweiligen Anbieter übernommen; eine Zeile, die ein Anbieter nicht veröffentlicht, wird weggelassen und nicht abgeleitet. Vollständige Quellen: Chirp 3 · Fun-ASR Flash

Mit einer Zeile zwischen ihnen wechseln

Beide IDs befinden sich in jedem Tab unten — das hervorgehobene Zeilenpaar ist die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiche Request-Struktur.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    # model="fun-asr-flash",  # diese Zeile einkommentieren, die darüberliegende auskommentieren
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

API-Schlüssel holen →

FAQ

Welches ist günstiger, Chirp 3 oder Fun-ASR Flash?

Fun-ASR Flash ist günstiger bei pro audiominute ($0.0021 vs. $0.016, 7.6× Unterschied). Andere Zeilen können in die andere Richtung deuten — die obige Tabelle enthält alle Daten, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich Chirp 3 gegen Fun-ASR Flash ohne zwei Integrationen A/B-testen?

Ja. Beide werden über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel bereitgestellt — der Wechsel ist eine einzeilige Änderung des Modell-Strings, sodass Sie einen Bruchteil des Traffics an jedes Modell leiten und die Rechnungen direkt vergleichen können.

Unterstützen Chirp 3 und Fun-ASR Flash Sprecherdiarisierung?

Die obige Fähigkeitentabelle beantwortet dies pro Modell, direkt aus der Dokumentation des jeweiligen Anbieters — Diarisierung, Streaming und Zeitstempel sind separat aufgeführt, da sich die Modelle bei allen dreien unterscheiden.

Verwandte Vergleiche

Aus unseren gemessenen Studien