Chirp 3 vs Fun-ASR Flash
Cuál usar y cuándo — veredicto seleccionado, no una tabla de benchmarks
Ambos facturan por minuto de audio y fun-asr-flash sale 7.6x más barato, $0.0021 frente a $0.016 — pero es la herramienta más estrecha: solo reconocimiento síncrono, hasta 5 minutos o 2GB por archivo, 30+ idiomas, sin diarización. chirp-3 cubre 29 locales GA más 82 en vista previa, procesa lotes de hasta una hora y flujos en tiempo real, y diariza en 14 idiomas. Elige fun-asr-flash para clips cortos en volumen; elige chirp-3 cuando necesites diarización, archivos largos o la lista de locales más amplia.
Precios
| Chirp 3 | Fun-ASR Flash | Δ | |
|---|---|---|---|
| Por minuto de audio | $0.016 | $0.0021 | 7.6× |
Tarifas del catálogo en vivo en el momento de la compilación; la página de cada modelo incluye la ficha actualizada.
Dónde se sitúan — precio por minuto de audio en todos los 11 modelos de voz a texto en esta unidad de facturación (escala logarítmica)
Capacidades
| Chirp 3 | Fun-ASR Flash | |
|---|---|---|
| Diarización de hablantes | sí | no |
| Streaming | sí | sí |
| Marcas de tiempo | sí | — |
Especificaciones
| Chirp 3 | Fun-ASR Flash | |
|---|---|---|
| Modalidades de entrada | audio | audio |
| Modalidades de salida | texto | texto |
| Lanzamiento | 2025-10-13 | 2026-06 |
| Límites | Auto-detected audio decoding sync Recognize <1 min, BatchRecognize 1 min–1 hr (<=20 min with word timestamps), StreamingRecognize for real-time speaker diarization in BatchRecognize and Recognize (14 languages) utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported language-agnostic transcription 29 GA + 82 preview locales | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization |
| Idiomas | 29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize diarization covers 14 of them | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak |
Las especificaciones se transcriben de la documentación de cada proveedor; si un proveedor no publica una fila, se omite en lugar de inferirse. Fuentes completas: Chirp 3 · Fun-ASR Flash
Cambia entre ellos con una línea
Ambos IDs están en cada pestaña a continuación — el par de líneas resaltadas es la única edición. Mismo endpoint, misma clave, misma estructura de solicitud.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-3",
# model="fun-asr-flash", # descomenta esta línea, comenta la de arriba
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-3",
// model: "fun-asr-flash", // descomenta esta línea, comenta la de arriba
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-3" \
# -F model="fun-asr-flash" \ # descomenta esta línea, comenta la de arriba
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-3",
// Model: "fun-asr-flash", // descomenta esta línea, comenta la de arriba
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-3")
// .model("fun-asr-flash") // descomenta esta línea, comenta la de arriba
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Preguntas frecuentes
¿Cuál es más barato, Chirp 3 o Fun-ASR Flash?
Fun-ASR Flash es más barato en por minuto de audio ($0.0021 vs $0.016, con una diferencia de 7.6×). Otras filas pueden indicar lo contrario — la tabla anterior muestra la ficha completa, y el costo real depende de su combinación.
¿Puedo hacer pruebas A/B de Chirp 3 frente a Fun-ASR Flash sin dos integraciones?
Sí. Ambos se sirven a través del mismo endpoint compatible con OpenAI con una clave API — el cambio es una modificación de una línea en la cadena del modelo, por lo que puede enrutar una fracción del tráfico a cada uno y comparar las facturas directamente.
¿Soportan Chirp 3 y Fun-ASR Flash la diarización de hablantes?
La tabla de capacidades anterior responde a esto por modelo, directamente desde la documentación de cada proveedor — la diarización, el streaming y las marcas de tiempo se listan por separado porque los modelos difieren en los tres.