Fun-ASR Flash vs GPT-4o Transcribe Diarize
Cuál usar y cuándo — veredicto seleccionado, no una tabla de benchmarks
Ambos son modelos de solo transcripción, pero facturan en unidades diferentes — fun-asr-flash cobra $0.0021 por minuto de audio mientras que gpt-4o-transcribe-diarize cobra $6.25 por millón de tokens de entrada de audio, por lo que ninguna conversión directa entre ellos es honesta. Elige fun-asr-flash para trabajos síncronos sencillos de menos de 5 minutos o 2GB, en más de 30 idiomas, con inyección de contexto para términos de dominio pero sin diarización. Elige gpt-4o-transcribe-diarize cuando necesites diarización de hablantes integrada con etiquetas de hablante en diarized_json y marcas de tiempo de segmento, aceptando su límite de archivo de 25MB, contexto de 16000 tokens y la chunking_strategy requerida para audio de más de 30s.
Precios
| Fun-ASR Flash | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| Por minuto de audio | $0.0021 | — | — |
| Entrada de audio / 1M tokens | — | $6.25 | — |
| Salida de texto / 1M tokens | — | $2.5 | — |
Estos dos modelos facturan en unidades diferentes, por lo que no se muestra ningún Δ — convertirlas requeriría una suposición que no hemos medido. Cada ficha aparece arriba en su propia unidad.
Capacidades
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Diarización de hablantes | no | sí |
| Streaming | sí | sí |
| Marcas de tiempo | — | sí |
Especificaciones
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Modalidades de entrada | audio | texto audio |
| Modalidades de salida | texto | texto |
| Lanzamiento | 2026-06 | 2025-10 |
| Límite de conocimiento | — | 2024-06 |
| Límites | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| Idiomas | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| Salida máxima | — | 2K |
Las especificaciones se transcriben de la documentación de cada proveedor; si un proveedor no publica una fila, se omite en lugar de inferirse. Fuentes completas: Fun-ASR Flash · GPT-4o Transcribe Diarize
Cambia entre ellos con una línea
Ambos IDs están en cada pestaña a continuación — el par de líneas resaltadas es la única edición. Mismo endpoint, misma clave, misma estructura de solicitud.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
# model="gpt-4o-transcribe-diarize", # descomenta esta línea, comenta la de arriba
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
// model: "gpt-4o-transcribe-diarize", // descomenta esta línea, comenta la de arriba
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
# -F model="gpt-4o-transcribe-diarize" \ # descomenta esta línea, comenta la de arriba
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
// Model: "gpt-4o-transcribe-diarize", // descomenta esta línea, comenta la de arriba
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
// .model("gpt-4o-transcribe-diarize") // descomenta esta línea, comenta la de arriba
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Preguntas frecuentes
¿Cuál es más barato, Fun-ASR Flash o GPT-4o Transcribe Diarize?
Facturan en unidades diferentes, por lo que no hay un único número representativo: Fun-ASR Flash y GPT-4o Transcribe Diarize aparecen cada uno en su propia unidad en la tabla anterior. Compárelos en su propia carga de trabajo — el compromiso práctico se describe en el veredicto en la parte superior de esta página.
¿Puedo hacer pruebas A/B de Fun-ASR Flash frente a GPT-4o Transcribe Diarize sin dos integraciones?
Sí. Ambos se sirven a través del mismo endpoint compatible con OpenAI con una clave API — el cambio es una modificación de una línea en la cadena del modelo, por lo que puede enrutar una fracción del tráfico a cada uno y comparar las facturas directamente.
¿Soportan Fun-ASR Flash y GPT-4o Transcribe Diarize la diarización de hablantes?
La tabla de capacidades anterior responde a esto por modelo, directamente desde la documentación de cada proveedor — la diarización, el streaming y las marcas de tiempo se listan por separado porque los modelos difieren en los tres.