Fun-ASR Flash vs GPT-4o Transcribe Diarize
Cuál usar y cuándo
Ambos son modelos de solo transcripción, pero facturan en unidades diferentes - fun-asr-flash cobra $0.0021 por minuto de audio mientras que gpt-4o-transcribe-diarize cobra $6.25 por millón de tokens de entrada de audio, por lo que ninguna conversión directa entre ellos es honesta. Elige fun-asr-flash para trabajos síncronos sencillos de menos de 5 minutos o 2GB, en más de 30 idiomas, con inyección de contexto para términos de dominio pero sin diarización. Elige gpt-4o-transcribe-diarize cuando necesites diarización de hablantes integrada con etiquetas de hablante en diarized_json y marcas de tiempo de segmento, aceptando su límite de archivo de 25MB, contexto de 16000 tokens y la chunking_strategy requerida para audio de más de 30s.
Precios
| Fun-ASR Flash | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| Por minuto de audio | $0.0021 | - | - |
| Entrada de audio / 1M tokens | - | $6.25 | - |
| Salida de texto / 1M tokens | - | $2.5 | - |
Estos dos modelos se facturan en unidades distintas, así que no se muestra ningún Δ: para convertir una en otra habría que asumir algo que no hemos medido. Arriba, cada tarifa aparece en su propia unidad.
Capacidades
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Diarización de hablantes | no | sí |
| Streaming | sí | sí |
| Marcas de tiempo | - | sí |
Especificaciones
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| Modalidades de entrada | audio | texto audio |
| Modalidades de salida | texto | texto |
| Lanzamiento | 2026-06 | 2025-10 |
| Corte de conocimiento | - | 2024-06 |
| Límites | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| Idiomas | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| Salida máxima | - | 2K |
Las especificaciones se transcriben de la documentación de cada proveedor; si un proveedor no publica un dato, la fila se omite en vez de deducirlo. Fuentes completas: Fun-ASR Flash · GPT-4o Transcribe Diarize
Cambia de uno a otro con una sola línea
Los dos ids aparecen en todas las pestañas de abajo; lo único que cambia es el par de líneas resaltadas. El endpoint, la clave y la estructura de la solicitud son los mismos.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
# model="gpt-4o-transcribe-diarize", # descomenta esta línea, comenta la de arriba
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
// model: "gpt-4o-transcribe-diarize", // descomenta esta línea, comenta la de arriba
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
# -F model="gpt-4o-transcribe-diarize" \ # descomenta esta línea, comenta la de arriba
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
// Model: "gpt-4o-transcribe-diarize", // descomenta esta línea, comenta la de arriba
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
// .model("gpt-4o-transcribe-diarize") // descomenta esta línea, comenta la de arriba
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Preguntas frecuentes
¿Cuál es más barato, Fun-ASR Flash o GPT-4o Transcribe Diarize?
Se facturan en unidades distintas, así que no hay una cifra única que sea honesta: en la tabla de arriba, Fun-ASR Flash y GPT-4o Transcribe Diarize aparecen cada uno en su propia unidad. Compáralos con tu propia carga de trabajo; el veredicto, al principio de esta página, explica qué ganas y qué pierdes con cada uno.
¿Puedo hacer pruebas A/B de Fun-ASR Flash frente a GPT-4o Transcribe Diarize sin dos integraciones?
Sí. Los dos se sirven desde el mismo endpoint compatible con OpenAI y con una sola clave API. Para cambiar de uno a otro basta con tocar una línea, el nombre del modelo, así que puedes mandar una parte del tráfico a cada uno y comparar directamente las facturas.
¿Admiten Fun-ASR Flash y GPT-4o Transcribe Diarize la diarización de hablantes?
La tabla de capacidades de arriba lo indica para cada modelo, según la documentación de su proveedor. La diarización, el streaming y las marcas de tiempo aparecen por separado porque los modelos difieren en las tres cosas.