Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

GPT-4o Transcribe

Lanzamiento: 2025-03-20

transcription

GPT-4o Transcribe es un modelo de voz a texto que usa GPT-4o para transcribir audio, sirviendo como la oferta de transcripción premium de OpenAI.

Entrada
audio texto $2.5/M
Salida
texto $10/M
Entrada de audio
$6/M
Contexto
16K
Corte de conocimiento
2024-06

Benchmarks

Sobre la mediasolo 1 comparables
GPT-4o Transcribe otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
WenetSpeech test-net (CER)
15.3%

Publicado por los proveedores: Alibaba (Qwen) ByteDance Google OpenAI

El precio en contexto

Posición del precio entre 3 modelos comparables

Entrada$2.5/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
Salida$10/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Salida máxima (especificación del proveedor) 2000
Corte de conocimiento 2024-06

Audio

Idiomas 57 idiomas listados para el endpoint de transcriptions (una única lista compartida por todos los modelos de transcripción); se aceptan códigos ISO 639-1 / 639-3 para los modelos basados en GPT-4o
Límites de audio
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, hasta 25MB
  • transcripción en streaming admitida (incl. sesiones de transcripción de Realtime)
  • salida solo en json/text
  • sin marcas de tiempo por palabra ni diarización
Diarización No
Transcripción en streaming
Marcas de tiempo No

Modelo

Modalidades audio + texto → texto

según documentación oficial de OpenAI ↗

Use GPT-4o Transcribe en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de GPT-4o Transcribe

  • La página oficial le atribuye mejoras en la tasa de error por palabra y un mejor reconocimiento y precisión de idiomas en comparación con los modelos Whisper originales.
  • Las solicitudes llevan una ventana de contexto de 16K tokens con hasta 2K tokens de salida, y el modelo se sirve en los endpoints de transcripción y realtime.
  • Las subidas siguen los límites compartidos de la API de transcripción: mp3, mp4, mpeg, mpga, m4a, wav o webm, hasta 25MB por archivo, con las grabaciones más largas divididas en el cliente.
  • A diferencia de Whisper acepta un prompt, que OpenAI describe como una forma de mejorar la calidad de la transcripción dando al modelo contexto adicional igual que se haría con cualquier otro modelo GPT-4o, lo que resulta útil para nombres, jerga y grafías de productos.
  • Se admite la transcripción en streaming, así como las probabilidades logarítmicas para canalizaciones conscientes de la confianza.
  • Dos límites condicionan las integraciones: la salida solo está disponible como JSON o texto plano, sin SRT, VTT ni JSON detallado, y en este modelo no se ofrecen granularidades de marcas de tiempo a nivel de palabra o de segmento.
  • La cobertura de idiomas sigue la lista publicada de más de setenta idiomas de la API de transcripción, que OpenAI condiciona a un umbral de tasa de error por palabra en lugar de afirmar un soporte universal, y la fecha de corte de conocimiento es junio de 2024.
  • OpenAI lo plantea como la opción de mayor precisión cuando el streaming no es la prioridad.
  • En Synthorai se conecta sin cambios a la ruta /v1/audio/transcriptions compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de GPT-4o Transcribe?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar GPT-4o Transcribe con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca GPT-4o Transcribe?

Nivel de transcripción premium; mejor reconocimiento de idiomas que el Whisper original; servido en los endpoints de transcripción y realtime. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta GPT-4o Transcribe?

GPT-4o Transcribe cuesta $2.5 por millón de tokens de entrada y $10 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.

¿Qué idiomas admite GPT-4o Transcribe?

GPT-4o Transcribe admite 57 idiomas listados para el endpoint de transcriptions (una única lista compartida por todos los modelos de transcripción); se aceptan códigos ISO 639-1 / 639-3 para los modelos basados en GPT-4o. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a GPT-4o Transcribe?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="gpt-4o-transcribe" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →