Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

GPT-4o Transcribe Diarize

Lanzamiento: 2025-10

transcription

GPT-4o Transcribe Diarize es un modelo de reconocimiento automático de voz que identifica quién habla y cuándo: asocia segmentos de audio con distintos hablantes de una conversación, de modo que las transcripciones capturan quién dijo qué, no solo qué se dijo.

Entrada
audio texto $2.5/M
Salida
texto $2.5/M
Entrada de audio
$6.25/M
Contexto
16K
Corte de conocimiento
2024-06

El precio en contexto

Posición del precio entre 3 modelos comparables

Entrada$2.5/M
$1.25 · GPT-4o Mini Transcribe GPT-4o Transcribe · $2.5
Salida$2.5/M
$2.5 · GPT-4o Transcribe Diarize GPT-4o Transcribe · $10

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Salida máxima (especificación del proveedor) 2000
Corte de conocimiento 2024-06

Audio

Idiomas 57 idiomas listados para el endpoint de transcriptions (una única lista compartida por todos los modelos de transcripción); se aceptan códigos ISO 639-1 / 639-3 para los modelos basados en GPT-4o
Límites de audio
  • mp3/mp4/mpeg/mpga/m4a/wav/webm, hasta 25MB
  • diarización de hablantes integrada con salida diarized_json (etiquetas de hablante + marcas de tiempo de segmento)
  • chunking_strategy obligatorio para audio de más de 30s
  • sin soporte de prompt
Diarización
Transcripción en streaming
Marcas de tiempo

Modelo

Modalidades audio + texto → texto

El único modelo de transcripción de OpenAI con diarización de hablantes integrada.

según documentación oficial de OpenAI ↗

Use GPT-4o Transcribe Diarize en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="gpt-4o-transcribe-diarize",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de GPT-4o Transcribe Diarize

  • Comparte la ventana de contexto de 16K tokens y los 2K tokens de salida máxima de la familia de transcripción GPT-4o y está concebido específicamente para el endpoint de transcripción y no para el chat general.
  • OpenAI afirma con claridad que el modelo solo está disponible a través de la Transcription API y no en la Realtime API.
  • Es el único modelo de OpenAI que devuelve el formato de respuesta JSON con diarización, que lleva etiquetas de hablante junto a las marcas de tiempo de segmento; también están disponibles JSON simple y texto, pero no SRT, VTT ni JSON detallado.
  • Dos comportamientos son específicos de este modelo.
  • Se requiere una estrategia de fragmentación para audio de más de 30 segundos, ya sea automática o una configuración de actividad de voz que usted proporcione, y el prompting no está disponible en absoluto, así que los trucos de contexto que funcionan en sus hermanos no se aplican aquí.
  • Opcionalmente se puede nombrar a los hablantes por adelantado aportando hasta cuatro clips de referencia cortos de unos pocos segundos cada uno.
  • El streaming funciona, aunque la asignación de hablante se consolida por segmento y no palabra por palabra.
  • Las notas de reuniones, la analítica de llamadas y las herramientas de entrevistas son su encaje natural.
  • Synthorai lo expone a través de la misma API de transcripción compatible con OpenAI que sus hermanos.

Preguntas frecuentes

¿Se puede probar gratis la API de GPT-4o Transcribe Diarize?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar GPT-4o Transcribe Diarize con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca GPT-4o Transcribe Diarize?

Diarización de hablantes incorporada; las transcripciones capturan quién dijo qué; encaja con notas de reuniones y analítica de llamadas. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta GPT-4o Transcribe Diarize?

GPT-4o Transcribe Diarize cuesta $2.5 por millón de tokens de entrada y $2.5 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.

¿Qué idiomas admite GPT-4o Transcribe Diarize?

GPT-4o Transcribe Diarize admite 57 idiomas listados para el endpoint de transcriptions (una única lista compartida por todos los modelos de transcripción); se aceptan códigos ISO 639-1 / 639-3 para los modelos basados en GPT-4o. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a GPT-4o Transcribe Diarize?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="gpt-4o-transcribe-diarize" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →