GPT-4o Transcribe Diarize es un modelo de reconocimiento automático de voz que identifica quién habla y cuándo: asocia segmentos de audio con distintos hablantes de una conversación, de modo que las transcripciones capturan quién dijo qué, no solo qué se dijo.
- Entrada
- audio texto $2.5/M
- Salida
- texto $2.5/M
- Entrada de audio
- $6.25/M
- Contexto
- 16K
- Corte de conocimiento
- 2024-06
El precio en contexto
Posición del precio entre 3 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Salida máxima (especificación del proveedor) | 2000 |
|---|---|
| Corte de conocimiento | 2024-06 |
Audio
| Idiomas | 57 idiomas listados para el endpoint de transcriptions (una única lista compartida por todos los modelos de transcripción); se aceptan códigos ISO 639-1 / 639-3 para los modelos basados en GPT-4o |
|---|---|
| Límites de audio |
|
| Diarización | Sí |
| Transcripción en streaming | Sí |
| Marcas de tiempo | Sí |
Modelo
| Modalidades | audio + texto → texto |
|---|
El único modelo de transcripción de OpenAI con diarización de hablantes integrada.
Use GPT-4o Transcribe Diarize en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe-diarize",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe-diarize",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe-diarize" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe-diarize",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe-diarize")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Acerca de GPT-4o Transcribe Diarize
- Comparte la ventana de contexto de 16K tokens y los 2K tokens de salida máxima de la familia de transcripción GPT-4o y está concebido específicamente para el endpoint de transcripción y no para el chat general.
- OpenAI afirma con claridad que el modelo solo está disponible a través de la Transcription API y no en la Realtime API.
- Es el único modelo de OpenAI que devuelve el formato de respuesta JSON con diarización, que lleva etiquetas de hablante junto a las marcas de tiempo de segmento; también están disponibles JSON simple y texto, pero no SRT, VTT ni JSON detallado.
- Dos comportamientos son específicos de este modelo.
- Se requiere una estrategia de fragmentación para audio de más de 30 segundos, ya sea automática o una configuración de actividad de voz que usted proporcione, y el prompting no está disponible en absoluto, así que los trucos de contexto que funcionan en sus hermanos no se aplican aquí.
- Opcionalmente se puede nombrar a los hablantes por adelantado aportando hasta cuatro clips de referencia cortos de unos pocos segundos cada uno.
- El streaming funciona, aunque la asignación de hablante se consolida por segmento y no palabra por palabra.
- Las notas de reuniones, la analítica de llamadas y las herramientas de entrevistas son su encaje natural.
- Synthorai lo expone a través de la misma API de transcripción compatible con OpenAI que sus hermanos.
Preguntas frecuentes
¿Se puede probar gratis la API de GPT-4o Transcribe Diarize?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar GPT-4o Transcribe Diarize con su carga de trabajo real antes de añadir un método de pago.
¿En qué destaca GPT-4o Transcribe Diarize?
Diarización de hablantes incorporada; las transcripciones capturan quién dijo qué; encaja con notas de reuniones y analítica de llamadas. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta GPT-4o Transcribe Diarize?
GPT-4o Transcribe Diarize cuesta $2.5 por millón de tokens de entrada y $2.5 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.
¿Qué idiomas admite GPT-4o Transcribe Diarize?
GPT-4o Transcribe Diarize admite 57 idiomas listados para el endpoint de transcriptions (una única lista compartida por todos los modelos de transcripción); se aceptan códigos ISO 639-1 / 639-3 para los modelos basados en GPT-4o. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.
¿Cómo obtengo acceso a GPT-4o Transcribe Diarize?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="gpt-4o-transcribe-diarize" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.