GPT-4o Transcribe es un modelo de voz a texto que usa GPT-4o para transcribir audio, sirviendo como la oferta de transcripción premium de OpenAI.
- Entrada
- audio texto $2.5/M
- Salida
- texto $10/M
- Entrada de audio
- $6/M
- Contexto
- 16K
- Corte de conocimiento
- 2024-06
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) ByteDance Google OpenAI
El precio en contexto
Posición del precio entre 3 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Salida máxima (especificación del proveedor) | 2000 |
|---|---|
| Corte de conocimiento | 2024-06 |
Audio
| Idiomas | 57 idiomas listados para el endpoint de transcriptions (una única lista compartida por todos los modelos de transcripción); se aceptan códigos ISO 639-1 / 639-3 para los modelos basados en GPT-4o |
|---|---|
| Límites de audio |
|
| Diarización | No |
| Transcripción en streaming | Sí |
| Marcas de tiempo | No |
Modelo
| Modalidades | audio + texto → texto |
|---|
Use GPT-4o Transcribe en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="gpt-4o-transcribe",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "gpt-4o-transcribe",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="gpt-4o-transcribe" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "gpt-4o-transcribe",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("gpt-4o-transcribe")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Acerca de GPT-4o Transcribe
- La página oficial le atribuye mejoras en la tasa de error por palabra y un mejor reconocimiento y precisión de idiomas en comparación con los modelos Whisper originales.
- Las solicitudes llevan una ventana de contexto de 16K tokens con hasta 2K tokens de salida, y el modelo se sirve en los endpoints de transcripción y realtime.
- Las subidas siguen los límites compartidos de la API de transcripción: mp3, mp4, mpeg, mpga, m4a, wav o webm, hasta 25MB por archivo, con las grabaciones más largas divididas en el cliente.
- A diferencia de Whisper acepta un prompt, que OpenAI describe como una forma de mejorar la calidad de la transcripción dando al modelo contexto adicional igual que se haría con cualquier otro modelo GPT-4o, lo que resulta útil para nombres, jerga y grafías de productos.
- Se admite la transcripción en streaming, así como las probabilidades logarítmicas para canalizaciones conscientes de la confianza.
- Dos límites condicionan las integraciones: la salida solo está disponible como JSON o texto plano, sin SRT, VTT ni JSON detallado, y en este modelo no se ofrecen granularidades de marcas de tiempo a nivel de palabra o de segmento.
- La cobertura de idiomas sigue la lista publicada de más de setenta idiomas de la API de transcripción, que OpenAI condiciona a un umbral de tasa de error por palabra en lugar de afirmar un soporte universal, y la fecha de corte de conocimiento es junio de 2024.
- OpenAI lo plantea como la opción de mayor precisión cuando el streaming no es la prioridad.
- En Synthorai se conecta sin cambios a la ruta /v1/audio/transcriptions compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de GPT-4o Transcribe?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar GPT-4o Transcribe con su carga de trabajo real antes de añadir un método de pago.
¿En qué destaca GPT-4o Transcribe?
Nivel de transcripción premium; mejor reconocimiento de idiomas que el Whisper original; servido en los endpoints de transcripción y realtime. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta GPT-4o Transcribe?
GPT-4o Transcribe cuesta $2.5 por millón de tokens de entrada y $10 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.
¿Qué idiomas admite GPT-4o Transcribe?
GPT-4o Transcribe admite 57 idiomas listados para el endpoint de transcriptions (una única lista compartida por todos los modelos de transcripción); se aceptan códigos ISO 639-1 / 639-3 para los modelos basados en GPT-4o. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.
¿Cómo obtengo acceso a GPT-4o Transcribe?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="gpt-4o-transcribe" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.