Whisper v1 es el modelo de reconocimiento de voz de propósito general de OpenAI, entrenado sobre un gran conjunto de datos de audio diverso.
- Entrada
- audio
- Salida
- texto
- Precio
- $0.006/min
El precio en contexto
Posición del precio entre 11 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Audio
| Idiomas | Entrenado en 98 idiomas; 57 figuran como admitidos, los idiomas que cumplieron el umbral de OpenAI de una tasa de error por palabra inferior al 50% en los endpoints de transcriptions y translations |
|---|---|
| Límites de audio |
|
| Diarización | No |
| Transcripción en streaming | No |
| Marcas de tiempo | Sí |
Modelo
| Modalidades | audio → texto |
|---|
Whisper large-v2 de código abierto servido por API; prompt limitado a 224 tokens.
Use Whisper v1 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="whisper-1",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "whisper-1",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="whisper-1" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "whisper-1",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("whisper-1")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Acerca de Whisper v1
- Es un sistema multitarea que realiza transcripción, reconocimiento de voz multilingüe, traducción de voz e identificación de idioma, y se factura simplemente por minuto de audio procesado.
- Pese a los modelos de transcripción más recientes basados en GPT-4o, para varios trabajos sigue siendo la única opción de la pila de audio de OpenAI.
- Es el único modelo servido en el endpoint de traducciones, que vierte el habla al inglés, y el único que admite granularidades de marcas de tiempo a nivel de segmento o de palabra.
- También tiene el soporte de formatos de respuesta más amplio de la familia, que abarca JSON, texto plano, JSON detallado, SRT y VTT, que es lo que necesitan las canalizaciones de subtítulos.
- Los compromisos son igual de concretos: no se admite la transcripción en streaming, los prompts dirigen el estilo más que el contenido (el modelo tiende a reflejar la puntuación y el uso de mayúsculas del prompt) y solo se consideran los últimos 224 tokens de un prompt.
- Se aplican los límites compartidos de transcripción, con mp3, mp4, mpeg, mpga, m4a, wav y webm aceptados hasta 25MB.
- La documentación de OpenAI lo plantea ahora en términos históricos, aunque la página del modelo no lleva aviso de obsolescencia.
- Synthorai acepta trabajos de Whisper en su ruta /v1/audio/transcriptions compatible con OpenAI, así que los clientes existentes funcionan tal cual.
Preguntas frecuentes
¿Se puede probar gratis la API de Whisper v1?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Whisper v1 con su carga de trabajo real antes de añadir un método de pago.
¿En qué destaca Whisper v1?
Multitarea: transcripción, traducción, identificación de idioma; se factura simplemente por minuto de audio; compatible en los endpoints de transcripción y traducción. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Whisper v1?
Whisper v1 cuesta $0.006 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.
¿Qué idiomas admite Whisper v1?
Whisper v1 admite Entrenado en 98 idiomas; 57 figuran como admitidos, los idiomas que cumplieron el umbral de OpenAI de una tasa de error por palabra inferior al 50% en los endpoints de transcriptions y translations. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.
¿Cómo obtengo acceso a Whisper v1?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="whisper-1" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.