seed-asr-bigmodel es el servicio de reconocimiento de voz de gran modelo Seed-ASR de ByteDance en BytePlus, expuesto a través de la API de reconocimiento de archivos de audio como el motor bigmodel.
- Entrada
- audio
- Salida
- texto
- Precio
- $0.002/min
El precio en contexto
Posición del precio entre 11 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Audio
| Idiomas | Con `language` vacío, el modelo cubre mandarín, inglés, cantonés, shanghainés, minnan y los dialectos de Sichuan y Shaanxi; se pueden fijar explícitamente 39 claves de idioma (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), además de la detección automática opcional (enable_auto_lang) |
|---|---|
| Límites de audio |
|
| Diarización | Sí |
| Transcripción en streaming | Sí |
| Marcas de tiempo | Sí |
Modelo
| Modalidades | audio → texto |
|---|
No existe un id de modelo oficial 'seed-asr-bigmodel': BytePlus Seed Speech usa el model_name 'bigmodel' con los ids de recurso volc.bigasr.auc (Seed ASR 1.0) / volc.seedasr.auc (Seed ASR 2.0).
Use Seed ASR en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="seed-asr-bigmodel",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "seed-asr-bigmodel",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="seed-asr-bigmodel" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "seed-asr-bigmodel",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("seed-asr-bigmodel")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Acerca de Seed ASR
- Transcribe grabaciones de forma asíncrona mediante un flujo de envío y consulta adecuado para cargas de trabajo por lotes y offline: quien llama aporta su propio identificador de solicitud, que hace también de identificador de tarea, y luego consulta hasta que el código de estado informa de la finalización, con resultados producidos en un plazo de tres horas y recuperables durante siete días.
- El audio puede llegar a cinco horas y 512 MB en OPUS, WAV, MP3, OGG, AMR, AAC y M4A, en mono o estéreo.
- Reconoce por defecto mandarín, inglés, cantonés y varios dialectos chinos, con decenas de idiomas configurables desde el japonés hasta el árabe y detección automática de idioma opcional, que tiene prioridad sobre un idioma nombrado explícitamente cuando se fijan ambos.
- El sesgo por hotwords y el contexto conversacional mejoran la precisión, con listas de hotwords limitadas a 5000 palabras y el contexto de diálogo a 800 tokens o veinte rondas, y Seed ASR 2.0 extiende ese contexto a una imagen adjunta, una por solicitud.
- La diarización de hablantes, la separación de canales, las marcas de tiempo a nivel de enunciado y de palabra con confianza, el filtrado de palabras sensibles y las variantes de chino tradicional son todos indicadores opcionales; conviene señalar que la puntuación está desactivada por defecto mientras que la normalización inversa de texto está activada, y que la diarización es una función del modo de archivo que los modos en streaming no ofrecen.
- Synthorai lo envuelve en un endpoint de transcripción compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Seed ASR?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Seed ASR con su carga de trabajo real antes de añadir un método de pago.
¿En qué destaca Seed ASR?
Transcripción por lotes asíncrona de envío y consulta; decenas de idiomas configurables con detección automática; el contexto conversacional se extiende a una imagen adjunta. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Seed ASR?
Seed ASR cuesta $0.002 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.
¿Qué idiomas admite Seed ASR?
Seed ASR admite Con `language` vacío, el modelo cubre mandarín, inglés, cantonés, shanghainés, minnan y los dialectos de Sichuan y Shaanxi; se pueden fijar explícitamente 39 claves de idioma (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), además de la detección automática opcional (enable_auto_lang). En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.
¿Cómo obtengo acceso a Seed ASR?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="seed-asr-bigmodel" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.