Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Paraformer Realtime v2

transcription

Paraformer-Realtime-v2 es el modelo de reconocimiento de voz en tiempo real de generación anterior de Alibaba Cloud, que transmite el audio de entrada y las transcripciones de salida por una conexión bidireccional.

Entrada
audio
Salida
texto
Precio
$0.002/min

El precio en contexto

Posición del precio entre 11 modelos comparables

Por minuto$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Audio

Idiomas 7 idiomas: chino (mandarín, además de cantonés, wu, hokkien y 15 acentos regionales), inglés, japonés, coreano, alemán, francés y ruso
Límites de audio
  • Streaming WebSocket en tiempo real, duración ilimitada
  • hotwords + language_hints
  • marcas de tiempo por palabra y por frase
  • dialectos del chino/EN/JA/KO/DE/FR/RU
Transcripción en streaming
Marcas de tiempo

Modelo

Modalidades audio → texto

Generación de Paraformer orientada al streaming, con personalización de hotwords y cobertura multilingüe.

según documentación oficial de Alibaba ↗

Use Paraformer Realtime v2 en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="paraformer-realtime-v2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Acerca de Paraformer Realtime v2

  • Reconoce el mandarín chino junto con un conjunto inusualmente amplio de dialectos regionales (cantonés, wu, hokkien, sichuanés y más) además de inglés, japonés, coreano, alemán, francés y ruso, y admite un parámetro language_hints para guiar la detección.
  • Esa es una incorporación exclusiva de la v2, igual que la aceptación de frecuencias de muestreo arbitrarias, donde la versión anterior exigía 16 kHz.
  • La documentación de Alibaba ahora recomienda Fun-ASR o Qwen-ASR para nuevos proyectos, posicionando este modelo para integraciones existentes.
  • Lo que lo mantiene utilizable es una superficie de parámetros madura: tablas de hotwords para vocabulario de dominio, normalización inversa de texto activada por defecto, predicción de puntuación activada por defecto con puntuación semántica opcional, un silencio máximo de frase configurable que cierra una intervención, y un filtro de disfluencias opcional que elimina las muletillas (un control que el modelo Fun-ASR en tiempo real no documenta).
  • Las marcas de tiempo a nivel de frase y de palabra se devuelven en milisegundos, y la conexión acepta PCM, WAV, MP3, Opus, Speex, AAC y AMR.
  • La diarización de hablantes no se ofrece en la vía en tiempo real, y no hay reconocimiento de emociones.
  • Trátelo como un endpoint estable para canalizaciones ya ajustadas a él, y no como el punto de partida de un trabajo nuevo.
  • Synthorai lo sigue sirviendo a través del endpoint compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Paraformer Realtime v2?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Paraformer Realtime v2 con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca Paraformer Realtime v2?

Transmite el audio de entrada y las transcripciones de salida; cobertura inusualmente amplia de dialectos regionales chinos; el parámetro language_hints guía la detección. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Paraformer Realtime v2?

Paraformer Realtime v2 cuesta $0.002 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.

¿Qué idiomas admite Paraformer Realtime v2?

Paraformer Realtime v2 admite 7 idiomas: chino (mandarín, además de cantonés, wu, hokkien y 15 acentos regionales), inglés, japonés, coreano, alemán, francés y ruso. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.

¿Cómo obtengo acceso a Paraformer Realtime v2?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="paraformer-realtime-v2" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →