Fun-ASR Flash es la variante offline rápida de la familia de reconocimiento de voz Fun-ASR de Alibaba, diseñada para transcribir grabaciones cortas de hasta cinco minutos.
- Entrada
- audio
- Salida
- texto
- Precio
- $0.0021/min
El precio en contexto
Posición del precio entre 11 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Audio
| Idiomas | Multilingüe con dialectos, la misma lista de 30 idiomas que las versiones principales de Fun-ASR: chino (mandarín, cantonés, wu, hokkien, hakka, gan, xiang y jin, además de acentos regionales), inglés, japonés, coreano, vietnamita, tailandés, indonesio, malayo, filipino, hindi, árabe, francés, alemán, español, portugués, ruso, italiano, neerlandés, sueco, danés, finés, noruego, griego, polaco, checo, húngaro, rumano, búlgaro, croata y eslovaco |
|---|---|
| Límites de audio |
|
| Diarización | No |
| Transcripción en streaming | Sí |
Modelo
| Modalidades | audio → texto |
|---|
Nivel síncrono rápido de la familia Fun-ASR.
Use Fun-ASR Flash en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Acerca de Fun-ASR Flash
- Su rasgo distintivo, según la documentación oficial, es la inyección de contexto basada en prompt: en lugar de mantener listas de hotwords, se proporciona la terminología de dominio directamente en un prompt para guiar la precisión del reconocimiento.
- Es el único modelo de la familia documentado para esto, y acepta hasta cinco rondas de contexto de unos cientos de caracteres cada una, lo que encaja con terminología que cambia de una llamada a otra en lugar de de un proyecto a otro.
- Conserva la amplia cobertura lingüística de la familia, que abarca chino con dialectos regionales, inglés, japonés, coreano y muchos idiomas europeos y del sudeste asiático.
- El resto del intercambio frente al modelo base es igual de concreto: las llamadas son síncronas con resultados en streaming en lugar de enviar y consultar, así que un clip corto se devuelve en línea en vez de mediante un id de tarea, pero el techo de cinco minutos sustituye al de doce horas (el límite de 2 GB por archivo se mantiene, así que aquí lo que restringe es la duración), y la diarización de hablantes no está disponible.
- Leídas en conjunto, la elección dentro de la familia queda clara: Fun-ASR para archivos largos con varios hablantes y vocabulario estable, y Fun-ASR Flash para clips cortos que necesitan una respuesta rápida y terminología por solicitud.
- En Synthorai está disponible a través de la superficie de API estándar compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Fun-ASR Flash?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Fun-ASR Flash con su carga de trabajo real antes de añadir un método de pago.
¿En qué destaca Fun-ASR Flash?
Inyección de contexto por prompt en lugar de hotwords; transcribe grabaciones cortas de hasta cinco minutos; amplia cobertura incluidos los dialectos regionales chinos. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Fun-ASR Flash?
Fun-ASR Flash cuesta $0.0021 por minuto de audio transcrito en Synthorai: pago por uso, sin margen de plataforma, sin suscripción.
¿Qué idiomas admite Fun-ASR Flash?
Fun-ASR Flash admite Multilingüe con dialectos, la misma lista de 30 idiomas que las versiones principales de Fun-ASR: chino (mandarín, cantonés, wu, hokkien, hakka, gan, xiang y jin, además de acentos regionales), inglés, japonés, coreano, vietnamita, tailandés, indonesio, malayo, filipino, hindi, árabe, francés, alemán, español, portugués, ruso, italiano, neerlandés, sueco, danés, finés, noruego, griego, polaco, checo, húngaro, rumano, búlgaro, croata y eslovaco. En Synthorai se invoca mediante POST /v1/audio/transcriptions, el formato de la API de transcripción de OpenAI.
¿Cómo obtengo acceso a Fun-ASR Flash?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="fun-asr-flash" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.