Paraformer-Realtime-v2 è il modello di riconoscimento vocale in tempo reale di generazione precedente di Alibaba Cloud, che riceve audio in streaming e restituisce trascrizioni su una connessione bidirezionale.
- Input
- audio
- Output
- testo
- Prezzo
- $0.002/min
Il prezzo nel contesto
Posizione del prezzo tra 11 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Audio
| Lingue | 7 lingue: cinese (mandarino più cantonese, wu, hokkien e 15 accenti regionali), inglese, giapponese, coreano, tedesco, francese, russo |
|---|---|
| Limiti audio |
|
| Trascrizione in streaming | Sì |
| Timestamp | Sì |
Modello
| Modalità | audio → testo |
|---|
Generazione Paraformer orientata allo streaming con personalizzazione tramite hotword e copertura multilingue.
Usa Paraformer Realtime v2 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="paraformer-realtime-v2",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "paraformer-realtime-v2",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="paraformer-realtime-v2" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "paraformer-realtime-v2",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("paraformer-realtime-v2")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Informazioni su Paraformer Realtime v2
- Riconosce il cinese mandarino insieme a un insieme insolitamente ampio di dialetti regionali (cantonese, wu, hokkien, sichuanese e altri) oltre a inglese, giapponese, coreano, tedesco, francese e russo, e supporta un parametro language_hints per guidare il rilevamento.
- Si tratta di un'aggiunta esclusiva della v2, come lo è l'accettazione di frequenze di campionamento arbitrarie là dove la versione precedente richiedeva 16 kHz.
- La documentazione di Alibaba raccomanda ora Fun-ASR o Qwen-ASR per i nuovi progetti, posizionando questo modello per le integrazioni esistenti.
- Ciò che lo mantiene utilizzabile è una superficie di parametri matura: tabelle di hotword per il vocabolario di dominio, normalizzazione inversa del testo attiva per impostazione predefinita, predizione della punteggiatura attiva per impostazione predefinita con punteggiatura semantica opzionale, un silenzio massimo di frase configurabile che chiude un enunciato e un filtro opzionale delle disfluenze che rimuove le parole riempitive (un controllo che il modello Fun-ASR realtime non documenta).
- I timestamp a livello di frase e di parola sono restituiti in millisecondi, e la connessione accetta PCM, WAV, MP3, Opus, Speex, AAC e AMR.
- La diarizzazione dei parlanti non è offerta sul percorso realtime e non c'è riconoscimento delle emozioni.
- Va trattato come un endpoint stabile per le pipeline già messe a punto su di esso, non come punto di partenza per il lavoro nuovo.
- Synthorai continua a servirlo tramite l'endpoint compatibile OpenAI.
FAQ
L'API di Paraformer Realtime v2 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Paraformer Realtime v2 sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle Paraformer Realtime v2?
Audio in streaming in ingresso, trascrizioni in uscita; copertura insolitamente ampia dei dialetti regionali cinesi; il parametro language_hints guida il rilevamento. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Paraformer Realtime v2?
Su Synthorai, Paraformer Realtime v2 costa $0.002 per minuto di audio trascritto: pagamento a consumo, senza ricarico della piattaforma, senza abbonamento.
Quali lingue supporta Paraformer Realtime v2?
Paraformer Realtime v2 supporta 7 lingue: cinese (mandarino più cantonese, wu, hokkien e 15 accenti regionali), inglese, giapponese, coreano, tedesco, francese, russo. Su Synthorai lo chiami via POST /v1/audio/transcriptions, lo stesso formato dell'API di trascrizione di OpenAI.
Come ottengo l'accesso a Paraformer Realtime v2?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="paraformer-realtime-v2" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.