Paraformer-Realtime-v2 est le modèle de reconnaissance vocale en temps réel de génération précédente d'Alibaba Cloud : l'audio entre en streaming et les transcriptions ressortent sur une connexion bidirectionnelle.
- Entrée
- audio
- Sortie
- texte
- Prix
- $0.002/min
Le prix en contexte
Position du prix parmi 11 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Audio
| Langues | 7 langues: chinois (mandarin, plus cantonais, wu, hokkien et 15 accents régionaux), anglais, japonais, coréen, allemand, français, russe |
|---|---|
| Limites audio |
|
| Transcription en streaming | Oui |
| Horodatages | Oui |
Modèle
| Modalités | audio → texte |
|---|
Génération Paraformer axée streaming, avec personnalisation par mots-clés et couverture multilingue.
Utilisez Paraformer Realtime v2 en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="paraformer-realtime-v2",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "paraformer-realtime-v2",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="paraformer-realtime-v2" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "paraformer-realtime-v2",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("paraformer-realtime-v2")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());À propos de Paraformer Realtime v2
- Il reconnaît le mandarin chinois ainsi qu'un ensemble exceptionnellement large de dialectes régionaux (cantonais, wu, hokkien, sichuanais, et d'autres), plus l'anglais, le japonais, le coréen, l'allemand, le français et le russe, et prend en charge un paramètre language_hints pour guider la détection.
- C'est un ajout propre à la v2, tout comme l'acceptation de fréquences d'échantillonnage arbitraires là où la version précédente exigeait 16 kHz.
- La documentation d'Alibaba recommande désormais Fun-ASR ou Qwen-ASR pour les nouveaux projets et réserve ce modèle aux intégrations existantes.
- Ce qui le garde utilisable, c'est une surface de paramètres mature : tables de mots-clés (hotwords) pour le vocabulaire métier, normalisation inverse du texte activée par défaut, prédiction de la ponctuation activée par défaut avec ponctuation sémantique optionnelle, silence maximal de phrase configurable qui clôt un énoncé, et filtre optionnel des disfluences qui retire les mots de remplissage (un contrôle que le modèle Fun-ASR temps réel ne documente pas).
- Les horodatages au niveau de la phrase et du mot sont renvoyés en millisecondes, et la connexion accepte les formats PCM, WAV, MP3, Opus, Speex, AAC et AMR.
- La diarisation des locuteurs n'est pas proposée sur le chemin temps réel, et il n'y a pas de reconnaissance des émotions.
- Considérez-le comme un endpoint stable pour les pipelines déjà réglés sur lui plutôt que comme le point de départ d'un nouveau projet.
- Synthorai continue de le servir via l'endpoint compatible OpenAI.
FAQ
Peut-on essayer l'API Paraformer Realtime v2 gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Paraformer Realtime v2 sur votre charge de travail réelle avant d'ajouter un moyen de paiement.
Quels sont les points forts de Paraformer Realtime v2 ?
Diffuse l'audio en entrée, les transcriptions en sortie ; couverture exceptionnellement large des dialectes régionaux chinois ; le paramètre language_hints guide la détection. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Paraformer Realtime v2 ?
Sur Synthorai, Paraformer Realtime v2 coûte $0.002 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.
Quelles langues Paraformer Realtime v2 prend-il en charge ?
Paraformer Realtime v2 prend en charge 7 langues: chinois (mandarin, plus cantonais, wu, hokkien et 15 accents régionaux), anglais, japonais, coréen, allemand, français, russe. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.
Comment obtenir l'accès à Paraformer Realtime v2 ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="paraformer-realtime-v2", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.