Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Paraformer Realtime v2

transcription

Paraformer-Realtime-v2 est le modèle de reconnaissance vocale en temps réel de génération précédente d'Alibaba Cloud : l'audio entre en streaming et les transcriptions ressortent sur une connexion bidirectionnelle.

Entrée
audio
Sortie
texte
Prix
$0.002/min

Le prix en contexte

Position du prix parmi 11 modèles comparables

Par minute$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Audio

Langues 7 langues: chinois (mandarin, plus cantonais, wu, hokkien et 15 accents régionaux), anglais, japonais, coréen, allemand, français, russe
Limites audio
  • Streaming WebSocket en temps réel, durée illimitée
  • mots-clés (hotwords) et language_hints
  • horodatages de mot et de phrase
  • dialectes chinois, EN/JA/KO/DE/FR/RU
Transcription en streaming Oui
Horodatages Oui

Modèle

Modalités audio → texte

Génération Paraformer axée streaming, avec personnalisation par mots-clés et couverture multilingue.

selon docs officielles Alibaba ↗

Utilisez Paraformer Realtime v2 en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="paraformer-realtime-v2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

À propos de Paraformer Realtime v2

  • Il reconnaît le mandarin chinois ainsi qu'un ensemble exceptionnellement large de dialectes régionaux (cantonais, wu, hokkien, sichuanais, et d'autres), plus l'anglais, le japonais, le coréen, l'allemand, le français et le russe, et prend en charge un paramètre language_hints pour guider la détection.
  • C'est un ajout propre à la v2, tout comme l'acceptation de fréquences d'échantillonnage arbitraires là où la version précédente exigeait 16 kHz.
  • La documentation d'Alibaba recommande désormais Fun-ASR ou Qwen-ASR pour les nouveaux projets et réserve ce modèle aux intégrations existantes.
  • Ce qui le garde utilisable, c'est une surface de paramètres mature : tables de mots-clés (hotwords) pour le vocabulaire métier, normalisation inverse du texte activée par défaut, prédiction de la ponctuation activée par défaut avec ponctuation sémantique optionnelle, silence maximal de phrase configurable qui clôt un énoncé, et filtre optionnel des disfluences qui retire les mots de remplissage (un contrôle que le modèle Fun-ASR temps réel ne documente pas).
  • Les horodatages au niveau de la phrase et du mot sont renvoyés en millisecondes, et la connexion accepte les formats PCM, WAV, MP3, Opus, Speex, AAC et AMR.
  • La diarisation des locuteurs n'est pas proposée sur le chemin temps réel, et il n'y a pas de reconnaissance des émotions.
  • Considérez-le comme un endpoint stable pour les pipelines déjà réglés sur lui plutôt que comme le point de départ d'un nouveau projet.
  • Synthorai continue de le servir via l'endpoint compatible OpenAI.

FAQ

Peut-on essayer l'API Paraformer Realtime v2 gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Paraformer Realtime v2 sur votre charge de travail réelle avant d'ajouter un moyen de paiement.

Quels sont les points forts de Paraformer Realtime v2 ?

Diffuse l'audio en entrée, les transcriptions en sortie ; couverture exceptionnellement large des dialectes régionaux chinois ; le paramètre language_hints guide la détection. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Paraformer Realtime v2 ?

Sur Synthorai, Paraformer Realtime v2 coûte $0.002 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.

Quelles langues Paraformer Realtime v2 prend-il en charge ?

Paraformer Realtime v2 prend en charge 7 langues: chinois (mandarin, plus cantonais, wu, hokkien et 15 accents régionaux), anglais, japonais, coréen, allemand, français, russe. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.

Comment obtenir l'accès à Paraformer Realtime v2 ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="paraformer-realtime-v2", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →