Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Seed ASR

transcription

seed-asr-bigmodel est le service de reconnaissance vocale à grand modèle Seed-ASR de ByteDance sur BytePlus, exposé via l'API de reconnaissance de fichiers audio comme moteur bigmodel.

Entrée
audio
Sortie
texte
Prix
$0.002/min

Le prix en contexte

Position du prix parmi 11 modèles comparables

Par minute$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Audio

Langues Avec `language` vide, le modèle couvre le mandarin, l'anglais, le cantonais, le shanghaïen, le minnan et les dialectes du Sichuan et du Shaanxi ; 39 clés de langue peuvent être épinglées explicitement (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus une détection automatique en option (enable_auto_lang)
Limites audio
  • Mode fichier audio asynchrone: < 512 Mo, < 5 heures, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (le PCM brut est également accepté), résultats renvoyés sous 3 heures et conservés 7 jours
  • diarisation des locuteurs via enable_speaker_info (API fichier audio uniquement, optimale avec <=10 locuteurs, pas de diarisation sur l'API streaming)
  • segmentation en phrases et en mots avec start_time/end_time via show_utterances
  • identification de la langue via enable_lid
  • mots-clés et contexte jusqu'à 800 tokens et 20 tours
  • facturation à l'appel
Diarisation Oui
Transcription en streaming Oui
Horodatages Oui

Modèle

Modalités audio → texte

Il n'existe pas d'id de modèle officiel « seed-asr-bigmodel »: BytePlus Seed Speech utilise le model_name « bigmodel » avec les ids de ressource volc.bigasr.auc (Seed ASR 1.0) / volc.seedasr.auc (Seed ASR 2.0).

selon docs officielles ByteDance ↗

Utilisez Seed ASR en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="seed-asr-bigmodel",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

À propos de Seed ASR

  • Il transcrit les enregistrements de façon asynchrone via un flux de soumission puis d'interrogation adapté aux charges par lots et hors ligne : l'appelant fournit son propre identifiant de requête, qui sert aussi d'identifiant de tâche, puis interroge jusqu'à ce que le code de statut signale l'achèvement, les résultats étant produits sous trois heures et récupérables pendant sept jours.
  • L'audio peut atteindre cinq heures et 512 Mo, aux formats OPUS, WAV, MP3, OGG, AMR, AAC et M4A, en mono ou en stéréo.
  • Il reconnaît par défaut le mandarin, l'anglais, le cantonais et plusieurs dialectes chinois, avec des dizaines de langues paramétrables du japonais à l'arabe et une détection automatique de la langue optionnelle, laquelle prime sur une langue explicitement nommée lorsque les deux sont définies.
  • Le biais par mots-clés et le contexte conversationnel améliorent la précision, les listes de mots-clés étant plafonnées à 5 000 mots et le contexte de dialogue à 800 tokens ou vingt tours, et Seed ASR 2.0 étend ce contexte à une image jointe, une par requête.
  • La diarisation des locuteurs, la séparation des canaux, les horodatages au niveau de l'énoncé et du mot avec confiance, le filtrage des mots sensibles et les variantes en chinois traditionnel sont autant d'indicateurs facultatifs ; notez que la ponctuation est désactivée par défaut alors que la normalisation inverse du texte est activée, et que la diarisation est une fonctionnalité du mode fichier que les modes streaming n'offrent pas.
  • Synthorai l'enveloppe dans un endpoint de transcription compatible OpenAI.

FAQ

Peut-on essayer l'API Seed ASR gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Seed ASR sur votre charge de travail réelle avant d'ajouter un moyen de paiement.

Quels sont les points forts de Seed ASR ?

Transcription par lots asynchrone en soumission-puis-interrogation ; des dizaines de langues paramétrables avec détection automatique ; le contexte conversationnel s'étend à une image d'accompagnement. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Seed ASR ?

Sur Synthorai, Seed ASR coûte $0.002 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.

Quelles langues Seed ASR prend-il en charge ?

Seed ASR prend en charge Avec `language` vide, le modèle couvre le mandarin, l'anglais, le cantonais, le shanghaïen, le minnan et les dialectes du Sichuan et du Shaanxi ; 39 clés de langue peuvent être épinglées explicitement (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus une détection automatique en option (enable_auto_lang). Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.

Comment obtenir l'accès à Seed ASR ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="seed-asr-bigmodel", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →