seed-asr-bigmodel est le service de reconnaissance vocale à grand modèle Seed-ASR de ByteDance sur BytePlus, exposé via l'API de reconnaissance de fichiers audio comme moteur bigmodel.
- Entrée
- audio
- Sortie
- texte
- Prix
- $0.002/min
Le prix en contexte
Position du prix parmi 11 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Audio
| Langues | Avec `language` vide, le modèle couvre le mandarin, l'anglais, le cantonais, le shanghaïen, le minnan et les dialectes du Sichuan et du Shaanxi ; 39 clés de langue peuvent être épinglées explicitement (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus une détection automatique en option (enable_auto_lang) |
|---|---|
| Limites audio |
|
| Diarisation | Oui |
| Transcription en streaming | Oui |
| Horodatages | Oui |
Modèle
| Modalités | audio → texte |
|---|
Il n'existe pas d'id de modèle officiel « seed-asr-bigmodel »: BytePlus Seed Speech utilise le model_name « bigmodel » avec les ids de ressource volc.bigasr.auc (Seed ASR 1.0) / volc.seedasr.auc (Seed ASR 2.0).
Utilisez Seed ASR en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="seed-asr-bigmodel",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "seed-asr-bigmodel",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="seed-asr-bigmodel" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "seed-asr-bigmodel",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("seed-asr-bigmodel")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());À propos de Seed ASR
- Il transcrit les enregistrements de façon asynchrone via un flux de soumission puis d'interrogation adapté aux charges par lots et hors ligne : l'appelant fournit son propre identifiant de requête, qui sert aussi d'identifiant de tâche, puis interroge jusqu'à ce que le code de statut signale l'achèvement, les résultats étant produits sous trois heures et récupérables pendant sept jours.
- L'audio peut atteindre cinq heures et 512 Mo, aux formats OPUS, WAV, MP3, OGG, AMR, AAC et M4A, en mono ou en stéréo.
- Il reconnaît par défaut le mandarin, l'anglais, le cantonais et plusieurs dialectes chinois, avec des dizaines de langues paramétrables du japonais à l'arabe et une détection automatique de la langue optionnelle, laquelle prime sur une langue explicitement nommée lorsque les deux sont définies.
- Le biais par mots-clés et le contexte conversationnel améliorent la précision, les listes de mots-clés étant plafonnées à 5 000 mots et le contexte de dialogue à 800 tokens ou vingt tours, et Seed ASR 2.0 étend ce contexte à une image jointe, une par requête.
- La diarisation des locuteurs, la séparation des canaux, les horodatages au niveau de l'énoncé et du mot avec confiance, le filtrage des mots sensibles et les variantes en chinois traditionnel sont autant d'indicateurs facultatifs ; notez que la ponctuation est désactivée par défaut alors que la normalisation inverse du texte est activée, et que la diarisation est une fonctionnalité du mode fichier que les modes streaming n'offrent pas.
- Synthorai l'enveloppe dans un endpoint de transcription compatible OpenAI.
FAQ
Peut-on essayer l'API Seed ASR gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Seed ASR sur votre charge de travail réelle avant d'ajouter un moyen de paiement.
Quels sont les points forts de Seed ASR ?
Transcription par lots asynchrone en soumission-puis-interrogation ; des dizaines de langues paramétrables avec détection automatique ; le contexte conversationnel s'étend à une image d'accompagnement. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Seed ASR ?
Sur Synthorai, Seed ASR coûte $0.002 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.
Quelles langues Seed ASR prend-il en charge ?
Seed ASR prend en charge Avec `language` vide, le modèle couvre le mandarin, l'anglais, le cantonais, le shanghaïen, le minnan et les dialectes du Sichuan et du Shaanxi ; 39 clés de langue peuvent être épinglées explicitement (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus une détection automatique en option (enable_auto_lang). Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.
Comment obtenir l'accès à Seed ASR ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="seed-asr-bigmodel", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.