Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Coût API GLM 5.3 : raisonne toujours, 2.5x moins cher que 5.2

Sommaire
  1. Qu’est-ce que GLM 5.3 et combien coûte-t-il ?
  2. Peut-on encore désactiver le raisonnement ?
  3. Quel niveau d’effort donne les bonnes réponses ?
  4. Invente-t-il une réponse quand il n’y en a pas ?
  5. GLM 5.3 respecte-t-il un schéma JSON ?
  6. Combien coûte une image avec GLM 5.3 Flash ?
  7. Qu’est-ce qui a changé depuis GLM 5.2 ?
  8. Prise en charge par Synthorai
  9. FAQ

GLM 5.3 coûte, comme GLM 5.2, $1.40 par million de tokens en entrée et $4.40 par million en sortie. Il n’est plus possible de désactiver le raisonnement : toutes les méthodes renvoient une erreur 400, et l’effort par défaut est max. Nous avons exécuté trois fois 11 tâches dont la réponse était vérifiable. Seul max a obtenu 33 bonnes réponses sur 33, à $0.00468 par bonne réponse. C’est 2.5x moins cher que GLM 5.2 avec max, car GLM 5.3 utilise environ deux fois moins de raisonnement. low réduit le coût par bonne réponse de 63%, mais rate 5 réponses sur 33. GLM 5.3 Flash atteint 31 sur 33 pour un dixième du prix. reasoning_effort, le paramètre qui détermine combien de temps un modèle raisonne avant de répondre, influe désormais autant sur la précision que sur le coût. Nous avons mesuré les deux versions face à GLM 5.2 et DeepSeek V4.1 Flash dans une même série de tests.

TL;DR

  • GLM 5.3 et GLM 5.3 Flash refusent thinking: disabled, reasoning_effort: none et medium avec l’erreur 1210. Seuls low, high et max (la valeur par défaut) fonctionnent.
  • Avec max, GLM 5.3 obtient 33 sur 33 à $0.00468 par bonne réponse. GLM 5.2 avec max coûte $0.01173.
  • Avec low, GLM 5.3 obtient 28 sur 33 et GLM 5.3 Flash 24 sur 33.
  • Les deux versions de GLM 5.3 ignorent un json_schema strict. json_object a renvoyé les bonnes valeurs 8 fois sur 8.

Qu’est-ce que GLM 5.3 et combien coûte-t-il ?

Un GLM 5.2 réentraîné au même prix, accompagné d’un modèle plus petit dix fois moins cher. D’après le guide de Z.ai, GLM 5.3 « utilise le même modèle de base que GLM-5.2, toutes les améliorations venant du post-entraînement ». Il n’accepte que du texte. GLM 5.3 Flash compte « 320B paramètres au total, dont 18B activés » (seuls 18B travaillent sur chaque token, d’où son faible coût) et accepte les images, les vidéos et les fichiers. Les deux disposent d’une fenêtre de contexte de 1M tokens et d’une sortie maximale de 128K. Voici les tarifs par million de tokens indiqués sur la page de tarification de Z.ai :

ModèleEntréeEntrée en cacheSortie
GLM 5.3$1.40$0.26$4.40
GLM 5.3 Flash$0.15$0.03$0.50
GLM 5.2$1.40$0.26$4.40
DeepSeek V4.1 Flash$0.30 en période de pointe$0.006 en période de pointe$1.20 en période de pointe

La fiche du modèle et le guide de Flash de Z.ai attribuent les progrès aux tâches d’agent et de développement :

BenchmarkCe qu’il mesureGLM 5.2GLM 5.3GLM 5.3 Flash
Terminal Bench 3.0tâches d’agent dans un terminal4.628.3non indiqué
DeepSWE v1.1correction de vrais dépôts46.266.963.4
AutomationBenchautomatisation de workflows26.248.248.8
CyberGymtâches liées aux vulnérabilités de sécurité77.284.5non indiqué
HLE with toolsquestions difficiles avec accès à des outils54.762.5non indiqué

Nous avons testé ce que nous pouvions vérifier nous-mêmes : des tâches avec une seule réponse contrôlable, et non des benchmarks d’agents.

Peut-on encore désactiver le raisonnement ?

Non. GLM 5.2 acceptait thinking: {"type": "disabled"}. GLM 5.3 et GLM 5.3 Flash renvoient une réponse HTTP 400 avec le code d’erreur 1210 (« ce modèle raisonne toujours, la désactivation du raisonnement n’est pas prise en charge ; utilisez low, high ou max ») pour thinking: disabled, enable_thinking: false et pour reasoning_effort défini sur none, minimal, medium ou xhigh. Sans reasoning_effort, la valeur utilisée est max. thinking_budget, qui plafonne le nombre de tokens de raisonnement chez certains fournisseurs, est accepté mais ignoré par GLM 5.3 : sur une même question, toutes les valeurs de 0 à 1,024 ont produit environ 101 tokens de raisonnement.

resp = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": prompt}],
    reasoning_effort="high",   # "low" | "high" | "max"; omitted means "max"
    max_tokens=8192,           # GLM 5.3 Flash rejects anything above 131,072
)
reasoning_tokens = resp.usage.completion_tokens_details.reasoning_tokens  # billed as output
thinking_text = resp.choices[0].message.reasoning_content                # the thinking itself, as text

L’ancienne option économique n’était de toute façon pas très bonne : sans raisonnement, GLM 5.2 n’a répondu correctement qu’à 10 de nos 33 tâches, et DeepSeek V4.1 Flash à 22.

Quel niveau d’effort donne les bonnes réponses ?

Pour GLM 5.3, seul max y parvient. Pour GLM 5.3 Flash, aucun. Nous avons exécuté trois fois 11 tâches dont la réponse est un nombre unique et vérifiable : sommes de nombres premiers, comptages de chiffres, chemins dans une grille, combinaisons de pièces, application d’une règle 40 fois, reste de la division de 7 à la puissance 222 par 1000, conversion de base, problème de sac à dos et comptage de nombres à quatre chiffres soumis à trois contraintes. Les tokens de raisonnement correspondent au raisonnement interne produit avant la réponse et sont facturés comme des tokens de sortie. Le coût par bonne réponse correspond à la dépense totale divisée par le nombre de bonnes réponses, aux tarifs publics :

ModèleEffortBonnes réponsesTokens de raisonnement, médiane (maximum)Coût par bonne réponse
GLM 5.3low28/33143 (1,826)$0.00173
GLM 5.3high29/33226 (1,950)$0.00197
GLM 5.3max (par défaut)33/33538 (7,733)$0.00468
GLM 5.3 Flashlow24/33120 (467)$0.00012
GLM 5.3 Flashhigh29/33196 (1,582)$0.00021
GLM 5.3 Flashmax (par défaut)31/33419 (5,024)$0.00040
GLM 5.2max33/331,129 (21,917)$0.01173
DeepSeek V4.1 Flashlow33/33337 (6,797)$0.00102
DeepSeek V4.1 Flashmax33/33386 (10,769)$0.00138

Histogramme du coût par bonne réponse pour GLM 5.3, GLM 5.3 Flash, GLM 5.2 et DeepSeek V4.1 Flash avec les niveaux d'effort low, high et max, accompagné du nombre de bonnes réponses sur 33. GLM 5.3 n'atteint 33 sur 33 qu'avec max, à $0.00468 ; GLM 5.2 avec max coûte $0.01173 ; GLM 5.3 Flash est le moins cher, mais ne dépasse pas 31 sur 33

L’écart de 2.5x avec GLM 5.2 vient du volume de raisonnement : une médiane de 538 tokens de raisonnement contre 1,129, et une exécution maximale de 7,733 contre 21,917. Les niveaux inférieurs économisent de l’argent en sautant des vérifications. Avec low, GLM 5.3 a répondu deux fois 216 au problème des chemins dans une grille (une case bloquée ramène le résultat à 132), puis s’est trompé une fois sur les combinaisons de pièces, le sac à dos et la conversion de base. Avec low, GLM 5.3 Flash a échoué à chaque fois sur la règle en 40 étapes et le comptage sous contraintes. À l’inverse, DeepSeek V4.1 Flash a obtenu 33 sur 33 avec tous les niveaux.

Pour tout problème arithmétique ou à plusieurs étapes, conservez la valeur par défaut sur GLM 5.3. N’utilisez low que si une mauvaise réponse est facile et peu coûteuse à détecter. Avec max, GLM 5.3 coûte 3.4x plus cher que DeepSeek V4.1 Flash par bonne réponse. GLM 5.3 Flash coûte moins d’un tiers de ce prix, mais rate 2 réponses sur 33.

Invente-t-il une réponse quand il n’y en a pas ?

Non, même lorsque le raisonnement est obligatoire. Nous avons posé cinq questions sur des entités inventées, pour lesquelles la seule bonne réponse était « je ne sais pas » : le cours de l’action Verantis Dynamics, le point de fusion de Oridium-7 et le gagnant du 1987 Pan-Continental Robotics Prize. Les tests utilisaient l’effort par défaut avec une limite de 16,384 tokens :

ModèleA refusé de répondreA inventé une réponseA atteint la limite sans répondreTokens de raisonnementCoût par question
GLM 5.35/50/50/5230 à 542$0.0022
GLM 5.3 Flash5/50/50/5238 à 625$0.0003
GLM 5.25/50/50/5134 à 1,559$0.0035
DeepSeek V4.1 Flash1/53/51/57,021 à 16,384$0.0139

Les deux versions de GLM 5.3 ont indiqué ne pas disposer de l’information après quelques centaines de tokens de raisonnement. DeepSeek V4.1 Flash a raisonné pendant 7,000 à 16,000 tokens, puis a généralement inventé une réponse (Andrew Martin, the robot protagonist of Isaac Asimov's The Bicentennial Man, won). Dans notre étude du modèle publiée la veille, davantage d’exécutions avaient plutôt atteint la limite, mais le modèle refusait rarement de répondre. Pour les recherches qui peuvent légitimement ne rien renvoyer, c’est la plus grande différence que nous ayons mesurée entre les deux modèles Flash.

GLM 5.3 respecte-t-il un schéma JSON ?

Pas un schéma strict. Utilisez json_object. Avec response_format défini sur un json_schema strict pour extraire une facture, GLM 5.3 et GLM 5.3 Flash ont renvoyé une réponse HTTP 200 tout en ignorant le schéma lors des 16 exécutions sur 16. Le JSON était entouré d’un bloc de code Markdown et contenait des clés absentes du schéma (invoice_date, reference). Aucun résultat n’a donc pu être interprété comme l’objet demandé. La documentation de référence de l’API de Z.ai ne mentionne que text et json_object. Le piège vient de l’acceptation silencieuse du schéma.

Avec {"type": "json_object"} et les champs nommés dans le prompt, les deux versions ont renvoyé toutes les bonnes valeurs lors des 8 exécutions sur 8. GLM 5.2 et DeepSeek V4.1 Flash ont fait de même. Comme le raisonnement reste actif, l’extraction consomme une médiane de 240 tokens de sortie sur GLM 5.3 et de 140 sur Flash, contre 25 sur V4.1 Flash sans raisonnement. Validez vous-même le résultat par rapport à votre schéma.

Combien coûte une image avec GLM 5.3 Flash ?

Le nombre de tokens augmente avec la surface en pixels et n’est toujours pas plafonné à 2048x2048. Les grandes images coûtent donc plus cher qu’avec DeepSeek V4.1 Flash malgré un tarif inférieur. Nous avons envoyé des PNG générés à GLM 5.3 Flash (GLM 5.3 n’accepte que du texte), puis soustrait le coût du prompt sans image :

ImageTokens GLM 5.3 FlashCoût à $0.15/MTokens DeepSeek V4.1 FlashCoût à $0.30/M
512x512363$0.000054184$0.000055
1024x10241,371$0.000206652$0.000196
2048x20485,478$0.000822994$0.000298

Courbe du nombre de tokens d'entrée en fonction de la taille d'une image carrée : GLM 5.3 Flash progresse avec la surface en pixels jusqu'à 5,478 tokens à 2048x2048 ; DeepSeek V4.1 Flash reste à 184 jusqu'à 512x512 et atteint 994

Au-delà de 512 pixels, GLM 5.3 Flash consomme environ un token pour 766 pixels. detail, le contenu de l’image et le format du fichier n’ont pas modifié le nombre de tokens. Les chiffres de DeepSeek V4.1 Flash viennent de l’étude publiée la veille. Réduisez la résolution des captures d’écran et des pages de document avant de les envoyer : à 2048x2048, GLM 5.3 Flash coûte 2.8x plus cher par image.

Qu’est-ce qui a changé depuis GLM 5.2 ?

La vitesse, mais peu de choses dans l’intégration. En streaming sur le même créneau, avec low, GLM 5.3 a généré 59 à 64 tokens de sortie par seconde, GLM 5.3 Flash 70 à 82, GLM 5.2 51 à 55 et DeepSeek V4.1 Flash 124 à 161. Dans une boucle de function calling sur deux tours, chaque modèle a effectué un appel par tour. Les trois versions GLM comptent exactement le même nombre de tokens sur des textes en anglais, en chinois et en Python (737, 484 et 488). Les budgets de tokens restent donc valables.

Le préfixe réutilisé d’un prompt est facturé au tarif du cache, par tranches de 64 tokens (sur un prompt de 1,153 tokens, 1,024 ont été lus dans le cache). Les deux versions acceptent des prompts proches de la limite de 1M tokens, même si la fiche du modèle Flash mentionne 300,000 tokens : un prompt de 990,000 tokens contenant une valeur cachée vers le début a permis de récupérer cette valeur (nous n’avons pas testé le rappel vers la fin). Un prompt d’environ 1.07M tokens a renvoyé une erreur 400, Prompt exceeds max length, au lieu d’être tronqué. Une incompatibilité à prévoir lors de la migration : GLM 5.3 Flash refuse les valeurs de max_tokens supérieures à 131,072.

Prise en charge par Synthorai

GLM 5.3, GLM 5.3 Flash et GLM 5.2 sont disponibles sur la gateway sous les identifiants glm-5.3, glm-5.3-flash et glm-5.2, aux tarifs publics de Z.ai, via /v1/chat/completions et /v1/responses. L’erreur 1210 est transmise sans modification. Un client qui envoie encore l’option de désactivation de GLM 5.2 reçoit donc une erreur explicite, au lieu de lancer silencieusement le raisonnement avec max. Le texte de raisonnement est renvoyé dans reasoning_content. Les images sont envoyées à GLM 5.3 Flash sous forme de parties de contenu image_url.

FAQ

Peut-on désactiver le raisonnement sur GLM 5.3 ?

Non. GLM 5.3 et GLM 5.3 Flash renvoient une erreur 400 avec le code 1210 pour toutes les méthodes de désactivation. Seuls low, high et max sont acceptés, avec max par défaut. Dans notre série de tests, low a réduit le coût par bonne réponse de 63%, mais n’a obtenu que 28 bonnes réponses sur 33 au lieu de 33.

GLM 5.3 est-il moins cher que GLM 5.2 ?

Pas par token : les deux coûtent $1.40 en entrée et $4.40 en sortie. Oui par bonne réponse : avec max, GLM 5.3 coûte $0.00468 contre $0.01173 pour GLM 5.2, car il utilise environ deux fois moins de raisonnement.

GLM 5.3 Flash peut-il remplacer GLM 5.3 ?

Oui lorsqu’une erreur numérique occasionnelle est détectée en aval, pour un dixième du prix. Avec max, GLM 5.3 Flash obtient 31 bonnes réponses sur 33 à $0.00040 par bonne réponse, contre 33 sur 33 à $0.00468 pour GLM 5.3. Évitez Flash avec low pour les calculs en plusieurs étapes, où il n’a obtenu que 24 bonnes réponses sur 33.

À lire aussi : effort de raisonnement de GLM 5.2, appels d’outils avec GLM 5.2, coût de DeepSeek V4.1 Flash, contrôle du raisonnement des LLM, sorties structurées des LLM.

← Retour au blog