Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

GLM-5.2

Lanzamiento: 2026-06-16

chatCódigoRazonamientoLlamada a herramientasCaché de prompts

GLM-5.2 es el modelo insignia de Z.AI construido para la era de las tareas de largo horizonte, que amplía la ventana de contexto a 1M tokens con hasta 128K de salida; la documentación insiste en hacer que ese contexto de 1M sea realmente utilizable para trabajo a escala de proyecto.

Entrada
texto $1.4/M
Salida
texto $4.4/M
Lectura de caché
$0.26/M
Contexto
1M
vs GPT-4o
~72% más barato

Benchmarks

Sobre la mediaNinguno mejor26 / 701 / 70
GLM-5.2 otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
SWE-Bench Pro
62.1%
GDPval-AA v2 Elo · 642-1861
1510
Harvey Lab-AA
91%
GPQA Diamond
91.2%
MCP-Atlas
82.6%

Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$1.4/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$4.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.26/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 1.000.000
Salida máxima (especificación del proveedor) 131.072

Caché de prompts

Modo automático

Razonamiento

Parámetro del proveedor thinking.type + reasoning_effort
Valores admitidos thinking.type enabled · disabled; reasoning_effort none · minimal · low · medium · high · xhigh · max (none and minimal skip thinking, low and medium map to high, xhigh maps to max)
Valor por defecto enabled, con reasoning_effort en max: el único GLM con un dial de esfuerzo, y viene fijado en su valor más alto se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento La traza se devuelve en reasoning_content; las trazas de los turnos anteriores se borran por defecto en el endpoint estándar de la API, y los bloques de pensamiento deben devolverse con los resultados de las herramientas para que el pensamiento intercalado funcione.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto → texto
Parámetros 744B totales · 40B activos MoE
Licencia MIT

Buque insignia de largo horizonte (744B-A40B) con contexto utilizable de 1M tokens / salida máxima de 128K, niveles configurables de esfuerzo de pensamiento y la eficiencia de atención dispersa IndexShare con contexto de 1M.

según documentación oficial de Z.ai ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

GLM-5.2 superado · 3 sentences

Enabling reasoning means the LLM now generates thousands of invisible "thinking" tokens to systematically work through complex problems before producing a final answer. Because our cloud providers bill for these internal processing steps at the same rate as standard output, our billable token volume per query has doubled. While this increases our direct API costs, it drastically reduces error rates and manual review labor, ultimately lowering our total cost per resolved transaction.

salida 1223 tok (+1138 pensamiento) latencia 17.1 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

GLM-5.2 fallado · 1/8 cases (fails [1])

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 […]

salida 4097 tok (+4036 pensamiento) latencia 58.4 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

GLM-5.2 superado · 5/5 fields, guidance "withheld"

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld" } ```

salida 1947 tok (+1893 pensamiento) latencia 30.9 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

GLM-5.2 superado · 120 words, 0 banned, 1 question

We are introducing Caching for our API Gateway, the smartest way to optimize your workflows. Why pay for the exact same response twice? Now, you can automatically store and reuse prompt results across multiple AI providers, drastically reducing latency and overall operational costs. If a user submits a duplicate query, the gateway serves the cached answer instantly, regardless of whether you route to OpenAI, Anthropic, or others. This directly translates to faster applications and significantly lower monthly API bills. You can easily configure your specific caching rules within the developer dashboard and watch your efficiency soar. Stop wasting your valuable tokens on completely redundant computations. Upgrade to the latest gateway version today and experience the future of intelligent prompt management.

salida 11125 tok (+10984 pensamiento) latencia 114.8 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use GLM-5.2 en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de GLM-5.2

  • Sobre GLM-5.1, la página oficial destaca una ejecución de tareas de largo horizonte más estable, mayor consistencia al seguir estándares de ingeniería en contextos extensos, comprensión a escala de proyecto con refactorización de varios archivos, y bucles completos de depuración en el dispositivo para desarrollo móvil y de cliente, junto con el desarrollo de miniprogramas y minijuegos y la reproducción de investigación.
  • También se publica la eficiencia que hay detrás de la ventana más larga: un esquema IndexShare permite que un indexador ligero sirva a cada cuatro capas del transformer, recortando el cómputo por token con 1M de contexto, con una capa mejorada de predicción de varios tokens que eleva la aceptación en la decodificación especulativa.
  • Este es además el único modelo de la línea con un control reasoning_effort, un conjunto documentado de niveles que en la práctica se reducen a omitir el pensamiento, un ajuste high y un ajuste máximo, y la API alojada usa el máximo por defecto, así que una solicitud que no fija nada es una solicitud que piensa a fondo.
  • Por lo demás el pensamiento se comporta como en el resto de la línea GLM-5, devolviendo su traza en un campo aparte, y la llamada a herramientas, MCP, la salida JSON y la caché automática se mantienen.
  • Los pesos tienen licencia MIT.
  • Cuando invoca GLM-5.2 en Synthorai, el endpoint compatible con OpenAI lo convierte en una actualización directa para cargas de trabajo de agente con contexto largo.

Preguntas frecuentes

¿Se puede probar gratis la API de GLM-5.2?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1.4/M por tokens de entrada, solo ese crédito cubre aproximadamente 89 solicitudes de ~8K tokens contra GLM-5.2.

¿En qué destaca GLM-5.2?

Contexto ampliado a 1M tokens utilizables; comprensión a escala de proyecto con refactorización de múltiples archivos; bucles de depuración en dispositivo para desarrollo móvil. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta GLM-5.2?

GLM-5.2 cuesta $1.4 por millón de tokens de entrada y $4.4 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.26/M.

¿GLM-5.2 admite caché de prompts?

Sí, automáticamente: los prompts servidos por Z.ai se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.26/M frente a $1.4/M sin caché. Guía de caché de prompts →

¿Cómo obtengo acceso a GLM-5.2?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="glm-5.2" y listo. Una sola clave API cubre todos los modelos del gateway.

¿GLM-5.2 es open source?

Sí: los pesos se publican bajo MIT License (repositorio oficial enlazado en la sección Acerca de). O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →