GLM-5.2 es el modelo insignia de Z.AI construido para la era de las tareas de largo horizonte, que amplía la ventana de contexto a 1M tokens con hasta 128K de salida; la documentación insiste en hacer que ese contexto de 1M sea realmente utilizable para trabajo a escala de proyecto.
- Entrada
- texto $1.4/M
- Salida
- texto $4.4/M
- Lectura de caché
- $0.26/M
- Contexto
- 1M
- vs GPT-4o
- ~72% más barato
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.000.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 131.072 |
Caché de prompts
| Modo | automático |
|---|
Razonamiento
| Parámetro del proveedor | thinking.type + reasoning_effort |
|---|---|
| Valores admitidos | thinking.type enabled · disabled; reasoning_effort none · minimal · low · medium · high · xhigh · max (none and minimal skip thinking, low and medium map to high, xhigh maps to max) |
| Valor por defecto | enabled, con reasoning_effort en max: el único GLM con un dial de esfuerzo, y viene fijado en su valor más alto se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content; las trazas de los turnos anteriores se borran por defecto en el endpoint estándar de la API, y los bloques de pensamiento deben devolverse con los resultados de las herramientas para que el pensamiento intercalado funcione. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto → texto |
|---|---|
| Parámetros | 744B totales · 40B activos MoE |
| Licencia | MIT |
Buque insignia de largo horizonte (744B-A40B) con contexto utilizable de 1M tokens / salida máxima de 128K, niveles configurables de esfuerzo de pensamiento y la eficiencia de atención dispersa IndexShare con contexto de 1M.
Un prompt, medido a través del gateway
GLM-5.2 superado · 3 sentences
Enabling reasoning means the LLM now generates thousands of invisible "thinking" tokens to systematically work through complex problems before producing a final answer. Because our cloud providers bill for these internal processing steps at the same rate as standard output, our billable token volume per query has doubled. While this increases our direct API costs, it drastically reduces error rates and manual review labor, ultimately lowering our total cost per resolved transaction.
salida 1223 tok (+1138 pensamiento) latencia 17.1 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
GLM-5.2 fallado · 1/8 cases (fails [1])
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 […]
salida 4097 tok (+4036 pensamiento) latencia 58.4 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
GLM-5.2 superado · 5/5 fields, guidance "withheld"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld" } ```
salida 1947 tok (+1893 pensamiento) latencia 30.9 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
GLM-5.2 superado · 120 words, 0 banned, 1 question
We are introducing Caching for our API Gateway, the smartest way to optimize your workflows. Why pay for the exact same response twice? Now, you can automatically store and reuse prompt results across multiple AI providers, drastically reducing latency and overall operational costs. If a user submits a duplicate query, the gateway serves the cached answer instantly, regardless of whether you route to OpenAI, Anthropic, or others. This directly translates to faster applications and significantly lower monthly API bills. You can easily configure your specific caching rules within the developer dashboard and watch your efficiency soar. Stop wasting your valuable tokens on completely redundant computations. Upgrade to the latest gateway version today and experience the future of intelligent prompt management.
salida 11125 tok (+10984 pensamiento) latencia 114.8 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use GLM-5.2 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "glm-5.2",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "glm-5.2",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("glm-5.2")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de GLM-5.2
- Sobre GLM-5.1, la página oficial destaca una ejecución de tareas de largo horizonte más estable, mayor consistencia al seguir estándares de ingeniería en contextos extensos, comprensión a escala de proyecto con refactorización de varios archivos, y bucles completos de depuración en el dispositivo para desarrollo móvil y de cliente, junto con el desarrollo de miniprogramas y minijuegos y la reproducción de investigación.
- También se publica la eficiencia que hay detrás de la ventana más larga: un esquema IndexShare permite que un indexador ligero sirva a cada cuatro capas del transformer, recortando el cómputo por token con 1M de contexto, con una capa mejorada de predicción de varios tokens que eleva la aceptación en la decodificación especulativa.
- Este es además el único modelo de la línea con un control reasoning_effort, un conjunto documentado de niveles que en la práctica se reducen a omitir el pensamiento, un ajuste high y un ajuste máximo, y la API alojada usa el máximo por defecto, así que una solicitud que no fija nada es una solicitud que piensa a fondo.
- Por lo demás el pensamiento se comporta como en el resto de la línea GLM-5, devolviendo su traza en un campo aparte, y la llamada a herramientas, MCP, la salida JSON y la caché automática se mantienen.
- Los pesos tienen licencia MIT.
- Cuando invoca GLM-5.2 en Synthorai, el endpoint compatible con OpenAI lo convierte en una actualización directa para cargas de trabajo de agente con contexto largo.
Preguntas frecuentes
¿Se puede probar gratis la API de GLM-5.2?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1.4/M por tokens de entrada, solo ese crédito cubre aproximadamente 89 solicitudes de ~8K tokens contra GLM-5.2.
¿En qué destaca GLM-5.2?
Contexto ampliado a 1M tokens utilizables; comprensión a escala de proyecto con refactorización de múltiples archivos; bucles de depuración en dispositivo para desarrollo móvil. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta GLM-5.2?
GLM-5.2 cuesta $1.4 por millón de tokens de entrada y $4.4 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.26/M.
¿GLM-5.2 admite caché de prompts?
Sí, automáticamente: los prompts servidos por Z.ai se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.26/M frente a $1.4/M sin caché. Guía de caché de prompts →
¿Cómo obtengo acceso a GLM-5.2?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="glm-5.2" y listo. Una sola clave API cubre todos los modelos del gateway.
¿GLM-5.2 es open source?
Sí: los pesos se publican bajo MIT License (repositorio oficial enlazado en la sección Acerca de). O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.