GLM-5 es el modelo fundacional de nueva generación de Z.AI construido para la ingeniería agéntica, orientado a la ingeniería de sistemas compleja y a las tareas de agente de largo horizonte.
- Entrada
- texto $1/M
- Salida
- texto $3.2/M
- Lectura de caché
- $0.2/M
- Contexto
- 200K
- vs GPT-4o
- ~80% más barato
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 200.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 131.072 |
Caché de prompts
| Modo | automático |
|---|
Razonamiento
| Parámetro del proveedor | thinking.type |
|---|---|
| Valores admitidos | enabled · disabled |
| Valor por defecto | enabled, y en GLM-5 el modelo determina automáticamente si piensa se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content; las trazas de los turnos anteriores se borran por defecto (clear_thinking true), y los bloques de pensamiento intercalado deben conservarse y devolverse junto con los resultados de las herramientas. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto → texto |
|---|---|
| Parámetros | 744B totales · 40B activos MoE |
| Licencia | MIT |
- Buque insignia para ingeniería agéntica: MoE de 744B parámetros (40B activos), preentrenado con 28.5T tokens y DeepSeek Sparse Attention
- contexto de 200K / salida máxima de 128K
Un prompt, medido a través del gateway
GLM-5 superado · 3 sentences
Enabling reasoning forces the model to perform multiple hidden steps to "think" through a problem, drastically increasing the volume of data processed per query compared to a standard response. Because our billing is directly tied to this processing volume, the additional computational work required for higher accuracy has proportionally doubled our consumption. Essentially, the spike reflects a trade-off where we are paying a higher variable cost to secure significantly better analytical outcomes.
salida 1393 tok (+1308 pensamiento) latencia 36.0 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
GLM-5 superado · 8/8 cases
Here is the fixed code: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The bug stems from initializing `best` and `cur` to zero, which causes the function to count the number of *transitions* between adjacent elements rather than the total number of items in the run, resulting in a return value that is always one less than the actual length (reporting 0 for a single element and 1 for a pair). By initializing the counters to 1 and resetting `cur` to 1 when a streak breaks, the logic correctly counts the items themselves; adding an explicit check for an empty list ensures the function handles the zero-element edge case correctly.
salida 2907 tok (+2694 pensamiento) latencia 73.7 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
GLM-5 superado · 5/5 fields, guidance "withheld pending the Q4 close"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld pending the Q4 close" } ```
salida 3620 tok (+3561 pensamiento) latencia 91.8 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
GLM-5 superado · 119 words, 0 banned, 1 question
We are thrilled to introduce Global Prompt Caching, a powerful new capability within our API gateway designed to optimize your AI operations. By intelligently storing prompt responses across every supported provider, this feature drastically reduces latency and cuts operational costs. Instead of processing identical requests repeatedly, our system serves cached results instantly, ensuring consistent performance even during high-traffic periods. Why pay full price for repeated inference on the same inputs? This update gives developers fine-grained control over cache lifetimes and hit rates, allowing for predictable budgeting and faster application response times. You can activate this functionality directly in your dashboard settings today. Start maximizing your efficiency now and deliver a snappier experience to your end-users without unnecessary API expenditure.
salida 715 tok (+571 pensamiento) latencia 18.9 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use GLM-5 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="glm-5",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "glm-5",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "glm-5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("glm-5")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de GLM-5
- Frente a su predecesor, Z.AI escaló los parámetros de 355B (32B activados) a 744B (40B activados) y los datos de preentrenamiento de 23T a 28.5T tokens, añadiendo atención dispersa y el marco de aprendizaje por refuerzo asíncrono Slime.
- Ofrece una ventana de contexto de 200K, hasta 128K tokens de salida, modos de pensamiento, llamada a funciones, caché de contexto y pesos abiertos, y Z.AI describe un rendimiento de codificación y de agente de vanguardia dentro del código abierto.
- Más allá del código, la página del modelo nombra el trabajo documental al que apunta su propio equipo: extraer datos estructurados de contratos y documentos financieros, traducción profesional, inspección de calidad en atención al cliente, y escritura de rol o de guion gráfico que debe mantenerse en personaje.
- El pensamiento se ajusta mediante un objeto thinking cuyo valor por defecto, enabled, significa en esta generación que el modelo decide por sí mismo si razona antes de responder en lugar de verse forzado a hacerlo; la traza vuelve en un campo reasoning_content aparte, transmitido por delante de la respuesta, y las trazas de turnos anteriores se eliminan por defecto.
- La llamada a herramientas acepta hasta 128 funciones con streaming incremental de los argumentos, las herramientas MCP externas se conectan directamente, se admite la salida de objeto JSON y la caché de prefijos repetidos es automática.
- Los pesos se publican bajo la MIT License.
- Synthorai sirve GLM-5 a través de su endpoint compatible con OpenAI, así que los SDK existentes funcionan sin cambios.
Preguntas frecuentes
¿Se puede probar gratis la API de GLM-5?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1/M por tokens de entrada, solo ese crédito cubre aproximadamente 125 solicitudes de ~8K tokens contra GLM-5.
¿En qué destaca GLM-5?
Escalado a 744B parámetros, 40B activados; atención dispersa más aprendizaje por refuerzo asíncrono; pesos abiertos con ventana de contexto de 200K. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta GLM-5?
GLM-5 cuesta $1 por millón de tokens de entrada y $3.2 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.2/M.
¿GLM-5 admite caché de prompts?
Sí, automáticamente: los prompts servidos por Z.ai se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.2/M frente a $1/M sin caché. Guía de caché de prompts →
¿Cómo obtengo acceso a GLM-5?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="glm-5" y listo. Una sola clave API cubre todos los modelos del gateway.
¿GLM-5 es open source?
Sí: los pesos se publican bajo MIT License. O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.