GLM-5.1 es el modelo fundacional insignia de Z.AI diseñado para tareas de largo horizonte, descrito oficialmente como capaz de trabajar de forma continua y autónoma en una sola tarea durante hasta 8 horas, cubriendo planificación, ejecución, pruebas, corrección y entrega.
- Entrada
- texto $1.4/M
- Salida
- texto $4.4/M
- Lectura de caché
- $0.26/M
- Contexto
- 200K
- vs GPT-4o
- ~72% más barato
El precio en contexto
Posición del precio entre 60 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 200.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 131.072 |
Caché de prompts
| Modo | automático |
|---|
Razonamiento
| Parámetro del proveedor | thinking.type |
|---|---|
| Valores admitidos | enabled · disabled |
| Valor por defecto | enabled, y el modelo determina automáticamente si piensa se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Comportamiento del razonamiento | La traza se devuelve en reasoning_content; las trazas de los turnos anteriores se borran por defecto (clear_thinking true), y los bloques de pensamiento intercalado deben conservarse y devolverse junto con los resultados de las herramientas. Sin control de reasoning_effort: eso está documentado solo para GLM-5.2. |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto → texto |
|---|---|
| Parámetros | 744B totales · 40B activos MoE |
| Licencia | MIT |
- Buque insignia de nueva generación para ingeniería agéntica (744B-A40B): trabaja de forma autónoma hasta 8 horas en una sola ejecución a lo largo de miles de llamadas a herramientas
- contexto de 200K / salida máxima de 128K
Use GLM-5.1 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="glm-5.1",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "glm-5.1",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.1",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "glm-5.1",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("glm-5.1")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de GLM-5.1
- Construido sobre GLM-5, enfatiza un bucle de experimentar, analizar y optimizar en lugar de la generación de una sola pasada, lo que habilita la exploración autónoma, la mejora continua y la entrega estable en entornos de ingeniería complejos.
- El planteamiento de Z.AI sobre esta actualización va de resistencia más que de capacidad máxima: donde la versión anterior se estanca pronto en un bucle agéntico, GLM-5.1 está documentado como capaz de sostener la optimización a lo largo de cientos de rondas y miles de llamadas a herramientas, con mejor criterio en problemas ambiguos.
- El modelo ofrece una ventana de contexto de 200K con hasta 128K tokens de salida, además de modos de pensamiento y llamada a funciones.
- Las cargas de trabajo nombradas van más allá del código, hasta el diálogo general, la escritura creativa, la generación de frontend y de artefactos, y la productividad ofimática.
- El pensamiento se conmuta mediante el mismo objeto thinking que en el resto de la línea y por defecto deja que el modelo decida, con la traza devuelta en un campo reasoning_content aparte; tenga en cuenta que el control de esfuerzo de razonamiento que Z.AI añadió después está documentado solo para GLM-5.2, así que este modelo no tiene un mando de esfuerzo.
- Las herramientas MCP, el streaming, la salida JSON y la caché de prefijo automática están todos admitidos, y los pesos se publican bajo la MIT License.
- Synthorai expone GLM-5.1 tras su endpoint compatible con OpenAI para una integración directa.
Preguntas frecuentes
¿Se puede probar gratis la API de GLM-5.1?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1.4/M por tokens de entrada, solo ese crédito cubre aproximadamente 89 solicitudes de ~8K tokens contra GLM-5.1.
¿En qué destaca GLM-5.1?
Trabaja de forma autónoma hasta 8 horas; bucle de experimentar-analizar-optimizar sobre la generación de una sola pasada; cubre desde la planificación hasta las pruebas y la entrega. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta GLM-5.1?
GLM-5.1 cuesta $1.4 por millón de tokens de entrada y $4.4 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.26/M.
¿GLM-5.1 admite caché de prompts?
Sí, automáticamente: los prompts servidos por Z.ai se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.26/M frente a $1.4/M sin caché. Guía de caché de prompts →
¿Cómo obtengo acceso a GLM-5.1?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="glm-5.1" y listo. Una sola clave API cubre todos los modelos del gateway.
¿GLM-5.1 es open source?
Sí: los pesos se publican bajo MIT License. O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.