Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
Este modelo se ha retirado del catálogo activo. La información siguiente queda archivada. El proveedor recomienda migrar a glm-5.2.

GLM-5.1

Lanzamiento: 2026-04-07

chatCódigoRazonamientoLlamada a herramientasCaché de prompts

GLM-5.1 es el modelo fundacional insignia de Z.AI diseñado para tareas de largo horizonte, descrito oficialmente como capaz de trabajar de forma continua y autónoma en una sola tarea durante hasta 8 horas, cubriendo planificación, ejecución, pruebas, corrección y entrega.

Entrada
texto $1.4/M
Salida
texto $4.4/M
Lectura de caché
$0.26/M
Contexto
200K
vs GPT-4o
~72% más barato

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$1.4/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$4.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.26/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 200.000
Salida máxima (especificación del proveedor) 131.072

Caché de prompts

Modo automático

Razonamiento

Parámetro del proveedor thinking.type
Valores admitidos enabled · disabled
Valor por defecto enabled, y el modelo determina automáticamente si piensa se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento La traza se devuelve en reasoning_content; las trazas de los turnos anteriores se borran por defecto (clear_thinking true), y los bloques de pensamiento intercalado deben conservarse y devolverse junto con los resultados de las herramientas. Sin control de reasoning_effort: eso está documentado solo para GLM-5.2.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto → texto
Parámetros 744B totales · 40B activos MoE
Licencia MIT
  • Buque insignia de nueva generación para ingeniería agéntica (744B-A40B): trabaja de forma autónoma hasta 8 horas en una sola ejecución a lo largo de miles de llamadas a herramientas
  • contexto de 200K / salida máxima de 128K

según documentación oficial de Z.ai ↗

Use GLM-5.1 en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="glm-5.1",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de GLM-5.1

  • Construido sobre GLM-5, enfatiza un bucle de experimentar, analizar y optimizar en lugar de la generación de una sola pasada, lo que habilita la exploración autónoma, la mejora continua y la entrega estable en entornos de ingeniería complejos.
  • El planteamiento de Z.AI sobre esta actualización va de resistencia más que de capacidad máxima: donde la versión anterior se estanca pronto en un bucle agéntico, GLM-5.1 está documentado como capaz de sostener la optimización a lo largo de cientos de rondas y miles de llamadas a herramientas, con mejor criterio en problemas ambiguos.
  • El modelo ofrece una ventana de contexto de 200K con hasta 128K tokens de salida, además de modos de pensamiento y llamada a funciones.
  • Las cargas de trabajo nombradas van más allá del código, hasta el diálogo general, la escritura creativa, la generación de frontend y de artefactos, y la productividad ofimática.
  • El pensamiento se conmuta mediante el mismo objeto thinking que en el resto de la línea y por defecto deja que el modelo decida, con la traza devuelta en un campo reasoning_content aparte; tenga en cuenta que el control de esfuerzo de razonamiento que Z.AI añadió después está documentado solo para GLM-5.2, así que este modelo no tiene un mando de esfuerzo.
  • Las herramientas MCP, el streaming, la salida JSON y la caché de prefijo automática están todos admitidos, y los pesos se publican bajo la MIT License.
  • Synthorai expone GLM-5.1 tras su endpoint compatible con OpenAI para una integración directa.

Preguntas frecuentes

¿Se puede probar gratis la API de GLM-5.1?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1.4/M por tokens de entrada, solo ese crédito cubre aproximadamente 89 solicitudes de ~8K tokens contra GLM-5.1.

¿En qué destaca GLM-5.1?

Trabaja de forma autónoma hasta 8 horas; bucle de experimentar-analizar-optimizar sobre la generación de una sola pasada; cubre desde la planificación hasta las pruebas y la entrega. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta GLM-5.1?

GLM-5.1 cuesta $1.4 por millón de tokens de entrada y $4.4 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.26/M.

¿GLM-5.1 admite caché de prompts?

Sí, automáticamente: los prompts servidos por Z.ai se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.26/M frente a $1.4/M sin caché. Guía de caché de prompts →

¿Cómo obtengo acceso a GLM-5.1?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="glm-5.1" y listo. Una sola clave API cubre todos los modelos del gateway.

¿GLM-5.1 es open source?

Sí: los pesos se publican bajo MIT License. O ahórrese las GPU: la versión alojada aquí es de pago por uso, sin infraestructura que operar. Ejecutar modelos de pesos abiertos →

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →