Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
Este modelo se ha retirado del catálogo activo. La información siguiente queda archivada.

GLM-5-Turbo

Lanzamiento: 2026-03-15

chatCódigoRazonamientoLlamada a herramientasCaché de prompts

GLM-5-Turbo es un modelo fundacional de Z.AI profundamente optimizado para el escenario de agente OpenClaw.

Entrada
texto $1.2/M
Salida
texto $4/M
Lectura de caché
$0.24/M
Contexto
205K
vs GPT-4o
~76% más barato

El precio en contexto

Posición del precio entre 60 modelos comparables

Entrada$1.2/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.24/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 200.000
Salida máxima (especificación del proveedor) 131.072

Caché de prompts

Modo automático

Razonamiento

Parámetro del proveedor thinking.type
Valores admitidos enabled · disabled
Valor por defecto enabled, y el modelo determina automáticamente si piensa se aplica si la solicitud no indica nada
Se puede desactivar
Comportamiento del razonamiento La traza se devuelve en reasoning_content; las trazas de los turnos anteriores se borran por defecto (clear_thinking true), y los bloques de pensamiento intercalado deben conservarse y devolverse junto con los resultados de las herramientas.
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto → texto
  • Variante de GLM-5 optimizada para velocidad, solo por API, ajustada para el escenario del agente OpenClaw: invocación de herramientas más fiable y estabilidad en tareas de larga duración
  • contexto de 200K / salida máxima de 128K

según documentación oficial de Z.ai ↗

Use GLM-5-Turbo en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="glm-5-turbo",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de GLM-5-Turbo

  • Frente al GLM-5 base, la documentación oficial destaca cuatro mejoras específicas: invocación de herramientas más precisa, mejor descomposición de instrucciones complejas, gestión consciente del tiempo de tareas programadas y persistentes, y mayor rendimiento en cadenas lógicas largas.
  • Proporciona una ventana de contexto de 200K y hasta 128K tokens de salida, con modos de pensamiento, streaming, llamada a funciones, caché de contexto, salida JSON estructurada e integración de herramientas MCP.
  • Z.AI presenta la versión como una mejora de la estabilidad y la eficiencia en tareas de agente de cadena larga más que de la inteligencia bruta, y enumera los dominios para los que se ajustó: instalación y configuración, desarrollo de código, recopilación de información, análisis de datos, creación de contenido, productividad ofimática, análisis financiero, ingeniería de operaciones e investigación.
  • Esa lista es la forma honesta de leerlo: un especialista en arneses de agente más que un hermano de propósito general.
  • El pensamiento sigue la misma convención de GLM-5, habilitado por defecto y con el modelo decidiendo si razona, y con la traza devuelta aparte de la respuesta.
  • Se pueden invocar habilidades externas junto a las herramientas, y los argumentos de las llamadas a herramientas pueden transmitirse de forma incremental.
  • Dos cosas lo distinguen del resto de la línea: Z.AI no publica su número de parámetros y, a diferencia de GLM-5, 5.1 y 5.2, no tiene una publicación de pesos abiertos.
  • Es solo API.
  • En Synthorai, GLM-5-Turbo se puede invocar mediante la API estándar compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de GLM-5-Turbo?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $1.2/M por tokens de entrada, solo ese crédito cubre aproximadamente 104 solicitudes de ~8K tokens contra GLM-5-Turbo.

¿En qué destaca GLM-5-Turbo?

Profundamente optimizado para el escenario de agente OpenClaw; invocación de herramientas y descomposición de instrucciones más precisas; gestión con conciencia del tiempo de tareas programadas y persistentes. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta GLM-5-Turbo?

GLM-5-Turbo cuesta $1.2 por millón de tokens de entrada y $4 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.24/M.

¿GLM-5-Turbo admite caché de prompts?

Sí, automáticamente: los prompts servidos por Z.ai se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.24/M frente a $1.2/M sin caché. Guía de caché de prompts →

¿Cómo obtengo acceso a GLM-5-Turbo?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="glm-5-turbo" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →