Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.
Este modelo foi aposentado do catálogo ativo. As informações abaixo estão arquivadas. O fornecedor recomenda migrar para glm-5.2.

GLM-5.1

Lançado em 2026-04-07

chatCódigoRaciocínioChamada de ferramentasCache de prompts

O GLM-5.1 é o modelo de base carro-chefe da Z.AI projetado para tarefas de longo horizonte, descrito oficialmente como capaz de trabalhar de forma contínua e autônoma em uma única tarefa por até 8 horas, cobrindo planejamento, execução, teste, correção e entrega.

Entrada
texto $1.4/M
Saída
texto $4.4/M
Leitura de cache
$0.26/M
Contexto
200K
vs GPT-4o
~72% mais barato

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$1.4/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$4.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.26/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 200.000
Saída máxima (especificação do fornecedor) 131.072

Cache de prompts

Modo automático

Raciocínio

Parâmetro do fornecedor thinking.type
Valores aceites enabled · disabled
Valor predefinido enabled, e o modelo determina automaticamente se deve raciocinar aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O trace retorna em reasoning_content; os traces dos turnos anteriores são limpos por padrão (clear_thinking true), e os blocos de raciocínio intercalado devem ser preservados e devolvidos junto com os resultados das ferramentas. Sem controle de reasoning_effort: isso está documentado apenas para o GLM-5.2.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto → texto
Parâmetros 744B no total · 40B ativos MoE
Licença MIT
  • Carro-chefe de engenharia agêntica de nova geração (744B-A40B): trabalha de forma autônoma por até 8 horas em uma única execução, ao longo de milhares de chamadas de ferramentas
  • contexto de 200K / saída máxima de 128K

conforme documentação oficial da Z.ai ↗

Use o GLM-5.1 em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="glm-5.1",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o GLM-5.1

  • Construído sobre o GLM-5, ele enfatiza um loop de experimentar-analisar-otimizar em vez de geração em uma única passagem, permitindo exploração autônoma, melhoria contínua e entrega estável em ambientes de engenharia complexos.
  • O enquadramento que a Z.AI dá à atualização é de resistência, e não de capacidade de pico: onde o lançamento anterior estaciona cedo em um loop agêntico, o GLM-5.1 é documentado como capaz de sustentar a otimização por centenas de rodadas e milhares de chamadas de ferramentas, com melhor julgamento em problemas ambíguos.
  • O modelo oferece uma janela de contexto de 200K com até 128K tokens de saída, além de modos de raciocínio (thinking) e function calling.
  • As cargas de trabalho nomeadas vão além de código, alcançando diálogo geral, escrita criativa, geração de frontend e de artefatos, e produtividade de escritório.
  • O raciocínio é acionado pelo mesmo objeto thinking do resto da linha e, por padrão, deixa o modelo decidir, com o trace retornado em um campo reasoning_content separado; note que o controle de esforço de raciocínio que a Z.AI adicionou depois é documentado como exclusivo do GLM-5.2, então este modelo não tem esse ajuste.
  • Ferramentas MCP, streaming, saída JSON e cache de prefixo automático são todos suportados, e os pesos são publicados sob a licença MIT.
  • A Synthorai expõe o GLM-5.1 atrás do seu endpoint compatível com OpenAI para integração drop-in.

Perguntas frequentes

A API do GLM-5.1 é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $1.4/M de tokens de entrada, só esse crédito já cobre cerca de 89 requisições de ~8K tokens ao GLM-5.1.

Em que o GLM-5.1 é melhor?

Trabalha de forma autônoma por até 8 horas; loop de experimentar-analisar-otimizar em vez de geração em uma passagem; cobre do planejamento aos testes e à entrega. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o GLM-5.1?

Na Synthorai, o GLM-5.1 custa $1.4 por milhão de tokens de entrada e $4.4 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.26/M.

O GLM-5.1 suporta cache de prompts?

Sim, automaticamente: prompts servidos pela Z.ai entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.26/M, contra $1.4/M sem cache. Guia de cache de prompts →

Como obtenho acesso ao GLM-5.1?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="glm-5.1" e pronto. Uma única chave de API cobre todos os modelos do gateway.

O GLM-5.1 é open source?

Sim, os pesos são publicados sob a MIT License. Ou dispense as GPUs: a versão hospedada aqui é pagamento por uso, sem infraestrutura para operar. Como rodar modelos de pesos abertos →

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →