20% em todo GPT 🎉 30% no DeepSeekSaiba mais

Z.ai: GLM-5.3-FlashX

Chat-59%
z-ai/glm-5.3-flashx

GLM-5.3-FlashX é o modelo leve e de alta velocidade do z.ai internacional (api.z.ai), voltado para codificação eficiente e tarefas de agente de longa duração, com velocidade de inferência de até 200 tokens/s, oferecendo uma experiência de modelo mais rápida e fluida. Suporta entrada multimodal nativa (imagens e vídeos), contexto de 1M, thinking permanente (não desativável, com três níveis de reasoning effort: low, high e max), prompt caching, tool calling e web search, e é acessível pelos dois protocolos, OpenAI-compatible e Anthropic (sem suporte ao endpoint Responses).

Janela de Contexto
1M
Tokens Máx de Saída
131K
Lançamento
2026-08-26
Capacidades
VisãoFunction CallingRaciocínioPrompt CachingBusca WebEntrada de Vídeo
Provedores Disponíveis
Z.ai
Protocolos Suportados
openaianthropic

Providers

Z.aiprovider.type: "zai"
-59%
Tokens de Entrada
$0.15/M
$0.37/M
Tokens de Saída
$0.5/M
$1.25/M
Leitura de Cache
$0.03/M
$0.075/M
Busca Web
$0.01/R
Protocols
openai/v1/chat/completions
anthropic

Exemplos de Código

from openai import OpenAI
client = OpenAI(
base_url="https://api.ofox.io/v1",
api_key="YOUR_OFOX_API_KEY",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3-flashx",
messages=[
{"role": "user", "content": "Hello!"}
],
)
print(response.choices[0].message.content)

Perguntas Frequentes

Z.ai: GLM-5.3-FlashX na Ofox.ai custa $0.37/M por milhão de tokens de entrada e $1.25/M por milhão de tokens de saída. Pague por uso, sem mensalidade.