-20 % sur tout GPT 🎉 -30 % sur DeepSeekEn savoir plus

Z.ai: GLM-5.3-FlashX

Chat-59%
z-ai/glm-5.3-flashx

GLM-5.3-FlashX est le modèle léger et rapide de z.ai sur son site international (api.z.ai), conçu pour le codage efficace et les tâches d'Agent longue durée, avec une vitesse d'inférence pouvant atteindre 200 tokens/s, pour une expérience de modèle plus rapide et plus fluide. Il prend en charge les entrées multimodales natives (images, vidéos), un contexte de 1M, le thinking permanent (non désactivable, avec trois niveaux de reasoning effort : low, high et max), le prompt caching, le tool calling et la recherche web, et s'intègre via les deux protocoles OpenAI-compatible et Anthropic (le point de terminaison Responses n'est pas pris en charge).

Fenêtre de contexte
1M
Tokens de sortie max
131K
Publié
2026-08-26
Capacités
VisionFunction CallingRaisonnementPrompt CachingRecherche webEntrée vidéo
Fournisseurs disponibles
Z.ai
Protocoles supportés
openaianthropic

Providers

Z.aiprovider.type: "zai"
-59%
Tokens d'entrée
$0.15/M
$0.37/M
Tokens de sortie
$0.5/M
$1.25/M
Lecture cache
$0.03/M
$0.075/M
Recherche web
$0.01/R
Protocols
openai/v1/chat/completions
anthropic

Exemples de code

from openai import OpenAI
client = OpenAI(
base_url="https://api.ofox.io/v1",
api_key="YOUR_OFOX_API_KEY",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3-flashx",
messages=[
{"role": "user", "content": "Hello!"}
],
)
print(response.choices[0].message.content)

Questions fréquentes

Z.ai: GLM-5.3-FlashX sur Ofox.ai coûte $0.37/M par million de tokens d'entrée et $1.25/M par million de tokens de sortie. Paiement à l'usage, sans frais mensuels.