GLM 5.3: бенчмарки, доступ к API и сроки по весам (2026)
Отдельный API GLM 5.3 открыт: $1.4 за вход и $4.4 за вывод, столько же, сколько у 5.2. Спецификации 1M/128K, бенчмарки, эндпоинты и статус весов.
GLM 5.3 вышла 14 августа 2026 года без API с оплатой за токены, и через пять дней этот пробел закрыт: отдельный API открыт по $1.4 за вход и $4.4 за вывод, столько же, сколько у GLM 5.2, а модель есть на OpenRouter и в сторонних шлюзах. Не хватает теперь только весов. Модель переиспользует базу GLM 5.2, и весь скачок дало пост-обучение.
Релиз: 2026-08-14 (релизная заметка Z.ai)
Базовая модель: та же, что у GLM 5.2, весь прирост от пост-обучения
Спецификация: 1M контекста, максимум 128K вывода (страница модели Z.ai)
Цена: $1.4 вход / $0.26 кэш / $4.4 вывод, как у GLM 5.2
Открытые веса: всё ещё закрыты, HuggingFace отдаёт 401
Кодинг: Terminal Bench 3.0 с 4.6 до 28.3, SOTA среди открытых
Ломающее API: thinking.type "disabled" убран; reasoning_effort low/high/max
Отдельный API: открыт, api.z.ai, три протокола
Также доступна: OpenRouter, каталоги шлюзов, GLM Coding Plan, ZCode
Снимок: 2026-08-19
Что такое GLM 5.3?
Это обновление GLM 5.2 через пост-обучение, а не новое семейство моделей. Z.ai пишет об этом в первом же абзаце релизной заметки GLM-5.3: модель «использует ту же базовую модель, что и GLM-5.2», и «весь прирост приходит из пост-обучения».
- Те же базовые веса, что у
z-ai/glm-5.2, плюс месяц дополнительного RL сверху - Обучение шло на синтезированных длинных задачах, часть из которых у опытного инженера заняла бы дни
- Цель прямая, агентный кодинг: работа в терминале, изменения масштаба репозитория, многошаговые вызовы инструментов
- В заметке есть ещё большой раздел про исследования безопасности, он вне рамок этой страницы, читайте оригинал
Тред релиза на r/LocalLLaMA за несколько часов перевалил за 800 голосов при рейтинге 0.99, и верхние комментарии зацепились за одно: модель класса 743B на равных с куда более крупными. Эта цифра параметров, впрочем, посчитана сообществом, а не опубликована вендором, поэтому как факт мы её не повторяем.
Когда вышла GLM 5.3?
14 августа 2026 года, и в тот же день она дошла до подписчиков GLM Coding Plan.
Раскатка идёт неравномерно, и это стоит знать до того, как пойдёте искать:
| Площадка | Состояние на 2026-08-14 | Состояние на 2026-08-19 |
|---|---|---|
| Релизная заметка Z.ai | Опубликована | Без изменений |
| GLM Coding Plan / ZCode | Доступна всем подписчикам | Доступна |
| Страница модели в документации Z.ai | Ещё не выложена | Опубликована, 1M контекста и 128K вывода |
| Отдельный API модели | «Скоро», даты нет | Открыт, три протокола на api.z.ai |
| Таблица цен Z.ai | Заканчивалась на GLM 5.2 | Строка GLM-5.3, $1.4 / $0.26 / $4.4 |
| Каталог OpenRouter | Записи нет | z-ai/glm-5.3, контекст 1 048 576 |
| Каталоги шлюзов, включая ofox | Не заведена | z-ai/glm-5.3 доступна |
| Веса на HuggingFace | Репозиторий есть, закрыт | По-прежнему 401 |
За пять дней релиз прошёл путь от «только по подписке» до полноценной тарификации везде, кроме весов. Это обычная форма релиза Z.ai, и порядок стоит запомнить: план получает модель первым, API за токены подтягивается следом, веса приходят последними.
GLM 5.3 это open source?
Пока нет. Z.ai обязуется опубликовать веса примерно через две недели после релиза, «когда завершатся оценка безопасности и харденинг».
Мы проверили, а не поверили на слово. Репозиторий zai-org/GLM-5.3 на HuggingFace уже существует, и API отдаёт по нему 401, тогда как zai-org/GLM-5.2 отдаёт 200. 401 вместо 404 означает, что репозиторий создан и закрыт, а не отсутствует. Это больше похоже на запланированную публикацию, чем на расплывчатое намерение. На 19 августа, пятый день после релиза, проверка по-прежнему отдаёт 401, так что двухнедельная оценка указывает на конец августа.
Есть прецедент, по которому можно оценить ожидание. Simon Willison писал 17 июня 2026 года о прошлом цикле: «Китайская AI-лаборатория Z.ai выпустила GLM-5.2 для подписчиков своего coding plan 13 июня, а вчера (16 июня) опубликовала полные открытые веса под лицензией MIT.» Тогда прошло три дня, сейчас заявлены две недели. За лицензией тоже стоит следить: 5.2 вышла под MIT, а про 5.3 Z.ai ничего не сказала.
Если веса нужны прямо сейчас, вариант по-прежнему GLM 5.2. Наш гайд по локальному запуску GLM 5.2 разбирает GGUF-кванты и требования каждого, а разбор железа и стоимости самостоятельного хостинга содержит цифры по vLLM. Поскольку 5.3 делит базу с 5.2, объём памяти и форма развёртывания должны перенестись почти без изменений. Это единственное удобство релиза, состоящего только из пост-обучения: планирование мощностей не начинается заново.
Сколько стоит GLM 5.3?
$1.40 за миллион входных токенов, $0.26 за кэшированный ввод, $4.40 за вывод. Ровно столько же, сколько стоит GLM 5.2. Таблица цен в документации Z.ai для разработчиков теперь содержит строку GLM-5.3, и она совпадает с 5.2 и 5.1 по всем позициям.
| Позиция | Ставка |
|---|---|
| Ввод | $1.40 / 1M токенов |
| Кэшированный ввод | $0.26 / 1M токенов |
| Хранение кэша | Бесплатно, помечено как временная акция |
| Вывод | $4.40 / 1M токенов |
| GLM Coding Plan | Квота в баллах, ввод, кэшированный ввод и вывод считаются отдельно |
| Скидка вне пика | 50% от стандартных баллов |
| Пиковое окно | 14:00–18:00 UTC+8, с понедельника по пятницу |
Обновление по той же цене — редкий случай, когда вопрос про стоимость отвечает сам на себя: остаться на 5.2 имеет смысл только ради весов или ради выключаемого мышления. При этом ровный ценник кое-что скрывает: по собственным данным Z.ai, GLM 5.3 эффективнее по токенам, так что та же задача должна обойтись дешевле, а не так же.
Реальные деньги лежат в строке про кэш. $0.26 против $1.40 означает, что повторяемый префикс стоит 19% от холодного чтения, а запись в кэш на время акции бесплатна. OpenRouter отдаёт ту же пару $1.4 / $4.4 при контексте 1 048 576, то есть сторонние маршруты передают первичную цену дальше без наценки. Таблица эндпоинтов, порядок миграции и замеренная стоимость вызова на каждом уровне reasoning_effort — в нашем гайде по API GLM 5.3.
Какое окно контекста у GLM 5.3?
1M токенов при задокументированном максимуме вывода 128K. Страница модели GLM-5.3 у Z.ai приводит оба числа, китайская документация Zhipu даёт ту же пару.
При этом собственные замеры Z.ai шли не на этом потолке, и это полезный сигнал о том, где модель реально нагружали:
| Бенчмарк | Использованный контекст | Максимум вывода |
|---|---|---|
| Terminal Bench 3.0 | 400K | 128K |
| Terminal Bench 2.1 | Не указан | 65 536 |
| DeepSWE v1.1 | 400K | Не указан |
| Agents’ Last Exam (CLI) | 1M | 64K |
| SWE-Marathon, PostTrainBench | 1M | 128K |
| NL2Repo | 1M | 64K |
| HLE with tools | 300 000, со стратегией управления контекстом | 163 840 |
Разброс важен, если вы рассчитывали опереться на полный миллион. 1M, это то, что модель принимает, а 400K, это то, что Z.ai выбрала для своего флагманского кодинг-набора. Эндпоинт, который в итоге будет отдавать 5.3, может опубликовать и более низкий потолок, поэтому рабочим числом считайте его.
Насколько лучше GLM 5.3 в коде?
Сильно на свежих агентных бенчмарках и умеренно на насыщенных. Все цифры ниже принадлежат самой Z.ai. Прогоны Terminal Bench, SWE-Marathon и Agents’ Last Exam шли на харнессе Claude Code 2.1.207 при максимальном reasoning effort, DeepSWE, на mini-swe-agent.
| Бенчмарк | GLM 5.3 | GLM 5.2 | Kimi K3 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 34.6 |
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.8 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 58.0 | 72.7 |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | 48.8 | 42.5 |
| Agents’ Last Exam (CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 28.6 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1588 | 1730 |
Основную работу делает строка Terminal Bench 3.0: с 4.6 до 28.3 на наборе, где GLM 5.2 фактически не участвовала. На Terminal Bench 2.1, где все сидят между 85 и 89, то же обновление стоит 7 пунктов и не меняет ни одной позиции. У новых бенчмарков есть запас, чтобы показать движение, у старых его нет.
Главный аргумент Z.ai, это не балл. На уровне High GLM 5.3 берёт 31.4% на своём внутреннем Code Bench, тратя около 50K токенов вывода на задачу, против 29.5% у Claude Opus 4.8 при 120K.
Именно это заявление стоит проверить самому, потому что платите вы за количество токенов. Z.ai также сообщает 34.5% примерно при 75K токенов на уровне Max, против 23.4% при 96K у GLM 5.2. Claude Fable 5 по-прежнему лидирует в этом закрытом бенчмарке с 39.5%, а GPT-5.6 Sol остаётся первым в Terminal Bench 3.0, так что корректная формулировка, это «SOTA среди открытых», а не «SOTA».
Одно предостережение ко всей таблице: это закрытый бенчмарк плюс публичные, прогнанные вендором. Числа Kimi K3 и Claude Opus 4.8 здесь получены Z.ai, а не их разработчиками.
Нужно ли менять код под GLM 5.3?
Да, если вы когда-либо отключали thinking. thinking.type: "disabled" убран, и Z.ai пишет, что запрос просто упадёт.
Новый контракт:
thinking.typeпринимает толькоenabledreasoning_effortпринимаетlow,high,maxи по умолчанию равенmax- Для кодинга Z.ai рекомендует
max - Порядок миграции важен: сначала выставьте
enabledвместе сreasoning_effort: "low", и только потом меняйте ID модели
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
Цену потери disabled легко недооценить, поэтому мы измерили её на GLM 5.2 через OpenAI-совместимый эндпоинт 14 августа 2026 года. Один тривиальный промпт, «Reply with the single word: ok», по три прогона на конфигурацию:
| Конфигурация запроса | Токены вывода (3 прогона) |
|---|---|
| По умолчанию (thinking включён) | 144, 138, 90 |
reasoning_effort: "low" | 69, 86, 122 |
reasoning_effort: "max" | 101, 120, 102 |
thinking.type: "disabled" | 2, 2, 2 |
На таком коротком промпте разброс между прогонами перекрывает разницу между low и max, поэтому не вычитывайте из этих трёх строк порядок. Значение имеет последняя строка. С выключенным мышлением ответ каждый раз укладывался в 2 токена вывода, а самая дешёвая настройка с включённым тратила от 69 до 122. В GLM 5.3 этой строки больше нет.
Эта таблица снята на GLM 5.2, и напрашивающийся из неё вывод оказался неверным. Прямое измерение на GLM 5.3 19 августа 2026 года: промпт классификации с ответом в одно слово даёт медиану в 3 выходных токена при reasoning_effort: "low" (10 прогонов) против 105 при max. Пол на 5.3 не 70 токенов, а примерно то же, что раньше стоил disabled. Загвоздка в том, что по умолчанию стоит max, так что перенесённая без явного параметра нагрузка получает версию на 105 токенов. Расчёты для такого профиля трафика есть в сравнении стоимости GLM 5.2 и GPT-5.5.
Какие возможности поддерживает GLM 5.3?
Текст на входе и выходе, плюс режимы мышления, стриминг, вызов функций, кэш контекста и структурированный вывод. Эти пять сегодня перечисляет страница модели Z.ai.
| Возможность | Состояние |
|---|---|
| Модальности ввода и вывода | Только текст |
| Режимы мышления | low, high, max, отключение недоступно |
| Стриминг вывода | Поддерживается |
| Вызов функций | Поддерживается |
| Кэш контекста | Поддерживается |
| Структурированный вывод | Поддерживается, включая JSON |
| MCP | Больше не указан в разделе возможностей |
Строка про MCP заслуживает отдельной пометки, потому что она сдвинулась. 15 августа страница модели содержала ссылку на MCP в списке возможностей, 19 августа её там нет. Об удалении не объявляли, так что считайте поддержку MCP неподтверждённой, а не отменённой, и проверьте её на своём стеке, прежде чем закладывать в архитектуру.
В остальном относительно GLM 5.2 здесь нет ничего нового, что согласуется с релизом из одного только пост-обучения. Зрение, изображения и аудио остаются на отдельных линейках GLM-5V и GLM-Image.
Как получить доступ к GLM 5.3?
Теперь четыре маршрута: тарифицируемый API Z.ai, GLM Coding Plan, ZCode или любой агрегатор с z-ai/glm-5.3.
| Маршрут | Что получаете | Оговорка |
|---|---|---|
| API модели Z.ai | Оплата за токены по $1.4 / $4.4, три протокола | Аккаунты с Coding Plan ограничены одним протоколом, см. ниже |
| GLM Coding Plan | Квота в баллах, 50% вне пика | Подписка, а не оплата по факту |
| ZCode | Режим Goal, попадание в кэш 98%+, квота ×1.5 до 2026-08-31 | Собственный клиент Z.ai |
| Claude Code / Cline / OpenCode | Прежний агент, новая модель | Расходует квоту плана, а не тарифицируемый ключ |
| Агрегаторы и шлюзы | Один ключ на все модели | Идентификаторы моделей различаются: на OpenRouter и в ofox это z-ai/glm-5.3 |
Эндпоинты оказались не теми, которые Zhipu анонсировала в день релиза. Страница модели сейчас указывает https://api.z.ai/api/coding/paas/v4 для протокола OpenAI Chat Completions, https://api.z.ai/api/v1 для протокола OpenAI Responses и https://api.z.ai/api/anthropic для протокола Anthropic Messages. Базовый URL open.bigmodel.cn/api/paas/v4 из релизной заметки в итоге не приехал, копировать его не нужно. Хуже того, раздел Quick Start на той же странице стучится в https://api.z.ai/api/paas/v4/chat/completions, без сегмента /coding, то есть одна страница противоречит сама себе. Если один вариант отдаёт 404, попробуйте второй, прежде чем подозревать ключ.
Ещё одну оговорку легко пропустить: аккаунты, когда-либо оформлявшие GLM Coding Plan, включая истёкшие, сейчас могут обращаться к API модели только по протоколу OpenAI Chat Completions.
Через агрегатор всё меняется в две строки:
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.io/v1")
r = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
reasoning_effort="low", # варианта "disabled" на 5.3 нет
)
print(r.usage)
Префикс идентификатора это z-ai, а не zai, и именно эта опечатка чаще всего приводит к ошибке:
{"error":{"message":"Model 'zai/glm-5.3' not found","type":"model_not_found","code":404}}
z-ai/glm-5.2 отвечает на том же эндпоинте с тем же ключом, так что переключение между ними это одна строка. Настройку ключа от начала до конца разбирает наш гайд по доступу к API GLM 5.2.
Как направить кодинг-агента на модель, вышедшую вчера?
Изменением одной строки, если агент позволяет задать эндпоинт самому. Неделя релиза всегда выглядит одинаково. Подписочный продукт получает модель в первый день, тарифицируемый API открывается через несколько дней, страница документации опаздывает на сутки после анонса, а каждый ваш инструмент держит захардкоженный список моделей. GLM 5.3 прошла всю эту последовательность с 14 по 19 августа 2026 года, и в очереди остались только веса.
Контролировать вы можете только одно: сколько стоит перекладка труб под новую модель. Агенты, где задаются base_url и строка модели, воспринимают релиз как правку в одну строку. Агенты с фиксированным выпадающим списком заставляют ждать своего цикла выпуска, поэтому тред на r/opencodeCLI появился в течение часа после анонса.
Claude Code, OpenCode и большинство остальных агентов говорят по OpenAI-совместимому HTTP, так что один ключ за одним базовым URL держит их всех на общем биллинге и общем переключении при сбоях. ofox покрывает каталог примерно из 130 моделей на этом единственном эндпоинте, причём z-ai/glm-5.3 и z-ai/glm-5.2 доступны обе, так что переключение между ними это блок кода выше и больше ничего.
GLM 5.3 против GLM 5.2: что изменилось?
Пост-обучение и три вещи, с которыми придётся что-то делать: нет переключателя выключения мышления, нет скачиваемых весов и балл Terminal Bench 3.0, ушедший с 4.6 на 28.3.
| GLM 5.3 | GLM 5.2 | |
|---|---|---|
| Базовая модель | Та же | Та же |
| Контекст / максимум вывода | 1M / 128K | 1M / 128K |
| Опубликованная цена за токен | $1.40 / $0.26 / $4.40 | $1.40 / $0.26 / $4.40 |
| Тарифицируемый API | Доступен | Доступен |
| В агрегаторах | Да, z-ai/glm-5.3 | Да, z-ai/glm-5.2 |
| Веса | Пока закрыты | Публичные, MIT |
| Отключение мышления | Не поддерживается | Поддерживается |
| Уровни effort | low / high / max, по умолчанию max | Уровни плюс disabled |
| Terminal Bench 3.0 | 28.3 | 4.6 |
Раз вопрос цены закрыт ничьей, по-настоящему остаётся одна причина держаться за GLM 5.2: нужны скачиваемые веса. Второй кандидат, сохранить thinking.type: "disabled" для потока коротких вызовов, при измерении почти исчезает: low на 5.3 отвечает на промпт классификации медианой в 3 выходных токена. Всё остальное указывает на 5.3, а гайд по доступу к API GLM 5.2 применим без изменений: ключ, эндпоинт и форма запроса те же.
Источники
- Релизная заметка Z.ai: GLM-5.3
- Документация Z.ai: страница модели GLM-5.3
- Документация Z.ai: цены
- Документация Z.ai devpack: обзор GLM Coding Plan
- Документация Zhipu AI: GLM-5.3
- HuggingFace: zai-org
- OpenRouter: z-ai/glm-5.3
- r/LocalLLaMA: GLM 5.3 Released
- r/opencodeCLI: GLM 5.3 is there!
- Simon Willison: GLM-5.2 is probably the most powerful text-only open weights LLM
- GLM 5.3 API: цены, эндпоинты и reasoning_effort (блог ofox)
- Страница модели ofox: GLM 5.3
- Страница модели ofox: GLM 5.2
Часто задаваемые вопросы
- Отдельный API GLM 5.3 уже доступен?
- Да. В таблице цен Z.ai появилась строка GLM-5.3: $1.4 за миллион входных токенов, $0.26 за кэшированный ввод и $4.4 за вывод, ровно как у GLM 5.2. Модель также есть на OpenRouter и в шлюзах, включая ofox, под идентификатором z-ai/glm-5.3. GLM Coding Plan остаётся отдельным маршрутом на баллах.
- Какой максимальный вывод у GLM 5.3?
- 128K токенов при окне контекста 1M, оба числа указаны на странице модели Z.ai. Собственные прогоны Z.ai укладываются в этот предел: 128K на Terminal Bench 3.0 и PostTrainBench, 64K на Agents' Last Exam. Эндпоинт, который в итоге будет отдавать модель, может выставить и более низкий потолок.
- Можно ли использовать GLM 5.3 с Claude Code?
- Да. Z.ai перечисляет Claude Code, Cline и OpenCode среди поддерживаемых инструментов GLM Coding Plan, а собственные бенчмарки прогоняла на харнессе Claude Code 2.1.207. Задавайте reasoning_effort, а не выключайте thinking, модель больше не принимает отключённое мышление.
- GLM 5.3 сильнее Kimi K3?
- По таблице самой Z.ai она выигрывает Terminal Bench 3.0 со счётом 28.3 против 17.4 и AutomationBench 48.2 против 46.7, тогда как Kimi K3 ведёт в Toolathlon 76.5 против 73.0 и SWE-Marathon 48.1 против 42.5. Все эти числа получены вендором Z.ai, поэтому читайте их как заявление, требующее проверки, а не как независимый результат.
- У GLM 5.3 новая базовая модель?
- Нет. Z.ai заявляет, что GLM 5.3 использует ту же базовую модель, что и GLM 5.2, и весь прирост даёт пост-обучение. Релизная заметка открывается фразой «Scaling post-training is all we did for GLM-5.3.»
- Есть ли бесплатный доступ к GLM 5.3?
- Бесплатного тарифа нет. Оплата за токены: $1.4 за миллион входных и $4.4 за миллион выходных. Платить меньше можно двумя способами: кэшированный ввод по $0.26, причём запись в кэш временно бесплатна, и GLM Coding Plan, где вызовы вне пикового окна с 14:00 до 18:00 UTC+8 по будням расходуют половину стандартных баллов.
- Где скачать веса GLM 5.3?
- Пока нигде. Через пять дней после релиза репозиторий zai-org/GLM-5.3 на HuggingFace по-прежнему отдаёт 401 через API, тогда как GLM 5.2 отдаёт 200. Z.ai обещает выложить веса примерно через две недели после релиза, когда закончит оценку безопасности и харденинг, то есть ближе к концу августа.


