GLM 5.3: бенчмарки, доступ к API и сроки по весам (2026)

GLM 5.3 вышла, но API за токены всё ещё «скоро»: вход сегодня только через GLM Coding Plan. Спецификации 1M/128K, бенчмарки, срок публикации весов.

GLM 5.3: бенчмарки, доступ к API и сроки по весам (2026)

GLM 5.3 вышла 14 августа 2026 года, и через сутки отдельный API всё ещё помечен как «скоро», так что весь первичный доступ сегодня идёт через GLM Coding Plan. Модель переиспользует базу GLM 5.2, и весь скачок дало пост-обучение. Веса обещают примерно через две недели.

Релиз:          2026-08-14 (релизная заметка Z.ai)
Базовая модель: та же, что у GLM 5.2, весь прирост от пост-обучения
Спецификация:   1M контекста, максимум 128K вывода (страница модели Z.ai)
Открытые веса:  ещё нет, Z.ai говорит про две недели
Кодинг:         Terminal Bench 3.0 с 4.6 до 28.3, SOTA среди открытых
Ломающее API:   thinking.type "disabled" убран; reasoning_effort low/high/max
Доступ сегодня: GLM Coding Plan, ZCode, Claude Code / Cline / OpenCode
Отдельный API:  «скоро», даты нет
Ещё нет в:      OpenRouter, каталогах шлюзов, HuggingFace
Снимок:         2026-08-15

Что такое GLM 5.3?

Это обновление GLM 5.2 через пост-обучение, а не новое семейство моделей. Z.ai пишет об этом в первом же абзаце релизной заметки GLM-5.3: модель «использует ту же базовую модель, что и GLM-5.2», и «весь прирост приходит из пост-обучения».

  • Те же базовые веса, что у z-ai/glm-5.2, плюс месяц дополнительного RL сверху
  • Обучение шло на синтезированных длинных задачах, часть из которых у опытного инженера заняла бы дни
  • Цель прямая, агентный кодинг: работа в терминале, изменения масштаба репозитория, многошаговые вызовы инструментов
  • В заметке есть ещё большой раздел про исследования безопасности, он вне рамок этой страницы, читайте оригинал

Тред релиза на r/LocalLLaMA за несколько часов перевалил за 800 голосов при рейтинге 0.99, и верхние комментарии зацепились за одно: модель класса 743B на равных с куда более крупными. Эта цифра параметров, впрочем, посчитана сообществом, а не опубликована вендором, поэтому как факт мы её не повторяем.

Когда вышла GLM 5.3?

14 августа 2026 года, и в тот же день она дошла до подписчиков GLM Coding Plan.

Раскатка идёт неравномерно, и это стоит знать до того, как пойдёте искать:

ПлощадкаСостояние на 2026-08-15
Релизная заметка Z.aiОпубликована 08-14
GLM Coding Plan / ZCodeДоступна всем подписчикам
Страница модели в документации Z.aiОпубликована, с 1M контекста и 128K вывода
Отдельный API модели«Скоро», дата не объявлена
Таблица цен Z.aiСтроки GLM 5.3 нет, всё ещё заканчивается на GLM 5.2
Каталог OpenRouterЗаписи glm-5.3 нет
Каталоги шлюзов, включая ofoxПока не заведена
Веса на HuggingFaceРепозиторий есть, закрыт

Страница модели появилась через сутки после анонса, и это обычная форма релиза: в первый день источником истины служит релизная заметка, а документация догоняет. Не догнала пока ровно та часть, которая важнее всего для оплаты по токенам.

GLM 5.3 это open source?

Пока нет. Z.ai обязуется опубликовать веса примерно через две недели после релиза, «когда завершатся оценка безопасности и харденинг».

Мы проверили, а не поверили на слово. Репозиторий zai-org/GLM-5.3 на HuggingFace уже существует, и API отдаёт по нему 401, тогда как zai-org/GLM-5.2 отдаёт 200. 401 вместо 404 означает, что репозиторий создан и закрыт, а не отсутствует. Это больше похоже на запланированную публикацию, чем на расплывчатое намерение, но обещание с двухнедельным фитилём остаётся обещанием.

Есть прецедент, по которому можно оценить ожидание. Simon Willison писал 17 июня 2026 года о прошлом цикле: «Китайская AI-лаборатория Z.ai выпустила GLM-5.2 для подписчиков своего coding plan 13 июня, а вчера (16 июня) опубликовала полные открытые веса под лицензией MIT.» Тогда прошло три дня, сейчас заявлены две недели. За лицензией тоже стоит следить: 5.2 вышла под MIT, а про 5.3 Z.ai ничего не сказала.

Если веса нужны прямо на этой неделе, вариант по-прежнему GLM 5.2. Наш гайд по локальному запуску GLM 5.2 разбирает GGUF-кванты и требования каждого, а разбор железа и стоимости самостоятельного хостинга содержит цифры по vLLM. Поскольку 5.3 делит базу с 5.2, объём памяти и форма развёртывания должны перенестись почти без изменений. Это единственное удобство релиза, состоящего только из пост-обучения: планирование мощностей не начинается заново.

Сколько стоит GLM 5.3?

Z.ai ещё не опубликовала цену за токен для GLM 5.3, и отдельный API, к которому эта цена относилась бы, тоже не открыт. Таблица цен в документации для разработчиков на момент этого снимка по-прежнему заканчивается на GLM 5.2.

Что задокументировано сегодня:

ПозицияСтавка
GLM 5.2, ввод (ориентир)$1.40 / 1M токенов
GLM 5.2, кэшированный ввод$0.26 / 1M токенов
GLM 5.2, вывод$4.40 / 1M токенов
GLM Coding PlanКвота в баллах, ввод, кэшированный ввод и вывод считаются отдельно
Скидка вне пика50% от стандартных баллов
Пиковое окно14:00–18:00 UTC+8, с понедельника по пятницу

Из таблицы следуют три вещи. Бесплатного тарифа нет ни на одном маршруте, поэтому самый дешёвый вход, это подписка Coding Plan, а не пробный ключ. Внепиковая ставка покрывает всё вне 20-часового окна в неделю, включая выходные, так что ночной батч по умолчанию считается вполовину, без всяких переговоров. И пока строки 5.3 нет, любой, кто называет вам цену за токен для GLM 5.3, экстраполирует её с 5.2.

Какое окно контекста у GLM 5.3?

1M токенов при задокументированном максимуме вывода 128K. Страница модели GLM-5.3 у Z.ai приводит оба числа, китайская документация Zhipu даёт ту же пару.

При этом собственные замеры Z.ai шли не на этом потолке, и это полезный сигнал о том, где модель реально нагружали:

БенчмаркИспользованный контекстМаксимум вывода
Terminal Bench 3.0400K128K
Terminal Bench 2.1Не указан65 536
DeepSWE v1.1400KНе указан
Agents’ Last Exam (CLI)1M64K
SWE-Marathon, PostTrainBench1M128K
NL2Repo1M64K
HLE with tools300 000, со стратегией управления контекстом163 840

Разброс важен, если вы рассчитывали опереться на полный миллион. 1M, это то, что модель принимает, а 400K, это то, что Z.ai выбрала для своего флагманского кодинг-набора. Эндпоинт, который в итоге будет отдавать 5.3, может опубликовать и более низкий потолок, поэтому рабочим числом считайте его.

Насколько лучше GLM 5.3 в коде?

Сильно на свежих агентных бенчмарках и умеренно на насыщенных. Все цифры ниже принадлежат самой Z.ai. Прогоны Terminal Bench, SWE-Marathon и Agents’ Last Exam шли на харнессе Claude Code 2.1.207 при максимальном reasoning effort, DeepSWE, на mini-swe-agent.

БенчмаркGLM 5.3GLM 5.2Kimi K3Opus 4.8GPT-5.6 Sol
Terminal Bench 3.028.34.617.421.134.6
Terminal Bench 2.188.281.088.385.088.8
DeepSWE v1.166.946.267.558.072.7
SWE-Marathon v1.142.519.448.148.842.5
Agents’ Last Exam (CLI)28.523.827.625.728.6
GDPval-AA v217691508168215881730

Основную работу делает строка Terminal Bench 3.0: с 4.6 до 28.3 на наборе, где GLM 5.2 фактически не участвовала. На Terminal Bench 2.1, где все сидят между 85 и 89, то же обновление стоит 7 пунктов и не меняет ни одной позиции. У новых бенчмарков есть запас, чтобы показать движение, у старых его нет.

Главный аргумент Z.ai, это не балл. На уровне High GLM 5.3 берёт 31.4% на своём внутреннем Code Bench, тратя около 50K токенов вывода на задачу, против 29.5% у Claude Opus 4.8 при 120K.

Именно это заявление стоит проверить самому, потому что платите вы за количество токенов. Z.ai также сообщает 34.5% примерно при 75K токенов на уровне Max, против 23.4% при 96K у GLM 5.2. Claude Fable 5 по-прежнему лидирует в этом закрытом бенчмарке с 39.5%, а GPT-5.6 Sol остаётся первым в Terminal Bench 3.0, так что корректная формулировка, это «SOTA среди открытых», а не «SOTA».

Одно предостережение ко всей таблице: это закрытый бенчмарк плюс публичные, прогнанные вендором. Числа Kimi K3 и Claude Opus 4.8 здесь получены Z.ai, а не их разработчиками.

Нужно ли менять код под GLM 5.3?

Да, если вы когда-либо отключали thinking. thinking.type: "disabled" убран, и Z.ai пишет, что запрос просто упадёт.

Новый контракт:

  • thinking.type принимает только enabled
  • reasoning_effort принимает low, high, max и по умолчанию равен max
  • Для кодинга Z.ai рекомендует max
  • Порядок миграции важен: сначала выставьте enabled вместе с reasoning_effort: "low", и только потом меняйте ID модели
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

Цену потери disabled легко недооценить, поэтому мы измерили её на GLM 5.2 через OpenAI-совместимый эндпоинт 14 августа 2026 года. Один тривиальный промпт, «Reply with the single word: ok», по три прогона на конфигурацию:

Конфигурация запросаТокены вывода (3 прогона)
По умолчанию (thinking включён)144, 138, 90
reasoning_effort: "low"69, 86, 122
reasoning_effort: "max"101, 120, 102
thinking.type: "disabled"2, 2, 2

На таком коротком промпте разброс между прогонами перекрывает разницу между low и max, поэтому не вычитывайте из этих трёх строк порядок. Значение имеет последняя строка. С выключенным мышлением ответ каждый раз укладывался в 2 токена вывода, а самая дешёвая настройка с включённым тратила от 69 до 122. В GLM 5.3 этой строки больше нет.

Если вы гоняете GLM на классификации, маршрутизации, извлечении или любой другой массовой задаче с короткими ответами, посчитайте эту миграцию до перехода: low теперь ваш пол. Расчёты для такого профиля трафика есть в сравнении стоимости GLM 5.2 и GPT-5.5.

Какие возможности поддерживает GLM 5.3?

Текст на входе и выходе, плюс режимы мышления, стриминг, вызов функций, кэш контекста, структурированный вывод и MCP. Страница модели Z.ai перечисляет все шесть, китайская страница Zhipu, тот же набор без MCP.

ВозможностьСостояние
Модальности ввода и выводаТолько текст
Режимы мышленияlow, high, max, отключение недоступно
Стриминг выводаПоддерживается
Вызов функцийПоддерживается
Кэш контекстаПоддерживается
Структурированный выводПоддерживается, включая JSON
MCPУказан на странице модели Z.ai

Относительно GLM 5.2 здесь нет ничего нового, что согласуется с релизом из одного только пост-обучения. Зрение, изображения и аудио остаются на отдельных линейках GLM-5V и GLM-Image.

Как получить доступ к GLM 5.3?

Сегодня через GLM Coding Plan, в ZCode или в любом кодинг-агенте, которому можно указать эндпоинт Z.ai. API с оплатой за токены не открыт.

МаршрутЧто получаетеОговорка
GLM Coding PlanКвота в баллах, 50% вне пикаПодписка, а не оплата по факту
ZCodeРежим Goal, попадание в кэш 98%+, квота ×1.5 до 2026-08-31Собственный клиент Z.ai
Claude Code / Cline / OpenCodeПрежний агент, новая модельРасходует квоту плана, а не тарифицируемый ключ
Отдельный API моделиОплата за токены«Скоро», без даты и без опубликованной цены
Агрегаторы и шлюзыОдин ключ на все моделиНа момент снимка 5.3 не заведена

Zhipu опубликовала эндпоинты, на которые приземлится API, раньше самого API: https://open.bigmodel.cn/api/paas/v4 для протокола OpenAI Chat Completions, /api/v1 для протокола OpenAI Responses и /api/anthropic для протокола Anthropic Messages. В той же заметке есть легко пропускаемая оговорка: аккаунты, когда-либо оформлявшие GLM Coding Plan, включая истёкшие, пока ограничены протоколом Chat Completions.

Всё, что OpenAI-совместимо, меняется в две строки, как только ваш провайдер заведёт модель:

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.io/v1")

r = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
    reasoning_effort="low",   # варианта "disabled" на 5.3 нет
)
print(r.usage)

Запустите это до обновления каталога и получите ожидаемую ошибку. Полезно знать её заранее, чтобы не искать проблему в авторизации:

{"error":{"message":"Model 'z-ai/glm-5.3' not found","type":"model_not_found","code":404}}

z-ai/glm-5.2 на том же эндпоинте отвечает уже сегодня, то есть эндпоинт, ключ и форма запроса у вас уже правильные к моменту появления 5.3. Настройку ключа от начала до конца разбирает наш гайд по доступу к API GLM 5.2.

Как направить кодинг-агента на модель, вышедшую вчера?

Изменением одной строки, если агент позволяет задать эндпоинт самому. Неделя релиза всегда выглядит одинаково. В подписочном продукте модель есть, в тарифицируемом API её нет, страница документации опаздывает на сутки, а каждый ваш инструмент держит захардкоженный список моделей. На 15 августа 2026 года этот разрыв у GLM 5.3 работает в обе стороны: подписчики Coding Plan уже её гоняют, а OpenRouter и каталогам шлюзов нечего продавать, репозиторий на HuggingFace тоже закрыт.

Контролировать вы можете только одно: сколько стоит перекладка труб под новую модель. Агенты, где задаются base_url и строка модели, воспринимают релиз как правку в одну строку. Агенты с фиксированным выпадающим списком заставляют ждать своего цикла выпуска, поэтому тред на r/opencodeCLI появился в течение часа после анонса.

Claude Code, OpenCode и большинство остальных агентов говорят по OpenAI-совместимому HTTP, так что один ключ за одним базовым URL держит их всех на общем биллинге и общем переключении при сбоях. Скидка 15% на пополнение до 2026-08-31 в ofox покрывает каталог примерно из 130 моделей на этом единственном эндпоинте, GLM 5.2 среди них. GLM 5.3 на момент снимка там нет, и когда появится, поменяется ровно тот блок кода выше.

GLM 5.3 против GLM 5.2: что изменилось?

Пост-обучение и три вещи, с которыми придётся что-то делать: нет переключателя выключения мышления, нет скачиваемых весов и балл Terminal Bench 3.0, ушедший с 4.6 на 28.3.

GLM 5.3GLM 5.2
Базовая модельТа жеТа же
Контекст / максимум вывода1M / 128K1M / 128K
ВесаПримерно через две недели после релизаУже публичные
Отключение мышленияНе поддерживаетсяПоддерживается
Уровни effortlow / high / max, по умолчанию maxУровни плюс disabled
Terminal Bench 3.028.34.6
Опубликованная цена за токенПока нет$1.40 / $4.40
Тарифицируемый APIСкороДоступен
В агрегаторахНетДа

Берите GLM 5.2, если в этом месяце нужны скачиваемые веса, опубликованная цена, оплата за токены или возможность отключить мышление ради дешёвых коротких вызовов. Берите GLM 5.3, если работа, это длинный агентный кодинг на подписке Coding Plan, потому что только там разрыв драматичен.

Источники

Часто задаваемые вопросы

Отдельный API GLM 5.3 уже доступен?
Пока нет. На странице модели у Z.ai висит баннер «The GLM-5.3 API is coming soon», китайская документация Zhipu пишет то же самое, и ни там, ни там нет даты. Единственный первичный канал сегодня, это GLM Coding Plan, где модель уже открыта всем подписчикам.
Какой максимальный вывод у GLM 5.3?
128K токенов при окне контекста 1M, оба числа указаны на странице модели Z.ai. Собственные прогоны Z.ai укладываются в этот предел: 128K на Terminal Bench 3.0 и PostTrainBench, 64K на Agents' Last Exam. Эндпоинт, который в итоге будет отдавать модель, может выставить и более низкий потолок.
Можно ли использовать GLM 5.3 с Claude Code?
Да. Z.ai перечисляет Claude Code, Cline и OpenCode среди поддерживаемых инструментов GLM Coding Plan, а собственные бенчмарки прогоняла на харнессе Claude Code 2.1.207. Задавайте reasoning_effort, а не выключайте thinking, модель больше не принимает отключённое мышление.
GLM 5.3 сильнее Kimi K3?
По таблице самой Z.ai она выигрывает Terminal Bench 3.0 со счётом 28.3 против 17.4 и AutomationBench 48.2 против 46.7, тогда как Kimi K3 ведёт в Toolathlon 76.5 против 73.0 и SWE-Marathon 48.1 против 42.5. Все эти числа получены вендором Z.ai, поэтому читайте их как заявление, требующее проверки, а не как независимый результат.
У GLM 5.3 новая базовая модель?
Нет. Z.ai заявляет, что GLM 5.3 использует ту же базовую модель, что и GLM 5.2, и весь прирост даёт пост-обучение. Релизная заметка открывается фразой «Scaling post-training is all we did for GLM-5.3.»
Есть ли бесплатный доступ к GLM 5.3?
Бесплатного тарифа нет. Доступ в день релиза идёт через GLM Coding Plan на баллах или через ZCode. Вызовы вне пикового окна с 14:00 до 18:00 UTC+8 по будням расходуют половину стандартных баллов, и это ближайшее к скидке, что сейчас есть.
Где скачать веса GLM 5.3?
Пока нигде. Репозиторий zai-org/GLM-5.3 на HuggingFace существует, но закрыт и отдаёт 401 через API, тогда как GLM 5.2 отдаёт 200. Z.ai обещает выложить веса примерно через две недели после релиза, когда закончит оценку безопасности и харденинг.