Harness для AI-кодинга 2026: 9 инструментов и выбор модели

Данные OpenRouter по 9 harness: внутри Claude Code чаще всего запускают GLM 5.2 — больше, чем все модели Anthropic вместе. Сначала цикл, потом модель.

Harness для AI-кодинга 2026: 9 инструментов и выбор модели

Коротко: девять harness и один вывод, который переформулирует всю категорию. По данным OpenRouter за 30 дней самая используемая модель внутри Claude Code — это GLM 5.2: 3.14T токенов против 1.98T у четырёх собственных моделей Anthropic вместе взятых. Codex — противоположный случай: около 86% трафика его первой десятки остаётся внутри семейства OpenAI. У Cline и Pi лидирует DeepSeek V4 Flash. Значит, честная версия вопроса «какой harness лучше» — это два вопроса, а не один. Выбирайте harness по управляющему циклу, а модель выбирайте отдельно: везде, где выбор доступен, разработчики уже так и делают.

Коротко: какой harness выбрать

HarnessГде работаетЦенаМожно сменить модельЧем расширяетсяЛицензия
Codex CLIТерминалПлан ChatGPT или API-ключТолько Responses APIAGENTS.md, MCPApache-2.0
Claude CodeТерминалПлан Claude или API-ключДа, ANTHROPIC_BASE_URLHooks, субагенты, skills, MCPПроприетарная
Google AntigravityДесктоп, IDE, CLIБесплатный тариф для разработчиковНет, только встроенное менюМенеджер агентов, субагентыПроприетарная
GitHub CopilotIDE, CLI, облако$0 / $10 / $39 / $100 в AI CreditsТолько чат, через расширениеSkills, MCPПроприетарная
CursorIDEПодпискаТолько чат, и ненадёжноRules, MCPПроприетарная
ClineVS Code, JetBrainsСвой ключДа, любой эндпоинт OpenAI или AnthropicРежим plan, MCPApache-2.0
OpenCodeТерминал, десктопСвой ключДа, любой провайдер с models.devAGENTS.md, MCPMIT
ReasonixТерминал, десктоп, VS CodeСвой ключДа, reasonix.tomlMCP, sidecar, режим plan, чекпойнтыMIT
PiТерминал, RPC, SDKСвой ключДа, 15+ провайдеров, прямо в сессииAPI расширений, и почти ничего большеMIT

Двое из девяти вообще не умеют смотреть на внешнюю модель в основном агентском режиме. Ещё трое умеют, но с оговорками, которые важны. Оставшиеся четверо относятся к модели как к строке конфига. Именно это разделение предсказывает ваш счёт и степень привязки лучше, чем любой бенчмарк в этой статье.

Что такое harness для AI-агента кодинга

Harness — это программа вокруг модели, которая превращает генерацию токенов в работу с вашим репозиторием. Модель — двигатель. Harness — коробка передач, шасси и тормоза.

Конкретно harness берёт на себя пять задач, которые модель сама не решает. Он собирает контекст, решая, какие файлы и предыдущие ходы отправятся в запрос. Он определяет и выполняет инструменты, чтобы вызов read_file действительно прочитал файл. Он контролирует права, чтобы rm -rf либо выполнился, либо запросил подтверждение, либо был отклонён. Он управляет восстановлением, решая, что делать, когда патч не накладывается или тест краснеет. И он хранит состояние сессии, чтобы прерванный прогон можно было продолжить, а не начинать с нуля.

Поэтому два разработчика с одной и той же моделью описывают совершенно разный опыт. Перенесите GPT-5.6 Sol из Codex в Cline: модель та же, но стратегия чтения файлов, схема инструментов, политика повторов и порядок подтверждений меняются целиком. Люди ищут этот слой под разными названиями (agent harness, агент кодинга, AI-инструмент для кода), но речь об одном и том же.

Чем harness реально отличаются друг от друга

Осей четыре, и только четвёртую нельзя разглядеть до того, как вы вложитесь.

Где работает. Терминал в первую очередь (Codex, Claude Code, OpenCode, Reasonix, Pi), внутри редактора (Cline, Cursor, Copilot) либо как отдельный менеджер агентов со своим окном (Antigravity 2.0). От этого зависит, сможете ли вы поставить его в пайп, в cron или запустить по SSH.

Ваш ли выбор модели. Самая чёткая дихотомия в категории. Либо инструмент читает base URL из конфига, либо меню моделей принадлежит вендору, и на этом разговор закончен.

Чем расширяется. Hooks, субагенты, skills и MCP-серверы против намеренно голого цикла, на котором вы строите сами. Claude Code и Pi специально стоят на разных полюсах.

Как управляющий цикл ведёт себя под нагрузкой. Именно это решает, останетесь ли вы с инструментом. Читает ли он нужные файлы перед правкой, держит ли диф узким, запускает ли ваши проверки, выбирается ли из упавшего теста без метаний, продолжает ли работу после прерывания? Длинная ветка r/AI_Agents о выборе harness от июля 2026 сошлась ровно на этом, и верхний комментарий сформулировал лучше, чем смогли бы мы:

Люди часто переоценивают модель и недооценивают цикл исполнения.

В этой рамке написана и статья. Качество модели сегодня — входной билет. Отличает поведение цикла, и это же ровно то, чего не показывает ни один бенчмарк.

Как мы проверяли цикл

Раз утверждение про цикл, значит цикл надо запустить. Мы собрали маленький Python-репозиторий с настоящим багом: функция повторов ловит urllib.error.HTTPError, тогда как OpenAI SDK бросает openai.RateLimitError, поэтому ветка 429 никогда не срабатывает и тест падает. Шесть из девяти инструментов (Codex CLI, Claude Code, Cline, OpenCode, Reasonix и Pi) были направлены на один и тот же шлюз и получили идентичный промпт в идентичном репозитории: запусти тест, назови первопричину одной строкой, покажи исправление в виде unified diff, ничего не редактируй.

Все шесть назвали первопричину верно — это наименее интересный результат, поэтому он идёт первым. Различия начались ниже. Codex CLI, OpenCode и Cline запустили тест до ответа; Claude Code, Reasonix и Pi ответили, прочитав код. Про ненужный import urllib.error, остающийся после исправления, Codex сказал прямо в тексте, Claude Code молча убрал его в дифе, остальные четверо оставили как есть. И четверо из шести выдали патч, в котором всё ещё стоит проверка if e.code != 429. Трое выписали её явно, один оставил нетронутой, изменив только строку except. Как только вы ловите openai.RateLimitError, эта проверка не может пройти никогда: её .code — это строковый код ошибки от API, а не HTTP-статус (статус лежит в .status_code), поэтому e.code != 429 всегда истинно, и ветка повтора недостижима.

Последнее — скорее артефакт модели, чем harness, и в этом вся суть: именно harness решает, проверит ли цикл собственный патч, и ни один из этих шести не проверил.

Три инструмента так прогнать не вышло. Copilot и Cursor требуют платного места, чтобы добраться до агентского режима со своим провайдером, а Antigravity не станет разговаривать без входа в Google. Их разделы ниже опираются на документацию вендора и вывод первоисточного CLI, а не на равноценный прогон, и это в них указано.

Какую модель разработчики реально запускают в каждом harness

Большинство обзоров говорят, какой инструмент купить, и на этом останавливаются. Более полезный вопрос, который люди и вправду ищут: какую модель в этот инструмент поставить. OpenRouter публикует использование моделей по приложениям, включившим отслеживание, и это превращает вопрос из мнения в данные.

Вот картина за 30 дней на 2026-08-11 из публичных страниц приложений OpenRouter.

HarnessТокены (30 дн.)Моделей использованоМодель №1№2№3Доля лидера в его первой десятке
Claude Code7.97T302GLM 5.2 3.14TClaude Opus 4.8 582BClaude Sonnet 5 558B49%
Cline3.86T314DeepSeek V4 Flash 1.26TStep 3.7 Flash 812BLaguna M.1 370B37%
Pi2.79T298DeepSeek V4 Flash 406BDeepSeek V4 Flash 0423 299BGLM 5.2 289B20%
Codex1.01T348GPT-5.6 Sol 321BGPT-5.6 Luna 177BDeepSeek V4 Flash 108B35%

Прочитайте последний столбец сверху вниз — получится тест на характер для каждого инструмента.

Claude Code самый концентрированный, и сконцентрирован он на чужой модели. Один только GLM 5.2 даёт 49% трафика его первой десятки. Сложите Opus 4.8, Sonnet 5, Opus 5 и Fable 5 — собственная линейка Anthropic наберёт 1.98T, которые GLM 5.2 в одиночку перекрывает примерно в 1.6 раза. Kimi K3 и обе сборки DeepSeek V4 Flash тоже попадают в десятку. Harness, чей цикл ценят выше всех, для этой аудитории работает в основном как шасси под не-Anthropic двигатели.

Codex — монокультура. Семь позиций из первой десятки занимают модели OpenAI, вместе они берут около 86% объёма десятки. Три чужака (DeepSeek V4 Flash, Nemotron 3 Ultra, GLM 5.2) делят оставшиеся 14%. Вот как ограничение «только Responses» выглядит в агрегате: это не стена, а фильтр, и большинство просто не берётся его перелезать.

Cline с самого начала оптимизирован по цене. DeepSeek V4 Flash лидирует с 1.26T, Step 3.7 Flash идёт следом с 812B, а первая модель Anthropic появляется лишь на десятом месте с 87.7B, это около 2.6% десятки. Пользователи Cline оптимизируют стоимость задачи, а не позицию в лидерборде.

У Pi самое ровное распределение из четырёх измеренных. Лидер берёт 20%, а первая десятка охватывает DeepSeek, Zhipu, Moonshot, Anthropic, OpenAI, xAI и Nvidia. Для инструмента с лозунгом «примитивы, а не функции» характер использования полностью совпадает с заявкой.

Что эти данные не покрывают, и не позволяйте убеждать вас в обратном. OpenRouter видит только трафик, прошедший через OpenRouter из приложений, включивших отслеживание. Все, кто запускает Claude Code по подписке Anthropic, Codex по плану ChatGPT, Copilot на собственном инференсе GitHub или Cursor на моделях Cursor, здесь невидимы. Так что это не доля рынка. Это нечто более узкое и, для читателя сравнения harness, более полезное: это то, что разработчики выбирают, когда выбор действительно принадлежит им. Обратите внимание и на тех, кого нет совсем. У Antigravity, GitHub Copilot, OpenCode и Reasonix в этом наборе данных нет записи, причём по двум разным причинам, которые проясняют разделы ниже.

Короткая версия, от модели

Если вы пришли сюда искать harness под конкретную модель, а не наоборот:

У вас уже естьНачните сПочему
GLM 5.2Claude Code, затем OpenCodeМодель говорит на Anthropic Messages API, поэтому вся настройка — подмена base URL, и она уже самая запускаемая в этом harness. Если вы взвешиваете хостинг против самостоятельного развёртывания весов, расчёт по железу — отдельная задача от выбора harness
DeepSeek V4 FlashReasonix, затем ClineReasonix строит цикл вокруг префиксного кэша DeepSeek; в Cline у этой модели уже наибольший объём
DeepSeek V4 ProOpenCode, затем PiОба позволяют оставить Flash по умолчанию и повышать класс модели под конкретную задачу
Kimi K3Claude CodeAnthropic-совместимый эндпоинт, и модель уже входит в первую десятку Claude Code
Qwen 3.8 MaxCodex CLIОдна из немногих не-OpenAI моделей, доступных по Responses API, а именно его Codex и требует
MiniMax M3Cline, затем OpenCodeОбычный OpenAI-совместимый Chat Completions, без протокольной акробатики
GPT-5.6 SolCodex CLIНастройки по умолчанию от первоисточника, и предпосылки тюнинга совпадают

Codex CLI: агент OpenAI и протокол, который его определяет

Где работает

Только терминал, Rust-бинарник из npm i -g @openai/codex, плюс отдельное десктопное приложение сбоку. Конфигурация живёт в ~/.codex/config.toml, инструкции проекта — в AGENTS.md. За последние 30 дней он занял #15 в глобальном рейтинге приложений OpenRouter и #8 среди агентов кодинга, что меньше, чем подсказывает его известность: большинство пользователей Codex никогда не выходят за пределы плана ChatGPT.

Codex CLI 0.147.0 работает со сторонним шлюзом при wire_api = responses: видно блок провайдера в config.toml, заголовок сессии с моделью bailian/qwen3.8-max и провайдером ofox, а также агент, который запускает pytest и затем называет несовпадение типов исключений в retry.py

Сколько стоит

Входит в подписку ChatGPT либо оплачивается по факту через API-ключ. Именно из-за этой связки его след в OpenRouter выглядит меньше реального.

Чем расширяется

AGENTS.md, MCP-серверы и команда импорта, которая переносит конфигурацию Claude Code и Cursor. Песочница здесь самая сильная в обзоре: изоляция на уровне ОС через seatbelt на macOS и Landlock вместе с seccomp на Linux, поверх которых накладываются режимы подтверждения. Если вы автоматически разрешаете shell-команды, эта разница стоит реальных денег.

К чему привязывает

К протоколу, а не к вендору. Codex говорит только на OpenAI Responses API; wire_api = chat удалён, и текущие сборки отказываются стартовать с ним. Значит, шлюз обязан отдавать /v1/responses, а не только /v1/chat/completions, и поддержка считается по модели, а не по шлюзу. Две детали спотыкают людей раз за разом: префикс идентификатора модели действует только внутри собственной записи model_providers, а наличие модели в каталоге шлюза не означает, что она доступна по Responses. Детали настройки — в руководстве по интеграции Codex у ofox и на странице провайдера моделей.

Фразу «по модели, а не по шлюзу» легко принять на веру и трудно представить, поэтому вот как это выглядело у нас. Codex 0.147.0 с корректным блоком провайдера возвращал Invalid 'input[0].tools[0].description': empty string на каждый запрос. Мы поставили перед шлюзом логирующий обратный прокси и прочитали тело, которое Codex отправляет на самом деле: он объявляет пространства имён инструментов в сообщении developer, и пространство functions уходит с description: "". Повторите это же тело на пяти моделях: три отклоняют, у одной вообще нет провайдера Responses, одна проходит. Заполните эту единственную пустую строку — и ранее падавшая модель возвращает 200. Виноват был ни шлюз, ни мы. Клиент отправляет поле, которое одни апстримы валидируют как minLength: 1, а другие игнорируют.

Терминал показывает тело запроса, которое реально отправляет Codex CLI 0.147: пространство имён functions несёт пустую строку description. Ниже — матрица повторов того же тела на пяти моделях: gpt-5.6-sol, gpt-5.5 и deepseek-v4-flash возвращают 400, glm-5.2 отдаёт 503 без провайдера Responses, qwen3.8-max возвращает 200, а после заполнения пустого description gpt-5.6-sol тоже даёт 200

Практический вывод стоит унести в любой harness: когда клиент и шлюз расходятся, сначала снимите реальный формат на проводе, а уже потом меняйте конфиг. Нам это стоило одного прокси и пяти минут; перебор значений wire_api наугад съел бы полдня и привёл к неверному выводу.

Claude Code: самая глубокая поверхность расширения, а внутри в основном чужие модели

Где работает

Терминал, установка через npm, экосистема плагинов и мост к IDE. Он на #2 в глобальном рейтинге приложений OpenRouter: 7.97T токенов и 302 различные модели.

Сколько стоит

Подписка Claude, оплата по API или сторонний шлюз. Три пути различаются настолько, что у вопроса «сколько стоит Claude Code» нет единственного ответа.

Чем расширяется

Больше, чем что-либо ещё здесь. Hooks срабатывают на события инструментов, субагенты выполняют ограниченные задачи в собственном контексте, skills упаковывают повторно используемые процедуры, MCP-серверы добавляют инструменты, а CLAUDE.md несёт инструкции проекта. Если вы хотите, чтобы harness кодировал процесс команды, а не ваши личные привычки, поддержит это именно он.

К чему привязывает

Меньше, чем следует из названия. ANTHROPIC_BASE_URL и ANTHROPIC_AUTH_TOKEN перенаправляют его на любой эндпоинт, говорящий на Anthropic Messages API, поэтому GLM 5.2, Kimi K3 и DeepSeek и появляются в его статистике. Две переменные окружения — вся процедура:

Claude Code 2.1.220 с ANTHROPIC_BASE_URL, направленным на сторонний Anthropic-совместимый эндпоинт, работает на z-ai/glm-5.2 и возвращает корректный диагноз первопричины вместе с unified diff для бага в повторах

Обратите внимание, что переносится, а что нет. GLM 5.2 правильно назвала несовпадение типов исключений, но её патч сохраняет проверку if e.code != 429, которая не может пройти никогда: у openai.RateLimitError поле .code — строковый код ошибки, а не HTTP-статус. Тот же harness, тот же промпт, другая модель — и диф едва заметно хуже. Настоящая привязка здесь поведенческая: системный промпт, схема инструментов и стратегия контекста настроены под модели Claude, поэтому подставленная модель наследует предпосылки, сделанные для кого-то другого. Точные переменные смотрите в руководстве по интеграции Claude Code у ofox и на странице провайдера моделей. Если вы движетесь в обратную сторону, у нас есть пошаговая миграция с Claude Code на Codex.

Google Antigravity: один бренд, четыре поверхности

Где работает

Повсюду, и это как раз запутывает. Antigravity теперь поставляется как четыре отдельные вещи: Antigravity 2.0, десктопный командный центр для параллельного запуска нескольких локальных агентов; Antigravity CLI, терминальная поверхность; Antigravity IDE, полноценный редактор; и SDK для написания собственных агентов. Продукт стартовал в ноябре 2025 года как agent-first IDE и с тех пор расширялся наружу.

Часть публикаций сообщила, что Gemini CLI закрывают и заменяют на Antigravity CLI. Мы искали первоисточник и не нашли. На 2026-08-11 это утверждение не подтверждено. Репозиторий google-gemini/gemini-cli не заархивирован, не содержит уведомления об устаревании и продолжает публиковаться по каналам preview, stable и nightly. Ни antigravity.google, ни Google Developers Blog этого не заявляют. Считайте их сосуществующими, пока Google не скажет иное.

Сколько стоит

На момент написания бесплатно для индивидуальных разработчиков, есть платный организационный тариф и более высокие лимиты на старших AI-подписках Google. Вы покупаете квоту, а не токены.

Чем расширяется

Менеджер 2.0 запускает несколько агентов одновременно и позволяет главному агенту порождать временных субагентов, чтобы параллельная работа не засоряла основной контекст. Встроенный браузер даёт возможность проверять изменения интерфейса визуально, а не утверждениями.

К чему привязывает

К меню моделей. Antigravity открывает собственные модели Google плюс отобранный набор сторонних вариантов, и никакого base URL для перенаправления нет. Записи в данных приложений OpenRouter у него нет, потому что маршрутизировать нечего. Если вы уже стандартизировались на шлюзе, Antigravity — тот инструмент обзора, который к вам не присоединится.

Убедиться можно по одному только списку флагов. Мы установили CLI (brew install --cask antigravity-cli, версия 1.1.12), и во всём перечне опций нет ни --base-url, ни --provider, ни --api-key. Просьба показать модели выдаёт не список, а стену входа.

Вывод help у Antigravity CLI 1.1.12: полный список флагов без опций base-url, provider и api-key, а следом agy models возвращает «Please sign in to view available models»

Эта стена входа и делает Antigravity единственным здесь инструментом, у которого вовсе нет пути «только по ключу». Copilot и Cursor не попали в прогон с падающим тестом потому, что агентский режим со своим провайдером стоит за платным местом, но место можно купить и войти. Antigravity требует аккаунт Google, прежде чем вообще начнёт разговаривать, и никакая оплата это не меняет.

GitHub Copilot: вариант по умолчанию, который есть у всех, с оплатой кредитами

Где работает

Везде, куда дотягивается GitHub: VS Code и другие IDE, Copilot CLI в терминале, облачный агент кодинга, открывающий пул-реквесты, и код-ревью внутри самого GitHub. Широта охвата и есть продукт.

Сколько стоит

Здесь всё изменилось, и многие тексты об этом устарели. Оплата теперь идёт через GitHub AI Credits, где 1 кредит равен $0.01. Free — $0, Pro — $10 в месяц с $15 кредитов внутри, Pro+ — $39 с $70, Max — $100 с $200, места Business и Enterprise тарифицируются отдельно. Инлайн-дополнения и подсказки next-edit кредиты не расходуют вовсе; чат, агентский режим, код-ревью и Copilot CLI расходуют. Свежие записи в чейнджлоге добавляют видимость кредитов по циклам и лимиты сессии, задаваемые внутри CLI и SDK. Страницы с ценами меняются, поэтому перед планированием бюджета сверьтесь с актуальной страницей тарифов.

Чем расширяется

MCP-серверы, пользовательские инструкции и настройки уровня репозитория, плюс автоматический выбор модели в CLI, маршрутизирующий по типу задачи.

К чему привязывает

К меню моделей, с одной оговоркой. Собственные поверхности Copilot работают на моделях Copilot. Внешний эндпоинт достижим только через стороннее расширение VS Code, только в Copilot Chat и только на индивидуальной подписке; места Business и Enterprise им пользоваться не могут, а Tab-дополнение в любом случае продолжает работать на модели GitHub. Руководство по интеграции Copilot у ofox описывает этот путь вплоть до конкретных полей провайдера и честно говорит, где он заканчивается.

Cursor: очень хороший редактор с заваренным капотом

Где работает

Как отдельный редактор. Это самый распространённый платный инструмент обзора, но в рейтинге агентов кодинга OpenRouter он на #11 с 471B токенов за 30 дней — примерно одна семнадцатая объёма Claude Code на той же платформе. Этот разрыв не упрёк, а суть: инференс у Cursor свой, поэтому наружу почти ничего не выходит.

Сколько стоит

Подписка за место плюс тарифные ступени по объёму использования.

Чем расширяется

Файлы rules, MCP-серверы и сильный цикл редактирования нескольких файлов. Его модель Tab — та функция, которую чаще всего называют незаменимой, и это реальная причина оставить редактор, даже если агентская работа идёт в другом месте.

К чему привязывает

Сильнее любого другого инструмента здесь, и наша собственная документация говорит об этом прямо. Страница Cursor у ofox озаглавлена как уведомление о совместимости, а не руководство по настройке: Tab-дополнение жёстко привязано к моделям Cursor и не заменяется, агентский режим со своим провайдером недоступен, аккаунты бесплатного тарифа вообще не могут использовать свои модели, а даже работающий путь через чат перекрывается режимом Auto. Рекомендация, к которой приходит документ, совпадает с той, до которой опытные пользователи доходят сами: оставить Cursor редактором, а Claude Code или Codex CLI запускать в его встроенном терминале. Это не столько обходной путь, сколько точное описание того, как эти два слоя стоит разделить.

Cline: цикл, оптимизированный по бюджету

Где работает

Как расширение внутри VS Code и JetBrains. Он на #4 в глобальном рейтинге OpenRouter и на #2 среди расширений IDE, работает с октября 2024 года, что делает его старейшей записью в данных приложений OpenRouter среди инструментов обзора.

Сколько стоит

Расширение бесплатно. Ключ ваш, и данные использования показывают, что пользователи выбирают этот ключ с оглядкой на стоимость.

Чем расширяется

Разделение на планирование и исполнение, доска задач для параллельной работы, MCP-серверы и автоматизация браузера для проверки фронтенд-изменений. Поверхность планирования здесь заметно сильнее, чем у большинства терминальных агентов.

Набор провайдеров — самый широкий с большим отрывом: 185 провайдеров в списке, причём «OpenAI Compatible» стоит полноправным пунктом, а не запасным выходом, закопанным в расширенных настройках.

Экран Model Providers в Cline со списком из 185 доступных провайдеров, из которых включены два, включая Cline Usage-Billing, OpenRouter, AWS Bedrock, LiteLLM и включённый пользовательский пункт OpenAI Compatible

К чему привязывает

Почти ни к чему. Подходит любой OpenAI-совместимый или Anthropic-совместимый эндпоинт, и именно так DeepSeek V4 Flash набрал 37% трафика первой десятки. Направить его на шлюз — одна команда cline auth, после чего цикл ведёт себя так же, как на ключе первоисточника:

Cline CLI 3.0.52, настроенный на OpenAI-совместимый шлюз с моделью deepseek/deepseek-v4-flash: видно, как он запускает pytest и читает retry.py, прежде чем вернуть первопричину и unified diff

Чаще всего пользователи жалуются не на привязку, а на надёжность цикла: в ветке r/AI_Agents один человек описал зависания задач на некорректно сформированных вызовах инструментов и перешёл на форк, который обрабатывает их аккуратнее. Это единичный отзыв, и вес у него соответствующий, но он указывает на верную ось — цикл, а не модель. Мы и сами наткнулись на соседнюю шероховатость: при направлении CLI на модель Claude с рассуждениями по OpenAI-совместимому пути возникала внутренняя ошибка text part ... _reasoning_0 not found, тогда как модели без рассуждений на том же эндпоинте отрабатывали чисто. Настройка описана в руководстве по интеграции Cline у ofox.

OpenCode: не зависит от модели по построению

Где работает

В первую очередь терминал, плюс десктопное приложение и поверхности редактора; ставится из npm как opencode-ai, лицензия MIT, инструкции проекта — AGENTS.md. В рейтингах приложений OpenRouter он не появляется, и это отражает добровольность отслеживания, а не отсутствие пользователей.

Сколько стоит

Бесплатно и с открытым кодом. Вы платите только за токены.

Чем расширяется

AGENTS.md, MCP-серверы и слой провайдеров, который дотягивается до каждого провайдера из списка models.dev — 183 на момент нашей проверки 2026-08-11, с переключением прямо в сессии. ofox поставляется как встроенный провайдер, поэтому настройка сводится к переменной окружения, а не к блоку JSON.

К чему привязывает

Структурно ни к чему, в этом весь замысел. На той же задаче с падающим тестом именно он показал свою работу полнее всех: запустил набор тестов, напечатал трассировку, а затем прочитал исходник и только потом ответил.

opencode 1.18.9 запускает deepseek/deepseek-v4-flash через пользовательский блок провайдера: видно выполнение pytest, полную трассировку RateLimitError, затем чтение retry.py и указание на несовпадение типов исключений

Расплата в том, что у harness без вендора по умолчанию нет и вендора, который настраивает промпты за вас, поэтому выжать из него максимум стоит большей конфигурации, чем требуют Claude Code или Codex. Настройка провайдера описана в руководстве по интеграции OpenCode у ofox, а два терминальных агента мы сравнили лоб в лоб в материале OpenCode против Codex CLI.

Reasonix: сделан сообществом, настроен под DeepSeek, кэш прежде всего

Где работает

Четыре места на одном локальном движке: CLI и TUI, десктопное приложение, браузерная поверхность и расширение VS Code, которое общается с тем же бэкендом по ACP. Поставляется одним статическим Go-бинарником с CGO_ENABLED=0, ставится через npm i -g reasonix на любой ОС или brew install esengine/reasonix/reasonix на macOS. Версия 1.23.0 вышла 2026-08-10, то есть проект активно поддерживается.

Сначала нужно поправить название. Reasonix не является продуктом DeepSeek. Это проект сообщества по адресу github.com/esengine/DeepSeek-Reasonix, лицензия MIT, собственный сайт reasonix.io. Официальная документация DeepSeek перечисляет как задокументированные интеграции Claude Code, GitHub Copilot и OpenCode и Reasonix не упоминает. Сторонний сайт, на котором опубликована большая часть материалов о нём, сам указывает на странице, что он независим и не аффилирован. Инструмент настоящий и интересный, но брендинг DeepSeek на нём неофициальный.

Сколько стоит

Бесплатно и с открытым кодом, плюс стоимость вашей модели. Цель конструкции в том, чтобы второе число оставалось маленьким.

Чем расширяется

MCP-серверы приносят инструменты и промпты, а sidecar по Extension Protocol v1 идут дальше: перехватывают события рантайма, добавляют провайдеров и поставляют версионируемые пакеты плагинов. Всё объявляется в одном reasonix.toml, без захардкоженных моделей. Здесь же есть вся защитная обвязка, которая нужна для долгого автономного прогона и которую Pi намеренно опускает: режим plan, слой разрешений, песочница рабочей области и чекпойнты на каждом ходу, которые можно прочитать и откатить. Одну возможность больше не предлагает никто: запускать модель-исполнителя и модель-планировщика вместе в отдельных сессиях со стабильным кэшем.

К чему привязывает

На уровне протокола ни к чему: любой OpenAI-совместимый эндпоинт — одна запись в конфиге, и reasonix.toml этим и исчерпывается:

Reasonix 1.23.0 настроен одним блоком провайдера в reasonix.toml на OpenAI-совместимый шлюз и возвращает первопричину одной строкой и unified diff из двух строк для бага в повторах

Интересное смещение — в самом цикле, который спроектирован вокруг поведения префиксного кэша DeepSeek, чтобы долгая сессия продолжала попадать в кэш вместо повторной оплаты контекста. Это реальное отличие, если вы оставляете агента работать часами, и почти безразличное, если работаете короткими рывками. И поскольку кэш DeepSeek совпадает по целым блокам, а не побайтно по префиксу, экономия приходит позже, чем ожидают; планируйте по форме своей работы, а не по заявленной доле попаданий в кэш.

Pi: harness, который намеренно почти ничего не поставляет

Где работает

Терминал, а также вывод print/JSON, RPC-сервис и встраиваемый SDK. Установка npm i -g @earendil-works/pi-coding-agent; версия 0.84.1 вышла 2026-08-07. Он на #7 в глобальном рейтинге приложений OpenRouter с 2.79T токенов, лицензия MIT.

Сколько стоит

Бесплатно и с открытым кодом.

Чем расширяется

API расширений, и намеренно почти ничем больше. Pi поставляется без MCP, без субагентов и без режима plan и описывает это как выбор, а не пробел в дорожной карте: примитивы, а не функции. Если эти возможности нужны, вы строите их на поверхности расширений. Командам, у которых уже есть мнение о том, как должен вести себя их агент, стартовать с голого цикла быстрее, чем бороться с чужими умолчаниями. Всем остальным это добавляет работы в первый день.

К чему привязывает

Ни к чему, и данные использования это подтверждают: 15+ провайдеров, переключение модели прямо в сессии через /model и самое ровное распределение среди измеренных инструментов — 20% у лидера. Добавить провайдера значит вписать блок в ~/.pi/agent/models.json, и всё:

pi 0.84.1 с пользовательским провайдером, объявленным в models.json, работает через OpenAI-совместимый шлюз на deepseek/deepseek-v4-flash и возвращает первопричину вместе с unified diff Одну оговорку стоит выделить, тем более что проект сам её открыто документирует: у Pi нет встроенной системы разрешений для файловой системы, процессов, сети и учётных данных, так что песочница — ваша забота. Запускайте в контейнере, если доверяете ему что-то чувствительное. В ветке r/AI_Agents есть и отзыв о том, что Pi заметно щедрее расходует токены на сопоставимой работе, чем конкурирующий harness, и это согласуется с дизайном, оставляющим стратегию контекста на вас.

Другие AI-агенты кодинга, о которых стоит знать

Эти не получили отдельных разделов либо потому, что занимают более узкую нишу, либо потому, что мы не смогли провести их через тот же практический прогон.

ИнструментФормаЧем примечателенДокументация ofox
Kilo CodeVS Code, JetBrains, CLI#3 среди агентов кодинга на OpenRouter, впереди ClineНет
Roo CodeРасширение VS CodeНесколько специализированных ролей агента в одном рабочем пространствеНет
AiderТерминалКарты репозитория: сжатый структурный обзор кодовой базы отправляется перед каждой правкой и снижает число правок не в том файлеЧерез прочие
ZedРедакторБыстрый нативный редактор с панелью агента; #14 в рейтинге кодингаДа
OpenHandsТерминал, облакоОткрытый автономный агент с доступом к браузеру и APIНет
gooseТерминалОткрытый агент от Block, построен на расширенияхНет
Qwen CodeТерминалCLI-инструмент рабочих процессов от AlibabaНет
CrushТерминалTUI-агент от Charm, сильная терминальная эргономикаНет
OpenClawЧерез мессенджерыВыполняет команды из чат-приложений; #5 среди агентов кодинга по объёмуДа
Windsurf / Devin / FactoryIDE и облакоКоммерческие автономные агенты, доступ по подпискеНет

Antigravity и GitHub Copilot — это одно и то же?

Ровно этот вопрос задали в ветке r/AI_Agents, увидев, как один и тот же человек высоко оценивает Antigravity и низко Copilot. Возражение справедливое, а ответ поучителен, потому что внешне это действительно одна категория: инструмент крупного вендора, отобранное меню моделей и подписка вместо счёта за токены.

Расходятся они в том, как крутится счётчик. Copilot списывает с кредитного баланса, который агентская работа уменьшает, поэтому тяжёлые сессии на дорогой модели быстро исчерпывают месячную квоту: пользователь в той ветке рассказал, как коллега израсходовал $30 бюджета за пять дней. Antigravity считает иначе, привязывая потолки использования к уровню тарифа, а не к балансу за запрос, и ощущение меняется с «смотреть, как пустеет кошелёк» на «упереться в стену и ждать». Универсально лучшего варианта нет. Если работа идёт всплесками, кредитный пул, сгорающий каждый месяц без переноса, расточителен; если она ровная и тяжёлая, фиксированный потолок предсказуемее.

Второе различие — проверка. Antigravity поставляется с браузером, которым управляет сам, поэтому фронтенд-изменения проверяются визуально внутри цикла. Сила Copilot на противоположном конце: он встроен в пул-реквесты, код-ревью и CI, то есть туда, где код приземляется, а не туда, где он пишется.

Какие harness работают удалённо или асинхронно

На сервер можно поставить те инструменты, что изначально терминальные. Codex CLI, Claude Code, OpenCode, Reasonix и Pi работают headless по SSH, а Pi заходит дальше всех, предлагая режимы print/JSON, RPC и SDK, созданные именно для этого. Cursor привязан к запущенному редактору. Copilot ушёл дальше всех в другую сторону: облачный агент принимает issue и возвращает пул-реквест, не задействуя вашу машину. Antigravity 2.0 запускает несколько агентов параллельно, но это локальные агенты в локальном окне.

Сюрприз в этой колонке — Cline. Расширению нужен редактор, а CLI нет: он поднимает локальный демон-хаб и браузерную панель, которая отслеживает подключённых клиентов и запущенные сессии, что делает его пригодным на машине, куда вы зашли по SSH.

Панель Cline Hub в браузере: два подключённых клиента, одна активная сессия с моделью deepseek-v4-flash по openai-compatible на локальном рабочем каталоге и лента последних событий

Если цель — долгая автономная работа, список короткий: терминальный harness плюс модель со стабильным кэшированием, то есть ровно та ниша, под которую создавался Reasonix.

Сколько на самом деле стоит месяц агентского кодинга

Самая содержательная цифра, найденная нами в этом месяце, пришла от пользователя, а не от вендора. В ветке r/AI_Agents разработчик, ведущий четыре проекта, выложил свою панель DeepSeek: примерно 1.2 миллиарда токенов за месяц, подавляющая часть — чтения из кэша, на сумму $9.57. Относитесь к этому как к отчёту одного человека, а не как к бенчмарку, но форма показательна. Расходы были низкими не потому, что harness дешёвый, а потому, что почти весь контекст отдавался из кэша.

Это переформулирует вопрос стоимости. Harness почти не двигает ваш счёт напрямую. Он двигает долю попаданий в кэш — через то, как собирает контекст между ходами, и объём токенов — через то, как часто перечитывает файлы или повторяет упавший шаг. Harness, который каждый ход пересобирает промпт с нуля, обойдётся в разы дороже того, который дописывает, на одной и той же модели. Поэтому сравнение стоимости задачи между инструментами почти бессмысленно, если модель, репозиторий и задача не зафиксированы одновременно.

Подписочные инструменты обходят вопрос, пряча его. С Copilot или Antigravity вы вообще не видите стоимость задачи, только скорость, с которой убывает квота. Это настоящее преимущество для планирования бюджета и настоящий недостаток для оптимизации.

Когда какой инструмент уместен

Каждый инструмент здесь где-то выигрывает. По порядку:

  • Codex CLI, когда вы живёте в стеке OpenAI и автоматически разрешаете shell-команды. Это единственный инструмент здесь, в кодовой базе которого видны примитивы изоляции уровня ОС: seatbelt на macOS, Landlock и seccomp на Linux.
  • Claude Code, когда вы хотите закодировать в harness процесс команды. Столько встроенных точек расширения не открывает никто другой.
  • Antigravity, когда нужно несколько агентов параллельно с визуальной проверкой и без тревоги за каждый токен.
  • GitHub Copilot, когда работа происходит в пул-реквестах и ревью, а не в сессии редактора, и когда у всех в команде уже есть место.
  • Cursor, когда скорость редактирования важнее всего. Модели Tab здесь ничто не ровня; просто планируйте запускать агентскую работу в его терминале.
  • Cline, когда нужна дисциплина «сначала план, потом действие» внутри IDE с дешёвой моделью позади.
  • OpenCode, когда свобода выбора модели обязательна и вы готовы настраивать.
  • Reasonix, когда сессии идут часами и экономика кэша доминирует в счёте.
  • Pi, когда у вас есть твёрдое мнение о цикле и нужен фундамент, а не готовый продукт.

Можно ли использовать несколько сразу

Можно, и разработчики с наибольшим опытом в основном так и делают. Ветка r/AI_Agents читается не как поиск единственного победителя, а как описание портфеля: редактор для быстрых правок, IDE-агент для локального контекста, терминальный агент для многофайловой работы с тестами. Один комментатор советовал держать эти три полосы явно раздельными и проверять любой новый инструмент на одних и тех же трёх задачах — исправление бага, небольшая фича и рефакторинг с тестами, — оставляя тот, что дал самый компактный чистый диф с наименьшим числом ручных подталкиваний.

Это лучший протокол оценки, чем любой бенчмарк в категории, и он занимает полдня. Наше собственное сравнение четырёх инструментов: Claude Code, Codex, Gemini CLI и Cursor и схватка терминальных агентов подходили к категории именно так: по одному инструменту на одной и той же работе.

Причина, по которой этот тест проводят немногие, не в его сложности. Дело в том, что запустить три harness значит настроить три набора учётных данных.

Как направить их все на один ключ

Это и есть практический пробел под всем сравнением. Каждый инструмент здесь, который позволяет выбрать модель, ждёт собственные учётные данные, в собственном формате, в собственном файле конфигурации. Claude Code хочет ANTHROPIC_BASE_URL и ANTHROPIC_AUTH_TOKEN. Codex хочет блок model_providers в TOML с wire_api = "responses". Cline хочет настройки провайдера в интерфейсе расширения. OpenCode хочет запись провайдера, Reasonix — секцию в reasonix.toml, Pi — собственную конфигурацию провайдера. Шесть инструментов, шесть мест, а если платить каждому вендору моделей напрямую, то ещё шесть счетов с шестью отдельными лимитами, которые не объединяются.

Пробел настоящий, и он не вина какого-то одного инструмента. Так выглядит категория, которая стандартизировалась на двух протоколах передачи и больше ни на чём.

Поскольку большинство этих агентов говорят либо на OpenAI-совместимом, либо на Anthropic-совместимом HTTP, решение везде одной формы: направьте их на один эндпоинт, отдающий оба протокола, и меняйте строку идентификатора модели, а не обвязку. ofox.ai отдаёт оба, поэтому один ключ покрывает Claude Code, Codex CLI, Cline, OpenCode, Reasonix и Pi, а расходы собираются в одном месте вместо шести. Настройка по каждому инструменту описана в документации по интеграциям, и честные ограничения задокументированы рядом: Copilot работает только в чате и только на индивидуальном месте, Cursor полностью блокирует Tab и Agent, а у Antigravity такой настройки нет вовсе. Трое из девяти присоединиться полностью не могут, и притворяться иначе не выйдет — первый же день тестов это вскроет.

Значение этого выходит за рамки удобства и упирается в протокол оценки выше. Прогнать одно и то же исправление бага через три harness на одной модели дёшево только тогда, когда учётные данные уже общие.

Вывод: сначала цикл, потом модель

Лучшего harness не существует, но существует лучший вопрос, и большинство статей задают неверный. Выбирайте инструмент по управляющему циклу, потому что жить вы будете именно с ним, а модель выбирайте отдельно, потому что на всех инструментах, которые это позволяют, разработчики уже относятся к этим решениям как к независимым. Данные OpenRouter подтверждают это эмпирически: самая популярная модель внутри Claude Code сделана не Anthropic, и отрыв не маленький.

Если нужна одна отправная точка: терминальный harness, принимающий base URL, направленный на модель с хорошим кэшированием, а редактор оставьте для редактирования. К этой конфигурации сошлись самые нагруженные пользователи категории, и месяц её работы стоит меньше одного обеда.

Источники

Часто задаваемые вопросы

Что такое harness для AI-агента кодинга?
Harness — это программа, которая оборачивает модель и превращает её в агента. Модель генерирует токены. Harness решает, какие файлы попадут в контекст, какие инструменты модель имеет право вызвать, нужно ли подтверждение для shell-команды, что происходит при упавшем тесте и можно ли возобновить сессию после прерывания. Claude Code, Codex CLI, Cline и OpenCode — это harness. GLM 5.2, GPT-5.6 и DeepSeek V4 — модели. Выбирать нужно и то и другое, и сочетание значит больше, чем любая из половин по отдельности.
Можно ли запустить в Claude Code модель не от Anthropic?
Да, и на OpenRouter это как раз большинство случаев. Claude Code читает ANTHROPIC_BASE_URL и ANTHROPIC_AUTH_TOKEN, поэтому подойдёт любой шлюз, говорящий на Anthropic Messages API. По данным OpenRouter за 30 дней на 2026-08-11 внутри Claude Code на GLM 5.2 пришлось 3.14T токенов против 1.98T у четырёх собственных моделей Anthropic вместе взятых. Цифра охватывает только тех, кто сознательно направил Claude Code на шлюз, так что это не доля рынка.
Reasonix сделан компанией DeepSeek?
Нет. Reasonix — проект сообщества, репозиторий github.com/esengine/DeepSeek-Reasonix, лицензия MIT, пакет в npm называется reasonix, собственный сайт — reasonix.io. Официальная документация DeepSeek перечисляет как задокументированные интеграции Claude Code, GitHub Copilot и OpenCode, а Reasonix не упоминает. Домен deepseek.ai, на котором опубликован обзор Reasonix, сам указывает на странице, что это независимый сайт, не связанный с DeepSeek.
Gemini CLI закрыли и заменили на Antigravity CLI?
Нет. На 2026-08-11 репозиторий google-gemini/gemini-cli не заархивирован, не содержит уведомления об устаревании и продолжает выпускаться по каналам preview, stable и nightly. У Antigravity действительно появился собственный CLI, и часть публикаций прочитала это как замену, но ни antigravity.google, ни Google Developers Blog не сообщают о закрытии Gemini CLI.
Какой harness дешевле всего в эксплуатации?
Стоимость определяется моделью и поведением кэша куда сильнее, чем harness. Самая дешёвая связка в этом обзоре — независимый от вендора harness, направленный на бюджетную модель с хорошим кэшем. Именно поэтому DeepSeek V4 Flash оказался самой используемой моделью и в Cline, и в Pi. Подписочные инструменты переворачивают вопрос: у GitHub Copilot и Antigravity вы покупаете квоту, а не токены, поэтому потолок фиксирован, а стоимость одной задачи не видна.
Нужен ли отдельный API-ключ для каждого агента кодинга?
Не нужен, если агент позволяет задать base URL. Claude Code, Codex CLI, Cline, OpenCode, Reasonix и Pi принимают произвольный эндпоинт, поэтому один ключ шлюза покрывает все шесть, а расходы собираются в одном месте. GitHub Copilot достаёт до внешнего эндпоинта только через стороннее расширение VS Code и только в чате. Cursor блокирует это для Tab и Agent. У Antigravity такой настройки нет вовсе.
У какого harness лучшая расширяемость?
Самая глубокая встроенная поверхность расширения у Claude Code: hooks, субагенты, skills, MCP-серверы и соглашение CLAUDE.md. Pi намеренно занимает противоположную позицию и не поставляет ничего из этого как встроенное, вместо этого открывая API расширений, чтобы вы собрали нужное сами. Reasonix посередине: MCP-серверы плюс версионируемый протокол sidecar-расширений, объявляемый в reasonix.toml, а также режим plan, слой разрешений, песочница рабочей области и чекпойнты на каждом ходу — всё это рассчитано на долгие автономные прогоны. Единственного победителя тут нет, есть выбор между «всё включено» и «примитивы».