Сколько стоит GPT‑6.1 Sol API: кэш, длинный контекст и расчёт расходов

Рассчитайте стоимость GPT‑6.1 Sol по отдельным категориям токенов, проверьте порог длинного контекста и режим обработки. В комплекте — офлайн-калькулятор.

Контурный рисунок шестерёнки на серо-розовом фоне с заголовком GPT-6.1 Sol API.

Стандартные тарифы GPT‑6.1 Sol API — 2 доллара за миллион входных и 10 долларов за миллион выходных токенов. Для бюджета агента этого недостаточно: чтение и запись кэша, длинный запрос, режим обработки и инструменты меняют итог. Ниже разобран расчёт отдельного запроса и сверка многошаговой задачи без повторного учёта одних и тех же токенов.

Тарифы проверены 30 сентября 2026 года по странице модели OpenAI и прайс-листу API. Примеры гипотетические, в USD: это не счета клиентов, не результаты платного теста, не предложение Ofox и не кредиты подписки ChatGPT.

Четыре непересекающиеся категории

Standard, вход не более 272 000 токеновUSD за 1 млн
Обычный вход без кэша2,00
Чтение кэша0,10
Запись кэша2,50
Выход, включая оплачиваемые токены рассуждений10,00

Тарифы Sol в официальной документации OpenAI

Настоящий снимок англоязычной документации. Он показывает опубликованные тарифы, а не счёт или запуск модели.

Обозначим обычный вход U, чтение R, запись W, выход O. Первые три категории не должны пересекаться:

USD = (2 × U + 0.10 × R + 2.50 × W + 10 × O) / 1,000,000

Если поле общего входа уже включает кэшированные токены, нельзя сначала оплатить весь вход по 2 доллара, а затем добавить кэш. Сначала сопоставьте поля usage конкретного интерфейса с отдельными категориями. Отсутствующая детализация означает неизвестное значение, а не ноль. Поэтому наш калькулятор принимает категории явно и не пытается угадывать формат ответа поставщика.

Аналогично с рассуждениями: если общий выход уже содержит их токены, повторное добавление детализации завысит результат. Учёт только видимого ответа, напротив, может занизить его. Для оплаты используйте общий оплачиваемый выход, а детализацию — для объяснения его состава.

Порог длинного контекста относится ко всему запросу

При входе свыше 272 000 токенов OpenAI применяет двойные тарифы входа и кэша и коэффициент 1,5 для выхода ко всему запросу. Повышенная цена не ограничена превышением. Ровно 272 000, по этому условию, ещё относится к короткому диапазону.

Standard, длинный контекстUSD за 1 млн
Обычный вход4,00
Чтение кэша0,20
Запись кэша5,00
Выход15,00

Порог проверяется по полному входу, а не только по новой части. 20 000 обычных и 260 000 прочитанных из кэша токенов составляют 280 000. Считать такой запрос коротким из-за небольшого некэшированного фрагмента неправильно.

Для 300 000 обычных входных и 10 000 выходных токенов расчёт равен 300000 × 4 / 1M + 10000 × 15 / 1M = $1.35. Короткие ставки дали бы $0.70, но здесь они неприменимы. Поэтому растущая история агента может влиять на счёт сильнее исходного вопроса пользователя.

Окно в 1 050 000 токенов не означает, что весь объём доступен для входа. Документация отдельно ограничивает вход и выход. Оставляйте резерв для ответа, учитывайте определения инструментов и их результаты. Количество символов не заменяет измерение токенов.

Четыре примера бюджета

Налоги, инструменты, хранение и региональная надбавка здесь не включены.

СценарийURWOStandard USD
Короткий запрос без кэша20 000005 0000,090
Повторное использование материала10 000100 00005 0000,080
Первичная запись кэша10 0000100 0005 0000,320
Длинный запрос без кэша300 0000010 0001,350

Вторая и третья строки — разные запросы. Первую запись нельзя заранее оценивать как чтение. Последовательность из одной записи и девяти попаданий в кэш стоит в примере $0.32 + 9 × $0.08 = $1.04. Десять некэшированных запросов с входом 110 000 и выходом 5 000 стоили бы $2.70.

Разница предполагает девять реальных попаданий и корректную классификацию расхода. Изменение префикса, истечение срока, маршрутизация или некэшируемый запрос нарушают предположение; длина ответа тоже меняется. Это модель нагрузки, а не обещание экономии. В журнале нужны записи, попадания и промахи.

Текущая документация кэша для GPT‑5.6 и новее использует prompt_cache_options.ttl со значением "30m" и минимальный кэшируемый префикс в 1024 видимых входных токена. Не переносите старый параметр prompt_cache_retention: "24h". Кэш сохраняется как минимум 30 минут после последней записи или повторного использования. Это условие хранения, а не гарантия попадания для изменённого запроса. Поддерживаются неявные и явные границы кэширования; в явном режиме без заданной точки кэш вообще не записывается. Размещайте стабильный общий материал до меняющихся данных запроса и проверяйте фактический расход кэша. Небольшой интервал между вызовами и повторяющийся текст сами по себе не доказывают попадание.

Режимы Standard, Fast, Batch и Flex

Fast стоит вдвое дороже Standard, Batch и Flex — на 50% дешевле. Это альтернативные режимы, а не складываемые скидки. Проверьте доступность для конкретной модели, интерфейса и нагрузки. Batch не превращает обычный интерактивный запрос в запрос со скидкой; Flex не следует приписывать те же гарантии задержки, что Standard.

Для примера за $0.09 оценка Fast составляет $0.18, Batch или Flex — $0.045. Для длинного запроса за $1.35 получаются $2.70 и $0.675. Количества токенов здесь фиксированы; реальный ответ может отличаться.

Региональная обработка добавляет 10% там, где применима. Учитывайте её только при фактическом использовании соответствующего варианта. Страница модели исключает Fast при выборе резидентности данных в ЕС. Нельзя соединять несовместимые опции только потому, что для каждой опубликован коэффициент.

Офлайн-калькулятор

Скачайте Python-калькулятор. Он использует стандартную библиотеку, не обращается к сети и не требует ключа:

python3 cost_calculator.py --ordinary 10000 --read 100000 --write 0 --output 5000 --mode standard

Ожидаемая оценка — 0.080000 USD. Значение --mode можно заменить на fast, batch или flex. Флаг --regional добавляет надбавку для расчёта, но не проверяет право её использовать. Отрицательные значения и сочетание --region eu --mode fast отклоняются.

Арифметика проверена локально; платный вызов Sol для сверки со счётом не выполнялся. Калькулятор не проверяет максимальный размер запроса и не подтверждает его допустимость. Тарифы зафиксированы по дате и автоматически не обновляются: перед новым бюджетом сверяйте их и сохраняйте версию расчёта. Инструмент считает только токены; отсутствие платы за инструменты в выводе не означает, что они бесплатны.

Сверяйте задачу по каждому запросу

Одна задача может вызвать несколько обращений к модели. Инструкции, история, определения инструментов и результаты пересылаются в разных объёмах. Умножать цену первого запроса на число видимых сообщений ненадёжно. Полезный журнал:

task_id, request_id, model, timestamp, mode, region,
input_total, ordinary_input, cache_read, cache_write,
output_total, reasoning_detail, tool_type, tool_quantity,
token_estimate_usd, tool_charge_usd, billing_adjustment_usd

Для каждой строки проверьте сумму входных категорий, порог контекста и отсутствие повторного счёта рассуждений. Добавьте реальные инструменты по их ставкам, затем агрегируйте по задаче. ID запроса помогает расследовать расхождения без сохранения приватного текста.

Включайте успешные запросы, попытки с подтверждённым оплачиваемым расходом и повторы. Не всякая HTTP-ошибка обязательно оплачивается; но отсутствие полезного ответа тоже не доказывает нулевой расход. Основание — usage и биллинг. Для стоимости принятой задачи дополнительно нужен итог приёмки.

Если расчёт расходится со счётом

Сначала проверьте единицы и границы: доллары или кредиты, миллион или тысяча, API или подписка, один запрос или вся задача. Затем — кэш и повторный учёт общего входа. После этого проверьте длину, режим, регион, выход и рассуждения; наконец инструменты, повторные попытки и корректировки поставщика.

У шлюза могут быть свои цены и поля. Тарифы OpenAI не доказывают скидку Ofox. Уточняйте точную модель и актуальный каталог, отделяя цену поставщика от справочного расчёта.

Для выбора уровня модели читайте Sol и Astra, для изменения приложения — руководство по переходу на английском и миграцию инструментов на Responses. Одна цена входа не определяет итоговое решение.