K2 Horizon 36B-A4B локально: как проверить память и поддержку движка

Проверяем размер BF16 GGUF, поддержку K2 Horizon MoVA 36B-A4B и условия сравнения с Qwen3.6-35B-A3B до выбора оборудования.

Обложка на серо-голубом фоне: светлая бумага с линейным рисунком с шестерёнкой, геометрические акценты и заголовок K2 Horizon 36B-A4B.

Перед загрузкой K2 Horizon 36B-A4B проверьте точный репозиторий, поддерживаемый движок и формат весов. В проверенном официальном GGUF-снимке находится BF16-файл примерно на 74,925 GB. Карточка направляет к форку llama.cpp от IFM, пока поддержка архитектуры в основном проекте ещё разрабатывается. A4B не означает, что память нужно рассчитывать лишь на четыре миллиарда параметров.

Это руководство по планированию локального запуска. Документация и метаданные проверены 14 сентября 2026 года. Мы не загружали полные веса, не запускали модель на потребительской видеокарте и не измеряли скорость относительно Qwen. Расчёты ниже — арифметические примеры, а не проверенные конфигурации.

Сначала определите точную модель

Официальный репозиторий — IFM/K2-Horizon-MoVA-36B-A4B. Это модель IFM, не Kimi K2 от Moonshot. Команда запуска для похожего имени не доказывает совместимость архитектуры.

Карточка описывает разреженную основную архитектуру с 36B параметров и 4B активных, а также нативным контекстом 512K. Сохраняйте область подсчёта рядом с числами: краткое название не является точной описью всех сохранённых тензоров.

Максимальный заявленный контекст не означает, что его выделит любой локальный компьютер. В память одновременно должны помещаться веса, кеш и рабочие буферы. Начинайте с документированной конфигурации движка и небольшой нагрузки, а не с предельного контекста.

Что содержится в официальном GGUF

Официальный GGUF-репозиторий указывает BF16. Проверенный список содержит K2-Horizon-36B-BF16.gguf размером 74 924 627 296 байт: около 74,925 десятичных GB, или 69,779 GiB. Учитывайте разные единицы в каталоге загрузки и интерфейсе ОС.

Это не подтверждает наличие официального Q4-файла. Для сторонней конверсии отдельно проверьте автора, ревизию, формат и требования движка. Знакомое расширение файла не доказывает поддержку архитектуры вашей установленной версией.

Что проверитьКак это влияет на план
Репозиторий и ревизияОпределяют архитектуру и веса
BF16 или квантованный форматМеняют хранение и загрузку
Ветка и коммит движкаОпределяют наличие реализации архитектуры
Контекст и число одновременных запросовТребуют памяти сверх весов
Модальности и дополнительные файлыМогут добавлять компоненты к оценке текстовой модели

Четырёхбитный расчёт не равен готовой конфигурации

Арифметический пример: 36 миллиардов параметров × 4 бита / 8 = 18 миллиардов байт, то есть 18 GB сырых значений весов. Здесь нет дополнительных тензоров, коэффициентов квантования, метаданных и рабочих выделений памяти. Расчёт не подтверждает, что такая квантизация выпущена и поддерживается.

Подстановка 4B активных параметров отвечает на другой вопрос — об отдельном пути вычисления. Разреженной модели нужен доступ и к весам, неактивным для данного токена. Размещение и выгрузка на CPU меняют место хранения, но не устраняют остальные веса.

Не планируйте полностью GPU-запуск на 16 GB на основании A4B. Официальный BF16-файл значительно больше; даже для гипотетического квантованного варианта нужен полный бюджет. Аналогичные ошибки разобраны в статье о полных и активных параметрах.

Следуйте документированному способу запуска

Официальная GGUF-карточка указывает, что поддержка в основном llama.cpp ещё разрабатывается, и ссылается на форк IFM. Автоматически созданный виджет «использовать модель» на хостинге не заменяет проверку полного запуска. То же касается общей команды Ollama для другой архитектуры.

Основная карточка содержит серверную конфигурацию, проверенную на двух H200. Это окружение издателя, а не рекомендация потребительского оборудования. Запишите ветку, коммит, зависимости, ревизию весов и аргументы запуска, чтобы воспроизводить ошибки.

Сначала убедитесь, что движок загружает нужную архитектуру и веса. Затем проверьте короткий текстовый запрос, после него — длинный контекст. K2 Horizon обозначен как text-generation: не предполагайте поддержку изображений только потому, что она есть у сравниваемой модели. Если архитектура не поддерживается, увеличение выходного лимита или изменение промпта это не исправит.

Сравнивайте с конкретной версией Qwen

Здесь речь о Qwen/Qwen3.6-35B-A3B. Карточка описывает языковую модель 35B с 3B активных параметров и визуальным энкодером. Нативный контекст и его расширение имеют собственные документированные пределы. Не заменяйте её неопределённым «Qwen 35B» и не переносите поддержку между версиями.

Сначала сравните доступные форматы и программную поддержку, затем числа параметров. Если обе модели помещаются на вашем оборудовании, проверьте одну задачу при одинаковом контексте, параллельности и критериях приёмки. Пиковую память, время до первого вывода, скорость генерации и результат задачи записывайте отдельно.

Победителя по скорости или качеству мы не объявляем. Без одинакового оборудования, формата и задачи чужой отчёт описывает конфигурацию, но не контролируемое сравнение. Руководство по памяти Qwen объясняет разницу между загрузкой и рабочей памятью на примере другой модели.

Частые вопросы

K2 Horizon — это Kimi K2?

Нет. Проверяйте издателя и полный ID репозитория. Здесь рассматривается IFM K2 Horizon MoVA 36B-A4B.

A4B означает, что модель поместится на небольшой видеокарте?

Нет. Активные параметры описывают вычисление для токена, а не хранение всей модели. Нужен бюджет всех необходимых весов и рабочей памяти.

Можно не проверять версию обычного llama.cpp?

Нет. Проверенная официальная GGUF-карточка направляет к форку IFM, пока основная поддержка разрабатывается. Перед запуском уточните текущие инструкции и ревизию.

Часто задаваемые вопросы

K2 Horizon — это Kimi K2?
Нет. Проверяйте издателя и полный ID репозитория. Здесь рассматривается IFM K2 Horizon MoVA 36B-A4B.
A4B означает, что модель поместится на небольшой видеокарте?
Нет. Активные параметры описывают вычисление для токена, а не хранение всей модели. Нужен бюджет всех необходимых весов и рабочей памяти.
Можно не проверять версию обычного llama.cpp?
Нет. Проверенная официальная GGUF-карточка направляет к форку IFM, пока основная поддержка разрабатывается. Перед запуском уточните текущие инструкции и ревизию.