K2 Horizon 36B-A4B 로컬 실행 전 메모리와 런타임 확인하기
K2 Horizon MoVA 36B-A4B의 BF16 GGUF 크기와 런타임 지원을 확인하고 Qwen3.6-35B-A3B와 비교할 조건을 정리합니다.
K2 Horizon 36B-A4B를 내려받기 전에 정확한 저장소, 지원 런타임, 가중치 형식을 확인하세요. 이번에 확인한 공식 GGUF 스냅샷에는 약 74.925 GB의 BF16 파일이 있으며, 카드에서는 upstream 아키텍처 지원이 진행 중이라 IFM의 llama.cpp 포크를 안내합니다. A4B는 메모리를 40억 파라미터 기준으로만 계산해도 된다는 뜻이 아닙니다.
이 글은 로컬 추론을 검토하는 개발자를 위한 배포 계획 안내입니다. 2026년 9월 14일 공식 문서와 저장소 메타데이터를 확인했습니다. 전체 가중치를 내려받거나 소비자용 GPU에서 모델을 실행하거나 Qwen과 속도를 비교하지 않았습니다. 아래 계산은 산술 예시이며 검증된 하드웨어 구성은 아닙니다.
런타임을 고르기 전에 모델 식별하기
정확한 공식 저장소는 IFM/K2-Horizon-MoVA-36B-A4B입니다. Moonshot의 Kimi K2가 아닌 IFM 모델입니다. 이름이 비슷한 모델의 명령어를 복사해도 아키텍처 호환성이 입증되지는 않습니다.
모델 카드는 총 36B·활성 4B 파라미터의 희소 백본과 네이티브 512K 문맥을 설명합니다. 이 숫자의 집계 범위를 함께 표시하세요. 대표 숫자를 저장된 모든 텐서의 정확한 목록으로 해석하면 안 됩니다.
최대 문맥 길이가 모든 로컬 환경에서 할당 가능한 길이라는 뜻도 아닙니다. 가중치, 캐시, 런타임 버퍼가 함께 메모리에 들어가야 합니다. 카드의 최대 길이부터 선택하기보다 문서에 나온 구성과 작은 작업으로 시작하세요.
공식 GGUF 스냅샷에 실제로 있는 파일
공식 GGUF 저장소는 가중치를 BF16으로 명시합니다. 확인한 파일은 K2-Horizon-36B-BF16.gguf이며 74,924,627,296바이트입니다. 약 74.925 GB(십진) 또는 69.779 GiB입니다. 다운로드 목록과 운영체제 표시를 비교할 때 단위 차이를 반영하세요.
이 목록으로 공식 Q4 파일이 있다고 결론 내릴 수는 없습니다. 커뮤니티 변환본이 있다면 제작자, 리비전, 형식, 런타임 요구사항을 따로 확인하세요. 익숙한 확장자도 설치된 추론 엔진의 아키텍처 지원을 보장하지 않습니다.
| 확인 항목 | 계획에 미치는 영향 |
|---|---|
| 모델 저장소와 리비전 | 실제 아키텍처와 가중치 식별 |
| BF16 또는 양자화 형식 | 저장 및 로드 요구량 변화 |
| 런타임 브랜치와 커밋 | 아키텍처 구현 여부 결정 |
| 문맥과 동시 요청 수 | 가중치 외 메모리에 영향 |
| 모달리티와 부속 파일 | 텍스트 전용 계산에서 빠진 구성요소 추가 가능 |
4비트 계산은 실행 가능한 배포가 아닙니다
산술 예로 360억 파라미터에 4비트를 곱하고 8로 나누면 원시 가중치 값은 180억 바이트, 즉 18 GB입니다. 추가 텐서, 양자화 스케일, 메타데이터, 런타임 할당은 제외한 값입니다. 해당 양자화가 출시됐거나 런타임이 지원한다는 증거도 아닙니다.
대신 활성 4B를 넣으면 특정 계산 경로의 크기를 구하는 셈입니다. 희소 모델도 그 토큰에서 비활성인 가중치에 접근할 수 있어야 합니다. 배치나 오프로딩은 저장 위치를 바꾸지만 나머지 가중치를 없애지는 않습니다.
A4B만 보고 16 GB GPU에 전부 올리는 구성을 계획하지 마세요. 공식 BF16 파일은 훨씬 크며 가상의 양자화에도 전체 예산이 필요합니다. 비슷한 계산 오류는 전체 파라미터와 활성 파라미터 설명을 참고하세요.
문서에 명시된 실행 경로 따르기
공식 GGUF 카드는 upstream llama.cpp 지원이 작업 중이며 IFM 포크를 사용하도록 안내합니다. 호스팅 페이지의 자동 생성 사용 위젯은 전체 실행 검증이 아닙니다. 다른 아키텍처에서 복사한 일반 Ollama 명령에도 같은 주의가 필요합니다.
메인 모델 카드에는 H200 두 장에서 검증한 서빙 구성이 있습니다. 게시자가 확인한 환경이라는 뜻이지 소비자용 GPU 추천이 아닙니다. 실행 전에 브랜치, 커밋, 의존성, 가중치 리비전과 실행 인수를 기록해 오류를 재현할 수 있게 하세요.
먼저 정확한 아키텍처와 가중치 로드를 확인하고 짧은 텍스트 요청을 검사한 뒤 긴 문맥을 별도로 시험하세요. K2 Horizon은 텍스트 생성 모델로 등록돼 있습니다. 비교 대상이 이미지를 처리한다고 해서 K2도 그렇다고 가정하지 마세요. 아키텍처 로드 실패는 출력 토큰 증가나 프롬프트 수정으로 해결되지 않습니다.
정확한 Qwen 모델과 비교하기
비교 대상은 Qwen/Qwen3.6-35B-A3B입니다. 공식 카드는 35B 언어 모델, 활성 3B 파라미터와 비전 인코더를 설명합니다. 네이티브 문맥과 확장 옵션에는 각각 문서화된 제한이 있습니다. 불명확한 Qwen 35B로 바꾸거나 이름이 비슷한 출시판들이 같은 런타임에서 동작한다고 가정하지 마세요.
대표 파라미터 숫자보다 사용 가능한 형식과 소프트웨어 지원을 먼저 비교하세요. 두 모델이 하드웨어에 들어간다면 동일 작업, 문맥, 동시성, 합격 기준으로 평가합니다. 실제 최대 메모리, 첫 출력까지 걸린 시간, 생성 속도와 작업 성공을 각각 기록하세요.
여기서는 속도나 품질의 승자를 정하지 않습니다. 하드웨어, 형식과 과제가 다르면 커뮤니티 속도 보고는 유용한 구성 사례일 수 있어도 통제된 비교는 아닙니다. 기존 Qwen 로컬 메모리 안내 (영문)는 다른 모델을 대상으로 다운로드 크기와 실행 메모리를 구분합니다.
자주 묻는 질문
K2 Horizon은 Kimi K2와 같은 모델인가요?
아닙니다. 제작자와 저장소 ID를 확인하세요. 이 글은 IFM의 K2 Horizon MoVA 36B-A4B를 다룹니다.
A4B면 작은 GPU에 들어가나요?
활성 파라미터는 토큰 계산량을 설명할 뿐 전체 저장량이 아닙니다. 필요한 모든 가중치와 런타임 메모리를 계산해야 합니다.
일반 llama.cpp를 버전 확인 없이 써도 되나요?
그렇게 가정하면 안 됩니다. 확인한 공식 카드는 upstream 지원이 진행 중이라 IFM 포크를 안내합니다. 배포 전에 현재 지원 지침과 리비전을 확인하세요.
자주 묻는 질문
- K2 Horizon은 Kimi K2와 같은 모델인가요?
- 아닙니다. 제작자와 저장소 ID를 확인하세요. 이 글은 IFM의 K2 Horizon MoVA 36B-A4B를 다룹니다.
- A4B면 작은 GPU에 들어가나요?
- 활성 파라미터는 토큰 계산량을 설명할 뿐 전체 저장량이 아닙니다. 필요한 모든 가중치와 런타임 메모리를 계산해야 합니다.
- 일반 llama.cpp를 버전 확인 없이 써도 되나요?
- 그렇게 가정하면 안 됩니다. 확인한 공식 카드는 upstream 지원이 진행 중이라 IFM 포크를 안내합니다. 배포 전에 현재 지원 지침과 리비전을 확인하세요.


