DeepSeek V4.1 Flashのパラメータ数と重み容量:552B・16Bは何を表す?

DeepSeek V4.1 Flashのバックボーン、アクティブパラメータ、Engram、重みファイル容量を整理し、必要VRAMと混同せずに数値を読む方法を解説します。

サンドカラーの背景に明るい紙を配置し、巻き尺の線画、幾何学模様、英語タイトル「DeepSeek V4.1 Parameters」を添えた表紙。

DeepSeek V4.1 Flashのバックボーンのパラメータ数、アクティブパラメータ数、ダウンロードする重みの容量は、それぞれ別のものを表します。公式モデルカードには、552Bのバックボーン、prefill時8B・decode時16Bのアクティブパラメータ、別の構成要素として196BのEngram条件付きメモリが記載されています。どの数値も、それだけで必要なGPUメモリ全体を表すものではありません。

本記事では、これらの数値の読み方と重みファイルの集計方法を説明します。2026年9月14日に公式モデルリポジトリとメタデータを確認しました。約510 GBの重みシャードをダウンロードしたり、モデルをローカル実行したりはしていません。以下では、観測したファイルのメタデータと、仮定に基づく保存容量の計算を区別します。

まず各数値の対象範囲を確認する

DeepSeek公式モデルカードは、バックボーン数とアクティブ数を使ってアーキテクチャを説明しています。リポジトリのカウンターや外部の比較表と比べる際も、何を数えた値なのかを数値とともに残します。

数値・ラベル表すものその数値だけでは分からないこと
552Bバックボーンモデルカードでいうバックボーンの範囲リポジトリに保存された全テンソル
prefill時8Bアクティブprefillで使うとされる計算の範囲ロードに必要な重み全体
decode時16Bアクティブdecodeで使うとされる計算の範囲16Bの密(dense)モデルと同じ導入時のメモリ要件
196B Engram別に説明される条件付きメモリの構成要素バックボーン数と置き換えられる同じ指標
ファイルのバイト数選択したファイルが占める保存容量推論中のRAM・VRAMのピーク

丸められた代表的なアーキテクチャの数値を足し合わせ、それを保存された全テンソルに含まれるパラメータの厳密な総数として示さないでください。丸めと構成要素の境界が重要です。リポジトリの精密な集計値とモデルカードの丸めた表記が違っていても、どちらかが誤記とは限りません。

アクティブパラメータ数でダウンロード容量は決まらない

疎なモデルは、特定のトークンに対して計算の一部を選びます。その経路で行う計算は減りますが、残りの学習済み重みをすべてモデル配布物から省けるという意味ではありません。別のトークンや段階では、別の構成要素が必要になる場合があります。

推論システムは、構成要素を異なるデバイスに置いたりオフロードしたりできます。それによりメモリの置き場所、帯域幅、性能が変わります。しかし、アクティブ数だけから一般向けGPUで動く構成は導けません。フレームワークが対応する配置方法と量子化戦略も確認する必要があります。

同じ理由で、160億に選んだ重み1個あたりのバイト数を掛けても、リポジトリ全体のダウンロード容量にはなりません。仮定した一部分を、その精度で保存した場合の容量を示すだけです。それを「モデルの必要VRAM」と呼ぶと、別の問いに答えてしまいます。

確認したリポジトリのファイル内訳

リポジトリのリビジョンdba1be0a40aa45a94ad051997016db3960a90277では、公式リポジトリのメタデータに48個のsafetensorsシャードがあり、合計510,296,708,312バイトでした。十進単位で約510.297 GBです。これはそのシャード群のファイルサイズ合計であり、補助ファイルをすべて含む値でも、実測した実行時メモリでもありません。

Hugging Faceのメタデータは、safetensors.totalを763,205,315,794と報告し、BF16、F32、F8_E4M3、I8という型の項目も含んでいました。これはホスティングサービスが返す集計カウンターとして扱い、独立に検証したアーキテクチャのパラメータ数とみなさないでください。モデルカードの552Bバックボーンとは範囲が異なります。テンソル型が混在することも、代表的なパラメータ数に単一のバイト幅を掛けてもファイル合計を再現できない理由です。

リポジトリのファイルやリビジョンが変わると、メタデータも変わり得ます。数値とともにリビジョンを記録してください。ハードウェアの提案書に集計を載せるなら、ファイル一覧を添え、十進GBと二進GiBを区別して、確認者が再計算できるようにします。

重みをダウンロードせずに容量を確認する

次のシェルコマンドは公開メタデータだけを取得します。重みシャードはダウンロードしません。Pythonスクリプトはリビジョンを表示し、名前が.safetensorsで終わるファイルのサイズを合計します。APIにサイズがない場合は0とみなさず、明示的なエラーにします。

curl --fail --silent --show-error \
  'https://huggingface.co/api/models/deepseek-ai/DeepSeek-V4.1-Flash?blobs=true' \
  -o model-metadata.json
import json
from pathlib import Path

metadata = json.loads(Path("model-metadata.json").read_text())
shards = [f for f in metadata["siblings"] if f["rfilename"].endswith(".safetensors")]
if not shards or any(type(f.get("size")) is not int or f["size"] < 0 for f in shards):
    raise ValueError("Complete safetensors file sizes are required")
size_bytes = sum(f["size"] for f in shards)
print(metadata["sha"], len(shards), size_bytes, size_bytes / 1_000_000_000)

これはファイルの集計方法であり、推論ベンチマークではありません。時点間で比べる前に、リビジョンを固定するか、返された値を記録します。後日の結果を、前のスナップショットのアーキテクチャやファイル数と黙って組み合わせないでください。

実行時メモリは別に見積もる

実行計画にはファイル合計以外も必要です。対応する重み表現、ロード時の変換、選んだコンテキストのKVキャッシュ、一時テンソル、フレームワークの割り当て、同時リクエストを含めます。ロード時のピークと、通常の生成中のピークが異なる場合もあります。

GPU台数を決める前に、実行環境のアーキテクチャ対応と導入手順を確認します。保存されている重みの型だけでは、特定のアクセラレーターが必要な演算をすべて直接実行できるとは証明できません。オフロードはメモリの負担をなくすのではなく、ホストRAMや帯域幅に移す場合があります。

目的がローカル推論ではなくアプリケーションへの組み込みなら、DeepSeek V4.1 APIガイドでホスト型の経路を確認できます。API料金はプロバイダーの課金ルールに基づき、保存されたパラメータ一つずつに課金するものではありません。510 GBのファイル集計から、リクエストごとのAPI費用を計算しないでください。

パラメータ数を品質スコアにしない

パラメータ数だけでは、どのモデルが自分の処理に向くかは分かりません。比較にはタスク品質、有効な推論設定、コンテキスト処理、ツールの挙動も必要です。同じモデルが二つの開発アプリで違って見える場合は、クライアント間の診断ガイドを参照してください。

導入時に問うべきなのは、検証済みの実行環境と処理全体が、許容できる性能で手持ちのハードウェアに収まるかです。より小さな疎なモデルの計画例として、K2 Horizonガイドも、アクティブ数と実際に提供されるファイルを同じように区別しています。

よくある質問

552Bは保存された全テンソルに含まれるパラメータの正確な総数ですか?

いいえ。公式の対象範囲を保ってください。これはバックボーンのパラメータ数です。リポジトリの保存データ集計には追加の構成要素が含まれ、範囲が異なる場合があります。

16Bアクティブから必要VRAM全体を推定できますか?

いいえ。アクティブな計算は、保存する重み全体とは別です。実行時メモリにはキャッシュや作業用の割り当ても含まれます。

510.297 GBのGPUメモリがあれば足りますか?

そうとはいえません。これは一つのリビジョンで観測した48個の重みシャードの合計サイズです。ロードや推論の必要メモリを実測した値ではありません。

よくある質問

DeepSeek V4.1 Flashの552Bは何を意味しますか?
公式モデルカードにあるバックボーンのパラメータ数です。Engramや保存ファイルの集計とは別に扱います。
16Bアクティブなら16Bの密(dense)モデルと同じメモリで動きますか?
いいえ。アクティブな計算と、保存する重み全体は別の量です。
重みファイルの容量は必要VRAMですか?
いいえ。ファイルのバイト数には、実行時に必要なメモリ全体は含まれていません。