GPT-6 Sol・Luna・Astraの選び方:作業と合格条件で比べる

GPT-6の3モデルを評価する出発点を整理。公式の位置づけと性能実測を区別し、固定数量でのAPI費用と空白の評価表を提供します。

淡色のカードにステンシルシートの黒い線画と幾何学模様、記事の英語タイトルを配置した表紙。

焦点が明確で大量に処理する作業はLuna、日常のコードや一般的な作業はSol、より複雑な作業はAstraを評価の出発点にできます。 これは公式の位置づけを使った候補選びで、あなたの作業での性能順位ではありません。

SolとLunaの発表Astra文書を2026年9月23日に確認しました。有料の3モデル対照実験は行っておらず、精度や速度の勝者は決めていません。

作業の難しさを合格条件で捉える

作業評価の候補確認する結果
出力が明確な大量の分類・抽出Luna正しいフィールド、例外、再試行費用
日常のコード修正・文書・複数手順Soldiff、テスト、ツール、手修正
制約が絡み合う複雑な作業Astra目標全体、見落とした制約、総費用

一つの流れの中で、安価なモデルが入力を整理し、難しい部分を別モデルが担当する設計も評価できます。ただし、切り替え条件は自分の事例で検証します。失敗がプロンプト、ツール、文脈に由来するなら、高価なモデルへの変更だけでは解決しない場合があります。

API単価と固定数量の例

以下はOpenAI料金のStandard・入力272K以下、100万テキストトークン当たりの米ドルです。

モデル通常入力読み取り書き込み出力
Luna0.100.010.1250.50
Sol20.202.5010
Astra10112.5050

直接契約APIの単価であり、Ofox料金やChatGPTのメッセージ枠ではありません。入力272K超ではリクエスト全体の入力・キャッシュが2倍、出力が1.5倍です。処理モードと追加費用も別に確認します。

通常入力20,000、出力5,000、キャッシュなしで固定するとLunaは0.0045、Solは0.09、Astraは0.45米ドルです。CSV計算スクリプトで検算できます。

実際のトークン数や合格率が同じとは仮定できません。これらは算術例で、ツールや再試行、人による修正は含みません。

出力を見る前に評価表を作る

空白の評価CSVに、入力、許可する操作、合格条件を記録します。コードは開始commit、依存関係、テストコマンドを固定し、抽出では正解と例外を残します。

モデルID、事業者、エンドポイント、推論設定、ツール権限、利用量、失敗、手修正を記録してください。異なるモデルに適した設定が違う場合は、その差を明記します。同じ推論レベル名が同量の計算を意味するとは限りません。

最良の出力だけを選ばず、捨てた試行を総費用へ入れます。提供する表にモデルの点数は入っていないため、実施済みのベンチマークとして扱わないでください。

失敗と切り替えの費用も見る

安価なモデルで手修正が多ければ、作業全体では安くない可能性があります。一方、機械的に合否を判定できる単純作業は、最高価格のモデルから始める必要があるとは限りません。どちらも記録で判断します。

フィールド欠落、テスト失敗、制約違反など、あらかじめ定めた条件で切り替え、追加費用を残す方法があります。「高価だから正しい」「1回成功したからすべて任せられる」という判断は避けます。

接続を揃えてから比べる

利用入口LunaのBatch費用Responses移行で条件を確認できます。ツール接続が壊れた状態の失敗を、モデル能力の差として比較しないことが重要です。

公式の位置づけは候補を絞る材料です。最終判断には自分の再現可能な作業、合格結果、費用、人の時間を使います。

よくある質問

Solはすべてのコード作業でAstraより適していますか?
そうとは判断できません。日常作業の候補にはなりますが、複雑な作業も同じ合格条件で評価する必要があります。
費用例は実測ですか?
いいえ。入力と出力を固定して単価の違いだけを示した計算です。
名前だけで自動振り分けしてよいですか?
作業と切り替え条件を定義し、実際の結果で検証してください。公式の位置づけは成功率の保証ではありません。