Sonnet 5.5とGPT-6 Sol、日々の開発ではどちらを選ぶ?

Sonnet 5.5とGPT-6 Solを、開発タスク・effort・API連携・合格したタスク当たりの費用で比較。自分のリポジトリで判断するための評価手順を紹介します。

天秤の線画と「Sonnet 5.5 vs GPT-6 Sol」のタイトル。

Claude Sonnet 5.5とGPT-6 Solは日常的なコーディングで比較する価値がありますが、どちらかがすべてのリポジトリ作業で安いという証拠はありません。 Sonnetの標準Claude API料金は入力・出力それぞれ100万トークン当たり2ドル・10ドルです。GPT-6 Solの短いコンテキストでの標準単価も同じですが、長いコンテキストの料金は別途確認が必要です。同じ単価でも消費トークン数や成功率まで同じにはなりません。

本記事は、範囲を限定したバグ修正、小さな機能追加、レビュー工程のモデルを選ぶ開発者向けです。2026年9月29日に確認した公式資料と独立機関の公開時評価に基づきます。Ofoxが独自に実施したコーディング対決ではありません。ランキングを本番環境の保証と見なさず、自分のリポジトリで判断するための記録方法を示します。

先に動作条件をそろえる

判断項目Sonnet 5.5GPT-6 Sol
ネイティブAPIの資料Claude Messagesの処理手順OpenAIのモデル・API資料
標準の短いコンテキストでの入力・出力100万トークン当たり$2/$10100万トークン当たり$2/$10
長いコンテキストの費用Claudeと利用サービスの現行条件を確認入力が272Kトークンを超えると、リクエスト全体の入力・出力に100万トークン当たり$4/$15を適用
EffortSonnetのこのバージョンで再評価Solの対応設定を使用。名称は共通の計算量単位ではない
組み込み作業Sonnet 5.5の移行変更点を確認OpenAIの対象エンドポイントとツールループを確認
合格基準自社のテストとレビュー要件同じテストとレビュー要件

出典:Sonnetの仕様、GPT-6 Solのモデル資料、OpenAIの料金。異なる会社のeffort名を同等の設定として扱っていません。

公開時の評価から分かること

Artificial Analysisは、Sonnet 5.5の高effortでの強い結果と、大量の出力トークン消費を報告しています。費用と能力の比較では、SonnetのhighがあるSol構成に近い一方、別の設定では費用との釣り合いが見劣りしました。見出しのスコアだけで決めず、両モデルを試す理由になります。

同機関は、構造化出力のバグがある公開前のSonnet環境で測定し、該当評価を再実施すると説明しています。この限定を省かないでください。提供元の図、別々のベンチマーク、古い環境のテストを、同じ課題と条件で測ったかのように一つの表へ混ぜることはできません。

本番運用で知りたいのは、より具体的なことです。自分たちのタスクで予算内に合格するパッチを作るのはどの構成でしょうか。ターミナルのベンチマークはエージェントの実行能力を示しても、レビュー時間、プロジェクト固有の規則、追加のロールバック費用までは測りません。

範囲を限定してコーディングを比較する

目立つデモ一つより、代表的なタスクを数件選びます。既知の失敗テストがある不具合修正、明確な合格条件のある機能追加、あらかじめ問題を仕込んだレビューを含めましょう。モデルの回答を見る前に期待結果を決め、入力には本番の秘密情報を含めません。

各試行では次をそろえます。

  1. 同じクリーンなコミットとツール権限から開始する。
  2. 同じ問題説明、リポジトリの指示、関連ファイルを渡す。
  3. 正確なモデル、effort、APIか月額契約か、クライアント版、日付を記録する。
  4. 同じテストを実行し、無関係な編集も含めて最終差分を見る。
  5. 使用トークン、キャッシュ区分、再試行、所要時間、人のレビュー時間を保存する。

3回の再試行後に成功したモデルは、最後のパッチが似ているだけで初回成功と同等にはなりません。一方、1回の失敗だけで能力不足とも断定できません。勝者ラベルだけでなく、タスクの件数と内容を示してください。

再試行で変わる費用の例

1回0.10ドルと仮定し、10回の試行で10件が合格すれば、合格1件当たり0.10ドルです。別の構成で同じ10件を完成させるために1回0.07ドルの試行が20回必要なら、合格1件当たり0.14ドルになります。これは架空の数値例であり、SolやSonnetの測定値ではありません。

1リクエストの料金が安くても、再試行後には逆転することを示しています。失敗件数も別に残しましょう。難しいタスクを途中で放棄し、その失敗を集計対象から外すと、安いモデルが実際以上に効率的に見えます。

対話型の作業では時間も重要です。出力トークン毎秒だけでなく、合格するパッチまでの時間を測ります。初回回答が速くても、デバッグをもう一巡するなら、タスク全体では遅くなる場合があります。

どちらから試すか

検証済みのClaudeツールループがすでにあるなら、API系列を変えるよりSonnetを試す方がクライアント改修は少なく済む可能性があります。ただし5.5の移行確認は必要です。OpenAIのツールを使っているなら、Solを比較の基準として残すのが自然です。これは統合費用に関する判断であり、能力ランキングではありません。

既存の実装で条件を管理しやすいモデルから試し、合格タスク当たりの費用、時間、パッチ品質、特定の失敗率など、測定した結果が改善した場合に切り替えます。SonnetとSolの比較を、すべての最上位モデルを並べる総合ランキングに広げる必要はありません。

入力・出力・キャッシュはSonnetの料金記録表で分けて計算できます。Claude内の選択はSonnet 5.5とOpus 5.5、OpenAIのモデル階層はSol・Luna・Astraのタスク別ガイドを参照してください。

よくある質問

2つのモデルは同じ料金ですか?
確認時点の標準的な短いコンテキストの入力・出力単価は同じです。すべてのコンテキスト長、キャッシュ操作、ツール、事業者、完了タスクの料金が同じという意味ではありません。
Sonnetのスコアが高ければ、自分のバグも上手に直せますか?
保証はありません。スコアは評価候補の選定に使い、パッチの有用性は自分のテスト、リポジトリの制約、レビューで判断します。
GPT-6 Astraと比較すべきではありませんか?
難しい作業ではAstraも参考になります。本記事は日常の開発とタスク費用を扱うため、Solを直接の比較対象としています。対象タスクを示さずに異なる階層を混ぜると、選び方が曖昧になります。