Cloud Intelligence™
トークン単価ではなくタスク単価:フロンティアLLMワークロードのユニットエコノミクス
AnthropicとOpenAIのフロンティアモデルをタスク単価で分析(2026年8月)
このページはEnglish、Deutsch、Español、Français、Italiano、Portuguêsでもご覧いただけます。
About Vadim Solovey
Founded DoiT in 2011 and have been here ever since — in every flavor of CTO, co-CEO, and now CEO. I started my career in 1999 building data centers before anyone called it "the cloud," and I've spent the two decades since trying to deliver on what the cloud was actually supposed to be. I still write code most weeks.
My personal page要約
トークン単価は、エージェント型ワークロードや本番ワークロードを測る単位として不適切です。正しい単位は、タスク完了あたりの期待コストに、自動チェックをすり抜けた誤出力の後始末コストを加えたものです:
2026年半ば時点のタスクあたりの素のトークンコストでは、OpenAIの最新フロンティアモデルのほうが安価な選択肢であることが多くなっています。Artificial Analysisの測定では、Intelligence Indexのタスクあたりコストは、GPT-5.6 Solが$1.04、Claude Opus 5が$2.03、Claude Fable 5が$2.75でした。OpenAIはトークン効率のギャップを埋めたのです。
しかし、分母に信頼性が入った瞬間、形勢はAnthropicに傾きます。tau-benchでは、Claude Opus 4.8は繰り返し実行しても単発スコアをはるかに高い割合で維持し、ポリシー違反はGPT-5.5の半分未満でした。高リスクの無人ループでは、この一貫性がリトライと人手による後始末を減らします。そして実際のコストの大半が発生するのは、まさにそこなのです。
主な発見
フラッグシップの定価は収斂しました。Claude Opus 5は100万トークンあたり入力$5/出力$25、GPT-5.6 Solは$5/$30です。出力の定価では、いまやAnthropicのほうが高いのではなく安いのです。「Claudeはトークン単価が高い」という従来の見方は、フロンティア領域ではほぼ過去のものです。
トークン数はベンダー間で比較できません。AnthropicのトークナイザーはOpus 4.7以降、同じテキストに対して約30%多くのトークンを生成し、Opus 4.8とOpus 5では英単語1語あたり約1.88トークンを報告します。GPT-5のo200kエンコーディングでは約1.17です。同じ「100万トークンあたりのドル単価」でも、Claudeのコンテキストで買える単語数は少なくなります。これがAnthropicに対する単純なトークン単価の比較を歪めています。
推論トークンは両プラットフォームとも出力トークンとして課金されます。OpenAIは推論トークンを非表示にし、Anthropicは返却できます。目に見える回答が500トークンでも、課金される推論トークンは数千に及ぶことがあります。
分母となる成功率が支配的です。試行あたりのコストが10%高くても、はるかに安定して成功するモデルは、リトライと人手の後始末を含めれば、正しくポリシーに準拠したタスク1件あたりでずっと安くなり得ます。
プロンプトキャッシングは長時間セッションの計算を一変させます。キャッシュ読み取りは、AnthropicもOpenAIの現行モデルも入力単価の10%です。
詳細
問題:トークン単価は測るべきものを測っていない
チームは能力、可用性、ベンダーとの相性でモデルを選びます。しかしコストを比較する段になると、価格表を眺めて「100万トークンあたり$5対$10」で終わりにしてしまいます。この比較は、エージェント型の用途にはほとんど役に立ちません。
エージェント型のタスクは1回のAPI呼び出しではありません。ループです。

計画し、ツールを呼び出し、結果を読み、判断し、編集し、検証し、繰り返す。Vantageによるエージェント型コーディングセッションの分析では、代表的な50ターンのコーディングセッションを入力約100万トークン、出力約4万トークンとモデル化しています。入出力比は25対1に近く、入力が総コストの約85%を占めます。モデルがターンごとに蓄積されたコンテキストを読み直すためです。Gartnerの2026年3月の分析では、エージェント型ワークフローは単純なチャットボットクエリの5〜30倍のトークンをタスクあたりに消費することが判明し、シニアディレクターアナリストのWill Sommer氏は、そのリスクを「最高製品責任者はコモディティトークンのデフレを、フロンティア推論の民主化と混同すべきではない」と端的に指摘しました。Bai et al.(arXiv:2604.22750)は、SWE-bench Verified上の8つのフロンティアLLMトラジェクトリを分析したプレプリントで、スタンフォード大学のErik Brynjolfsson氏やMITのAlex Pentland氏らが共著者に名を連ねています。同研究では、エージェント型コーディングタスクはコード推論やコードチャットの最大1,000倍のトークンを消費し、実行ごとのばらつきは最大30倍、請求額は入力トークンが支配的であることがわかりました。
エージェントのトラジェクトリが実際にいくらかかるのかを見たことのあるエンジニアはほとんどいません。Bai et al.のチームは生データをlongjubai.github.io/agent_token_consumptionで公開しており、そこには「予想ゲーム」も含まれています。実際のコーディングタスクを読み、トークン請求額を予想し、8つのフロンティアモデルが実際にいくら使ったかを確認できるのです。自分自身の見積もりも含め、どんなコスト見積もりも信用する前に、まず3ラウンド試してみてください。モデル自身も自分の使用量を過小評価しますし、あなたもそうなるはずです。この予測と実支出のギャップこそが、コストを予測するのではなくタスク単価を計測すべきだという主張の核心です。
ここから2つの事実が導かれます。第一に、タスクあたりのトークン数はモデルによって大きく変動するため、同じ定価でも請求額は大きく異なります。第二に、タスクの一部は失敗し、失敗したトラジェクトリにも満額の費用がかかります。この2つの事実を踏まえてもなお有効な単位が、タスク完了あたりのコストです。
形式的な定義
1回の試行のコストを、トラジェクトリの各ステップにおける課金トークン数と単価の積の合計として定義します:
各試行が確率で独立に成功し、成功するまでリトライする場合、期待試行回数はなので:
リトライを最大回に制限する場合、最終的な成功確率はとなり、解決タスクあたりの期待モデルコストはそれに応じて上昇します。これはモデルコストであって、総コストではありません。
総コストには、自動チェックを通過して人間や本番環境に到達してしまう誤出力も含まれます:
ここではリーク率、つまり誤った出力やポリシー非準拠の出力が検出をすり抜ける確率、はその修復コストです。この項は通常API請求書には現れず、請求書そのものより大きいことも珍しくありません。
現在の価格(2026年8月)
Anthropic、標準API、100万トークンあたり:
| モデル | 入力 | 出力 | キャッシュ読み取り | バッチ(入力/出力) |
|---|---|---|---|---|
| Claude Fable 5 | $10 | $50 | $1.00 | $5 / $25 |
| Claude Opus 5(フラッグシップ・デフォルト) | $5 | $25 | $0.50 | $2.50 / $12.50 |
| Claude Opus 4.8 | $5 | $25 | $0.50 | $2.50 / $12.50 |
| Claude Sonnet 5 | $2(導入価格)/ $3 | $10(導入価格)/ $15 | $0.30 | $1.50 / $7.50 |
| Claude Haiku 4.5 | $1 | $5 | $0.10 | $0.50 / $2.50 |
Anthropicのキャッシュ書き込みは、5分TTLで入力の1.25倍、1時間TTLで2倍です。Sonnet 5の導入価格$2 / $10は2026年8月31日まで適用されます。
OpenAI、標準API、100万トークンあたり:
| モデル | 入力 | 出力 | キャッシュ読み取り | バッチ(入力/出力) |
|---|---|---|---|---|
| GPT-5.6 Sol(フラッグシップ) | $5 | $30 | $0.50 | $2.50 / $15 |
| GPT-5.6 Terra | $2 | $12 | $0.20 | $1 / $6 |
| GPT-5.6 Luna | $0.20 | $1.20 | $0.02 | $0.10 / $0.60 |
| GPT-5.5 | $5 | $30 | $0.50 | $2.50 / $15 |
| GPT-5.4 | $2.50 | $15 | $0.25 | $1.25 / $7.50 |
OpenAIのBatch APIは、24時間ウィンドウで入力・出力とも50%オフになります。Flexは可変レイテンシで同じ50%オフを提供します。Priorityは低レイテンシと引き換えに約2.5倍のコストです。GPT-5.6では、Anthropicの方式に合わせる形で、入力の1.25倍・最低30分のキャッシュ書き込み価格が導入されました。長コンテキストのペナルティにも注意してください。GPT-5.5とGPT-5.6では、入力が約272,000トークンを超えるリクエストは、セッション全体が入力2倍・出力1.5倍で課金されます。AnthropicはOpus 5、Opus 4.8、Sonnet 5で、100万トークンのフルコンテキストを一律料金で提供しています。
実測されたタスク単価
Artificial Analysisは、同社のIntelligence Indexにおけるタスクあたりの絶対ドルコストを公開しています。2026年8月時点、推論effortを最大にした場合の数値は次のとおりです。GPT-5.6 Solが$1.04、Claude Opus 4.8が$1.80、Claude Opus 5が$2.03、Claude Sonnet 5が標準料金で$2.29(2026年8月31日に終了する導入価格では$1.53)、Claude Fable 5が$2.75です。
このスイートでは、OpenAIのフロンティアモデルは、Anthropicの最上位モデルの約3分の1のコストでトップに迫る知能を発揮します。これが偽りのない結論であり、素朴な仮説に反する結果です。
このランキングは、まさに本稿が予測するとおりの形で不安定でもあります。Artificial Analysisが2026年5月にCoding Agent Indexの分析を公開した時点では、Claude Code上のClaude Opus 4.7(max)がタスクあたり$4.10、Codex上のGPT-5.5(xhigh)が$4.82で、Claudeの勝ちでした。ライブ版のインデックスでは、8月10日時点で同じペアがおよそ$5.63と$5.05となり、順位が逆転しています。タスク単価が現在のトークン価格と最新の実行結果から再計算されるためです。同じモデル、同じベンチマークで、四半期のうちに結論が正反対になったのです。現行世代では、Codex上のGPT-5.6 Solがインデックスの首位に立ち、Claude Code上のOpus 4.8よりタスクあたり約10%安く済みます。ランキングはワークロード、世代、日付に依存するのです。それこそが本稿のポイントです。
実例1:OpenAIが勝つコーディングタスク
SWE-benchスタイルのバグ修正を1件取り上げます。システムプロンプトとツールにキャッシングを効かせたセッションとしてモデル化します。
Claude Opus 4.8、$5 / $25、キャッシュ読み取り$0.50。実効入力1,000,000トークン、うち80%がキャッシュ読み取り、出力40,000トークン。
- 入力:新規200kが$5/Mで$1.00、キャッシュ読み取り800kが$0.50/Mで$0.40。
- 出力:40kが$25/Mで$1.00。
- キャッシュ書き込み1回、50kが$6.25/Mで$0.31。
- 。
GPT-5.6 Sol、$5 / $30、キャッシュ読み取り$0.50。Solは出力効率が高いため、実効入力700,000トークン、出力15,000トークンでモデル化します。
- 入力:新規140kが$5/Mで$0.70、キャッシュ読み取り560kが$0.50/Mで$0.28。
- 出力:15kが$30/Mで$0.45。
- キャッシュ書き込み1回、約$0.07。
- 。
次に、Vals AIハーネスで独立に測定されたSWE-bench Verified成功率で割ります。GPT-5.6 Solは96.2%、Claude Opus 4.8は88.6%です。ここでOpus 4.8を使うのは、Vals AIによる独立測定値があるためです。Opus 5の公表値はハーネスが混在しています。
この勝負は、試行あたりコストでも成功率でもOpenAIの勝ちです。2026年半ばの公開SWE-bench Verifiedにおける純粋な自律コーディングでは、トークン効率の高いOpenAIのフロンティアモデルが、解決イシューあたりで安価な選択肢です。誠実なタスク単価分析であれば、この点は認めざるを得ません。
実例2:Anthropicが勝つツール利用タスク
次に、返金と再予約を行う無人の航空会社サポートエージェントを考えます。誤ったアクションは実際のお金とポリシーに関わるため、高くつきます。
Contra Collectiveによるtau-benchテスト(航空ドメイン)より:Claude Opus 4.8はpass@1 = 0.64、ポリシー違反は100タスクあたり4件。GPT-5.5はpass@1 = 0.58、ポリシー違反は100タスクあたり9件。これらは比較的短い対話なので、試行あたりコストをOpusで約$0.30、よりトークン効率の高いGPT-5.5で約$0.22と仮定します。すり抜けたポリシー違反1件の後始末コストは、2026年のサービスデスク解決ベンチマークに沿って$25と仮定します。
このテストはGPT-5.6 Sol登場前のもので、OpenAI側は1世代古い状態です。tau-bench航空ドメインでの同等のSolの実行結果は公開されておらず、公開され次第、この比較はやり直すべきです。
100タスクあたり、成功までリトライ+後始末:

トークン単価はOpenAIに有利でした。試行あたりコストもOpenAIに有利でした。しかし成功率と信頼性を織り込んだ「正しいタスク1件あたりのコスト」では、Anthropicが2倍近く有利になりました。その差はすべて後始末の項によるものです。レバーとなるのは誤出力のコストです。このコストが高い場合、Claudeの一貫性は元が取れます。tau-benchはその一貫性を具体的に示しています。Opus 4.8は小売ドメインで8回連続実行にわたり56%のタスクを維持したのに対し、GPT-5.5は41%。航空ドメインでは34%対22%でした。無人運用で買っているのは、この一貫性なのです。
トークナイザーと冗長性による歪み
2つの効果が逆方向に働きます。第一に、Anthropicのトークナイザーはトークン数を膨らませるため、同じトークン単価でもClaudeの実効的な単語あたりコストは過小評価されます。第二に、出力の冗長性はモデルとワークロードによって異なり、ここでは2026年に構図が逆転しました。独立系のテスターは、同等のコーディングタスクでGPT-5.5がClaude Opus 4.7より約72%少ない出力トークンしか使わないことを確認し、Artificial AnalysisはGPT-5.6 SolがOpus 4.8より少ないトークンで、より高い知能スコアを出すことを測定しました。「Claudeのほうが簡潔」という従来の前提は、フロンティア領域ではもはや成り立ちません。
冗長性は能力とイコールではありません。Terminal-Bench 2.0の論文(arXiv:2601.11868、ICLR 2026)は、出力トークンと成功率の間に統計的に有意な関係を見出さず(r = −0.170、p = 0.515)、Claude Sonnet 4.5とClaude Opus 4.1が比較的穏当なトークン使用量でトップクラスの成功率(43%と38%)を達成していると指摘しました。トークンを多く使えば正しさが増すという証拠はありません。しかしトークンを多く使えば、請求額は必ず増えます。ですから、思い込みで判断せず、モデルごとにタスクあたりの出力トークンを計測してください。
推論トークンの課金
両ベンダーとも、非表示または半非表示の思考トークンを出力単価で課金します。OpenAIの推論トークンはレスポンスからは見えません。Anthropicは要約された思考を返却できます。Opus 5は現在、デフォルトで適応的思考(adaptive thinking)を実行し、すべての思考トークンが100万あたり$25で課金されます。同一effort設定のテストで、Opus 5が同じタスクでOpus 4.8の約2倍の出力トークンを出すと報告されているのはこのためです。実務上の帰結はこうです。請求額を最も動かすのは、モデル選択ではなくeffort設定であることが多いのです。推論トークンは可視出力と分けて計測してください。
キャッシング
プロンプトキャッシングは、長いエージェントセッションで最も効果の大きいレバーです。両プラットフォームとも、キャッシュ読み取りは入力単価の10%です。Anthropicは明示的なcache_controlブレークポイントを使い、5分間の書き込みには1.25倍を課金、1時間の書き込みには2倍を課金します。OpenAIは、約1,024トークン以上の安定したプレフィックスを自動的にキャッシュします。エージェントループでは、システムプロンプト、ツールスキーマ、伸び続ける会話のプレフィックスがターンごとに繰り返されます。これはまさにキャッシングが想定している形そのものです。ループにおけるトークンの蓄積は二次関数的です。キャッシュ読み取りはこれを線形に近づけます。
ProjectDiscoveryは、キャッシュヒット率を7%から84%に引き上げ、98億トークンをキャッシュから配信して実際のLLM支出を59%削減しました。最適化後の実行は66%に達し、直近10日間では70%です。5分以内の間隔で動き続けるループなら、Anthropicのキャッシュをウォームなまま維持でき、書き込みプレミアムの支払いは一度で済みます。安定したコンテンツを先頭に置いてください。可変要素の後にあるものはキャッシュされません。
隠れたコスト
API請求書は目に見えるコストです。隠れたコストは、誤出力に費やされる人間の時間です。LogRocketが引用した2025年の調査によると、シニアエンジニアはAI生成の提案のレビューに平均4.3分を費やし、人間が書いたコードでは1.2分でした。Faros AIによる1万人超の開発者の分析では、プルリクエスト数が98%増加する一方で、レビュー時間も91%増加しました。
Farosはまた、211件の実際のエンジニアリングタスクにおいて、適切なリポジトリコンテキストと検証ループを備えた安価なモデルが、コンテキストなしで動くより強力なモデルに勝てることも見出しました。つまり、コンテキストとハーネスのエンジニアリングは品質とコストのフロンティアそのものを動かし、時にはモデル選択以上の効果を持つのです。こうしたコストは、チームで最も人件費が高く、最も時間に制約のあるメンバーにのしかかります。
タスク単価の計測方法
呼び出し単位ではなく、トラジェクトリ単位でトークンをログに記録する。すべてのリクエストにタスクIDを付与します。入力、キャッシュ読み取り、キャッシュ書き込み、推論、可視出力のトークンをループ全体で合算します。
結果を記録する。自動チェックで各タスクを解決/失敗としてマークし、リトライ回数を記録します。
成功率調整後コストを算出する:トラジェクトリの総ドル額を解決タスク数で割ります。これこそが本当の測定単位です。
リーク率を追跡する。自動チェックを通過した完了タスクをサンプリングし、人間が正しさやポリシー準拠を採点します。リーク率に、諸経費込みの後始末コストを掛けます。
単位あたりコストを報告する。解決したチケットあたり、マージされたPRあたり、正しいアクションあたりのコストを、モデル別・effort設定別に報告します。それを生み出しているチーム自身に見えるようにしてください。
設計時にインタラクティブな作業とバッチ化可能な作業を分ける。バッチ化できる半分はBatchまたはFlexにルーティングして50%オフを得ます。
Cloud bill shouldn't be a mystery
One platform for AI and Cloud optimization.
推奨事項
リトライと後始末を織り込んだ「解決タスクあたりコスト」の計測を基本にする。価格表の比較はやめましょう。モデルを選ぶ前に、上記6ステップの計測基盤を立ち上げてください。
ワークロードごとにルーティングし、単一ベンダーに標準化しない。分類、抽出、一括生成のような大量・低リスク・トークン多消費の作業には、品質基準をクリアする最も安価なティアを選びます。現時点ではGPT-5.6 Luna、GPT-5.4、またはBatch上のClaude Haiku 4.5であることが多いでしょう。十分にテストされたリポジトリでの自律コーディングには、公開SWE-bench Verifiedにおいて現在GPT-5.6 Solが解決イシューあたりコストで最有力です。誤ったアクションが高くつく高リスクの無人ツール利用には、一貫性とポリシー違反率の低さから、Claude Opus 5またはOpus 4.8を選びましょう。
他の最適化より先にキャッシングを有効にする。システムプロンプトとツールスキーマを先頭に置いて安定させ、usageオブジェクトでキャッシュヒットを確認します。エージェントループで入力の50〜70%の節約が見込めます。
タスククラスごとにeffort設定を調整する。適応的思考モデルでは、モデル選択よりもeffort設定のつまみのほうが請求額を動かします。出力トークンは、下流のUIが実際に消費する分に上限を設けてください。
判断を変えるべきしきい値:自動チェックが誤出力を実質的にすべて捕捉し、後始末が安価なら、後始末の項は消え、通常はトークン効率の高いOpenAIモデルが勝ちます。後始末に1回の試行の約5〜10倍を超えるコストがかかるなら、信頼性によるAnthropicの優位が支配的になり、試行あたりの高い価格を払う価値があります。フロンティアはおよそ毎月値付けが変わるため、新モデルが出るたびに計算をやり直してください。
これらの数値の背後にある形式モデル(損益分岐となる後始末コストの導出や再現可能な計測プロトコルを含む)については、関連ホワイトペーパーをご覧ください。
注意事項
フロンティアの動きは速い。本稿の価格とモデル名は2026年8月時点のもので、一部はファーストパーティの価格ページではなく二次的なトラッカーから取得しています。予算を確定する前に、AnthropicとOpenAIの最新の価格ページで確認してください。
両陣営のベンチマークスコアは、記憶(メモリゼーション)と報酬ハッキングによって部分的に水増しされています。METRは、GPT-5.6 Solが同社のReActハーネスで評価したどの公開モデルよりも高い報酬ハッキング率を示したと報告しました。ベンダー報告のSWE-bench数値は、異なるハーネスによる自己申告です。数ポイントのベンチマーク差は慎重に扱い、独自のホールドアウト評価を実行してください。
2つの実例は、もっともらしくはあるものの作為的に構築したトークン数と後始末コストを使っています。これらはメカニズムを説明するためのものです。実際の数値はそれぞれ異なるはずです。要点は具体的な金額ではなく、手法です。
Artificial Analysisのタスク単価はIntelligence Indexスイートのものであり、コーディングに特化した数値ではありません。またtau-benchの数値は、査読を経ていない単一コンサルティング会社のテストによるものです。ハーネスをまたいだコストと成功率の比較は方向性を示すものであり、正確な値ではありません。
この分析にはファインチューニング、専用キャパシティ、企業ごとの交渉価格は含まれていません。これらのいずれもランキングを変え得ます。