Skip to content

Column

「クラウドは高い」は本当か——コーディングエージェント28日実運用データが示す逆転条件

クラウドAPI(Claude Opus)とオンプレ量子化OSS(GLM-5.1/5.2)を各28日間の実運用ログで比較。プロンプトキャッシュヒット率99.3%でAPIの実効コストはオンプレを下回った。一方でFix Commit Ratioはオンプレが2.6〜4.9倍高く、コスト・品質・DevExの三軸で判断する経営フレームを整理する。

5 分で読める English version →
クラウドとオンプレサーバーを天秤にかけ、コストと品質の数値が浮かぶビジネスイメージ図

こんにちは。Affectosphere Group の三浦です。

「AI活用を本格化したいが、クラウドAPIはコストが読めない。オンプレに移行したほうがいいのでは」——こういう議論、最近の経営会議や技術検討の場でよく聞きます。

この「常識」が、使い方次第で逆転する実証データが出てきました。

2026年7月にarXivで公開された研究(Sheng-Wei Peng, Yi-Hsun Lin, Yi-Pei Lee; arXiv:2607.13080)は、エンタープライズのコーディングエージェントを28日間にわたって実運用し、クラウドAPIとオンプレの両方のコスト・品質・運用負荷を比較したものです。単なるベンチマークではなく、実際のエンジニアが業務で使ったログを分析しています。その分、経営判断の参考として使いやすいデータになっています。


今日の3点

  1. キャッシュ最適化でクラウドAPIのコストがオンプレを下回ることがある。繰り返しプロンプトが多い業務では、キャッシュ設計がTCOを左右する。
  2. コード品質(Fix Commit Ratio)はオンプレが2.6〜4.9倍高い。コスト逆転が起きても品質差は残るため、コスト・品質・DevExの三軸での評価が必要。
  3. Fix Commit Ratioは社内AIツールの品質KPIとして転用できる。「AIが提案したコードが実際にコミットされた割合」という指標は、LLMの現場貢献度を測る出発点になる。

① 「クラウドは高い」の逆転条件

まず、コスト面の話から入ります。

一般的なイメージでは、クラウドAPIは使うほど課金が増え、オンプレはハードウェアを一度買えば固定費になる、という感覚があります。長期的にはオンプレのほうが安い、という前提で意思決定している企業も少なくないはずです。

この研究は、その前提をひっくり返す可能性を示しています。

Claude Opus(クラウドAPI)を28日間運用したところ、プロンプトキャッシュのヒット率が99.3%に達しました。この結果、実効コストは1Mトークンあたり$0.57でした。

比較対象のオンプレ側(量子化OSS、GLM-5.1/5.2)は、GPU減価償却を含めると1Mトークンあたり$2.83でした。

つまり、クラウドAPIのほうが安かった、ということになります。

なぜこうなるのか。理由は「プロンプトキャッシュ」にあります。

コーディングエージェントのような業務では、システムプロンプトやコードベースのコンテキストなど、毎回ほぼ同じ内容が含まれます。キャッシュが効けば、この部分の処理コストが大幅に下がります。99.3%というヒット率は、ほぼすべてのリクエストでキャッシュが効いていたということです。

逆に言えば、キャッシュがほとんど効かない業務——毎回まったく異なるコンテキストを投入するユースケース——では、この逆転は起きないかもしれません。

コスト比較の際は「自社のプロンプトにはどれくらい繰り返しの要素があるか」を先に確認することが、判断精度を上げる鍵になります。

もうひとつ重要な注意点があります。この研究では「DevExコスト(開発者体験に関わる運用負荷)」がTCOに含まれていません。オンプレ運用にはモデルの管理・更新・監視といった内部コストが伴いますが、その部分が未計上です。数値を使う際は「DevExコスト込みでは比較が変わる可能性がある」という前提で読む必要があります。


② 品質の差は「コスト逆転」後も残る

コスト面でクラウドが優位に見えた一方で、品質面では別の話があります。

この研究では「Fix Commit Ratio(FCR)」という指標を使っています。AIが提案した修正(fix)がどれくらい実際にコミットされたか、という割合です。AIツールが現場で実際に役に立っているかを測る、実務的な指標といえます。

結果は、オンプレ74.9%、クラウドAPI45.9%でした。

オンプレが2.6〜4.9倍高い、というのは大きな差です。

コスト的にはクラウドAPIが有利でも、エンジニアが「これは使えない」と判断してコミットに至らない提案が半数以上あるとしたら、実際の生産性への貢献度は低くなります。

この差がなぜ生まれるのかは、研究では完全には解明されていません。モデルの能力差やキャッシュの使い方が品質に影響している可能性はありますが、断定はできません。

重要なのは「コストだけ見てもROIは分からない」という点です。

1Mトークンあたりのコストが安くても、そこから生まれる生産性貢献が小さければ、単純なコスト比較では判断を誤ります。

また、この研究ではTCO試算として「共有GPUオンプレが40.1%削減の場合もある」という結果も示されています。ただしこれは前述のDevExコストが未計上の数値です。「オンプレのほうが安い場面もある」という可能性は残っており、単純にどちらが優れているという結論は出ていません。

経営の観点では、コスト・品質・DevExの三軸で評価する必要があります。


③ Fix Commit Ratioを社内KPIに転用する

この研究で面白いのは、「Fix Commit Ratio」という指標の設計思想です。

AIが提案したコードが、最終的にどれだけ実際のコードベースに取り込まれたか。これは「エンジニアが実際に信頼して使った割合」とも解釈できます。

社内でAIコーディングツールを導入している、あるいは検討している組織にとって、この指標は汎用性があります。

たとえば、ツール選定のフェーズでは、候補となるLLMやツールを並べて同じコードベース・同じタスクでFCRを測ることができます。「この数値が高いほど現場で使われる確率が高い」という仮説のもとで、定量的な選定ができます。

展開後の品質モニタリングにも使えます。ツールを導入した後、FCRが時系列でどう推移するかを追うことで、エンジニアがAIの提案をどれくらい受け入れているかの感度が数値として見えてきます。

モデルを更新した際の評価にも転用できます。バージョンアップ前後でFCRを比較することで、品質の改善・劣化を定量的に確認できます。

ただし注意点もあります。FCRが低い理由がAIの品質の低さにあるのか、エンジニアの使い方や組織文化にあるのかは、数値だけでは分かりません。定性的な現場の声と組み合わせた解釈が必要です。

また、この研究ではハイブリッドルーティング(用途に応じてクラウドとオンプレを切り替える)についても検討されていますが、「明確な優位なし」という結果でした。単純にミックスすれば良いわけではなく、ルーティング設計の質が問われます。


持ち帰れる3つの問い

この研究から、自社の判断に直結する問いを取り出すとすれば、以下の3点になります。

まず、自社のプロンプトにはどれくらい繰り返し構造があるか。コーディングエージェントや社内QAシステムのように、ほぼ同じシステムプロンプトを毎回使う業務ならキャッシュが効きやすく、クラウドAPIのコスト優位が出やすいです。

次に、現在使っているAIツールの品質をFix Commit Ratio相当の指標で測っているか。「なんとなく使われている気がする」ではなく「どれくらいの割合で実際の成果に繋がっているか」を可視化することが、次の投資判断の根拠になります。

そして、DevExコストを含めた総合TCOで比較しているか。GPU調達・保守・バージョン管理・チームの運用オーバーヘッドを含めない比較では、オンプレの「安さ」を過大評価しやすいです。

「クラウドかオンプレか」という問いは、実は多軸の評価問題です。この研究は、その評価軸を整理する出発点として使えます。

では!


参考論文

  1. Sheng-Wei Peng, Yi-Hsun Lin, Yi-Pei Lee (2026). Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs. arXiv preprint. https://arxiv.org/abs/2607.13080

※ 本記事は一部 AI により執筆されており、間違った情報が含まれる恐れがあります。