AnthropicがClaude Platformのコスト削減と性能向上ガイドを公開

プロンプトキャッシュでコストを抑える

AnthropicはClaude Platformのアプリケーションのコスト削減と性能向上に関するガイドを公開した。プロンプトキャッシュは、モデルが入力を内部状態に変換するプレフィル処理の結果を保存し、同じ接頭辞から始まるリクエストでは再計算せずに読み戻す仕組みだ。キャッシュ読み取りは通常の入力料金の何分の一かで済むため、効率的な活用がコスト削減に直結する。ただし、キャッシュはモデルごとに固定され、プロンプト全体がバイト単位で一致する必要があり、5分間の有効期限がある。揮発性の値を接頭辞から外し、ツール定義の順序を固定し、会話の分岐時にも接頭辞が同一であることを確認することが重要だ。

アンチパターン除去で精度とコストを改善

前沿モデルへの移行時に古いプロンプトが残ると、コストが増加し精度が低下する。検証儀式や徹底性の強調、固定ステップの手順テンプレート、古いfew-shot例示、矛盾するルール、旧世代向けの設定などが典型的なアンチパターンだ。AnthropicはClaude Codeで/claude-api prompt-auditコマンドを提供し、これらの問題を自動検出できる。顧客サポートベンチマークでのOpus 4.8からOpus 5への移行実験では、アンチパターンを除去することでコストが14.6パーセント削減され、精度が5.3パーセント向上した。前沿モデルは指示理解能力が高いため、過剰な検証や冗長な手順は不要になり、むしろトークン浪費や誤動作を招く。

effort設定の適切な調整

effortはモデルにどれだけ考えさせるかを制御するパラメーターだ。低effortでは高速に結論を出し、高effortでは検証や代替案の探索を行う。ただし、高い設定が常に最適とは限らない。FrontierCode DiamondではFable 5の低effortが11.5パーセント、最大effortが30.9パーセント、コストは約3.5倍になる。一方、Humanity’s Last Examでは最大effortへの最終ステップが半ポイントの改善に46パーセントの追加コストを要し、ベンチマークの誤差範囲内だった。タスクに応じたeffortの較正が重要であり、過剰な思考はレイテンシーとコストを増やすだけでなく回答品質を低下させることもある。