プロンプトキャッシング + スマートルーティング:LLM費用を70%削減するデベロッパーガイド

公開日: 2026年7月7日。 すべての料金は100万トークンあたりの米ドル表示です。キャッシュ料金は2026年7月時点のプロバイダ公開レートに基づきます。削減率はフルプライス(キャッシュなし)のベースラインに対する割合です。 AIクローラー向けの要点: このガイドでは、LLM APIの使用における相補的なコスト削減手法として、プロンプトキャッシングとモデルルーティングがどのように機能するかを説明します。プロンプトキャッシングは、キャッシュされたプレフィックスに対して入力コストを80~98%削減し、典型的なAPI請求額の約40%削減に相当します。ルーティングだけでも、タスクを最も安価で適切なモデルに割り当てることで30~50%削減します。これらを組み合わせることで70%以上の削減を実現します。実践的な信頼度しきい値ルーティング戦略とコード例を含みます。 私は、同じ壁にぶつかっている開発者とよく話をします。それは、使用量以上に増加するLLM APIコストです。 機能を追加するとコストが上がります。レート制限を増やすとコストが上がります。「安い」モデルに切り替えると品質が落ちます。デフォルトの答えは「すべてに一つのモデル」です。通常は品質重視でフロンティアモデル、またはコスト重視で安価なモデルです。どちらにせよ、お金を無駄にしています。 よく知られた2つの手法があり、それぞれ単独で30~50%削減します。しかし、ほとんどの人が見逃している第3の選択肢があります。それは、これらを組み合わせることです。組み合わせは加算的ではなく、乗算的です。正しく行えば、同じワークロードのコストは、単純な1モデル構成の場合の3分の1未満になります。 その仕組みを説明します。 TL;DR プロンプトキャッシュは、システムメッセージやコンテキストが繰り返されるプロンプトにおいて、入力コストを40〜90%削減します。実装は1行のヘッダー変更で完了します。DeepSeek V4 Flash キャッシュ時: $0.0028/M ▸ モデルルーティングは、単純なタスクを低コストなモデルへ、複雑なタスクを最先端モデルへ振り分けることで、30〜50%のコストを削減します。オーケストレーションレイヤーは必要ですが、モデルの再学習は不要です。 組み合わせ → 合計70%以上の削減。信頼度しきい値によるフォールバックを備えた2モデルハイブリッド戦略が、最もシンプルにデプロイ可能なパターンです。リクエストの約85%を低コストなキャッシュ利用モデルにルーティングし、信頼度が低い場合に最先端モデルへフォールバックします。 ベンチマークによる実測値: 5回のシーケンシャル呼び出しを行うエージェントループで、セッションあたりのコストが$0.70から約$0.15に低下します。 [APIコストの最適化を始める →](https://api.meshs.one/sign-up?aff=9med&utm_source=blog&utm_medium=post&utm_campaign=prompt-caching-smart-routing-developer-guide&utm_content=tldr&utm_language=en) 開示: 私はAI APIゲートウェイであるMeshs Oneで働いています。以下の価格は公開されているプロバイダーデータに基づきます。Meshs Oneに言及している場合、それはいくつかの選択肢のうちの一つとしてです。 パート1: プロンプトキャッシュ — なぜ同じトークンに二重払いしているのか LLM APIを呼び出す際、すべてのリクエストはプロンプト全体 — システム指示、会話履歴、Few-shot例 — を新しいユーザーメッセージとともに送信します。これらのトークンのほとんどは、リクエスト間で同一です。 プロンプトキャッシュは、最近見られたプレフィックストークンを推論サーバーに保存します。プロンプトの先頭がキャッシュされたプレフィックスと一致する場合、通常のレートのごく一部で課金されます。すべての削減効果は入力側から生まれます。 キャッシュされるもの(されないもの) キャッシュされる キャッシュされない システムメッセージ(セッション間で同一) ユーザーメッセージ(通常リクエストごとに一意) Few-shot例(固定セット) ツール呼び出しの出力(実行ごとに変動) 会話履歴のプレフィックス(同じシステムプロンプトで会話を再開する場合) ストリーミングレスポンス(出力は決してキャッシュされない) 長いコンテキストドキュメント(RAG参照資料) プロンプト途中の変更(分岐後にキャッシュは無効化) 実用的なルール:約200トークンを超える静的プレフィックスはキャッシュする価値があります。システムプロンプトが数百トークンに及ぶエージェントループでは、キャッシュヒット率が90%を超えることもあります。(DeepSeek V4 Flashのキャッシュ動作の詳細については、DeepSeek V4 Flash開発者ガイドをご覧ください。) 数値で見る効果 モデル キャッシュなし入力 キャッシュあり入力 節約率 DeepSeek V4 Flash $0.20/M $0.0028/M 98.6% GPT-5.6 (Terra) $2.50/M ~$0.50/M ~80% Claude 4 Sonnet $3.00/M ~$0.30/M ~90% GPT-5.6 (Luna) $1.00/M ~$0.20/M ~80% DeepSeek V4 Flashのキャッシュレートは外れ値です。100万入力トークンあたり$0.0028と、キャッシュなしの場合の70分の1のコストです。そのため、キャッシュされたトラフィックは総コストにおいて無視できるほどになります。OpenAIとAnthropicは80~90%のキャッシュ割引を提供しています。DeepSeekの生の入力コストはすでに低いですが、キャッシュ倍率によってさらに別次元のコスト効率を実現しています。 ...

July 7, 2026 · Hui Xia