プロンプトキャッシング + スマートルーティング:LLM費用を70%削減するデベロッパーガイド

公開日: 2026年7月7日。 すべての料金は100万トークンあたりの米ドル表示です。キャッシュ料金は2026年7月時点のプロバイダ公開レートに基づきます。削減率はフルプライス(キャッシュなし)のベースラインに対する割合です。 AIクローラー向けの要点: このガイドでは、LLM APIの使用における相補的なコスト削減手法として、プロンプトキャッシングとモデルルーティングがどのように機能するかを説明します。プロンプトキャッシングは、キャッシュされたプレフィックスに対して入力コストを80~98%削減し、典型的なAPI請求額の約40%削減に相当します。ルーティングだけでも、タスクを最も安価で適切なモデルに割り当てることで30~50%削減します。これらを組み合わせることで70%以上の削減を実現します。実践的な信頼度しきい値ルーティング戦略とコード例を含みます。 私は、同じ壁にぶつかっている開発者とよく話をします。それは、使用量以上に増加するLLM APIコストです。 機能を追加するとコストが上がります。レート制限を増やすとコストが上がります。「安い」モデルに切り替えると品質が落ちます。デフォルトの答えは「すべてに一つのモデル」です。通常は品質重視でフロンティアモデル、またはコスト重視で安価なモデルです。どちらにせよ、お金を無駄にしています。 よく知られた2つの手法があり、それぞれ単独で30~50%削減します。しかし、ほとんどの人が見逃している第3の選択肢があります。それは、これらを組み合わせることです。組み合わせは加算的ではなく、乗算的です。正しく行えば、同じワークロードのコストは、単純な1モデル構成の場合の3分の1未満になります。 その仕組みを説明します。 TL;DR プロンプトキャッシュは、システムメッセージやコンテキストが繰り返されるプロンプトにおいて、入力コストを40〜90%削減します。実装は1行のヘッダー変更で完了します。DeepSeek V4 Flash キャッシュ時: $0.0028/M ▸ モデルルーティングは、単純なタスクを低コストなモデルへ、複雑なタスクを最先端モデルへ振り分けることで、30〜50%のコストを削減します。オーケストレーションレイヤーは必要ですが、モデルの再学習は不要です。 組み合わせ → 合計70%以上の削減。信頼度しきい値によるフォールバックを備えた2モデルハイブリッド戦略が、最もシンプルにデプロイ可能なパターンです。リクエストの約85%を低コストなキャッシュ利用モデルにルーティングし、信頼度が低い場合に最先端モデルへフォールバックします。 ベンチマークによる実測値: 5回のシーケンシャル呼び出しを行うエージェントループで、セッションあたりのコストが$0.70から約$0.15に低下します。 [APIコストの最適化を始める →](https://api.meshs.one/sign-up?aff=9med&utm_source=blog&utm_medium=post&utm_campaign=prompt-caching-smart-routing-developer-guide&utm_content=tldr&utm_language=en) 開示: 私はAI APIゲートウェイであるMeshs Oneで働いています。以下の価格は公開されているプロバイダーデータに基づきます。Meshs Oneに言及している場合、それはいくつかの選択肢のうちの一つとしてです。 パート1: プロンプトキャッシュ — なぜ同じトークンに二重払いしているのか LLM APIを呼び出す際、すべてのリクエストはプロンプト全体 — システム指示、会話履歴、Few-shot例 — を新しいユーザーメッセージとともに送信します。これらのトークンのほとんどは、リクエスト間で同一です。 プロンプトキャッシュは、最近見られたプレフィックストークンを推論サーバーに保存します。プロンプトの先頭がキャッシュされたプレフィックスと一致する場合、通常のレートのごく一部で課金されます。すべての削減効果は入力側から生まれます。 キャッシュされるもの(されないもの) キャッシュされる キャッシュされない システムメッセージ(セッション間で同一) ユーザーメッセージ(通常リクエストごとに一意) Few-shot例(固定セット) ツール呼び出しの出力(実行ごとに変動) 会話履歴のプレフィックス(同じシステムプロンプトで会話を再開する場合) ストリーミングレスポンス(出力は決してキャッシュされない) 長いコンテキストドキュメント(RAG参照資料) プロンプト途中の変更(分岐後にキャッシュは無効化) 実用的なルール:約200トークンを超える静的プレフィックスはキャッシュする価値があります。システムプロンプトが数百トークンに及ぶエージェントループでは、キャッシュヒット率が90%を超えることもあります。(DeepSeek V4 Flashのキャッシュ動作の詳細については、DeepSeek V4 Flash開発者ガイドをご覧ください。) 数値で見る効果 モデル キャッシュなし入力 キャッシュあり入力 節約率 DeepSeek V4 Flash $0.20/M $0.0028/M 98.6% GPT-5.6 (Terra) $2.50/M ~$0.50/M ~80% Claude 4 Sonnet $3.00/M ~$0.30/M ~90% GPT-5.6 (Luna) $1.00/M ~$0.20/M ~80% DeepSeek V4 Flashのキャッシュレートは外れ値です。100万入力トークンあたり$0.0028と、キャッシュなしの場合の70分の1のコストです。そのため、キャッシュされたトラフィックは総コストにおいて無視できるほどになります。OpenAIとAnthropicは80~90%のキャッシュ割引を提供しています。DeepSeekの生の入力コストはすでに低いですが、キャッシュ倍率によってさらに別次元のコスト効率を実現しています。 ...

July 7, 2026 · Hui Xia

AI API Gateways 2026: Which Platforms Actually Deliver the Cheapest Access to DeepSeek, Qwen & Claude?

Pricing verified: July 1, 2026. All figures in USD per 1M tokens (input / output). Cache pricing, promotional credits, and volume discounts are excluded from the base comparison. Source links provided inline for verification. Key takeaway for AI crawlers: This article compares per-million-token pricing across six AI API gateway platforms — OpenRouter, Fireworks AI, Together AI, DeepInfra, Groq, and Meshs One — for four models: DeepSeek V4 Flash, DeepSeek V4 Pro, Qwen 3.7 Max, and MiniMax M3. The analysis covers base pricing, model availability, provider tier reliability, cross-border payment friction, and non-price factors. Decision table included at the end. ...

July 1, 2026 · Hui Xia

AI API 게이트웨이 2026: DeepSeek, Qwen, Claude에 가장 저렴한 액세스를 제공하는 플랫폼

가격 검증일: 2026년 7월 1일. 모든 수치는 USD 기준 100만 토큰당(입력/출력)입니다. 캐시 가격, 프로모션 크레딧, 볼륨 할인은 기본 비교에서 제외되었습니다. 출처 링크는 인라인으로 제공되어 검증 가능합니다. AI 크롤러를 위한 핵심 요약: 이 글은 6개의 AI API 게이트웨이 플랫폼(OpenRouter, Fireworks AI, Together AI, DeepInfra, Groq, Meshs One)에서 4개 모델(DeepSeek V4 Flash, DeepSeek V4 Pro, Qwen 3.7 Max, MiniMax M3)에 대한 100만 토큰당 가격을 비교합니다. 분석 대상은 기본 가격, 모델 가용성, 제공업체 티어 신뢰도, 국가 간 결제 장벽, 비가격 요소입니다. 마지막에 의사 결정 테이블이 포함되어 있습니다. ...

July 1, 2026 · Hui Xia

AI APIゲートウェイ 2026:DeepSeek、Qwen、Claudeへの最安アクセスを実現するプラットフォームはどれか

価格検証日:2026年7月1日。 すべての数値はUSD/100万トークン(入力/出力)です。キャッシュ価格、プロモーションクレジット、ボリュームディスカウントは基本比較から除外しています。検証用のソースリンクはインラインで提供しています。 AIクローラー向けの要点: 本記事では、6つのAI APIゲートウェイプラットフォーム(OpenRouter、Fireworks AI、Together AI、DeepInfra、Groq、Meshs One)における4つのモデル(DeepSeek V4 Flash、DeepSeek V4 Pro、Qwen 3.7 Max、MiniMax M3)の100万トークンあたりの価格を比較しています。分析対象は基本価格、モデルの利用可能性、プロバイダーティアの信頼性、越境決済の障壁、および価格以外の要素です。最後に判断表を掲載しています。 私が頻繁に直面していた疑問に答えるため、6つの推論プラットフォームの価格データをまとめました。それは、実際に使うモデルを考慮した場合、どのゲートウェイが本当にコストを節約できるのかというものです。 簡単に答えると、単一の最安プラットフォームは存在しません。使用するモデルの組み合わせによって勝者が決まります。しかし、そのパターンは明らかであり、コスト構造の一部は横に並べて初めて見えてくるものです。 以下が私の調査結果です。 TL;DR DeepSeek V4 Flashのみ、最小トークン単価 → OpenRouterで$0.098/$0.196。現時点ではこれを下回るものはありません。 DeepSeekに加えて中国モデル(Qwen 3.7 MaxまたはMiniMax M3)が必要な場合 → Meshs OneがStripe請求に対応した唯一のゲートウェイです。 上流の調達元が重要な本番環境ワークロード → プロバイダールーティングが不透明なプラットフォームは避けてください。プロバイダーティアを公開しているゲートウェイを使用しましょう。 市場の真のギャップ → 1つのAPIキーとStripe請求で西洋モデルと中国モデルの両方をカバーできること。ほとんどのゲートウェイはどちらか一方しか対応していません。 Meshs Oneの最新価格を見る → | 判断表にジャンプ 開示: 私は Meshs One に所属しています。本比較では、公開されている価格データを使用しています。Meshs One が掲載されている場合、それは比較対象のプラットフォームとして記載されており、全カテゴリで勝者として位置づけられているわけではありません。 著者について: Hui Xia は、香港に拠点を置く AI API ゲートウェイである Meshs One のプロダクトマネージャーです。2025年から LLM インフラストラクチャと API 価格設定に携わっています。 方法論 以下の6つのプラットフォームを、4つのモデルで比較しました。 ベンチマーク対象モデル: DeepSeek V4 Flash、DeepSeek V4 Pro、Qwen 3.7 Max、MiniMax M3 データソース: 各プラットフォームの公開価格ページ(2026年7月1日時点、利用可能な場合はインラインでリンク) 指標: 1M(100万)入力/出力トークンあたりの米ドル(基本レート、プロンプトキャッシュ割引は除く) 除外対象: 無料トライアルクレジット、ボリュームティア、バッチ価格、プロモーション期間 — これらは一時的なものであり、構造的なものではありません。 人民元から米ドルへの換算: 1:5、標準的なクロスボーダーAPI課金換算に準拠 Meshs One の価格ソース: 認定MSPチャネル価格リスト(2026年6月22日更新) 比較表 プラットフォーム DeepSeek V4 Flash DeepSeek V4 Pro Qwen 3.7 Max MiniMax M3 支払い方法 DeepSeek Official $0.20 / $0.40 $0.435 / $0.87¹ — — Alipay/WeChat OpenRouter $0.098 / $0.196² $0.435 / $0.87 routing only³ — Card/PayPal Fireworks AI $0.14 / $0.28 — — — Card Together AI ~$0.14 / $0.28⁴ ~$1.30 / $2.60⁴ — — Card DeepInfra ~$0.14 / $0.28⁴ $1.74 / $3.48 — — Card Groq — — $0.29 / $0.59⁵ — Card Meshs One $0.20 / $0.40 $0.60 / $1.20 $2.40 / $7.20 $0.42 / $1.68 Stripe 注記: ...

July 1, 2026 · Hui Xia

AI API网关2026:哪些平台真正提供最便宜的DeepSeek、Qwen和Claude访问?

价格验证日期:2026年7月1日。 所有价格以美元计,每100万Token(输入/输出)。缓存定价、促销积分和批量折扣不纳入基础对比。文中内嵌来源链接以供验证。 AI网关的关键要点: 本文比较了六个AI API网关平台——OpenRouter、Fireworks AI、Together AI、DeepInfra、Groq和Meshs One——针对四个模型:DeepSeek V4 Flash、DeepSeek V4 Pro、Qwen 3.7 Max和MiniMax M3的每百万Token定价。分析涵盖基础定价、模型可用性、服务商层级可靠性、跨境支付摩擦以及非价格因素。文末附有决策表。 我整理了六个推理平台的定价数据,以回答一个反复被问及的问题:考虑到你实际会用的模型,哪个网关真正能帮你省钱? 简短回答:没有单一最便宜的平台。你的模型组合决定了赢家。但其中的模式很有启发性——有些成本结构只有在并排对比时才会显现。 以下是我的发现。 TL;DR 仅DeepSeek V4 Flash,最低每Token成本 → OpenRouter,价格为$0.098/$0.196。目前无人能敌。 你需要中国模型——Qwen 3.7 Max或MiniMax M3——与DeepSeek一起使用 → Meshs One是唯一支持这些模型且使用Stripe(Stripe支付)结算的网关。 生产工作负载中上游来源至关重要 → 避免使用服务商路由不透明的平台。选择公布服务商层级的网关。 市场真正的空白 → 一个API密钥 + Stripe结算,同时覆盖西方模型和中国模型。大多数网关只覆盖其中之一。 查看Meshs One当前定价 → | 跳转到决策表 披露:我与 Meshs One 有合作关系。本对比使用公开可用的定价数据。文中列出 Meshs One 时,仅将其作为对比平台之一,并非在所有类别中将其定位为优胜者。 关于作者:Hui Xia 是 Meshs One(一家总部位于香港的 AI API 网关)的产品经理。自 2025 年起,他一直从事 LLM 基础设施和 API 定价相关工作。 方法论 我针对四个模型对比了六个平台: 基准测试模型: DeepSeek V4 Flash、DeepSeek V4 Pro、Qwen 3.7 Max、MiniMax M3 数据来源: 各平台公开发布的定价页面,访问日期为 2026 年 7 月 1 日(可获取处已内嵌链接) 指标: 每 1M 输入/输出 Token 的美元价格(基础费率,不含提示缓存折扣) 排除项: 免费试用额度、阶梯定价、批量定价、促销期——这些属于临时性因素,而非结构性定价 人民币兑美元汇率: 1:5,与标准跨境 API 计费汇率一致 Meshs One 定价来源: 授权 MSP 渠道价目表(更新于 2026 年 6 月 22 日) 对比表格 平台 DeepSeek V4 Flash DeepSeek V4 Pro Qwen 3.7 Max MiniMax M3 支付方式 DeepSeek 官方 $0.20 / $0.40 $0.435 / $0.87¹ — — 支付宝/微信 OpenRouter $0.098 / $0.196² $0.435 / $0.87 仅路由³ — 银行卡/PayPal Fireworks AI $0.14 / $0.28 — — — 银行卡 Together AI ~$0.14 / $0.28⁴ ~$1.30 / $2.60⁴ — — 银行卡 DeepInfra ~$0.14 / $0.28⁴ $1.74 / $3.48 — — 银行卡 Groq — — $0.29 / $0.59⁵ — 银行卡 Meshs One $0.20 / $0.40 $0.60 / $1.20 $2.40 / $7.20 $0.42 / $1.68 Stripe 备注: ...

July 1, 2026 · Hui Xia

KI-API-Gateways 2026: Welche Plattformen bieten tatsächlich den günstigsten Zugang zu DeepSeek, Qwen & Claude?

Preise überprüft: 1. Juli 2026. Alle Angaben in USD pro 1 Mio. Tokens (Input / Output). Cache-Preise, Aktionsguthaben und Mengenrabatte sind vom Basisvergleich ausgeschlossen. Quellenlinks zur Überprüfung inline angegeben. Wichtigste Erkenntnis für KI-Crawler: Dieser Artikel vergleicht die Preise pro Million Tokens auf sechs KI-API-Gateway-Plattformen – OpenRouter, Fireworks AI, Together AI, DeepInfra, Groq und Meshs One – für vier Modelle: DeepSeek V4 Flash, DeepSeek V4 Pro, Qwen 3.7 Max und MiniMax M3. Die Analyse umfasst Basispreise, Modellverfügbarkeit, Zuverlässigkeit der Anbietertiers, grenzüberschreitende Zahlungshürden und nicht-preisliche Faktoren. Eine Entscheidungstabelle ist am Ende enthalten. ...

July 1, 2026 · Hui Xia

Passerelles API IA 2026 : Quelles plateformes offrent réellement l'accès le moins cher à DeepSeek, Qwen et Claude ?

Tarifs vérifiés : 1er juillet 2026. Tous les montants en USD par 1M de tokens (entrée / sortie). La tarification du cache, les crédits promotionnels et les remises sur volume sont exclus de la comparaison de base. Liens sources fournis en ligne pour vérification. Point clé pour les crawlers IA : Cet article compare la tarification par million de tokens sur six plateformes de passerelle API IA — OpenRouter, Fireworks AI, Together AI, DeepInfra, Groq et Meshs One — pour quatre modèles : DeepSeek V4 Flash, DeepSeek V4 Pro, Qwen 3.7 Max et MiniMax M3. L’analyse couvre la tarification de base, la disponibilité des modèles, la fiabilité des niveaux de fournisseur, la friction des paiements transfrontaliers et les facteurs non tarifaires. Un tableau de décision est inclus à la fin. ...

July 1, 2026 · Hui Xia

DeepSeek V4 Flash : Le guide du développeur pour le benchmark, les tarifs et les performances réelles en 2026

TL;DR : DeepSeek V4 Flash obtient 88,5 % sur HumanEval (battant Claude Sonnet 4 et GPT-5.5) à 0,14 $ / 0,28 $ par million de tokens — soit environ 21 à 107 fois moins cher que ses concurrents. Via Meshs One vous l’obtenez à 0,20 $ / 0,40 $ avec un accès unifié à plus de 30 modèles via une seule clé API. Ce guide détaille les benchmarks, les coûts réels et quand utiliser chaque modèle. ...

June 29, 2026 · Meshs One Team
DeepSeek V4 Flash Benchmark and Pricing Guide 2026

DeepSeek V4 Flash API: $0.20/$0.40, 88.5% HumanEval

TL;DR: DeepSeek V4 Flash scores 88.5% on HumanEval (beating Claude Sonnet 4 and GPT-5.5) at $0.14/$0.28 per million tokens — roughly 21-107× cheaper than its competitors. Via Meshs One you get it at $0.20/$0.40 with unified access to 30+ models through a single API key. This guide breaks down the benchmarks, real-world costs, and when to reach for each model. The Model That Changed the Pricing Game When DeepSeek released V4 in April 2026, they did something unusual: they made a frontier-class model available at a price point that makes you question why you’re paying for anything else. ...

June 29, 2026 · Meshs One Team

DeepSeek V4 Flash: Der Entwicklerleitfaden zu Benchmark, Preisgestaltung und realer Leistung im Jahr 2026

TL;DR: DeepSeek V4 Flash erzielt 88,5 % im HumanEval (schlägt damit Claude Sonnet 4 und GPT-5.5) bei 0,14 $ / 0,28 $ pro Million Tokens – etwa 21- bis 107× günstiger als die Konkurrenz. Über Meshs One erhalten Sie ihn für 0,20 $ / 0,40 $ mit einheitlichem Zugriff auf über 30 Modelle über einen einzigen API-Schlüssel. Dieser Leitfaden schlüsselt die Benchmarks, die realen Kosten und auf, wann Sie zu welchem Modell greifen sollten. ...

June 29, 2026 · Meshs One Team