プロンプトキャッシュとは、LLM(大規模言語モデル)のAPIに毎回同じ内容で送る先頭部分を、提供側のサーバーに一時保存して再計算を省く仕組みです。先頭部分とは、システムプロンプトや参照資料、ツール定義などを指します。再利用された部分は入力トークンの料金が通常より安くなり、応答が始まるまでの待ち時間も短くなります。
プロンプトキャッシュとは:何を省いているのか
LLMは入力を受け取るたびに、すべてのトークンを先頭から処理します。長いマニュアルや大きなコードを毎回添付すると、同じ計算を何度も繰り返すことになります。プロンプトキャッシュはこの処理結果を保存しておきます。次のリクエストの先頭が完全に一致していれば、保存した続きから処理を再開します。
効くのは「先頭が同じ」場合だけです。途中が1文字でも変われば、そこから後ろはキャッシュされません。そのため、変わらない部分(指示文、ツール定義、資料)を前に置き、毎回変わる部分(ユーザーの質問)を後ろに置くのが基本です。
使い方
使い方は提供事業者によって2通りあります。
- 明示指定型:Anthropic の Claude API では、リクエストの区切りたい位置に `cache_control` を付け、「ここまでをキャッシュする」と指定します。 - 自動型:OpenAI の API では、一定以上の長さのプロンプトについて、共通する先頭部分が自動でキャッシュされます。基本的にコードを変える必要はありません。
どちらも保存期間は短めです。Claude の場合、標準は5分で、使われるたびに期限が延びます。追加料金を払えば1時間も選べます。キャッシュ対象になる最小トークン数や保存期間はモデル・事業者ごとに違うため、公式ドキュメントで確認してください。
料金
Claude API での倍率は次のとおりです。キャッシュからの読み出しは通常の入力料金の1割です。キャッシュへの書き込みは、5分保存なら通常の1.25倍、1時間保存なら2倍かかります。書き込むときは割高なので、同じ内容を2回以上使ってはじめて得になります。
OpenAI も読み出した分を割り引いていますが、割引率はモデルによって違います。具体的な単価はモデルごとに異なり改定もあるため、この記事では載せていません。各社の料金ページを確認してください。
何に使えるのか
効果が大きいのは、同じ長い前提を何度も使う業務です。
- 社内規程やFAQを丸ごと渡して質問に答えるチャットボット - 同じ契約書や仕様書に、観点を変えて何度も質問する分析 - ツールを繰り返し呼び出すAIエージェント(毎回、これまでの会話履歴が先頭に積み上がるため)
反対に、毎回まったく別の短い文章を1回ずつ処理する用途(大量のテキストの分類など)では、共通する部分が少ないため効果は限られます。
誰が提供しているのか
プロンプトキャッシュは単独の製品ではなく、LLM APIの機能のひとつです。Anthropic、OpenAI、Google(Gemini API)が自社のAPIで提供しており、AWS の Amazon Bedrock でも対応モデルで使えます。各社の違いは「割引率」「保存期間」「自動か明示指定か」の3点です。長い文脈を扱うエージェント用途が広がるほど、この機能が実際のAPIコストを左右する度合いは大きくなると当サイトは見ています(これは推測です)。


