KVキャッシュは、LLMが文章を生成するときに、すでに処理したトークンの内部計算結果(attention の Key と Value ベクトル)をメモリに保存しておく仕組みです。これがないと1トークン出すたびに文脈全体を計算し直すことになるため、長い入力ほど速度とコストが跳ね上がります。
KVキャッシュとは
Transformer の attention は、次のトークンを予測するたびに、それまでの全トークンの Key と Value を参照する。この K/V は一度計算すれば以後変わらないため、保存して使い回せる。その置き場が KV キャッシュで、生成処理を「毎回すべて再計算」から「新しい1トークン分だけ計算」に落とす。
代わりに消費するのがメモリである。キャッシュ量は文脈長・レイヤー数・同時実行するリクエスト数にほぼ比例して増え、モデルの重みとは別枠で GPU メモリを占有する。結果として、デコード(1トークンずつ出す段階)は演算性能ではなくメモリ帯域と容量で頭打ちになる。長文脈の推論が重い理由の多くは、計算量ではなくここにある。GQA や MQA といったモデル側の設計は、このキャッシュ量を削るための工夫だ。
使い方
自前で動かす場合、KV キャッシュを管理するのは推論エンジンの仕事になる。vLLM の PagedAttention のように、キャッシュを固定長ブロックに分割して断片化を防ぎ、同じ前置きを持つリクエスト間で共有する実装が広く使われている。
API 経由の利用者から見ると、これは「プロンプトキャッシュ」として露出する。効かせ方は単純で、毎回同じ内容(システムプロンプト、長い仕様書、コードベース、少数事例)をプロンプトの先頭に固定し、リクエストごとに変わる部分を後ろに置く。先頭から一致した範囲だけが再利用されるため、可変部分を前に混ぜると、その後ろ全部がキャッシュミスになる。会話を続ける用途とも相性がよい。
料金への効き方
KV キャッシュ自体を単体で買うものではなく、費用は2つの経路で効く。1つは API 料金で、多くのプロバイダがキャッシュヒットした入力トークンを通常より安い単価で課金し、代わりにキャッシュ書き込み時に割増を取る方式を採る。倍率や保持時間は提供元と時期で異なるので、必ず各社の最新の価格表を確認してほしい(本記事では具体的な数値を示さない)。
もう1つは自社ホスティングの場合で、KV キャッシュのサイズが必要な GPU メモリ量、つまり1台あたりの同時処理数とサーバ台数を直接決める。長文脈サービスの原価を見積もるなら、まずここを計算するのが早い。
誰が作っていて、競合は何か
KV キャッシュは特定企業の製品ではなく、推論スタック全体の設計課題である。SemiAnalysis は MoE(Mixture of Experts)モデルの推論解説で、Prefill・Midfill・Decode といった段階ごとに、何を物理的に近くへ置くべきか、どの転送に帯域が要るかが変わると指摘している。段階ごとに最適なハードウェアが異なる、という構図だ。
メモリベンダーもここを狙う。SK hynix は2026年9月15〜17日に米サンタクララで開かれた「AI Infra Summit 2026」に出展し、HBM と SSD の間を埋める大容量・高帯域 NAND「HBF」や、メモリ内で演算する PIM チップ「AiM」を披露した。KV キャッシュをどこに置くかという問題が、メモリ階層そのものの競争領域になりつつある。

