用語解説 じょうりゅう

蒸留とは

蒸留とは、大きなAIモデルの出力を使って小さなモデルを学習させ、近い能力を低コストで引き継がせる手法。仕組みと使い方、費用の決まり方に加え、FBIが中国企業を名指しした「蒸留攻撃」をめぐる米中の対立までを解説する。

蒸留(distillation)とは、大きく高性能なAIモデル(教師モデル)の出力を学習データにして、より小さなモデル(生徒モデル)を訓練する手法です。教師に近い能力を、少ない計算コストで動くモデルに引き継がせることが目的です。

「知識蒸留」とも呼ばれ、モデルを小さくする標準的な技術です。その一方で最近は、他社のモデルの能力を無断で写し取る行為が「蒸留攻撃」と呼ばれ、政治の問題にもなっています。

蒸留とは:仕組み

通常の学習では、モデルに正解のラベルだけを教えます。蒸留では、教師モデルが返した出力そのものを生徒モデルに学ばせます。分類モデルであれば各選択肢の確率の分布を、大規模言語モデルであれば質問への回答文を使います。

確率の分布には「正解ではないが近い候補」の情報も含まれるため、正解ラベルだけで学ぶより多くを得られます。これが蒸留の基本的な考え方で、2015年のHintonらの論文をきっかけに広く知られるようになりました。

使い方:何に使えるのか

エンジニアにとっての主な用途は、大きなモデルの性能をできるだけ保ったまま、小さく速いモデルを作ることです。一般的な手順は次のとおりです。(1)対象業務の入力を集める、(2)教師モデルに回答させる、(3)その入力と出力の組で生徒モデルを微調整する、(4)精度を評価する。

事業側から見ると、問い合わせの分類や文書検索のように業務を絞れば、小型モデルでも実用的な精度を狙えます。推論費用や応答時間を下げたり、自社の環境で動かしたりする選択肢になります。ただし、生徒モデルは教師モデルを超えにくく、学習させていない業務では性能が落ちることを前提にしてください。

また、商用AIのAPIでは、出力を競合するモデルの開発に使うことを利用規約で制限している例があります。利用する前に、各社の規約を確認する必要があります。

料金:いくらかかるのか

蒸留は手法の名前なので、それ自体に定価はありません。費用を決めるのは主に次の3つです。教師モデルに回答させるためのAPI利用料またはGPU費用、生徒モデルの学習費用、評価にかかる人件費です。当サイトでは具体的な相場を確認できていないため、金額は示しません。

誰が関わっているか:「蒸留攻撃」をめぐる米中の対立

投資家にとって重要なのは、蒸留が地政学の論点になっている点です。米国の政府とフロンティアAI企業の間では、「蒸留攻撃」への警戒が強まっています。中国やロシアが米国モデルの出力を使い、低いコストで同等の能力を得ることへの警戒です。正規アカウントの会話ログを買い取る手口もあり、当サイトの報道では、完全に防ぐのは難しい状況です。

FBIは、Alibabaを含む中国企業6社を「産業規模の蒸留」を行っているとして名指ししました。中国はこの疑惑を否定しています。そのうえで、米国がこれを口実に中国のAIを封じ込めるなら対抗措置をとると表明しました。9月24日の米中首脳会談で議題になる可能性がありましたが、実際に取り上げられたかどうかは当サイトでは確認できていません。

関連して、米連邦官報(Federal Register)のサイトが、公開コメントの検索にAlibabaのQwenモデルを一時的に採用し、その後撤去した件もありました。専門家によると、使われていたのはQwen3 0.6Bクラスの小型オープンモデルで、用途は文書検索に限られていました。

以下は当サイトの見立てです。今後の規制を見るうえでの焦点は、蒸留への警戒と、中国製オープンモデルの実用性をどう両立させるかです。

蒸留に関する記事

2 件