用語解説 ガードレール

ガードレールとは

ガードレールとは、生成AIの入力と出力をチェックし、有害な表現や個人情報の漏えい、想定外の回答を止める仕組みの総称です。この記事では、できること、使い方、料金の考え方、NVIDIA・AWSなどの主な提供元と競合を紹介します。

ガードレールとは、生成AI(大規模言語モデル、LLM)への入力とLLMからの出力をチェックし、不適切な内容や想定外の動作を止める仕組みです。特定の製品名ではなく、AIアプリに後から付ける「安全装置」をまとめて指す言葉です。

ガードレールとは

LLMは確率的に文章を作ります。そのため同じ指示でも毎回同じ答えになるとは限らず、差別的な表現、個人情報、事実と異なる回答、社外秘の話題を出してしまうことがあります。モデルの学習(アラインメント)だけでは防ぎきれない部分を、アプリの側から制御するのがガードレールの役割です。道路のガードレールと同じで、「走らせる」ためのものではなく、「はみ出したときに止める」ためのものです。

何ができるのか

主な機能は次のとおりです。

- 入力のチェック:プロンプトインジェクションやジェイルブレイク(AIの制限を回避させようとする指示)を見つける - 話題の制限:「自社製品のサポート以外には答えない」のように、対象外の話題を断る - 個人情報の保護:氏名や電話番号などを見つけて、出力する前に伏せる - 有害な表現のフィルタ:暴力・ヘイト・性的な表現などを判定して止める - 根拠のチェック:参照した資料に書かれていない内容を答えていないか確かめる - 形式のチェック:JSONなど、決められた形式で出力されているか確かめる

使い方

基本の流れは「ユーザーの入力 → 入力のチェック → LLM → 出力のチェック → ユーザー」です。問題が見つかったときの対応は、定型文で断る、該当する部分を伏せる、LLMに作り直させる、の中から選びます。

実装の例を挙げます。NVIDIAのオープンソース「NeMo Guardrails」では、Colangという専用の言語で会話の流れや禁止事項を書きます。Guardrails AIのPythonライブラリでは、「バリデーター」と呼ばれるチェック用の部品を組み合わせて出力を確かめます。クラウドでは、Amazon Bedrock Guardrailsのように、管理画面やAPIから禁止する話題やフィルタの強さを設定する方法もあります。

企画・DXの担当者は、社内チャットボットや顧客対応AIを公開する前に、まず「何を答えさせないか」を決めてください。それをガードレールとして実装する、という順番で進めると導入しやすくなります。

料金

ガードレールそのものに決まった価格はありません。オープンソースのライブラリは無料で使えます。ただし、チェックのために別のLLMや判定用のモデルを呼び出す方式では、その分の推論コストがかかり、応答も遅くなります。クラウドのマネージドサービスは、処理したテキストの量に応じた従量課金が主流です。単価は変わることがあるため、この記事では金額を載せていません。各社の公式料金ページで確認してください。

誰が作っているのか・競合

主な提供元は次のとおりです。

- NVIDIA:NeMo Guardrails(オープンソース) - Guardrails AI:同じ名前のスタートアップが開発するオープンソースのライブラリ - AWS:Amazon Bedrock Guardrails - Microsoft:Azure AI Content Safety - Meta:安全性を判定する公開モデル「Llama Guard」

大手クラウドは自社のAI基盤の機能の一つとして提供しています。一方でスタートアップは、特定のモデルやクラウドに縛られない点を強みにしています。なお、この整理は筆者の見立てです。

AIの安全性については意見が分かれています。NVIDIAのジェンスン・フアンCEOは「AIが世界を滅ぼす確率は0%」と述べました。これに対し、Anthropicでアラインメント研究を率いていたEvan Hubinger氏は「今後10年で10%超」という見積もりを示しています。ガードレールは、こうした長い目で見たリスクの議論とは別のものです。目の前のAIサービスでの誤った回答や情報の漏えいを防ぐ、実務のための道具です。

ガードレールに関する記事

2 件