用語解説 エーアイあんぜんせい

AI安全性とは

AI安全性とは、AIが人や社会に害を与えず、意図どおりに動くようにするための研究・技術・運用の総称。製品ではないので料金表はない。エンジニアが実際に行う対策、企業が負担するコスト、主な担い手、Anthropicの上場説明と米政権の反応という最近の動きを整理する。

AI安全性(AI Safety)とは、AIシステムが人や社会に害を与えず、開発者や利用者の意図どおりに動くようにするための研究・技術・運用の総称です。製品やサービスの名前ではないので「料金」はありません。費用は、評価や対策にかける工数とツール代として発生します。

AI安全性とは:何を扱う分野か

AI安全性が扱うリスクは、大きく2つの時間軸に分かれます。

1つ目は、いま使われているAIで起きている問題です。もっともらしい誤情報を出す(ハルシネーション)、有害な内容や偏った内容を出力する、外部の文書に埋め込まれた指示に乗っ取られる(プロンプトインジェクション)、機密情報を漏らす、といったものです。

2つ目は、より高度なAIが将来人間の制御を外れる可能性です。AIの目標を人間の意図とずらさないようにする研究は「アラインメント」と呼ばれ、AI安全性の中心的なテーマの一つです。

なお、攻撃者からシステムを守る「AIセキュリティ」とは重なる部分が多いものの、AI安全性はAI自身の振る舞いが原因となる害まで含む、より広い概念です。

使い方:エンジニアが実際にやること

AI安全性は「導入する」ものではなく、開発と運用の各段階に組み込む作業です。代表的なものを挙げます。

- **評価とレッドチーミング**:わざと悪用を試みる入力を大量に与え、危険な出力が出ないか検証する - **ガードレール**:入力と出力にフィルタをかけ、禁止内容を止める - **権限の最小化**:AIエージェントに与えるツールやデータへのアクセスを必要な範囲に絞る - **人間による承認**:送金、削除、外部送信など取り消せない操作の前に人が確認する - **ログと監視**:本番環境での出力を記録し、問題を後から追えるようにする

特にLLMにWebページやメールを読ませる設計では、プロンプトインジェクションを前提にした権限設計が欠かせません。

料金と用途:企画・DX担当者向け

AI安全性そのものには価格がありません。企業が実際に負担するのは、評価に必要な人員の工数、フィルタリングや監視のツール費用、社内の利用ガイドライン整備にかかる手間です。個別ツールの価格はベンダーごとに異なり、この記事では確認できていないため、各社の公式情報を参照してください。

用途としては、生成AIを顧客対応や社内業務に入れる前のリスク評価、誤回答が出たときの責任範囲の整理、監査や取引先への説明材料づくりが挙げられます。

誰が担い手か、なぜいま注目されるのか:投資家向け

主な担い手は、大規模モデルを開発する企業の安全性研究部門、大学などの研究機関、評価機関を設ける政府です。AI安全性は製品市場ではないため「競合」という構図にはなりませんが、各社が安全性への取り組みをどう示すかは企業評価の材料になっています。

最近の動きを2つ挙げます。Ars Technicaの報道によると、AnthropicはIPO(新規株式公開)に向けた投資家向け説明に、人類の絶滅に関するリスクの警告を記載しました。当サイトで確認できたのは見出しだけで、具体的な文言、上場時期、財務の数字は未確認です。

一方、トランプ米大統領はTruth Socialで、AIの安全性をめぐる懸念を民主党による「デマ」の一つだと主張しました。開発企業が自らリスクを投資家に開示する動きがある一方で、政権トップはリスク論そのものを否定しています。AI安全性は技術の問題であると同時に、規制と政治の争点にもなっています(この位置づけは当サイトの見立てです)。

AI安全性に関する記事

2 件