レッドチーミングとは、攻撃者の役を担うチーム(レッドチーム)が、対象のシステムを本気で攻めて弱点を洗い出す検証手法です。もとは軍事や情報セキュリティの用語ですが、現在は主に生成AIの安全評価を指す言葉として使われています。
レッドチーミングとは:AIで何を調べるのか
AIのレッドチーミングは、通常の性能テストとは目的が違います。性能テストは「正しく答えられるか」を測ります。レッドチーミングは「悪用しようとする相手に、してはいけないことをさせられるか」を探します。
代表的な検証対象は次のとおりです。
- 安全対策を回避して禁止された回答を引き出す、いわゆるジェイルブレイク - 外部の文書やWebページに命令を紛れ込ませ、AIを乗っ取るプロンプトインジェクション - サイバー攻撃などに転用できる危険な能力が、モデルにどこまで備わっているか
最後の「危険な能力」の評価は、最先端モデルの開発元が特に重視している領域です。当サイトでは、Anthropicがフロンティアモデルに関するレッドチーミング報告書の中で、中国で開発された人気モデルに「Mythos級」のハッキング能力があると指摘した、という報道を取り上げました。ただし入手できたのは見出しだけで、対象モデルや評価方法は確認できていません。
使い方:どう進めるのか
一般的な流れは「攻撃シナリオを決める → 攻撃を試す → 結果を記録する → 対策して再テストする」の繰り返しです。エンジニアが自社でAIを組み込む場合は、自社の用途で起こりうる失敗(顧客情報の漏洩、不適切な回答、外部ツールの誤操作など)に的を絞ると、検証が具体的になります。
手作業の攻撃に加え、攻撃用のプロンプトを自動で大量に生成し、応答を判定するツールも使われています。オープンソースでは、MicrosoftのPyRITやgarakが知られています。どのツールが自社に合うかは、検証対象と運用体制によって変わります。
料金:いくらかかるのか
レッドチーミングに決まった価格はありません。社内で実施すれば主な費用は人件費になり、外部の専門家や機関に頼めば案件ごとの見積もりになるのが通常です。具体的な相場を示せる資料は、当サイトでは確認できていません。
規模の参考になる事例はあります。Anthropicは、外部の安全評価者を社内に常駐させる取り組みの最初の相手としてAccentureを選びました。両社はこの事業に、今後5年で少なくとも10億ドルを投じる見込みです。これはフロンティアモデルの開発元による最大級の案件であり、一般企業が自社のAI活用を検証する費用の目安にはなりません。
誰が担っているのか:主なプレイヤー
担い手は大きく3つに分かれます。1つ目はAnthropicのようなAIモデルの開発元で、自社の評価チームを持ち、報告書も公表しています。2つ目はMETRのような専門の評価機関です。3つ目はコンサルティング会社で、Accentureの例では、同社が買収してAI部門としたFacultyの人員がAnthropic社内に入り、レッドチーミング、アライメント評価、安全対策の検証を担います。
投資の観点では、モデルの安全評価を外部の大手企業に大規模に委託する動きが出てきた点が注目に値します。ここからは推測ですが、この分野は今後、ほかのコンサルティング会社やセキュリティ企業との競争が増えていく可能性があります。

