従来のレッドチーミングとは
レッドチーミングはもともと軍事用語だ。 冷戦期、米国防総省が自軍の計画の盲点を発見するために「敵役」(レッドチーム)を設置したことに由来する。 情報セキュリティの分野では1990年代ごろから、攻撃者の視点でシステムを評価する手法として定着した。
ペネトレーションテストとダブルブラインド
現代の従来型レッドチーミングは、主にネットワーク・アプリケーション・物理セキュリティを対象とする。 代表的な形態がペネトレーションテスト(ペンテスト)だ。 ホワイトボックス(全情報提供)・グレーボックス・ブラックボックスの3形態があり、 最も現実的なシナリオを再現するのがダブルブラインド方式だ。
ダブルブラインド方式では、防御側の担当者(ブルーチーム)も攻撃が行われることを知らない状態でテストが実施される。 これにより、普段の防御体制がそのまま評価される。SOCの検知能力やインシデント対応手順まで含めた総合評価が可能になる。
成熟したツールキット
従来のペネトレーションテストには、数十年の蓄積による成熟したツール群が存在する。
- Metasploit:エクスプロイト開発・実行フレームワーク
- Burp Suite:Webアプリケーションの脆弱性スキャナー
- Nmap / Nessus:ネットワークスキャン・脆弱性評価
- Cobalt Strike:高度な侵入シミュレーション
- OWASP ZAP:Webアプリの自動スキャン
さらに、CVE(共通脆弱性識別子)という標準化されたデータベースが存在し、 発見した脆弱性を業界共通の指標(CVSS スコア)で評価できる。 評価軸・報告形式・修正手順まで、業界全体で標準化が進んでいる。
AIレッドチーミングとの決定的な違い
では、AIレッドチーミングはどう違うのか。以下の比較図と表を見てほしい。
| 比較軸 | 従来のレッドチーミング | AIレッドチーミング |
|---|---|---|
| 方式 | ネットワーク・アプリ侵入テスト | プロンプト・モデル挙動の評価 |
| 目的 | 認証回避・データ窃取・権限昇格の検証 | 有害出力・ポリシー回避・信頼性の検証 |
| 模倣対象 | 外部攻撃者・内部不正者 | 悪意あるユーザー・競合他社・研究者・ジャーナリスト |
| ツール成熟度 | 高(数十年の蓄積) | 低〜中(急速に進化中) |
| 主な攻撃媒体 | ネットワークパケット・エクスプロイトコード・フィッシング | 自然言語テキスト(プロンプト) |
| 評価軸 | CVSSスコア・侵入成功/失敗の二択 | 有害性・誠実性・ポリシー適合性(グラデーション) |
最大の違い「境界」の話
従来のセキュリティが守る「境界」は明確だ。 ネットワーク境界(ファイアウォール)、認証境界(ログイン画面)、 OS権限境界(サンドボックス)——これらは物理的・論理的に定義されており、 「越えられたかどうか」を検証できる。
AIの場合、唯一の境界はプロンプト(テキスト入力)だ。 システムプロンプトで「有害なことを言うな」と指示することはできても、 その指示がどこまで守られるかはモデルの確率的な判断に委ねられる。 境界が曖昧で、越えたかどうかも一律には判断できない。
Metasploit のような専門ツールを使わなくても、ChatGPTに「〇〇のように振る舞って」と テキストを打ち込むだけで攻撃が成立する場合がある。 これはセキュリティ専門家でなくても、普通のユーザーが意図せず「攻撃者」になり得ることを意味する。 AIセキュリティにおける脅威モデルが、従来のそれとは根本的に異なる理由がここにある。
AIレッドチーミングが難しい理由
AIレッドチーミングには、従来手法にはない固有の難しさが3つある。
1. 非決定論的な挙動
従来のシステムは決定論的だ。同じ入力に対して、常に同じ出力を返す。 バグが再現できるからこそ、修正できる。
生成AIは非決定論的だ。同じプロンプトを送っても、 毎回異なる出力が返ってくる(temperature パラメータによる確率的サンプリング)。 あるプロンプトで今日は有害な出力が得られても、 明日は同じプロンプトで拒否されるかもしれない。 「発見した脆弱性を再現する」という作業自体が困難になる。
2. 評価基準の曖昧さ
ネットワーク侵入の成否は明確だ——「管理者権限を取得できたか否か」という二択で判断できる。
AIの有害性判断には、そのような明確な基準がない。 「爆発物の仕組みを教えて」という質問への回答が有害かどうかは、 文脈・目的・文化・ユーザーの属性によって異なる。 化学教師が授業で使うためのものなのか、テロを計画している人物が求めているのか—— AIには判断できないし、レッドチーマーが「失敗」と判定する基準も文化依存になる。
3. ツールの成熟度が低い
Garak や PyRIT などのAIセキュリティ専用ツールが登場し始めているが、 従来のセキュリティツールと比べればはるかに若い。 評価指標の標準化も途上であり、「このスコアが何を意味するか」が ツールによって異なることもある。業界全体として、まだ「正解」を模索している段階だ。
AIレッドチーミングが難しい3つの理由(まとめ)
- 非決定論的:同じ入力でも毎回異なる出力。再現性が低い。
- 評価基準が曖昧:「有害」の定義が文化・文脈に依存する。
- ツールが未熟:標準化された評価フレームワークがまだ発展途上。
Microsoft AI Red Teamの事例
AIレッドチーミングの最前線にいる組織の一つが、Microsoft AI Red Teamだ。 2018年に設立され、Microsoft 社内の AI製品・外部提供モデルの評価を担当している。
同チームは、Microsoft Copilot や OpenAI との協業モデル(Azure OpenAI Service)など、 多数の商用 AI システムの安全評価を実施してきた。 2023年に公開したレポートでは、GPT-4 に対して約100種類の攻撃シナリオを試みたことが明らかにされている。
注目すべきは、同チームの構成メンバーの多様性だ。 オフェンシブセキュリティ専門家(従来のペンテスター)だけでなく、 機械学習エンジニア・社会科学者・倫理研究者・責任あるAI(Responsible AI)専門家が同一チームに在籍している。 「有害性」の判断には技術的視点だけでなく、社会科学的・倫理的視点が不可欠であることの証左だ。
オフェンシブセキュリティの経験は AIレッドチーミングでも価値がある。 特にプロンプトインジェクションはSQLインジェクションと概念的に近く、 ペンテスターの「攻撃者思考」はそのまま応用できる。 一方で、有害性評価・社会的文脈の理解・ML の基礎知識を新たに習得する必要がある。 どちらかだけでは不十分であり、T字型(あるいは複数専門性を持つ)スキルセットが理想的だ。
比較の全体像が把握できたら、次は AIモデルの3大リスク入門に進もう。 ハルシネーション・アライメントギャップ・プロンプトインジェクションという AIが抱える根本的な問題を掘り下げる。「なぜAIは安全でないのか」の答えがここにある。