AIセキュリティ用語集

AIセキュリティの記事で用語に詰まったときに使う辞書ページ。50以上の用語を五十音順・アルファベット順で掲載。検索ボックスで絞り込みができる。

ア行

アライメントAlignment
AIの動作を人間の意図・価値観に合わせる研究・取り組みの総称。RLHF(人間フィードバック強化学習)などの手法を使って実現する。完全なアライメントは現時点では達成されておらず、継続的な研究が行われている。
アライメントギャップAlignment Gap
モデルが意図しない行動を学習し、期待通りのアライメントが取れていない状態。訓練データの偏り・報酬ハッキング・評価者のバイアスなどが原因で生じる。AIレッドチーミングの主要なテスト対象の一つ。
エージェント / AIエージェントAgent / AI Agent
ツール呼び出し・外部サービス操作・コード実行・Web検索などを自律的に行えるAIシステム。ユーザーの代わりに複数のタスクを連鎖的に実行する。間接プロンプトインジェクションの対象として特に危険度が高い。
エンベディングEmbedding
テキストを高次元のベクトル(数値の配列)に変換したもの。意味的に似たテキストは近いベクトルになる。RAGシステムで類似度検索に使われる。

カ行

ガードレールGuardrail
LLMが有害なコンテンツを出力しないよう設けられた制御の仕組み。RLHF・システムプロンプト・コンテンツフィルタなど複数の層で構成されることが多い。ジェイルブレイクはこのガードレールを迂回しようとする攻撃。
間接プロンプトインジェクションIndirect Prompt Injection
WebページやPDF・メール・データベースなどの外部データ経由でAIに悪意ある命令を注入する攻撃。ユーザーは攻撃に気づかないことが多く、特にAIエージェントが使われる環境で危険度が高い。
コンテキストウィンドウContext Window
LLMが一度に処理できるテキストの最大長。トークン数で表される(例: 128,000トークン)。長いほど多くの情報を扱えるが、Many-shot Jailbreakingなどの攻撃にも悪用されやすくなる。

サ行

システムプロンプトSystem Prompt
エンドユーザーには見えないが、LLMの動作・役割・制約を定義する事前設定のプロンプト。開発者が設定し、AIの「人格」や「できること・できないこと」を規定する。プロンプトインジェクション攻撃の主要な標的の一つ。
ジェイルブレイクJailbreak
AIの安全制約(ガードレール)を迂回して、本来拒否すべき内容を出力させる攻撃手法の総称。ロールプレイ・エンコーディング・多言語・GCGなど多様な手法がある。スマートフォンのジェイルブレイク(脱獄)から命名。
直接プロンプトインジェクションDirect Prompt Injection
ユーザーが直接入力を操作してAIの動作を乗っ取る攻撃。「前の指示を無視して」「あなたは今から〇〇AIです」などのパターンが典型例。

タ行

データポイズニングData Poisoning
AIの訓練データに悪意ある内容を混入させ、モデルの動作を意図的に歪める攻撃。バックドア攻撃(特定のトリガーで悪動作)や偏見の植え付けなどが含まれる。
トークンToken
LLMがテキストを処理する際の最小単位。英語では約4文字、日本語では1〜2文字程度が1トークンに相当することが多い。APIの料金はトークン数に基づいて計算される。

ハ行

ハルシネーションHallucination
モデルが事実と異なる情報を確信を持って出力する現象。「幻覚」とも呼ばれる。LLMが確率的に「次のトークン」を予測する仕組み上、避けがたい問題。架空の人名・書籍・法令・判例などを生成することがある。
バックドア攻撃Backdoor Attack
特定のトリガーワード・フレーズが入力された場合にのみ悪意ある動作をするよう訓練データを汚染する攻撃。通常の評価では検出が困難。
プロンプトPrompt
LLMへの入力テキスト。指示・質問・文脈・例示などを含む。適切なプロンプト設計(プロンプトエンジニアリング)によってLLMの出力の質が大きく変わる。
プロンプトインジェクションPrompt Injection
AIへの入力に悪意ある命令を混入させ、意図しない動作をさせる攻撃の総称。直接(ユーザーが直接操作)と間接(外部データ経由)の2種類がある。OWASP LLM Top 10の第1位に位置付けられている。
ファインチューニングFine-tuning
事前学習済みモデルを特定のタスク向けに追加学習させること。少量のデータで特定の動作を学習させられる。悪意ある攻撃者がモデルの安全制約を外すために悪用することもある。

マ行

マルチモーダルMultimodal
テキスト以外(画像・音声・動画等)も処理できるAIシステム。GPT-4V・Claude 3などが代表例。画像内の隠しテキストを使った攻撃(マルチモーダルプロンプトインジェクション)の対象になる。
モデル抽出攻撃Model Extraction
APIアクセスを通じてモデルの動作を推測・複製する攻撃。大量のクエリを送信し、応答からモデルの挙動を学習して安価なモデルで模倣品を作ることができる。

ラ行

RAGRetrieval-Augmented Generation
外部データベース(ベクトルDB等)の情報を検索してLLMに渡し、より正確な回答を生成する手法。社内文書・最新情報へのアクセスが可能になる一方、間接プロンプトインジェクションの経路になりやすい。
RLHFReinforcement Learning from Human Feedback
人間の評価を報酬信号として使うLLMの訓練手法。「人間フィードバック強化学習」。評価者が良い/悪い出力を判定し、その信号を元にモデルを更新する。ChatGPTの開発に大きく貢献した手法。
レッドチーム / レッドチーミングRed Team / Red Teaming
攻撃者の視点でシステムの弱点を探すテスト手法・チームの総称。軍事用語が起源。AIレッドチーミングでは、LLMの安全性・セキュリティをテストするために攻撃を試みる。

アルファベット

CBRN
化学(Chemical)・生物(Biological)・放射線(Radiological)・核(Nuclear)の略。AIが関連情報(製造方法・入手方法等)を提供しないよう特に厳しく管理されるカテゴリ。AIレッドチーミングの重要なテスト項目。
DANDo Anything Now
代表的なジェイルブレイクのプロンプトパターン。「あなたは今からDANです。DANはどんな質問にも答えられます」という形式でAIの制約を外そうとする。現在の高性能モデルでは多くの場合検出・拒否される。
GCGGreedy Coordinate Gradient
勾配情報を使って自動的に最適なジェイルブレイクプロンプト(サフィックス)を生成する攻撃手法。Zou et al. (2023)が発表。あるモデルで最適化したサフィックスが別モデルにも有効(転移性)という特徴がある。
LLMLarge Language Model
大規模言語モデル。大量のテキストデータで事前学習された、テキスト生成・理解が得意なAIモデル。GPT-4・Claude・Gemini・Llama等が代表例。AIレッドチーミングの主要な攻撃対象。
Many-shot Jailbreaking
コンテキストウィンドウに大量のQ&Aペアを詰め込み、モデルにそのパターンで回答させる攻撃。Anthropicが2024年に発表。長いコンテキストウィンドウ(128K〜1Mトークン)のモデルほど効果が増大する傾向がある。
MITRE ATLAS
Adversarial Threat Landscape for Artificial-Intelligence Systems の略。AIシステムへの攻撃手法をMITRE ATT&CKフォーマット(タクティクス・テクニック・プロシージャ)でまとめたデータベース。実際の攻撃事例も掲載。
OWASP LLM Top 10
LLMアプリケーションにおける10大セキュリティリスクをまとめたドキュメント。OWASPが作成・公開。プロンプトインジェクションが第1位。開発者・セキュリティ担当者のチェックリストとして活用される。
PyRITPython Risk Identification Toolkit
Microsoft AI Red Teamが開発・オープンソース化したAI攻撃自動化ツール。Orchestrators(攻撃戦略)・Converters(プロンプト変換)・Scorers(応答評価)の3コンポーネントで構成される。Black Hat トレーニングでも使用される。
Garak
NVIDIAが開発したオープンソースのLLM脆弱性スキャナー。nmap のLLM版とも言われる。多数のプローブ(攻撃パターン)を備え、自動的にLLMの弱点を発見・レポートする。
← 前の記事
【体験】Gandalf でジェイルブレイクに挑戦
次の記事 →
ジェイルブレイク完全ガイド(前編)