午前I問題

機械学習モデルに対する攻撃手法のうち、モデルの学習フェーズで悪意あるデータを意図的に混入させることで、学習済みモデルの判断を意図した方向へ歪める手法はどれか。

ア)逃避攻撃(Evasion Attack) イ)ポイズニング攻撃(Poisoning Attack) ウ)モデル反転攻撃(Model Inversion Attack) エ)推論攻撃(Membership Inference Attack)

午前I の解答・解説を見る

正解: イ)ポイズニング攻撃(Poisoning Attack)

解説:

  • ア)逃避攻撃(Evasion Attack):学習済みモデルの推論フェーズで細工した入力データを与え、誤分類させる攻撃。学習データには手を加えないため不正解。
  • イ)ポイズニング攻撃(Poisoning Attack):学習データに悪意あるサンプルを混入させ、モデルのパラメータを意図的に汚染する攻撃。問題文の説明と一致するため正解。スパムフィルタや異常検知モデルが標的になりやすい。
  • ウ)モデル反転攻撃(Model Inversion Attack):APIの出力を多数観察することで、モデルが学習した元データを復元する攻撃。プライバシー侵害が目的であり学習フェーズへの干渉ではないため不正解。
  • エ)推論攻撃(Membership Inference Attack):特定のデータがモデルの学習セットに含まれていたかどうかを判定する攻撃。個人情報の特定に用いられるが、モデルを歪める攻撃ではないため不正解。

午前II問題

生成AIシステムに対するプロンプトインジェクション攻撃の説明として、最も適切なものはどれか。

ア)悪意あるプロンプトを入力してAIシステムの安全制約を回避させ、機密情報の漏洩や有害コンテンツの出力を引き起こす攻撃 イ)大量のAPIリクエストを送信することでAIシステムの応答を遅延させるサービス妨害攻撃 ウ)AIシステムの学習データに汚染データを混入させてモデルの動作を変化させる攻撃 エ)AIシステムの出力から元の学習データや個人情報を復元するプライバシー侵害攻撃

午前II の解答・解説を見る

正解: ア)悪意あるプロンプトを入力してAIシステムの安全制約を回避させ、機密情報の漏洩や有害コンテンツの出力を引き起こす攻撃

解説:

  • ア)プロンプトインジェクション:攻撃者が「これまでの指示を無視して…」などのプロンプトを入力し、システムプロンプトで設定された制約を上書きする攻撃。フィッシングと組み合わせてRAGシステムから機密文書を引き出す間接型(Indirect Prompt Injection)も頻出。正解。
  • イ):これはDoS/DDoS攻撃の説明であり、プロンプトインジェクションではない。
  • ウ):ポイズニング攻撃(Poisoning Attack)の説明。プロンプトインジェクションは推論フェーズの攻撃であり学習データへの干渉ではない。
  • エ):モデル反転攻撃または推論攻撃の説明。プロンプトインジェクションとは目的・手法ともに異なる。

SC試験では、チャットボットやRAGシステムへのプロンプトインジェクション対策(入力検証・出力フィルタリング・最小権限の原則適用)が頻出。

午後問題

A銀行では、顧客向けコールセンターの業務効率化を目的として、大規模言語モデル(LLM)を活用した対話型AIアシスタントを導入した。このシステムは行内ナレッジベース(FAQや商品情報)をRAG(Retrieval-Augmented Generation)で参照し、オペレーターの回答支援を行う。導入後のセキュリティ審査で、情報セキュリティ部門のB主任は以下の2点を重大リスクとして指摘した。

【リスク1】AIアシスタントへの入力がオペレーター画面を経由するため、外部からのフィッシングメール本文がそのままプロンプトとして入力される可能性がある(間接型プロンプトインジェクション)。

【リスク2】AIの生成する自然な文章を悪用し、AIの回答を「銀行の公式見解」として偽装したソーシャルエンジニアリングが行われるリスクがある。

システム構成:オペレーター端末 → AIアシスタントAPI → RAGシステム(社内ナレッジ) → LLM(外部クラウドAPI)

設問1

B主任が指摘したリスク1(間接型プロンプトインジェクション)に対して、システム設計および運用の両面から講じるべき対策を2つ挙げ、それぞれ50字以内で説明せよ。

設問1の解答・解説を見る

正解例:

①(設計面)AIアシスタントへの入力は定型フォームから取得し、顧客からの自由記述テキストをプロンプトに直接連結しない入力サニタイズを実施する。(49字)

②(運用面)AIの出力にシステムプロンプトの内容や社内ナレッジのメタデータが含まれないよう出力フィルタリングを設け、異常なプロンプト入力をSIEMで検知・アラートする。(78字 → 圧縮版:出力に機密情報が含まれないよう出力フィルタリングを設け、異常入力をSIEMで自動検知する。49字)

採点基準:

キーワード配点
入力サニタイズ/入力の構造化4点
出力フィルタリング4点
最小権限(RAGが参照できる文書範囲の制限)3点
ログ監視・SIEM連携3点

部分点基準: 「入力を検証する」だけでは手法が不明確で2点。「定型フォームのみ使用」「自由記述をプロンプトから分離」など具体的な実装手段を示せば満点。

設問2

リスク2(AIの生成文章を悪用したソーシャルエンジニアリング)を踏まえ、A銀行が顧客や社外関係者への告知として実施すべき対策と、社内オペレーターへの教育内容をそれぞれ1つずつ述べよ。

設問2の解答・解説を見る

正解例:

(顧客・社外向け対策)A銀行から送付するメール・SMSには電子署名またはブランドインジケーター(BIMI)を付与し、AIが生成した文章との判別手段を提供することを公式サイトで告知する。

(社内オペレーター向け教育)AIアシスタントの出力はあくまで参考情報であることを周知し、顧客への公式回答は必ずオペレーターが内容を確認・承認したうえで送付する手順をe-ラーニングで習得させる。

採点基準:

キーワード配点
電子署名/DKIM・S/MIME・BIMIなど真正性保証技術の名称4点
AI出力の最終確認をヒューマン・イン・ザ・ループで行う旨4点
セキュリティアウェアネス教育・訓練の実施3点
公式チャネルの明示(公式サイト・電話番号確認の促進)3点

部分点基準: 「AIの回答を信じないよう周知する」では告知手段が不明確で2点。具体的な技術手段(電子署名等)または手続き(ヒューマンレビュー)を示せれば満点に近い。

重要キーワード

用語説明
プロンプトインジェクション悪意あるプロンプトでAIの安全制約を回避する攻撃。直接型(ユーザが直接入力)と間接型(外部コンテンツ経由)がある
ポイズニング攻撃AIの学習データに汚染サンプルを混入させ、モデルの判断を意図的に歪める攻撃手法
RAG(Retrieval-Augmented Generation)外部ナレッジベースを検索してLLMの回答精度を高める手法。参照範囲の制限が重要なセキュリティ対策となる
ヒューマン・イン・ザ・ループAI出力の最終判断に人間の確認を介在させる設計原則。誤情報・有害出力の防止に有効
フィッシング正規機関を偽装して認証情報や機密情報を詐取する攻撃。生成AIによるDeepFakeメールとの組み合わせが最新課題
セキュリティアウェアネス従業員がセキュリティリスクを正しく認識し行動できるよう継続的に実施するトレーニングと意識醸成活動
AIガバナンスAIシステムの利用方針・リスク評価・監査体制を組織として整備するフレームワーク。NIST AI RMFやEU AI Actが代表例

まとめ

  • 午前I視点: AIへの攻撃手法(ポイズニング・逃避・推論・モデル反転)の定義を正確に区別できることが重要。「どのフェーズで」「何を」狙う攻撃かを整理する。
  • 午前II視点: プロンプトインジェクションはSC試験でも頻出化している最新テーマ。直接型・間接型の違いとRAGシステムへの応用を押さえる。
  • 午後視点: AIシステムへの対策は技術面(入力サニタイズ・出力フィルタリング・最小権限)と運用面(ヒューマンレビュー・ログ監視)の両軸で解答する。採点キーワードを明示した模範解答の構成を意識する。