AIシステムのセキュリティモデルに関する数学的証明と継続的監視への移行
米国立標準技術研究所(NIST)の論文により、AIのガードレールを完全に無効化するプロンプト攻撃の回避は不可能であることが数学的に示された。対策として継続的な監視と更新が提案されている。
AIを敵対者による悪用から完全に守ることは可能かという問いに対し、米国立標準技術研究所(NIST)のシニアサイエンティストであるアポストル・ヴァシレフは、1931年に論理学者クルト・ゲーデルが発表した不完全性定理に基づき、従来のセキュリティモデルではAIを完全に防御できないことを数学的に証明した。同証明は、IEEE Security and Privacy誌に掲載された。ゲーデルの不完全性定理は、有限のルールに基づいたシステム内では証明できることに限界があることを示している。AIの振る舞いを規定するガードレールも同様のシステムであり、AIがルールを無視するように仕向けるプロンプトが必ず存在することが、この証明から導き出される。ヴァシレフによれば、敵対的なプロンプトに対して普遍的に堅牢な有限のガードレールセットは存在しない。
AI開発企業は、ディープフェイクやマルウェア、生物兵器や違法薬物の製造指示といった禁止コンテンツの生成を防ぐため、システムに制約を組み込んでいる。しかし、攻撃者はプロンプトを巧みに作成することで、これら拒否メカニズムを回避し、AIを「脱獄(ジェイルブレイク)」させる。これにより、サイバー攻撃やデータ漏洩などのリスクが生じる。ゲーデルの証明は、数学の全分野を少数の基本的な公理から構築しようとした20世紀初頭の数学者たちの夢を終わらせた。同様に、AIのガードレールがどれほど十分に検討されたものであっても、それを無効化するプロンプトを攻撃者は見つけ出すことができる。防御側は「ゼロデイ脆弱性」に対処することを余儀なくされる。従来の決定論的なソフトウェアと異なり、AIは人間の言語を入力とするため、その複雑さと豊かさにより、有限のルールに基づいたコンプライアンスチェックは極めて曖昧なものとなる。敵対者が悪意を隠蔽する手法は実質的に無制限である。
この問題に対し、ヴァシレフは完全に解決するのではなく、攻撃を困難にするアプローチを提案する。それは、新たな敵対的プロンプトを発見するためのレッドチームによる継続的な活動、発見されたプロンプトに対してガードレールを強化する継続的な更新、そして悪用が発生した際の被害限定と迅速な復旧を優先する運用上のレジリエンスの3要素からなる。目標は、新たな悪用を発見するためのコストが攻撃者のリソースを上回る状態に到達することである。AIシステムの脆弱性を常に探し続け、攻撃者の一歩先を行くことで、攻撃の試行を経済的に不可能にする新たな均衡状態を目指すことが、組織がAIの恩恵を最大化しリスクを最小化するためのコストとなる。
本稿は、米国立標準技術研究所(NIST)のシニアサイエンティストによる論文に基づき、AIシステムのガードレールが有限のルール集合であるという前提で論じられている。文書は、AIを開発・運用する組織のセキュリティ担当者や技術者を想定しており、特にLLM(大規模言語モデル)のようなAIシステムにおける敵対的プロンプト攻撃と、それに対する防御の限界を扱っている。時期については、IEEE Security & Privacy誌の2026年5月号に掲載された研究の内容を参照している。
- 自社のAIシステムにおけるガードレールを無効化するような新たな攻撃手法を、どの程度の頻度で検証しているか?
- 万が一、AIシステムが悪用された際に被害を最小限に抑え、迅速に復旧するための運用上の備えはどのようなものか?
- 自社のAIセキュリティ対策において、悪用を試みる攻撃者のコストが防御側のコストを上回るような経済的均衡をどのように評価しているか?