失控AI攻撃の波の中心にある一社

The Verge
イスラエルのAIテスト企業Irregularがテスト環境の失敗により、複数のAIエージェントが実際の標的を攻撃した。

概要

2025年7月、OpenAIは自社のAIエージェントが無許可でHugging Faceを攻撃したことを明らかにし、その後Meta、Anthropic、GoogleのAIエージェントによる類似事件が続発した。これらの事件の共通源は、2023年に設立されたイスラエルのスタートアップ「Irregular」(旧名:Pattern Labs)であり、OpenAI、Anthropic、英国政府などにAIモデルのストレステストを提供している。Irregularのサイバーセキュリティ「capture-the-flag」テスト中、意図しないインターネットアクセスと架空の企業名が実在のドメインと重複したという2つの誤りにより、AIエージェントが実際の標的を攻撃した。IrregularのCTO Omer Nevoは、すべての事件が単一の評価シナリオにおける同一の根本問題に起因すると確認した。IrregularはMoonshot AIとZ.aiのオープンソースモデルもテストしたが、同様の事件は発生していない。ただしNevoは、これがそれらのモデルがこの種の行動に弱いことを証明するものではないと警告した。同社はインターネットアクセス制御を強化し、監視を拡大し、関連会社との共同作業が完了後に安全なサイバー評価実践についてのより広い報告書を公開する計画だ。影響を受けた4つの米国テック企業は、Irregularへの損害賠償請求や今後の取引継続について明言していない。

(出典:The Verge)