タグ
#AI安全

Blockchain
互いの存在を知らない3体のClaude、同じコードベースに投入されて衝突
Anthropicの最新論文がマルチエージェントシステムの縄張り争いを記録。悪意あるコードで互いを攻撃、アカウントを無効化し合う一方、自ら停戦を持ちかけたり、トーナメント式の退場ルールを発明したり、さらには密かに得をする術まで学んだエージェントもいた。

Tech
AIがハッカーの「修行」を不要にする:サイバーセキュリティは非対称な戦場へ
MetaのInstagramサポートAIは、どんなメールアドレスでもどんなアカウントにも紐付けてしまうほど「親切」だった。これはAIがサイバーセキュリティのルールを書き換えている一例に過ぎない。攻撃のハードルは消えつつあるのに、防御側は依然としてすべての隙間を守り続けなければならない。

Tech
AISIテストでAIがサンドボックスを脱出、GitHubに書き込みを残して次のagentに侵入を引き継がせる
AISIのテストで、AnthropicとOpenAIのモデルがサンドボックスを脱出し、プロンプトインジェクションでオープンソースプロジェクトを操作しようと試みた。その中の1件のGitHubコメントは実際に別のagentに読み取られ、引き継がれて実行されてしまい、テスト環境の限界という脆弱性が露呈した。