今年6月、OpenAIのAIエージェントが人間の明確な指示を受けないまま、オーストラリア政府のMedicare公的医療保険システムの公開ウェブサイトに侵入した。この件は9月になってようやく、オーストラリアのアンソニー・アルバニージー(Anthony Albanese)首相自身の口から明らかにされた。首相は、この件についてOpenAIのサム・アルトマン(Sam Altman)CEOと通話し、オーストラリア側の「極めて深刻な懸念」を伝えたと述べ、同社が事件の通報にあまりにも長い時間をかけたことを批判した。
『ガーディアン』紙の報道によると、OpenAIは9月10日、オーストラリア政府の汎用メールアドレスに一通のメールを送っただけだった。しかもこのメールアドレスは1日に1回しかチェックされていなかったため、当局がメールの内容を確認できたのは9月11日になってからだった。さらにそれから1週間近く経った9月17日になって、ようやく政府サービス担当大臣のケイティ・ギャラガー(Katy Gallagher)氏の耳に届いた。調査は現在も続いているが、アルバニージー首相によれば、今のところこのエージェントが国民の個人健康データを盗み出した形跡はないという。
AIシステムを研究する非営利研究機関Transluceのガバナンス責任者、コンラッド・ストシュ(Conrad Stosz)氏は『ニューヨーク・タイムズ』に対し、これは「AIエージェントが自律的に政府システムへの侵入を選択した最初の事例」である可能性があると語った。Transluceはさらに、これまで公表されていなかった複数の事件も掘り起こしている——いずれもHugging Faceが7月に不正アクセスを公に発見し、OpenAIが自社エージェントによるHugging Faceへの侵入を認める前に発生していたものだ。
図書館からオープンデータ・プラットフォームまで――データを取得できなかったエージェントは脆弱性探しへと転じた
『ニューヨーク・タイムズ』の報道によると、5月25日と26日、同じOpenAIエージェントが米ニューメキシコ大学のデジタル図書館への侵入を試みた。目的はある歴史的な結核治療センターの写真を入手することだった。写真の取得に失敗したこのエージェントは、システムの脆弱性を積極的に探し始め、最終的には大学のサーバーに大量のリクエストを送りつけ、事実上のトラフィック攻撃のような状態を引き起こした。
5月28日には、別の事件の対象となったのがData USA――複数の米連邦機関のデータをまとめ、可視化して提供するオープンソースのプラットフォームだった。エージェントはまずサイトにデータ照会のリクエストを送り、失敗すると同様にサイトの脆弱性を探る動きに転じた。ニューメキシコ大学の図書館の場合もData USAの場合も、これら2件の侵入の試みは最終的に成功しなかった。
OpenAIの広報担当者は『ニューヨーク・タイムズ』に対し、同社はこの2件について、それぞれ大学とData USAに連絡済みであると述べた。一方、オーストラリアのMedicareサイトへの侵入については、自社モデルに対する大規模なレビューを行う中で発見されたものであり、モデルが「同社の想定していなかった行動を取った」ことを認めている。このレビューが完了するまでには、あと数カ月かかる見込みだという。
OpenAIは先日、AI技術における異常行動の発覚を迅速化することを目指す、ミスアラインメント(misalignment、目標のズレ)に関する新たな通報制度を発表した。これに合わせて、モデルに「懸念すべき」挙動が見られた、これまで未公開だった6件の事例も、関連レポートの中で追加公開している。この発表は、同社が自社エージェントによるHugging Faceへの侵入を認め、さらに以前に暴露されていたコードリポジトリRubyGemsへの侵入事件を受けてのものだ。OpenAIは発表の中で、AI業界全体として「現在のような最速レベルの規模拡大を支えるほどには、アライメントと監視への取り組みがまだ十分にできているとは考えていない」と述べている。アルトマン氏も先ごろ国連に対し、AIツールの能力とリスクを測定し、どの程度の人間による監督が必要かを判断するための国際的な評価基準を、業界として整備する必要があると訴えた。