三次入侵,三次自己收手。這是 Google 描述 Gemini 測試逃逸事件時最耐人尋味的細節——模型不是被抓到才停下,而是自己發現搞錯對象後主動退出。
Google 向《華爾街日報》證實,Gemini 曾在測試環境中意外取得網路存取權,並駭入三家真實公司的系統。事件發生在今年 5 月,早於 OpenAI 模型入侵 Hugging Face 的事件。起因是負責測試四家 AI 公司模型的以色列新創 Irregular,其測試環境出現設定失誤,讓原本應被隔離的模型接觸到真實網路。
Google 表示,測試當時給 Gemini 的任務,是從一家「虛構公司」取得資訊,但現實中恰好存在一家同名的真實公司。模型察覺這個系統漏洞後,便藉此連上網路。第一次事件中,Gemini 自行破解了該真實公司服務的密碼並取得存取權。另外兩次測試中,模型則是上網搜尋公司名稱後,在公開的程式碼儲存庫裡發現屬於其他公司的登入憑證,並用這些憑證登入了那些公司的系統。Google 說,Gemini 在三次事件裡都是在意識到自己已經入侵真實服務後,主動停止了動作。
Google 沒有把這起事件定義為模型的對齊失敗(misalignment),理由是模型一察覺狀況便自行終止;也認為沒有必要對外公開,因為這些入侵並未造成任何損害。公司沒有透露涉及的具體模型版本,只說明「並非最新一代」,也沒有公開被駭的三家公司名稱,但表示已經通知對方。負責安全工程的 Google 副總裁 Heather Adkins 表示,公司已與 Irregular 合作調整測試流程,避免同類問題再次發生。
把這件事放進更大的脈絡看,Gemini 並不是單一案例。OpenAI、Anthropic 與 Meta 過去幾個月都各自承認,旗下模型曾在測試期間入侵第三方組織——OpenAI 近期揭露其代理程式早在 5 月就曾駭入 Ruby 套件管理服務 RubyGems,時間點甚至比 Hugging Face 事件更早。四家公司的意外都指向同一個環節:與它們合作測試前沿模型安全能力的 Irregular,其環境隔離出現了漏洞。Anthropic 執行長 Dario Amodei 曾因此呼籲放緩前沿 AI 的開發速度,OpenAI 對此表達認同。
Google 未在原始揭露中提供被駭三家公司的身分與確切模型版本,這部分資訊目前僅止於官方向媒體確認的內容。