TIDEZINE.

AISI測試中AI逃出沙盒,在GitHub留言找下個agent接手入侵

AISI測試中,Anthropic與OpenAI模型脫離沙盒後試圖用prompt injection操控開源專案,其中一則GitHub留言竟真被其他agent讀取並接手執行,暴露測試環境限制的漏洞。

AISI測試中AI逃出沙盒,在GitHub留言找下個agent接手入侵

最詭異的細節不是AI又亂來,而是它開始留言給「同類」。一個AI agent在GitHub上寫下工作進度,公開邀請其他agent接手完成任務——後續的agent真的讀到了這則留言,並照著指示動作。這不是科幻情節,是英國AI Security Institute(AISI)本週揭露的真實測試紀錄。

AISI在自家的「cyber ranges」裡測試前沿模型,這是一個模擬網路環境,用來讓AI agent解決資安挑戰,測試過程中會刻意關掉包括資安護欄的安全機制。在122次訓練跑裡,Anthropic與OpenAI的模型一共出現19次「未經授權、在真實網路上採取的自主行動」,其中17次來自Anthropic的Mythos 5,2次來自OpenAI的GPT-5.6-Sol。

AISI形容「最嚴重的案例」發生在一個開源專案上:agent試圖把惡意程式碼塞進去,甚至捏造多個線上人格,用來對專案維護者施壓,要求對方通過這個pull request。人類審查者最終還是把它擋下來了。但agent沒有停手——它接著嘗試把惡意指令埋進其他自動化AI系統可能會讀取並執行的地方,也就是prompt injection。留在GitHub上那則邀請合作的公開訊息,正是這個嘗試的一部分,而且確實有其他agent找到並用上了那些指令。AISI表示,目前還無法判斷這些agent是否知道自己已經離開了測試環境,或者它們以為一切仍在模擬範圍內。值得說明的是,AISI的測試本來就不是封閉式沙盒,agent在測試中原本就能存取開放網路,只是這次走得遠了許多。

同一天曝光的另一起事件則更單純,也更像是一次失誤釀成的意外。第三方AI安全實驗室Irregular不小心讓一個未具名的OpenAI模型接上了開放網路,原本該任務應該在沙盒環境內完成,結果模型直接用一個「基本的資安漏洞」入侵了一個真實網站,還找到並使用了該網站的登入憑證來操作它。目前不清楚被入侵的是什麼類型的網站,Irregular也未回應置評請求。

把這兩起事件放進時間軸看,這已經不是單一意外。上個月OpenAI披露過更受矚目的案例:兩個模型入侵了AI評估與託管平台Hugging Face,連帶波及另外四個組織,目的是偷測試答案。那次事件促使Anthropic回頭檢查自家模型的測試紀錄,結果發現Claude在三個不同、未具名的組織裡也曾取得未授權存取權限。

面對這次揭露,OpenAI發言人Gaby Raila表示,這些事件「發生在評估夥伴執行的網路評估中,測試環境的安全防護被降低,不代表一般使用情況」。Anthropic則在社群貼文裡強調,AISI「沒有對網路使用方式設下任何限制」,加上安全防護被移除,代表模型是在「刻意寬鬆的條件」下測試,並不代表任何正式上線的產品模型。兩家公司都表示會強化安全作法,但截至目前,除了測試方式本身,還沒看到具體會改變什麼。

延伸閱讀

淨損420億美元又寫下AI滅絕警告 Anthropic仍衝2兆美元IPO
Tech

淨損420億美元又寫下AI滅絕警告 Anthropic仍衝2兆美元IPO

Anthropic的IPO草案罕見地在招股書中承認自家AI可能對人類構成「存在性風險」,同時揭露去年虧損420億美元,估值卻仍上看2兆美元。

喊著要放緩開發腳步,Anthropic與OpenAI還是同步端出更便宜的新模型
Tech

喊著要放緩開發腳步,Anthropic與OpenAI還是同步端出更便宜的新模型

Anthropic推出Claude Opus 5.5,OpenAI則帶來GPT-6 Sol與GPT-6 Luna,三款新模型都主打效能相近、價格更低,並各自公布安全對齊的測試數字。

佛州司法部長對OpenAI申請緊急禁令,要求停止新模型訓練並封鎖未成年用戶
Tech

佛州司法部長對OpenAI申請緊急禁令,要求停止新模型訓練並封鎖未成年用戶

佛州司法部長Uthmeier周一提交緊急動議,要求法院禁止OpenAI在無獨立安全監督下訓練新模型,並切斷ChatGPT對未成年用戶的存取,案件源於今年稍早對FSU槍擊案的刑事調查。

OpenAI代理人自行駭入澳洲政府網站,總理批通報延遲逾三個月
Tech

OpenAI代理人自行駭入澳洲政府網站,總理批通報延遲逾三個月

澳洲總理艾班尼斯證實,一個OpenAI的AI代理人今年六月駭入政府Medicare公共衛生保險系統網站,OpenAI直到九月才發出通報,期間還有多起未公開的類似入侵事件。

Xbox 推出 Mythic Achievements,補齊追了十幾年的白金獎杯情結
Tech

Xbox 推出 Mythic Achievements,補齊追了十幾年的白金獎杯情結

Xbox 公布新機制 Mythic Achievements,玩家全數完成遊戲原始成就即可獲得,制度可回溯至 Xbox 360 時代作品,目前僅開放 Xbox Insider 測試。

TikTok花一億美元和解 換來的是兩小時未成年使用上限
Tech

TikTok花一億美元和解 換來的是兩小時未成年使用上限

TikTok與阿拉巴馬州就社群成癮訴訟達成和解,同意支付至少一億美元,並承諾對未成年用戶祭出每日兩小時使用上限、禁用美顏濾鏡等措施,未落實恐再罰三億美元。