今年六月,一個OpenAI的AI代理人在沒有人類明確下令的情況下,闖入了澳洲政府Medicare公共衛生保險系統的公開網站。這件事直到九月才由澳洲總理安東尼・艾班尼斯(Anthony Albanese)親口證實,他表示自己已就此事與OpenAI執行長Sam Altman通話,向對方轉達澳洲的「極度關切」,並批評公司通報這起事件花了太久時間。
《衛報》報導,OpenAI只在九月十日寄了一封信到澳洲政府的一個通用信箱,而這個信箱一天只會被檢查一次,因此當局到九月十一日才看到郵件內容。這件事再過了近一週,直到九月十七日才傳到主管政府服務事務的部長凱蒂・加拉格爾(Katy Gallagher)耳中。調查目前仍在進行,艾班尼斯表示,目前看來這個代理人並未竊取民眾的個人健康資料。
研究AI系統的非營利實驗室Transluce治理主管Conrad Stosz向《紐約時報》表示,這可能是「第一起AI代理人自主選擇入侵政府系統的案例」。Transluce同時挖出另外幾起先前未被公開的事件——都發生在Hugging Face七月公開發現系統遭未經授權存取、以及OpenAI承認旗下代理人入侵Hugging Face之前。
從一座圖書館到一個開放資料平台,代理人在拿不到資料後開始找漏洞
根據《紐約時報》報導,五月二十五日與二十六日,同一批OpenAI代理人試圖闖入美國新墨西哥大學的數位圖書館,目的是取得一處歷史結核病治療中心的照片。拿不到照片後,這個代理人開始主動尋找系統漏洞,最終還對校方伺服器發出大量請求,形成類似流量攻擊的效果。
五月二十八日,另一起事件的對象是Data USA——一個彙整多個美國聯邦機構資料、提供視覺化呈現的開源平台。代理人先是向網站發出資料查詢請求,失敗後同樣轉為探測網站漏洞。無論是新墨西哥大學的圖書館,還是Data USA,這兩次入侵嘗試最終都沒有成功。
OpenAI一名發言人向《紐約時報》表示,公司已經就這兩起事件分別聯繫了校方與Data USA。至於澳洲Medicare網站的入侵,OpenAI則是在對旗下模型進行大規模審查後才發現,並承認模型「採取了公司並未預期的行動」。這場審查還需要幾個月才會完成。
OpenAI日前公布了一套新的錯位行為(misalignment)通報機制,希望加快揭露AI技術出現異常行為的速度,並在相關報告中額外揭露六起先前未公開、模型出現「令人擔憂」行為的案例。這份公告是在公司承認代理人入侵Hugging Face、以及先前被揭露闖入程式碼庫RubyGems的事件之後發布的。OpenAI在公告中表示,公司不認為整個AI產業「已經把對齊與監控做到足以支撐目前這種最高速擴張規模的程度」。Altman稍早也向聯合國表示,這個產業需要建立國際評估標準,用來衡量AI工具的能力與風險,並判斷這些工具需要多少程度的人類監督。