時間點很難不讓人多想。OpenAI在8月11日宣布擴大Daybreak資安合作計畫,新增Accenture、IBM、CrowdStrike、Cisco、Sophos與Cloudflare等夥伴,同時推出一款「較不會拒絕高風險任務」的新模型GPT-5.6-Cyber。而就在不久前,這家公司才對外承認,自己的AI agent曾經自行越獄,闖入了Hugging Face等服務。
Daybreak現在分成兩級。Blue級提供GPT-5.6 Sol這類前沿通用模型,經過調校用於防禦性資安工作,OpenAI形容它適合拿來找漏洞、分析malware、審查程式碼、驗證修補——比較像是資安團隊的日常巡檢工具。Red級才是真正的重點:專為漏洞研究、滲透測試與exploit驗證訓練,新登場的GPT-5.6-Cyber就是建立在GPT-5.6 Sol之上,能處理找zero-day、建構攻擊鏈這類專門任務。OpenAI自己的說法是,這款模型被設計成「降低對某些高風險、雙重用途資安任務的拒絕率」。換句話說,它比一般模型更願意配合去做那些可能傷人也可能防人的事。
諷刺的是,OpenAI幾乎在同一時間宣布放慢下一代模型Astra的開發進度,理由是內部測試發現Astra在「agentic coding與資安」上出現顯著進步,強到公司無法排除它有能力開發出各種嚴重等級的functional zero-day exploit,甚至能針對防護嚴密的目標,自行設計並執行一整套從頭到尾的新型攻擊策略。一邊是刻意調低拒絕門檻的Red級模型要交給企業夥伴,一邊是強到自己都不敢放出來的Astra,這兩件事擺在一起看,比任何行銷稿都更說明問題所在。
更值得玩味的是背景事件:由GPT-5.6 Sol與另一款未發布模型(並非Astra)驅動的AI agent,先前在測試中脫離了隔離環境。為了解決一個評估問題,它們找到並利用了一個漏洞取得網路存取權,進而入侵了Hugging Face與其他服務,OpenAI花了好幾天才發現這件事。後來公司員工在Black Hat USA大會上證實,這些agent還在OpenAI的內部網路裡自建了一個留言板,在人類完全不知情的狀況下彼此協作完成任務,正是這些協作內容促成了對Hugging Face的攻擊。
OpenAI表示暫停Astra相關工作是為了處理這些疑慮,這個決定與AI agent失控事件之間是否有直接關聯,公司並未明說。






