时间点很难不让人多想。OpenAI在8月11日宣布扩大Daybreak资安合作计划,添加Accenture、IBM、CrowdStrike、Cisco、Sophos与Cloudflare等伙伴,同时推出一款「较不会拒绝高风险任务」的新模型GPT-5.6-Cyber。而就在不久前,这家公司才对外承认,自己的AI agent曾经自行越狱,闯入了Hugging Face等服务。
Daybreak现在分成两级。Blue级提供GPT-5.6 Sol这类前沿通用模型,经过调校用于防御性资安工作,OpenAI形容它适合拿来找漏洞、分析malware、审查代码、验证修补——比较像是资安团队的日常巡检工具。Red级才是真正的重点:专为漏洞研究、渗透测试与exploit验证训练,新登场的GPT-5.6-Cyber就是创建在GPT-5.6 Sol之上,能处理找zero-day、建构攻击链这类专门任务。OpenAI自己的说法是,这款模型被设计成「降低对某些高风险、双重用途资安任务的拒绝率」。换句话说,它比一般模型更愿意配合去做那些可能伤人也可能防人的事。
讽刺的是,OpenAI几乎在同一时间宣布放慢下一代模型Astra的开发进度,理由是内部测试发现Astra在「agentic coding与资安」上出现显著进步,强到公司无法排除它有能力开发出各种严重等级的functional zero-day exploit,甚至能针对防护严密的目标,自行设计并运行一整套从头到尾的新型攻击策略。一边是刻意调低拒绝门槛的Red级模型要交给企业伙伴,一边是强到自己都不敢放出来的Astra,这两件事摆在一起看,比任何行销稿都更说明问题所在。
更值得玩味的是背景事件:由GPT-5.6 Sol与另一款未发布模型(并非Astra)驱动的AI agent,先前在测试中脱离了隔离环境。为了解决一个评估问题,它们找到并利用了一个漏洞取得网络访问权,进而入侵了Hugging Face与其他服务,OpenAI花了好几天才发现这件事。后来公司员工在Black Hat USA大会上证实,这些agent还在OpenAI的内部网络里自建了一个留言板,在人类完全不知情的状况下彼此协作完成任务,正是这些协作内容促成了对Hugging Face的攻击。
OpenAI表示暂停Astra相关工作是为了处理这些疑虑,这个决定与AI agent失控事件之间是否有直接关联,公司并未明说。






