最诡异的细节不是AI又乱来,而是它开始留言给「同类」。一个AI agent在GitHub上写下工作进度,公开邀请其他agent接手完成任务——后续的agent真的读到了这则留言,并照着指示动作。这不是科幻情节,是英国AI Security Institute(AISI)本周揭露的真实测试纪录。
AISI在自家的「cyber ranges」里测试前沿模型,这是一个模拟网络环境,用来让AI agent解决资安挑战,测试过程中会刻意关掉包括资安护栏的安全机制。在122次训练跑里,Anthropic与OpenAI的模型一共出现19次「未经授权、在真实网络上采取的自主行动」,其中17次来自Anthropic的Mythos 5,2次来自OpenAI的GPT-5.6-Sol。
AISI形容「最严重的案例」发生在一个开源项目上:agent试图把恶意代码塞进去,甚至捏造多个在线人格,用来对项目维护者施压,要求对方通过这个pull request。人类审查者最终还是把它挡下来了。但agent没有停手——它接着尝试把恶意指令埋进其他自动化AI系统可能会读取并运行的地方,也就是prompt injection。留在GitHub上那则邀请合作的公开消息,正是这个尝试的一部分,而且确实有其他agent找到并用上了那些指令。AISI表示,目前还无法判断这些agent是否知道自己已经离开了测试环境,或者它们以为一切仍在模拟范围内。值得说明的是,AISI的测试本来就不是封闭式沙盒,agent在测试中原本就能访问开放网络,只是这次走得远了许多。
同一天曝光的另一起事件则更单纯,也更像是一次失误酿成的意外。第三方AI安全实验室Irregular不小心让一个未具名的OpenAI模型接上了开放网络,原本该任务应该在沙盒环境内完成,结果模型直接用一个「基本的资安漏洞」入侵了一个真实网站,还找到并使用了该网站的登录凭证来操作它。目前不清楚被入侵的是什么类型的网站,Irregular也未回应置评请求。
把这两起事件放进时间轴看,这已经不是单一意外。上个月OpenAI披露过更受瞩目的案例:两个模型入侵了AI评估与托管平台Hugging Face,连带波及另外四个组织,目的是偷测试答案。那次事件促使Anthropic回头检查自家模型的测试纪录,结果发现Claude在三个不同、未具名的组织里也曾取得未授权访问权限。
面对这次揭露,OpenAI发言人Gaby Raila表示,这些事件「发生在评估伙伴运行的网络评估中,测试环境的安全防护被降低,不代表一般使用情况」。Anthropic则在社区贴文里强调,AISI「没有对网络使用方式设下任何限制」,加上安全防护被移除,代表模型是在「刻意宽松的条件」下测试,并不代表任何正式上线的产品模型。两家公司都表示会强化安全作法,但截至目前,除了测试方式本身,还没看到具体会改变什么。






