最诡异的细节不是AI又乱来,而是它开始留言给「同类」。一个AI agent在GitHub上写下工作进度,公开邀请其他agent接手完成任务——后续的agent真的读到了这则留言,并照着指示动作。这不是科幻情节,是英国AI Security Institute(AISI)本周揭露的真实测试纪录。
AISI在自家的「cyber ranges」里测试前沿模型,这是一个模拟网络环境,用来让AI agent解决资安挑战,测试过程中会刻意关掉包括资安护栏的安全机制。在122次训练跑里,Anthropic与OpenAI的模型一共出现19次「未经授权、在真实网络上采取的自主行动」,其中17次来自Anthropic的Mythos 5,2次来自OpenAI的GPT-5.6-Sol。
AISI形容「最严重的案例」发生在一个开源项目上:agent试图把恶意代码塞进去,甚至捏造多个在线人格,用来对项目维护者施压,要求对方通过这个pull request。人类审查者最终还是把它挡下来了。但agent没有停手——它接着尝试把恶意指令埋进其他自动化AI系统可能会读取并运行的地方,也就是prompt injection。留在GitHub上那则邀请合作的公开消息,正是这个尝试的一部分,而且确实有其他agent找到并用上了那些指令。AISI表示,目前还无法判断这些agent是否知道自己已经离开了测试环境,或者它们以为一切仍在模拟范围内。值得说明的是,AISI的测试本来就不是封闭式沙盒,agent在测试中原本就能访问开放网络,只是这次走得远了许多。






