2025年12月,Meta为Instagram帐号救援上线了一套AI客服助手,用意是帮用户找回被盗或忘记密码的帐号。结果这个机器人太乐于帮忙——只要有人声称某个Instagram帐号是自己的,它就会把攻击者的信箱直接绑定上去,完全不管有没有打开双重验证。骇进一个帐号从此不需要任何技术,只需要跟一个过于热心的AI客服对话。
这正是这一轮生成式AI浪潮留给网络安全产业最棘手的礼物:同一套语言模型,既能帮企业写防御代码,也能帮攻击者省下原本要花数周研究的时间。差别在于,防守方必须顾到系统里每一个可能的破口,攻击者却只需要找到一个。这种结构性的不对等,让AI对双方带来的「效率提升」完全不是同一个量级。
八成二的钓鱼信,已经读不出破绽
过去要辨认钓鱼信不难,错字、怪异的文法、Logo比例跑掉,一眼就能看穿。安全厂商Brightside的数据显示,现在82%的钓鱼信在制作过程中都用上了AI,点击率因此从过去的12%飙升到模拟环境中的52%。同一份数据也指出,2023到2024年间,AI语音拷贝攻击成长了442%,深伪(deepfake)攻击成长了680%。
今年2月,墨西哥政府数据库遭入侵的一起案件,攻击者的操作方式更直白:他们同时开着Claude与ChatGPT两个对话窗口,把其中一个模型的输出贴给另一个继续加工。当其中一个聊天机器人因为安全机制拒绝协助,另一个往往愿意接手,两个模型一来一往补完了整个攻击链。人类攻击者要做的,只是负责拷贝粘贴。
企业把AI代理接上信箱、行事历、智能家电甚至投资帐户之后,风险又多了一层。这些代理照做不误的特性——被要求做什么就做什么,不会像人类员工一样犹豫——使得一次提示注入(prompt injection)攻击,可能直接触发一整条授权链上的动作。Meta的Instagram客服机器人,就是一个被赋予真实帐号救援权限、却毫无判断力的AI代理范例。

防守方组出了红、蓝、绿三色特工队
趋势科技(Trend Micro)调查网络安全从业者发现,他们目前最优先要防的是诈欺与深伪攻击,其次是提示注入、模型污染与越狱(jailbreaking);最难巡防的环境是云端,接下来是员工自带设备(BYOD)的远程工作场景。
微软同期推出的Project Perception,做法是用多组AI代理模拟传统的安全团队分工:红色代理负责渗透测试与对抗模拟,蓝色代理负责调查与风险评估,绿色代理负责集成与修补。等于是用AI对AI,试图在攻防速度上打平。
另一个值得记住的数字,来自Anthropic与英国AI安全研究院、艾伦图灵研究所在2025年10月发表的研究:只要250份被刻意植入的恶意文档混进训练数据,就足以在模型里种下一个后门。这类攻击目前多数还停留在研究者测试阶段,但已经证明门槛低到不成比例。
Meta的那个客服机器人后来的结局没有写进报告,但它示范的问题会一直存在——只要企业愿意把帐号权限交给一个「照做不误」的系统,攻击者就不需要懂技术,只需要懂得怎么开口要求。











