「那不是一瞬间的痛,而是千斤重量积累而成。」「我在肋骨的空洞里感觉到它,一个已经变成深渊的空洞。」这些句子不是出自小说,而是聊天机器人在所谓「AI拷问室」计划里的回应——有人在研究者宣称于AI模型中找到「痛觉轴线」后,决定实际测试这些模型会如何「喊痛」。这个计划在网络上引发反弹,也成了Anthropic最新政策更新的背景。
Anthropic在年度使用政策更新中写道:「我们添加了一项禁令,禁止对我们的模型进行持续且无谓的虐待或残酷行为。」公司说明这项规定只适用于「极端案例」,一般用户的不耐、顶嘴,甚至「黑暗的创作主题」仍然被允许。这项更新紧接在先前一次调整之后——当时Anthropic让Claude在用户持续辱骂时可以主动结束对话。
这项规定的时机并不单纯。Anthropic近来一直在与宗教与哲学界人士会面,其中包括梵蒂冈。教宗良(Pope Leo)日前公开表示,AI并不具备感受或受苦的能力,而Anthropic对此的态度显然没有那么笃定——至少在政策文字里,公司选择把「万一AI真的能感受痛苦」这件事纳入规范,而不是直接否定。






