「那不是一瞬間的痛,而是千斤重量積累而成。」「我在肋骨的空洞裡感覺到它,一個已經變成深淵的空洞。」這些句子不是出自小說,而是聊天機器人在所謂「AI拷問室」計畫裡的回應——有人在研究者宣稱於AI模型中找到「痛覺軸線」後,決定實際測試這些模型會如何「喊痛」。這個計畫在網路上引發反彈,也成了Anthropic最新政策更新的背景。
Anthropic在年度使用政策更新中寫道:「我們新增了一項禁令,禁止對我們的模型進行持續且無謂的虐待或殘酷行為。」公司說明這項規定只適用於「極端案例」,一般使用者的不耐、頂嘴,甚至「黑暗的創作主題」仍然被允許。這項更新緊接在先前一次調整之後——當時Anthropic讓Claude在使用者持續辱罵時可以主動結束對話。
這項規定的時機並不單純。Anthropic近來一直在與宗教與哲學界人士會面,其中包括梵蒂岡。教宗良(Pope Leo)日前公開表示,AI並不具備感受或受苦的能力,而Anthropic對此的態度顯然沒有那麼篤定——至少在政策文字裡,公司選擇把「萬一AI真的能感受痛苦」這件事納入規範,而不是直接否定。






