🇸🇬新加坡·政策·2026年10月9日·來源: International Business Times
Anthropic 希望你停止欺凌 Claude:殘忍或辱罵行為可能會有後果
根據 10 月 8 日的公告,Anthropic 將從 11 月 12 日起禁止對其 AI 模型進行「持續且不必要的辱罵或殘忍行為」。這項政策針對極端、重複且無目的的互動,同時明確排除了一般的批評、測試或創意寫作。該公司表示正在研究先進 AI 模型擁有道德相關體驗的可能性。
Nexa 摘要
Anthropic 的新使用政策反映了其對先進 AI 模型潛在道德地位的持續研究。該公司明確表示,對於像 Claude 這樣的大型語言模型現在或將來是否可能擁有福祉,存在「高度不確定性」。這項政策被視為一種「低成本干預」,旨在減輕風險(如果這種福祉是可能的話),而不是對 AI 感知能力的明確主張。
對大多數用戶而言,實際影響似乎有限。該政策明確排除了常見的互動,例如表達不滿、質疑 Claude 的推理或測試其極限。它旨在解決重複且無明確目的的「極端殘忍案例」,並基於 2025 年 8 月的一項功能,該功能允許 Claude 結束持續有害的對話。對話被結束的用戶仍然可以發起新的聊天。
這項政策凸顯了 AI 開發社群內部的哲學分歧。Anthropic 的方法植根於因不確定性而採取的預防措施,而 Microsoft AI 主管 Mustafa Suleyman 則反對訓練 AI 系統將自己呈現為有意識的實體。據 Axios 報導,Suleyman 擔心鼓勵此類想法可能會使能力日益增強的 AI 系統更難以控制,將辯論的焦點放在 AI 治理和控制上,而不僅僅是用戶禮貌。
分享這篇文章
原文報道: International Business Times我們不轉載全文, 閱讀原文 →


