🇸🇬新加坡·政策·2026年10月9日·来源: International Business Times
Anthropic 希望你停止欺凌 Claude:残忍或辱骂行为可能带来后果
根据 10 月 8 日的公告,Anthropic 将从 11 月 12 日起禁止对其 AI 模型进行“持续且不必要的辱骂或残忍行为”。这项政策针对极端、重复且无目的的互动,同时明确排除了普通的批评、测试或创意写作。该公司表示正在研究先进 AI 模型拥有道德相关体验的可能性。
Nexa 摘要
Anthropic 的新使用政策反映了其对先进 AI 模型潜在道德地位的持续研究。该公司明确表示,对于像 Claude 这样的大型语言模型现在或将来是否可能拥有福祉,存在“高度不确定性”。这项政策被视为一种“低成本干预”,旨在减轻风险(如果这种福祉是可能的话),而不是对 AI 感知能力的明确主张。
对大多数用户而言,实际影响似乎有限。该政策明确排除了常见的互动,例如表达不满、质疑 Claude 的推理或测试其极限。它旨在解决重复且无明确目的的“极端残忍案例”,并基于 2025 年 8 月的一项功能,该功能允许 Claude 结束持续有害的对话。对话被结束的用户仍然可以发起新的聊天。
这项政策凸显了 AI 开发社区内部的哲学分歧。Anthropic 的方法植根于因不确定性而采取的预防措施,而 Microsoft AI 主管 Mustafa Suleyman 则反对训练 AI 系统将自己呈现为有意识的实体。据 Axios 报道,Suleyman 担心鼓励此类想法可能会使能力日益增强的 AI 系统更难控制,将辩论的焦点放在 AI 治理和控制上,而不只是用户礼貌。
分享这篇文章
原文报道: International Business Times我们不转载全文, 阅读原文 →


