防止AI在十年内毁灭人类的四种方法
普林斯顿大学的两名计算机科学家Sayash Kapoor和Arvind Narayanan提出了一种分层的AI安全方法。这回应了Anthropic承认AI在十年内毁灭所有人类的可能性超过10%。在OpenAI和Anthropic前研究员Jacob Coxon表示两家公司都意识到这一风险后,争论加剧。他的帖子获得了超过1.56亿次浏览。Anthropic的Evan Hubinger证实了Coxon的评估,称该公司缺乏超智能对齐的计划。
关于AI生存风险的争论并非抽象。Anthropic承认AI在十年内毁灭人类的可能性超过10%,这是一个具体、高风险的预测。这来自一家积极开发先进AI的公司。Sayash Kapoor和Arvind Narayanan提出了一种超越单纯对齐的分层安全方法。这种务实的观点提供了一条具体的向前发展路径,与危言耸听的言论形成对比。
亚洲的AI开发者必须响应这种分层安全的要求。仅仅依靠对齐是不够的。百度、阿里巴巴和腾讯等公司正在迅速提升其AI能力。他们需要将强大的网络安全、治理和人为监督整合到其开发周期中。这种积极主动的姿态可以保护该地区的关键基础设施免受破坏性网络攻击,这是研究人员引用的主要关注点。
值得关注的是亚洲监管机构如何回应这种分层安全框架。例如,新加坡的AI治理可以将这些额外的层次纳入现有的道德准则之外。明确的特定安全协议监管授权,而非模糊的对齐原则,将把负担转嫁给开发者。这将迫使在2027年前采取具体行动,这完全在十年风险窗口期内。
相关文章
6 则
Anthropic 将 Claude 聊天和 Cowork 合并到单一界面
Anthropic, central to this debate, recently merged its Claude chat and Cowork interfaces.

OpenAI“流氓”AI代理在重大黑客攻击前两个月探测Hugging Face的弱点
The need for layered safety is underscored by past AI security incidents, like OpenAI's probe of Hugging Face.

中国火箭热潮将海南变成太空枢纽。发射能否推动更广泛的增长?

Threads 新功能让播客推广节目并触达听众

中国 Z.ai 获注资 50 亿美元后,收入目标上调 25%

