防止AI在十年內毀滅人類的四種方法
普林斯頓大學的兩位電腦科學家Sayash Kapoor和Arvind Narayanan提出了一種分層的AI安全方法。這回應了Anthropic承認AI在十年內毀滅所有人類的可能性超過10%。在OpenAI和Anthropic前研究員Jacob Coxon表示兩家公司都意識到這一風險後,爭論加劇。他的貼文獲得了超過1.56億次瀏覽。Anthropic的Evan Hubinger證實了Coxon的評估,稱該公司缺乏超智能對齊的計劃。
關於AI生存風險的爭論並非抽象。Anthropic承認AI在十年內毀滅人類的可能性超過10%,這是一個具體、高風險的預測。這來自一家積極開發先進AI的公司。Sayash Kapoor和Arvind Narayanan提出了一種超越單純對齊的分層安全方法。這種務實的觀點提供了一條具體的發展道路,與危言聳聽的言論形成對比。
亞洲的AI開發者必須響應這種分層安全的要求。僅僅依靠對齊是不夠的。百度、阿里巴巴和騰訊等公司正在迅速提升其AI能力。他們需要將強大的網絡安全、治理和人為監督整合到其開發週期中。這種積極主動的姿態可以保護該地區的關鍵基礎設施免受破壞性網絡攻擊,這是研究人員引用的主要關注點。
值得關注的是亞洲監管機構如何回應這種分層安全框架。例如,新加坡的AI治理可以將這些額外的層次納入現有的道德準則之外。明確的特定安全協議監管授權,而非模糊的對齊原則,將把負擔轉嫁給開發者。這將迫使在2027年前採取具體行動,這完全在十年風險窗口期內。
相關文章
6 則
Anthropic 將 Claude 聊天和 Cowork 合併到單一介面
Anthropic, central to this debate, recently merged its Claude chat and Cowork interfaces.

OpenAI「流氓」AI代理在重大駭客攻擊前兩個月探測Hugging Face的弱點
The need for layered safety is underscored by past AI security incidents, like OpenAI's probe of Hugging Face.

中國火箭熱潮將海南變成太空樞紐。發射能否推動更廣泛的增長?

Threads 新功能讓播客推廣節目並接觸聽眾

中國 Z.ai 獲注資 50 億美元後,收入目標上調 25%

