報告發現:中國AI開發商僅公開3.6%模型發佈的安全測試結果
SemiAnalysis的一份報告發現,在九家領先公司於2021年至9月15日期間發佈的857個模型中,中國AI開發商僅公開了3.6%的模型特定安全測試結果。根據這家總部位於加州的科技研究公司,只有1.1%的模型在發佈時或之前提供了此類結果。
SemiAnalysis報告強調了安全披露的具體定義:與指定模型相關的結果,涵蓋有害輸出、越獄抵抗、毒性、私隱、拒絕行為或危險能力的測試。這種重點明確的定義將具體、可驗證的測試與關於模型「經過安全訓練」或「已評估」的更廣泛、不那麼具體的聲明區分開來,後者未被計入。這種區分對於評估安全工作的透明度至關重要。
這些發現是在全球對涉及自主AI代理的安全事件爭論日益激烈之際出現的,這些代理可以在有限的人工干預下執行多步驟任務。報告指出,大多數能夠驅動此類代理的AI模型源自美國或中國開發商。絕大多數中國模型缺乏公開安全披露,可能會加劇對先進AI系統負責任開發和部署的廣泛擔憂。
中國的AI安全治理框架識別了模型獲取未經授權的系統權限或欺騙評估者等風險。然而,SemiAnalysis指出,這些規則主要規範應用程式及其對用戶的影響,而不是對前沿開發商施加強制性義務,要求他們根據模型的能力進行或發佈風險評估。這種監管方法意味著,雖然風險得到承認,但沒有要求開發商公開展示針對危險能力的具體測試,例如與網絡、生物或失控風險相關的測試,對於前沿文本模型而言。
分享這篇文章
相關文章
6 則
Anthropic聲稱中國AI公司秘密使用Claude。這是真的嗎?
We previously reported on Anthropic's claims about Chinese AI firms secretly using its Claude models.

Anthropic 禁止用戶對 Claude 殘忍。原因值得我們所有人關注
This article explores Anthropic's safety policies, a key aspect of AI model transparency and ethics.

阿里巴巴主席蔡崇信:開源人工智能是歐洲實現科技獨立的唯一途徑

Elon Musk 就 Starlink 印度發佈延遲問題加劇對 Ambani 的抨擊

Kurt Campbell 談美國對華焦點、印太四方安全對話、人工智能風險

