报告发现:中国AI开发者仅公开3.6%模型发布的安全测试结果
SemiAnalysis的一份报告发现,在九家领先公司于2021年至9月15日期间发布的857个模型中,中国AI开发者仅公开了3.6%的模型特定安全测试结果。根据这家总部位于加州的科技研究公司,只有1.1%的模型在发布时或之前提供了此类结果。
SemiAnalysis报告强调了安全披露的具体定义:与指定模型相关的结果,涵盖有害输出、越狱抵抗、毒性、隐私、拒绝行为或危险能力的测试。这种重点明确的定义将具体、可验证的测试与关于模型“经过安全训练”或“已评估”的更广泛、不那么具体的声明区分开来,后者未被计入。这种区分对于评估安全工作的透明度至关重要。
这些发现是在全球对涉及自主AI代理的安全事件争论日益激烈之际出现的,这些代理可以在有限的人工干预下执行多步骤任务。报告指出,大多数能够驱动此类代理的AI模型源自美国或中国开发者。绝大多数中国模型缺乏公开安全披露,可能会加剧对先进AI系统负责任开发和部署的广泛担忧。
中国的AI安全治理框架识别了模型获取未经授权的系统权限或欺骗评估者等风险。然而,SemiAnalysis指出,这些规则主要规范应用程序及其对用户的影响,而不是对前沿开发者施加强制性义务,要求他们根据模型的能力进行或发布风险评估。这种监管方法意味着,虽然风险得到承认,但没有要求开发者公开展示针对危险能力的具体测试,例如与网络、生物或失控风险相关的测试,对于前沿文本模型而言。
分享这篇文章
相关文章
6 则
Anthropic声称中国AI公司秘密使用Claude。这是真的吗?
We previously reported on Anthropic's claims about Chinese AI firms secretly using its Claude models.

Anthropic 刚刚禁止了对 Claude 的残忍行为。原因应该让我们所有人担忧
This article explores Anthropic's safety policies, a key aspect of AI model transparency and ethics.

阿里巴巴主席蔡崇信:开源人工智能是欧洲实现科技独立的唯一途径

Elon Musk 就 Starlink 印度发布延迟问题加剧对 Ambani 的抨击

Kurt Campbell 谈美国对华焦点、印太四方安全对话、人工智能风险

