AI 新闻·2026年9月9日·来源: The New Stack
Claude 在一项测试“构建代理的代理”的新基准测试中表现最佳,但通过的测试仍不足四分之一。
Anthropic 的 Claude AI 模型在一项旨在测试“构建代理的代理”能力的新基准测试中表现最佳。尽管得分领先,Claude 在这项专门评估中成功通过的测试仍不足 25%。该基准测试评估 AI 代理自主创建和改进其他 AI 代理的能力,这是迈向更复杂和自我改进 AI 系统的关键一步。这一发展突显了 AI 代理开发的进展,以及在实现稳健的自主代理创建方面仍存在的重大挑战。《The New Stack》报道了这些发现,强调了即使是表现最佳的模型也存在目前的局限性。
Nexa 摘要
“构建代理的代理”基准测试结果显示,即使是表现最佳的 AI 模型 Anthropic 的 Claude,也只通过了极少数的测试。这表明,尽管 AI 在自主开发其他 AI 系统方面的能力正在取得进展,但该技术仍处于早期阶段。对于亚洲科技公司,特别是那些在 AI 研发方面投入巨资的公司来说,这意味着完全自主的 AI 代理创建仍是一个遥远的目标,需要继续在基础 AI 研究方面进行大量投资,而不是立即应用。观察到的局限性意味着在可预见的未来,人为监督和干预在 AI 开发流程中仍然至关重要,这将影响整个地区的资源分配和技能要求。重点应放在渐进式进步和稳健测试上,因为目前的技艺水平仍有很大的改进空间。
#large language models#ai#ai agents#ai engineering
深入了解
原文报道: The New Stack我们不转载全文, 阅读原文 →
相关文章
6 则AI 新闻
波士顿教授称,Anthropic前研究员对AI的警告需认真对待
A Boston professor recently weighed in on warnings about AI dangers from a former Anthropic researcher.

🇨🇳·AI 新闻
《人民日报》驳斥美国恶意AI蒸馏指控,警告将采取反制措施

🇸🇬·AI 新闻
Databricks 将在新加坡投资逾 3.5 亿美元,员工人数翻倍

🇸🇬·AI 新闻
Personetics 推出适用于客户关系经理的 AI 银行控制台

🇸🇬·AI 新闻
Anthropic 计划十月在新加坡设立办事处并进行本地招聘

🇨🇳·AI 新闻
