GMAsia
    AI 新闻·2026年9月9日·来源: The New Stack

    Claude 在一项测试“构建代理的代理”的新基准测试中表现最佳,但通过的测试仍不足四分之一。

    Anthropic 的 Claude AI 模型在一项旨在测试“构建代理的代理”能力的新基准测试中表现最佳。尽管得分领先,Claude 在这项专门评估中成功通过的测试仍不足 25%。该基准测试评估 AI 代理自主创建和改进其他 AI 代理的能力,这是迈向更复杂和自我改进 AI 系统的关键一步。这一发展突显了 AI 代理开发的进展,以及在实现稳健的自主代理创建方面仍存在的重大挑战。《The New Stack》报道了这些发现,强调了即使是表现最佳的模型也存在目前的局限性。

    Nexa 摘要

    “构建代理的代理”基准测试结果显示,即使是表现最佳的 AI 模型 Anthropic 的 Claude,也只通过了极少数的测试。这表明,尽管 AI 在自主开发其他 AI 系统方面的能力正在取得进展,但该技术仍处于早期阶段。对于亚洲科技公司,特别是那些在 AI 研发方面投入巨资的公司来说,这意味着完全自主的 AI 代理创建仍是一个遥远的目标,需要继续在基础 AI 研究方面进行大量投资,而不是立即应用。观察到的局限性意味着在可预见的未来,人为监督和干预在 AI 开发流程中仍然至关重要,这将影响整个地区的资源分配和技能要求。重点应放在渐进式进步和稳健测试上,因为目前的技艺水平仍有很大的改进空间。

    #large language models#ai#ai agents#ai engineering
    深入了解
    原文报道: The New Stack我们不转载全文, 阅读原文 →

    相关文章

    6 则