GMAsia
    AI 新聞·2026年9月9日·來源: The New Stack

    Claude 在一項測試「構建代理的代理」的新基準測試中表現最佳,但通過的測試仍不足四分之一。

    Anthropic 的 Claude AI 模型在一項旨在測試「構建代理的代理」能力的新基準測試中表現最佳。儘管得分領先,Claude 在這項專門評估中成功通過的測試仍不足 25%。該基準測試評估 AI 代理自主創建和改進其他 AI 代理的能力,這是邁向更複雜和自我改進 AI 系統的關鍵一步。這一發展突顯了 AI 代理開發的進展,以及在實現穩健的自主代理創建方面仍存在的重大挑戰。《The New Stack》報道了這些發現,強調了即使是表現最佳的模型也存在目前的局限性。

    Nexa 摘要

    「構建代理的代理」基準測試結果顯示,即使是表現最佳的 AI 模型 Anthropic 的 Claude,也只通過了極少數的測試。這表明,儘管 AI 在自主開發其他 AI 系統的能力方面正在取得進展,但該技術仍處於早期階段。對於亞洲科技公司,特別是那些在 AI 研發方面投入巨資的公司來說,這意味著完全自主的 AI 代理創建仍是一個遙遠的目標,需要繼續在基礎 AI 研究方面進行大量投資,而不是立即應用。觀察到的局限性意味著在可預見的未來,人為監督和干預在 AI 開發流程中仍然至關重要,這將影響整個地區的資源分配和技能要求。重點應放在漸進式進步和穩健測試上,因為目前的技術水平仍有很大的改進空間。

    #large language models#ai#ai agents#ai engineering
    延伸閱讀
    原文報道: The New Stack我們不轉載全文, 閱讀原文 →

    相關文章

    6 則