AI 新聞·2026年9月9日·來源: The New Stack
Claude 在一項測試「構建代理的代理」的新基準測試中表現最佳,但通過的測試仍不足四分之一。
Anthropic 的 Claude AI 模型在一項旨在測試「構建代理的代理」能力的新基準測試中表現最佳。儘管得分領先,Claude 在這項專門評估中成功通過的測試仍不足 25%。該基準測試評估 AI 代理自主創建和改進其他 AI 代理的能力,這是邁向更複雜和自我改進 AI 系統的關鍵一步。這一發展突顯了 AI 代理開發的進展,以及在實現穩健的自主代理創建方面仍存在的重大挑戰。《The New Stack》報道了這些發現,強調了即使是表現最佳的模型也存在目前的局限性。
Nexa 摘要
「構建代理的代理」基準測試結果顯示,即使是表現最佳的 AI 模型 Anthropic 的 Claude,也只通過了極少數的測試。這表明,儘管 AI 在自主開發其他 AI 系統的能力方面正在取得進展,但該技術仍處於早期階段。對於亞洲科技公司,特別是那些在 AI 研發方面投入巨資的公司來說,這意味著完全自主的 AI 代理創建仍是一個遙遠的目標,需要繼續在基礎 AI 研究方面進行大量投資,而不是立即應用。觀察到的局限性意味著在可預見的未來,人為監督和干預在 AI 開發流程中仍然至關重要,這將影響整個地區的資源分配和技能要求。重點應放在漸進式進步和穩健測試上,因為目前的技術水平仍有很大的改進空間。
#large language models#ai#ai agents#ai engineering
延伸閱讀
原文報道: The New Stack我們不轉載全文, 閱讀原文 →
相關文章
6 則AI 新聞
波士頓教授稱,Anthropic前研究員對AI的警告應嚴肅看待
A Boston professor recently weighed in on warnings about AI dangers from a former Anthropic researcher.

🇨🇳·AI 新聞
《人民日報》駁斥美國惡意AI蒸餾指控,警告將採取反制措施

🇸🇬·AI 新聞
Databricks 將在新加坡投資逾 3.5 億美元,員工人數翻倍

🇸🇬·AI 新聞
Personetics 推出適用於客戶關係經理的 AI 銀行控制台

🇸🇬·AI 新聞
Anthropic 計劃十月在新加坡設立辦事處並進行本地招聘

🇨🇳·AI 新聞
