GMAsia
    AI 新聞·2026年9月14日·來源: The New Stack

    AI 最強編碼代理程式失敗率達 60% — 數據證實

    Claude Fable 5.1 在 AI 代理程式能力方面創下新的編碼基準,表現卓越。儘管設計先進,該 AI 代理程式在測試中的成功率僅為 38.8%。這意味著它在嘗試編碼任務時,十次中有超過六次失敗。基準測試的數據證實了該代理程式的表現,清晰地呈現了其在實際應用中的當前效能。這一結果為 AI 在軟件開發中的現狀提供了關鍵見解。

    Nexa 摘要

    核心發現是,即使是最好的 AI 編碼代理程式,失敗率也高達 60%。Claude Fable 5.1 在新基準測試中僅有 38.8% 的成功率,顯示了當前的局限性。這並非一個關於 AI 勝利的故事,而是關於其在實際編碼應用中持續面臨挑戰的故事。開發人員仍然面臨大量的除錯開銷。

    對於亞洲科技公司而言,這意味著對 AI 編碼工具的依賴必須與實際預期相符。投資於開發人員生產力工具的公司,特別是在印度和越南等市場,應規劃大量的人工監督。全自動編碼的承諾仍然遙遠,影響著開發時間表和成本。

    值得關注的是,這些失敗率在未來 12 到 18 個月內能多快改善。如果成功率未能顯著提升至 50% 以上,在關鍵企業環境中的採用將會放緩。首爾和新加坡的公司將繼續優先考慮人機協作的 AI 整合。

    #ai engineering#software testing#ai models
    延伸閱讀
    原文報道: The New Stack我們不轉載全文, 閱讀原文 →

    相關文章

    6 則