The Sequence Radar - 第936期:上週AI要聞:Gemini對話、Astra實踐法律、Figure摺疊衣物、Crusoe為這一切提供動力
Google升級了其Gemini模型,推出了Live和Live Extended Thinking,專注於整合視覺語境和背景工具呼叫的實時對話式AI。OpenAI推出了Astra for Law,這是一款專為法律工作流程設計的GPT-6模型,據報在私人法律研究基準驗證集上達到了54%的正確率。Figure在30個未曾見過的家居環境中測試了其Helix 2.5機械人,在整理和鋪床任務中達到了56%的完整任務成功率。這些發展反映了對AI基礎設施日益增長的需求,Crusoe完成了首輪F系列融資,投後估值達309億美元。
核心故事圍繞著將智能與其操作環境連接起來,而不僅僅是新的AI模型。Google的Gemini 3.8 Live模型優先考慮對話控制,協調對話和運算而無需用戶等待。OpenAI的Astra for Law表明,專業信息環境能提高模型性能,在法律研究中達到54%的正確率。Figure的Helix 2.5展示了物理泛化能力,透過利用人類行為數據集,在新的家居環境中將任務成功率從9%提高到56%。
對於亞洲而言,這意味著將更專注於通用模型之外的專業AI應用。新加坡和韓國等市場的公司正大力投資智慧城市和先進製造計劃,將看到對執行特定任務的代理程式需求增加。區域參與者的考驗在於他們能否建立領域特定的智能,而不僅僅是複製大型語言模型。這也推動了整個地區對運算基礎設施的需求,使數據中心營運商和能源供應商受益。
值得關注的是剩餘的失敗率。Figure的機械人在陌生家居中仍有44%的時間失敗。OpenAI的法律模型達到了54%的正確率,遠未達到可靠的自主性。這表明在彌合令人印象深刻的演示與可靠的實際部署之間的差距方面,仍有大量工作要做。亞洲AI的下一個篇章將獎勵實際整合,而不僅僅是原始模型規模。






