The Sequence Radar - 第936期:上周AI要闻:Gemini对话、Astra实践法律、Figure折叠衣物、Crusoe为这一切提供动力
Google升级了其Gemini模型,推出了Live和Live Extended Thinking,专注于整合视觉语境和背景工具调用的实时对话式AI。OpenAI推出了Astra for Law,这是一款专为法律工作流程设计的GPT-6模型,据报在私人法律研究基准验证集上达到了54%的正确率。Figure在30个未曾见过的家居环境中测试了其Helix 2.5机器人,在整理和铺床任务中达到了56%的完整任务成功率。这些发展反映了对AI基础设施日益增长的需求,Crusoe完成了首轮F系列融资,投后估值达309亿美元。
核心故事围绕着将智能与其操作环境连接起来,而不仅仅是新的AI模型。Google的Gemini 3.8 Live模型优先考虑对话控制,协调对话和计算而无需用户等待。OpenAI的Astra for Law表明,专业信息环境能提高模型性能,在法律研究中达到54%的正确率。Figure的Helix 2.5展示了物理泛化能力,通过利用人类行为数据集,在新的家居环境中将任务成功率从9%提高到56%。
对于亚洲而言,这意味着将更专注于通用模型之外的专业AI应用。新加坡和韩国等市场的公司正大力投资智慧城市和先进制造计划,将看到对执行特定任务的代理需求增加。区域参与者的考验在于他们能否建立领域特定的智能,而不仅仅是复制大型语言模型。这也推动了整个地区对计算基础设施的需求,使数据中心运营商和能源供应商受益。
值得关注的是剩余的失败率。Figure的机器人在陌生家居中仍有44%的时间失败。OpenAI的法律模型达到了54%的正确率,远未达到可靠的自主性。这表明在弥合令人印象深刻的演示与可靠的实际部署之间的差距方面,仍有大量工作要做。亚洲AI的下一个篇章将奖励实际整合,而不仅仅是原始模型规模。






