GMAsia
    AI 新闻·2026年10月2日·来源: Techtimes

    Gemini 4 Argon 在知识型工作上领先:承诺使用前仍有不足之处

    Google DeepMind 推出了 Gemini 4 Argon,据报道这款全新 AI 模型在 19 项内部基准测试中,有 13 项的表現优于 GPT-6 Astra 和 Claude Opus 5.5。该模型于 2026 年 9 月 30 日发布,其输出令牌上限为 100 万,而入门级 API 价格为每百万输入令牌 2 美元。

    Nexa 摘要

    Gemini 4 Argon 的优势主要集中在企业知识型工作和长文本检索。它在 Vals Index 等基准测试中表现领先,该指数根据金融、编码、法律和税务工作对美国 GDP 的贡献来衡量各行业的表现。它处理和检索多达 100 万个令牌提示信息的能力,在 GraphWalks BFS F1 上领先 Astra 12.4 个百分点,这对于需要大量文件或代码库分析的应用程序来说意义重大。

    尽管有这些领先优势,Argon 在特定领域仍落后于竞争对手。在两项已发布的软件工程评估中,它在较难的一项上落后 GPT-6 Astra 10.5 个百分点,在终端驱动代理工作上落后 Claude Opus 5.5 9 个百分点。对于构建基于 shell 的自动化管道的团队来说,这些都是关键的不足之处,因为 AI 代理必须在多个步骤中驱动终端或 shell 环境。

    对于潜在采用者来说,一个关键的财务不确定性是规模化后的实际每项任务成本。Google 尚未确认模型的内部推理令牌是否按输出费率计费。这意味着,虽然输入令牌价格已知,但需要大量内部处理的复杂操作的全部成本仍未确定,这会影响大规模部署的预算可预测性。

    分享这篇文章

    深入了解
    原文报道: Techtimes我们不转载全文, 阅读原文 →

    相关文章

    6 则