
9 月 30 日,Google 发布新一代旗舰模型 Gemini 4 Argon,距 Gemini 3 约十个月。按 Google 公布的评测,Argon 在 19 项评测中有 14 项领先或并列领先 GPT-6 Astra 和 Claude Opus 5.5。Artificial Analysis 的独立评测给出 53 分,与 Astra 持平(Opus 5.5 为 58 分,Sonnet 5.5 为 56 分),Google 已重回前沿模型竞争,但整体能力与 OpenAI、Anthropic 仍有差距。首发优惠价 2/10 美元(每百万 token 输入/输出,下同),正式价 4/20 美元。目前先向一批可信测试者开放,之后从付费 API 和 Google AI Ultra 用户开始扩大范围。
这个结果和两个月前的市场预期差距很大。8 月 5 日 Google 宣布重组:Hassabis 卸任 DeepMind CEO,转任 Google DeepMind 董事长兼 Alphabet 首席科学家;Jeff Dean 带着 Oriol Vinyals、Quoc Le 等人离开 Google 创办 Discovery Loop;Koray Kavukcuoglu 接管 DeepMind 的日常运营,直接向 Pichai 汇报。此前 5 月 I/O 上宣布的 Gemini 3.5 Pro 跳票后被搁置,Google 只能依靠 Flash 系列模型维持竞争力。Alphabet 当天跌约 5%,当时不少评论认为 Google 正退出前沿模型竞争、转向卖算力和分发。Tim O'Reilly 则用 Westinghouse 作类比,认为 Google 可能把竞争重点转向 AI 基础设施和应用分发。我们当时持不同判断:Google 会继续投入前沿模型,聚焦之后有机会追上来。Gemini 4 的结果支持了这个判断。不过这轮预训练在重组前已经开始,Google 7 月 22 日就披露预训练正在进行;组织调整对研发效率的影响,还要看后续几代模型。
年初市场曾讨论过一种可能:Anthropic 在编程和企业市场持续拉大领先优势,其他实验室逐步掉队,前沿最终只剩一家。现在看,OpenAI 和 Anthropic 仍然领先,Google 已重回前沿竞争,Meta 和 xAI 也在持续投入,前沿竞争仍有多家参与。
Artificial Analysis 的 53 分比 Gemini 3.1 Pro 高 23 分,比 Google 此前分数最高的 Gemini 3.8 Flash 高 12 分。Vals 的综合指数上 Argon 以 68.9% 排 41 个模型中的第一,Sonnet 5.5 和 Opus 5.5 都在 67% 左右;LMArena 文本榜 Argon 以 1525 分排第一。
7 月 22 日 Google 披露“迄今规模最大的一次预训练”正在进行,9 月 30 日宣布推出 Argon,两次披露相隔约十周。据我们的调研,这轮训练仍使用 TPU。此前有传言说 Gemini 4 改用 Nvidia GB 系列训练,我们当时就澄清过:Google 长期围绕 TPU 优化训练系统,临时迁移到 GPU 需要大量适配和重新验证;预训练重启本身,也不能说明芯片出了问题。
This report is available to subscribers. Sign in or subscribe to read the full analysis.