
Open-weight catch-up should fade as hidden reasoning raises compute needs and restores proprietary lead.
今年夏天,开源模型密集发布。智谱 6 月 22 日发布 GLM-5.2,8 月 14 日又推出只扩大了后训练的 GLM-5.3,按智谱公布的评测,多项 Agent 编程任务追平甚至超过 Fable 5 和 GPT-5.6 Sol。月之暗面 7 月 17 日发布 Kimi K3,在 Artificial Analysis 智能指数上获得 57 分,仅次于 Fable 5 和 GPT-5.6 Sol。DeepSeek 8 月 13 日更新 V4 Pro,Terminal-Bench 2.1 得分 87.9,与 Fable 5 的 88 分几乎持平,每个任务的成本约为后者的五十分之一;9 月又发布了 V4.1 Flash。小米 9 月 22 日开源的 MiMo-V2.6,其 Pro 版本在 Artificial Analysis 智能指数的开源模型中排名第一。
不少行业人士认为,开源与顶级闭源模型的差距已经缩小到几个月。也有观点认为,蒸馏并不是开源模型跟得上的主要原因。我们同意蒸馏不是唯一原因,但它是关键因素之一。市场担心的是,开源模型开发者能否以远低于顶级闭源模型的研发成本,持续达到相近能力;如果可以,闭源厂商的领先还能维持多久?这种担心直接影响了 AI 和算力相关的交易,和 2025 年 1 月 DeepSeek R1 那次类似。
我们的判断是,开源模型难以持续以如此低的成本追赶,近期差距缩小也会像 R1 之后一样,只是暂时的。靠蒸馏复制顶级闭源模型正在变难:Anthropic、OpenAI 和 Google 的最新模型都不再返回明文的完整思维链,只用答案和摘要,训练信号更弱。开源模型开发者要继续追,需要更多投入自己的强化学习、合成数据和训练环境,而这些都要算力。我们预计,未来几轮迭代中,领先开源模型与顶级闭源模型的能力差距会重新扩大到约 6 到 12 个月。2025 年走过类似的路:R1 一度接近 o1,随后 o3、Claude 4 和 GPT-5 相继发布,差距重新拉开。
Anthropic、OpenAI 和 Google 目前对隐藏推理采取类似做法:最新模型只返回思维链摘要,或者连摘要都不返回。API 还可以返回供后续对话复用的加密推理块,Anthropic 使用 signature 字段,OpenAI 使用 encrypted_content,Google 使用 thought signatures。开发者在后续请求中原样传回这些数据块,客户端无法自行解密。
推理信息的获取是逐步收紧的。OpenAI 从 2024 年 9 月的 o1 起就不显示原始思维链,但到 2025 年初,Gemini 早期的推理模型仍直接返回原始推理,斯坦福等机构的研究者只用 1,000 条 Gemini 推理轨迹做微调,就复现了推理行为。2025 年 5 月,Gemini 2.5 和 Claude 4 改成只给摘要;2026 年 4 月发布的 Opus 4.7 默认连摘要都不返回;9 月 1 日发布的 Fable 5.1,在任何设置下都拿不到原始思维链。Anthropic 的最新模型也会拒绝在回答中披露隐藏推理的请求。从 9 月 24 日起,Anthropic 对被归类为推理提取的拒答,按模型标准费率计费。
This report is available to subscribers. Sign in or subscribe to read the full analysis.