几条模型路线正在汇合,但终点仍在雾里

今天凌晨看到 Fable 5.1 的发布帖,我先去看了一眼日历。不是因为 AGI 突然有了日期,而是模型更新已经快到让人失去时间感:几周前刚建立的能力认知,转眼又要重算。

这次值得看的也不只是 Anthropic。OpenAI 正在准备发布 Astra,国产模型则在一个多月里接连放出 Kimi K3、GLM-5.3 和 Qwen3.8-Flash-Next。它们走的路不同,却都在回答同一个问题:模型能不能少说一点,真正把事情做完。

先把发布状态摆清楚

  • Claude Fable 5.1:已经上线,闭源。重点是长任务、科研、编程与更低的 Agent 成本。
  • OpenAI Astra:官方称正在准备发布,尚无日期。它是首个达到 Critical 网络安全能力门槛的 OpenAI 模型。
  • Kimi K3:已经上线并开放权重。特点是 2.8T MoE、原生多模态、1M 上下文和长程 Agent。
  • GLM-5.3:已经开放权重,主打 Agent 编程和网络安全防御。
  • Qwen3.8-Flash-Next:已经开放权重,生产 API 将上线,也是 Qwen4 架构的早期预览。
  • DeepSeek-V4-Flash-Vision-Exp:实验 API 已上线,未承诺开放权重,正式版仍待观察。

这份状态对照很重要。最近“发布”“预览”“开放 API”“开放权重”经常被混着说,但它们不是一回事。能在网页里用,不代表能下载;放出实验模型,也不代表正式版和权重马上就来。

严格来说,开放权重也不自动等于完整开源:训练数据、训练代码和商业许可仍要分别看。下文统一使用各家官方的“开放权重”口径。

Fable 5.1:重点是做得久,也用得起

Anthropic 这次同时发布了 Fable 5.1 和 Mythos 5.1。Fable 面向编程和知识工作,已经全面可用;Mythos 更偏网络安全防御和生命科学,目前只通过可信访问计划提供。本文讨论的是前者。

Fable 5.1 最明显的变化,是长任务能力。官方没有只说“更聪明”,而是特意强调 complex, long-running tasks:复杂、运行时间长、需要反复使用工具的工作。它还把科研单独拿出来,称其研究能力已经能让人看到 AI 参与科学进展的早期样子。

数字也确实跳得很大:Terminal-Bench-Science 0.1 从 Fable 5 的 24.7% 提到 52.6%,Terminal-Bench 4.0 从 42.0% 提到 55.8%,计算机操作从 72.9% 升到 77.9%。这些评测分别在看科学终端任务、真实命令行工作和电脑操作,不只是聊天题库。

不过榜单要带着说明书看。评测由厂商选择,运行预算、工具配置和提示词都会影响结果。52.6% 可以证明进步很大,也同时说明还有接近一半的任务没做对。把“七项领先”直接翻译成“全面碾压”,就走过头了。

我反而更在意成本。Anthropic 称 Fable 5.1 的缓存读取价格比 Fable 5 低 75%,典型工作负载的实际成本大约下降 25%,高度 Agent 化的任务最多可下降 45%。它还支持用较低 effort 换取更便宜的结果。对一次问答,这只是账单好看一点;对一个要跑几十轮工具调用的 Agent,这是产品能不能成立的区别。

安全策略也在变得更实用。官方称,网络安全防护对正常请求的误拦截减少约 60%,基础生物和医疗问题触发 fallback 的比例减少约 85%。能力增强之外,模型还得少误伤正常工作,否则再强也只能放在演示里。

所以 Fable 5.1 的意义,不是某张表又多了一个第一,而是三件事同时发生:长任务更稳、调用成本更低、防护不再那么容易挡住正常用户。Agent 正从“偶尔跑通”走向“可以算投入产出”。

Astra:大家口中的 ChatGPT 6,但官方没这么叫

如果按产品代际理解,Astra 基本就是大家所说的“ChatGPT 6”这一代。但截至 9 月 2 日,OpenAI 的正式说法是“正在准备发布 Astra”,没有在原帖和技术说明里使用 GPT-6 或 ChatGPT 6,也没有给日期。

比名字更值得注意的是,OpenAI 先讲的不是聊天、数学或写代码,而是网络安全。Astra 是 OpenAI 第一个被认定达到 Critical 网络安全能力门槛的模型。按照其 Preparedness Framework,这意味着模型在获得合适工具和访问权限后,可以在没有人逐步带领的情况下,寻找真实加固系统中的未知漏洞,开发利用方式,甚至按一个高层目标组织端到端攻击。

这不是抽象的风险描述。OpenAI 公布了几组具体结果:

  • Astra 在 ExploitBench 上拿到 100%,随后在包含 20 个近期高危 V8 漏洞的内部测试中,用更少的输出 token 达到显著高于 GPT-5.6 Sol 的任意代码执行率。
  • 测试过程中,它在一条利用链里发现并使用了两个零日漏洞,OpenAI 正在向维护者披露。
  • 在专家测试中,它完成了浏览器沙箱逃逸并在宿主机执行命令,也把多个操作系统漏洞组合成了从普通用户到 root 的本地提权链。

这也是 Astra 没有直接全量开放的原因。OpenAI 曾暂停部分训练,并推迟更大的强化学习训练,先补训练环境隔离、监控和对齐要求。发布初期,高级网络安全能力只给少量测试者,随后再通过 Daybreak Blue 扩大防御用途;普通用户拿到的不会是毫无限制的同一套能力。

OpenAI 还公布了一些对齐结果。面对不允许的网络攻击请求,Astra 的拒绝率是 91.5%,GPT-5.6 Sol 是 59%。在模拟模型会不会绕过周边安全设施的“蜜罐”测试中,未加生产防护的 GPT-5.6 Sol 有 56% 的尝试越界,Astra 没有出现同类行为。上线后还会叠加推理过程监控,发现未授权动作时自动停下;在 ChatGPT 或 Codex 里,用户可能会被要求复核后再继续。

这些数字仍然来自 OpenAI 自己的测试,不能当成外部审计。但它们说明了一件事:Astra 的发布门槛已经不是“回答够不够好”,而是“行动能力强到什么程度,以及系统能不能在它越界前踩刹车”。这比产品最后叫 Astra 还是 GPT-6 更重要。

国产开源模型,刚发布的三条路线

国产模型的节奏确实快,但先别急着都叫“即将发布”。Kimi K3、GLM-5.3 和 Qwen3.8-Flash-Next 已经放出来了,它们更适合当作下一轮竞争的起跑线。

Kimi K3 是最激进的规模路线:2.8T MoE 参数、原生多模态、1M 上下文,目标直接写成 long-horizon agentic coding 和 self-evolving workflows。Kimi Delta Attention 用来降低百万上下文的解码成本,官方给出的最高加速是 6.3 倍;Attention Residuals 则称以不到 2% 的额外成本换来约 25% 的训练效率提升。K3 已在产品和 API 上线,权重也已按计划开放。

GLM-5.3 的方向更集中:Agent 编程和网络安全防御。它在 8 月 28 日开放权重,可以下载、私有运行和定制。它和 Astra 的有趣对照是,同样把网络安全当作前沿能力,Astra 先强调访问控制,GLM-5.3 则直接提供权重。能力上限和部署自由之间的取舍,会越来越明显。

Qwen3.8-Flash-Next 更像一张技术预告。它有 125B 模型参数和 51B N-gram embedding,每个 token 只激活 6B;使用 GDN 与 QSA 混合注意力、Gated Residual、N-gram Embedding 和 Muon 优化器,原生上下文 262K,可用 YaRN 扩到 1M。官方称训练成本只有 Qwen3.7-Plus 的九分之一,同时在编程和办公任务上更强。权重已经开放,生产版 API 也宣布将上线。

这三条路线放在一起很有意思:Kimi 用超大稀疏模型换能力上限,GLM 押注 Agent 编程和安全,Qwen 则把重点放在架构效率和可部署成本。国产开源模型不再只追“接近闭源”,而是在试不同的工程答案。

接下来真正值得等什么

第一是 Qwen4。这是目前证据最硬的下一代国产开源模型信号。Qwen 官方明确说,Qwen3.8-Flash-Next 是正在探索的 Qwen4 架构先行版。由此可以合理期待 Qwen4 延续混合注意力、稀疏激活、长上下文和原生多模态,但参数规模、完整型号、开放时间和许可证都还没有官宣。能说“会来”,不能替官方写日期。

第二是 DeepSeek-V4-Flash-Vision 的后续版本。8 月 21 日上线的是 Exp 实验 API:文本能力对齐 V4-Flash,在多模态 Agent 评测上接近 Opus 4.8,并支持图像、Files API 和多种接口。按照实验版到正式版的常见节奏,后续稳定版本值得期待;但 DeepSeek 没有承诺正式名称、发布时间或开放权重,所以它只能列入观察名单,不能写成“马上开源”。

至于 Kimi 和 GLM,目前官方没有公布 K3 下一型号或 GLM-5.3 后继模型的发布日期。它们刚完成一轮大版本和权重发布,更现实的近期变化可能是推理版本、工具链、量化版本和部署生态补齐,而不是立刻再跳一个主版本。没有官方信号时,少写一个型号,比编一个倒计时更有价值。

所以,AGI 要来了吗?

我的判断仍然是:轮廓越来越清楚,但钥匙还不能交出去。

Fable 5.1 证明长任务正在变得更稳、更便宜;Astra 证明模型已经能在高风险环境里组织复杂行动;国产开源模型则把这些能力带进可以下载、改造和私有部署的工程体系。能力、成本和可获得性,确实在同时跨线。

但会连续做十小时任务,不等于十小时都知道自己为什么这么做;能发现零日漏洞,不等于能对现实后果负责;可以私有部署,也不等于部署者已经有能力控制它。

AGI 真正缺的不是再多几个榜单第一,而是几件不太好做发布会演示的事:知道自己什么时候不确定,出错后能回到正确轨道,面对陌生环境仍守住目标和边界,并且让人能看懂它为什么采取某个行动。

如果 AGI 指某天突然亮起的一盏灯,我不觉得它会出现在某场发布会上。如果它指越来越多工作开始可以交给通用 Agent,那么它已经在路上,而且比大多数人预想得快。

只是现在更准确的说法仍然是:我们正在进入 AGI 的前夜,还不是第二天早晨。

参考资料