GLM-5.3:中国实验室如何保持前沿步伐
Z.ai 以 750B 参数、纯后训练扩展的 GLM-5.3 逼近前沿,靠极快发布周期与 RL 数据产业,正系统性改变中美 AI 竞赛的动力学。
家务说明:我目前在外旅行,因此无法为这篇文章录制配音。编辑——我在发出邮件后,补充了关于中国数据行业的第5点。
GLM-5.3 发布与性能概览
今天,Z.ai 发布了他们的 GLM-5.3 模型,目前仅在编程套餐中提供,即将上线其 API,并在两周后登陆 Hugging Face(开放权重)。这款模型表现卓越,分数提升幅度令人惊叹。在许多基准测试中,该模型已超越 Moonshot AI 的 Kimi K3,并在部分测试中超过了 Claude Fable 5 或 GPT-5.6-Sol。

以下是更全面的对比:

这使得该模型在智能体编码基准测试中基本处于前沿水平,而参数量仅约 750B——只有 Kimi K3 的三分之一!
Z.ai 的博客文章相当直白,开篇便是一句大胆的陈述:
GLM-5.3 的全部工作就是扩展后训练。
GLM-5.3 与 GLM-5.2 使用相同的基础模型,但大幅扩展了后训练。粗略概括地说,Z.ai 在后训练方面似乎比 Kimi 更具优势,而 Kimi 更像是预训练的杰作。此次发布后,引发了大量讨论:中国如何能保持如此强劲的势头?这么小的模型怎能媲美美国领先的公开模型?这些结果真实吗?
GLM 系列发展历程
最简单的解释是,Z.ai 在其领域非常擅长——值得回顾的是,他们研发这一系列模型的时间比业内几乎任何人都长。以下是 GLM 模型的简要历史。
智谱AI成立——2019年
GLM(通用语言模型)——2021年3月——由清华大学数据挖掘/知识工程组(THUDM)发布。
GLM-130B——2022年8月——扩展版本。GLM-130B至GLM-4的技术报告
ChatGLM——2023年3月14日——首个聊天版本。
ChatGLM2——2023年6月25日
ChatGLM3——2023年10月27日
GLM-4——2024年1月16日——更名为GLM;随后于6月发布开放权重的GLM-4-9B。
GLM-5——2026年2月11日——最新主要代际。
今年6月22日发布的GLM 5.2引起了巨大轰动——发布数周后,我经常听到我认识的AI研究人员仍在使用该模型,原因在于其速度(有些人将模型部署在内部集群上,以获得比公开服务更快的速度)和简洁性(作为一个无回滚等特性的模型,在开发前沿AI系统时尤为实用)。GLM-5.2完全不负众望。
超越蒸馏的竞争解释
我自己也经历过类似的否认阶段,心想:“他们是怎么做到的?这些模型肯定没有看起来那么好。”美国公司在资源上拥有压倒性优势,却似乎无法在能力上拉开差距,这让人有些不安。常见的解释是蒸馏,我对此已写过大量文章,但我认为这不是主要因素。关于这一点,最近有一篇论文展示了从前沿模型中提取推理轨迹的简单方法——这正是中国实验室可以大规模利用的东西。我不明白为什么美国实验室没有更快地修补这种行为;相反,他们却跑去向政府寻求政策帮助。这对我来说说不通。
Z.ai的博客直截了当,与以强化学习为主导的训练体系相符。他们表示使用了“更多环境、更多样化的任务,以及在这些任务上投入了更多的计算资源进行训练。”人们不可能轻易蒸馏出强化学习环境、大规模运行这些环境的基础设施,或有效混合它们的算法。
那么,中国实验室如果不是靠蒸馏,又是怎么做到的呢?他们是在刷榜吗?一个公认的刷榜定义是让模型专注于测试集,使得实际性能与纸面分数产生显著差异。决定因素更多是宏观层面的,而非技术细节(当然,技术细节确实重要,但实验室之间的差异更难分辨):
Z.ai的发布周期可能只需几天,而非OpenAI或Anthropic那样的数月。极有可能的是,OpenAI和Anthropic内部模型远优于Z.ai和月之暗面。然而,这些美国公司往往需要数月时间才向公众发布模型,这在前沿领域的采用决策上极大地利好中国实验室。简而言之——中国实验室利用美国实验室进行发布前测试的时间,持续在基准测试上攀登优化(SpaceXAI在这方面可能更接近中国实验室)。鉴于进展速度如此之快,这可能是中国实验室保持前沿地位的最大决定因素。到目前为止,这对美国实验室在经济上尚可接受,因为他们的模型需求依然旺盛。
随着实验室内部构建大语言模型的自我改进循环加速,如果这些反馈循环需要用户数据,更快的发布周期可能极大有利于中国实验室,使他们的产品在下一个更优越模型出现之前拥有更长的生命周期,从而削弱对其模型的需求。
这些显然正是业内许多人担忧的竞争动态。在如此多实验室竞相开发前沿模型、能力边界不断拓展的情况下,很难看到这种局面在短期内有所缓和。
基准测试与市场策略
是的,Z.ai可能比OpenAI或Anthropic更在意公开基准测试。这些基准测试,例如在Artificial Analysis Intelligence Index或类似聚合器上取得高分,会直接影响其股价。在很多方面,他们需要这样做以持续融资并保持团队士气,因为作为挑战美国巨头的后起之秀,这本身就是一个精彩的故事。微妙的刷榜行为并不一定源于绝望或类似压力。这在众多实验室中已是行业常态。许多公司的数据采集策略就是购买他们在基准测试中落后项目的数据。
Z.ai并没有刷榜到让GLM-5.3“烤焦”的程度(至少不是故意的,而且他们会检查这一点)。目前,每个实验室都在应对扩展强化学习时的棘手问题。Anthropic的Opus 5和Sonnet 5模型尽管基准分数惊人,但口碑却褒贬不一。业内所有人都面临同样的情况,因此有些模型权重用起来更顺手,但发布博客中的基准分数是实打实的。
GLM-5.3可能比Claude Fable或GPT Sol更窄众。GPT-5.2发布时,除智能体编码外,评价也是好坏参半。与此同时,OpenAI和Anthropic支撑着庞大的业务,其模型有无数用例。这是处于采用曲线早期阶段的公司的一大优势——你可以瞄准最有价值的用例。在训练后阶段,少在意一些东西会让最终模型的组装容易得多。我有点夸大其词了,因为据报道,Z.ai凭借强劲的本地部署业务,年经常性收入已达10亿美元。
同样,旗舰GLM模型一直缺乏视觉能力。纯文本模式确实帮助Z.ai获得更具竞争力的分数,但这也是一个竞争更激烈的领域。另一边则是像Inkling-Small这样的模型,它被设计为全模态。
(新增)中国的强化学习数据产业正在蓬勃发展。我们关注的许多消息源和传闻渠道都提到,中国的数据产业正在起飞——很大程度上是由美国数据公司向中国模型实验室销售所推动的。这可能表现为中国实验室购买许多美国前沿实验室使用的相同强化学习环境,并更早发布下游经过强化学习的模型。我们对该市场的规模和影响仍存在较大误差范围,但它无疑正变得日益重要。
技术实力与人才根基
Z.ai 是一家技术极为精湛的大语言模型组织——其计算效率很可能远超 OpenAI / Anthropic。这一点需要反复强调。这些人非常擅长他们所做的事情。该公司与清华大学关系密切,而清华汇聚了许多中国最优秀的计算机科学家。这个人才济济、求知若渴的人才库,与任何西方同行一样,是他们成功的关键所在。



摄于我的清华之行。
总体而言,他们围绕 GLM 系列模型所执行的策略似乎相当出色。祝贺发布!我很期待权重公开,这样我就能进行更深入的测试(我倾向于使用 Fireworks 或 Baseten 等美国开源权重推理服务)。
欢迎留言评论。
安全风险与产业责任
这是向经济领域不可避免扩散的超强网络能力迈出的又一步。智谱AI已对此予以承认,表示:
GLM-5.3是我们迄今为止在网络安全任务中最强大的模型。它在漏洞发现、漏洞利用分析以及复杂的多步骤安全任务方面带来了显著提升。这些能力可以帮助防御者更早识别弱点、验证风险并加速修复。
这些能力也带来了明显的双重用途风险。因此,我们采取分阶段发布的方式。选定的安全合作伙伴将首先在受控环境中评估GLM-5.3。随后将提供更广泛的访问和API可用性。一旦必要的安全评估和发布准备工作完成,我们将发布GLM-5.3的完整模型权重。
他们接着承认如何通过请求分类器和思维链监控(在模型对齐之上)来监控其平台上的推理过程。细节决定成败,目前尚不清楚每个AI实验室在此方面的执行水平如何。能力扩散取决于最低共同标准。
归根结底,当真正的开放权重模型即将到来时,这类安全措施几乎无关紧要。如果不是GLM-5.3,那也会是另一个模型。具备这些能力的模型规模正在随时间缩小,变得更容易修改和部署(可能没有防护措施)。智谱AI做了一些正确的事情,包括推动更多漏洞发现和主动管理,但任何单一公司都远不能独自应对这一问题。
我们需要由政府或行业联盟主导的产业级指导,立即为这一转型在所有软件领域做好准备。