智谱业绩电话会
智谱2026上半年完成从“智能前沿”到“把能力转化为价值”的跃迁:以编程为杠杆、国产芯片为底座,模型能力阶梯式攀升,开放平台/API收入占比飙至86.5%,验证

唐杰
各位投资者、分析师,晚上好。非常感谢大家参加我们2026年中期业绩发布会。我首先简要介绍一下智谱的基本情况、近期的一些思考以及未来的技术路线图。
大模型技术发展至今已近十年。自去年起,智谱认识到大模型正从会聊天向能做事转变,我们较早地对此进行了定位,并特别注重加强模型的编程能力。去年年中,我们发布了GLM-4.5,这是我们在编程方面取得良好成果的首个模型。今年年初以来,我们相继发布了GLM-5.0、5.1、5.2和5.3,这些版本都在同一基础上持续迭代。
首先,规模扩大是否必然意味着参数数量的大幅增加?规模扩大是通往更高智能的关键路径,但其本质并非简单地增加参数数量。
自今年年初以来,我们显著加强了基础模型、后训练和任务环境的规模。在扩大参数规模的同时,还需要增加模型的有效深度——例如,通过使用循环Transformer让模型在推理过程中进行更深入的思考。我们最近正在推进相关工作。同时,后训练仍有很大的提升空间。因此,我们在GLM-5.3上投入了大量资源,并显著加强了其后训练。
编程也包含许多不同类型的任务。在一系列编程任务中强化模型,可以系统地提升其整体能力。我们在不同的任务环境上做了大量工作,这显著提升了GLM-5.3的性能,使其达到了SOTA水平,并处于当前智能的前沿。
另一方面,模型不仅要强大,用户还需能够负担并访问它。设计模型时,我们需要考虑模型大小、活跃参数,以及推理和基础设施的效率。唯有降低推理成本,技术才能广泛普及。
因此,在设计GLM-5系列时,我们特别强调了推理能力的强化。在英伟达芯片与多种国产芯片并存的运算环境中,我们借鉴外部资源,并收购了一家推理技术公司,以进一步增强推理能力,使GLM-5.1、5.2和5.3更易于部署和使用。
当前模型使用量巨大,我们在OpenRouter上的使用量一度位居首位。每次新模型发布后,我们MaaS平台的调用量普遍翻倍。这是对我们今年整体定位和进展的基本概述。
对于模型研发公司而言,核心任务仍是不断推进智能的前沿。这让我们回到智谱最根本的愿景。2019年,我们为智谱设定了一个愿景:让机器像人一样思考。至今,我们仍在探索智能的上限。探索这一上限不仅关乎训练模型,还需思考未来模型应具备何种智能,以及它们能实现什么。我们已围绕下一阶段路线图发展出几条思路。
首先,今年年初,我们观察到编程已成为业界广泛认可的方向。随后,我们进一步思考,如何在编程能力基础上,让模型承担更多任务。在GLM-5.1和5.2版本期间,我们提出了长周期任务的概念,期望模型能执行更长时间跨度的任务;同时,我们也提出了自主人工智能,即模型应能自主完成一项任务。
一旦模型具备这些能力,它们仍需进一步演进。我们已着手研究完全自我训练的模型。我们希望模型能够通过预训练、中期训练和后训练阶段自主学习,并自主构建其辅助工具,从而使训练过程逐步实现自动化。
您可能已经注意到,在近期的推理优化中——尤其是在GLM-5.3发布及国产芯片基础设施优化期间——我们已开始使用基础设施智能体。由GLM-5.3驱动的该智能体能自主修订国产芯片的优化方案,显著提升了效果。未来,我们将继续沿着这一方向,进一步加强这些能力。
最后,在我们努力使人工智能更广泛地普及、惠及更多人群的同时,社会责任同样至关重要。模型的大规模发布和使用需要健全的治理与安全机制。我们持续思考如何增强模型在社会治理、公共安全和伦理方面的能力,并已启动相关研究。我们也期待投资者和分析师能提供更多建议与支持,共同探索通用人工智能的前沿及广泛普及人工智能的路径。
刘德兵
接下来,我将就上半年的成果与思考做一个全面汇报。概括而言,如果说去年的关键词是智能前沿,那么今年上半年的关键词则是“把能力转化为价值”。模型首次被证明不仅仅是工具,而是能够独立完成任务的系统。我们的收入结构也随之改变,强模型的商业价值开始规模化兑现。
第一部分是关于战略聚焦与模型发展的思考。首先,智能前沿决定任务边界,而任务价值决定商业机会。在三月份的年度业绩发布会上,我们提出了一个公式:
AGI商业价值 = 智能前沿 × Token消耗规模
智能前沿决定了模型能处理什么任务,以及每个Token能为用户创造多少价值。智能前沿越高,模型能处理的任务价值密度就越高,每单位智能对应的经济产出也就越大。Token消耗规模则反映了智能被使用的广度与深度。同样的Token,用于闲聊与用于修复生产环境中的漏洞,可能产生相差数个数量级的结果。因此,Token所处场景的价值密度,取决于模型能够打开的任务边界。每当任务边界提升一个层级,市场机会就可能扩大一个数量级。
第二点,是关于模型能力发展的五个阶段。我们认为,大模型能力的演进并非并行的产品线,而是依次递进的阶梯:
对话 → 编程 → 智能体 → 协同 → 自主AI
Chat提供一次性答案,编码交付可执行代码,智能体完成多步骤任务链,而协作则产出可供专业人士审阅的工作成果。
自主AI则具备持续运行的能力。每一层级的跃升都对应特定的技术门槛,唯有跨越此门槛,下一层级的商业模式方能成立。从Chat到编码,关键在于结果能否被验证;从编码到智能体,则需解决长期规划与错误恢复的难题;从智能体到协作,考验的是可靠性是否足以让专业人士愿意审阅成果而非从头构建;从协作到自主AI,则要求模型能自主判断其产出是否正确。报告期内,公司重点聚焦于编码与协作之间,已在网络安全、法律服务、金融、教育等领域启动实验,其中网络安全进展最快,其余方向尚处早期,尚未形成规模化收入。
我们的模型在CyberGym上取得84.5分,超越Fable5与GPT-5.6 SOLO;在ExploitGym上完成130项任务,仅次于Fable5和GPT-5.6。
第三点,我们强调持续优化的模型迭代轨迹与保持SOTA水平的重要性。过去一年,业界对SOTA的理解不断演变,短期内领跑排行榜已非首要目标。真正的关键在于,谁能以更快的速度、更优的成本持续推出更强大的模型。单点冠军转瞬即逝,持续卓越才是不断攀升的轨迹。
GLM系列在约十一个月内完成了六次迭代,其智能指数从32提升至60,而单任务成本维持在约0.20美元水平。GLM-5.3 Flash以单任务成本0.045美元进入智能成本前沿。以编程为切入点,GLM-5开启了长时程智能,其能力从代码生成扩展到系统理解、任务规划、工具使用及工程交互,推动模型从氛围编程向智能体工程演进。编程已成为公司主要收入来源,而通过编程积累的长时程任务能力,也已通过向网络安全等领域的迁移得到验证。
GLM-5.2是面向长时程任务的旗舰模型,支持真正可用的100万token上下文窗口,在实际应用中能容纳项目级工程上下文。它在长时程任务执行上更为稳定,遵循工程规范也更可靠,在开发场景中的成功率进一步提升,能够在一个任务中完成从需求到跨多个端点的可部署输出的完整开发链路。
GLM-5.3是智谱最新旗舰模型,在复杂软件工程和智能体任务方面实现了全面进步。它与GLM-5.2采用相同的基础模型,其所有能力提升均源自后期训练。GLM-5.3进一步扩展了任务环境,使训练任务不再局限于传统编程问题,而是更贴近专家在真实场景中执行的完整专业工作单元。在相同架构、相同总参数量、相同激活参数量的条件下,仅通过扩大后期训练规模,端到端完成率便提升了超过50%。GLM-5.3证明,扩展不仅关乎参数;训练目前是提升空间最大的领域。
如果说GLM-5.3代表了当前的能力前沿,那么GLM-5.3 Flash则代表了成本前沿。GLM-5.3 Flash专为高频、大规模、成本敏感型应用而设计,采用全新架构以降低开销。其总参数达3200亿,激活参数为180亿,结合了稀疏注意力与线性注意力,定价仅为GLM-5.2的十分之一。在基准测试和实际应用中,其性能均优于GLM-5.2。
发布前,该模型以匿名名称OX和Aux Offer在OpenCode和OpenRouter上进行了真实场景测试。上线首日,它在OpenRouter上排名第一,并创下单日Token使用量新纪录。六天总使用量超过62万亿Token,推动平台整体使用量增长超过20%。
我们第四点进展是国产芯片驱动国产模型。自年初以来,我们已将国产芯片纳入主要推理能力。GLM-5.3 Flash 是公司首款在超大规模、真实流量下完全通过国产芯片集群提供服务的模型。这些芯片通过我们自主研发的高带宽互联网络连接,整个推理引擎由 GLM-5.3 驱动的 Infer Agent 大幅加速,将算子开发周期缩短了一半。在公司内部,我们首次完成了“模型优化系统、系统运行模型”的闭环。
与同一硬件上的初始基线相比,端到端服务性能提升了三倍。公司已在约10万张国产加速卡上实现了大规模、低成本推理,每令牌推理成本较年初下降了80%。在全球算力供应持续紧张的背景下,这一路径意味着我们已开始掌握自身成本曲线的主动权。
接下来,由肖磊介绍公司的财务数据。
肖磊
各位投资者晚上好。下面我将介绍公司的财务表现及业务发展情况。
2026年上半年,总营收达到人民币9.54亿元,相当于1.42亿美元,同比增长近400%。比增长率本身更值得关注的是营收构成的变化。开放平台与API业务收入达到人民币8.25亿元,相当于1.23亿美元,是去年同期的27倍以上。其占总营收的比例从去年同期的15.2%和去年年底的26.3%急剧上升至86.5%。智谱的营收现在主要来源于开放平台与API业务。近期发布的GLM-5.2、GLM-5.3和GLM-5.3 Flash推动了开放平台和API业务量的历史性激增。
截至2026年8月底,我们的ARR已达到16亿美元。这一ARR的计算方式是将月度收入年化——即用8月份的收入乘以12。海外前沿模型公司和业内一些公司也采用更激进的方法,将最新一周的数据乘以52。考虑到GLM-5.3的爬坡效应,按该方法计算的ARR已超过20亿美元。
比ARR数字本身更重要的是其背后的驱动力。自年初以来,智谱在量和价两方面均实现了较为健康的增长。截至8月底,MaaS平台上的令牌使用量较年初增长了40倍以上,其中CodingPlan的增长超过23倍。API平均定价上涨约101%。这表明平台收入的历史性激增主要得益于模型能力,而非完全依赖价格弹性。
受益于交易量和定价的双重提升,毛利率亦实现了显著增长。开放平台及API业务的毛利率由去年上半年的负0.4%跃升至今年上半年的24.6%,同比提升了25个百分点,较去年全年的18.9%也增长了约六个百分点。
在研发方面,我们持续全力投入,因为模型领先是其他一切的前提。2026年上半年,公司研发支出达到人民币21.3亿元,约合3.17亿美元。期内亏损约为人民币20.72亿元,同比下降12.1%,亏损率较去年同期收窄了4.7倍。调整后净亏损为人民币19.64亿元,调整后亏损率较去年同期收窄了3.5倍。显然,在收入规模扩大的同时,单位经济效应也在迅速改善。
尤为值得关注的是,今年上半年的调整后净亏损为人民币19.64亿元,低于研发支出。这表明,遵循去年全年业绩的模式,业务产生的毛利润在初步覆盖行政及销售费用后,已开始支撑研发投资。
接下来是第三部分。我将从五个角度阐述财务数据背后的公司运营表现。
首先,收入结构发生了根本性变化。2026年上半年,开放平台与API业务占收入的86.5%。这并非刻意进行财务工程的结果,而是模型能力提升带来的自然演进。回顾公司业务发展历程,我们从前两年销售本地部署模型,转向API使用和订阅计划,再到如今销售端到端的任务成果。随着模型智能的提升,新场景和新业务模式不断被解锁。
随着模型能够独立完成越来越完整的任务,客户购买的越来越接近成果本身,收入计量的单位也随之改变。2025年之前,在第一阶段,公司主要发展本地部署模型业务。当时,早期模型尚不能独立完成整个工作。用户购买的是工具,该工具需要集成、定制并交付到客户自身环境中,还需满足数据安全、合规性及自主可控的要求。因此,本地部署成为当时企业采用大模型的自然起点。
自2025年初起,公司逐步进入第二阶段:编码阶段。这一阶段的显著特征是模型从知识驱动行为转向任务驱动行为。编程能力的提升推动了API及CodingPlan等订阅产品的快速增长。
在此阶段,公司战略性地缩减了本地部署模型的软件许可业务,转而持续提供可调用、可扩展、可度量的智能服务。自今年年初起,公司进入第三阶段:智能体协同阶段。业务重心从模型调用转向任务交付。2026年上半年,GLM模型在智能体规划、工具使用及长周期任务持续执行方面持续改进。业务也从单一代码应用扩展到软件工程、网络安全、数据分析及复杂自动化等高价值场景。商业模式正从按用量销售转向订阅制及端到端任务成果销售。
展望未来,协同阶段正是公司当前开启的新篇章。模型连接企业数据、工具及业务系统,嵌入采购、财务、客服、研发、IT运维等流程中。它们已具备从理解需求到执行任务所需的基础。真实的企业工作流反过来可成为模型学习的环境和数据。2026年上半年,公司已在网络安全、法律服务、金融、教育等领域启动试点。
目前,网络安全领域进展最快。其他领域仍处于早期阶段,尚未形成规模化收入。将本地部署、编码及协同三个阶段串联起来,核心逻辑如下:每当模型能力实现飞跃,能够完成更重大的任务时,客户购买的内容便更接近最终经济价值和成果,公司收入结构也随之重塑。这正是收入构成变化的根本原因。
其次,我们的市场进入策略进一步拓宽。除了在各种基准测试中的模型得分外,行业越来越关注模型能否在智能与成本之间实现帕累托最优组合。2026年上半年,公司在深化高价值任务场景布局的同时,推出了GLM-5.3 Flash,旨在展示前沿智能也能进入广泛可及的应用场景。
依托超过10万张国产加速卡集群,公司初步实现了超大规模、低成本推理。上月底,公司向所有用户开放了CodingPlan订阅服务,涵盖Light、Pro、Max及团队版。这是国内较早通过订阅模式提供编程智能体能力的大模型服务之一。除了通过API满足企业需求外,我们也希望为国内开发者提供高质量的编程订阅方案。从高价值任务到前沿智能与广泛可及性的并行追求,从企业服务到API与CodingPlan的组合,公司的市场进入策略正变得更加深入、广泛且均衡。
第三,我们首次对MaaS平台的用户规模、使用深度及用户质量进行了详细阐述。截至2026年8月,该平台注册用户数已超过740万,较年初增长144%。付费日活跃用户数增长了603%。从收入角度看,本月前十名用户的日均使用量是年初水平的98倍。这些数据综合表明,我们已构建起中国最大的独立开发者平台之一,且总用户基数在原本庞大的基础上持续快速增长。过去两个月,受GLM-5.2、GLM-5.3及GLM-5.3 Flash的推动,用户数从6月底的580万增至740万,增加了160万。
这表明,进入长周期任务时代后,重度开发者用户在真实工作流程中的日均平台使用量,无论在规模还是深度上,都远超早期“氛围编码”阶段。同时,平台的高质量用户群体也在不断扩大。截至8月底,按年化经常性收入(ARR)计算,贡献年化收入超过10万美元、50万美元、100万美元、1000万美元、2500万美元及2.5亿美元的高质量用户群体数量分别为115、25、37、8、2和2。以上即为用户规模、用户画像、使用深度及用户质量的相关数据。
第四,我们引入了一个新概念:算力乘数。近年来,这一概念在行业内受到广泛关注。它反映了每投入1元人民币算力(包括训练和推理)所创造的开放平台及API收入。公司今年的算力乘数较去年上半年增长了十四倍,充分展示了算力供给效率的显著提升。
这条曲线的改善来自两个方向。首先,每个令牌所承载的智能持续提升,而每项任务的令牌消耗和成本则不断下降。其次,每投入1元算力所产生的收入持续增长,这意味着模型自我造血、支撑自身发展的能力正在稳步增强。智能上的突破带来更大的令牌使用量和商业回报;这些回报又被重新投入到算力和研发中,进一步推高智能的边界。这个飞轮已经开始转动。
第五,安全能力与模型能力同步提升。要使模型能力成为可靠的服务,关键在于它能否在现实世界中赢得信任。我们始终坚持开放与安全并重的发展路径。一方面,通过开放模型权重、MaaS平台、CodingPlan以及全球开发者网络,我们让模型尽可能多地进入真实应用场景。另一方面,通过权限控制、流程监控、风险评估、漏洞披露和外部验证,我们确保模型能力的可验证性。
以上是对公司财务表现和业务发展的讨论。接下来,智谱董事长刘德斌将阐述未来展望。
智谱董事长 刘德斌
在2026年上半年,我们证明了模型能够独立完成一项完整的工作。下一步,是让模型能够承担整个业务流程。围绕这一目标,我们形成了以下几点判断。
首先,从模型任务的角度看,模型正从长程任务向自主系统演进。当前的前沿是持续数小时的工程任务。下一步将扩展至持续数天的完整交互,使模型能够在更长时间内保持目标一致性,持续分解任务、调用工具、与环境互动、修复错误并验证结果。同时,行业将从单一Agent走向多Agent分工协作,模型将承担完整的业务流程,从辅助工作转向执行工作。
这一步的门槛并不完全在于智能本身,更在于可靠性和可审计性。模型需要在无需人类逐步检查的情况下工作,同时仍留下可追溯的轨迹。
其次,从能力演进的角度看,扩展从未停止,仍是通向更高智能的主要路径。不变的是路径,变化的是扩展的对象。模型当前的上限由四个因素共同决定:基础模型规模、有效深度、训练深度和任务环境。这四个因素的边际收益各不相同,并在不同阶段轮换。公司通过判断每个阶段哪个因素回报最高来分配资源。
GLM-5.3证明了训练深度是目前提升空间最大的领域。一旦后训练被推到极限,下一阶段的增长必须回归基础模型。GLM-5.3 Flash已通过下一代架构和30 TG多模态语料库验证了效率。下一代基础模型已在训练中,方向包括更大的有效规模、更长的原生上下文和原生统一多模态建模。
第三,我们追求在系统层面实现自我训练。训练系统内部正发生着更深层次的变革:数据、环境与基础设施均显现出被AI接管的早期迹象。
数据开始自我生成。模型对模型的自我对弈流程意味着,数据质量的上限不再受限于人工标注的速度,而是取决于模型自身验证结果的能力。
环境开始被制造。研究代理收集任务模式,评判代理尝试每项任务,验证器与环境被自动合成,逐渐成为流水线上的标准化产品。
基础设施开始自我优化。推理系统的优化本质上是代码工程任务,而这正是模型最为擅长的能力领域。
这三条线索指向同一个终极状态:模型参与自身的改进,形成递归式的自我提升。这就是我们的技术愿景——自我训练。下一代GLM将在上一代GLM构建的环境中自我训练。
第四,边界与治理。能力越强,评估与判断就越要交由外部。对模型能力的评估和风险的判断,最终必须由人来作出,并由外部机构进行独立评估。2026年上半年,我们已在网络安全领域开始实践这一点。最敏感的能力在受控条件下发布。开源之前,由专业第三方团队进行独立评估。漏洞通过国家漏洞库负责任地披露。基准分数由公司报告。风险判断则留给外部团队。这种分工不会因能力提升而改变,只会随着能力进步而更加牢固。
最后,我想用一句话总结今天所有的数字:模型能力的代际水平,是公司所有产品和商业逻辑的起点。从GLM预训练架构到悟道系列,再到今天的GLM-5系列,七年来我们只专注一件事:训练更强的模型。每一轮收入的快速增长,都发生在模型能力提升、新任务场景被解锁之后,而非之前。能力先行,商业随后。2026年上半年收入结构的反转和量价齐升,已经验证了这一逻辑。未来,它将继续被更大的用户规模、更大的商业体量和更广泛的全球影响力所验证。前路漫漫,但方向坚定。谢谢大家。
问答
问:您如何看待智谱在编程能力上的领先优势,以及真正的长期护城河是什么?
答: 任何单点领先都有时间限制。在编程基准测试中排名第一,可能在数周或数月内就会被追平。比任何单一排行榜位置更重要的是持续迭代的能力。
在过去大约十一个月里,GLM 模型家族经历了多代演进——从 4.6、4.7 到 5.1、5.2 和 5.3。其能力曲线持续上升,而每项任务的成本保持在相对健康的水平。
长期护城河并非在每个基准测试上永久领先。而是保持更快的模型迭代速度、更高的真实世界任务完成率、更低的智能单位成本,以及持续渗透到更高价值的客户工作流程中。
问:为什么选择编程作为模型能力突破的关键起点?
答: 编程不仅仅被视为一个可以快速商业化的产品线。它是通往智能体、长周期任务、复杂协作工作以及完全自训练道路上的技术瓶颈。
一个复杂的编程智能体必须同时理解需求、拆解任务、阅读代码、调用工具、修改代码、运行测试、重新规划并验证结果。这系统地训练了多步规划、错误恢复和自我纠错能力。
代码能否运行、测试能否通过、性能是否提升、缺陷是否修复,这些都可以客观验证。因此,编程为强化学习提供了一个可扩展、自动化且低成本的反馈环境。
GLM-5.3 的训练环境已从常规编程练习扩展到真实工程任务。其中一些任务的工作量相当于资深工程师连续数日的工作。
问:编程能力如何迁移到网络安全及其他专业领域?
答: 编程能力迁移的关键在于其底层抽象。编程训练所强化的核心能力——任务分解、工具调用、多步推理、错误恢复和结果验证——并非编程独有,而是通用智能的基础组件。
在网络安全领域,威胁检测、漏洞分析、攻击路径推理等任务本质上也是多步决策和模式识别问题。模型在编程中学会的“理解-规划-执行-验证”循环,可以直接映射到安全运营的闭环流程中。
此外,编程训练积累的代码理解和生成能力,使模型能够直接处理安全工具链中的脚本、配置和日志分析,降低专业领域的接入门槛。随着模型在更多领域的数据和反馈中持续迭代,这种迁移会变得更加自然和高效。
A: 网络安全要求理解代码、识别异常、调用工具进行验证、构建多阶段攻防流程,并根据环境反馈调整计划。因此,其底层能力与复杂编码智能体所需的能力高度一致。
在CyberGym上,GLM-5.2得分约为77.2,而GLM-5.3提升至84.5。在ExploitBench上,得分从约24.4提升至54.4。任务越接近完整的利用链,越需要长期规划,改进效果就越显著。
自GLM-5.2以来,我们与多个国内安全团队在真实代码库上合作,经过专家筛选和去重后识别出约2436个漏洞。其中超过1000个为高危漏洞,涉及269个项目。
下一步是将通过编码训练出的长期规划、工具使用和错误恢复能力,持续迁移到数据分析、复杂自动化、法律服务和金融等高价值专业工作中。
问:智谱在选择Cowork场景时采用什么标准?
A: Cowork并非简单的日常办公辅助,而是承担或替代专业领域中真实、复杂的工作流程。
选择场景有三个标准:任务必须具备足够高的智力门槛;结果必须能够有效验证;完成任务必须创造足够高的经济价值。
网络安全目前是最清晰且已验证的方向。法律服务、金融、数据分析等领域也在探索中,但由于其可靠性门槛和验证机制不同,商业化时间线会有所差异。
如果每一代模型都能完成更长、更完整、更专业的工作,编程将成为一种元能力,公司能够服务的高价值任务边界也将不断扩展。
问:目前算力扩张的进展如何,算力资源的结构是怎样的?
答: 自年初以来,算力容量持续健康扩张,训练和推理方面的投入均有所增加。算力来源包括自建集群、租用算力和购买算力服务。用途覆盖预训练、中期训练、后训练和生产推理。
不同芯片代际和架构构成了多样且异构的环境。训练效率和推理吞吐量差异显著,因此简单地统计加速卡数量已无法准确反映算力供给或基础设施能力。
在内部,我们更关注有效算力:即已安装、可稳定调度、能长期持续运行,并最终转化为模型训练进度或可计费令牌的算力。
大模型公司算力能力的核心衡量标准,不在于拥有多少张卡,而在于这些资源能多快支持模型迭代,以及能提供多少商业令牌供给。
问:国产芯片在智谱推理业务中的使用规模如何,表现怎样?
答: 截至上半年,我们已在约10万张国产加速卡上实现了大规模、低成本的推理。我们的推理供给不会依赖单一渠道,无论是进口卡还是国产卡,都不会作为唯一路径。
当GLM-5.3 Flash匿名上线时,后端全面采用国产芯片集群提供服务。在大约六天的时间里,这些集群处理了约60万亿token的使用量,并在OpenRouter和OpenCode等平台的历史性高流量下保持了强劲的服务性能。
国产加速器和推理卡运行工作负载的能力已经得到验证。下一阶段将聚焦于经济性:如何在内存容量、带宽和长上下文工作负载等约束下,提高每单位硬件的有效token输出。
问:基础设施优化在国产芯片上将推理效率提升了多少?
答: 公司六个月前开始执行“全面投入基础设施”战略,并为GLM-5.3重建了推理引擎和服务栈。优化涵盖了编码/解码、预填充与解码分离、量化、层拆分、缓存、通信等多个领域。
在相同的国产硬件和计算资源条件下,整体端到端服务性能相比初始基线提升了约三倍。
在有限且复杂的计算供应下,通过模型-基础设施协同优化来提高效率,比单纯扩大硬件来源更为根本。下一阶段的主要挑战是将每单位物理计算转化为更多智能、更多有效token和更大的商业价值。
问:训练侧计算面临哪些结构性问题,未来将如何改进?
答: 训练前沿模型不仅需要大量的计算资源,还需要大规模同构集群的稳定性、网络通信、软件栈以及长期运行能力。
目前,中国仍主要依赖异构计算。先进的国产加速卡尚未完全进入大规模量产阶段,形成了一定的结构性错配。
在接下来的大约三到六个月内,先进国产芯片制造商可能开始提升产量,异构并行计算环境预计将得到实质性改善。
基础模型的训练已在推进中。算力分配将优先保障关键训练窗口,我们不会仅仅因为推理需求快速增长就将所有资源转向推理。
问:模型层是否存在商品化风险,智谱如何构建定价权?
答: 单一指标的SOTA结果无法创造长期定价权。公开基准和短任务上的表现将逐渐趋同。然而,持续时间长、可执行且可验证的真实世界任务会放大模型之间的差异。
在过去大约十一个月里,GLM在Artificial Analysis上的智能指数从32升至60,而旗舰模型的单任务成本保持在约0.20美元。GLM-5.3 Flash进一步将其降至约0.045美元。
定价权取决于一个token能完成什么。一百万token用于闲聊对话,与一百万token用于完成工程项目或修复生产系统中的漏洞,对客户创造的价值截然不同。随着模型从编码走向智能体与协同工作,客户将逐渐从购买token转向购买任务成果。
一旦模型进入客户的代码库、工具链、内部数据和工作流程,客户就会围绕它积累提示词、智能体工作流、权限系统、评估标准和工程集成。届时,切换成本将远不止API价格本身。
问:商业数据是否已经证明能力提升可以支撑价格上涨?
A: 上半年,API平均售价上涨约101%,同时token使用量也大幅增长。以收入计算,前十大客户日均使用量较年初增长约98倍。
价格上升而核心客户使用深度增加,这表明客户并非仅仅因为模型价格低廉才使用。随着能力的提升,客户愿意将更多实际任务委托给模型,并为更强的能力付费。
行业未来可能形成两条定价曲线。在特定智能水平下,价格将持续下降。而开辟新任务边界、显著提升成功率的领先模型,仍可能保持溢价甚至进一步提价。
问:海外业务目前处于什么阶段,将如何拓展?
A: 公司自2025年起已形成一定规模的海外业务。早期主要聚焦本地化部署和主权大模型项目。马来西亚的Matrix大模型项目是较早的海外项目之一。
随着业态变化,海外重心转向开放平台和API。GLM-5.3代表更高层次的智能,而GLM-5.3 Flash则代表易用性和高性价比。两者在高价值任务层和广泛可及层占据不同的生态位。
我们正积极推进与海外CSP平台的合作。未来将通过开源模型、本地托管、收益分成等方式拓展海外市场。未来一至两个月内可能披露更多进展。
中国模型与海外顶尖模型仍有差距,但整体能力与成本的帕累托最优组合,可成为海外竞争的重要切入点。
问:对于下一代GLM模型,最重要的改进方向是什么?
答: 规模扩展从未停止,目标依然是提升智能上限。我们之前投资了多模态、图像生成和视频生成的研究,但这些方向在提高智能上限方面帮助有限。因此,我们将重心转向文本,以及文本与多模态能力相互增强的模型形态。
模型能力正从回答知识性问题转向完成任务。研究重心相应地从基础问答转向编程与协作。下一代模型将继续沿着这一方向发展。
基础模型将继续扩大,以便更好地存储和表示知识。同时,我们将通过减少活跃参数数量并结合循环等方法增加推理深度,避免因活跃参数过多而导致万亿参数模型变得过于缓慢和昂贵。
除了扩展基础模型外,后训练也将显著加强。我们将采用技术和工程手段,缩小中国在计算资源限制下与OpenAI、Anthropic等海外公司的差距。
问:为什么数据环境和后训练是GLM-5.3改进的重要来源?
答: 在2022年ChatGPT发布前后,智谱已经建立了一个数百人的数据标注团队,并长期投资于数据和训练环境的开发。
GLM-5.3相比GLM-5.2有显著提升的一个重要原因是其数据环境的规模扩大了数十倍。未来我们将继续扩大数据和环境的规模。
互联网上新增的文本数据量正逐渐减少,而合成数据的占比却在上升。因此,除了增加基础模型的参数规模外,构建可验证的数据环境和真实任务环境更为重要,以便模型在后训练阶段能持续获得有效反馈。
问:GLM-6.0所设想的完全自训练是什么?
答: 完全自训练对应的是具备自我进化能力的模型,在海外通常也被称为RSI。其目标是让模型在预训练、中期训练和后训练阶段更多地自主进行训练和自我进化。
最大的挑战并非单纯扩大模型规模或持续训练,而是让模型能够自我评估、知晓何时停止,并在出错时自主纠正。
完全自训练将成为未来模型研究的重要方向。伦理和社会治理也将被纳入模型进化的过程中。
问:为何目前在参数规模上相对克制?
答: 模型规模的选择需综合考虑资源、模型目标以及用户实际能使用模型的时间。国内可用的训练数据量通常在30至50万亿个token左右。在这样的数据规模下,根据缩放定律盲目训练一个特别大的模型,可能无法获得足够高的边际回报。
国内算力有限,而中期训练和后训练的潜力尚未完全释放。因此,单纯增加参数并非当前最重要的投资方向。
GLM-5.3所依托的7450亿参数基础模型于年初完成训练,自设计之初便规划为可复用超过半年。在同一基础上,我们相继推进了GLM-5.1、5.2和5.3版本,以及相应的SFT、中期训练和后训练环境开发。
基本策略是从每个基础模型中挖掘最大潜能,同时将推理成本优化至用户在大规模应用中真正能够承受的水平,而非仅仅追求一个无法部署的庞大模型。
问:您如何规划下一代基础模型及其推理部署?
答: 下一代大型基础模型已在推进中,尽管具体参数数量尚未公开。中期训练和后训练也将基于新基础进行系统性规划。
推理研究与工程已提前启动,目标是让下一代模型在发布首日即能支持全规模用户需求,而非发布后还需漫长的工程适配期。
下一代模型的一个重要设计约束依然是:一旦模型开源,企业应能直接安装使用,而公司自身也应能通过低推理成本支撑大规模应用。