智谱 2026 年中期业绩说明会:管理层发言与问答全文翻译
所提供英文稿的完整中文翻译,涵盖管理层发言与全部问答:模型迭代、编程与 Cowork、财务表现、国产算力、推理优化及全自主训练。
译文说明:本文根据提供的英文稿全文翻译,保留发言顺序、问答结构、数字及专有名词。标题依据稿件内容拟定;原稿未附原始发布链接,文中业绩、评测及技术进展均为稿件中的发言表述,未经本文独立核验。原稿中的姓名拼写与个别单位存在不一致或含义不明之处,均予以保留,并在文末说明。
一、管理层发言
Tang Jie
各位投资者、分析师,晚上好。非常感谢大家参加我们 2026 年中期业绩说明会。我先简要介绍一下智谱的基本情况、我们近期的一些思考,以及未来的技术路线图。
大模型技术已经发展了近十年。从去年开始,智谱就认识到,大模型正在从“聊天”转向“做事”。我们较早地为这一转变进行了布局,尤其注重加强模型的编程能力。去年年中,我们发布了 GLM-4.5,这是我们第一个在编程方面取得出色表现的模型。今年以来,我们陆续发布了 GLM-5.0、5.1、5.2 和 5.3,持续在同一个基础上迭代。
首先,规模化扩展(Scaling)是否必然意味着大幅增加参数量?规模化扩展是通向更高智能的关键路径,但其本质并不只是扩大参数量。今年以来,我们显著加强了基座模型、后训练以及任务环境的规模。在扩大参数规模的同时,还需要增加模型的有效深度,例如利用循环 Transformer(Loop Transformer),让模型在推理时进行更深入的思考。我们最近一直在推进相关工作。与此同时,后训练仍有很大的提升空间。因此,我们在 GLM-5.3 上投入了大量资源,显著加强了它的后训练。
编程也包含许多不同类型的任务。在各类编程任务上强化模型,可以系统性地提升其整体能力。我们围绕不同的任务环境做了大量工作,显著提升了 GLM-5.3 的表现,使其达到当前最先进水平(SOTA),跻身当下的智能前沿。
另一方面,模型不仅要强大,还必须让用户用得起、用得上。在设计模型时,我们既要考虑模型规模与激活参数量,也要考虑推理和基础设施的效率。只有降低推理成本,技术才能实现普惠。
因此,在设计 GLM-5 系列时,我们特别注重加强推理能力。在英伟达芯片与多种国产芯片并存的算力环境中,我们借助外部资源,并收购了一家推理技术公司,进一步增强推理能力,使 GLM-5.1、5.2 和 5.3 更容易部署和使用。
目前,模型的使用量非常大,我们在 OpenRouter 上的使用量一度排名第一。每次发布新模型后,我们 MaaS 平台的调用量通常都会翻倍。这就是我们今年整体布局和进展的基本情况。
对于一家模型研发公司来说,核心任务仍然是持续抬高智能上限。这又回到了智谱最根本的愿景。2019 年,我们为智谱确立了一个愿景:让机器像人一样思考。直到今天,我们仍在探索智能的上限。探索这个上限,不只是训练模型,还要求我们思考:未来的模型应该具备怎样的智能,应该能够完成哪些事情。围绕下一阶段的路线图,我们形成了几条思路。
首先,今年年初,我们看到编程已经成为行业普遍认可的方向。随后,我们进一步思考,模型如何在编程能力的基础上完成更多任务。在 GLM-5.1 和 5.2 阶段,我们提出了长时程任务(Long Horizon Task)的概念,希望模型能够执行持续时间更长的任务;我们也提出了自主人工智能(Autonomous AI)的概念,即模型应该能够自主完成一项任务。
当模型具备这些能力后,仍然需要进一步演进。我们已经开始研究全自主训练模型。我们希望,模型能够在预训练、中期训练和后训练阶段自主学习,并自主构建自己的配套运行与评测框架(harness),让训练过程逐步实现自主化。
大家可能已经注意到,在我们近期的推理优化中,特别是在发布 GLM-5.3 和优化国产芯片基础设施时,我们已经使用了基础设施智能体(Infra Agent)。由 GLM-5.3 驱动的 Infra Agent 能够自主修改国产芯片的优化方案,显著改善效果。未来,我们将沿着这一路径继续推进,进一步加强这些能力。
最后,在推动 AI 普惠、让更多人能够使用 AI 的过程中,社会责任同样重要。模型的发布与大规模使用,需要健全的治理和安全机制。我们持续思考如何加强模型在社会治理、公共安全与伦理方面的能力,并已经启动相关研究。我们也希望投资者和分析师提出更多建议、给予更多支持,共同探索 AGI 的前沿以及 AI 普惠的实现路径。
Liu Debing
接下来,我将全面汇报我们上半年的成果与思考。概括而言,如果说去年的关键词是“智能上限”,那么今年上半年的关键词就是“将能力转化为价值”。模型第一次被证明不仅是工具,而且是能够独立完成一项任务的系统。我们的收入结构也随之变化,强大模型的商业价值开始规模化兑现。
第一部分,是我们关于战略聚焦与模型发展的思考。首先,智能上限决定任务边界,任务价值决定商业空间。在 3 月的年度业绩说明会上,我们提出了一个公式:
AGI 商业价值 = 智能上限 × Token 消耗规模
智能上限决定模型能够处理哪些任务,以及每个 Token 能够为用户创造多少价值。智能上限越高,模型所能处理的任务的价值密度就越高,单位智能对应的经济产出也越大。Token 消耗规模则反映了智能被使用的广度与深度。同样一个 Token,用于日常闲聊与用于修复生产环境中的漏洞,产生的结果可能相差几个数量级。因此,Token 所处场景的价值密度,取决于模型能够打开怎样的任务边界。任务边界每提升一个层级,市场空间就可能扩大一个数量级。
第二点,是模型能力发展的五个阶段。我们认为,大模型能力的演进不是一组并行的产品线,而是依次向上攀升的阶梯:
聊天(Chat)→ 编程(Coding)→ 智能体(Agent)→ 协同工作(Cowork)→ 自主人工智能(Autonomous AI)
Chat 交付一次性答案。Coding 交付可执行代码。Agent 交付一条完成的多步骤任务链。Cowork 交付可供专业人士审核的工作成果。
Autonomous AI 交付持续运行的能力。每上一个台阶,都有特定的技术门槛。如果没有跨过这个门槛,下一个层级的商业模式就无法成立。从 Chat 到 Coding,门槛是结果能否被验证。从 Coding 到 Agent,门槛是长时程规划与错误恢复。从 Agent 到 Cowork,门槛是可靠性是否足够高,让专业人士愿意审核结果,而不是从头重做。从 Cowork 到 Autonomous AI,门槛是模型能否自主判断自己的结果是否正确。报告期内,公司的重点位于 Coding 与 Cowork 之间。我们已经开始在网络安全、法律服务、金融、教育等领域进行试验。网络安全进展最快;其他方向仍处于早期,尚未产生规模化收入。
我们的模型在 CyberGym 上取得了 84.5 分,超过 Fable5 和 GPT-5.6 SOLO。在 ExploitGym 上完成了 130 项任务,仅次于 Fable5 和 GPT-5.6。
第三点,是保持持续向上的模型迭代轨迹与 SOTA 水平的重要性。过去一年,行业对 SOTA 的理解一直在变化。短期登顶榜单已经不再是最重要的事情。真正重要的是,谁能够以更快的速度、更优的成本,持续向市场推出更强的模型。单点冠军稍纵即逝,持续领先则是一条不断向上的轨迹。
GLM 系列在大约 11 个月内完成了六次迭代。其智能指数从 32 提升到 60,而单任务成本维持在约 0.20 美元的水平。GLM-5.3 Flash 以每项任务 0.045 美元的成本,进入了智能与成本的前沿。GLM-5 以编程为切入点,打开了长时程智能,其能力从代码生成扩展到系统理解、任务规划、工具使用和工程交互,推动模型从氛围编程(vibe coding)走向智能体工程(agentic engineering)。编程已经成为公司的主要收入来源,而通过编程积累的长时程任务能力,也已经在向网络安全等领域的迁移中得到验证。
GLM-5.2 是面向长时程任务的旗舰模型。它支持真正可用的 100 万 Token 上下文窗口,在实际使用中能够容纳项目级工程上下文。它在长时程任务执行中更稳定,对工程规范的遵循也更可靠。其在开发场景中的成功率进一步提高,能够在单次任务中完成从需求到多个终端可部署产物的完整开发链路。
GLM-5.3 是智谱最新的旗舰模型,在复杂软件工程和 Agent 任务上实现了全面进步。它与 GLM-5.2 使用相同的基座模型,全部能力提升均来自后训练。GLM-5.3 进一步扩大了任务环境规模,使训练任务不再局限于常规编程题,而是更加接近专家在真实场景中完成的完整专业工作单元。在架构、总参数量和激活参数量都相同的情况下,仅扩大后训练规模,就使端到端完成率提高了 50% 以上。GLM-5.3 表明,规模化扩展不只是参数问题;训练是当前提升空间最大的领域。
如果说 GLM-5.3 代表当前的能力前沿,那么 GLM-5.3 Flash 就代表成本前沿。GLM-5.3 Flash 面向高频、大规模、成本敏感的使用需求,采用了专门为降低成本而开发的新架构。它拥有 3200 亿总参数、180 亿激活参数,将稀疏注意力与线性注意力结合起来,定价为 GLM-5.2 的十分之一。它在基准测试和实际应用中的表现都优于 GLM-5.2。
发布之前,该模型以 OX 和 Aux Offer 的匿名模型名称,通过 OpenCode 和 OpenRouter 上的真实使用进行测试。上线首日,它便登上 OpenRouter 第一名,并创下单日 Token 使用量新纪录。六天累计使用量超过 62 万亿 Token,带动平台整体使用量增长超过 20%。
第四点,是“用国产芯片驱动国产模型”的进展。今年以来,我们已将国产芯片纳入主要推理产能。GLM-5.3 Flash 是公司第一个在超大规模真实流量下,完全通过国产芯片集群提供服务的模型。芯片通过我们自主研发的高带宽互连网络连接,整个推理引擎在 GLM-5.3 驱动的 Infer Agent 的帮助下大幅加速,算子开发周期缩短了一半。我们首次在公司内部完成了“模型优化系统、系统运行模型”的闭环。
与相同硬件上的初始基线相比,端到端服务性能提升至三倍。公司已经在约 10 万张国产加速卡上实现大规模、低成本推理,每 Token 推理成本较年初下降了 80%。在全球算力供应持续紧张的背景下,这条路径意味着,我们已经开始掌握自身的成本曲线。
接下来,由 Xiao Lei 介绍公司的财务数据。
Xiao Lei
各位投资者,晚上好。接下来,我将介绍公司的财务表现和业务发展。
2026 年上半年,公司总收入达到人民币 9.54 亿元,折合 1.42 亿美元,同比增长近 400%。比增长率本身更值得关注的是收入构成的变化。开放平台及 API 业务收入达到人民币 8.25 亿元,折合 1.23 亿美元,是去年上半年的 27 倍以上。其占总收入的比例,从去年同期的 15.2%、去年年底的 26.3%,大幅提升至 86.5%。智谱的收入现在主要来自开放平台及 API 业务。近期发布的 GLM-5.2、GLM-5.3 和 GLM-5.3 Flash,推动开放平台及 API 业务量出现历史性跃升。
截至 2026 年 8 月底,我们的年度经常性收入(ARR)达到 16 亿美元。这个 ARR 是将月度收入年化计算得出的,也就是将 8 月收入乘以 12。海外前沿模型公司和行业内一些公司还采用更激进的方法,即将最近一周的数据乘以 52。考虑到 GLM-5.3 的放量,按这一方法计算的 ARR 已经超过 20 亿美元。
比 ARR 数字本身更重要的是背后的驱动力。今年以来,智谱在量与价两方面都实现了相对健康的增长。截至 8 月底,MaaS 平台的 Token 使用量较年初增长了 40 多倍,其中 CodingPlan 增长了 23 多倍。API 平均价格上涨约 101%。这说明,平台收入的历史性跃升主要由模型能力驱动,而不是完全依赖价格弹性。
受益于量价齐升,毛利率也大幅改善。开放平台及 API 业务的毛利率,从去年上半年的负 0.4% 提升至今年上半年的 24.6%,同比提高 25 个百分点,较去年全年的 18.9% 提高约 6 个百分点。
在研发方面,我们继续全力投入,因为模型领先是一切的前提。2026 年上半年,公司研发支出达到人民币 21.3 亿元,折合约 3.17 亿美元。期内亏损约为人民币 20.72 亿元,同比下降 12.1%。亏损率较去年上半年收窄了 4.7 倍。经调整净亏损为人民币 19.64 亿元,经调整亏损率较去年上半年收窄了 3.5 倍。可以看到,在收入规模扩大的同时,单位经济效益也在快速改善。
特别值得注意的是,今年上半年的经调整净亏损为人民币 19.64 亿元,低于研发支出。这表明,延续去年全年业绩呈现的趋势,业务产生的毛利在初步覆盖管理费用与销售费用之后,已经开始支持研发投入。
接下来是第三部分。我将从五个方面介绍财务数字背后的经营表现。
第一,收入结构发生了根本性变化。2026 年上半年,开放平台及 API 业务占收入的 86.5%。这并不是刻意进行财务操作的结果,而是模型能力提升带来的自然演进。回顾公司的业务发展,我们从两年前销售本地部署模型,发展到 API 调用和订阅套餐,再到现在销售端到端任务成果。随着模型智能水平提高,新的场景与业务形态被陆续打开。
随着模型能够独立完成越来越完整的任务,客户购买的东西越来越接近结果本身,收入的计量单位也随之变化。2025 年以前,在第一阶段,公司主要发展本地部署模型业务。当时,早期模型还无法独立完成一整项工作。用户购买的是一个工具,而这个工具需要被集成、定制,并交付到客户自己的环境中,还要满足数据安全、合规和自主可控的要求。因此,本地部署是当时企业采用大模型的自然起点。
从 2025 年初开始,公司逐步进入第二阶段,即 Coding 阶段。这一阶段的显著特征,是模型从知识驱动转向任务驱动。编程能力的提升,推动了 API 和 CodingPlan 等订阅产品的快速增长。
在这一阶段,公司战略性地收缩了本地部署模型的软件授权业务,转向持续提供可调用、可扩展、可计量的智能服务。今年以来,公司进入第三阶段,即 Agentic 与 Cowork 阶段。业务正在从模型调用走向任务交付。2026 年上半年,GLM 模型在 Agent 规划、工具使用和长时程任务持续执行方面不断提升。业务也从单点编程应用,扩展到软件工程、网络安全、数据分析和复杂自动化等高价值场景。商业模式正从销售使用量,向销售订阅及端到端任务成果演进。
面向未来,Cowork 正是公司正在打开的阶段。模型连接企业数据、工具和业务系统,嵌入采购、财务、客服、研发、IT 运维等流程,已经具备从理解需求走向执行任务所需的基础。真实的企业工作流反过来也可以成为模型学习的环境与数据。2026 年上半年,公司开始在网络安全、法律服务、金融、教育等领域进行试验。
目前网络安全进展最快,其他领域仍处于早期,尚未产生规模化收入。将本地部署、Coding 和 Cowork 这三个阶段串联起来,核心逻辑是:每当模型能力实现一次跃迁、能够完成更实质性的任务,客户购买的东西就更接近最终的经济价值与结果,公司的收入结构也随之改写。这是收入结构变化的根本原因。
第二,我们的市场拓展策略进一步拓宽。除了模型在各项基准测试上的得分,行业越来越关注模型能否实现智能与成本的帕累托最优组合。2026 年上半年,公司继续深耕高价值任务场景,同时推出 GLM-5.3 Flash,希望证明前沿智能也能够进入普惠使用场景。
依托超过 10 万张国产加速卡组成的集群,公司已初步实现超大规模、低成本推理。上月底,公司面向所有用户开放了 CodingPlan 订阅,覆盖 Light、Pro、Max 和团队版。这是国内较早通过订阅模式提供编程智能体能力的大模型服务之一。除了通过 API 满足企业需求,我们也希望为中国开发者提供高质量的订阅制编程套餐。从高价值任务走向前沿智能与普惠并重,从企业服务走向 API 与 CodingPlan 相结合,公司的市场拓展策略正在变得更深入、更广泛,也更加均衡。
第三,我们首次详细介绍 MaaS 平台的用户规模、使用深度和用户质量。截至 2026 年 8 月,平台注册用户超过 740 万,较年初增长 144%。付费日活跃用户增长 603%。从收入角度看,前十大用户本月的平均每日使用量达到年初的 98 倍。这些数据共同表明,我们已经建立了中国最大的独立开发者平台之一,而且在已有相当规模的基础上,用户总量仍在快速增长。过去两个月,在 GLM-5.2、GLM-5.3 和 GLM-5.3 Flash 的推动下,用户数量从 6 月底的 580 万增加到 740 万,增长了 160 万。
这表明,进入长时程任务时代后,无论从规模还是在真实工作流中的使用深度来看,重度开发者用户在平台上的日均使用量都远远超过早期的 vibe coding 阶段。与此同时,平台的优质用户群持续扩大。截至 8 月底,按 ARR 口径,年化贡献超过 10 万美元、50 万美元、100 万美元、1000 万美元、2500 万美元和 2.5 亿美元的优质用户群数量,分别为 115、25、37、8、2 和 2。这些就是有关用户规模、用户画像、使用深度和用户质量的数据。
第四,我们引入一个新概念:算力乘数。这个概念近年来在行业内受到广泛关注。它反映每投入人民币 1 元算力,能够产生多少开放平台及 API 收入,其中算力投入包括训练与推理。公司今年的算力乘数较去年上半年提高了 14 倍,说明算力供给效率显著改善。
这条曲线的改善来自两个方向。一是每个 Token 承载的智能不断提高,而每项任务的 Token 消耗和成本持续下降。二是每投入人民币 1 元算力所产生的收入持续增加,意味着模型为自身发展提供资金的能力不断增强。智能突破带来更多 Token 使用量和商业回报,这些回报再投入算力与研发,进一步抬高智能上限。这个飞轮已经开始转动。
第五,安全能力与模型能力同步增长。模型能力要成为可靠的服务,关键在于能否在真实世界中赢得信任。我们始终坚持开放与安全同步发展。一方面,通过开放模型权重、MaaS 平台、CodingPlan 和全球开发者网络,让模型进入尽可能多的真实环境。另一方面,通过权限控制、过程监控、风险评估、漏洞披露和外部验证,建立模型能力的可验证性。
以上是公司财务表现和业务发展的介绍。接下来,请智谱董事长 Liu Debin 介绍未来展望。
Liu Debin,智谱董事长
2026 年上半年,我们证明了模型能够独立完成一整项工作。下一步,是让模型能够承接一个完整的业务流程。围绕这一目标,我们形成了几项判断。
第一,从模型任务的角度看,模型正在从长时程任务向自主系统演进。当前前沿是持续数小时的工程任务,下一步将延伸至持续数天的完整交互,使模型能够在更长时间内保持目标一致性,持续拆解任务、调用工具、与环境交互、修复错误并验证结果。与此同时,行业将从单一 Agent 走向多 Agent 分工协作,由模型承接完整业务流程,从辅助工作走向执行工作。
跨越这一步的门槛,并不完全在于智能本身,更在于可靠性与可审计性。模型需要在不由人类逐步检查的情况下工作,同时仍留下可供复核的过程记录。
第二,从能力演进的角度看,规模化扩展从未停止,仍然是通向更高智能的主要路径。没有改变的是路径,改变的是被扩展的对象。当前模型的上限由四个因素共同决定:基座模型规模、有效深度、训练深度和任务环境。这四个因素的边际收益各不相同,并会在不同阶段轮动。公司通过判断每个阶段哪个因素的当前回报最高,来分配资源。
GLM-5.3 证明,训练深度是当前提升空间最大的领域。一旦后训练被推到极限,下一阶段的增长就必须回到基座模型。GLM-5.3 Flash 已经通过下一代架构和一个 30 TG 的多模态语料库验证了效率。下一代基座模型已经在训练中,方向包括更大的有效规模、更长的原生上下文,以及原生统一多模态建模。
第三,我们希望在系统层面实现自主训练。训练系统内部正在发生更深层的变化:数据、环境和基础设施都开始显现由 AI 接管的迹象。
数据开始自我生成。模型与模型自博弈的流水线,意味着数据质量的上限不再由人工标注速度决定,而是由模型自身验证结果的能力决定。
环境开始被批量构建。研究智能体收集任务模式,评判智能体尝试每一项任务,验证器和环境被自动合成,逐渐成为流水线上的标准化产物。
基础设施开始自我优化。推理系统优化本质上是一项代码工程任务,而这恰恰是模型最擅长的能力领域。
这三条线指向同一个终点:模型参与自身改进,形成递归式自我改进。这就是我们的技术愿景——自主训练。下一代 GLM 将在上一代 GLM 构建的环境中自主训练。
第四,边界与治理。能力越强,将评估与判断交由外部完成就越重要。模型能力的评估与风险判断,最终必须由人作出,并由外部机构开展独立评估。2026 年上半年,我们已经在网络安全领域开始实践。最敏感的能力在受控条件下释放;开源之前,由专业第三方团队开展独立评估;通过国家漏洞库进行负责任的漏洞披露。基准测试成绩由公司报告,风险判断交给外部团队。这种分工不会随着能力提升而改变,只会随着能力进步而进一步加强。
最后,我想用一句话概括今天所有的数据:模型能力所处的代际水平,是公司一切产品与商业逻辑的起点。从 GLM 预训练架构,到悟道系列,再到今天的 GLM-5 系列,七年来我们始终专注于一件事:训练更强的模型。每一次收入快速增长,都发生在模型能力提升、打开新的任务场景之后,而不是之前。能力在先,业务随后。2026 年上半年收入结构的逆转与量价齐升,已经验证了这一逻辑。未来,更大的用户群、更大的商业规模和更广泛的全球影响力,将继续验证这一逻辑。前路漫长,但方向坚定。谢谢大家。
二、问答环节
1. 如何看待智谱在编程能力上的领先?真正的长期护城河是什么?
答: 任何单点领先都有时效性。在某项编程基准测试中排名第一,可能几周或几个月后就会被追平。比任何一次榜单排名更重要的,是持续迭代的能力。
过去大约 11 个月,GLM 模型家族经历了多个代际,从 4.6、4.7 到 5.1、5.2 和 5.3,能力曲线持续上升,而单任务成本保持在相对健康的水平。
长期护城河并不是永远在每一项基准测试上领先,而是能够保持更快的模型迭代速度、更高的真实任务完成率、更低的单位智能成本,并持续深入更高价值的客户工作流。
2. 为什么选择编程作为模型能力突破的关键起点?
答: 我们并不只是把编程看作一条能够快速商业化的产品线。它是通向 Agent、长时程任务、复杂协同工作和全自主训练(Fully Self-Training)的一道技术关口。
复杂的编程 Agent 必须同时完成需求理解、任务拆解、代码阅读、工具调用、代码修改、测试运行、重新规划和结果验证。这会系统性地训练多步骤规划、错误恢复和自我纠正能力。
代码能否运行、测试能否通过、性能是否提升、缺陷是否修复,都可以客观验证。因此,编程为强化学习提供了一个可扩展、自动化且低成本的反馈环境。
GLM-5.3 的训练环境已经从常规编程练习扩展到真实工程任务。其中一些任务的工作量,相当于一名资深工程师连续工作数天。
3. 编程能力如何迁移到网络安全及其他专业领域?
答: 网络安全需要理解代码、识别异常、调用工具验证、构建多阶段攻防流程,并根据环境反馈调整计划。因此,其底层能力与复杂编程 Agent 所需的能力高度一致。
在 CyberGym 上,GLM-5.2 的得分约为 77.2,GLM-5.3 则提高到 84.5。在 ExploitBench 上,得分从约 24.4 提高到 54.4。任务越接近完整的漏洞利用链、越需要长时程规划,提升就越明显。
从 GLM-5.2 开始,我们与多家国内安全团队合作,在真实代码库中发现了约 2436 个经过专家筛选与去重的漏洞。其中超过 1000 个是高危漏洞,涉及 269 个项目。
下一步,是继续把通过编程训练出的长时程规划、工具使用与错误恢复能力,迁移到数据分析、复杂自动化、法律服务和金融等高价值专业工作中。
4. 智谱选择 Cowork 场景的标准是什么?
答: Cowork 并不只是日常办公辅助,而是承接或替代专业领域中真实、复杂的工作流。
选择场景有三个标准:任务必须具有足够高的智力门槛;结果必须能够得到有效验证;完成任务必须创造足够高的经济价值。
网络安全是目前验证最清晰的方向。法律服务、金融、数据分析等领域也在探索中,但由于可靠性门槛与验证机制不同,它们的商业化节奏也会有所差异。
如果每一代模型都能够完成更长、更完整、更专业的工作,编程就会成为一种元能力,公司能够服务的高价值任务边界也将不断扩大。
5. 当前算力扩张进展如何?算力资源结构是怎样的?
答: 今年以来,算力规模持续以健康的节奏扩张,训练与推理两方面的投入都在增加。算力来源包括自有集群、租赁算力和购买算力服务,用途涵盖预训练、中期训练、后训练和生产推理。
不同代际、不同架构的芯片构成了多样化的异构环境。训练效率与推理吞吐量差异显著,因此简单统计加速卡数量,已经无法准确反映算力供给或基础设施能力。
我们内部更关注有效算力:已经安装到位、能够稳定调度、能够长期持续运行,并最终转化为模型训练进度或可计费 Token 的算力。
衡量一家大模型公司算力能力的核心,不是它拥有多少张卡,而是这些资源能以多快的速度支持模型迭代,以及能够提供多少商业化 Token 供给。
6. 国产芯片在智谱推理业务中的使用规模有多大?表现如何?
答: 截至上半年,我们已经在约 10 万张国产加速卡上实现了大规模、低成本推理。我们的推理供给不会把进口卡或国产卡中的任何单一渠道作为唯一路径。
GLM-5.3 Flash 匿名上线时,后端全部采用国产芯片集群提供服务。在大约六天内,这些集群承载了约 60 万亿 Token 的使用量,并在 OpenRouter、OpenCode 等平台创纪录的高流量下,保持了良好的服务表现。
国产加速卡和推理卡能够承载这些工作负载,这一点已经得到验证。下一阶段将聚焦经济性:如何在显存容量、带宽、长上下文工作负载等约束下,提高单位硬件的有效 Token 产出。
7. 基础设施优化使国产芯片的推理效率提高了多少?
答: 公司从六个月前开始执行“全力投入基础设施(all in Infra)”战略,并为 GLM-5.3 重建了推理引擎与服务栈。优化涵盖编码/解码、预填充与解码分离、量化、层拆分、缓存、通信等多个方面。
在相同国产硬件、相同算力资源下,整体端到端服务性能相较初始基线提升至约三倍。
在算力供给有限且复杂的情况下,通过模型与基础设施协同优化来提升效率,比单纯拓宽硬件来源更加根本。下一阶段的主要挑战,是将每一单位物理算力转化为更多智能、更多有效 Token 和更大的商业价值。
8. 训练侧算力面临哪些结构性问题?未来将如何改善?
答: 训练前沿模型,不仅需要大量算力,还需要大规模同构集群所具备的稳定性、网络通信、软件栈和长时间运行能力。
目前,国内仍主要依赖异构算力。先进国产加速卡尚未完全进入大规模量产,形成了一定的结构性错配。
未来大约三到六个月,先进国产芯片厂商可能开始放量,异构并行计算环境有望显著改善。
基座模型训练已经在推进。算力分配将优先保障关键训练窗口,我们不会因为推理需求增长迅速,就把全部资源转向推理。
9. 模型层是否面临同质化风险?智谱如何建立定价权?
答: 单点 SOTA 成绩无法形成长期定价权。公开基准测试与短任务上的表现会逐步趋同,但持续时间长、可执行、可验证的真实任务,会放大模型之间的差异。
过去大约 11 个月,GLM 在 Artificial Analysis 上的智能指数从 32 提升到 60,而旗舰模型的单任务成本维持在约 0.20 美元。GLM-5.3 Flash 则进一步将其降低至约 0.045 美元。
定价权取决于一个 Token 能够完成什么。一百万 Token 用于日常闲聊,与用于完成一个工程项目或修复生产系统中的漏洞,为客户创造的价值截然不同。随着模型从 Coding 走向 Agent 和 Cowork,客户将逐步从购买 Token 转向购买任务结果。
一旦模型进入客户的代码库、工具链、内部数据和工作流,客户就会围绕它积累提示词、Agent 工作流、权限体系、评估标准和工程集成。届时,切换成本涉及的内容将远远超出 API 价格本身。
10. 商业数据是否已经证明,能力提升能够支持涨价?
答: 上半年,API 平均售价上涨约 101%,同时 Token 使用量也大幅增长。按收入衡量,前十大客户的日均使用量较年初增长了约 98 倍。
价格上涨的同时,核心客户继续加深使用,说明客户并不只是因为便宜才使用模型。随着能力提升,客户愿意把更多真实任务交给模型,并为更强的能力付费。
行业最终可能形成两条价格曲线。在给定智能水平下,价格将持续下降;能够打开新任务边界、显著提高成功率的前沿模型,则可能继续获得溢价,甚至进一步提价。
11. 海外业务目前处于什么阶段?将如何拓展?
答: 公司自 2025 年起已经开展了一定规模的海外业务。早期主要聚焦本地部署和主权大模型项目。马来西亚的 Matrix 大模型项目,是较早的海外项目之一。
随着业务形态变化,海外业务的重点已转向开放平台和 API。GLM-5.3 代表更高水平的智能,GLM-5.3 Flash 则代表普惠与高性价比。它们分别在高价值任务层与普惠层占据不同的生态位置。
我们正在积极推进与海外云服务提供商(CSP)平台的合作。未来,将通过开源模型、本地托管、收入分成等方式拓展海外市场。未来一到两个月可能会披露进一步进展。
中国模型与海外最顶尖模型仍有差距,但综合能力与成本的帕累托最优组合,可以成为参与海外竞争的重要切入点。
12. 下一代 GLM 模型最重要的提升方向是什么?
答: 规模化扩展从未停止,目标仍然是抬高智能上限。我们过去投入过多模态、图像生成和视频生成研究,但这些方向对提高智能上限的帮助有限。因此,我们把重点转向了文本,以及文本与多模态能力相互促进的模型形态。
模型能力正在从回答知识问题转向完成任务,研究重点也相应地从基础问答转向 Coding 和 Cowork。下一代模型将继续沿着这一方向发展。
基座模型会继续扩大,以便更好地存储和表征知识。同时,我们将通过较少激活参数量与循环机制相结合等方式,增加推理深度,避免数万亿参数模型因为激活参数过多而变得过慢、过于昂贵。
除了扩大基座模型规模,后训练也将显著加强。我们将同时运用技术与工程手段,缩小国内算力约束相较 OpenAI、Anthropic 等海外公司造成的差距。
13. 为什么数据环境和后训练是 GLM-5.3 提升的重要来源?
答: 大约在 2022 年 ChatGPT 发布的时候,智谱就已经建立了一支数百人的数据标注团队,并长期投入数据与训练环境建设。
GLM-5.3 相比 GLM-5.2 大幅提升的一个重要原因,是其数据环境规模扩大了数十倍。未来,我们将继续扩大数据和环境规模。
互联网上新增文本数据的数量正在逐渐减少,而合成数据占比正在上升。因此,除了增加基座模型参数,更重要的是构建可验证的数据环境和真实任务环境,让模型在后训练阶段持续获得有效反馈。
14. GLM-6.0 所设想的全自主训练是什么?
答: 全自主训练(Fully Self-Training)对应的是具备自我演进能力的模型,海外也常称之为 RSI。目标是让模型在预训练、中期训练和后训练阶段,更多地自行开展训练与自我演进。
最大的挑战并不只是把模型做得更大,或继续训练,而是让模型能够评估自身、知道何时停止,并在犯错时自主纠正。
全自主训练将成为未来模型研究的重要方向。伦理与社会治理也将被纳入模型演进过程。
15. 为什么目前在参数规模上相对克制?
答: 模型规模的选择,必须考虑资源、模型目标,以及用户何时能够真正用上模型。国内可用训练数据的规模通常在 30 万亿至 50 万亿 Token 左右。在这样的数据规模下,按照缩放定律盲目训练特别大的模型,未必能够获得足够高的边际回报。
国内算力有限,而中期训练和后训练的潜力尚未充分释放。因此,单纯增加参数并不是现阶段最重要的投入方向。
GLM-5.3 所基于的 7450 亿参数基座模型,在年初就已完成训练,并从一开始就计划复用半年以上。在同一个基座上,我们陆续推进了 GLM-5.1、5.2 和 5.3,以及相应的监督微调(SFT)、中期训练和后训练环境建设。
基本思路是,尽可能挖掘每一个基座模型的能力,同时将推理成本优化到用户真正能够大规模负担的水平,而不只是追求一个无法部署的大模型。
16. 下一代基座模型及其推理部署将如何规划?
答: 下一代大型基座模型已经在推进,但具体参数量尚未披露。在新基座之上,也将系统规划中期训练和后训练。
推理研究与工程工作已经提前启动。目标是让下一代模型从发布第一天起,就能够支撑完整规模的用户需求,而不是上线后再花很长时间进行工程适配。
下一代模型的一项重要设计约束仍然是:模型开源之后,企业应该能够直接安装和使用;同时,公司自身也应该能够依靠低推理成本,支撑大规模使用。
译注
- 姓名: 原稿分别使用了
Liu Debing和Liu Debin,另有Tang Jie、Xiao Lei。译文按各段原稿拼写保留,未在缺少中文姓名来源的情况下自行统一或补写。 - 专名与单位:
Fable5、GPT-5.6 SOLO、OX、Aux Offer以及30 TG均按原稿保留;30 TG的单位含义未作推定。原稿分别出现Infra Agent与Infer Agent、ExploitGym与ExploitBench,译文没有自行合并为同一名称。 - 用户分档: 原稿将年化贡献“超过”各门槛的数量依次列为 115、25、37、8、2、2,但这些数量不符合累计门槛应有的单调关系。译文保留原始表述,未将其擅自改为互斥区间。
- 统计表述: 原稿对六天 Token 用量分别使用“超过 62 万亿”和“约 60 万亿”;对前十大用户用量,发言部分写“达到年初的 98 倍”,问答部分写“较年初增长约 98 倍”。译文分别保留。亏损率“收窄了 4.7 倍/3.5 倍”等表述亦照原稿翻译,未换算为百分比。
- 相对时间与换算: “今年”“上月底”“未来三到六个月”等相对时间均沿用发言视角。美元折算金额照录原稿,不按本文发布日期汇率重新计算。