GLM-5:从 vibe coding 到 agentic engineering
本文译自 Zhipu AI 与清华大学的 GLM-5: from Vibe Coding to Agentic Engineering1,2026 年 2 月 17 日提交于 arXiv(v2 为 2 月 24 日),40 页 15 图 13 表。这里是全文翻译,覆盖摘要、§1 引言、§2 预训练、§3 后训练、§4 Agentic Engineering、§5 国产芯片适配、§6 评测、§7 结论、§8 彩蛋,以及附录 A 超参和附录 B 评测细节。§9 贡献者名单与致谢中的合作方名录不在译文范围内。
摘要
我们提出 GLM-5,一个把 vibe coding 范式推进到 agentic engineering 的新一代基础模型。在前代 agentic、reasoning、coding(ARC)能力的基础上,GLM-5 采用 DSA 大幅降低训练与推理成本,同时保持长上下文保真度。为推进模型对齐与自主性,我们实现了一套新的异步强化学习基础设施,通过把生成与训练解耦,显著提升后训练效率。我们还提出了新的异步 agent RL 算法,进一步提升 RL 质量,让模型能更有效地从复杂的长程交互中学习。凭借这些创新,GLM-5 在主流开放 benchmark 上取得 state-of-the-art 表现。最关键的是,GLM-5 在真实世界编码任务上展现出前所未有的能力,在端到端软件工程挑战上超越了此前的 baseline。代码、模型与更多信息见 https://github.com/zai-org/GLM-52。
1 引言
追求通用人工智能(AGI)不仅需要扩大模型参数规模,还需要从根本上重新思考智能的效率与自主改进的架构。随着 GLM-4.5 的发布,我们证明了把 agentic、reasoning、coding(ARC)能力统一到单一 MoE(Model-of-Experts)架构中,可以在多样 benchmark 上取得 state-of-the-art 结果。然而,随着大语言模型(LLM)从被动的知识库转向主动的问题求解者,计算成本与真实世界适应性这对双重挑战——尤其是在复杂软件工程中——已成为主要瓶颈。
我们提出 GLM-5,我们的新一代旗舰模型,专为突破这些障碍而设计。GLM-5 在性能与效率两方面都代表了范式转变,在主流公开榜单上取得 state-of-the-art 地位,包括 ArtificialAnalysis.ai、LMArena Text 与 LMArena Code。更重要的是,GLM-5 重新定义了真实世界编码的标准,展现出处理复杂端到端软件开发任务的前所未有的能力,其范围远超 SWE-bench 这类传统静态 benchmark。
结果。
图 1 展示了 GLM-5、GLM-4.7、Claude Opus 4.5、Gemini 3 Pro 与 GPT-5.2 (xhigh) 在 8 个 agentic、reasoning、coding benchmark 上的结果:Humanity’s Last Exam3、SWE-bench Verified4、SWE-bench Multilingual5、Terminal-Bench 2.06、BrowseComp7、MCP-Atlas8、$\tau^{2}$-Bench910、Vending Bench 211。平均而言,GLM-5 相比上一版 GLM-4.7 提升约 20%,与 Claude Opus 4.5 和 GPT-5.2 (xhigh) 相当,优于 Gemini 3 Pro。
GLM-5 在 Intelligence Index v4.012 上得分 50,成为新的开放权重领跑者(参见图 2),高于 GLM-4.7 的 42 分——这 8 分的跃升来自 agentic 表现与知识/幻觉两方面的改进。这是开放权重模型首次在 Artificial Analysis Intelligence Index v4.0 上达到 50 分。
LMArena 由 UC Berkeley 发起,是一个透明的共享空间,用数百万真实任务、以人类判断来评测和比较前沿 AI 能力,任务涵盖写作、编码、推理、设计、搜索与创作。大量人类交互产生的信号反映了真实世界效用,这使它区别于其他静态 benchmark。图 3 显示 GLM-5 再次成为 Text Arena 与 Code Arena 双榜的第一名开放模型,整体上与 Claude-Opus-4.5 和 Gemini-3-pro 相当。
agent 的长期一致性正变得越来越重要。coding agent 现在已经能自主写代码数小时,AI 模型能完成的任务在时长和广度上都还会继续增长。我们用 Vending-Bench 2 与 CC-Bench-V2 两个 benchmark 来评测 GLM-5 完成长程任务的能力。Vending-Bench 2 衡量 AI 模型在长时间跨度上经营一门生意的表现:模型要在模拟环境中经营一年的自动售货机生意,以期末银行账户余额计分。图 4(左)显示 GLM-5 在所有开源模型中排名第一,最终账户余额为 4,432 美元,逼近 Claude Opus 4.5,展现出很强的长期规划与资源管理能力。图 4(右)进一步给出我们内部评测套件 CC-Bench-V2 上的结果:GLM-5 在前端、后端与长程任务上都显著优于 GLM-4.7,缩小了与 Claude Opus 4.5 的差距。
方法。
图 5 展示了 GLM-5 的整体训练流程。基座模型训练从 27 万亿 token 的庞大语料开始,早期就优先投入代码与推理数据。随后我们用一个独立的 mid-training 阶段把上下文长度从 4K 逐步扩展到 200K,专门针对长上下文 agentic 数据,以确保复杂工作流中的稳定性。在后训练阶段,我们超越了标准 SFT,实现了一条顺序执行的强化学习流水线——先 Reasoning RL,再 Agentic RL,最后 General RL。关键在于我们在整个过程中使用 On-Policy Cross-Stage Distillation 来防止灾难性遗忘,保证模型在成为稳健通才的同时保持锐利的推理能力。总结起来,GLM-5 性能上的跃升由以下技术贡献驱动:
第一,我们采用 DSA(DeepSeek Sparse Attention)13,这一架构创新显著降低了训练与推理成本。GLM-4.5 通过标准 MoE 架构提升效率,而 DSA 让 GLM-5 可以按 token 重要性动态分配注意力资源,在不牺牲长上下文理解与推理深度的前提下大幅降低计算开销。有了 DSA,我们把模型参数量扩展到 744B,训练 token 预算扩展到 28.5T。
第二,我们打造了一套新的异步强化学习基础设施。在 GLM-4.5 中引入的 slime 框架和解耦 rollout 引擎的基础上,新基础设施进一步把生成与训练解耦,以最大化 GPU 利用率。这套系统允许大规模探索 agent 轨迹,而不受此前拖慢迭代速度的同步瓶颈限制,显著提升了 RL 后训练流水线的效率。
第三,我们提出了新的异步 Agent RL 算法,用于提升自主决策的质量。在 GLM-4.5 中我们用迭代自蒸馏和结果监督来训练 agent。对 GLM-5,我们开发了异步算法,让模型能持续从多样的长程交互中学习。这些算法专门针对动态环境中的规划与自我纠错能力做了优化,直接促成了我们在真实世界编码场景中的领先。
最后,还有一项技术贡献在于:从第一天起,GLM-5 就完成了对国产 GPU 生态的全栈适配。我们在包括华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、沐曦、燧原在内的七个主流国产芯片平台上,完成了从底层算子到上层推理框架的深度优化。
有了这些进展,GLM-5 不只是一个更强的模型,更是下一代 AI agent 的一个更高效、更实用的底座。我们把 GLM-5 发布给社区,以进一步推进高效 agentic 通用智能的前沿。
2 预训练
与 GLM-4.5 类似,GLM-5 的基座模型经历两个阶段:面向通用语言与编码能力的预训练,以及面向 agentic 与长上下文能力的 mid-training。我们扩大了 GLM-5 所有训练阶段的 token 预算,基座模型总计 28.5 万亿 token。
2.1 架构
模型规模扩展。
GLM-5 扩展到 256 个专家,并把层数减少到 80,以最小化专家并行的通信开销。这带来一个 744B 参数(40B 激活参数)的模型,总规模是 GLM-4.5(355B 总参数、32B 激活参数)的两倍。
表 1:GQA-8 与若干 MLA 变体的评测结果。
| 数据集 | Hellaswag | MMLU | C-Eval | RACE | BBH | GSM8K | HumanEval |
|---|---|---|---|---|---|---|---|
| GQA-8 | 77.3 | 61.2 | 60.0 | 79.6 | 53.3 | 47.6 | 38.5 |
| MLA | 77.3 | 61.5 | 59.7 | 77.8 | 48.9 | 46.2 | 33.5 |
| MLA + Muon Split | 77.8 | 62.5 | 62.1 | 79.9 | 51.8 | 45.0 | 36.7 |
| MLA-256 + Muon Split | 77.4 | 62.0 | 59.9 | 79.6 | 51.3 | 47.5 | 36.6 |
Multi-latent Attention。
通过使用降维的 key-value 向量, Multi-latent attention(MLA)14 在效果上匹配 Grouped-Query Attention(GQA),同时在 GPU 显存节省和长上下文序列处理速度上更优。
然而,在我们用 Muon 优化器做的实验里,576 维 latent KV-cache 的 MLA 无法匹配 8 个 query group 的 GQA(记作 GQA-8,2048 维 KV-cache)的表现。为弥补这一性能差距,我们对 GLM-4.5 中的 Muon 优化器配方做了改造。原配方中,我们对多头 query、key、value 的上投影矩阵 $W^{UQ},W^{UK},W^{UV}$ 施加矩阵正交化。改造后我们把这些矩阵按不同 head 拆分成更小的矩阵,再对这些独立矩阵施加矩阵正交化。这个方法记作 Muon Split,它让不同注意力头的投影权重能以不同尺度更新。如表 1 所示,该方法有效地把 MLA 的表现提升到与 GQA-8 相当的水平。实践中我们还发现,有了 Muon Split,GLM-5 的 attention logits 尺度在预训练全程都保持稳定,无需任何 clipping 策略。
MLA 的另一个劣势是解码时的高计算成本。解码时 MLA 要做 576 维点积,高于 GQA 的 128 维计算。DeepSeek-V3 的注意力头数是按 H800 的 roofline 选定的15,这对其他硬件并不合适。考虑到 MLA 在训练和 prefill 阶段是 Multi-head Attention(MHA)形态,我们把 head 维度从 192 增加到 256,并把注意力头数减少 1/3。这保持了训练计算量和参数量不变,同时降低了解码计算量。这个变体在表 1 中记作 MLA-256,在 Muon Split 下与 MLA 表现相当。
表 2:DeepSeek-V3.2 与 GLM-5 的接受长度对比。
| 模型 | 接受长度 |
|---|---|
| DeepSeek-V3.2 | 2.55 |
| GLM-5 | 2.76 |
参数共享的 Multi-token Prediction。
Multi-token prediction(MTP)1617 能提升基座模型性能,并作为 speculative decoding 的 draft 模型18。但训练时要预测接下来 $n$ 个 token 就需要 $n$ 个 MTP 层,于是 MTP 参数和 kv cache 的显存占用会随投机步数线性增长。DeepSeek-V3 的做法是只用单个 MTP 层训练,推理时预测接下来 2 个 token,这种训练-推理差异降低了第二个 token 的接受率。为此我们提出在训练时共享 3 个 MTP 层的参数:这让 draft 模型的显存成本与 DeepSeek-V3 持平,同时提升接受率。表 2 显示,在我们的私有 prompt 集上、给定相同投机步数(4)时,GLM-5 的接受长度比 DeepSeek-V3.2 更长。
2.1.1 用 DeepSeek Sparse Attention(DSA)继续预训练
表 3:MLA 与 DSA 基座模型在长上下文 benchmark 上的对比。
| MQ-NIAH-128k | MV-NIAH-128k | SQuAD-128k | HotpotQA-128k | |
|---|---|---|---|---|
| MLA | 100.0 | 95.5 | 79.7 | 66.3 |
| DSA | 100.0 | 97.0 | 86.0 | 63.0 |
我们在训练中使用 DSA。DSA13 的核心理念是用一个动态的、细粒度的选择机制,替换掉在 $128\text{K}$ 上下文下代价高到无法承受的传统稠密 $O(L^{2})$ 注意力。与滑动窗口这类固定模式不同,DSA 会「看」内容来决定哪些 token 重要。从研究者视角看,DSA 特别有意思的一点是它是通过从稠密基座模型继续预训练引入的,这避免了从零训练的「天文数字」成本。这一转换遵循「稠密 warm-up 加稀疏训练适配」的两阶段策略。DeepSeek-V3.2-Exp 保持了与其稠密前身相同的 benchmark 表现,证明长上下文中 90% 的注意力条目确实是冗余的。DSA 对长序列的注意力计算量降低约 1.5-2 倍,这对我们正在构建的推理密集型 agent 非常重要——能以一半的 GPU 成本处理 128K 上下文。
DSA 训练从 mid-training 结束时的基座模型开始。warm-up 阶段走 1000 步,每步训练 14 条 202,752 token 的序列,最大学习率 5e-3。稀疏适配阶段沿用 mid-training 的训练数据与超参,走 20B token。虽然训练预算远小于 DeepSeek-V3.2(943.7B token),我们发现这已足够让 DSA 模型适配到与原始 MLA 模型相当的表现。如表 3 所示,DSA 模型的长上下文表现接近 MLA 模型。为进一步验证 DSA 训练的有效性,我们用相同的 SFT 数据分别微调 DSA 与 MLA 模型,发现两者在训练 loss 与评测 benchmark 上打平。
2.1.2 高效注意力变体的消融研究
除 DSA13 之外,我们还基于 GLM-9B19 探索了若干替代性的高效注意力机制。该 baseline 在全部 40 层都使用 group query attention,并已在 128K token 上下文窗口下微调过。我们评测了以下方法:
- Sliding Window Attention(SWA)Interleave:全注意力层与窗口注意力层按固定交替模式在全网络均匀排布。
- Gated DeltaNet(GDN)20:一种线性注意力变体,用带门控的线性递归替代二次复杂度的 softmax 注意力计算,把注意力的计算成本从序列长度的二次降到线性。
在这些 baseline 之上,我们提出两项改进:
- SWA Pattern(基于搜索):受 PostNAS21 启发,我们引入一种基于搜索的适配方法,找出最适合转成 SWA 的层子集,其余层保留全注意力。我们用 beam search 策略确定在长上下文下游任务上表现最优的配置。为降低计算成本,我们只在 16K 上下文长度下做搜索,再把得到的 pattern 泛化到其他所有输入长度。具体来说,beam size 取 8,每步优化两层;对 GLM-9B(40 层)而言大约 10 步收敛。每步在 16K 上下文长度下用 RULER benchmark22 评测候选 pattern,保留 top-8 候选进入下一步。最终得到的 pattern 是
SFSSFFSSSFFFFSSFSFFFFFFSFSFSSFSSFSFSSFSSS,其中 S 与 F 分别表示 SWA 层与全注意力层。如表 4 所示,这个基于搜索的配置显著优于固定交替方案。值得注意的是,尽管只在 16K 下优化,该 pattern 展现出稳健的长度泛化能力,在所有测试的上下文长度上都保持有效。 - SimpleGDN:一种极简线性化策略,为最大化复用预训练权重而设计,在持续训练适配上改进了 GDN。我们完全移除 Conv1d 与显式门控模块,直接把预训练的 Query、Key、Value 投影权重映射进线性递归形式。这一简化免去了额外参数,同时保留了线性注意力的效率优势。
表 4:GLM-9B baseline 与两个 SWA 变体在 RULER benchmark 上的结果,未经任何额外训练。两个 SWA 方法都采用全注意力层与 SWA 层 1:1 的比例、4096 token 窗口大小。基于搜索的 SWA pattern 只在 16k 上下文长度下搜索一次,然后统一应用到所有输入长度。
| 4K | 8K | 16K | 32K | 64K | 128K | |
|---|---|---|---|---|---|---|
| GLM-9B(全注意力) | 95.19 | 93.67 | 92.01 | 91.09 | 85.35 | 75.28 |
| SWA Interleave | 94.87 | 54.02 | 25.89 | 12.61 | 8.32 | 6.51 |
| SWA Pattern | 95.78 | 92.54 | 88.92 | 82.52 | 70.23 | 53.95 |
我们在四个长上下文 benchmark 上评测所有方法:RULER22、MRCR23、HELMET-ICL24 与 RepoQA25。结果汇总于表 5。我们对每个方法在 64K 上下文长度下持续训练 190B token,保持高效注意力层与全注意力层 1:1 的比例。对 GDN 与 SimpleGDN 方法,我们沿用 Jet-Nemotron21 的流水线。
表 5:长上下文 benchmark 结果。所有高效注意力变体都从 GLM-9B 全注意力 baseline 持续训练而来。SWA pattern 表示基于搜索的层选择,SWA interleave 表示固定交替模式。Δ@64K 与 Δ@128K 分别表示在 64K 与 128K 上下文长度下相对全注意力 baseline 的差异。
| RULER (64K / 128K) | MRCR (64K / 128K) | HELMET-ICL (64K / 128K) | RepoQA (64K / 128K) | |
|---|---|---|---|---|
| GLM-9B | 85.35 / 75.28 | 36.53 / 35.39 | 77.68 / 77.36 | 69.00 / 65.83 |
| SWA Interleave | 65.94 / 44.93(↓19.41 / ↓30.35) | 30.03 / 28.83(↓6.50 / ↓6.56) | 75.96 / 63.52(↓1.72 / ↓13.84) | 50.33 / 39.33(↓18.67 / ↓26.50) |
| SWA Pattern | 83.72 / 69.59(↓1.63 / ↓5.69) | 35.02 / 33.58(↓1.51 / ↓1.81) | 76.48 / 74.60(↓1.20 / ↓2.76) | 62.33 / 51.17(↓6.67 / ↓14.66) |
| GDN | 76.76 / 64.00(↓8.59 / ↓11.28) | 31.72 / 30.22(↓4.81 / ↓5.17) | 76.88 / 74.84(↓0.80 / ↓2.52) | 65.50 / 56.17(↓3.50 / ↓9.66) |
| SimpleGDN | 81.76 / 67.03(↓3.59 / ↓8.25) | 33.03 / 31.27(↓3.50 / ↓4.12) | 79.80 / 81.84(↑2.12 / ↑4.48) | 65.50 / 58.50(↓3.50 / ↓7.33) |
表 5 的结果揭示了高效注意力方法之间清晰的权衡层级。朴素交替的滑动窗口注意力(SWA)在长上下文任务上造成灾难性退化(例如 RULER@128K 上 $-$30.35),而基于搜索的层选择通过在最关键的位置保留全注意力,大幅缩小了这一差距。GDN 这类线性注意力变体进一步提升了质量,但代价是引入额外参数;SimpleGDN 通过最大化复用预训练权重,取得了最好的平衡。尽管如此,所有这些方法在细粒度检索任务上都有固有的精度缺口——RULER@128K 上最多 5.69 分、RepoQA@128K 上 7.33 分——原因是高效注意力机制在持续训练适配过程中不可避免地带来信息损失,即使有一半层保留了全注意力也是如此。相比之下,DSA 在构造上是无损的:它的 lightning indexer 实现了 token 级稀疏而不丢弃任何长程依赖,因此可以应用到所有层而没有质量退化。
为验证这一点,我们在带 multi-latent attention 的 GLM-4.7-Flash26 上做了一个小规模 DSA 实验。按标准 DSA 配方,训练分两个阶段:(i) warmup 阶段只训练 indexer 1,000 步(batch size 16),基座模型权重全部冻结;(ii) 联合训练阶段,模型与 indexer 在 150B token 上共同训练。表 6 汇总了 4K 到 128K 各上下文长度下的 RULER 结果。即使是仅 warmup 的变体(GLM-4.7-Flash + DSA warmup)也已保留了绝大部分 baseline 表现,下降幅度不大且集中在最长的上下文窗口(128K:$79.21\to 71.35$),较短上下文几乎不受影响。在完整的 150B token 联合训练阶段之后,GLM-4.7-Flash + DSA 几乎补齐了这一残余差距:它在 16K($+0.86$)、32K($+0.49$)、64K($+1.72$)上超过 baseline,仅在 128K 上有 0.35 分的落后。
表 6:GLM-4.7-Flash 加 DSA 在 RULER benchmark 上的结果。仅 warmup 变体只训练 indexer 并冻结基座模型,完整 DSA 变体则对两者联合训练 150B token。
| 4K | 8K | 16K | 32K | 64K | 128K | |
|---|---|---|---|---|---|---|
| GLM-4.7-Flash | 97.44 | 96.72 | 95.83 | 92.96 | 85.34 | 79.21 |
| GLM-4.7-Flash + DSA warmup | 97.51 | 96.54 | 95.40 | 90.09 | 84.05 | 71.35 |
| GLM-4.7-Flash + DSA | 96.77 | 96.25 | 96.69 | 93.45 | 87.06 | 78.86 |
2.2 预训练数据
Web。
在 GLM-4.5 数据流水线基础上,我们细化了海量 web 数据集的筛选标准。我们引入了另一个基于句向量的 DCLM27 分类器,用来识别并聚合标准分类器之外的额外高质量数据。为应对长尾知识的挑战,我们用一个 World Knowledge 分类器——通过 Wikipedia 条目和 LLM 标注数据优化——从原本中低质量的数据中蒸馏出有价值的信息。
代码。
我们用主流代码托管平台的最新快照和更大规模的含代码网页扩充了代码预训练语料,模糊去重后的唯一 token 数增加了 28%。为提升语料完整性、降低噪声,我们修正了 Software Heritage 代码文件的元数据对齐问题,并采用了更准确的语言分类流水线。我们沿用 GLM-4.5 对源代码和代码相关 web 文档的质量感知采样策略。此外,我们为更广泛的低资源编程语言(如 Scala、Swift、Lua 等)训练了专门的分类器,提升这些语言的采样质量。
数学与科学。
我们从网页、书籍和论文中收集高质量数学与科学数据,以进一步提升推理能力。具体来说,我们优化了网页的内容抽取流水线以及书籍和论文的 PDF 解析机制,以提升数据质量。我们用大语言模型给候选文档打分,只保留最具教学价值的内容。对长上下文文档,我们开发了 chunk-and-aggregate 打分算法来提升打分准确性。我们还执行了过滤流水线,严格避免使用合成、AI 生成或模板化的数据。
2.3 Mid-Training
在 GLM-4.5 引入的 mid-training 框架基础上,GLM-5 同时扩大了训练量与最大上下文长度,以进一步强化模型的推理、长上下文与 agentic 能力。
扩展的上下文与训练规模。
我们分三个阶段逐步扩展上下文窗口:32K(1T token)、128K(500B token)、200K(50B token)。相比 GLM-4.5 的 128K 上限,新增的 200K 阶段显著提升了模型处理超长文档和复杂多文件代码库的能力。长文档与合成 agent 轨迹在后续阶段相应上采样。
软件工程数据。
我们保留了把仓库级代码文件、commit diff、GitHub issue、pull request 和相关源文件拼接成统一训练序列的范式。在 GLM-5 中,我们放宽了仓库级过滤标准以扩大合格仓库池,得到约 1000 万个 issue–PR 对,同时在单个 issue 层面加强质量过滤以降低噪声。我们还为每个 issue–PR 对检索了更大范围的相关文件,从而得到更丰富的开发上下文和更广的真实软件工程场景覆盖。过滤后,数据集的 issue–PR 部分约含 160B 唯一 token。
长上下文数据。
我们的长上下文训练集包含自然数据与合成数据。自然数据来自书籍、学术论文以及通用预训练语料中的文档,经多阶段过滤(PPL、去重、长度)并对知识密集领域上采样。在合成数据构造上,受 NextLong28 与 EntropyLong29 启发,我们用多种技术来构建长程依赖:把高度相似的文本通过交错 packing 聚合成序列,以缓解 lost-in-the-middle 现象,并提升一系列长上下文任务的表现。在 200K 阶段,我们额外加入了一小部分类 MRCR 数据,并设计了多个变体来扩展 OpenAI 的原始范式,以强化超长多轮对话中的召回能力。经验上我们发现,提升数据多样性会持续增强模型的长上下文表现;值得注意的是,在 128K 阶段之后再做一个 200K 的 mid-training 阶段,能进一步提升模型在 128K 上下文窗口内的表现。
2.4 训练基础设施
2.4.1 显存效率
灵活的 MTP 放置。 在交错 pipeline 并行30 下,模型组件被灵活分配到各个 stage。MTP 模块横跨 embedding、transformer 与 output 三类组件,其显存占用远高于其他模块,导致 stage 级别的不均衡。我们把 MTP 的 output 层与主 output 层共置在最后一个 stage 以实现参数共享,而把它的 embedding 与 transformer 组件放在前一个 stage。这降低了最后一个 stage 的显存压力,改善了各 pipeline rank 之间的均衡。
Pipeline ZeRO2 梯度分片。 每个 pipeline rank 维护多个 stage30,朴素做法下每个 stage 都需要一份完整的梯度 buffer 用于累积和优化器更新。受 ZeRO231 启发,我们把梯度在数据并行 rank 之间分片,使每个 stage 只存 1/dp 的完整梯度。此外,我们同时只为两个 stage 保留完整累积 buffer,并通过双缓冲复用:当一个 stage buffer 在连续 microbatch 上累积梯度时,上一个 stage buffer 的梯度同步并行进行。这把常驻梯度显存降到「每 stage 分片 buffer 加两个用于滚动累积的完整 buffer」,实践中没有额外同步开销。
Muon 分布式优化器的零冗余通信。 朴素的 Muon 实现会在每个数据并行 rank 上 all-gather 完整模型参数,造成瞬时显存尖峰和冗余通信。我们把 all-gather 限制在每个 rank 拥有的参数分片上,并让本地计算与分片通信重叠。这消除了冗余通信,显著降低了优化器相关的峰值显存开销。
Pipeline 激活值 offload。 在 pipeline warmup 阶段,前向执行会跑在反向传播之前,延长了中间激活值的生命周期。我们在前向执行后把激活值 offload 到主机内存,在反向执行前再加载回来32。offload 以层为粒度进行,以进一步降低峰值显存。结合细粒度重计算,这基本消除了让激活值常驻 GPU 显存的需要。offload 与 reload 被调度成与计算重叠,同时避免与点对点通信、MoE token 路由(dispatch 与 combine)争用资源。这在近乎零开销的前提下大幅降低了激活值显存占用。
序列分块的 output projection 以降低峰值显存。 output projection 与交叉熵 loss 会因为要存反向传播用的激活值、以及在 loss 计算中提升到更高精度,产生瞬时显存开销。为降低这一开销,我们把输入序列切成更小的 chunk,在每个 chunk 上独立计算 projection 与 loss,完成前向与反向后即释放激活值,再处理下一个 chunk。于是峰值显存随 chunk 数增加而下降。在合适的 chunk 数下,这个方法缓解了 output 层的显存压力,同时保持了与不分块执行相当的性能。
2.4.2 并行效率
高效的延迟权重梯度计算。 为减少 pipeline bubble,我们把关键路径上的部分权重梯度计算延后33。细粒度延迟配合优化过的存储与通信重叠,在保持显存开销有界的同时提升了吞吐。
高效的长序列训练。 更长的序列会加剧数据并行组和 pipeline 并行组之间的负载不均。我们通过负载感知的序列重排、注意力计算的动态重分配,以及把数据并行 rank 灵活切分成不同大小的 context 并行组来解决3435。一个分层 all-to-all 让 QKV 张量的节点内与节点间通信重叠,以降低延迟。
2.4.3 INT4 量化感知训练
为在低精度下提供更好的精度,我们在 SFT 阶段应用 INT4 QAT。此外,为进一步减小训练时间开销,我们开发了一个同时适用于训练和离线权重量化的量化 kernel,它保证训练与推理之间行为逐位一致。
3 后训练
GLM-5 的后训练阶段旨在把基座模型转变为具备稳健推理、编码与 agentic 能力的高能力助手。如图 5 所示,我们的流水线遵循渐进式对齐策略:先做引入复杂交错思考模式的多任务监督微调(SFT),然后是面向推理与 agentic 任务的专门强化学习(RL)阶段,最后以一个面向人类风格对齐的 general RL 阶段收尾。通过把 on-policy cross-stage distillation 作为最终精修手段,GLM-5 在收获每个训练阶段性能增益的同时,有效缓解了能力回退。
3.1 监督微调
相比 GLM-4.5,GLM-5 在 SFT 阶段显著扩大了 Agent 与 Coding 数据的规模。GLM-5 的 SFT 语料涵盖三大类:
- General Chat:问答、写作、角色扮演、翻译、多轮对话与长上下文交互;
- Reasoning:数学、编程与科学推理;
- Coding & Agent:前后端工程代码、工具调用、coding agent、search agent 与通用 agent。
此外,GLM-5 在 SFT 阶段把最大上下文长度扩展到 202,752 token。配合更新后的 chat template,模型支持三种不同的思考特性(见图 7):
- Interleaved Thinking:模型在每次回复和每次工具调用前都思考,提升指令遵循与生成质量36。
- Preserved Thinking:在 coding agent 场景中,模型自动在多轮对话间保留所有 thinking block,复用已有推理而不是从头重新推导。这减少了信息损失与前后不一致,很适合长程复杂任务37。
- Turn-level Thinking:模型支持在一个会话内按轮控制是否推理——对轻量请求关闭思考以降低延迟和成本,对复杂任务开启以提升准确性与稳定性。
通过在动作之间思考、并在多轮之间保持一致性,GLM-5 在复杂任务上取得了更稳定、更可控的行为。
对 General Chat,我们把回复风格优化得比 GLM-4.5 更有逻辑、更简洁。对角色扮演任务,我们收集并构造了覆盖多语言、多角色配置的更广更多样的数据集。特别地,我们定义了若干评估维度——包括指令遵循、语言表现力、创造力、逻辑连贯性与长对话一致性——并用自动与人工双重筛选来整理和精修数据。
对 Reasoning 任务,我们进一步强化模型推理的深度。具体来说,对逻辑推理,我们构造可验证问题并用拒绝采样合成高质量数据。对数学与科学问题,我们施加基于难度的过滤,只保留对 GLM-4.7 模型有挑战性的问题。
对 Coding 与 Agent 任务,相比 GLM-4.5,GLM-5 构建了大量执行环境来获取高质量轨迹,特别侧重真实世界场景与长程任务。我们还用专家强化学习和拒绝采样进一步改进 SFT 数据。轨迹中的错误片段被保留,但在损失函数中被 mask 掉,让模型学会纠错行为而不强化错误动作。
3.2 Reasoning RL
RL 算法骨架。
我们的 RL 算法建立在 GRPO38 之上,并引入 IcePop 技术39 来缓解 训练-推理 mismatch,即 RL 优化过程中推理分布与训练分布之间的差异。我们显式区分用于梯度更新的训练策略 $\pi^{\text{train}}$ 与用于轨迹采样的推理策略 $\pi^{\text{infer}}$。相比原始 IcePop formulation,我们移除了 KL 正则项以加速 RL 提升。最终的优化损失为:
$$ \begin{aligned} \mathcal{L}(\theta)= -\mathbb{E}_{ x \sim \mathcal{D}, \{y_i\}_{i=1}^{G} \sim \pi^{\text{infer}}_{\theta_{\text{old}}}(\cdot \mid x) } &\Bigg[ \frac{1}{G} \sum_{i=1}^{G} \frac{1}{|y_i|} \sum_{t=1}^{|y_i|} \operatorname{pop} (\rho_{i,t}, 1/\beta, \beta) \\ &\cdot \min\!\left( r_{i,t}\hat{A}_{i,t}, \operatorname{clip}\!\left( r_{i,t}, 1-\epsilon_{\text{low}}, 1+\epsilon_{\text{high}} \right) \hat{A}_{i,t} \right) \Bigg], \end{aligned} \tag{1} $$其中训练-推理 mismatch 比值定义为
$$ \rho_{i,t}
\frac{ \pi_{\theta_{\text{old}}}^{\text{train}}(y_{i,t} \mid x, y_{i,<t}) }{ \pi_{\theta_{\text{old}}}^{\text{infer}}(y_{i,t} \mid x, y_{i,<t}) }. $$
算子 $\operatorname{pop}(\cdot)$ 抑制那些 mismatch 比值偏离过大的样本:
$$ \operatorname{pop}(\rho_{i,t}, 1/\beta, \beta)
\begin{cases} \rho_{i,t}, & 1/\beta \le \rho_{i,t} \le \beta, \ 0, & \text{otherwise}. \end{cases} $$
PPO 式重要性比值与组内归一化优势沿用原始 GRPO 定义:
$$ r_{i,t}
\frac{ \pi_\theta^{\text{train}}(y_{i,t}\mid x,y_{i,<t}) }{ \pi_{\theta_{\text{old}}}^{\text{train}}(y_{i,t}\mid x,y_{i,<t}) }, \quad \hat{A}_{i,t}
\frac{ R_i - \operatorname{mean}(R_1,\dots,R_G) }{ \operatorname{std}(R_1,\dots,R_G) }. $$
训练中我们设超参 $\beta=2, \epsilon_{\text{low}}=0.2, \epsilon_{\text{high}}=0.28$。训练完全 on-policy,group size 32、batch size 32。
DSA RL 的经验。
我们在基于 DSA 架构的模型上做了非常大规模的 RL 训练。相比 MLA,DSA 引入了一个额外的 indexer,用来检索 top-k 个最相关的 key-value 条目,并只在检索到的子集上稀疏地计算注意力。检索出的 top-k 结果对 RL 稳定性至关重要。这类似于 MoE 模型用 routing replay40 保留激活的 top-k 专家来确保训练-推理一致性。然而直接把这一策略搬到 indexer replay,也就是在每个 token 位置存储 indexer 的 top-k 索引,显然不切实际,因为 indexer 用的 $k = 2048$ 远大于 MoE 中常用的 $k$,存下所有这些索引会带来巨大的存储成本,以及训练引擎与推理引擎之间的可观通信开销。
我们发现采用确定性的 top-k 算子能有效解决 DSA indexer token 选择中的训练-推理 mismatch。相比 SGLang 的 DSA Indexer 所用的非确定性 CUDA top-k 实现,直接用朴素的 torch.topk 稍慢但是确定性的,它产生更一致的输出,并带来可观的 RL 收益。相反,其他非确定性 top-k 算子(例如 CUDA 或 TileLang 实现)会让 RL 在几步之后就急剧退化,并伴随熵的骤降。因此在我们所有 RL 阶段中,训练引擎里 DSA Indexer 的默认 top-k 算子都用 torch.topk。我们还默认在 RL 期间冻结 indexer 参数,以加速训练并避免 indexer 学习不稳定。
混合领域 reasoning RL。
在 Reasoning RL 阶段,我们在四个领域上做混合 RL 训练:数学、科学、代码和工具集成推理(TIR)。对数学与科学,我们从开源数据集4142 以及与外部标注供应商共建的数据集中整理数据。我们进一步施加难度过滤,把训练聚焦在 GLM-4.7 只能偶尔做对或持续做错、但更强的 teacher 模型(如 GPT-5.2 xhigh 与 Gemini 3 Pro Preview)仍能解出的问题上。对代码,我们同时覆盖竞赛编程风格任务和科学编程任务:前者主要来自 Codeforces 以及 TACO43 和 SYNTHETIC-2-RL44 等代表性数据集,后者则从内部题库构造,把问题分解成得到正确解所需的最小代码实现。对 TIR,我们复用数学与科学 RL 数据中更难的子集,并额外与标注供应商共建了明确设计为需借助外部工具回答的 STEM 问题。RL 训练中我们为不同领域和来源分配专门的 judge 模型或评测系统来产生二值结果奖励。我们让整体混合比例在四个领域间大致均衡,并持续观察到每个领域在混合 RL 设置下都有稳定且显著的提升。
3.3 Agentic RL
为提升 GLM-5 的 agentic 表现,我们开发了一套完全异步、解耦的 RL 框架,并在 coding 与 search agent 任务上优化 GLM-5。朴素的同步 RL 在长程 agent rollout 期间会有严重的 GPU 空闲。通过一个中心化的 Multi-Task Rollout Orchestrator 把推理引擎与训练引擎解耦,我们在多样 agentic 负载上实现了高吞吐的联合训练。
为在异步 off-policy 条件下维持训练稳定性,我们引入两项关键机制。第一, Token-in-Token-out(TITO)网关通过保留精确的动作级对应关系,消除重新分词造成的 mismatch。第二,我们采用 Direct Double-sided Importance Sampling,对 rollout 对数概率施加 token 级 clipping 机制($[1-\epsilon_\ell, 1+\epsilon_h]$),在不追踪历史策略 checkpoint 的前提下高效控制 off-policy 偏差。我们还采用 DP-aware routing,为大规模 MoE 模型的长上下文推理最大化 KV-cache 复用以提速。在 agentic 环境扩展上,我们把可验证训练环境扩展到三个领域:超过 1 万个真实世界软件工程(SWE)环境、终端任务,以及高难度多跳搜索任务。关于 agentic RL 的更多细节见后文 §4。
3.4 General RL
多维优化目标。
我们把 General RL 的优化目标分解成三个互补维度:基础正确性、情商与任务特定质量。
基础正确性维度是回复质量的基石。它针对一大类损害模型输出可用性的错误类型,包括指令遵循失败、逻辑不一致、事实不准确、知识幻觉与语言不流畅。目标是把错误率降到最低,让回复达到可用的基线。我们认为这是所有后续优化的前提:一条包含事实错误或误解用户意图的回复,无论表面多么精致,都会主动误导用户。
情商维度在核心正确性之外优化用户体验。它的目标是产生有共情、有洞察、风格上贴近自然人类沟通的回复,让与模型的交互更自然、更有吸引力。
任务特定质量维度针对各类具体任务做细粒度优化。在基础正确性建立的可用性之上,它的目标是把每个任务类别下的回复从「仅仅正确」提升到「真正高质量」。这一维度覆盖写作、文本处理、主观与客观问答、角色扮演、翻译等广泛任务。每个任务领域需要不同的奖励信号,因此需要一套混合奖励系统。
混合奖励系统。
为监督上述多样目标,我们构建了一套混合奖励系统,集成三类互补的奖励信号:规则型奖励函数、结果奖励模型(ORM)与生成式奖励模型(GRM)。每一类都有各自的长短处,它们的组合是 General RL 训练稳定、高效、可扩展的关键。
规则型奖励提供精确、可解释的信号,但只限于能用确定性规则表达的方面。ORM 提供低方差信号与高训练效率,但更容易被 reward hacking——策略去利用表层模式而不是真正提升核心能力。GRM 借助语言模型产生标量或结构化评价,对这类利用更稳健,但方差往往更高。把这三类信号混合,我们得到一个在精确性、效率与稳健性之间取得平衡的 奖励系统,缓解了任何单一组件的弱点。
人在环中的风格对齐。
我们 General RL 流水线的一个鲜明特点是显式纳入高质量的人写回复。我们不只依赖模型生成的回复,而是把专家人写回复作为风格与质量上的锚点。这样做的动因是我们观察到:纯粹依赖模型生成的优化倾向于收敛到可辨识的「模型味」模式——往往冗长、公式化,或缺乏熟练人类写作的细腻。通过让模型接触人写范例,我们鼓励它采纳更自然、更贴近人类的回复模式。
3.5 On-Policy Cross-Stage Distillation
在我们的多阶段 RL 流水线中,依次针对不同目标做优化可能导致此前获得的能力累积退化。为缓解这一问题,我们把 on-policy cross-stage distillation 作为最后一个阶段,采用 on-policy 蒸馏算法45464748 来迅速恢复早前 SFT 与 RL 阶段(Reasoning RL 与 General RL)习得的技能。具体来说,前序训练阶段的最终 checkpoint 充当 teacher 模型,训练 prompt 从相应 teacher 的 RL 训练集中采样并按合适比例混合。训练损失可以通过把式 (1) 中的优势项替换为下式得到(‘sg’ 表示停止梯度操作,例如 .detach()):
3.6 RL 训练基础设施:slime 框架
我们继续用 slime 作为 GLM-5 的统一后训练基础设施,支撑端到端的大规模强化学习(RL)。GLM-5 并没有引入新的系统组件,而是充分利用 slime 的既有能力来做到三件事:(1) 通过自由形式的 rollout 定制和服务化执行模型拓宽任务覆盖;(2) 通过混合精度训练/rollout,配合 MTP 与 Prefill-Decode(PD)分离大幅提升吞吐——尤其是多轮 RL 负载;(3) 通过心跳驱动的 rollout 容错和 router 级的服务生命周期管理提升鲁棒性。
3.6.1 横向扩展:通过高度可定制的 rollout 实现灵活训练
GLM-5 的后训练横跨多样的目标谱系。为在不给每个任务开分支的情况下支持这种多样性,GLM-5 利用了 slime 高度可定制的 rollout 接口以及它的服务化 rollout 执行。
高度可定制的 rollout。 slime 提供了灵活的接口来实现任务特定的 rollout 逻辑——包括多轮交互循环、工具调用、环境反馈处理和 verifier 引导的分支——而无需修改底层基础设施。GLM-5 利用这一能力,在统一的训练栈内支持广泛的领域与训练范式,包括但不限于 reasoning RL、general RL、agentic RL 与 on-policy 蒸馏。
通过 HTTP API 的服务化 rollout。 slime 通过标准 HTTP API 暴露它的 rollout server 和推理 router,用户可以像使用常规推理引擎那样与 slime 的服务层交互。这把 rollout 逻辑与训练进程边界解耦:外部 agent 框架和环境可以直接调用 server/router 端点,而优化后端对短程单轮训练与长程多轮轨迹都保持不变。
3.6.2 纵向扩展:RL rollout 的尾延迟优化
对 RL rollout 而言,优化目标不是聚合吞吐而是端到端延迟,它由每一步中最慢的(长尾)样本主导。实践中,单条拖后腿的轨迹就能卡住同步点(例如 batch 完成、buffer 就绪、trainer 更新),直接决定 wall-clock 进度。因此 GLM-5 充分利用 slime 面向延迟的服务与调度机制,来同时压低中位延迟,以及更重要的尾延迟。
通过多节点推理加 MLA 的 DP-attention 实现无排队服务。 为避免排队延迟,rollout 请求即使在突发流量下也必须被及时服务,这需要充足的 KV-cache 容量。GLM-5 采用多节点推理部署(例如 8 节点上的 EP64 与 DP64)来提供足够的分布式 KV-cache。引入 DP-attention 主要是为了避免在不同 rank 之间复制 KV。
用 FP8 rollout 与 MTP 降低尾延迟。 GLM-5 用 FP8 做 rollout 推理,以降低单 token 延迟、缩短长轨迹的完成时间。此外 GLM-5 利用 slime 对 Multi-Token Prediction(MTP)的支持,这在 RL rollout 典型的小 batch 解码场景下尤其有效。由于尾延迟往往由小 batch size 的拖后腿样本驱动(例如罕见的长上下文、复杂多轮推理、工具密集的轨迹),MTP 在长尾上带来不成比例的巨大收益,改善了最慢样本的完成时间,从而减少步级停顿。
用 PD 分离防止多轮 RL 中的 prefill-decode 干扰。 在多轮设定下,长前缀 prefill 很频繁(对话历史、工具轨迹、代码上下文)。在 DP-attention 下,把 prefill 和 decode 混在同一份服务资源上会造成严重干扰:一次重量级 prefill 可能抢占或打断服务端正在进行的 decode,让其他样本无法持续推进,尾延迟急剧恶化。因此 GLM-5 利用 slime 的 Prefill–Decode(PD)分离。把 prefill 与 decode 跑在专用资源上,decode 就能保持稳定不被打断,让长程样本持续推进,显著改善多轮 agentic RL 的尾部行为。
3.6.3 Rollout 鲁棒性:心跳驱动的容错
在大规模下,瞬时故障(例如单个 server 崩溃、网络问题或性能退化)不可避免。GLM-5 利用 slime 的心跳驱动容错来保证这类事件下的训练连续性:rollout server 周期性发出心跳由编排层监控,不健康的 server 会被主动终止并从推理 router 中注销。于是重试会自动被路由到健康 server 而绕开故障或退化的 server,避免单机事故打断 rollout,保持端到端 RL 训练不中断。
4 Agentic Engineering
我们描述从 vibe coding(人类 prompt)到 agentic engineering 的转变。在 vibe coding 中,是人 prompt 一个 AI 模型来写代码;在 agentic engineering 中,是 AI agent 自己写代码——它们规划、实现并迭代。为支撑这些长程任务,GLM-5 使用完全异步、解耦的 RL 框架,通过减少 agent rollout 期间的空闲时间来显著提升 GPU 利用率。为扩展 agent 环境,我们开发了环境构建流水线。对编码任务,我们基于真实世界软件工程 issue 和终端任务搭建了超过 10,000 个可验证训练场景。对 search agent,我们开发了一条自动、可扩展的复杂多步推理数据合成流水线来构建 agentic 训练数据。
4.1 面向 agentic 任务的异步 RL
为对 agent 任务做 RL,我们设计了一套完全异步、解耦的 RL 基础设施,它能高效处理长程 agent rollout,并支持跨多样 agent 框架的灵活多任务 RL 训练。
我们采用 group-wise 策略优化算法做 RL 训练。对每个问题 $x$,我们从上一版策略 $\pi_{\text{old}}$ 采样 $K$ 条 agent 轨迹 $\{y_1,\dots,y_K\}$,并按以下目标优化模型 $\pi_{\theta}$:
$$ L(\theta)=\mathbb{E}_{x\sim\mathcal{D}}\!\left[\frac{1}{K}\sum_{i=1}^{K}\left(r(x,y_i)-\bar{r}(x)\right)\right], $$其中 $\bar{r}(x)\;=\;\frac{1}{K}\sum_{i=1}^{K}r\bigl(x,y_i\bigr)$ 是采样回复的平均奖励。注意只有模型生成的 token 参与优化,环境反馈在损失计算中被忽略。
4.1.1 面向 agentic 训练的异步 RL 设计
由于 rollout 过程的长尾特性,朴素的同步 RL 训练会因 agentic 任务生成的严重不均衡而在 rollout 阶段引入大量 bubble,造成大量 GPU 空闲。为提升训练吞吐,我们对 Agentic RL 采用完全异步的训练范式来提升 GPU 利用率与训练效率。具体来说,我们把训练引擎与推理引擎解耦到不同的 GPU 设备上。推理引擎持续生成轨迹,一旦生成轨迹数达到预定义阈值,这批数据就被送到训练引擎更新模型。为减少策略滞后、让训练近似 on-policy,rollout 引擎使用的模型权重会周期性地与训练引擎同步:训练引擎每 $K$ 次梯度更新就更新参数并把新权重推回推理引擎。异步虽能显著提升整体训练效率,但也意味着不同轨迹可能由不同版本的模型生成,引入严重的 off-policy 问题。由于 rollout 策略在变,每次权重更新面对的其实是一个不同的优化问题,因此我们在推理引擎每次权重更新后也重置优化器。
服务化的多任务训练设计。
多任务 RL 中轨迹生成是异质的——不同任务通常依赖不同的工具集和任务特定的 rollout 逻辑。为应对这一点,我们为多任务 RL 训练引入了服务化的 Multi-Task Rollout Orchestrator。这个组件通过一个带多个已注册任务服务的中心 orchestrator,确保 slime RL 训练框架与多样下游任务之间无缝兼容。具体来说,每个任务把自己的 rollout 与奖励逻辑实现为一个独立微服务,注册到中心 orchestrator 接受管理与调度。在 rollout 阶段,中心 orchestrator 控制每个任务的 rollout 比例与生成速度,以实现跨任务的均衡数据采集。关键在于,我们把所有 agentic 任务的轨迹标准化为统一的 message-list 表示。这既支持复杂 agentic 框架(例如软件工程任务)的联合训练,也支持对异质负载做集中式后处理与日志记录。这一设计干净地把任务特定逻辑与核心训练循环隔离开,使多任务 RL 训练能无缝集成。作为 GLM-5 训练基础设施的骨干,这个 orchestrator 支持超过 1k 并发 rollout,并支持任务采样比例的自动动态调整以及任务进度的细粒度监控。
4.1.2 优化异步训练的稳定性
Token-in-Token-out 对比 Text-in-Text-out。
在 RL rollout 设定中,token-in-token-out(TITO)意味着训练流水线消费的是推理引擎产生的精确分词与解码 token 流,并直接用它来构建学习用的轨迹。相反,text-in-text-out 把 rollout 引擎当成一个返回最终文本的黑盒,trainer 随后通过对该文本重新分词(并常常重新推导边界与截断)来重建轨迹,再计算损失。这个看似很小的选择很关键:重新分词会在 token 边界、空白/归一化处理、截断或特殊 token 位置上引入微妙的 mismatch,进而破坏动作与奖励/优势之间的步级对齐——尤其当 rollout 被流式传输、截断,或在很多 actor 之间交错进行时。我们发现 token-in-token-out 对异步 RL 训练至关重要,因为它保留了「采样出来的」与「被优化的」之间精确的动作级对应关系,同时让 actor 能立刻发出轨迹片段(token ID 加元数据),无需有损的文本往返,也无需等待 learner 侧事后重新分词。实践中我们实现了一个 TITO Gateway,拦截 rollout 任务的所有生成请求,记录每条轨迹的 token ID 与元数据。这一设计把繁琐的 token ID 处理从下游 agent rollout 逻辑中隔离出来,同时避免 RL 训练中的重新分词 mismatch。
用于 token clipping 的直接双侧重要性采样。
与 §3 中的同步 RL 训练设定不同,在异步设定下 rollout 引擎可能在单条轨迹生成期间经历多次更新,这使得追踪精确的行为概率 $\pi_{\theta_{\text{old}}}$ 在计算上不可承受。否则我们就得维护一大堆模型 checkpoint 的历史 $\{\pi_{\theta_{\text{old}}^{(1)}}, \dots, \pi_{\theta_{\text{old}}^{(N)}}\}$,这在实际实现中不可行。
为解决这一点,我们首先采用一个简化的 token 级重要性采样机制,把 rollout 期间生成的对数概率直接复用为行为代理。把重要性采样比值算作 $r_t(\theta) = \frac{\pi_{\theta}}{\pi_{\text{rollout}}}$ 并丢弃传统的 $\pi_{\theta_{\text{old}}}$,我们免去了单独做旧策略推理的计算开销。其次,我们采用双侧校准的 token 级 masking 策略。不同于标准 PPO 使用的非对称 clipping,我们把信任域限制在 $[1-\epsilon_\ell, 1+\epsilon_h]$,其中 $\epsilon_\ell$ 与 $\epsilon_h$ 是 clipping 超参。落在该区间外的 token 被完全从梯度计算中 mask 掉,以防止极端策略偏离造成的不稳定。这与 IcePop 机制49 有相似之处,但我们的策略更简单——进一步移除了 $\pi_{\theta_{\text{old}}}$ 并取得了更稳定的训练。
形式上,带 token 级 clipping 的优化目标可以写作:
$$ L(\theta) = \mathbb{E}_t \left[ f(r_t(\theta), \epsilon_l, \epsilon_h) \hat{A}_t \log \pi_{\theta}(a_t|s_t) \right] \tag{3} $$在这一形式中,重要性采样比值 $r_t(\theta)$ 计算为:
$$ r_t(\theta) = \exp\left( \log \pi_\theta(a_t|s_t) - \log \pi_{\text{rollout}}(a_t|s_t) \right) \tag{4} $$稳定性进一步由校准函数 $f(x; \epsilon_\ell, \epsilon_h)$ 保证:
$$ f(x; \epsilon_\ell, \epsilon_h) = \begin{cases} x, & \text{if } 1-\epsilon_\ell < x < 1+\epsilon_h \\ 0, & \text{otherwise} \end{cases} \tag{5} $$实验中我们发现,复用 rollout 对数概率是以接受一定程度的可控 off-policy 偏差为代价,来规避对历史策略的追踪,同时提升训练稳定性。
丢弃 off-policy 与噪声样本。
在异步 RL 中,过长的轨迹可能变得高度 off-policy,从而破坏训练稳定性。为过滤这些严重 off-policy 的样本,我们在生成时记录 rollout 引擎使用的策略权重版本。具体来说,对每条回复我们记录涉及的模型版本序列 $(w_0, \ldots, w_k)$,其中 $w_0 < \cdots < w_k$。令 $w'$ 表示当前策略版本,若某样本最旧的 rollout 版本太陈旧,即 $w' - w_0 > \tau$($\tau$ 是预定义阈值),我们就丢弃它。这剔除了落后当前策略太多的轨迹。
此外,coding agent 的沙箱本身可能不稳定,可能因与模型无关的原因失败(例如环境崩溃)。这类失败会引入噪声训练信号,因为它们反映的是环境不稳定而不是模型能力。为缓解这一点,我们为每个样本记录失败原因,并排除因环境崩溃而失败的样本。对 GRPO 这类基于组采样的方法,移除失败样本可能留下不完整的组。这种情况下,若有效样本数超过组大小的一半,我们就通过重复有效样本来补齐这个组;否则丢弃整个组。这一流程降低了虚假奖励噪声,提升了训练稳定性。
用于加速的 DP-aware routing。
我们提出一种 DP-aware routing 机制,在大规模 MoE 推理中保持数据并行(DP)下的 KV cache 局部性。在多轮 agentic 负载中,来自同一 rollout 的连续请求共享完全相同的前缀。为最大化 KV 复用,我们强制 rollout 级亲和性:属于同一 agent 实例的所有请求都被路由到同一个 DP rank。具体来说,我们引入一个有状态的路由层,用一致性哈希把每个 rollout ID 映射到固定的 DP rank。这个映射在多轮之间保持稳定,消除了跨 rank 的 cache miss。为防止长期失衡,我们把哈希与哈希空间上的轻量动态负载再平衡结合。这一设计避免了冗余的 prefill 计算,同时不需要跨 DP rank 同步 KV。随着 rollout 变长,prefill 成本与增量 token 数成正比而不是与总上下文长度成正比。结果是端到端延迟改善、长上下文 agentic 推理的有效吞吐提升。
4.2 面向 agent 的环境扩展
为支持跨多样 agentic 任务的强化学习,我们构建了可验证、可执行的环境,为代码中心与内容生成两类工作流都提供有据可依的反馈。对 agentic coding 任务,我们开发了两条环境构建流水线来构造可验证的可执行环境:一条基于真实世界软件工程 issue 的环境搭建流水线,以及一条面向 terminal-agent 环境的合成流水线。在编码之外,我们进一步引入了幻灯片生成环境,agent 在其中操作结构化 HTML,并配有可执行渲染与基于布局的验证。
4.2.1 软件工程(SWE)环境
在构造可执行环境之前,我们先收集大量真实世界的 Issue-Pull Request(PR)对,并施加严格的规则型与 LLM 型过滤,以确保获得真实、高质量的 issue 陈述。我们把这些实例分成不同任务类型——bug 修复、功能实现、重构等——并附上必要的任务要求,以确保模型的实现与 test patch 一致。我们采用基于 RepoLaunch50 框架的环境搭建流水线,把从真实 SWE issue 构造可执行环境的过程规模化。这条流水线自动分析仓库的安装与依赖配置来构建可执行环境并生成测试命令,然后借助 LLM 从测试输出生成语言感知的日志解析函数,从而抽取 Fail-to-Pass(F2P)与 Pass-to-Pass(P2P)测试用例。用这条流水线,我们在数千个仓库、覆盖 9 种编程语言(Python、Java、Go、C、CPP、JavaScript、TypeScript、PHP、Ruby)上构造了超过 1 万个可验证环境。
4.2.2 终端环境
从种子数据合成。
为大规模构建可验证的 terminal-agent 环境,我们设计了一条 agentic 数据合成流水线,包含三个阶段:任务草稿生成、具体任务实现、迭代任务优化。从真实世界软件工程与基于终端的 computer-use 场景中收集的一组种子任务出发,我们借助 LLM 头脑风暴生成大量可验证的终端任务草稿。这些草稿随后由一个构造 agent 实例化为 Harbor51 格式的具体任务,包括结构化任务描述、Docker 化执行环境和相应测试脚本。之后一个 refine agent 按人工定义的 rubric 检查并迭代精修生成的任务,确保 Docker 镜像能可靠构建、测试用例与任务规格一致、环境对潜在的漏洞利用或捷径足够稳健。整体上,这条流水线产出了数千个多样且可验证的 terminal-agent 环境,Docker 构建成功率超过 90%。
从 web 语料合成。
我们开发了一条可扩展的自动化流水线,基于 web 语料构造 LLM 验证过的终端编码任务,采用闭环设计——构造 agent 同时充当自己的第一轮评估者。第一步,我们收集大规模代码相关网页语料,并用数据质量分类器只保留高质量内容,丢弃以非技术为主或缺乏实质代码内容的页面。从过滤后的子集中,我们进一步识别适合形成终端式任务的网页。然后我们按主题类别与难度等级做分层采样,确保最终任务池在分布上均衡且多样。第二步,我们把 Harbor 任务构造规范52——包括任务 schema、格式要求和示例任务——连同每个选定的源网页一起提供给一个 coding agent。这个 agent 被要求 (i) 基于网页内容合成一个完整的终端任务,并 (ii) 对自己的输出执行 Harbor 验证脚本。验证失败时,agent 迭代诊断并修改任务直到通过所有自动检查。只有成功通过这一自验证循环的任务才被纳入最终数据集。
4.2.3 搜索任务
对深度搜索的信息寻取任务,我们构建了一条数据合成流水线来产出有挑战性的多跳 QA 对。每个问题都要求基于从多个 web 来源聚合的证据做多步推理。
Web 知识图谱(WKG)构造与问题生成。 从早期版本 search agent 的轨迹出发,我们收集并去重所有遇到过的 URL,保留了跨多样领域的超过两百万个高信息量网页。LLM 执行语义解析来做实体识别、噪声过滤和结构化信息抽取。WKG 会随新页面不断更新,并通过实体对齐、属性归一化、关系合并与语义一致性修正,用下游验证信号来精修。基于 WKG,我们采样中低频实体作为种子节点,扩展它们的多跳邻域形成完整子图,同时控制扩展以减少重叠。用针对高难度、多领域推理的 prompt,我们把每个子图转成一个隐式编码多实体关系链的问题。
高难度问题过滤与验证。 我们用一条三阶段流水线在难度与正确性之间取得平衡:(1) 移除那些无工具推理模型在八次独立尝试中至少答对一次的问题。(2) 过滤掉早期版本 agent 用基础搜索、浏览和计算在几步之内就能解出的问题。(3) 用一个验证 agent 做双向校验:我们从阶段 2 的搜索轨迹中收集候选答案,然后分别独立验证候选答案与标注 ground truth 各自与问题的一致性,剔除答案不唯一、证据不一致或标签错误的样本。这产出了高质量、高难度、可靠的多跳 QA 对。
4.2.4 面向 search agent 的上下文管理推理
我们发现 BrowseComp7 上的表现对 judge prompt 和 judge 模型都很敏感,开源 judge 会引入系统性偏差。为确保一致性与可复现性,我们用官方 OpenAI 评测 prompt 和闭源模型 o3-mini 作为 judge,标准化了所有基于 judge 的环节。案例研究显示这一配置与人工标注 ground truth 最吻合,因此我们在所有实验中都采用它。
先前工作13 引入了上下文管理,其中 Discard-all 通过移除整个工具调用历史来重置上下文。我们进一步观察到,模型准确率在极长上下文(例如超过 10 万 token)下会大幅退化。受此启发,我们采用一个简单的 Keep-recent-k 策略:当交互历史超过阈值 $k$ 时,比最近 $k$ 轮更早的内容会被折叠,以控制上下文长度。设轨迹为 $(q,r_1,a_1,o_1,r_2,a_2,o_2,\cdots,r_n,a_n,o_n)$,其中 $q$ 表示问题,$r_i$ 表示第 $i$ 轮的推理,$a_i$ 表示动作(我们设计了 search、open、find 和 python 四个工具),$o_i$ 表示工具观测。我们只折叠比最近 $k$ 轮更早的观测:$o_i\leftarrow\text{Tool result is omitted to save tokens.}\quad i=1,\ldots,n-k$。实验中我们取 $k=5$,这带来稳定提升,把 GLM-5 从 55.3%(无 keep-recent-$k$)提升到 62.0%(有 keep-recent-$k$)。我们还发现,用不同的 keep-recent $k$ 值,或改为在上下文长度达到预定义 token 阈值时触发 keep-recent,都得到相同结果。
在此基础上,我们把 keep-recent 与 Discard-all 结合成一个混合的分层上下文管理策略。用 keep-recent 做推理时,若总上下文长度超过阈值 $T$,就丢弃整个工具调用历史、以全新上下文重启,同时继续应用 keep-recent 策略。我们通过参数搜索选定 $T=32k$。
如图 8 所示,在不同计算预算下,这一策略有效释放了上下文空间,让模型能执行更多步数并持续提升表现。相比单用 Discard-all,与 keep-recent-k 结合在所有预算下都取得一致增益,最终得分 75.9,优于所有配备上下文管理的开源模型。
4.2.5 幻灯片生成
我们采用一条自我改进的流水线,目标是通过强化学习和拒绝采样微调训练一个专门的幻灯片生成专家,从而系统性地提升幻灯片生成表现。我们先用监督微调(SFT)初始化模型以提供基础的幻灯片生成能力,然后做强化学习,奖励采用基于演示幻灯片常见美学与结构属性的多层次形式。这一阶段带来了生成质量的大幅提升。我们进一步做拒绝采样微调和 mask 微调,让强化学习期间获得的知识被注入回训练语料。这一流程以协同、迭代的方式同时提升了数据质量与模型能力。
我们提出一种多层次奖励形式,把基于 HTML 的幻灯片生成过程中的奖励信号划分为三个层次:
Level-1:静态标记属性。 这一层关注生成 HTML 中的声明式属性,包括定位、间距、颜色、排版、饱和度等风格属性。基于专业设计原则,我们设计了一组规则来规范模型生成这类声明时的行为。这些规则确保生成 HTML 的语法可解析性,同时把标记层面的设计空间约束到一个针对表现力、结构清晰度、视觉和谐与可读性优化过的子空间。此外,我们引入了幻觉图片与重复图片检测机制,来抑制幻觉性或冗余的插图。
Level-2:运行时渲染属性。 与静态检查不同,这一层评估渲染时 DOM 节点的运行时属性,例如元素宽高、bounding box 和其他几何布局指标。通过约束这些属性,我们鼓励生成的幻灯片在空间组织上更贴合人类审美偏好。我们开发了一个分布式渲染服务,能以高吞吐执行渲染作业并抽取所需的运行时属性。训练期间我们观察到若干 reward hacking 行为,例如对超长内容做硬截断,或过度操纵间距(见图 9)。为缓解这些问题,我们改进渲染器实现来消除可利用的漏洞,确保奖励信号真正激励美观协调的布局,而不是对几何指标的表面合规。
Level-3:视觉感知特征。 在运行时渲染约束之外,我们对渲染后的幻灯片做感知层面的评估。例如我们检测异常空白模式作为辅助信号,来进一步改善整体构图平衡与视觉美观。
训练策略。 这些信号在 RL 中被联合优化,以提升生成 HTML 的结构有效性、增强布局组织、提升整体视觉美感。除奖励设计之外,我们还通过动态采样重塑训练分布:具体来说,一部分结构上过于平凡的样本会被概率性丢弃,让优化聚焦在更有挑战的页面上,提升在复杂构图场景下的鲁棒性。我们还采用 token 级策略梯度损失来稳定优化53。此外,我们引入一种均衡策略,把同一样本的不同 rollout 结果分散到多个训练 batch 中,降低优化偏差、提升训练稳定性。
拒绝采样。
在拒绝采样阶段,RL 中用的奖励函数被迁移到一条数据过滤流水线中,用来构造高质量训练子集。在页面层面,过滤标准包括代码有效性与可编译性。在轨迹层面,我们进一步强制工具执行正确性和全局内容多样性约束,确保结构一致。我们采用 Best-of-$N$ 选择策略,从多个独立生成的候选中保留质量最高的样本。这一机制有效地把分布重新加权到更高质量的实例上,带来更好的样本效率与更稳定的训练。
基于 mask 的精修。
尽管拒绝采样移除了大多数低质量输出,仍有一些轨迹的缺陷只集中在少数几页上。丢弃这类样本会降低有效数据利用率、增加生成成本。为此我们引入基于 mask 的纠正机制,自动识别有缺陷的页面并施加 mask,同时保留同一轨迹内的高质量内容。这种选择性精修保留了有价值的监督信号,提升了有效数据效率,减少了冗余重生成的开销,从而提升整体训练效率。
经验性改进。
严格符合 16:9 宽高比的生成页面比例从 40% 提升到 92%,页面溢出情况也大幅减少。人工评测进一步显示,相比 GLM-4.5,GLM-5 在内容质量上胜率 60%、布局合理性 57.5%、视觉美观 65%,整体胜率 67.5%。这些结果为所提出的多层次奖励设计与自我改进框架的有效性提供了经验证据。
5 把 GLM-5 适配到国产芯片基础设施
把 GLM-5 适配到多样的国产芯片基础设施是个不小的挑战,因为硬件生态是异质的,这往往使高性能部署变得复杂。尽管有这些障碍,我们通过与七个主流国产芯片平台——包括华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、沐曦、燧原——的密切合作,成功实现了 GLM-5 的全栈适配。本节我们以昇腾 Atlas 系列为例,展示我们的适配方法论,聚焦三大支柱:极致量化、高性能算子融合、先进推理引擎调度。
混合精度 W4A8 量化。
为把 750B 参数的 GLM-5 模型装进单台 Atlas 800T A3 机器,我们实现了一套精细的 W4A8 混合精度量化策略。借助 msModelSlim54 工具,我们对不同模型组件施加不同精度:标准 Attention 与 MLP 块用 W8A8(INT8),而 MoE 专家被压缩到 W4A8(INT4),在不显著损失精度的前提下大幅降低显存占用。我们还采用了 QuaRot55 做离群值抑制、Flex_AWQ_SSZ 做缩放校准这类先进算法,来维持低比特部署下的稳定性。
高性能融合算子。
为克服稀疏注意力在昇腾 NPU 上的计算瓶颈,我们开发了一套定制融合算子:Lightning Indexer、Sparse Flash Attention 和 MLAPO(Multi-head Latent Attention Pre-processing Optimization)。Lightning Indexer 把 score 计算、ReLU 和 TopK 操作整合进单个 kernel,让 NPU 能把计算与访存重叠。对 Sparse Flash Attention kernel,我们专门针对 GLM-5 的稀疏模式做了优化,这个 kernel 并行处理从 KV cache 中选取 TopK token 以及稀疏注意力计算。最后,MLAPO 把 13 个小的预处理算子融合成一个「超级算子」,利用 Vector 与 Cube 单元之间的并行处理来提升端到端效率。
专门的推理引擎优化。
我们适配了两个主流推理引擎 vLLM-Ascend 与 SGLang,以最大化硬件利用率:
- 异步调度:在 vLLM 内,我们实现了一套机制,把「Device-to-Host」(D2H)采样拷贝与下一个 decode 步的准备工作重叠,有效消除调度「bubble」。
- 上下文管理:RadixCache(前缀共享)与 Prefix Cache(把 KV 存储扩展到系统 RAM)这类特性支持 KV 条目的高效复用,这对长上下文性能至关重要。
- 并行策略:我们采用了 Attention 数据并行(DP)与 MoE 专家并行(EP)结合的混合方案,并配合 FlashComm——它拆分 AllReduce 操作,把通信延迟隐藏在计算之后。
- Multi-Token Prediction(MTP):通过每个推理步生成多个 token,我们显著提升了 NPU 计算密度、缩短了总序列生成时间。
通过这些硬件层面的协同优化,GLM-5 在单台国产节点上取得了与双 GPU 国际集群相当的性能,同时在长序列场景下把部署成本降低了 50%。
6 评测
如前所述,GLM-5 标志着从 vibe coding 到 agentic engineering 新时代的转变。我们首先在 agentic、reasoning、coding(ARC)benchmark 上把 GLM-5 与前沿模型做对比。为全面评测 GLM-5 在真实世界 agentic engineering 场景下的表现,我们提出一个新的内部评测套件 CC-Bench-V2,包含前端、后端与长程任务。最后,我们在五个常见真实场景中评测 GLM-5 的通用能力。
6.1 ARC benchmark 评测
我们在表 7 中报告 ARC benchmark 的主要结果,把 GLM-5 与 GLM-4.7、DeepSeek-V3.213、 Kimi-K2.556、Claude Opus 4.557、Gemini 3 Pro58 与 GPT-5.2 (xhigh)59 做对比。总体上,GLM-5 相比 GLM-4.7 有显著提升,在开源模型中取得 state-of-the-art 表现,并缩小了与 Claude Opus 4.5 这类闭源模型的差距。评测细节见 §B.2。
表 7:GLM-5 与开源/闭源模型的对比。带 * 的结果来自 HLE 全集。带 † 的结果在修正了部分歧义指令的 Terminal-Bench 2.0 verified 版本上评测。GDPval-AA Elo 分数记录于 2026 年 2 月 15 日。每个 benchmark 的最高分加粗,第二高在原文中加下划线。
| GLM-5 | GLM-4.7 | DeepSeek -V3.2 | Kimi K2.5 | Claude Opus 4.5 | Gemini 3 Pro | GPT-5.2 (xhigh) | |
|---|---|---|---|---|---|---|---|
| Reasoning & General | |||||||
| HLE | 30.5 | 24.8 | 25.1 | 31.5 | 28.4 | 37.2 | 35.4 |
| HLE (w/ Tools) | 50.4 | 42.8 | 40.8 | 51.8 | 43.4* | 45.8* | 45.5* |
| AIME 2026 I | 92.7 | 92.9 | 92.7 | 92.5 | 93.3 | 90.6 | - |
| HMMT Feb. 2025 | 97.9 | 97.1 | 92.5 | 95.4 | 92.9 | 97.3 | 99.4 |
| HMMT Nov. 2025 | 96.9 | 93.5 | 90.2 | 91.1 | 91.7 | 93.0 | 97.1 |
| IMO-AnswerBench | 82.5 | 82.0 | 78.3 | 81.8 | 78.5 | 83.3 | 86.3 |
| GPQA-Diamond | 86.0 | 85.7 | 82.4 | 87.6 | 87.0 | 91.9 | 92.4 |
| LongBench v2 | 64.5 | 59.1 | 59.8 | 61.0 | 64.4 | 68.2 | 59.8 |
| Coding | |||||||
| SWE-bench Verified | 77.8 | 73.8 | 73.1 | 76.8 | 80.9 | 76.2 | 80.0 |
| SWE-bench Multilingual | 73.3 | 66.7 | 70.2 | 73.0 | 77.5 | 65.0 | 72.0 |
| Terminal-Bench 2.0 (Terminus-2) | 56.2 / 60.7† | 41.0 | 39.3 | 50.8 | 59.3 | 54.2 | 54.0 |
| Terminal-Bench 2.0 (Claude Code) | 56.2 / 61.1† | 32.8 | 46.4 | - | 57.9 | - | - |
| CyberGym | 43.2 | 23.5 | 17.3 | 41.3 | 50.6 | 39.9 | - |
| Agentic | |||||||
| BrowseComp | 62.0 | 52.0 | 51.4 | 60.6 | 37.0 | 37.8 | - |
| BrowseComp (w/ Context Manage) | 75.9 | 67.5 | 67.6 | 74.9 | 57.8 | 59.2 | 65.8 |
| BrowseComp-ZH | 72.7 | 66.6 | 65.0 | 62.3 | 62.4 | 66.8 | 76.1 |
| $\tau^{2}$-Bench | 89.7 | 87.4 | 85.3 | 80.2 | 91.6 | 90.7 | 85.5 |
| MCP-Atlas (Public Set) | 67.8 | 52.0 | 62.2 | 63.8 | 65.2 | 66.6 | 68.0 |
| Tool-Decathlon | 39.2 | 23.8 | 35.2 | 27.8 | 43.5 | 36.4 | 46.3 |
| Vending-Bench 2 | $4,432 | $2,377 | $1,034 | $1,198 | $4,967 | $5,478 | $3,591 |
| GDPval-AA Elo | 1,409 | 1,198 | 1,195 | 1,288 | 1,400 | 1,201 | 1,462 |
6.1.1 推理与通用 benchmark 评测
推理与通用 benchmark 方面,我们评测了 Humanity’s Last Exam(HLE)3、AIME 2026、HMMT 2025、IMO-AnswerBench60、GPQA-Diamond61 与 LongBench v262。对 HLE 只评测纯文本子集,并用 GPT-5.2 (medium) 作为 judge 模型。大多数推理任务以 131,072 token 的最大生成长度评测,HLE-with-tools 用 202,752 最大 token。
从表 7 看,GLM-5 在推理任务上的表现与强开源 baseline Kimi-K2.5 相当。相比闭源模型,GLM-5 在 HLE(带工具)上优于 Claude Opus 4.5 与 Gemini 3 Pro。相比前代 GLM-4.7,GLM-5 在 HLE benchmark(带工具与不带工具)上都有显著提升。在 HMMT 2025 年 2 月/11 月 benchmark 上,GLM-5 表现优于 Claude Opus 4.5 与 Gemini 3 Pro。GLM-5 在长上下文任务上也有显著进展,在长上下文推理 benchmark LongBench v2 上取得高分,仅次于 Gemini 3 Pro。
6.1.2 编码 benchmark 评测
编码 benchmark 方面,我们在 SWE-bench Verified4、SWE-bench Multilingual5、Terminal Bench 2.06 与 CyberGym63 上评测 LLM。对 SWE-bench Verified 与 Multilingual,我们用 OpenHands 框架配合为 GLM-5 定制的指令 prompt。对 Terminal-Bench 2.0,我们用两个 agent 框架(即 Terminus-2 与 Claude Code),并额外报告修正了部分歧义指令的 Terminal-Bench 2.0 verified 版本上的表现64。CyberGym benchmark 在 Claude Code 2.1.18 中评测。
从表 7 看,GLM-5 在开源 LLM 中于编码 benchmark 上取得 SOTA 表现。相比闭源 LLM,GLM-5 在 SWE-bench Verified 上优于 Gemini 3 Pro,在 SWE-bench Multilingual 上也击败了 Gemini 3 Pro 与 GPT-5.2 (xhigh)。在 Terminal-Bench 2.0 上,GLM-5 取得与 Claude Opus 4.5 相当的结果,修正该 benchmark 的歧义指令后甚至更好。为展示编码能力的泛化性,我们用两个 agent 框架评测 Terminal Bench 2.0,GLM-5 在两个框架上表现一致。在网络安全编码 benchmark(即 CyberGym)上,GLM-5 相比 GLM-4.7 有显著提升,仅次于 Claude Opus 4.5。
6.1.3 Agentic 能力评测
agentic benchmark 方面,我们在 BrowseComp7、BrowseComp-ZH65、$\tau^{2}$-Bench10、MCP-Atlas8、Tool-Decathlon66、Vending-Bench 211 与 GDPval-AA67 上评测 GLM-5 与前沿模型。BrowseComp 衡量语言 agent 通过浏览网页解决有挑战性问题的能力,BrowseComp-ZH 主要针对中文网页。对 BrowseComp 我们用 discard-all 策略做上下文管理,与 DeepSeek-V3.2 和 Kimi K2.5 相同。$\tau^{2}$-Bench 评测对话 agent 在双向控制环境中的能力,我们对 Retail 与 Telecom 做了小幅 prompt 调整以避免用户过早终止导致的失败(见 §B.3)。对 Airline,我们采用 Claude Opus 4.5 system card57 提出的领域修正以获得更准确的结果。MCP-Atlas 是一个真实世界工具使用 benchmark,评估 LLM 在给定 Model Context Protocol(MCP)server 的多步工作流中的表现。为公平比较,我们在 500 任务的公开集上重新评测了所有模型,并把每个任务的超时从 4 分钟延长到 10 分钟,以避免因部署条件导致的任务失败。MCP-Atlas 用 Gemini 3 Pro 作为 judge 模型。Tool-Decathlon 也是工具使用 benchmark,但针对真实世界的长程任务。Vending-Bench 2 在模拟环境中衡量 LLM 在长时间跨度商业场景下的 agentic 能力,相比前身 Vending-Bench 加入了更多真实世界因素。GDPval 关注 AI agent 在有经济价值任务上的表现。
从表 7 看,相比 GLM-4.7,GLM-5 在 agentic benchmark 上显著提升。在 BrowseComp 上,GLM-5 在带与不带上下文管理两种设定下都取得前沿 LLM 中的 SOTA 表现。在 BrowseComp-ZH 上,GLM-5 也击败了 Claude Opus 4.5 与 Gemini 3 Pro。对三个工具使用 agentic 任务(即 $\tau^{2}$-Bench、MCP-Atlas、Tool-Decathlon),GLM-5 取得与 Claude Opus 4.5 相当的表现,说明 GLM-5 有很强的工具使用能力。GLM-5 在 Vending-Bench 2 上的表现(即 4,432 美元)进一步展现了商业任务上的长程能力。在经济场景中,GLM-5 在 GDPval-AA 上优于 Claude Opus 4.5,仅次于 GPT-5.2 (xhigh)。
6.2 真实世界 agentic engineering 体验评测
真实体验比榜单更重要。我们把内部的 CC-Bench 升级为 CC-Bench-V2,用来评测模型能否在真实的 agentic engineering 环境下正确完成跨前端、后端与长程任务的端到端任务。CC-Bench-V2 完全去掉了人工标注,通过 Claude Code 和其他 agent harness,配合单元测试与 Agent-as-a-Judge 技术实现全自动化。
前端。 我们用一条流水线先构建 agent 生成的前端项目,检查是否有语法、依赖和兼容性错误,然后用 Agent-as-a-Judge 通过一个配备 Playwright 和 bash 工具的 GUI agent 模拟用户交互,来验证端到端正确性。
后端。 任务取自 C++、Rust、Go、Java、TypeScript 和 Python 的真实开源项目,涵盖功能实现、bug 修复、回归修复与性能优化。每一处改动都必须在真实工程约束下通过完整单元测试。
长程。 我们先评测模型在大型代码库上的信息寻取能力,这是像人类开发者那样定位正确文件、理解项目上下文的前提。然后我们通过多步链式任务评估端到端正确性——这些任务由挖掘有大量 commit 历史的已合并 Pull Request、并把其 commit 聚类成连贯任务链构造而来。agent 顺序执行这些链,考验它在阶段之间维持上下文、解决依赖的能力。评估把单元测试与 Agent-as-a-Judge 结合,验证功能正确性与语义符合度。
表 8:CC-Bench-V2 在前端、后端与长程任务上的评测结果。BSR:构建成功率;ISR:实例成功率;CSR:检查项成功率。
| 类别 | 任务 | 指标 | GLM-5 | GLM-4.7 | Claude Opus 4.5 |
|---|---|---|---|---|---|
| Frontend | HTML | ISR | 38.9 | 35.4 | 52.2 |
| Frontend | HTML | CSR | 76.3 | 64.9 | 82.2 |
| Frontend | React | ISR | 34.6 | 17.2 | 39.7 |
| Frontend | React | CSR | 71.0 | 49.4 | 70.7 |
| Frontend | Vue | ISR | 32.7 | 24.5 | 46.9 |
| Frontend | Vue | CSR | 77.1 | 53.8 | 74.3 |
| Build | React | BSR | 100 | 65.0 | 95.0 |
| Build | Vue | BSR | 100 | 70.0 | 100 |
| Build | Svelte | BSR | 100 | 60.0 | 90.0 |
| Build | Next.js | BSR | 95.0 | 70.0 | 80.0 |
| Backend | Engineering | Pass@1 | 25.8 | 19.6 | 26.9 |
| Long-horizon | Repo Exploration | Pass@1 | 65.6 | 47.8 | 64.5 |
| Long-horizon | Chained Tasks | Pass@1 | 52.3 | 43.0 | 61.6 |
6.2.1 前端评测——Agent-as-a-Judge
我们开发了一个专为前端开发场景设计的全面自动化评测 benchmark。这个 benchmark 覆盖开发者日常构建的多样应用,包括落地页、管理面板、数据可视化、图形与动画、在线生产力工具、交互式游戏和表单驱动工作流,跨越 HTML、React、Vue、Svelte、Next.js 等主流技术栈。
每个测试用例由一个包含多条具体可实现规格的 Task,配上一个 Checklist 组成,其中每个检查项都直接从相应规格派生。评测流程遵循两阶段流水线:1) 静态验证:先验证生成代码能否成功构建并运行。2) Agent-as-a-Judge:对能正确执行的代码,我们用一个 GUI agent 模拟人类测试行为,交互式验证每个检查项,并按需求满足程度打分。我们定义以下指标:构建成功率(BSR)衡量成功初始化并运行的项目比例;实例成功率(ISR)衡量通过全部关联规格的项目比例;检查项成功率(CSR)衡量所有检查项上的细粒度完成率。数据分布以及构造与验证流程的更多细节见附录 §B.4.1。
Agent-as-a-Judge。
前端正确性本质上是视觉和交互性的,也就是说 bug 往往只在用户点击按钮或调整窗口大小时才显现,这让静态分析和固定测试套件都不够用。因此我们引入 Agent-as-a-Judge(图 10):每个生成的项目被部署在一个 Docker 容器中并构建,以验证静态正确性;构建成功的实例随后交给一个自主 Judge Agent(Claude Code 配 Claude Sonnet 4.5,装有 Playwright MCP 工具),它以闭环循环运行——对每个检查项,agent 读源码、与实时 UI 交互(点击、按键、截图)、检查终端输出,然后给出通过/失败的判定。
为验证可靠性,我们从两个维度把 Agent-as-a-Judge 的判定与独立的人类专家判断做对比。逐点一致性方面,我们采样了 130 个检查项,让人类专家各自独立打分,再与 agent 的判定比较:两者在 94% 的项上一致,分歧集中在主观的视觉质量标准而不是功能规格上。排序一致性方面,我们用自动框架和人类专家分别评测了 8 个前沿模型(Claude Sonnet 4.5、Claude Opus 4.5、Gemini 3 Pro、GLM-4.7、DeepSeek-V3.2 等),得到的模型排序 Spearman 相关系数为 85.7%,说明强正相关。
如表 8 所示,GLM-5 取得 98.0% 的 BSR,在 CSR 上与 Claude Opus 4.5 有竞争力,但三个技术栈上都还有明显的 ISR 差距,说明 GLM-5 能满足大多数单项需求,但在端到端完成整个任务上仍不及 Claude Opus 4.5。
6.2.2 后端评测
后端评测衡量 coding agent 能否在真实工程约束下,对真实世界的服务端代码库做出正确、能通过测试的修改。我们整理了 85 个任务,跨六种语言(Python、Go、C++、Rust、Java、TypeScript),覆盖搜索引擎、数据库引擎、web 框架、AI 推理服务、知识管理系统,以及独立的算法与系统编程挑战等领域。任务类型包括功能实现、bug 修复、回归修复与性能优化,反映日常后端开发的多样性。
为实现全自动评测,每个任务都配有人工编写的单元测试(每任务 5–10 个),验证功能正确性与边界情况处理。任务以 terminal-bench 风格打包:每个任务在一个从项目实际构建环境初始化的 Docker 容器中运行,agent 收到一段描述所需改动的自然语言问题陈述。我们报告 Pass@1,只有当一个任务所有关联单元测试都通过才算解决。这种严格的全有或全无标准让这个 benchmark 尤其困难:GLM-5 与 Claude Opus 4.5 表现相当(表 8),两者都显著领先 GLM-4.7。
6.2.3 长程评测
长程评测针对的是把生产级 agentic engineering 与单轮 vibe coding 区分开来的能力:在庞大代码库中导航,以及执行多步开发——其中每个动作都会重塑后续动作的上下文。我们把它分解为两个互补任务。
大型仓库探索。 任何非平凡编码任务的前提,都是能在一个庞大、陌生的仓库中定位到正确的源文件。我们在包含数万个文件的真实高星 GitHub 仓库上构造了一个自动化 benchmark。每个问题都用自然的、面向用户的语言在业务语义层面提出,严格避免提及文件名、类名或函数名。此外,问题要求从面向用户的描述到实际实现之间做一到两跳的逻辑推理——例如,一个关于生成视频中唇形不同步的问题,对应到某个视频生成后端里的参数调优代码块。目标文件的选择以最大化导航难度为准:它们至少在三层目录深处,名字晦涩以抵抗基于关键词的搜索,实现了仓库中别处没有重复的独特功能,并且位于仓库主要功能面之外。我们报告三次运行平均的 Pass@1,若 agent 在探索过程中成功读取了目标文件即算解决。这个任务上 GLM-5 优于 Claude Opus 4.5(表 8),两者都远超 GLM-4.7。这一结果提示:有效的仓库探索更少依赖原始代码生成能力,更多依赖策略性搜索,也就是通过目录级推理与语义联想迭代收窄文件空间——而 GLM-5 在 agentic 工具使用轨迹上的训练在这里带来明显优势。
多步链式任务。 SWE-bench 这类主流编码 benchmark 把评测化简为单 commit、孤立的编辑,因此无法评估 agent 做增量开发的能力——即每一步都会改变代码库状态从而影响后续步骤。为此我们通过挖掘高质量仓库的已合并 Pull Request 构造了一个长程 benchmark,流水线如下:
- PR 过滤。 只保留包含测试、含 3–15 个 commit、且历史为线性(非 merge)的已合并 PR。
- 语义分组。 由 LLM 给相邻 commit 之间的成对语义相关度打分;用动态规划找到最优划分,切成连贯的任务组,在保持 commit 顺序的同时最大化组内连贯性。
- Patch 分类。 每个任务的累积 diff 被切成三类:golden patch(agent 必须产出的核心代码)、test patch(验证用测试)和 auto-apply patch(自动应用的配置与 fixture)。
- 问题陈述生成。 由 LLM 根据每个任务的 patch 与 commit message 生成自然语言问题陈述。
- 任务分类。 任务被自动分类(功能 / bug 修复 / 重构 / 测试 / 配置),并沿三个维度评估:错误消除、关键路径准确性、测试通过。
- 环境验证。 构造 Docker 环境,并应用 golden patch 以验证整条链上零回归。
给定一条含 $K$ 个任务的链,agent 从 base commit 开始顺序工作:完成任务 $k$ 后,它的改动被提交,任务 $k{+}1$ 的 auto-apply patch 被应用,于是代码库状态是累积演化的。评估依次检查每个 commit,在运行完整测试套件之前累积应用任务 $1$ 到 $k$ 的 test patch,从而既捕捉当前任务的失败,也捕捉对早前任务的回归。我们报告单个任务上的 Pass@1。这种链式、状态递归的设计直接评估了单 commit benchmark 无法触及的长程上下文追踪、规划与增量开发能力。如表 8 所示,GLM-5 相比 GLM-4.7 有大幅提升,但与 Claude Opus 4.5 的差距仍然显著。原因是错误会沿链复合:某个任务中一次次优的编辑,可能在后续任务里静默地弄坏测试。缩小这一差距需要长上下文一致性与长程自我纠错方面的进展,二者都是我们正在推进的研究方向。
6.2.4 演进式 SWE 任务评测
我们在 SWE-rebench68 上评测,因为 SWE-bench Verified 是一个静态、公开、人工验证的测试集,且已发布超过两年。相比之下,SWE-rebench 建立在一条自动化流水线上,持续挖掘新鲜的真实 GitHub issue 修复任务,实现去污染、时间稳健的评测,能更好地衡量对新软件工程问题的泛化能力,而不是在静态 benchmark 上的表现。表 9 给出 GLM-5 在 SWE-rebench 上的官方成绩,我们观察到 GLM-5 能有效泛化到新的 SWE 问题。
表 9:SWE-rebench 上的表现,2026 年 1 月。
| 模型 | 解决率 (%) | 解决率 SEM (±, %) | Pass@5 (%) |
|---|---|---|---|
| Claude Opus 4.6 | 52.9% | 1.06% | 70.8% |
| GPT-5.2 (xhigh) | 51.7% | 1.21% | 58.3% |
| Claude Sonnet 4.5 | 47.1% | 1.69% | 60.4% |
| Gemini 3 Pro | 46.7% | 2.04% | 58.3% |
| Claude Opus 4.5 | 43.8% | 0.93% | 58.3% |
| GLM-5 | 42.1% | 1.21% | 50.0% |
| GLM-4.7 | 41.3% | 2.12% | 56.3% |
| Kimi K2.5 | 37.9% | 1.21% | 50.0% |
6.3 真实世界通用能力评测
标准化学术 benchmark 提供了有用信号,但并不能完整刻画模型在实践中如何被使用。为弥补这一缺口,我们在一组从部署环境中观察到的高频用户交互模式派生出的真实世界通用能力上评测 GLM-5。这些能力包括机器翻译、多语言对话、指令遵循、世界知识与工具调用。
与以 benchmark 为中心的传统评测不同,我们的目标是衡量能直接转化为用户可感知质量提升的改进。对每项能力,我们采用内部人工评测、内部自动评测、外部人工评估与外部自动 benchmark 的组合,以兼顾诊断粒度与跨模型可比性。使用外部 benchmark 时,我们优先选择反映真实交互模式的数据集,而不是构造得很窄的测试分布。
图 11 给出 GLM-5 与 GLM-4.7 在五个真实能力领域上的对比结果。在所有评测维度上,GLM-5 在机器翻译、多语言对话、指令遵循、世界知识与工具调用上都有一致提升。
每项能力的详细评测协议与数据集描述如下。
6.3.1 机器翻译
ZMultiTransBench。
这个内部数据集包含 1,220 个样本,来自自采的高频翻译场景,覆盖七个语言对:中文到西班牙语($300$)、俄语($250$)、法语($220$)、韩语($200$)、日语($150$)、阿拉伯语($50$)和德语($50$)。所有样本由受过翻译学正式训练的研究生整理、翻译并独立校验。数据集强调自然发生的使用语境而非人为构造的测试用例。评测采用与固定 baseline 回复的成对比较,判定由基于 GPT-4.1 的自动评估器给出,评估语义保真度、流畅度与整体翻译质量。
MENT-SNS。
为进一步评测在语言学上有挑战性的语境下的鲁棒性,我们采用 MENT69 的源句,包含 $753$ 个英汉句对,覆盖四个领域:社交网络服务(SNS)、跨文化、诗歌与文学。选择这些领域是为了在复杂语言现象下压测翻译,包括俚语、谐音文字游戏、习语表达、历史典故与隐喻语言。与 ZMultiTransBench 类似,所有样本都由受过专业训练的研究生整理与校验。评测遵循相同的与 baseline 回复成对比较的协议,同样以 GPT-4.1 作为自动 judge 模型。
6.3.2 多语言对话
LMArena。
我们报告 LMArena70 的 Elo 评分,它们来自大规模社区提交的成对比较。这些评分反映开放式对话设定下的相对模型偏好,提供了对话表现的外部信号。
ZMultiDialBench。
除公开榜单之外,我们还在 ZMultiDialBench 这个内部多语言对话 benchmark 上做人工评测。数据集包含 141 个精选实例,跨越多样对话类别。样本来自多个国家母语标注者贡献的高质量对话数据,以及线上用户上报的困难失败案例。人工标注者按类别特定的标准化评测标准,对匿名化的模型回复给出 1–10 分的逐点打分。
6.3.3 指令遵循
IF-Badcase。
IF-Badcase 是一个内部 benchmark,由生产环境中真实用户上报的指令遵循失败案例构造而成。数据集设计用于评测对真实、多约束指令的严格遵循,强调流程准确性、逻辑一致性与刚性格式要求。评测采用详细的 checklist 协议,验证对显式约束的符合度,包括有序步骤、规则型条件与结构规格。所有样本由人类专家标注、复核并迭代过滤,最终得到 450 个测试实例。
IF-Bench71。
IF-Bench 评测 LLM 遵循复杂客观约束的能力,例如特定格式规则、长度限制与内容限制。它提供了对精确指令遵循能力的量化度量,关注可验证的符合度而不是开放式生成质量。
MultiChallenge72。
MultiChallenge 通过真实的多轮对话场景考察 LLM。它针对需要准确指令遵循、上下文分配与上下文内推理的复杂交互。
6.3.4 世界知识
SimpleQA73。
SimpleQA 用有单一、无争议答案的困难问题衡量短答案事实性。它通过把回复分类为正确、错误或未尝试来评估模型的校准度,优先看准确性而非生成长度。
Chinese SimpleQA74。
这个 benchmark 把 SimpleQA 方法论适配到中文语境,在六大领域、99 个子话题上评测事实性。它使用高质量、静态的短答案问题,专为可靠的自动评分设计,以评估 LLM 的知识准确性。
6.3.5 工具调用
ToolCall-Badcase。
ToolCall-Badcase 是一个内部 benchmark,由生产环境中用户上报的工具调用场景失败案例派生而来。每个实例都关联一个可验证的 ground-truth 工具调用,从而能客观评测工具选择与参数正确性两方面。评测考察模型是否 (1) 调用了正确的工具,(2) 提供了结构正确、语义准确的参数。所有样本经过多轮复核、改写与验证以消除歧义、确保可评测性。最终数据集包含 200 个精选测试用例,反映真实的工具调用能力。
7 结论
在本报告中,我们介绍了 GLM-5,一个从根本上弥合高性能推理与极致计算效率之间鸿沟的新一代基础模型。通过从「vibe coding」范式转向真正的「agentic engineering」,GLM-5 证明开放权重模型现在已能在复杂的真实世界工作流中与顶级闭源系统一较高下。GLM-5 代表了实用 AI 效用上的一次范式转变。通过把模型开源,我们希望赋能社区超越静态 benchmark,探索高效 agentic 通用智能的前沿,迎来一个 AI agent 能自主规划、实现并迭代复杂任务的新时代。
8 彩蛋
「Pony Alpha」实验对我们来说确实是一个关键时刻。以匿名方式把 GLM-5 发布到 OpenRouter 上是个大胆的决定,但结果极其令人振奋。剥去我们的品牌名之后,我们让模型的内在能力自己说话,确保收到的反馈是纯粹且无偏的。以下是简要总结:
几天之内,Pony Alpha 就成了热门话题。OpenRouter 社区的开发者开始注意到它出色的表现,尤其在复杂编码任务、agentic 工作流和角色扮演场景中。
猜测四起,很多用户猜它是 Anthropic 这类实验室泄露的更新(Claude Sonnet 5)、一次秘密的 Grok 发布,或者 DeepSeek V4。初步统计显示 25% 的用户猜是 Claude Sonnet 5,20% 猜 DeepSeek,10% 猜 Grok,其余猜 GLM-5。
最终确认它就是我们的 GLM-5,这对我们来说是个意义深远的时刻,有效地打消了对中国 LLM 能否在前沿水平竞争的质疑。
Pony Alpha(GLM-5)的成功不只关乎原始 benchmark 分数,它标志着我们的关注点向工程级可靠性的转移。
这次匿名发布让我们得以超越地缘政治偏见。社区接受这个模型,是因为它管用。
在庆祝这一成功的同时,我们必须保持务实。开放权重模型与绝对的闭源前沿之间的差距正在缩小,但这场竞赛远未结束。我们的重心仍然坚定地放在推进可扩展、高效、智能系统的边界上。
附录 A 超参
GLM-5 模型架构相关的超参见表 10。
训练方面,我们沿用 GLM-4.5 的设置,包括 Muon 优化器、cosine decay 和 batch size warmup。学习率经历一个从 0 到 2e-4 的 warmup 阶段,然后衰减到 4e-5 直到预训练阶段结束。在 mid-training 阶段,学习率从 4e-5 线性下降到 1e-5。其他超参与 GLM-4.5 相同。对 DSA warmup 阶段,学习率从 5e-3 降到 2e-4。对 DSA 稀疏适配阶段,我们用 1e-5 的恒定学习率。
表 10:GLM-4.5 与 GLM-5 的模型架构。统计参数量时,所有模型都计入 MTP 层的参数,但不计入词嵌入和输出层。
| 模型 | GLM-4.5 | GLM-5 |
|---|---|---|
| 总参数量 | 355B | 744B |
| 激活参数量 | 32B | 40B |
| Dense 层数 | 3 | 3 |
| MoE 层数 | 89 | 75 |
| MTP 层数 | 1 | 1 |
| Hidden Dim | 5120 | 6144 |
| Dense Intermediate Dim | 12288 | 12288 |
| MoE Intermediate Dim | 1536 | 2048 |
| QK Head Dim | 128 | 192 |
| V Head Dim | 128 | 256 |
| Q LoRA Dim | – | 2048 |
| KV LoRA Dim | – | 512 |
| 注意力头数 | 96 | 64 |
| Key-Value 头数 | 8 | – |
| Indexer 注意力头数 | – | 32 |
| Indexer Head Dim | – | 128 |
| 专家总数 | 160 | 256 |
| 路由专家数 | 8 | 8 |
| 共享专家数 | 1 | 1 |
| 词表大小 | 151552 | 154880 |
附录 B 评测细节
B.1 基座模型评测
我们在表 11 中用英文、中文、代码和数学 benchmark 评测 GLM-5 的基座模型。
表 11:GLM-5-Base、GLM-4.5-Base 与其他代表性开源基座模型的对比。
| Benchmark(指标) | DeepSeek-V3 | Kimi-K2 | GLM-4.5 | GLM-5 | |
|---|---|---|---|---|---|
| Base | Base | Base | Base | ||
| 架构 | MoE | MoE | MoE | MoE | |
| 激活参数量 | 37B | 32B | 32B | 40B | |
| 总参数量 | 671B | 1043B | 355B | 744B | |
| 英文 | SimpleQA (EM) | 26.6 | 35.3 | 30.0 | 36.0 |
| 英文 | BBH (EM) | 88.4 | 88.7 | 86.2 | 87.4 |
| 英文 | MMLU (EM) | 87.2 | 87.8 | 86.1 | 88.3 |
| 英文 | HellaSwag (EM) | 88.9 | 94.6 | 87.1 | 88.1 |
| 英文 | PIQA (EM) | 84.7 | - | 85.3 | 84.6 |
| 英文 | TriviaQA (EM) | 82.9 | 85.1 | 80.0 | 80.9 |
| 代码 | EvalPlus (Pass@1) | 65.6 | 80.3 | 78.1 | 87.0 |
| 代码 | LiveCodeBench-Base (Pass@1) | 24.6 | 26.3 | 28.1 | 34.4 |
| 数学 | GSM8K (EM) | 87.6 | 92.1 | 79.4 | 68.8 |
| 数学 | MATH (EM) | 62.6 | 70.2 | 61.0 | 56.4 |
| 中文 | CLUEWSC (EM) | 82.7 | - | 83.5 | 84.2 |
| 中文 | C-Eval (EM) | 90.1 | 92.5 | 86.9 | 88.8 |
| 中文 | C3 (EM) | 78.6 | - | 83.1 | 80.3 |
| 中文 | Chinese-SimpleQA (EM) | 72.1 | 77.6 | 70.1 | 74.6 |
B.2 ARC benchmark 评测细节
Humanity’s Last Exam(HLE)与其他推理任务:最大生成长度 $131{,}072$ token($temperature=1.0,top\_p=0.95,max\_new\_tokens=131072$)。默认报告纯文本子集,标 * 的结果来自全集。judge 模型用 GPT-5.2 (medium)。对 HLE-with-tools,最大上下文长度用 $202{,}752$ token。
SWE-bench 与 SWE-bench Multilingual:我们用 OpenHands 配定制指令 prompt 跑 SWE-bench 套件。设置:$temperature=0.7,top\_p=0.95,max\_new\_tokens=16384$,200K 上下文窗口。
BrowseComp:不做上下文管理时,我们保留最近 5 轮的细节。做上下文管理时,我们用与 DeepSeek-V3.2 和 Kimi K2.5 相同的 discard-all 策略。
Terminal-Bench 2.0(Terminus 2):用 Terminus 框架评测,$timeout=2h,temperature=0.7,top\_p=1.0,max\_new\_tokens=8192$,128K 上下文窗口。资源上限为 16 CPU、32 GB RAM。
Terminal-Bench 2.0(Claude Code):在 Claude Code 2.1.14(think 模式)中评测,$temperature=1.0,top\_p=0.95,max\_new\_tokens=65536$。我们移除了 wall-clock 时间限制,但保留每任务的 CPU 与内存约束。我们修复了 Claude Code 引入的环境问题,并额外报告在解决了歧义指令的 Terminal-Bench 2.0 verified 数据集上的结果64。分数为 5 次运行的平均值。
CyberGym:在 Claude Code 2.1.18(think 模式,无 web 工具)中评测,$temperature=1.0,top\_p=1.0,max\_new\_tokens=32000$,每任务 250 分钟超时。结果是 1,507 个任务上的单次运行 Pass@1。
MCP-Atlas:所有模型都在 500 任务的公开子集上以 think 模式评测,每任务 10 分钟超时。judge 模型用 Gemini 3 Pro。
$\tau^{2}$-Bench:我们在 Retail 和 Telecom 中加了小幅 prompt 调整,以避免用户过早终止导致的失败。对 Airline,我们采用 Claude Opus 4.5 system card 提出的领域修正。
B.3 面向 $\tau^{2}$-Bench 的优化用户模拟器
我们在 Telecom 和 Retail 中加了小幅 prompt 调整,以避免用户过早终止导致的失败。优化后的 prompt 见下方图 12 与图 13。这些优化 prompt 按如下方式集成进 system prompt:
|
|
图 12:$\tau^{2}$-Bench Telecom 的优化用户 prompt。
|
|
图 13:$\tau^{2}$-Bench Retail 的优化用户 prompt。
|
|
B.4 真实世界 agentic engineering 体验评测
B.4.1 前端评测
数据。
我们的数据集涵盖七个不同的前端场景,用于评测模型在多样功能领域上的工程能力:业务管理系统、Web 游戏、SVG/Canvas 渲染、创意工具与编辑器、展示页面、表单与表格,以及数据可视化。
表 12:前端应用场景的分布。
| 类别 | 描述 | 任务数 | 检查项数 |
|---|---|---|---|
| Business Systems | 企业/个人数据与流程管理 | 42 | 167 |
| Web Games | 以交互和娱乐为核心的游戏 | 40 | 163 |
| SVG/Canvas | 图形渲染与交互式可视化 | 32 | 166 |
| Creative Tools | 内容创作与在线编辑工具 | 28 | 160 |
| Showcase Pages | 视觉表达与信息呈现 | 27 | 115 |
| Forms & Tables | 结构化数据录入与处理 | 26 | 93 |
| Data Visualization | 图形化数据表达与分析 | 25 | 85 |
按编码语言的数据分布
这个 benchmark 完整覆盖三种主流范式:Vanilla Web Stack(HTML/CSS/JS)、React 组件式框架,以及 Vue 3 + Vite 渐进式方案。
表 13:技术栈与评测单元的统计。
| 类别 | 描述 | 任务数 | 检查项数 |
|---|---|---|---|
| HTML | 原生 HTML/CSS/JS 开发 | 113 | 490 |
| React | 组件式框架开发 | 58 | 249 |
| Vue | Vue 3 + Vite 渐进式方案 | 49 | 210 |
数据样例
每个测试用例由三部分组成:Task、Checklist 和一个专用环境。以下是一个代表性的测试用例:
|
|
数据构造与验证
我们用一条严格的四阶段流水线来保证数据质量:
- 阶段 1:任务合成。 任务由资深前端专家设计,确保它们反映真实世界的工程挑战,同时在多样场景与技术之间保持均衡分布。
- 阶段 2:Checklist 生成与精修。 我们先用 Claude Sonnet 4.5 基于任务规格 $T$ 合成候选 checklist,然后由专家细致审核并整合。经过多轮精修,我们确保每个检查项语义无歧义、客观,并且对用户需求有穷尽覆盖。
- 阶段 3:基于执行的纠正。 我们在 Agent-as-a-Judge 框架与人类专家之间做交叉验证,任何判断分歧都会触发对底层数据的重新评估与修正,以消除潜在噪声。
- 阶段 4:动态 benchmark 迭代。 为保持高辨别力,我们迭代更新测试套件,移除已不再能挑战 state-of-the-art coding agent 的平凡任务。这一专家主导的整理过程最终形成了 220 个高质量前端编码任务及其对应 checklist。
-
GLM-5 Team, GLM-5: from Vibe Coding to Agentic Engineering, https://arxiv.org/abs/2602.15763 ↩︎
-
GLM-5 代码与模型, https://github.com/zai-org/GLM-5 ↩︎
-
L. Phan et al., Humanity’s Last Exam, https://arxiv.org/abs/2501.14249 ↩︎ ↩︎
-
C. E. Jimenez et al., SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, https://arxiv.org/abs/2310.06770 ↩︎ ↩︎
-
J. Yang et al., SWE-smith: Scaling Data for Software Engineering Agents, https://arxiv.org/abs/2504.21798 ↩︎ ↩︎
-
Terminal-Bench Team, Terminal-Bench: A Benchmark for AI Agents in Terminal Environments, https://github.com/laude-institute/terminal-bench ↩︎ ↩︎
-
J. Wei et al., BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents, https://arxiv.org/abs/2504.12516 ↩︎ ↩︎ ↩︎
-
C. Bandi et al., MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers, https://arxiv.org/abs/2602.00933 ↩︎ ↩︎
-
S. Yao et al., τ-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains, https://arxiv.org/abs/2406.12045 ↩︎
-
V. Barres et al., τ²-Bench: Evaluating Conversational Agents in a Dual-Control Environment, https://arxiv.org/abs/2506.07982 ↩︎ ↩︎
-
A. Backlund and L. Petersson, Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents, https://arxiv.org/abs/2502.15840 ↩︎ ↩︎
-
Artificial Analysis Intelligence Index, https://artificialanalysis.ai/ ↩︎
-
DeepSeek-AI, DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, https://arxiv.org/abs/2512.02556 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎
-
A. Liu et al., DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model, https://arxiv.org/abs/2405.04434 ↩︎
-
C. Zhao et al., Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures, https://arxiv.org/abs/2505.09343 ↩︎
-
F. Gloeckle et al., Better & Faster Large Language Models via Multi-Token Prediction, https://arxiv.org/abs/2404.19737 ↩︎
-
A. Liu et al., DeepSeek-V3 Technical Report, https://arxiv.org/abs/2412.19437 ↩︎
-
Y. Leviathan et al., Fast Inference from Transformers via Speculative Decoding, ICML 2023, https://arxiv.org/abs/2211.17192 ↩︎
-
GLM-9B 是我们 GLM-4 系列模型之一, https://github.com/zai-org/GLM-4 ↩︎
-
S. Yang et al., Gated Delta Networks: Improving Mamba2 with Delta Rule, ICLR 2025, https://arxiv.org/abs/2412.06464 ↩︎
-
Y. Gu et al., Jet-Nemotron: Efficient Language Model with Post Neural Architecture Search, https://arxiv.org/abs/2508.15884 ↩︎ ↩︎
-
C. Hsieh et al., RULER: What’s the Real Context Size of Your Long-Context Language Models?, https://arxiv.org/abs/2404.06654 ↩︎ ↩︎
-
OpenAI MRCR 数据集, https://huggingface.co/datasets/openai/mrcr ↩︎
-
H. Yen et al., HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly, https://arxiv.org/abs/2410.02694 ↩︎
-
J. Liu et al., RepoQA: Evaluating Long Context Code Understanding ↩︎
-
GLM-4.7-Flash 模型权重, https://huggingface.co/zai-org/GLM-4.7-Flash ↩︎
-
J. Li et al., DataComp-LM: In Search of the Next Generation of Training Sets for Language Models, https://arxiv.org/abs/2406.11794 ↩︎
-
C. Gao et al., NExtLong: Toward Effective Long-Context Training Without Long Documents, https://arxiv.org/abs/2501.12766 ↩︎
-
J. Jia et al., EntropyLong: Effective Long-Context Training via Predictive Uncertainty, https://arxiv.org/abs/2510.02330 ↩︎
-
D. Narayanan et al., Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM, https://arxiv.org/abs/2104.04473 ↩︎ ↩︎
-
S. Rajbhandari et al., ZeRO: Memory Optimizations Toward Training Trillion Parameter Models, https://arxiv.org/abs/1910.02054 ↩︎
-
T. Yuan et al., Accelerating the Training of Large Language Models Using Efficient Activation Rematerialization and Optimal Hybrid Parallelism ↩︎
-
P. Qi et al., Zero Bubble Pipeline Parallelism, https://arxiv.org/abs/2401.10241 ↩︎
-
H. Ge et al., ByteScale: Efficient Scaling of LLM Training with a 2048K Context Length on More Than 12,000 GPUs, https://arxiv.org/abs/2502.21231 ↩︎
-
Y. Wang et al., FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism ↩︎
-
interleaved thinking 最早由 Anthropic 提出, https://platform.claude.com/docs/en/build-with-claude/extended-thinking#interleaved-thinking ↩︎
-
preserved thinking 自 Opus 4.5 起也被 Claude 采用, https://platform.claude.com/docs/en/build-with-claude/extended-thinking#thinking-block-preservation-in-claude-opus-4-5-and-later ↩︎
-
Z. Shao et al., DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models, https://arxiv.org/abs/2402.03300 ↩︎
-
X. Zhao et al., Small Leak Can Sink a Great Ship—Boost RL Training on MoE with IcePop!, https://ringtech.notion.site/icepop ↩︎
-
C. Zheng et al., Group Sequence Policy Optimization, https://arxiv.org/abs/2507.18071 ↩︎
-
W. Du et al., Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision, https://arxiv.org/abs/2512.15489 ↩︎
-
I. Moshkov et al., AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning Dataset, https://arxiv.org/abs/2504.16891 ↩︎
-
R. Li et al., TACO: Topics in Algorithmic Code Generation Dataset, https://arxiv.org/abs/2312.14852 ↩︎
-
Prime Intellect, SYNTHETIC-2 Release: Four Million Collaboratively Generated Reasoning Traces, https://www.primeintellect.ai/blog/synthetic-2-release ↩︎
-
Y. Gu et al., MiniLLM: Knowledge Distillation of Large Language Models, ICLR 2024, https://arxiv.org/abs/2306.08543 ↩︎
-
A. Yang et al., Qwen3 Technical Report, https://arxiv.org/abs/2505.09388 ↩︎
-
Xiaomi LLM-Core Team, MiMo-v2-Flash Technical Report, https://arxiv.org/abs/2601.02780 ↩︎
-
K. Lu and Thinking Machines Lab, On-Policy Distillation, https://thinkingmachines.ai/blog/on-policy-distillation/ ↩︎
-
LongCat Team, Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model, https://arxiv.org/abs/2510.18855 ↩︎
-
L. Zhang et al., SWE-bench Goes Live!, https://arxiv.org/abs/2505.23419 ↩︎
-
Harbor: A Framework for Evaluating and Optimizing Agents and Models in Container Environments, https://github.com/laude-institute/harbor ↩︎
-
Harbor 任务构造教程, https://harborframework.com/docs/tasks/task-tutorial ↩︎
-
Q. Yu et al., DAPO: An Open-Source LLM Reinforcement Learning System at Scale, https://arxiv.org/abs/2503.14476 ↩︎
-
msModelSlim 量化工具文档, https://www.hiascend.com/document/detail/zh/CANNCommunityEdition/80RC3alpha003/devaids/auxiliarydevtool/modelslim_0001.html ↩︎
-
S. Ashkboos et al., QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs, https://arxiv.org/abs/2404.00456 ↩︎
-
Kimi Team, Kimi K2.5: Visual Agentic Intelligence, https://arxiv.org/abs/2602.02276 ↩︎
-
Anthropic, System Card: Claude Opus 4.5, https://assets.anthropic.com/m/64823ba7485345a7/Claude-Opus-4-5-System-Card.pdf ↩︎ ↩︎
-
Google DeepMind, Gemini 3 Pro Model Card, https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-Pro-Model-Card.pdf ↩︎
-
OpenAI, Introducing GPT-5.2, https://openai.com/index/introducing-gpt-5-2/ ↩︎
-
M. Luong et al., Towards Robust Mathematical Reasoning, EMNLP 2025, https://aclanthology.org/2025.emnlp-main.1794/ ↩︎
-
D. Rein et al., GPQA: A Graduate-Level Google-Proof Q&A Benchmark, https://arxiv.org/abs/2311.12022 ↩︎
-
Y. Bai et al., LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-Context Multitasks, https://arxiv.org/abs/2412.15204 ↩︎
-
Z. Wang et al., CyberGym: Evaluating AI Agents’ Cybersecurity Capabilities with Real-World Vulnerabilities at Scale, https://arxiv.org/abs/2506.02548 ↩︎
-
Terminal-Bench 2.0 verified 数据集, https://huggingface.co/datasets/zai-org/terminal-bench-2-verified ↩︎ ↩︎
-
P. Zhou et al., BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese, https://arxiv.org/abs/2504.19314 ↩︎
-
J. Li et al., The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution, https://arxiv.org/abs/2510.25726 ↩︎
-
T. Patwardhan et al., GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks, https://arxiv.org/abs/2510.04374 ↩︎
-
I. Badertdinov et al., SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents, https://arxiv.org/abs/2505.20411 ↩︎
-
Y. Tian et al., Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation, https://arxiv.org/abs/2601.07338 ↩︎
-
LMArena 文本榜单, https://arena.ai/leaderboard/text ↩︎
-
V. Pyatkin et al., Generalizing Verifiable Instruction Following ↩︎
-
V. Sirdeshmukh et al., MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs, https://arxiv.org/abs/2501.17399 ↩︎
-
J. Wei et al., Measuring Short-Form Factuality in Large Language Models, https://arxiv.org/abs/2411.04368 ↩︎
-
Y. He et al., Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models, https://arxiv.org/abs/2411.07140 ↩︎
Author houmin
Publish July 30, 2026
LastMod July 31, 2026
License 本作品采用 CC BY-NC-ND 4.0 许可协议进行许可,转载时请注明原文链接
如果你在浏览博客的过程中发现了任何问题,欢迎在对应文章下评论。如果你有其他事情想要咨询,可以通过邮件联系我。