本文译自蚂蚁 Ling Team 的 Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale1,2026 年 6 月 13 日提交 arXiv,43 页,署名 218 位作者外加 118 位未列出。原文最特别的一点是它不从头训模型:Ling-2.0-1T 的 20T token 已经花掉了,于是他们在那个已经训好的 checkpoint 上把 GQA 换成 Lightning Attention 与 MLA 的 7:1 混合——先转线性注意力、再把 QK Norm 融进投影权重、再做 TransMLA 转换,每一步后面跟一段 warmup 把 loss 拉回去。这里是全文翻译,覆盖摘要、§1 引言、§2 预训练、§3 后训练、§4 基础设施、§5 结论与局限,以及附录 A(agentic 编码环境)、附录 B(MTP 续训)。Contributors 那节是按贡献排列的作者名单,和 References 一样不译。代码在 inclusionAI/Ling-V2.5,权重在 HuggingFace 的 ling-26ring-26 两个 collection。

摘要

高效且可扩展的 agentic 智能,要求模型既能给出低延迟响应、又有强推理能力,同时在训练、服务和部署上仍然切实可行。本报告提出 Ling-2.6 和 Ring-2.6,一个为在大规模下应对这一挑战而设计的模型家族。Ling-2.6 面向即时响应生成和高「每输出 token 能力」做优化,而 Ring-2.6 面向更深的推理和更高级的 agentic 工作流。

我们没有从头训练,而是通过架构迁移预训练和大规模后训练,把 Ling-2.0 base 模型升级上来。这次升级由模型架构、优化目标、服务系统和 agent 训练环境的统一协同设计来引导,从而在模型能力和部署效率两侧同时取得提升。

在架构层面,我们引入一种混合线性注意力设计,把 Lightning Attention 与 MLA 结合起来,改善长上下文训练和解码的效率。为了进一步提升 token 效率,我们通过 Evolutionary Chain-of-Thought、Linguistic Unit Policy Optimization、双向偏好对齐和最短正确响应蒸馏,来优化每个输出 token 的能力。

在 agentic 能力上,我们提出 KPop,一个为支撑 Ring-2.6-1T 在大规模环境接地数据上稳定训练而设计的强化学习框架。KPop 通过跨编码、搜索、工具使用和工作流执行的异步调度来提升训练效率,使得从复杂的 agent—环境交互中做可扩展的学习成为可能。

Ling-2.6 和 Ring-2.6 合在一起,提供了一条通向高效、可扩展、开放的 agentic 系统的可行路径。我们开源 2.6 家族的全部 checkpoint,以支持在实用 agentic 智能方向上的进一步研究与开发。

1 引言

Ling-2.6-1T 在 Artificial Analysis 智能指数上的得分(纵轴)对该指数消耗的输出 token 数(横轴,对数刻度)。左上角浅绿色区域标注为「最具吸引力的象限」,Ling-2.6-1T 落在约 16.8M token、得分 34 的位置,与 GPT-5.4(Non-reasoning,约 4.19M token、得分 35)同处该象限;Gemini 3.1 Pro Preview、GLM-5.1、Kimi K2.5、Claude Opus 4.6 (max) 等推理模型得分更高但 token 消耗在 67M–134M 量级
Ling-2.6-1T 在 Artificial Analysis 智能指数上的得分(纵轴)对该指数消耗的输出 token 数(横轴,对数刻度)。左上角浅绿色区域标注为「最具吸引力的象限」,Ling-2.6-1T 落在约 16.8M token、得分 34 的位置,与 GPT-5.4(Non-reasoning,约 4.19M token、得分 35)同处该象限;Gemini 3.1 Pro Preview、GLM-5.1、Kimi K2.5、Claude Opus 4.6 (max) 等推理模型得分更高但 token 消耗在 67M–134M 量级

Ring-2.6-1T 与同类模型的 benchmark 表现,八组柱状图分别是 AIME 26(Mean@64)、GPQA Diamond(Pass@1)、ARC-AGI-V2(Pass@2)、PinchBench(Average@3)、ClawEval(pass^3)、SWE-Bench Verified(Resolved)、Gaia2-search(Mean@3)、Tau2-Bench Telecom(Mean@3)。蓝色柱为 Ring-2.6-1T(标注 xhigh 或 high),灰色柱依次为 Kimi-K2.6 Thinking、Deepseek-V4-Pro Max、GPT-5.4 xHigh、Gemini-3.1-Pro high、Claude-Opus-4.7 xhigh
Ring-2.6-1T 与同类模型的 benchmark 表现,八组柱状图分别是 AIME 26(Mean@64)、GPQA Diamond(Pass@1)、ARC-AGI-V2(Pass@2)、PinchBench(Average@3)、ClawEval(pass^3)、SWE-Bench Verified(Resolved)、Gaia2-search(Mean@3)、Tau2-Bench Telecom(Mean@3)。蓝色柱为 Ring-2.6-1T(标注 xhigh 或 high),灰色柱依次为 Kimi-K2.6 Thinking、Deepseek-V4-Pro Max、GPT-5.4 xHigh、Gemini-3.1-Pro high、Claude-Opus-4.7 xhigh

大语言模型(LLM)正在从对话系统走向 agentic 系统234。这个转变改变了 LLM 的优化目标。换句话说,实用的 LLM 必须推理得好、用工具可靠、并且保持高效。然而这几个目标常常互相拉扯。更长的推理能提升表现,但同时抬高延迟和 token 成本。快模型更容易服务,但它们往往在可靠推理和长程 agentic 任务上吃力。因此我们主张,实用的 agentic 智能应该在三个方向上同时改进:长上下文下的效率、每个输出 token 的能力,以及针对真实 agent 工作流的原生优化。

本报告介绍 Ling-2.6 和 Ring-2.6,一个面向高效、即时 agentic 智能的万亿参数级模型家族。具体来说,Ling-2.6 面向即时响应和高 token 效率做优化,Ring-2.6 面向更深的推理和可控的思考量做优化。这个模型家族从 104B 扩展到 1T 参数,开源了三份模型权重:Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T。我们没有从头重训一个万亿参数模型,而是通过架构改造、继续预训练和大规模后训练,把 Ling-2.05 base 模型升级上来。下面简要总结 2.6 家族的关键设计原则与结果。

长上下文的效率。长上下文只有在被高效利用时才有价值。在我们此前基于 Grouped Query Attention(GQA)的架构65里,随着上下文长度增加,attention 成为首要瓶颈——超过 32K token 之后它占总 FLOPs 的 60% 以上。为了突破这个限制,Ling-2.6 和 Ring-2.6 采用一种统一的混合线性注意力架构,把 Lightning Attention7与 MLA8按 7:1 的比例整合起来(线性注意力 AttentionDeepSeek MLA)。这个设计在保住建模质量的同时,降低了长上下文的计算成本、KV cache 压力和解码延迟。同时,在一个新架构下从头训练万亿参数模型的代价高到不可承受。因此我们从 Ling-2.0 base checkpoint 出发继续预训练约 9.6T token,用一条平滑的架构改造流水线,其中包含混合初始化、QK Norm 吸收、Partial RoPE 适配和 MLA warmup。与此并行,我们通过带 MTP 续训的 speculative decoding、优化过的 context parallel 通信,以及 linghe 融合算子库,同时改进服务和训练。这些改动合起来,让解码吞吐高于我们基于 GQA 的 2.0 一代。

高 token 效率。token 效率是 Ling-2.6 的首要设计目标。我们并不把更短的回复当成一种表面的风格偏好;我们优化的是每个生成 token 所承载的能力。在后训练里,我们整合了 Evolutionary Chain of Thought(Evo-CoT)、Linguistic Unit Policy Optimization(LPO)和双向偏好对齐,在保持推理保真度的前提下提升信息密度5。Evo-CoT 移除冗余的推理步骤,而不依赖朴素的响应长度最小化;LPO 把优化从 token 级动作转移到语义连贯的语言单元上,改善 credit assignment 并减少无谓的重复。双向偏好对齐奖励信息量足、满足约束的输出,惩罚逻辑错误、幻觉和套话式的冗长。我们进一步应用最短正确响应蒸馏来提升每 token 能力。这些方法合起来,在推理类负载上带来比 2.0 一代约 4 倍的 token 效率。在 Artificial Analysis 智能指数上,Ling-2.6-1T 只用约 16M 输出 token 就拿到 34 分,与 GPT-5.4 在 non-reasoning 设置下相当。

原生的 agentic 优化。2.6 家族的 agentic 能力是直接训出来的,不是从对话数据里间接继承的。我们构建了覆盖工具使用、编码、搜索、工作流执行和真实环境中多轮交互的广泛 agentic 语料,并把它们与可验证任务、结构化的工具调用轨迹、环境接地的反馈配对起来。此外,Ring-2.6 引入 KPop,一个新的 RL 算法,用二元 KL 散度替换 IcePop9里那个统一的固定比值约束,以稳定 agentic 强化学习;再配合把 rollout 收集与参数更新解耦的异步 RL,这让万亿参数级下的长程、环境绑定轨迹变得可处理(Long Horizon RL)。这套训练配方改善了跨工作流和工具 benchmark 的实际 agent 行为。Ring-2.6-1T 在 PinchBench 上取得 87.60,在 ClawEval 上取得 63.82,在 GAIA-2 Search 和 $\tau^2$-Bench Telecom 上也取得不错的结果。这些结果说明,agent 能力在 2.6 家族里是一个原生的训练目标,而不是一层薄薄的指令微调。

合起来看,Ling-2.6 和 Ring-2.6 朝着一种更实用的 agentic 智能形态推进。架构改善了长上下文效率。后训练配方改善了每 token 的智能。agentic 训练栈改善了真实环境中的可靠性。2.6 家族的 base 与后训练 checkpoint 都已开源,我们将与社区的工作10111213一起推进高效、开放的 agentic 智能的前沿。

2 预训练

长程 agentic 任务要求高效处理超长上下文。在这个规模下 GQA 主导了计算,然而从头训一个万亿参数的替代品,等于扔掉 Ling-2.0-1T 上那 20T token 的投入。我们的做法是在已有 checkpoint 上改造,按 7:1 的混合比例接入 Lightning Attention 和 MLA,产出 Ling-2.5/2.6 与 Ring-2.5/2.6 两个家族共用的 base。线性注意力把每 token 的开销从 $O(n^2)$ 降到 $O(n)$;MLA 把 KV cache 压缩到一个低秩隐空间里。问题在于,这样一次架构移植能不能在一个已经训好的模型上成功,以及得到的 base 是否仍然适合下游专门化。§2.1 到 §2.4 描述架构设计、四阶段迁移策略、数据与训练配方,以及评测结果,以 Ling-2.6-1T-base 为例。

Ling-2.6-1T-base 的整体架构。图中标题写的是「Ling 2.5 Architecture at 1T-Parameter Scale」。中间主干自下而上是 Token Embedding、10 个 group(每个 group 内 7 层 Linear Attention 加 1 层 Multi-head Latent Attention)、Final RMSNorm、Linear Output Layer;训练目标是 Next-Token Prediction 加 Multi-Token Prediction。右上展开 MoE:1 个 Shared Expert SwiGLU 加 256 个 Expert SwiGLU,经 Router 与 Bias 选择。右下展开 Linear Attention 层:QKV Projection → QK Norm → RoPE → Linear Attention Kernel → Grouped RMSNorm,再与一路 Gate Projection 经 sigmoid 的门控相乘,最后过 Output Projection。左侧标注词表 157k、embedding 维度 8,192、前 4 个 block 用稠密 FFN 而非 MoE
Ling-2.6-1T-base 的整体架构。图中标题写的是「Ling 2.5 Architecture at 1T-Parameter Scale」。中间主干自下而上是 Token Embedding、10 个 group(每个 group 内 7 层 Linear Attention 加 1 层 Multi-head Latent Attention)、Final RMSNorm、Linear Output Layer;训练目标是 Next-Token Prediction 加 Multi-Token Prediction。右上展开 MoE:1 个 Shared Expert SwiGLU 加 256 个 Expert SwiGLU,经 Router 与 Bias 选择。右下展开 Linear Attention 层:QKV Projection → QK Norm → RoPE → Linear Attention Kernel → Grouped RMSNorm,再与一路 Gate Projection 经 sigmoid 的门控相乘,最后过 Output Projection。左侧标注词表 157k、embedding 维度 8,192、前 4 个 block 用稠密 FFN 而非 MoE

表 1:Ling-2.6 系列的关键架构配置。

Ling-2.6-flash Ling-2.6-1T
层数 32 80
expert 总数 256 256
每 token 激活的 expert 数 8 8
shared expert 数 1 1
attention head 数 32 64
稠密层数 1 4
hidden size 4,096 8,192
intermediate size 9,216 18,432
expert intermediate size 1,024 2,048
KV LoRA rank 512 512
Q LoRA rank 1536 1536
layer group size 8 8

2.1 混合线性注意力改造

总体上,Ling-2.6-1T-base 引入三项关键的架构创新,以实现高效的长上下文建模,同时保住 Ling-2.0-1T-base 模型的预训练能力。首先,我们做 scaling law 实验来确定最优的混合比例,并验证续训期间一种激进的数据切换策略。然后,基于这些发现,我们设计一个把 Lightning Attention 与 MLA 按 7:1 结合的混合注意力架构。这大幅降低了长上下文场景下的推理 FLOPs 和 KV cache 内存。最后,我们开发一套平滑的多阶段迁移策略,使得从预训练好的 Ling-2.0-1T-base checkpoint 做性能无损的转换成为可能。图 2 展示了整体架构,细节在下面描述。

2.1.1 继承下来的设计

基本配置。我们把 Transformer 层数设为 80,hidden 维度 $d$ 设为 8,192。每层用 64 个 attention head,head 维度 128。模型词表大小 157,184,通过 RoPE14位置编码支持最长 262,144 token 的上下文,其中 $\theta = 6{,}000{,}000$。我们用 SiLU 作为激活函数,用 $\epsilon = 10^{-6}$ 的 RMSNorm 做层归一化。rotary 维度设为 64,也就是说 Partial RoPE 只作用于 head 维度的一个子集。

Mixture-of-Experts。沿用 Ling-2.0,Ling-2.6-1T-base 的前馈网络(FFN)采用细粒度 MoE 架构(MoE),设置 routed expert 和 shared expert。每个 MoE 层由 1 个 shared expert 和 256 个 routed expert 组成,每个 routed expert 的中间隐藏维度是 2,048。routed expert 里每个 token 激活 8 个。我们采用无辅助损失的负载均衡策略并启用 expert bias,其中 router 在 FP32 精度下运行、用 sigmoid 打分。我们采用分组 routing 策略,$n_\text{group} = 8$ 个组、选 top-4 个组,routed 输出按 2.5 的系数缩放,top-$k$ 概率做归一化。前 4 个 Transformer block 用中间维度 18,432 的稠密 FFN 层,而不是 MoE 层。

2.1.2 混合比例的选择

我们在等 FLOPs 约束下,通过 scaling law 实验研究 Lightning Attention 层与 MLA 层的最优比例。我们定义 layer group size $M$,使得每个 group 包含 1 层 Full Attention(MLA)和 $M-1$ 层 Linear Attention,并比较 $M \in \{2, 4, 8, 16\}$ 的配置。图 3 给出 scaling law 曲线,表 2 汇总结果。

不同混合比例的 scaling law 曲线:横轴是不含 embedding 的训练 FLOPs($10^{17}$ 到 $10^{24}$,对数刻度),纵轴是 smooth loss。四条虚线分别对应 $M = 2, 4, 8, 16$,每个 group 里 1 层 MLA 加 $M-1$ 层 Lightning Attention。$M=2$、4、8 三条线基本重合,$M=16$(黄色)在 $10^{20}$ FLOPs 之后逐渐抬高,到 $10^{24}$ 时明显高于其余三条
不同混合比例的 scaling law 曲线:横轴是不含 embedding 的训练 FLOPs($10^{17}$ 到 $10^{24}$,对数刻度),纵轴是 smooth loss。四条虚线分别对应 $M = 2, 4, 8, 16$,每个 group 里 1 层 MLA 加 $M-1$ 层 Lightning Attention。$M=2$、4、8 三条线基本重合,$M=16$(黄色)在 $10^{20}$ FLOPs 之后逐渐抬高,到 $10^{24}$ 时明显高于其余三条

表 2:等 FLOPs 约束下混合比例配置的对比。

layer group size($M$) Linear:Full 比例 scaling 表现 推理成本
2 1:1 与 $M=4$ 相当
4 3:1 与 $M=2$ 相当 中等
8 7:1 scaling 趋势最好
16 15:1 loss 明显退化 最低

$M=8$ 的配置(Linear 对 Full 为 7:1)取得了最好的 scaling 表现,同时提供可观的推理成本节省,代表模型质量与效率之间的最优平衡。我们还观察到,随着总 FLOPs 预算 scale 到更大,Linear Attention 层的占比可以适度提高而不出现退化。基于这些结果,我们为 Ling-2.6-1T-base 选择 7:1 的比例。

2.1.3 注意力移植

随着上下文长度增加,attention 机制成为主导性的计算瓶颈。我们观察到,在超过 32K token 的上下文窗口下,计算成本决定性地从 MoE 层转移到 attention 层;而在 256K+ token 时,Full Attention(GQA)成为绝对的性能瓶颈。为此我们设计一个混合注意力架构,把一部分 GQA 层替换成 Lightning Attention,同时把剩下的 Full Attention 层从 GQA 转成 MLA 以压缩 KV cache(KV-Cache 基础)。本小节描述这两个 attention 组件,以及 MLA 转换所需的结构兼容性方案。

Lightning Attention 转换。我们把一部分 GQA 层替换成线性的 Lightning Attention 层,做法沿用 Ring-flash-linear-2.015。转换时,通过在 head 维度上扩增 $W_{qkv}$ 投影,把 GQA 的维度扩展成标准的 Multi-Head Attention(MHA)。新引入的参数随机初始化,另外为线性注意力机制引入门控参数 $W_\text{gate}$ 和门控归一化 $\gamma_\text{gate}$。在这个初始转换阶段,我们保留原架构里的 QK Norm 和 Partial RoPE,以稳定训练、改善 FP8 训练兼容性,并增强长上下文窗口下的鲁棒性。

MLA 转换。相比 GQA,MLA 通过把 key-value 对投影到一个低秩隐空间,实现极致的 KV cache 压缩。我们在两个规模上通过消融实验验证了这个转换:一个 mini 配置(总参 16B、激活 1.3B)和一个 flash 配置(总参 100B、激活 5B)。在这两个设定里,把所有 GQA 层替换成 MLA、再训练 700B token 加 600B 的 mid-training token,最终表现都超过了原来的 GQA 基线。这个结果在纯 MLA 架构和混合 Linear+MLA 架构上都一致成立。

然而,直接把 Ling-2.0 的 attention 转成 MLA 会带来两个必须解决的结构不兼容。

QK Norm 不兼容。QK Norm 是一个非线性操作,它妨碍了 MLA 高效推理所需的 KV 权重矩阵吸收。我们的解决办法是在 MLA 转换之前移除 QK Norm。利用 RMSNorm 的数学性质,我们把 QK Norm 的参数近似地融进 query 和 key 的投影权重里。具体来说,对于一个含 $N$ 个校准样本的数据集,我们计算 query 与 key 输出 $q_{ij}$ 和 $k_{ij}$ 的逐维统计量($i$ 为样本、$j$ 为 head 维度 $d$ 内的维度下标),并推导出吸收了 QK Norm 参数 $\gamma_Q$ 与 $\gamma_K$ 效果的修正投影权重 $\hat{W}_q$ 和 $\hat{W}_k$:

$$ \begin{aligned} \hat{W}_q &\gets \frac{W_q}{\sqrt{\frac{1}{Nd}\sum\limits_{i=1}^{N}\sum\limits_{j=1}^d{q_{ij}^2} + \epsilon}} \odot \gamma_{Q}, \\ \hat{W}_k &\gets \frac{W_k}{\sqrt{\frac{1}{Nd}\sum\limits_{i=1}^{N}\sum\limits_{j=1}^d{k_{ij}^2} + \epsilon}} \odot \gamma_{K}. \end{aligned} $$

这种基于校准的融合有效地移除了非线性的 QK Norm,同时保住它的归一化效果,从而让后续的 MLA 权重吸收成为可能。

位置编码不兼容。TransMLA16原生支持 Full RoPE,而 Ling-2.0-1T-base 用的是 Partial RoPE——只有一部分 head 维度接受 rotary 位置编码。我们的处理办法是解耦 RoPE 模块:把受 RoPE 影响的维度与不受影响的维度分开,只对受 RoPE 影响的那部分做基于 PCA 的权重旋转,再把结果拼接起来重建完整表示。这种解耦处理让 TransMLA 转换能正确进行,同时保住 Ling-2.0 的 Partial RoPE 结构。

2.2 预训练语料

2.2.1 领域语料

Agentic 语料。agentic 语料代表了预训练数据上的一次范式转变,从静态文本转向能刻画 agent 在真实部署中所经历的完整信息流、决策路径和环境动态的数据17。这份语料的任务多样性极高,跨越两个主要领域:agentic 工具使用和 agentic 编码。具体来说,我们利用 500 多个真实 MCP 环境、涵盖 3,000 多个不同工具,构建了一大批工具使用任务;除此之外,我们合成了大规模、多样的编码任务,与 bash 命令、基于 web 的问答和相关软件仓库集成在一起。随后我们用基于模型的质量过滤,来保证任务的相关性、逻辑连贯性和难度合适。接着用多种 teacher 模型和各类交互脚手架生成 agentic 轨迹,并加入严格的规则式和模型式验证以保证轨迹质量。

长上下文语料。为了把上下文窗口扩到 256K,并缓解自然分布数据中高质量超长语料的稀缺,我们同时着力于定向检索和数据合成,从而构建出一份覆盖多个领域的超长语料,包括数学、复杂网页解析、长文档摘要、检索增强生成(RAG)融合和多跳推理。

与此同时,我们进一步强化了质量保证流水线。具体来说,通过引入一个整合规则式与模型式方法的深度检测框架,我们能有效识别并移除超长文本中常见的缺陷,包括过度自我重复、结构崩塌和长程语义幻觉。这条流水线也被用来重新清洗和精炼一部分已有的长上下文数据。

2.2.2 通用语料

Web 语料。为了提升模型在预训练期间的通用知识,我们在一套宽表基础设施和 fastText18之上搭建了一条高效的通用特征工程流水线,实现小时级的模型迭代和天级的特征更新。从一个大规模 web 索引出发,我们做定向的 STEM 数据召回、面向问答的检索,以及通过内部搜索引擎的闭环检索,并进一步把检索到的网页内容改写成教科书风格的材料,噪声更少、逻辑结构更强,有效缓解了 Common Crawl 的知识覆盖局限。为进一步提升模型的事实性问答能力,我们观察到散布在长文本中的零散事实很难被模型有效学到。为解决这个问题,我们开发了一条原子事实构建流水线,把 Wikipedia 文章转成独立命题和结构化三元组,配合一条多策略问答合成流水线做细粒度的知识增强。实验结果表明,这个方法大幅降低了事实记忆的难度,并有效增强了模型的事实性问答能力。

数学与代码语料。数学和编程语料仍然是我们预训练数据的核心组成。在本次发布中,我们通过改写语料、并挖掘更广谱的高质量网页内容、完整文献和源代码仓库,系统性地扩增并精炼了这些特定语料。

多语语料。为缓解先进多语模型在常用语言之间的表现差距,我们优先扩展 21 种语言的单语语料覆盖,重点补充了阿拉伯语、日语和印地语。在数据构成上,我们纳入了开源语料 Fineweb219和 Fineweb2-hq20的 1.1T token(覆盖 8 种关键语言),并引入约 70B token 的合成网页代码数据以增强领域特定的表示能力。

在迁移预训练和继续预训练期间,多语数据占全部数据集的 4%,内部再分层为 70% 的 web 语料——跨越罗曼语族、日耳曼语族、斯拉夫语族和东南亚语族——以及 30% 的能力导向混合:数学、代码、考试、合成网页和平行语料。而在 mid-training 阶段,我们剥掉通用 web 数据集,只留下高价值的能力类别——数学推理、代码、考试、合成数据和平行语料——以策划出一个低噪声、聚焦能力的分布。

2.3 预训练配方

Ling-2.6 的预训练建立在 Ling-2.0 语言模型 checkpoint 之上,继承了它的关键超参数,处理约 9.6T token 分三个阶段。

2.3.1 超参数

Ling-2.6-1T-base 从 Ling-2.0-1T-base 继承 MoE 主干,并进一步引入混合线性注意力架构。关键架构参数随模型规模变化,细节见表 1。至于训练超参数,我们首先在混合线性注意力架构上重新建立 Ling 的 scaling law,以在给定总训练预算下确定合适的学习率和 batch size。我们采用无辅助损失的负载均衡策略,在继续预训练期间把 bias 更新率设为 $\gamma{=}0.001$,随后在 mid-training 阶段降到 0.0001。MTP 损失权重设为 0.1。其余超参数与 Ling-2.0 保持一致。我们继续使用 Ling-2.0 的 WSM 调度器:线性 warmup 到峰值学习率,然后保持常数直到训练结束;最终的退火效果通过 checkpoint 合并来实现。

2.3.2 多阶段训练

Ling-2.6 的多阶段预训练流水线。上排灰色框是 Migration Training,四步依次为 Lightning Attention Conversion、Linear Warmup、MLA Conversion、MLA Warmup,全部在 4K 上下文。下排先是绿色框 Continue Pre-Training(64% General Data、36% Reasoning Data,4K),再是橙色框 Mid-Training 的三个阶段:67% General / 33% Reasoning(32K)→ 47% General / 53% Reasoning(32K)→ 43% General / 42% Reasoning / 15% Agentic(256K)
Ling-2.6 的多阶段预训练流水线。上排灰色框是 Migration Training,四步依次为 Lightning Attention Conversion、Linear Warmup、MLA Conversion、MLA Warmup,全部在 4K 上下文。下排先是绿色框 Continue Pre-Training(64% General Data、36% Reasoning Data,4K),再是橙色框 Mid-Training 的三个阶段:67% General / 33% Reasoning(32K)→ 47% General / 53% Reasoning(32K)→ 43% General / 42% Reasoning / 15% Agentic(256K)

如图 4 所示,预训练处理约 9.6T token 分三个阶段:迁移预训练(Migration Pre-Training)、继续预训练(Continue Pre-Training)和 mid-training。

迁移预训练。从 Ling-2.0 base checkpoint 出发,这个阶段把架构从基于 GQA 的 Softmax Attention 平滑过渡到带 MLA 的混合线性注意力,同时把性能退化降到最低。它在约 400B token 上分四步进行。

首先我们做 Lightning Attention 转换:把一部分 GQA 层转成 Lightning Attention,做法是在 head 维度上扩增 $W_{qkv}$ 参数并初始化新的门控参数 $W_\text{gate}$ 和 $\gamma_\text{gate}$,同时保留 QK Norm 和 Partial RoPE 以保证训练稳定。

接下来是 Linear Warmup 阶段,冻结除 $W_{qkv}$ 和 QK Norm 权重之外的所有参数。用较小的数据预算做一次学习率 warmup,把 loss 拉回转换前的水平,让随机初始化的线性注意力参数与预训练好的表示对齐。

第三步是 MLA 转换,它包含三个依次进行的操作:(1)用 §2.1.3 描述的基于校准的融合移除 QK Norm。在 mini 规模上,这会让测试困惑度从 6.65 升到 11.13,是一个可控且可恢复的退化;(2)一段简短的部分参数训练阶段(只解冻 $W_{qkv}$、QK Norm、$W_\text{gate}$ 和 $\gamma_\text{gate}$)配学习率 warmup,以缓解移除 QK Norm 的影响;(3)通过 Partial RoPE 适配和 TransMLA16转换完成结构转换。

最后,MLA Warmup 冻结那些未被结构性修改的参数,并施加一次学习率 warmup 把 loss 恢复到转换前的水平。迁移预训练结束时,模型已完全采用目标的混合线性注意力架构,可以进入大规模续训。

继续预训练。迁移预训练之后,所有参数解冻,在 4K 上下文窗口下用 8T token 做完整续训。数据配比大约 46% 给推理密集的领域(例如数学和代码)、50% 给通用语料(例如网页文本)、4% 给多语数据。

在初步实验里,我们比较了两种数据切换策略:(1)一种保守做法,先在 2T token 的原始预训练数据上训练以恢复模型能力,再引入新的、更高质量的数据;(2)一种激进做法,从这个阶段一开始就引入新数据。激进策略被证明更优:早期就接触更高质量的数据能加速能力恢复、减少所需的总 token 数,并给出更高的最终性能上限。因此我们在 Ling-2.6 的继续预训练里采用激进策略。

译注:图 4 给出的配比与正文对不上——图里继续预训练那格写的是 64% General / 36% Reasoning,正文写的是 46% 推理、50% 通用、4% 多语。就算把多语算进通用,也是 54% 对 46%,与图里的 64/36 仍有差距。两处口径原文并存,本译文照抄未改。

Mid-Training。在 mid-training 阶段,我们在高质量数据上训练并激活长上下文,以精炼能力并扩展上下文窗口。这个阶段约 1.2T token,分三个 phase。

第一个 phase 训练 250B token,其中 20% 的序列采样到 32K 长度,同时维持与前一阶段相似的数据配比,把模型的有效上下文窗口从 4K 扩到 32K。学习率保持在从继续预训练继承下来的峰值。

第二个 phase 跨越 425B token、上下文长度 32K,显著提高高质量数据的占比。

第三个 phase 覆盖 525B token,把上下文窗口扩到 256K,同时维持这份高质量数据配比。

2.4 预训练评测

Benchmark 与配置。为了系统评测 base 模型的能力,我们采用一套覆盖六个关键领域的宽 benchmark 套件,包括数学、编码、推理、语言理解、世界知识和长上下文理解。整个套件共 31 个评测 benchmark,分为以下类别:

  • 数学:GSM8K21(4-shot,CoT)、CMath22(3-shot,CoT)、MathBench23(4-shot,CoT)、OlympiadBench24(3-shot,CoT)、OmniMath25(3-shot,CoT)、GKMathUnion(4-shot,CoT)。GKMathUnion 是一个内部榜单,由 GaoKao 2023 En26和高考题(含 GaoKao I/II 202427、GaoKao-Math-QA28、GaoKao-Math-Cloze28,以及收集到的 91 道 2024 年高考题)组成。
  • 编码:HumanEval-Plus29(0-shot)、HumanEval-Fim30(0-shot)、MBPP-Plus31(3-shot)、LiveCodeBench32(0-shot,含 2024 年 8 月至 2025 年 5 月发布的 454 道题)、BIRD-SQL33(0-shot)。
  • 通用推理:BBH34(3-shot,CoT)、BBH-zh35(3-shot,CoT)、KorBench36(3-shot)、CommonSenseQA37(5-shot)、WorldSense38(0-shot)、AutoLogi39(3-shot,CoT)、ZebraLogic40(1-shot)。
  • 语言理解:Squad 2.041(1-shot)、Belebele42(0-shot)。
  • 世界知识:MMLU43(5-shot)、MMLU-Pro44(5-shot)、GPQA45(0-shot)、SuperGPQA46(5-shot)、TriviaQA47(5-shot)、SimpleQA48(5-shot)、C-SimpleQA49(5-shot)、mARC50(0-shot)、MMMLU51(0-shot,各基线的语言覆盖可能不同)。
  • 长上下文理解:LEval52(0-shot)、LongBenchv253(0-shot)。

所有评测都在我们内部的评测框架里进行,对四个 base 模型 Ling-2.0-flash-base、Ling-2.6-flash-base、Ling-2.0-1T-base、Ling-2.6-1T-base 使用同一套 benchmark 特定配置,以保证公平对比。

评测结果。表 3 给出 Ling-2.6-1T-base 模型与 Ling-2.0-1T-base 模型的评测结果。总体上,Ling-2.6-1T-base 相比前一版本带来广泛且一致的提升,在知识密集型评测、长上下文建模,以及数学与编码能力的保持上尤为明显:

  • 世界知识上的显著提升:我们的 Ling-2.6-flash-base 和 Ling-2.6-1T-base 在英文、中文和多语的世界知识类评测上都有大幅改善。与 Ling-2.0-1T-base 模型相比,它们在 GPQA、SimpleQA 和 MMMLU 等代表性 benchmark 上取得明显增益。这些增益有力地证明,续训期间引入的高质量知识数据已被模型有效内化,带来更强、更可迁移的知识表示。
  • 长上下文与推理能力的增强:在长上下文建模和推理密集型评测上也有明显改善。Ling-2.6-1T-base 模型能更有效地处理扩展输入、保持长程依赖、从冗长上下文中识别与任务相关的信息,同时展现出更强的多步推理与问题求解能力。这些能力为后训练阶段增强 agentic 能力提供了更强的 base 模型底座。
  • 续训下数学与代码表现的稳健性:尽管额外训练大幅提升了知识、长上下文和推理能力,模型仍保住了数学与编码 benchmark 上的强表现,没有明显退化。特别是在 MathBench 和 LiveCodeBench 等代表性 benchmark 上表现进一步提升,说明这套训练策略有效缓解了知识扩展与推理密集型能力之间常见的「跷跷板效应」。

表 3:Ling-2.0-flash-base、Ling-2.6-flash-base、Ling-2.0-1T-base 和 Ling-2.6-1T-base 的对比。原文没有说明标记含义,按实际标法反推:斜体(原文下划线,markdown 无下划线故改用斜体)是两个 flash 之间的较优者,加粗是两个 1T 之间的较优者——所以加粗未必是全场最高,例如 LEval 一行加粗的 76.21 就低于斜体的 77.86,MMLU-Pro 一行加粗的落在 Ling-2.0-1T 而非 2.6。首列加粗、其余留空的整行是原文用 \multicolumn 做的能力分组行。

Benchmark Ling-2.0-flash-base Ling-2.6-flash-base Ling-2.0-1T-base Ling-2.6-1T-base
世界知识
MMLU (EM) 82.98 84.13 86.03 86.82
MMLU-Pro (EM) 60.73 61.36 67.91 67.79
GPQA (EM) 35.35 37.88 41.92 45.45
SuperGPQA (EM) 38.79 40.17 44.06 44.72
TriviaQA (EM) 74.32 75.52 81.62 82.62
SimpleQA (EM) 10.01 18.33 20.87 38.26
C-SimpleQA (EM) 49.43 63.53 64.53 76.83
mARC (EM) 82.07 82.53 86.68 87.50
MMMLU (EM) 62.76 64.76 68.68 71.53
数学
GSM8K (Acc) 90.60 91.89 89.31 93.93
CMath (Acc) 93.35 93.53 93.62 94.72
MathBench (Acc) 77.69 80.87 82.11 82.66
GKMathUnion (Acc) 63.17 63.49 63.81 65.71
OlympiadBench (Acc) 35.70 39.31 39.56 39.85
OmniMath (Acc) 28.30 29.90 33.60 38.70
代码
HumanEval-Plus (Pass@1) 83.54 81.10 83.54 85.98
HumanEval-Fim (Pass@1) 80.93 81.22 85.48 88.87
MBPP-Plus (Pass@1) 74.07 73.28 73.81 77.78
LiveCodeBench (Pass@1) 30.40 33.48 40.09 44.27
BIRD-SQL (Acc) 38.69 38.40 42.70 44.59
通用推理
BBH (Acc) 84.82 85.06 86.88 89.73
BBH-zh (Acc) 83.59 83.91 85.82 87.15
KorBench (Acc) 43.52 44.96 49.04 50.64
CommonSenseQA (EM) 87.71 87.31 89.76 90.99
WorldSense (EM) 61.28 60.10 66.99 67.36
AutoLogic (Acc) 61.10 62.82 65.76 67.43
ZebraLogic (Acc) 20.10 21.00 26.00 30.00
语言理解
Squad 2.0 (Acc) 89.27 88.81 91.29 92.98
Belebele (EM) 92.50 93.22 93.89 94.67
长上下文
LEval (Acc) 73.41 77.86 72.30 76.21
LongBenchv2 (Acc) 33.40 34.19 30.02 43.54

3 后训练

Ling-2.6 和 Ring-2.6 的后训练从同一个 base 模型出发,但在优化目标上分岔。Ling-2.6 被开发成一个 instant 模型,重点在快速响应、高 token 效率和基本的 agentic 能力。Ring-2.6 遵循相似的整体框架,同时更强调更强的推理和更高级的 agentic 智能。

3.1 Ling-2.6 的后训练

与 Ling-2.0 采用的统一后训练策略不同,Ling-2.6 采用一种 specialist 驱动的训练范式,以系统性地增强跨领域的能力。为此,监督微调(SFT)过程被组织成两个阶段:先是冷启动 SFT,然后是专门化的 specialist 微调。接着用强化学习(RL)进一步强化每个 specialist 模型。最后,把获得的领域特定能力蒸馏回一个统一的 Ling-2.6 模型(Mixed RL)。这套「先专门化再蒸馏」的框架,目标是在保住实际部署所需的快速响应特性和 token 效率的同时,最大化能力密度。此外,我们还采用多 MTP 层的续训后训练来做 speculative decoding 加速(请参见附录 B)。

译注:原文在这一节里 expert 和 specialist 混用,指的都是「按领域单独训出来的专精模型」,和 §2 里 MoE 的 expert 完全是两回事。本译文一律保留 specialist 以示区分,MoE 那个继续写作 expert。

Ling-2.6 的后训练流水线,从左到右:Ling-2.6-base → Cold-Start SFT → Specialist of Ling(Reasoning 一路走 expert-level SFT 再接 Evo-CoT / LPO 加 Redundancy Penalty;Agentic 一路走 expert-level SFT 再接 GSPO 加 Redundancy Penalty)→ Specialist Distillation → Bidirectional Preference Alignment → Ling-2.6-Instruct
Ling-2.6 的后训练流水线,从左到右:Ling-2.6-base → Cold-Start SFT → Specialist of Ling(Reasoning 一路走 expert-level SFT 再接 Evo-CoT / LPO 加 Redundancy Penalty;Agentic 一路走 expert-level SFT 再接 GSPO 加 Redundancy Penalty)→ Specialist Distillation → Bidirectional Preference Alignment → Ling-2.6-Instruct

3.1.1 监督微调语料

为给后续 RL 里的专门化提供稳定的初始化,Ling-2.6 的 SFT 语料仔细平衡了推理、长上下文窗口和 agentic 工具使用三类场景。这个底座被设计来支撑 token 高效的即时响应、深度的长上下文推理,以及稳健的 agentic 行为。

推理。我们编制了一份多样的推理数据集,涵盖数学、STEM、编码和逻辑。为维持均衡的难度分布,所有样本都经过基于模型的通过率标注来验证。我们大幅扩充了数学部分的高难度竞赛题,拓宽了化学与生物的科学覆盖,并引入 5 万多条跨命题逻辑与视觉逻辑领域的合成逻辑查询。此外,我们纳入以 agent 为中心的编码任务——例如仓库探索、调试和测试生成——跨多种编程语言。这些可验证、难度受控的数据集合在一起,为推理导向的 RL 提供了理想的目标。

Agent。对于 agentic 行为和工具利用,我们在可扩展、可执行的环境之上构建 RL 数据,覆盖 200 多个真实和合成的工具包(例如搜索工具、Model Context Protocol 服务器)。这些环境提供 2,500 多个可调用函数,跨越搜索、电商、金融和科学计算。基于这套基础设施,我们生成可验证的工具使用轨迹,涵盖无关工具拒绝、长程单轮执行和交互式多轮任务54。通过同时采用以种子为中心和以关键工具链为中心的合成方式,得到的语料把模型训练成能做准确、简洁、高效的 agentic 交互。

长上下文。我们通过一份专门的语料把后训练的上下文窗口扩到 256K token,语料包含书籍、学术论文、代码仓库、财报和网页数据。为明确增强长上下文推理,我们聚焦于数字密集的语料。我们通过策略性地合并多公司、跨年度的财报来合成扩展上下文,制造出高密度、结构化的摘要。我们生成的不是简单的检索题,而是多跳计算题,强迫模型跨这些扩展上下文做推理。为保证数据质量,我们采用一条严格的验证流水线:先用自动沙箱评估可执行代码的数值准确性,再做 human-in-the-loop 验证,确保只有高质量、完全对齐的推理轨迹被保留用于训练。

3.1.2 Ling 的 specialist 训练

冷启动 SFT 之后,流水线转入 specialist 训练阶段来培养各个专精模型。这个阶段把 specialist 级 SFT 与定向的强化学习(RL)结合起来。核心目标是在严格的 token 效率约束下最大化即时响应的质量,为最终蒸馏进 Ling-2.6 准备好这些专门化能力。

推理。为了在灌注自适应推理能力的同时抑制冗长,我们实施一套贯穿数据精炼与奖励设计的整体策略。我们首先精炼 SFT 推理数据,利用内部的 specialist 模型生成回答,严格只保留最短的正确候选。为进一步消除「过度反思」的模式——正确答案已经找到之后还出现多余的二次反思——我们用一个 LLM judge 来剪掉这些片段。这个数据层面的干预把平均输出长度减少了 200 到 300 token。

在 RL 阶段,我们在 Ling-2.05的 Evolutionary Chain of Thought(Evo-CoT)框架之上继续构建。从精炼后的 SFT checkpoint 出发,我们用一套显式惩罚冗余的复合奖励系统来训练模型:

  • 准确性($R_{\text{acc}}$):最终答案与 ground truth 匹配则 $+1$,否则 $0$。
  • 格式($R_{\text{format}}$):如果生成了显式的推理标记(例如 <think> 标签)则惩罚 $-0.5$,以强制 instant 响应格式。
  • 动态长度惩罚($\hat{R}_{\text{length}}$):惩罚超过难度特定长度上限的回答。它允许在难任务上做详尽推理,同时在易任务上严格压缩长度:
$$ \hat{R}_{\text{length}} = \begin{cases} p(l), & \text{if } R_{\text{acc}} = 1, \\[4pt] \min\!\big(p(l),\, 0\big), & \text{if } R_{\text{acc}} = 0, \end{cases} $$

其中 $p(l)$ 定义为:

$$ p(l) = 0.5 - \frac{l - \ell_{\min}}{\ell_{\max} - \ell_{\min} + 10^{-9}} $$

这里 $l$ 表示某个采样回答的 token 长度,$\ell_{\min}$ 和 $\ell_{\max}$ 分别表示给定 query 的所有样本中最短和最长的长度。

  • 语义冗余惩罚($R_{\text{redundancy}}$):只依赖 token 长度不足以控制重复性的内部反思。因此我们把模型的思考过程切段,部署一个 LLM judge 来评估每一段的语义冗余度。被判定为逻辑循环或冗余的段落,会被归一化成一个额外的惩罚项 $R_{\text{redundancy}}$,有效地迫使模型高效思考。

Agentic。对 agentic 任务,我们采用专门为最大化 token 高效的工具使用而定制的 Group Sequence Policy Optimization(GSPO)55。为此我们引入两个专门的奖励信号。第一个是过程奖励,衡量模型预测的轨迹与最优 ground-truth 工具调用序列之间的对齐程度56,惩罚不必要的或探索性的调用以鼓励简洁执行。第二个是我们施加的基于压缩率的重复惩罚,利用 zlib 压缩比。既然高度重复、退化的输出可压缩性很高,它们就会收到相应更重的惩罚,自然地促成简洁连贯的回答。

除了奖励设计,我们还通过一种叫 Dynamic Pass Rating(DPR)的新样本选择策略来提升训练效率。DPR 不依赖静态的历史通过率,而是基于训练行为动态评估任务难度。从时间维度看,训练早期就被解出的任务被判为容易;从稳定性维度看,通过率持续偏高的任务同样被这样归类。反过来,那些一直没解出或不稳定的任务被优先当作难任务。这构成一套自适应课程,让训练资源持续聚焦在模型当前能力前沿附近的信息量样本上。

3.1.3 双向偏好对齐

作为 Ling-2.6 效率导向后训练的最后一个阶段,我们引入一种双向 focus reward 机制。它在把模型与细粒度人类偏好对齐的同时,主动保住简洁、信息密度高的回答。与传统的单向模型不同,我们的设计把正向激励和负向惩罚整合进单一的奖励模型。这拓宽了打分范围,并给出信噪比显著更高的偏好梯度。为防止模型通过单纯拉长输出来 hack 奖励,我们设计了一种 focus reward 机制57。通过监测不同 rubric 维度上的 on-policy 饱和程度,训练权重被动态地从已饱和的指标转移到需要改进的维度上。

对于复杂任务,我们用专门的评估器来补充这套通用机制。对长文写作,我们提出 ReportLogic 框架58,它评估宏观结构和篇章组织,把优化目标从表面流畅性转向深层文本逻辑。对多面向的指令遵循,一个独立的验证 agent 把请求分解成显式的逐条规则来做细粒度校验。虽然这些任务特定的奖励只在各自领域内起作用,双向 focus reward 仍是通用查询的基本驱动力,保证 Ling-2.6 持续给出高质量、token 高效的即时响应。

3.2 Ring-2.6 的后训练

Ring-2.6 在 Ring-2.09的后训练底座之上,通过 specialist 训练进一步针对复杂、长程、工具密集的 agentic 行为做优化。目标不只是提升最终任务成功率,还要在真实执行约束下强化规划、搜索、工具使用和自适应交互。具体来说,我们构建一份跨编码、搜索和通用工具使用任务的大规模 agentic 后训练混合数据,把它与可复现的执行环境配对,并开发一条为可验证长程行为定制的 agentic 强化学习流水线。这些组件合起来定义了长程 agentic 优化阶段。

在跨推理与 agentic 任务的 specialist 训练完成之后,我们施加 specialist 蒸馏来进一步提升整体表现。此外,我们在训练流水线里引入了自适应思考,以同时适应日常使用和有挑战性的推理问题。自适应思考包含 SFT 和 RL 两个阶段。high 模式采用适度的长度惩罚,在推理深度与回答简洁之间取平衡;xhigh 模式采用极小的长度惩罚,为复杂推理问题最大化推理深度(推理努力度是怎么训出来的)。

Ring-2.6 的后训练流水线,从左到右:Ling-2.6 1T Base → Cold-Start SFT → Specialist of Ring(Agentic 侧覆盖 Tool Use、Search、Coding,Reasoning 侧覆盖 Logic、STEM、Math、Code,统一通过 Reasoning &amp; Agentic RL(KPop)训练)→ Specialist Distillation → Adaptive Thinking → Ring-2.6 1T(xhigh / high 两档)
Ring-2.6 的后训练流水线,从左到右:Ling-2.6 1T Base → Cold-Start SFT → Specialist of Ring(Agentic 侧覆盖 Tool Use、Search、Coding,Reasoning 侧覆盖 Logic、STEM、Math、Code,统一通过 Reasoning &amp; Agentic RL(KPop)训练)→ Specialist Distillation → Adaptive Thinking → Ring-2.6 1T(xhigh / high 两档)

3.2.1 工具使用数据

工具使用数据支撑在真实约束下持续执行 agentic 任务,强调三种互补能力:仓库级编码、跨移动端与 web 环境的信息搜寻,以及需要规划和从中间失败中恢复的通用工作流。在所有设定里,我们优先考虑可验证性、环境真实性和交互多样性。

编码 agent 任务

我们大规模挖掘 GitHub 上的 PR-Issue 配对,在真实软件工程工作流上训练编码 agent。从完整的 GH-Archive(2015 年 12 月至 2023 年,约 10 亿条记录)出发,我们只保留星数 $>$100 的仓库,要求 PR 已合并且关联到已关闭的 issue,并强制每个 PR 都包含一个测试 patch 以保证可验证性。与已有 SWE benchmark 重叠的仓库被排除以防污染。一个 LLM 负责把 PR 关联到对应的 issue,产出约 30 万条原始配对。结合附录 A 描述的可复现执行环境,这些实例为 agentic 强化学习提供了严格的任务。

搜索 agent 任务

移动 App 搜索。受 Meta ARE59启发,我们构建带有状态化应用(联系人、消息、邮件、日历、购物、打车、租房、文件)的合成个人数字宇宙。每个宇宙维持跨应用的实体一致性,并引入近似干扰实体和可做聚合的数值字段。可验证任务以「目标优先」的方式合成:先把可执行的操作链与确定性答案配对,再改写成自然的请求。规则式和验证器式的过滤会移除不一致的、或能被走捷径解出的实例。

Web 搜索。从 Wikipedia 图上的长尾种子实体出发,我们向外扩展以积累一组单独看都很模糊、但联合起来唯一确定一个答案的约束,然后用间接指代把它们改写成自然问题,以抵抗词汇层面的捷径。不做检索就能回答的实例被过滤掉。轨迹在真实工具执行下收集,只保留正确解,并过滤掉冗余的工具调用和走捷径式的模式。

这两个数据来源合在一起,强化了在真实交互与上下文约束下的信息搜寻能力,构成我们 agentic 后训练混合数据的一个重要组成。

通用 agent 任务

除了编码和搜索,自主 agent 还必须处理各类涉及多步规划、策略合规和错误恢复的工具使用场景。我们沿四个互补方向构建通用 agent 训练数据:

  • 策略遵从的多轮工具调用:一条五阶段流水线在业务策略约束下合成交互式任务,覆盖边界条件和递进难度。奖励信号由环境状态校验、工具调用序列匹配和自然语言断言组合而成,同时产出 SFT 轨迹和 RL 任务数据。
  • 与 harness 无关的工作流任务:覆盖办公、研究、编码、数据分析和文档理解的可验证工作流任务,被围绕可移植抽象(用户请求、工具 schema、observation、验证信号)做归一化,使其能跨执行 harness 复用(Harness 工程:模型之外那层系统如何自我改进)。
  • 大规模基于 MCP 的合成:我们在 197 个经过验证的 MCP 服务器上合成多轮轨迹,跨 12 个领域、2,400 多个工具,要求做工具选择、错误处理和组合。多层质量控制——包括对抗性服务器检测和跨批次去重——保证数据保真度。
  • 通用工具使用任务:我们扩展到 170 多个合成工具包($>$2,300 个可调用函数),跨搜索、电商、金融和科学计算。任务包括无关工具、长程单轮和交互式多轮三类设定54,每一类都对着环境状态和关键工具调用检查做验证。任务通过以种子为中心60和以关键工具链为中心的范式生成。

为维持训练效率,我们施加一种 Dynamic Pass Rating(DPR)策略,基于训练动态来选任务:早期就被掌握、或通过率持续偏高的任务被当作容易,一直解不出的被当作困难。这保证模型总是在其当前能力前沿上、信息量最大的样本上训练。

上述编码、搜索和通用数据合起来构成我们 agentic 后训练混合数据的核心。如 §3.3 所报告,这套数据配方在 SWE-bench、GAIA2 Search、BrowseComp、$\tau^2$-bench、PinchBench 和 ClawEval 上都取得有竞争力的结果,证实了跨编码、搜索和通用工具使用能力的一致改善。

3.2.2 Agentic 强化学习

有了任务混合数据和执行环境,我们通过一条为可验证长程行为设计的 agentic 强化学习流水线来训练 Ring-2.6。我们开发了一个建立在 function-calling 能力之上的轻量 agent 框架,给 agent 配三个核心工具:(1)execute_bash 执行通用 bash 命令,(2)search_replace 做精确的文件编辑,(3)task_done 用于发出任务完成信号。训练时最大对话长度设为 200 轮,评测时 500 轮。

我们从一个冷启动模型出发,在由 AEnvironment61支撑的沙箱环境里做强化学习。SWE 任务天生是长程的,通常需要 30 到 200 个求解步骤。为提升训练效率,我们施加若干过滤阶段以移除冗余和低质量实例:

  • 不稳定实例——gold patch 偶尔通不过给定测试的——被移除。
  • 非代码改动——gold patch 涉及源码之外改动的实例(例如只改配置或文档)——被排除。
  • 基于复杂度的筛选——我们把冷启动模型在每个实例上的通过率当作复杂度估计,只保留通过率落在 0.1–0.9 区间、且带有人类专家标注的清晰 issue 描述的那些。
  • 按仓库去重——为维持多样性,每个仓库最多保留 3 个实例。

得到的训练集包含约 2,500 个实例,来自 1,550 个仓库,跨越 30 多种编程语言,包括 Python、Java、C、Rust 和 JavaScript。

为防止模型通过信息泄漏来利用奖励信号,我们采用两种防护机制。第一,在受限的 Git 历史访问下,git log 命令里的 --all 标志被移除,把模型的可见范围限制在当前分支的提交历史。第二,在实时监控下,训练期间持续部署监控以检测 reward hacking 行为。我们的分析显示约 0.2% 的轨迹表现出作弊模式,实践中可以忽略。

3.2.3 KPop:用二元 KL 散度约束训推错配

在 Ring-1T9的发布中,我们提出了 IcePop,它利用双侧掩码来改善 MoE 模型上强化学习的训练稳定性。然而我们观察到,一个统一的常数比值约束隐含地假定了错配在各 token 上不成比例,这没能反映不同 token 概率所引发的异质训推差异。因此我们引入 KPop62,它用二元 KL 散度替换那个统一的固定比值约束,以更好地刻画高概率区与低概率区之间异质的 token 级错配。技术细节请参见我们的博客63

回顾 IcePop 的形式化表述:

$$ \begin{aligned} \mathcal{J}_{\text{IcePop}}(\theta) &= \mathbb{E}_{ x \sim \mathcal{D}, \{y_i\}_{i=1}^{G} \sim \pi_{\textcolor{red}{\text{infer}}} (\cdot \mid x; \theta_{\rm old}) } \Bigg[ \frac{1}{G} \sum_{i=1}^{G} \frac{1}{|y_i|} \sum_{t=1}^{|y_i|} \Bigg[ \mathcal{M} \Bigg( \frac{ \pi_{\textcolor{blue}{\text{train}}} (y_{i,t}\mid x,y_{i,IcePop 在一个固定的全局区间 $[\alpha, \beta]$ 内对策略概率比值施加统一的常数比值约束,外加双侧掩码,其中一个常数比值阈值对所有 token 一视同仁,不管它们的概率是多少。但现实里,比值中的噪声在各 token 上并不均匀,因为比值的偏离依赖于 token 概率62。因此 IcePop 倾向于过度掩掉低概率 token。

KPop 用一个对称的二元 KL 判据替换 IcePop 的常数比值界。对每个输出 token $y_t$,我们计算 $\pi_{\textcolor{blue}{\text{train}}}(y_t)$ 与 $\pi_{\textcolor{red}{\text{infer}}}(y_t)$ 之间的二元 KL 散度,它把整个词表看成一个二事件划分:当前采样到的 token 对比其余全部。

$$ D_{\text{KL}}^B\!\left( \pi_{\text{train}}(y_t) \;\|\; \pi_{\text{infer}}(y_t) \right) = \pi_{\text{train}}(y_t) \log \frac{\pi_{\text{train}}(y_t)}{\pi_{\text{infer}}(y_t)} + \left( 1-\pi_{\text{train}}(y_t) \right) \log \frac{1-\pi_{\text{train}}(y_t)}{1-\pi_{\text{infer}}(y_t)} $$

一个非对称的变体只检查单个方向,正向或反向。而对称的 KPop 掩码要求二元 KL 在两个方向上都足够小。

$$ \mathcal{M}_{\text{KPop}}(t) = \mathbf{1}\!\left[D_{\text{KL}}^B\!\left(\pi_{\textcolor{blue}{\text{train}}}(y_t) \| \pi_{\textcolor{red}{\text{infer}}}(y_t)\right) \leq \phi\right] \cdot \mathbf{1}\!\left[D_{\text{KL}}^B\!\left(\pi_{\textcolor{red}{\text{infer}}}(y_t) \| \pi_{\textcolor{blue}{\text{train}}}(y_t)\right) \leq \phi \right] $$

整个机制由单个超参数 $\phi$ 控制。

编码任务上 agentic RL 的训练动态,四张子图横轴都是训练 step(0 到约 790)。左上是 reward,从约 0.54 震荡上升到约 0.68–0.70;右上是 masked token ratio,在 0.21–0.34 之间起伏;左下是 $|\log \pi_{train} - \log \pi_{infer}|$,从 0.0247 升到约 0.0315 后回落到 0.0285 附近;右下是 $\log \pi_{train}$,在 $-0.42$ 到 $-0.30$ 之间波动
编码任务上 agentic RL 的训练动态,四张子图横轴都是训练 step(0 到约 790)。左上是 reward,从约 0.54 震荡上升到约 0.68–0.70;右上是 masked token ratio,在 0.21–0.34 之间起伏;左下是 $|\log \pi_{train} - \log \pi_{infer}|$,从 0.0247 升到约 0.0315 后回落到 0.0285 附近;右下是 $\log \pi_{train}$,在 $-0.42$ 到 $-0.30$ 之间波动

SWE-bench Verified 上的评测:横轴是 RL FLOPs,纵轴是得分,从约 70.9 起步、中途有若干次回落,整体上行至末尾的 76.28
SWE-bench Verified 上的评测:横轴是 RL FLOPs,纵轴是得分,从约 70.9 起步、中途有若干次回落,整体上行至末尾的 76.28

实证结果。得益于 KPop 的帮助,如图 7 所示,reward 曲线在整个训练过程中呈现稳定上行的轨迹,从初始的 0.54 升到约 0.68,说明策略在持续改进。图 8 给出 RL 训练期间获得的评测结果。值得注意的是,KPop 使得在这个轻量 agent 上做有效的 agentic RL scaling 成为可能,把 SWE-bench Verified 上的解决率从 70.8% 提升到 76.28%,展示了 KPop 用于大规模 agentic RL 的潜力。所有报告的评测结果都是三次独立运行的平均。

3.3 评测

本节我们给出 Ling-2.6 和 Ring-2.6 在覆盖知识、推理、agentic 行为、指令遵循和长上下文理解的一大批 benchmark 上的全面评测。这套评测的设计不只是要衡量总体能力,还要衡量两个模型家族各自不同的优化目标。具体来说,Ling-2.6 作为面向快速响应和 token 效率优化的 instant 模型被检验,而 Ring-2.6 作为具备更强推理与工具使用能力的长程 agentic 模型被评测。合起来,这些结果给出我们旗舰模型的能力画像与专门化方向的系统性视图。

3.3.1 Ling-2.6 的评测

我们给出 Ling-2.6 系列模型的全面评测,具体是高性能的 Ling-2.6-1T 和它的轻量对应版 Ling-2.6-flash。它们的能力在跨五个关键领域的多样 benchmark 上被评估:知识、推理、agentic 能力、指令遵循和长上下文理解。我们把它们的表现与一大批先进系统对比,包括领先的闭源模型在其 non-reasoning 或 instant 模式下的表现(例如 Kimi-K2.5、GPT-5.4、 GLM-5、Nemotron-3-Super、DeepSeek-V3.2)。

Benchmark

为全面评估 Ling-2.6 系列模型,我们在一大批 benchmark 上做评测,主要覆盖 5 个领域:知识、推理、agentic 能力、指令遵循和长上下文理解。

  • 知识:C-SimpleQA49(Correct)、SimpleQA-Verified48(Correct)、GPQA-Diamond64(Mean@4,CoT)、SuperGPQA46(EM,CoT)、Humanities-Last-Exam65(Mean@4)。
  • 推理:AIME 202666(Mean@64,CoT)、HMMT(Nov25、Feb26)67(Mean@64,CoT)、IMO-AnswerBench68(Mean@8,CoT)、LiveCodeBench-v669(Mean@4)、bbeh70(Pass@1)、ARCPrize71(Mean@4)。
  • Agentic:SWE-bench Verified72(Claude Code、openhands fc)、PinchBench73(Mean@5)、ClawEval74(Pass@3)、BFCL-V475(Accuracy)、$\tau^2$-bench76(Mean@4,用户模型为 gpt-5.2,含 Average、Retail、Airline、Telecom)、terminal-bench 2.077(Accuracy)。
  • 指令遵循:IFBench78(Mean@5)、LIFEBench79
  • 长上下文与对话:LongBenchv253(Accuracy)、MRCR80(Mean@16K-256K)、Multichallenge81(Accuracy)、Multi-IF82(turn-3)。

我们把我们的模型 Ling-2.6-1T 和 Ling-2.6-flash 与一批领先的开源模型作对比。对比对象包括闭源模型的各种 non-reasoning 或 instant 响应配置,例如 Kimi-K2.5、DeepSeek-V3.2、GPT-5.4、GPT-5.4-mini、GLM-5、GLM-4.5-Air、Nemotron-3-Super-120B-A12B 和 GPT-OSS-120B。

表 4:Ling-2.6-flash 与其他模型在各类 benchmark 上的对比。原文没有说明标记含义,按实际标法反推:加粗是该行所有模型里的最高分。-- 表示原文未给出数值。首列加粗、其余留空的整行是原文用 \multicolumn 做的能力分组行。

Benchmark Ling-2.6-flash Nemotron-3-Super 120B-A12B non-reasoning GPT-OSS-120B low GPT-5.4-mini non-reasoning
知识
C-SimpleQA 60.23 47.03 43.47 59.73
SimpleQA-Verified 15.10 17.1 12.1 16.5
Humanities-Last-Exam 6.30 11.26 4.59 5.61
推理
AIME26 73.85 88.59 60.10 35.68
HMMT-Feb26 49.29 76.23 35.89 21.73
IMO-AnswerBench 54.28 79.53 38.59 21.16
LiveCodeBench-v6 62.28 74.67 61.51 55.07
Agentic
SWE-bench-Verified 61.20 61.00 43.80
PinchBench 81.30 73.10 52.00 71.40
BFCL-v4 66.81 35.12 43.30 49.72
$\tau^2$-bench 76.36 68.92 23.48 46.92
ClawEval 64.56 56.00
指令遵循
IFBench 57.40 39.87 58.30 38.80
LIFEBench 57.20 44.60 49.40 57.60
长上下文与多轮对话
Multichallenge 39.71 35.16 37.73 34.43
Multi-IF (turn-3) 74.80 64.80 68.52 71.13
MRCR (16K-256K) 75.93 39.04 22.56 34.76

表 5:Ling-2.6-1T 与其他先进模型在不同 benchmark 上的对比。原文没有说明标记含义,按实际标法反推:加粗是该行所有模型里的最高分。/ 是原文的写法,表示未评测。

Benchmark Ling-2.6-1T GLM-5 non-thinking GPT-5.4 non-reasoning DeepSeek-V3.2 nothink Kimi-K2.5 Instant
知识
C-SimpleQA 76.53 71.97 70.57 68.37 76.80
SimpleQA-Verified 31.50 28.90 30.20 23.70 25.40
GPQA-Diamond 76.17 70.20 76.89 77.11 80.52
SuperGPQA 58.32 57.63 62.97 61.37 66.40
Humanities-Last-Exam 10.06 7.09 10.75 10.47 12.92
推理
LiveCodeBench-v6 65.58 52.09 70.76 57.71 73.40
bbeh 52.37 27.80 25.70 48.04 48.43
AIME26 87.40 49.22 72.92 66.41 66.98
HMMT-Nov25 81.93 46.09 47.76 53.44 61.20
IMO-AnswerBench 65.81 39.34 44.75 46.66 52.56
ARCPrize 50.94 12.31 26.00 20.06 31.19
Agentic
SWE-bench-Verified 72.20 73.80 69.20 66.40 66.80
PinchBench 85.24 83.29 73.40 85.38 85.48
ClawEval 51.00 40.38 43.26 46.15 48.08
BFCL-v4 70.64 67.57 56.09 60.05 62.96
$\tau^2$-bench 78.36 78.12 69.53 75.63 71.21
terminal-bench 2.0 40.45 48.31 46.07 29.21 48.30
指令遵循
IFBench 57.62 57.14 49.73 50.00 42.53
长文本
LongBenchV2 48.31 / 49.30 51.89 59.64
MRCR (16K-256K) 80.37 / 68.43 30.50 63.22

结果

表 4 和表 5 给出的评测结果,展示了 Ling-2.6 系列模型跨多个领域的强大而全面的能力。

知识。在知识类 benchmark 上,两个模型都表现强劲。Ling-2.6-1T 在 C-SimpleQA 上取得 76.53 的第一梯队成绩,在 SimpleQA-Verified 上取得压倒性的 31.50,超过大多数竞争者。虽然 Kimi-K2.5 在 GPQA-Diamond(80.52)和 Humanities-Last-Exam(12.92)这类高度专门化的考试上更有优势,Ling-2.6-1T 仍然极具竞争力。同时,轻量的 Ling-2.6-flash 以 60.23 的 C-SimpleQA 成绩领先其对比组,超过 GPT-5.4-mini(59.73)这类快模型。

推理。推理领域凸显了 Ling-2.6-1T 的突出实力。它在多数有挑战性的推理 benchmark 上取得最高分,从而建立起明显的领先地位,包括 AIME26(87.40)、HMMT-Nov25(81.93)、IMO-AnswerBench(65.81)、bbeh(52.37)和 ARCPrize(50.94)。这一表现显著超过其他 non-thinking / instant 模型。相比之下,虽然 Ling-2.6-flash 提供了扎实的基线推理能力(例如 AIME26 上 73.85),它被 Nemotron 3 Super 这类体量更大的开源权重模型超过,凸显了这个轻量模型上的性能—效率权衡。

Agentic 能力。在 agentic 任务上,两个模型都展现出稳健、常常是最先进的表现。Ling-2.6-1T 在 PinchBench(85.24)、ClawEval(51.00)、BFCL-v4(70.64)和 $\tau^2$-bench(78.36)上领先,展示了它的通用性,并在软件工程(SWE-bench-Verified)和终端操作任务上保持高度竞争力。更令人印象深刻的是,Ling-2.6-flash 在这个类别里表现突出。尽管是个轻量模型,它在 SWE-bench Verified(61.20)、PinchBench(81.30)和 $\tau^2$-bench(76.36)这类复杂任务上持续领先其对比组,说明它在工具使用和任务执行上有相当的天赋。

指令遵循与长上下文。模型遵循指令和处理长文本的能力都很出色。Ling-2.6-1T 在 IFBench 上取得 57.62 的领先分数,在 MRCR(16K-256K)上取得压倒性的 80.37,展示了优越的长上下文检索与理解能力。Ling-2.6-flash 在这个方面尤为出色,在所列的全部长上下文与对话 benchmark 上都果断超过同侪。它在 MRCR 上取得 75.93,是最接近的竞争者的两倍多,同时也在 Multichallenge(39.71)和 Multi-IF(74.80)上领先,印证了它在处理长而复杂的交互时出色的效率与效果。

Token 效率。我们在 Ling-2.6-1T 上做了 Artificial Analysis 智能指数评测,如图 1 上半部分所示。模型只用约 16M 输出 token 就取得 34 分,比 Ling-2.0-1T 的 token 效率好约 4 倍,与 GPT-5.4 在 non-reasoning 设置下相当。这凸显了我们后训练配方在 token 效率上取得的显著改进,使得用大幅更少的输出 token 完成高质量推理成为可能。

推理效率。除了 benchmark 质量,Ling-2.6-1T 主要瞄准最高能力档,因此部署要求也高得多;而 Ling-2.6-flash 是明确为部署时的推理效率而设计的。得益于混合注意力设计和高度稀疏的 MoE 架构,Ling-2.6-flash 的服务速度大幅快于同体量档位的先进模型,prefill 和 decode 都有最高 4 倍的加速。如图 9 所示,在 4$\times$H20 部署、batch size 32、4 路张量并行、输出长度 64K 的条件下,Ling-2.6-flash 的解码吞吐是 Nemotron-3-Super 的 1.3 倍、Qwen3.5-122B-A10B 的 2.4 倍、GLM-4.5-Air 的 4.3 倍。实践中,这样的效率画像让 Ling-2.6-flash 更适合延迟敏感、长输出、吞吐受限的 agentic 负载——在那些场景里响应速度是模型效用的一部分,而不是次要的系统考量。

Ling-2.6-flash 的 prefill 吞吐:横轴是上下文长度(512 到 65536),纵轴是以 GLM-4.5-Air 为 1.0 基准归一化的 prefill 吞吐。Ling-2.6-Flash(蓝色)从 512 时的约 1.5 倍升到 65536 时的约 4.65 倍,Qwen3.5-122B-A10B 到 2.7 倍,Nemotron-3-Super 到 2.1 倍
Ling-2.6-flash 的 prefill 吞吐:横轴是上下文长度(512 到 65536),纵轴是以 GLM-4.5-Air 为 1.0 基准归一化的 prefill 吞吐。Ling-2.6-Flash(蓝色)从 512 时的约 1.5 倍升到 65536 时的约 4.65 倍,Qwen3.5-122B-A10B 到 2.7 倍,Nemotron-3-Super 到 2.1 倍

Ling-2.6-flash 的 decode 吞吐:横轴是生成长度(512 到 65536),纵轴是以 GLM-4.5-Air 为 1.0 基准归一化的 decode 吞吐。Ling-2.6-Flash(蓝色)从约 1.05 倍升到 65536 时的约 4.4 倍,Nemotron-3-Super 到约 3.35 倍,Qwen3.5-122B-A10B 到约 1.9 倍
Ling-2.6-flash 的 decode 吞吐:横轴是生成长度(512 到 65536),纵轴是以 GLM-4.5-Air 为 1.0 基准归一化的 decode 吞吐。Ling-2.6-Flash(蓝色)从约 1.05 倍升到 65536 时的约 4.4 倍,Nemotron-3-Super 到约 3.35 倍,Qwen3.5-122B-A10B 到约 1.9 倍

3.3.2 Ring-2.6 的评测

本节我们给出 Ring-2.6-1T 在覆盖推理、OpenClaw、agentic 编码、agentic 搜索和 function calling 的一大批 benchmark 上的全面评测。我们把它的表现与领先的前沿模型对比,既包括开源权重也包括闭源模型,以刻画它的能力范围、识别强项与待改进之处。

Benchmark

为全面评估 Ring-2.6-1T,我们在一大批 benchmark 上做评测,主要覆盖 5 个领域:推理、OpenClaw、agentic 编码、agentic 搜索和 function calling。

  • 推理:AIME 202666(Avg@64)、LiveCodeBench-v669(2408-2505,Avg@4)、GPQA-Diamond64(Avg@16)、ARC-AGI-283(Pass@2)、HMMT-Feb2684(Avg@64)、IMO-AnswerBench68(Avg@8)。
  • OpenClaw:PinchBench73(Avg@3)、ClawEval74(0424,Pass^3)。
  • Agentic 编码(SWE 类 benchmark 我们用 Claude Code 作为脚手架来报告表现):SWE-bench Verified72(Resolved)、SWE-bench Pro85(Resolved)。
  • Agentic 搜索:GAIA-2 Search86(Pass@1,3 次运行)。
  • Function Calling:$\tau^2$-bench76(Average、Retail、Airline、Telecom)。

我们在两种推理配置下评测 Ring-2.6-1T:Ring-2.6-1T (xhigh) 使用扩展的思考预算以获得最大推理深度,Ring-2.6-1T (high) 为效率优化、降低推理开销。我们与领先模型对比,包括 Kimi-K2.6-Thinking、DeepSeek-V4-Pro87、ChatGPT-5.488、Gemini-3.1-Pro89、GLM-5.1-Thinking13、Claude-Opus-4.7-Thinking90和 Claude-Opus-4.6-Thinking。所有评测都在受控实验条件下使用标准化配置。

结果

表 6 给出 Ring-2.6-1T 与领先前沿模型的全面对比。下面各段按不同方面详细分析它的表现。

表 6:跨多个 benchmark 的性能对比。加粗是全场第一,斜体是全场第二(原文用下划线,markdown 无下划线故改用斜体)。$^\ast$ 表示结果来自我们自己的评测。原表把列分成三组——Ring-2.6-1T(xhigh / high 两档)、开源权重模型(Kimi-K2.6、GLM-5.1、DS-V4-Pro)、闭源模型(Claude Opus-4.6、Claude Opus-4.7、OpenAI GPT-5.4、Gemini 3.1-Pro)——markdown 表不支持合并单元格,这里把分组信息并进列名。ARC-AGI-2 那行 Claude Opus-4.6 的 $^\dagger$ 原文未作说明。

Benchmark Ring-2.6-1T xhigh Ring-2.6-1T high 开源:Kimi-K2.6 开源:GLM-5.1 开源:DS-V4-Pro 闭源:Claude Opus-4.6 闭源:Claude Opus-4.7 闭源:GPT-5.4 闭源:Gemini 3.1-Pro
推理
AIME 2026 (Avg@64) 95.78 87.86 96.40 95.30 95.83 96.67 96.41$^\ast$ 99.17 98.33
HMMT-Feb26 (Avg@64) 93.47 67.80 92.70 95.20 83.38$^\ast$ 94.08$^\ast$ 95.64$^\ast$
IMO-AnswerBench (Avg@8) 86.12 66.44 86.00 89.80 80.28$^\ast$ 87.31$^\ast$ 77.53$^\ast$
LCB-v6 (Avg@4) 86.95 76.71 89.80 82.49$^\ast$ 85.68$^\ast$ 85.46$^\ast$ 81.39$^\ast$ 93.28$^\ast$
GPQA-Diamond (Avg@16) 85.89 76.10 91.10 86.20 90.10 91.30 94.20 92.80 94.30
ARC-AGI-2 (Pass@2) 66.18 - 29.38$^\ast$ 21.74$^\ast$ 62.43$^\ast$ 68.80$^\dagger$ 75.80 74.00 77.10
OpenClaw
PinchBench (Avg@3) 87.60 70.30$^\ast$ 74.95 75.83 79.95 80.00
ClawEval (0424, Pass^3) 63.82 62.30 62.30 59.80 70.40 60.30 57.80
Agentic 编码
SWE-bench-Verified (Resolved) 74.00 80.20 - 80.60 87.60 80.60 80.60
SWE-bench-Pro (Resolved) 53.76 58.40 64.30 59.10 54.20
Agentic 搜索
GAIA-2 Search (Pass@1, 3 runs) 77.90 75.40 76.04 75.63$^\ast$ 78.33$^\ast$ 73.75$^\ast$ 67.92$^\ast$ 82.71$^\ast$ 80.83$^\ast$
Function Calling
$\tau^2$-Average (Acc) 83.44 84.26 84.28$^\ast$ 88.74$^\ast$ 87.73$^\ast$ 85.93$^\ast$ 83.63$^\ast$ 84.42$^\ast$
$\tau^2$-Retail (Acc) 77.85 78.07 72.15$^\ast$ 85.09$^\ast$ 81.80$^\ast$ 81.80$^\ast$ 74.34$^\ast$ 83.77$^\ast$
$\tau^2$-Airline (Acc) 77.50 78.00 82.00$^\ast$ 82.00$^\ast$ 82.50$^\ast$ 88.50$^\ast$ 80.50$^\ast$ 76.50$^\ast$
$\tau^2$-Telecom (Acc) 94.96 96.71 98.68$^\ast$ 99.12$^\ast$ 99.30$^\ast$ 87.50$^\ast$ 96.05$^\ast$ 99.30$^\ast$

译注:图 1 下半部分那组柱状图里 Ring-2.6-1T 的几个数字与表 6 对不上:AIME 26 图里 95.83、表里 95.78;GPQA Diamond 图里 88.27(Pass@1)、表里 85.89(Avg@16);Gaia2-search 图里 75.40 标的是 high 档、与表里 high 档一致,但图的口径写作 Mean@3、表里写 Pass@1(3 runs)。ARC-AGI-V2 的 66.18、PinchBench 的 87.60、ClawEval 的 63.82、SWE-Bench Verified 的 74.00 则两处一致。原文两处并存,本译文照抄未改。

推理。Ring-2.6-1T 在有挑战性的 benchmark 上展现出强推理能力。在 AIME 2026 上,Ring-2.6-1T (xhigh) 取得 95.78%,在头部前沿模型中处于有竞争力的位置。在 LiveCodeBench-v6(2408–2505)上它取得 86.95%,在开源权重模型中排第二、仅次于 Kimi-K2.6-Thinking(89.80%),并以 4 个百分点以上的差距超过 GLM-5.1-Thinking(82.49%)。在 ARC-AGI-2 上,Ring-2.6-1T (xhigh) 达到 66.18%,是开源权重模型中的第一,展现出强的抽象推理与模式识别能力。这些结果凸显了模型稳健的推理表现,其驱动力来自我们可扩展的强化学习训练配方。

OpenClaw。Ring-2.6-1T 在通过 OpenClaw benchmark 评测的任务上表现优异。在 PinchBench 上,Ring-2.6-1T (high) 取得所有参评模型中最高的 87.60%,以 7 个百分点以上的显著优势超过 Gemini-3.1-Pro(80.00%)和 ChatGPT-5.4(79.95%)。在 ClawEval(0424,pass$^3$)上,Ring-2.6-1T (high) 取得 63.82%,在开源权重模型中排第一,超过 Kimi-K2.6-Thinking(62.30%)和 GLM-5.1-Thinking(62.30%)。

Agentic 编码。在 agentic 编码 benchmark 上,Ring-2.6-1T 展现出有希望的能力。在 SWE-bench Verified 上,Ring-2.6-1T (high) 取得 74.00%,缩小了与 Kimi-K2.6-Thinking(80.20%)和 DeepSeek-V4-Pro(80.60%)这类领先开源权重模型的差距。在 SWE-bench Pro 上它取得 53.76%,与 GLM-5.1-Thinking(58.40%)有竞争力。这些结果反映出它在需要多文件推理和迭代调试的复杂真实软件工程任务上有扎实的底子。

Agentic 搜索。在 GAIA-2 Search 上,Ring-2.6-1T (xhigh) 取得 77.90%,展现出 web 搜索场景下强的多跳推理与信息检索能力。这一表现让它与 DeepSeek-V4-Pro(78.33%)处在有竞争力的位置,落后于领先的 ChatGPT-5.4(82.71%)和 Gemini-3.1-Pro(80.83%)。值得注意的是,模型超过了若干强基线,包括 GLM-5.1-Thinking(75.63%)和 Claude-Opus-4.6-Thinking(73.75%),说明它有效地整合了搜索增强推理。

Function Calling。Ring-2.6-1T 在 $\tau^2$-bench 套件76上展现出稳健的 function calling 能力。high 变体取得 84.26% 的 $\tau^2$-Average,与 Gemini-3.1-Pro(84.42%)和 Kimi-K2.6-Thinking(84.28%)有竞争力。在 $\tau^2$-Telecom 上,Ring-2.6-1T (high) 取得 96.71%,展示了在领域特定工具使用上的强表现。这些结果印证了模型在结构化 API 交互和多轮 function calling 场景下的可靠性,而这些对真实世界的 agentic 应用至关重要。

4 基础设施

系统栈是能力和成本的一阶决定因素。简单说,主要挑战不只是让每个组件孤立地能跑起来,而是在万亿参数规模和高度多变的负载下保住吞吐、数值稳定性和调度效率。因此本节描述支撑 2.6 家族的基础设施协同设计,覆盖三个层次:长上下文预训练与后训练的训练效率、大规模异步 agentic 优化的 RL 效率,以及服务的推理效率。

4.1 长上下文训练

2.6 家族的长上下文训练不是 Ling-2.0 那套栈的直接延伸。引入混合线性注意力、并把训练推到长得多的序列长度之后,我们发现分布式训练策略和内存管理策略都必须重新考虑,才能保住端到端效率。因此我们在基础设施上的应对聚焦于三个互相耦合的问题:Lightning Attention 的可扩展 context parallelism、高度碎片化的变长负载下的 kernel 效率,以及长上下文 MoE 训练的吞吐—稳定性平衡。

4.1.1 Lightning Attention 的 Context Parallel

Linear Attention 通过一种 RNN 式的递推把复杂度从 $O(N^2)$ 降到 $O(N)$,使它成为长上下文训练的一个关键原语。然而它沿序列维度的顺序依赖,使得为 Softmax Attention 设计的传统 Context Parallel(CP)方案无法直接移植过来(Context Parallel):Ring Attention 依赖 online-softmax 校正,这对递推状态累加不适用;而 DeepSpeed Ulysses 要求 cp_size 能整除 head_num,在极端上下文长度下限制了可扩展性。

基于 AllGather 的 CP。我们为 Linear Attention 引入一种 AllGather CP 设计,建立在先局部递推、再全局校正的原则上,如图 10 所示:

  • GPU 内阶段:每个 rank 在自己的序列 shard 上独立计算局部隐状态 $h^{(k)}$ 和局部输出 $O^{(k)}$,完全复用高度优化的 FLA kernel,不做算法改动。
  • GPU 间阶段:对 $[B,H,D,D]$ 的局部状态发起一次 AllGather;每个 rank 随后沿递推折叠前面的状态并校正自己的局部输出。由于 FLA 从两个独立的 kernel 里发出 $h^{(k)}$ 和 $O^{(k)}$,这次 AllGather 可以与局部 $O$ 的计算重叠,有效地把 rank 间通信成本隐藏起来。

这个设计不受 head 整除性约束,并且随 cp_size 线性扩展,在超长上下文场景下提供严格优于 All2All 式方案的可扩展性。

Lightning Attention 的 CP 优化。两个 cp rank 各自从 chunk QKV 出发算 local h,随后一次 AllGather h 与两个 rank 的 cal local O 计算重叠(图中标为 Overlapping 的区域),最后各 rank 依次做 Fused update h 和 Fused update O
Lightning Attention 的 CP 优化。两个 cp rank 各自从 chunk QKV 出发算 local h,随后一次 AllGather h 与两个 rank 的 cal local O 计算重叠(图中标为 Overlapping 的区域),最后各 rank 依次做 Fused update h 和 Fused update O

4.1.2 变长序列的 kernel 融合

cp_size 较大的长上下文训练里,变长输入常常包含大量短子序列。在这类负载下,朴素实现会频繁启动 kernel,转化为可观的 CPU 侧开销和明显下降的 GPU 利用率,这个效应在反向传播里尤为突出。我们的缓解办法是把状态校正的递推解析地展开成向量化的矩阵形式,并把每个子序列的输出校正合并进一个 Triton 融合 kernel,在 256K 上下文长度下共同带来约 68% 的端到端加速。

4.1.3 吞吐与稳定性的平衡

MoE 模型的长上下文训练会在各 GPU 之间造成计算负载和内存使用的严重不均衡,影响性能和稳定性。关键问题包括 router 负载均衡的波动,以及块对角因果掩码带来的负载不均,两者都随上下文长度加剧。

我们面向吞吐的策略把并行方式(expert、pipeline 和 context parallelism)与选择性激活重计算协同设计,以最大化内存利用、最小化额外开销。然而,在贴近 GPU 内存上限运行会带来风险:router 突然失衡时可能 OOM。

为管理这一点,我们按训练阶段采用不同的内存策略:

  • 预训练:激进使用 GPU 内存以获得更高的 FLOPs 利用率。
  • 长上下文后训练:保守使用 GPU 内存以吸收波动,优先保证稳定性。

我们还发现一个关键的 scaling 问题:一些已有的 MoE kernel 实现假定 token 计数能装进 32 位整数。在长上下文训练里,expert 的 token 计数可能超过这个上限,导致溢出或崩溃。我们的处理办法是审查并修改关键路径,改用 64 位整数(int64)做索引和计数,以保证大规模下的鲁棒性。

总的来说,我们通过阶段特定的内存策略和这些基础性修复,在高吞吐和稳定性之间取得平衡,使超长上下文上的可靠分布式 MoE 训练成为可能(Megatron Core 的 MoE 训练:打破内存、通信与计算三堵墙)。

4.2 强化学习基础设施:ASystem

Ling-2.6 和 Ring-2.6 的 RL 建立在 ASystem 之上,那是我们此前在 Ring-2.09中引入的 RL 框架。通过可插拔的训练、推理和 reward 后端,ASystem 让每个组件都能独立扩展和调试。通过把控制流与数据流分离,它有效缓解了传统 SingleController 架构中的单点数据流瓶颈。在 Ling-2.6 和 Ring-2.6 里,ASystem 瞄准三项基础设施需求:高效的长序列 rollout 调度、稳定的低精度训推对齐,以及多轮 agentic RL 轨迹的原生收集。

用 ARouter 做全局 rollout 调度。ARouter 是 RL rollout 的全局请求路由器,如图 11 所示。它最小化的不是单个请求的延迟,而是 step 的完成时间——因为少量长解码请求就能拖住整个 rollout batch,让很多 GPU 空转。

ARouter 架构,副标题为「Global routing for rollout acceleration, overlap, and failover」。自上而下四层:Layer 1 Rollout Worker Groups(Group A/B/N,每个 RL step 提交批量 rollout 请求);Layer 2 ARouter Global Control Plane(Global Scheduler 做 step 级负载均衡、Long-Tail Router 做尾请求迁移、Health &amp; Failover 做故障隔离与重路由);Layer 3 Inference Execution(Main Inference Group 主 rollout 执行,经 Spillover 到 Spillover Inference Group 承接尾请求);Layer 4 Training Engine(梯度累加与尾部解码重叠)
ARouter 架构,副标题为「Global routing for rollout acceleration, overlap, and failover」。自上而下四层:Layer 1 Rollout Worker Groups(Group A/B/N,每个 RL step 提交批量 rollout 请求);Layer 2 ARouter Global Control Plane(Global Scheduler 做 step 级负载均衡、Long-Tail Router 做尾请求迁移、Health &amp; Failover 做故障隔离与重路由);Layer 3 Inference Execution(Main Inference Group 主 rollout 执行,经 Spillover 到 Spillover Inference Group 承接尾请求);Layer 4 Training Engine(梯度累加与尾部解码重叠)

为降低尾延迟,ARouter 跟踪推理实例的负载和生成进度,然后把处于后期阶段的尾请求从拥塞实例迁移到空闲实例。它还支持基于 spillover 的训推重叠:残余的尾请求被卸载到一个专用推理组,同时主推理组释放算力、开始训练侧的梯度累加。尾部结果在模型更新前被合并,使训练计算能藏在 rollout 内部,在长序列场景下把端到端性能提升 80% 以上。

ARouter 还提供推理实例的 failover。不健康的实例被从调度中移除,受影响的请求被重路由到健康节点,请求级的流式 checkpoint 保住增量生成状态。这避免了整 step 重跑,降低了长时间 rollout step 的恢复成本。

FP8 训练与推理的一体化。ASystem 把 FP8 训练和推理整合起来,在保持 RL 稳定性的同时提升吞吐(混合精度训练:fp16 到 fp8)。由于 Ling-2.6 从预训练一路到监督微调都用 FP8 训练,FP32 的 optimizer master weight 比反量化出来的 BF16 模型权重保留了更高精度的信息。在 RL 初始化时加载这些 master weight,能改善 BF16 和 FP8 两种续训方式的早期 reward 增长。

为减少训推错配,ASystem 在 Megatron 训练引擎和 SGLang 推理引擎里都用 FP32 计算 LM Head,带来约两个点的 reward 改善。对其余层,ASystem 采用模块感知的 FP8 量化,而不是统一施加 Blockwise FP8 Linear。Attention Linear 和 Shared Experts Linear 保持 BF16,而 Routed Experts Linear 用 Blockwise FP8。这既保住了数值敏感的 attention 计算,又量化了占参数量 90% 以上的 MoE 部分。在 Max 1T 128K 的 RL 设定下,这个设计控制住了 log 概率漂移,在长时间评测中与 BF16 基线持平,并把端到端吞吐提升 30%。

Agentic RL 支持。ASystem 通过把 agent 执行与分布式推理、训练解耦来支持多轮 agentic RL。agent 通过 HTTP 调用标准的 OpenAI Chat Completions API,而一个 proxy 层把请求路由到 SGLang、记录交互、并为训练构建轨迹树。每个 prompt 可以跑多个独立 session,并做 session 级的故障隔离,这样某次 agent 运行失败不会阻塞整个 batch。

为支持多轮 agent 交互中的训练信号组织,ASystem 支持 individual 模式——只在当前回复上算 loss、逐轮训练;以及 concat 模式——用终端 reward 训练完整轨迹。对复杂 agent,它能检测重试和探索分支、抽出主链,并可选地在分支上训练或共享 reward,把学习聚焦在关键决策上。

4.2.1 异步 RL

Ring-2.6 进一步用异步 RL 执行扩展 ASystem,以应对长尾的推理 rollout 和环境绑定的 agentic 负载。数学、编码、逻辑和 STEM 这类推理任务会产生尾部生成远长于平均的思维链。编码、搜索和工具使用这类 agentic 任务,还会从代码沙箱、终端会话、检索服务和工具/MCP 端点引入额外延迟。一条同步的锁步 RL 流水线会让 trainer 一直等最慢的那个 rollout。因此 ASystem 聚焦于持续给 trainer 喂数据,同时约束异步执行引入的策略 staleness。

Partial-Rollout 流水线。Ring-2.6 的 RL 不是把 rollout 和训练完全解耦,而是跑在一个 partial-rollout 机制里:每个优化 step 由一个全局的 rollout 生成 token 预算来把闸,思路上沿袭 C3PO++9。一个 rollout 控制器通过重叠批次分发器持续向推理引擎派发 prompt,在此前的轨迹还在收集时就提交新工作,这样推理池在 batch 边界处不会被抽干。随着轨迹到达,控制器跟踪累计生成的 token 数与每轮预算 $\Phi$ 的关系。完成的轨迹被路由到 ASandbox 做 verifier 式或工具驱动的 reward 计算;预算耗尽时仍在飞行中的轨迹被暂停,连同它们的 KV-cache 指纹一起持久化进一个跨版本的 rollout buffer,并在后续某轮里由下一个策略版本恢复。trainer 随后在收上来的这批数据上做一次优化 step,并触发推理引擎上的权重更新。通过按 token 数而不是按最慢轨迹来限制每个 step,这个做法避开了完全同步 rollout 会带来的长尾开销,同时仍让 rollout 与训练之间的边界保持确定、易于 checkpoint。

由于轨迹现在可能由不同策略版本生成的片段拼装而成,我们通过一个专门的 staleness 管理器来管理由此产生的版本偏斜。每个 rollout 片段都带上生成时推理引擎的策略版本标签;管理器只在 max_staleness $\times$ consumer_batch_size 这个可配置的界限内允许新 rollout 进池,并丢弃或退役那些与 trainer 版本差距超出该界限的片段。结果是一个有界 staleness 的机制:RL 算法可以把这些 rollout 当成近似 on-policy,同时系统榨取到 partial-rollout 执行带来的吞吐。配合 ASystem 亚秒级的权重广播,Ring-2.6 强化学习期间的有效 staleness 被限制在仅几个优化 step 内,而我们观察到相比同步基线在稳定性和最终 reward 上都没有损失。

异步 agentic rollout。partial-rollout 流水线是我们能在自身规模下以可处理方式跑 agentic RL 的原因。对编码任务,轨迹在一个容器化的仓库里运行,调用工具做构建、测试和 shell 访问;对搜索任务,它们通过调用外部服务做检索、浏览和推理;对工具使用任务,它们与一个多轮客服模拟器交互,模拟器的状态在推理引擎之外被跟踪。每种情形下,rollout 都是一串交互(模型生成、环境步进、模型生成、$\dots$),其每步延迟高度可变,且由环境而不是 GPU 主导。

栈的三个性质让这类负载得以高效运行。第一,推理引擎和环境是独立扩缩的:数千个 ASandbox 副本处理各种环境,rollout 控制器把每次工具调用建模成一个 awaitable,保证 GPU 绝不会被挂起来等一个 pending 的 HTTP/MCP 请求。第二,重叠批次分发器在任何一条飞行中的轨迹产出部分结果时就持续续填推理引擎,同时 token 预算的截断把病态长轨迹的成本限制住——把它们放进 rollout buffer 交给下一个策略版本;这两个机制合起来,保证一次代码 patch 或一次浏览会话的长尾不再让 GPU 空转。第三,统一的 verifier 接口覆盖各类推理任务、编码 harness、工具使用模拟器和浏览器,它们全部通过 ASandbox 之下的单一 HTTP/MCP 契约呈现,使 trainer 能在同一次运行里把推理数据集和 agentic 数据集混在一起,而不需要任务特定的调度。

4.3 算子融合

在 Ling-2.6 的预训练期间,我们通过大量算子融合显著提升了训练效率。在推理一侧,我们进一步把这些融合 kernel 适配到真实部署场景,让它们的融合粒度和数值行为尽可能与训练阶段对齐。这个设计不仅提升推理效率,还减少了 RL rollout 期间的训推偏差。这些推理 kernel 已通过 linghe91开源。为支持不同的精度设置,我们在推理阶段做了系统性优化。

BF16 推理:我们对 QK Norm + RoPE、Group RMSNorm + Sigmoid Gate 等关键算子实现了融合。我们还为 MoE Router GEMM 和 LM Head GEMM 都采用 BF16 输入 + FP32 输出的计算路径,并进一步优化了 MLA RoPE 和 Top-K 的实现。

FP8 推理:我们进一步把 RMS Norm、SwiGLU 与量化融合起来,并为小 batch 场景引入 Split-K Blockwise FP8 GEMM,以释放额外的吞吐收益。

合起来看,这些优化构成一次跨 kernel 融合、prefix caching 机制和多 token 生成的系统级协同设计。结果不只是更高的整体系统吞吐,还有更高的单用户 TPS、更短的等待时间,以及真实使用中更稳定流畅的交互体验。

用 linghe 做推理优化。左两列是 attention:融合前依次为 layernorm、quantize、qkvg proj、split、qk norm、rope、attention、group norm、sigmoid、mul、quantize、out_proj,MLA q rope 与 MLA kv rope 分开;融合后合并为 layernorm + quantize$^\ast$、qkvg proj、split + qk norm + rope、attention with MTP、group norm + sigmoid gate + quantize、out_proj,以及合并的 MLA q + kv rope。右两列是 MoE:融合前依次为 layernorm、fp32 cast、router gemm、group topk、quantize、fc1、SiLU、quantize、fc2、scale、combine;融合后合并为 split-k router gemm、fast group topk、quantize、fc1、SiLU + quantize + scale、fc2、combine
用 linghe 做推理优化。左两列是 attention:融合前依次为 layernorm、quantize、qkvg proj、split、qk norm、rope、attention、group norm、sigmoid、mul、quantize、out_proj,MLA q rope 与 MLA kv rope 分开;融合后合并为 layernorm + quantize$^\ast$、qkvg proj、split + qk norm + rope、attention with MTP、group norm + sigmoid gate + quantize、out_proj,以及合并的 MLA q + kv rope。右两列是 MoE:融合前依次为 layernorm、fp32 cast、router gemm、group topk、quantize、fc1、SiLU、quantize、fc2、scale、combine;融合后合并为 split-k router gemm、fast group topk、quantize、fc1、SiLU + quantize + scale、fc2、combine

表 7:不同精度与 batch size 设置下的吞吐对比。输入长度为 16,384,其中共享前缀 8,192 token。

Baseline(tokens/s) MTP(tokens/s) MTP+linghe(tokens/s)
BF16 (BS=1) 186 257 (+38%) 297 (+60%)
BF16 (BS=16) 1075 1114 (+4%) 1233 (+15%)
FP8 (BS=1) 155 236 (+51%) 341 (+119%)
FP8 (BS=16) 1078 1173 (+9%) 1664 (+54%)

5 结论、局限与未来方向

在本报告中,我们提出了 Ling-2.6 和 Ring-2.6,一个面向万亿参数级实用 agentic 智能的模型家族。这个模型家族说明,在这个规模上的进步,更少来自单纯的模型体量,更多来自架构、后训练、系统和 agent 训练环境之间更紧密的协同设计。在这个框架下,本报告推进三个目标:高效的长上下文处理、更高的每输出 token 能力,以及更可靠的环境接地 agentic 行为。Ling-2.6 被开发为一条 instant 模型线,面向快速响应、强 token 效率,以及部署约束下的广泛实用性做优化;而 Ring-2.6 被开发为一条更深思考的模型线,面向复杂推理和长程 agentic 任务。合起来看,2.6 家族不应该只被理解成一批新模型,而应该被理解成一条通向高效、开放、日益面向实用的 agentic 系统的具体路径。

尽管有这些进展,仍有几个重要瓶颈没有解决。Ling-2.6-flash 获得了可观的吞吐和 token 经济性,但它更紧的思考预算必然限制了高复杂度场景下的推理深度、指令的组合性和工具使用可靠性。当前的 token 效率目标也是不完整的。它能有效压缩程序性推理,但在知识密集的输出里,它并不总能干净地把低价值重复与必要的事实性展开区分开来。此外,长程 agentic 鲁棒性仍弱于短程能力:模型能做出很好的局部决策,但在跨长工作流、变动的工具状态和异质执行环境时,可靠性会退化。最后,对齐和评测仍不如期望中稳定:模型在高度受限的 prompt 下会跨语言漂移,而现有的公开 benchmark 对坚持性、恢复行为、成本感知规划和部署时鲁棒性仍然测量不足。

Ling 和 Ring 的下一阶段应该延续这种协同设计视角,同时把这个家族推向更高的能力上限。简单说,进一步的收益将取决于跨架构与系统的更深效率协同设计,包括模型 scaling、更先进的架构设计、低精度训练与推理、KV cache 管理,以及 Muon92这类下一代优化配方。另一个同等重要的转变是从纯文本系统走向原生多模态 agent。实用的 agent 必须在视觉界面、文档、代码工件和混合模态环境上操作,所以未来的 Ling 和 Ring 模型应该把当前架构和 agentic RL 栈扩展到原生多模态,而不是依赖松耦合的外部感知模块。评测也必须朝同一方向演进。合起来看,这些方向为我们下一阶段的 agentic 系统定义了一份紧凑的研究议程:更大更强的模型、跨整个栈更紧的效率协同设计,以及更贴近部署的多模态 agent。

附录 A:Agentic 编码环境

编码环境的构建工作流,六个步骤成环:(1) Explore Repo(CLAUDE,用 search / read / glob,产出 repo context)→ (2) Write Dockerfile(MCP,用 write_file,产出 Dockerfile)→ (3) Build Image(MCP,用 docker_build,产出 image:tag)→ (4) Write eval.sh(MCP,用 write_file,产出 eval.sh)→ (5) F2P Check(MCP,用 run_test,产出 pass)→ (6) Overall Check(MCP,用 validate,逐项核对 Image exists、Dockerfile exists、eval.sh exists、F2P passed)→ 回到 (1)
编码环境的构建工作流,六个步骤成环:(1) Explore Repo(CLAUDE,用 search / read / glob,产出 repo context)→ (2) Write Dockerfile(MCP,用 write_file,产出 Dockerfile)→ (3) Build Image(MCP,用 docker_build,产出 image:tag)→ (4) Write eval.sh(MCP,用 write_file,产出 eval.sh)→ (5) F2P Check(MCP,用 run_test,产出 pass)→ (6) Overall Check(MCP,用 validate,逐项核对 Image exists、Dockerfile exists、eval.sh exists、F2P passed)→ 回到 (1)

Agentic 编码任务通常运行在一个隔离环境里,agent 在其中与文件和系统工具交互来解决给定问题。因此可复现的执行环境对训练和评测都至关重要,它们提供了忠实 rollout 与验证所需的基础设施。我们采用 Claude Code + MCP 的方式,为每个实例自动生成 Docker 镜像。核心想法是让 Claude Code 探索一个仓库的代码库和文档、收集足够上下文,然后产出一个能用的 Dockerfile。为缓解幻觉、保证可靠性,LLM 被约束只能通过一组指定的 MCP 工具与环境交互。举例来说,镜像构建只能通过 build_image 工具触发,该工具通过 Dockerfile 的 COPY 指令把一份干净的仓库快照复制进镜像,并保证镜像内的仓库保持未被修改。类似地,verify_task_completion 工具检查所有必需的产物——包括 Dockerfile、评测脚本和构建好的镜像——都在,且 Fail2Pass 验证通过。图 13 展示了这条构建工作流。通过把 LLM 驱动探索的灵活性与规则式工具校验结合起来,我们快速可靠地生产了约 22 万个 Docker 镜像。

附录 B:带续训的 Multi-Token Prediction

除了 SFT 数据精炼和 RL 优化,Ling-2.6 还通过多 token 预测(MTP)在续训期间进一步提升推理效率(MTPSpeculative Decoding:投机解码)。MTP 既能提升 base 模型的表现,也能作为 speculative decoding 的 draft 模型,从而大幅加速推理。然而,一个标准的 MTP 层9394只被训练来预测下一个 token。当它在推理时被用来预测多个 token 时,就出现了训练与推理之间的偏差95,这会降低接受长度。为缓解这个问题,训练时必须引入多个 MTP 层。因此我们在后训练阶段加入两个额外的 MTP 层,并对这些 MTP 层继续训练。

如表 8 所示,在相同的投机步数(即四步)下,在我们的私有评测数据集上,经过续训的 MTP 模型相比标准 MTP 模型在接受长度上取得中等程度的提升。我们还观察到,只用第一个 MTP 层来预测所有后续 token 会带来接受长度的明显增加。这说明在续训设定下,新引入的那些 MTP 层可能仍然训练不足。为进一步检验这个假设,我们在不同 MTP 层之间共享参数96,并把除第一层之外所有 MTP 层的梯度 detach 掉,从而阻止它们传播到 base 模型。结果显示这个策略进一步提升了推理时的接受长度,同时降低了内存开销。

表 8:不同 MTP 架构的接受长度对比。

MTP-1 MTP-3 MTP-3-1 MTP-3-share
接受长度 2.71 3.23 3.29 3.31

  1. Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale, https://arxiv.org/abs/2606.15079 ↩︎

  2. Introducing Claude Opus, Anthropic ↩︎

  3. Introducing GPT-5.5, OpenAI, 2026 ↩︎

  4. Gemini 3.1 Pro, Google DeepMind ↩︎

  5. Ling Team, Every Activation Boosted: Scaling General Reasoner to 1 Trillion Open Language Foundation, 2025, https://arxiv.org/abs/2510.22115 ↩︎ ↩︎ ↩︎ ↩︎

  6. Ainslie 等, GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints, 2023, https://arxiv.org/abs/2305.13245 ↩︎

  7. Qin 等, TransNormerLLM: A Faster and Better Large Language Model with Improved TransNormer, 2024, https://arxiv.org/abs/2307.14995 ↩︎

  8. DeepSeek-AI, DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model, 2024, https://arxiv.org/abs/2405.04434 ↩︎

  9. Ling Team, Ring-1T: Scaling Trillion-parameter Thinking Model with Reinforcement Learning, 2025, https://arxiv.org/abs/2510.18855 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  10. Qwen Team, Qwen Studio, 2026 ↩︎

  11. DeepSeek-AI, DeepSeek-V4-Pro, 2026, https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro ↩︎

  12. Kimi K2.6 Technical Report, Moonshot AI ↩︎

  13. GLM-5.1: Long-Horizon Tasks, Z.ai ↩︎ ↩︎

  14. Su 等, RoFormer: Enhanced Transformer with Rotary Position Embedding, 2024, https://arxiv.org/abs/2104.09864 ↩︎

  15. Ling Team, Attention Matters: Efficient Hybrid Linear Attention, 2025 ↩︎

  16. Meng 等, TransMLA: Multi-Head Latent Attention Is All You Need, 2025, https://arxiv.org/abs/2502.07864 ↩︎ ↩︎

  17. Zeng 等, DaVinci, 2026 ↩︎

  18. fastText, https://fasttext.cc/ ↩︎

  19. FineWeb2, https://huggingface.co/datasets/HuggingFaceFW/fineweb-2 ↩︎

  20. FineWeb2-HQ, https://huggingface.co/datasets/epfml/FineWeb2-HQ ↩︎

  21. Cobbe 等, Training Verifiers to Solve Math Word Problems (GSM8K), https://arxiv.org/abs/2110.14168 ↩︎

  22. CMath, https://arxiv.org/abs/2306.16636 ↩︎

  23. MathBench, https://arxiv.org/abs/2405.12209 ↩︎

  24. OlympiadBench, https://arxiv.org/abs/2402.14008 ↩︎

  25. Omni-MATH, https://arxiv.org/abs/2410.07985 ↩︎

  26. GaoKao 2023 En, https://arxiv.org/abs/2305.12474 ↩︎

  27. Llmeval-Gaokao2024-Math, https://github.com/llmeval/Llmeval-Gaokao2024-Math ↩︎

  28. AGIEval, https://arxiv.org/abs/2304.06364 ↩︎ ↩︎

  29. EvalPlus (HumanEval-Plus / MBPP-Plus), https://arxiv.org/abs/2305.01210 ↩︎

  30. HumanEval-FIM / Efficient Training of Language Models to Fill in the Middle, https://arxiv.org/abs/2207.14255 ↩︎

  31. MBPP-Plus, https://arxiv.org/abs/2305.01210 ↩︎

  32. LiveCodeBench, https://arxiv.org/abs/2403.07974 ↩︎

  33. BIRD-SQL, https://arxiv.org/abs/2305.03111 ↩︎

  34. BBH (Big-Bench Hard), https://arxiv.org/abs/2210.09261 ↩︎

  35. BBH-zh ↩︎

  36. KorBench, https://arxiv.org/abs/2410.06526 ↩︎

  37. Talmor 等, CommonsenseQA, 2018, https://arxiv.org/abs/1811.00937 ↩︎

  38. WorldSense, https://arxiv.org/abs/2311.15930 ↩︎

  39. AutoLogi, https://arxiv.org/abs/2502.16906 ↩︎

  40. ZebraLogic, https://arxiv.org/abs/2502.01100 ↩︎

  41. SQuAD 2.0, https://arxiv.org/abs/1806.03822 ↩︎

  42. Belebele, https://arxiv.org/abs/2308.16884 ↩︎

  43. MMLU, https://arxiv.org/abs/2009.03300 ↩︎

  44. MMLU-Pro, https://arxiv.org/abs/2406.01574 ↩︎

  45. GPQA, https://arxiv.org/abs/2311.12022 ↩︎

  46. SuperGPQA, https://arxiv.org/abs/2502.14739 ↩︎ ↩︎

  47. TriviaQA, https://arxiv.org/abs/1705.03551 ↩︎

  48. SimpleQA, https://openai.com/index/introducing-simpleqa/ ↩︎ ↩︎

  49. Chinese SimpleQA, https://arxiv.org/abs/2411.07140 ↩︎ ↩︎

  50. mARC (Multilingual ARC) ↩︎

  51. MMMLU, https://huggingface.co/datasets/openai/MMMLU ↩︎

  52. An 等, L-Eval, 2023, https://arxiv.org/abs/2307.11088 ↩︎

  53. Bai 等, LongBench v2, 2025, https://arxiv.org/abs/2412.15204 ↩︎ ↩︎

  54. He 等, VitaBench, 2025, https://arxiv.org/abs/2509.26490 ↩︎ ↩︎

  55. Zheng 等, Group Sequence Policy Optimization (GSPO), 2025, https://arxiv.org/abs/2507.18071 ↩︎

  56. Qian 等, ToolRL, 2026, https://arxiv.org/abs/2504.13958 ↩︎

  57. Huang 等, Focal Reward: Balanced Reinforcement, 2026 ↩︎

  58. Zhao 等, ReportLogic: Evaluating Logical Quality, 2026 ↩︎

  59. Froger 等, Meta ARE (Agents Research Environments), 2025, https://arxiv.org/abs/2509.17158 ↩︎

  60. Fang 等, Towards …(seed-centric 合成), 2025 ↩︎

  61. AEnvironment, https://github.com/inclusionAI/AEnvironment ↩︎

  62. KPop, 2026 ↩︎ ↩︎

  63. KPop 技术博客, https://ringtech.notion.site/kpop ↩︎

  64. Rein 等, GPQA: A Graduate-Level Google-Proof Q&A Benchmark, 2023, https://arxiv.org/abs/2311.12022 ↩︎ ↩︎

  65. Humanity’s Last Exam, https://arxiv.org/abs/2501.14249 ↩︎

  66. AIME Problems and Solutions, https://artofproblemsolving.com/wiki/index.php/AIME_Problems_and_Solutions ↩︎ ↩︎

  67. HMMT 2025, https://www.hmmt.org/ ↩︎

  68. Luong 等, IMO-AnswerBench, 2025 ↩︎ ↩︎

  69. Jain 等, LiveCodeBench, 2025, https://arxiv.org/abs/2403.07974 ↩︎ ↩︎

  70. BIG-Bench Extra Hard (bbeh), https://arxiv.org/abs/2502.19187 ↩︎

  71. Chollet 等, ARC Prize 2024, https://arxiv.org/abs/2412.04604 ↩︎

  72. Jimenez 等, SWE-bench, 2024, https://arxiv.org/abs/2310.06770 ↩︎ ↩︎

  73. PinchBench, https://pinchbench.com/ ↩︎ ↩︎

  74. ClawEval,OpenClaw agent 的评测套件,benchmark 细节见 https://kimi.com/blog/kimi-k2-6 ↩︎ ↩︎

  75. Berkeley Function Calling Leaderboard, https://gorilla.cs.berkeley.edu/leaderboard.html ↩︎

  76. Barres 等, $\tau^2$-bench, 2025, https://arxiv.org/abs/2506.07982 ↩︎ ↩︎ ↩︎

  77. Merrill 等, Terminal-Bench 2.0, 2026 ↩︎

  78. Pyatkin 等, IFBench / Generalizing Verifiable Instruction Following, 2025, https://arxiv.org/abs/2507.02833 ↩︎

  79. Zhang 等, LIFEBench, 2026, https://arxiv.org/abs/2505.16234 ↩︎

  80. Vodrahalli 等, Michelangelo (MRCR), 2024, https://arxiv.org/abs/2409.12640 ↩︎

  81. Deshpande 等, MultiChallenge, 2025, https://arxiv.org/abs/2501.17399 ↩︎

  82. He 等, Multi-IF, 2024, https://arxiv.org/abs/2410.15553 ↩︎

  83. Chollet 等, ARC-AGI-2, 2025, https://arxiv.org/abs/2505.11831 ↩︎

  84. HMMT, https://www.hmmt.org/ ↩︎

  85. Deng 等, SWE-bench Pro, 2025, https://arxiv.org/abs/2509.16941 ↩︎

  86. Mialon 等, GAIA, 2023, https://arxiv.org/abs/2311.12983 ↩︎

  87. DeepSeek-V4-Pro, https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro ↩︎

  88. Singh 等, GPT-5, 2025 ↩︎

  89. Gemini, https://deepmind.google/technologies/gemini/ ↩︎

  90. Claude, https://www.anthropic.com/claude ↩︎

  91. linghe, https://github.com/inclusionAI/linghe ↩︎

  92. Liu 等, Muon, 2025, https://arxiv.org/abs/2502.16982 ↩︎

  93. Gloeckle 等, Better & Faster Large Language Models via Multi-token Prediction, 2024, https://arxiv.org/abs/2404.19737 ↩︎

  94. DeepSeek-AI, DeepSeek-V3 Technical Report, 2024, https://arxiv.org/abs/2412.19437 ↩︎

  95. Leviathan 等, Fast Inference from Transformers via Speculative Decoding, 2023, https://arxiv.org/abs/2211.17192 ↩︎

  96. Zeng 等, GLM, 2026 ↩︎