LongCat-Flash-Thinking-2601 技术报告
本文译自美团 LongCat 团队的 LongCat-Flash-Thinking-2601 Technical Report1,2026 年 1 月 23 日提交于 arXiv(2 月 1 日更新),27 页 16 图 2 表。这是全文翻译,覆盖摘要、§1 引言、§2 预训练、§3 扩展强化学习、§4 Heavy Thinking 测试时扩展、§5 评测、§6 Zig-Zag 注意力、§7 结论,以及附录 A、B。贡献者名单与参考文献列表不在译文范围内。
模型对话入口在 LongCat Chat2,权重与代码分别开源在 Hugging Face3 和 GitHub4。
摘要
我们推出 LongCat-Flash-Thinking-2601,一个 5600 亿参数的开源 Mixture-of-Experts(MoE)推理模型,具备出色的智能体推理能力。LongCat-Flash-Thinking-2601 在广泛的智能体基准上取得开源模型中的最先进表现,涵盖智能体搜索、智能体工具使用和工具集成推理。除了基准分数之外,该模型还展现出对复杂工具交互的强泛化能力,以及在带噪的真实世界环境下的鲁棒行为。它的先进能力源自一套统一的训练框架——把领域并行的专家训练与后续融合结合起来,再加上一次贯穿预训练到后训练、覆盖数据构造、环境、算法与基础设施的端到端协同设计。特别地,模型在复杂工具使用上的强泛化能力,来自我们对环境扩展和有原则的任务构造所做的深入探索。为了优化长尾、倾斜的生成过程与多轮智能体交互,并支撑跨越 20 多个领域、超过 10,000 个环境的稳定训练,我们系统性地扩展了自研的异步强化学习框架 DORA,使之能够支持稳定高效的大规模多环境训练。此外,考虑到真实世界任务本质上是带噪的,我们对真实世界的噪声模式做了系统的分析和分解,并设计了有针对性的训练流程,把这些不完美显式地纳入训练过程,从而提升了在真实应用中的鲁棒性。为进一步提升复杂推理任务上的表现,我们引入 Heavy Thinking 模式,通过密集的并行思考同时拓展推理的深度与宽度,实现有效的测试时扩展。我们公开发布 checkpoint,以推动智能体系统的后续研究与真实世界应用。
图 1:LongCat-Flash-Thinking-2601 的基准表现。
1 引言
推理模型的近期进展已经在数学、编程这类复杂任务上带来快速突破,某些情形下甚至超过了顶尖人类专家5678。随之而来的自然问题是:这种复杂问题求解能力如何被用来解决复杂的真实生活任务,又如何在此之上继续拓展?当内生推理能力逼近其极限时,我们认为与外部环境的交互会成为进一步前进的关键机制910。从这个视角看,智能体推理可以理解为通过与外部环境的自适应交互来求解复杂问题的能力。除了内部的斟酌之外,先进的智能体推理能力要求模型判断何时、以何种方式与环境交互,并有效整合环境反馈来维持和推进推理过程。这样一来,推理与交互自然地交错并互相强化,共同催生出更通用、更强大的问题求解行为11。然而,要让模型具备这样的智能体推理能力,对现有模型和训练流程提出了实质性的挑战。智能体任务通常涉及长时程轨迹、异构环境和长尾的交互动力学,这对从预训练到后训练阶段的数据整理、环境构造、强化学习策略和系统级基础设施都提出了新要求。
本工作推出 LongCat-Flash-Thinking-2601,一个强大而高效的 Mixture-of-Experts(MoE)推理模型,总参数 560B、平均每 token 激活 27B,具备强智能体推理能力。LongCat-Flash-Thinking-2601 的预训练很大程度上沿用 LongCat-Flash-Chat12 的配方,保留原有的数据分布以维持有竞争力的通用推理性能。在这个基础上,我们通过一个精心设计的中期训练(mid-training)阶段把模型进一步推向大规模智能体推理。与传统推理相比,智能体行为通常涉及带主动工具调用的长时程轨迹。然而这类交互模式在真实语料中极为稀缺——真实语料绝大部分是自然语言。结果就是,一个原始模型对智能体交互动力学基本是陌生的,这会导致强化学习阶段的探索效率低下。为解决这一挑战,我们在中期训练期间让模型接触中等规模的、合成的结构化智能体轨迹,为智能体推理行为提供一个强初始化。
在后训练阶段,我们聚焦于高效扩展 RL 算力以提升智能体推理能力。除搜索、代码这类具体智能体场景之外,我们进一步把跨任务、跨环境的泛化能力认定为先进智能体行为的核心特征。这种能力主要通过与多样化环境的交互获得,环境因此成为学习的游乐场。为此,我们设计了一条自动化的环境扩展流水线,构造出覆盖 20 多个领域的复杂多样环境,同时严格保持可执行性与可验证性。由于所得环境在领域和难度上都表现出显著的异质性,在其上训练需要训练策略与基础设施支撑的仔细协同设计,才能保证稳定有效的多域环境学习。为支撑这一设定下的大规模智能体强化学习,我们扩展了自研的多版本异步训练系统 DORA(Dynamic ORchestration for Asynchronous Rollout),使之能够在最多 32,000 个环境并发执行的情况下做到可扩展且稳定的训练。然而,泛化到真实世界场景仍然极具挑战,因为真实世界环境本质上是不完美的。为了弥合理想化训练设定与真实部署之间的落差,我们系统地分析真实世界噪声,并设计了一条自动化流水线,把多类型、多层级的环境不完美逐步注入多域环境训练过程。
为把推理能力推到现有极限之外,LongCat-Flash-Thinking-2601 内置了一个 Heavy Thinking 模式,实现推理的有效测试时扩展。这个模式把有挑战性的问题求解拆解成互补的两个阶段,同时拓展推理的宽度与深度,让模型既能探索多样的解题路径,又能逐步精化自己的推理。我们额外引入了一个强化学习阶段,专门强化模型聚合与精化中间推理结果的能力,进一步提升有效性。
在通用推理基准上保持强竞争力的同时,LongCat-Flash-Thinking-2601 在广泛的智能体基准上取得开源模型中的最先进表现,并在分布外的真实世界智能体场景中展现出强泛化能力。值得注意的是,LongCat-Flash-Thinking-2601 在 BrowseComp 上取得 73.1%,在 RWSearch 上取得 77.7%,在 $\tau^{2}$-Bench 上取得 88.2%,在 VitaBench 上取得 29.3%,确立了它在智能体搜索与智能体工具使用任务上的开源领先地位。
译注:这里 RWSearch 的 77.7% 与表 2 对不上——表 2 里 RW Search 是 79.5,而 77.7 是 BrowseComp-zh 的分数。§5.2 的正文也写的是「在 BrowseComp-ZH 上取得 77.7,在 RWSearch 上取得 79.5」。引言这一句应是把两个基准的名字弄反了。
我们的工作有三项核心贡献:
- 环境扩展与多域环境训练。我们开发了一套可扩展的环境构造与任务生成框架,能产出大量高质量、可执行、可验证的智能体环境。在此基础上,我们扩展了自研的异步强化学习基础设施以支撑稳定高效的多域环境训练,使模型得以在多样领域上获得可泛化的智能体技能。
- 带噪环境下的鲁棒智能体训练。为应对真实世界环境固有的不完美,我们系统分析了环境噪声的主要来源,并设计了一条自动化流水线,把多类型、多层级的噪声注入训练环境。我们采用基于课程的强化学习策略逐步提高噪声复杂度,大幅改善了不理想条件下的鲁棒性与表现。
- 面向测试时扩展的 Heavy Thinking 模式。我们引入 Heavy Thinking 模式,通过同时拓展推理宽度与深度,实现推理的有效测试时扩展。借助并行轨迹探索与迭代式推理精化,这个模式在有挑战性的推理与智能体任务上进一步提升了表现。
2 预训练
我们的模型建立在 LongCat-Flash-Chat12 的预训练配方之上,继承其数据分布以保持强通用语言与推理能力。除传统推理之外,智能体行为通常涉及带主动工具调用的长时程轨迹。这带来两个额外挑战:(i)对长上下文建模效率的要求大幅提高,(ii)真实世界中大规模智能体轨迹的稀缺。为应对智能体推理的长上下文需求,我们采用分阶段、上下文长度逐步增加的中期训练流程,给 32K/128K 阶段分配 500B token,再给 256K 阶段额外分配 40B token。由于单靠大规模强化学习、而模型又没有事先具备基本智能体行为时往往低效且不稳定,我们选择在这个阶段就让模型接触中等规模的智能体数据。为缓解真实世界智能体轨迹的稀缺,我们构建了一条混合数据合成流水线来收集和构造智能体训练数据。此外,我们能基于任意一个预训练 checkpoint 预测中期训练阶段的最优超参数,这一设计专门用来最小化寻找最佳配置的算力成本(见附录 A)。
沿用原有的中期训练配方以保留通用推理能力1314,我们进一步用结构化智能体轨迹15扩充数据分布。由于大规模高质量的智能体数据——尤其是涉及推理、规划和交互的长时程轨迹——极为稀缺,我们构建了一套混合数据合成框架来填补这一缺口。具体来说,我们的框架取材于两个互补的来源:非结构化文本和可执行环境,分别对应文本驱动合成与环境接地合成。前者提供广泛的语义与任务多样性,后者保证逻辑一致性和可执行性。此外,为显式强化规划能力——这是智能体推理的核心组件,却很难从已有数据中获得——我们进一步设计了一套专门的、以规划为中心的数据构造策略。如图 2 所示,用这套增强中期训练配方训练出的模型,在 $\tau^{2}$-Bench 上表现出更高的 pass@k,也就是更高的智能体能力边界。
文本驱动合成。大规模文本语料中蕴含丰富的隐式程序性知识,比如教程、说明书和多步问题求解工作流。我们利用这一性质,用下面的流水线把这些潜在的过程挖掘并重构成显式的智能体交互轨迹:
- 文本过滤与工具抽取:我们有策略地识别出展现丰富多步工作流的文本片段。从这些片段出发定义候选函数,并抽取相应的函数调用列表,把隐式过程转换成显式的工具 schema。
- 合成与精化:我们把抽象的工作流和原始文本翻译成具体的多轮用户—智能体交互。为保证数据集的鲁棒性和覆盖广度,我们施加了大量的智能体模式多样性增强和严格的质量过滤,确保最终轨迹覆盖多样的交互场景与任务领域。
为进一步提高合成轨迹的结构复杂度,我们施加两种基于分解的增强:
- 工具分解:从简单的工具调用轨迹出发,迭代地把部分工具参数藏进环境里。相应地,我们合成模型的交互过程去抽取这些参数,逐步构建出更复杂的轨迹。
- 推理分解:对模型输出中的每一个动作步,我们生成多个候选替代项并用它们替换原动作。然后合成模型的推理步骤去选出最合适的候选,把轨迹变成一个反映智能体多步推理的决策过程。
环境接地合成。除了从文本导出的轨迹之外,我们也直接从可执行环境构造智能体数据,以保证逻辑正确性和执行一致性。我们为收集到的工具集实现了轻量的 Python 环境,通过受控的工具链采样和执行校验生成轨迹:
- 环境构造与依赖建模:基于已有的工具定义,我们实现轻量、可验证的 Python 环境。我们显式地建模工具之间的逻辑依赖,构造一个有向图,其中节点表示工具、边表示参数依赖。这个结构让我们能系统地采样出不同复杂度和深度的工具调用链。
- 逆向合成与执行校验:我们从依赖图中采样有效的工具执行路径,并用逆向工程的思路合成与所选工具链对齐的用户模拟器 system prompt。关键在于,每条轨迹的正确性都通过执行代码、校验环境数据库的最终状态来验证。这保证了合成数据扎根于真实的执行逻辑。
面向规划的数据增强。我们观察到智能体推理关键依赖于规划能力,它决定了模型如何分解复杂目标、探索备选方案、以及在中间决策上下注。然而这类以规划为中心的行为在已有数据中表现得很差,也很难规模化地获得。为在中期训练期间显式强化这一能力,我们设计了一套有针对性的数据构造策略,把已有轨迹转化为以规划为中心的决策过程。第一类数据聚焦于合成有效的问题分解轨迹,并配上正确的初始动作选择,为由粗到细的规划和早期决策提供监督。第二类从完整的交互轨迹出发,在每个决策步生成多个备选候选来进一步丰富它。模型随后被训练去在这些候选之间推理并做出选择,把原本线性的轨迹转化为结构化的多步决策过程。
图 2:智能体能力对比(pass@k)。「Baseline」表示经过旧版中期训练配方的模型,「Enhanced」表示经过智能体增强版中期训练配方的模型。
译注:图 2 是 $\tau^{2}$-Bench 三个子集(Airline / Retail / Telecom)的 pass@k 曲线,$k$ 从 1 到 32。三个子集上 Enhanced 都整条曲线压过 Baseline,Telecom 上的差距最大($k=1$ 时 0.19 对 0.06,$k=32$ 时 0.72 对 0.56)。
3 扩展强化学习
用强化学习做后训练已经成为激发更强推理能力的主要途径。沿用 LongCat-Flash-Thinking16 的做法,我们采用统一的多域后训练流水线:先在一个共享框架下训练领域专精的专家模型,再通过模型级与数据级的双重合并把它们整合成单个通用模型。
带智能体推理的强化学习需要三样东西:(i)精心准备的训练设置,包括可扩展的环境构造、高质量的冷启动数据和标定良好的 RL 任务集;(ii)一套专门的基础设施,能够承载高吞吐、异步、长尾的多轮 rollout;(iii)专门的训练策略,在异构领域和不同难度层级上都保持稳定有效。本节给出一条系统化的流水线来应对这些挑战,实现可扩展的智能体强化学习。
3.1 RL 准备
在做大规模强化学习之前,有几个必要的准备步骤。标准强化学习依赖两个核心组件:(i)一个初始化良好、已经展现出基本任务相关行为的策略,(ii)一个有原则的训练任务集,使学习稳定而有效。除这些共有组件之外,智能体强化学习还需要一个可靠、可扩展的环境基座,来支撑长时程、交互驱动的训练。
3.1.1 环境
传统推理在很大程度上是无环境的,纯粹在一个内部的语言空间里运作。相比之下,环境构成了智能体系统的一个决定性组件——它直接决定了智能体能感知什么、能如何与外部系统交互、以及在世界上什么动作是可执行的。我们特别引入智能体任务中两类尤其有挑战的环境:智能体编码与智能体工具使用。对智能体编码任务,环境表现为一个可执行的代码沙箱,它必须同时支持复杂的真实世界工具链、保证严格的执行正确性,并在大规模并行使用下保持稳定可复现。对通用智能体工具使用任务,环境必须以一致的方式建模跨异构工具与数据库的复杂多样交互。这些要求呼唤专门的、领域特定的环境设计,我们在下面详述。
代码沙箱。对每个编码任务,智能体都必须在一个可执行的代码沙箱内运作,实时与各种终端工具交互。这一设定引入两个主要挑战:高效的大规模资源调度需求,以及工具与执行环境的异质性。在大规模训练中,沙箱系统必须同时保证灵活性和鲁棒性。为应对这些挑战,我们设计了一套可扩展的执行沙箱系统,提供统一的工具接口和高吞吐的交互。为处理真实世界代码执行设定的异质性,我们把常用工具——包括搜索、文件读写、代码编辑和 shell 执行——整合进一个标准化的环境接口。为进一步支撑大规模训练,我们实现了一个高并发的沙箱调度器,异步地供给与回收沙箱实例、把任务分发给各个 worker、并行执行数千个沙箱,从而把环境启动和阻塞开销从训练的关键路径上移除。
图 3:可执行域图的自动化构造。从一份高层的领域规格出发,流水线合成领域特定的工具,生成相应的数据库 schema 和工具 schema 实现。在此基础上,我们构造出一个经过验证的工具依赖图,作为环境扩展的基础。
图 4:保持可验证性的环境扩张。环境从一条种子可执行工具链出发,通过受控的图增长逐步扩张。
智能体工具使用环境。先进智能体推理能力的核心特征是泛化——在已知环境中习得有效行为,并可靠地迁移到此前未见的设定中。为训练出这样的泛化智能体,我们主张可迁移的智能体推理能力应当从接触多样工具集和交互模式中涌现。虽然设计单一的元环境去完整刻画真实世界工具使用的复杂度是不可行的,但我们发现一组足够多样的环境就能提供基础,催生出可迁移、可泛化的工具使用行为。不过在实践中,构造这样的环境有非平凡的挑战,因为不同领域对交互接口、执行机制和评估标准的要求各不相同。
我们设计了一条全自动流水线,把高层的领域规格转换成可执行的图。如图 3 所示,流水线从领域定义出发合成一套领域特定的工具集,把它们的功能抽象成统一的数据库 schema 并给出显式的工具—数据库映射。基于这份 schema 级规格,它随后自动生成数据库实现和相应的工具代码。为保证正确性与鲁棒性,生成的代码要经过单元测试和一个辅助调试智能体的校验。实践中,这条流水线把 schema 级设计转换成完全可执行的工具实现的成功率超过 95%。最后,我们从校验过的工具集构造出工具依赖图,作为后续环境构造与扩张的基础。
用这条自动化流水线,我们构造出一组覆盖 20 多个领域的领域特定工具图 $\mathcal{G}$。每个工具图 $G \in \mathcal{G}$ 包含 60 个以上的工具,组织成一张稠密的依赖图,并配有相应的可执行、工具特定的数据库 schema 实现,为大规模探索与多样环境构造提供了足够的结构复杂度。
接下来介绍我们基于域图构造可执行环境的流水线。给定一个领域特定的工具图 $G$,我们先采样出一条中等规模的工具链 $s_1 \subset G$。此前已被选中的工具,其采样概率会逐步降低,以促进任务多样性。对 $s_1$ 中的每个工具,我们依次实例化相应的数据库状态,保证所有必需的工具依赖都被完全满足。工具关联的数据库构造完毕后,我们自动生成一个扎根于这条工具链的任务。采样得到的 $s_1$ 充当所生成任务的可执行工具链。为减轻潜在的人类先验偏置,任务生成器被限制为只能使用完整的工具链,不做任何刻意的任务设计。具体来说,每个生成的任务由三部分组成:(i)任务描述,(ii)用户画像,(iii)评估 rubrics。为保证监督可靠,评估 rubrics 要经过多轮一致性检查的校验,以确保任何可执行的工具链都能被接受为正确解,而错误或不完整的轨迹都会被一致地拒绝。
我们注意到任务难度来自两个互补的源头:交互复杂度和环境复杂度。交互复杂度通过合成需要不同程度澄清、规划和多步交互的多样用户 prompt 来保证,鼓励模型做出丰富且自适应的智能体行为。环境复杂度则用底层工具图的结构性质来量化,包括涉及的工具节点数量和它们之间的连通密度。
提高环境复杂度的一个自然做法,是从 $G$ 中引入额外的工具节点,把初始工具链 $s_1$ 扩张成一个更大的子图 $\mathcal{R}(s_1)$,同时维护它们的数据库实例。值得注意的是,这样扩张之后,所得环境里可能额外存在多条有效的可执行工具链。然而随着子图变大,维持跨工具的数据库一致性会越来越困难。特别地,由于工具依赖图施加的约束,不受控地引入额外工具节点可能触发一连串此前未被满足的依赖,需要大量的数据库扩充和大量辅助工具节点的维护。一旦数据库状态在这种扩张下变得不一致,工具调用就可能产生不可预测的结果,导致连有效的工具轨迹都执行失败。这会让正确解被误判为失败,从而在训练中引入有偏的负奖励。为缓解这一问题,我们不去盲目注入随机工具,而是通过延伸可执行工具链来扩张环境。具体来说,从 $s_1$ 出发,我们在工具图上做 BFS 式的扩张,只有当一个新工具节点的全部依赖都已被此前实例化、数据库状态也已完全构造好的工具满足时,才把它加进来。这种受控的扩张策略让我们能在保持可执行性和可靠监督的同时,逐步提高环境复杂度。
通过这种受控的图扩张,我们把 $s_1$ 延伸成一个更复杂的子图 $\mathcal{R}(s_1)$。记所得的扩展环境为 $\mathcal{E}_1 = \mathcal{R}(s_1)$,令 $\mathcal{D}_1 = G \setminus \mathcal{E}_1$ 表示 $\mathcal{E}_1$ 剩下的未用工具节点。接下来的一个设计选择是:要不要初始化另一条种子可执行工具链 $s_2 \subseteq \mathcal{D}_1$,把它延伸成 $\mathcal{R}(s_2)$ 来构造环境:
$$ \mathcal{E}_{2} = \mathcal{R}(s_1) \bigcup \mathcal{R}(s_2), $$以进一步提高环境复杂度。我们基于三点做这个决定:(i)当前环境的结构复杂度 $c(\mathcal{E}_{1})$,(ii)从剩余图中找出一条新的有效工具链的难度 $g(\mathcal{D}_1)$,(iii)剩余未用节点的数量 $|\mathcal{D}_1|$。具体地,给定当前环境:
$$ \mathcal{E}_{n} = \bigcup_{i=1}^{n} \mathcal{R}(s_i), $$我们定义剩余未用工具集为 $\mathcal{D}_n = G \setminus \mathcal{E}_n$,并以如下概率从 $\mathcal{D}_n$ 中采样一条新的种子链 $s_{n+1}$:
$$ p = f\big(c(\mathcal{E}_n), g(\mathcal{D}_n), \lvert \mathcal{D}_n \rvert\big), $$其中 $g(\mathcal{D}_n)$ 用一个强求解器从 $\mathcal{D}_n$ 中发现一条替代的有效工具链所需的尝试次数来度量,$f(\cdot)$ 是一个控制环境增长过程的单调决策函数。实践中,当 $p > \tau$($\tau$ 是预设阈值)时,我们从 $\mathcal{D}_n$ 初始化一条新的种子黄金工具链 $s_{n+1}$,并把它延伸成 $\mathcal{R}(s_{n+1})$。为保证环境复杂度的下限,我们进一步引入一个兜底机制:如果扩张后的 $\mathcal{E}_n$ 只包含少量工具节点,我们就从 $G$ 中随机采样一条额外的中等规模工具链并入环境,同时保证与当前工具链的数据库一致性。这保证了每个构造出的环境至少包含 20 个工具,为有意义的智能体交互与探索提供足够的结构复杂度。这套自动环境构造策略让我们在维持可靠监督信号的同时,逐步扩大环境复杂度,从而实现稳定有效的大规模智能体强化学习。
3.1.2 初始策略
冷启动阶段在为后续强化学习初始化策略上扮演关键角色。我们的首要目标不是在标准基准上立刻拿到收益,而是让模型为大规模探索做好准备。一个高质量的冷启动策略必须展现出多样的推理模式和稳定的交互格式,以保证后续 RL 阶段能高效进行、同时保留通用思考能力。因此我们从更根本的视角来评估冷启动模型,聚焦于:(1)它在 RL 阶段指定任务上的熟练度,(2)它推理路径的多样性——通过定性的人工检查来评估。虽然我们也报告标准基准上的 pass@k 来衡量底层推理能力,但那只是参考,不是主要的优化目标。
冷启动训练的一个主要挑战在于构造高质量数据,让模型能有效地为智能体行为做好准备。对某些领域,比如数学、通用编码和智能体代码任务,真实世界里有大规模数据来源。这些情况下我们从已有来源整理和汇集轨迹,核心挑战在于严格的质量控制和可执行性校验。然而对大多数智能体任务,比如搜索和工具使用,高质量的真实世界轨迹基本拿不到。因此我们依靠精心设计的数据合成流水线来构造冷启动轨迹。下面详述我们如何针对不同智能体能力实例化这两条互补策略。
通用思考。智能体能力需要以强思考能力为基础。因此我们设计了一条严格的数据过滤流水线来构造高质量的通用思考数据。具体来说,我们采用一个由困惑度(PPL)引导的 K-Center-Greedy(KCG)选择算法171819。已有的基于 PPL 的过滤方法要么忽略序列长度,要么在整条序列上对 PPL 取平均2021,这会掩盖局部的困难 token,丢弃有信息量的样本。为解决这一点,我们引入滑窗 PPL:在一条序列的所有 512-token 窗口上计算平均 PPL 的最大值,捕捉模型不确定性的峰值而不被全局平均稀释。在 KCG 选择过程中,我们用候选样本的滑窗 PPL 分数给它与当前已选集合之间的距离加权。这一设计同时兼顾两个互补目标:KCG 保持对原始数据分布的覆盖,滑窗 PPL 则强调那些暴露模型当前推理能力短板的样本。用这条流水线,我们从大规模语料中下采样出 21 万条通用思考样本。在这个子集上训练的模型,在多个推理基准上都优于在全量语料上训练的模型。
智能体编码。对智能体编码任务,大型软件开发平台提供了丰富的真实世界轨迹来源。然而从这类来源收集的原始轨迹往往带噪、部分错误或不可复现,保证其可靠性和可执行性成为一个关键挑战。为此我们为代码交互轨迹构建了一条严格的整理流水线。我们要求所有保留下来的轨迹在可复现环境中完全可执行、可验证,并且只保留那些正确解决了目标 issue、同时保持已有功能不受影响的轨迹。为进一步避免学到虚假行为,我们施加细粒度的动作级过滤,移除那些对正确求解无贡献的错误、冗余或投机性操作。此外,为保留真实调试过程中常见的长时程推理模式,我们通过压缩早期步骤保留那些涉及长而反复调试的轨迹,让长时程代码推理能在不受长度约束的情况下被维持下来。
智能体搜索。对智能体搜索能力,构造高质量轨迹需要显式建模多步证据收集和完整的条件验证,同时避免基于部分信息的虚假捷径。这类结构化的推理轨迹在真实世界搜索日志里很少见。因此我们构造合成推理轨迹,优先保证正确性、推理完整性和对捷径行为的鲁棒性。我们施加严格过滤以保证轨迹质量,剔除平凡样例并强制统一的推理与工具使用格式。为避免像「基于部分证据的幸运猜中」这类捷径学习,我们要求轨迹显式包含对查询中所有条件的验证。我们进一步通过压缩早期步骤保留那些涉及长而反复探索的轨迹,让长时程推理能在不受长度约束的情况下被保留。最后,我们复用后续强化学习阶段的 rollout 轨迹来扩大数据收集规模、增加行为多样性。
译注:原文这一段里「我们因此构造合成推理轨迹,优先保证正确性、推理完整性和对……的鲁棒性」这句连着出现了两遍,只有末尾从 shortcut behaviors 换成了 spurious shortcuts,明显是重复粘贴。译文合并成一句。
智能体工具使用。对通用智能体工具使用能力,主要挑战在于建模跨异构工具与数据库、schema 和依赖结构各异的复杂有状态交互。这类环境和交互轨迹同样难以从真实世界来源获取或标准化。我们在环境扩展流水线之上构建了一条可扩展的数据合成流水线,通过联合定义领域、工具 schema、数据库状态和任务目标,建模覆盖 33 个代表性领域的真实工具使用环境,并生成扎根于结构化工具依赖的多步任务。为保证多样性,我们在三个方面显式促进变化:领域覆盖、轨迹结构和交互长度。每个任务都容许多条不同的正确工具调用轨迹,交互时程从短对话到长的多轮执行都有,覆盖了很宽的任务难度和行为模式谱系。为保证数据质量,所有合成轨迹都用基于 rubric 的结果校验和轮次级质量控制做严格过滤,只有正确到达目标终态的轨迹才被保留。在这些轨迹内部,我们施加轮次级的 loss masking,把低质量轮次——比如失败的工具调用或格式违规——排除在损失计算之外,保证模型只从正确动作中学习,同时保留完整的交互上下文。
3.1.3 RL 任务集
在强化学习里,环境定义了智能体能做什么,任务集则决定了智能体被训练去做什么。二者共同塑造了智能体如何探索环境、如何分配算力、如何通过反复 rollout 精化策略。一个设计良好的任务集应当既有信息量、复杂度又恰到好处,既不平凡也不至于不可解,从而提供有效的学习信号。常见做法是先构造一批覆盖多领域、多难度层级的多样环境与任务指令,再通过评估模型的通过率来判断任务是否合适。基于这个信号,那些既非轻易可解、也非难到无从下手的任务会被选进强化学习。然而,可用训练任务的数量在各领域之间差异显著。对编码这类领域,已经存在大量复杂的高质量任务,可以直接收集整理。相比之下,对智能体搜索和工具使用这类领域,合适的任务稀缺或者根本不以可直接使用的形式存在,直接收集就不够用了。因此我们引入有原则的合成流水线,为智能体搜索和工具使用场景构造覆盖多样复杂度层级的任务集。
智能体搜索。我们识别出刻画搜索问题的两个基本难度因子:(i)在关系实体链上做多跳推理,(ii)在多个模糊约束下对单个实体做推理。大多数复杂搜索任务都可以看作这两个因子的组合或迭代精化。
- 基于图的 QA 合成:为建模多跳推理难度,我们通过一条系统的流水线构造基于图的问答任务——从 Wikipedia 实体出发建立关系图,再生成有挑战性的推理问题。我们的做法从 Wikipedia 中抽取低频实体作为初始种子节点,然后迭代扩张这张图:从已有实体集合中采样、检索它们的 Wikipedia 页面、纳入相关实体及其对应关系,直到达到预设的规模阈值。图构造完成后,我们采样多个固定大小的连通子图,用它们生成问答对。在生成问题时,我们借助大语言模型创造与子图信息对应的问题,然后刻意模糊掉数值、实体名、地理位置、时间标记这类显式细节,以最大化推理复杂度。为保证全流程的质量与正确性,我们在实体关系抽取、问题生成和模糊化这些关键步骤上都采用 LLM-as-a-judge 来维持基线准确率。最后,对每个生成的问答对,我们用一套基于智能体的方法去找出其他可能的正确答案并评估其有效性,只保留那些原答案正确、且所有其他被找出的候选答案都不正确的问答对。
- 基于智能体的 QA 合成:为建模由歧义驱动的难度,我们给出一条可扩展、高效的数据合成流水线,其中多智能体协作交互由一个有限状态机(FSM)编排。在这个框架里,实体抽取智能体识别出有代表性的长尾实体并抽取其显著属性,作为合成问题的基础 ground truth。随后,问题合成智能体随机采样这些属性来编制有针对性的问题。为保证精确性,一个校验智能体借助搜索和浏览工具严格验证 ground truth 是否满足问题中指定的全部约束,从而降低实体—问题不匹配的风险。对每个通过校验的问题,答案生成智能体用搜索和浏览工具产出候选答案。判定智能体评估这些候选与预设 ground truth 之间的一致性。当判定智能体发现某个非 ground truth 的答案同样满足校验标准时,就意味着出现了多答案冲突。为解决这个问题,系统随机补充 ground truth 实体的额外属性,触发问题的重新合成以保证唯一性。这条流水线支持在多个领域上高吞吐地生成多样的高质量 QA 对;此外,它还能基于答案生成智能体的准确率指标,实现自动化的难度分级机制。
智能体工具使用。对智能体工具使用,我们的任务集直接通过 §3.1.1 描述的环境扩展流水线构造。每个合成出来的环境天然定义了一个独立任务,这样一组环境就构成了最终的任务集。
3.2 可扩展的异步智能体 RL 框架
图 5:我们可扩展异步智能体 RL 框架的执行工作流。
与标准推理任务那种单轮场景相比,智能体训练涉及与可变环境(ENV)或工具的多轮交互,这给 RL 基础设施带来了新挑战。在典型的多轮 rollout 阶段,流程会反复交错 LLM 生成、环境执行和奖励评估,最终拼出用于 RL 训练的轨迹。在这一设定下,轨迹不仅长尾倾斜,还涉及不可预测、延迟倾斜的环境交互,在批处理设定下会导致设备利用率不足222324。此外,我们的生产集群由中端加速器组成,尤其是设备可用显存只有 60GB 左右。这些硬件约束连同其软件生态,给实现稳定可扩展的智能体 RL 训练带来了显著挑战。为解决这些问题,我们扩展了自研的多版本 异步训练系统 DORA(Dynamic ORchestration for Asynchronous rollout)25,使其能完整支持多轮智能体场景下的大规模 RL 训练。
如图 5 所示,我们的控制器采用生产者—消费者架构,由 RolloutManager(管理 rollout 阶段)、SampleQueue(控制样本陈旧度)和 Trainer(管理 Experience-Maker 与训练阶段)组成。这些组件跑在不同节点上,主要通过远程过程调用(RPC)负责逻辑控制与协调,实际任务则由跑在 CPU 或加速器上的 worker 执行。我们提出了几项关键技术来实现高效、可扩展、稳定的智能体 RL 训练。
全流式异步流水线。为最小化智能体设定下的设备空转,我们基于流式 RPC25 在 rollout 过程内部、以及 rollout 与训练之间都引入了 全流式异步流水线。在 RolloutManager 的 rollout 循环内部,我们移除了批次屏障,让 LLM 生成、环境执行和奖励计算能以单个样本为粒度在远程 worker 上执行。这避免了加速器因等待成批的 ENV 调用完成而空转。为进一步在保证训练稳定性的前提下应对 长尾生成问题,我们的 DORA 系统支持多版本异步训练:不同模型版本生成的轨迹一旦完成就立即入队。在一个训练步内,我们的多版本生成实例会继续用多个此前的模型版本做 rollout,而 Trainer 一旦满足条件就可以启动训练,或者在训练设备空闲时弹性地扩出额外的生成实例,白赚一部分吞吐。
扩展到大规模智能体训练。我们的算法设定需要大量环境,例如多达 32,000 个环境跑在大约 400 台物理机、数千个加速器上。然而这些环境之间的密集交互,会在扩容时让我们的 RolloutManager 遇到单机瓶颈——每次交互通常都涉及若干 CPU 操作。为解决这个问题,我们首先把原来的设计拆解成一个 Lightweight-RolloutManager(管理全局控制元数据)和多个 RolloutController(每个以数据并行的方式管理一个虚拟 rollout 组的生命周期)。一个虚拟 rollout 组由多条轨迹和相关的物理机(包括生成实例和 ENV 实例)构成。其次,为了在生产任务中灵活调度海量环境,我们扩展了 PyTorch RPC 框架26,使其提供 CPU 空闲感知的远程函数调用与对象实例化。这一扩展让我们可以在任意机器或空闲机器上实例化并执行远程环境,从而高效部署海量环境。
图 6:Prefill-Decode 分离配合 KV cache 换出的工作流。rollout manager 协调 prefill(P)与 decode(D)实例,并从 D 实例收集最终结果。收到新请求时,P 和 D 先做一次初始握手,然后启动异步的分块 KV cache 传输。当设备上的 KV cache 用量达到给定水位线时,换出被触发,并且可以在 P 和 D 两侧实例上并发执行。
PD 分离与 CPU 换出。为了在我们的加速器上高效生成 LongCat-Flash-Thinking-2601 这个 560B MoE 模型,我们采用了高度的专家并行,并对 decode 做图级编译。然而在多轮智能体训练中,频繁到来的长上下文请求会在一个专家并行组内造成负载不均:被分到更长上下文的 rank 会消耗不成比例的算力和通信带宽,成为性能瓶颈。为解决这一问题,我们在 RL 训练中引入 Prefill–Decode(PD)分离2728,如图 6 所示。对生成实例,我们把 prefill 节点和 decode 节点部署在不同的设备组上,让 decode 的执行图不会被新到达请求的 prefill 负载打断。这避免了生成效率的退化,在多轮 rollout 中维持了高吞吐。不过 PD 分离也带来额外挑战,包括 KV cache 的传输开销,以及当 decode 节点上的设备内 KV cache 不够时昂贵的重算开销——在我们的加速器上尤其明显。为降低 KV cache 传输成本,我们把 KV cache 块按 chunk 级别聚合,并在 PD 节点之间启用异步传输,让前一个 chunk 的传输与后一个 chunk 的计算重叠,从而最小化 KV cache 传输的开销。为避免设备上 KV cache 内存受限引发的重算,我们进一步引入常驻 CPU 的 KV cache,按需动态换入换出 KV cache 块。这一设计消除了设备内 KV cache 容量不足导致的重算开销,帮助在我们的加速器上维持高吞吐。
总体而言,我们的智能体 RL 训练框架在 560B 模型上达到了工业规模的强性能与稳定性,支撑数万个加速器和环境。根据生产任务的运行时统计,整个 rollout 过程中我们的请求负载率29大约是 63%。这个指标量化了长尾请求对生成吞吐的影响,值越高说明利用率越好。训练时之所以没能跑满请求负载率,是因为我们把新请求限制给较旧的模型版本,以牺牲效率为代价来控制平均陈旧度。此外,在一个可能包含多次负载均衡操作的训练步内,我们采用两阶段策略:在第一次负载均衡之前的初始 rollout 阶段(此时还没有长尾生成),我们允许每台设备承载更多请求(例如 8 个),随后把每设备请求数限制到一个最优水平(例如 4 个),以避免重算、提升生成效率。未来我们打算采用更激进的陈旧度控制策略,并探索陈旧度感知的稳定性技术,以实现更高效的异步训练。总之,我们的多版本异步训练系统 DORA 在跨不同场景的生产任务上,比同步训练快 2 到 4 倍。
3.3 RL 训练策略
强化学习已经成为持续提升模型推理能力的中心机制。传统上,RL 训练策略主要关注在相对同质的任务分布和单步 rollout 下稳定策略优化、提升样本效率、管理探索—利用权衡。在这些设定里,任务的难度层级可以差别很大,导致训练样本之间的学习价值高度不均衡。除课程学习之外,我们还在每个训练步内动态分配 rollout 预算,以有效利用有限的算力和训练时间预算,把学习资源集中到高价值任务上。为进一步提升训练有效性,我们额外把验证建模成一个辅助任务来支撑生成、加速优化。
当扩展到智能体设定时,强化学习面临多轮交互和不可预测的环境反馈带来的新挑战,这对模型的有效上下文长度提出了严苛要求。为解决这一问题,我们引入一套上下文管理策略,让模型能在有限上下文窗口下支撑长时程轨迹,同时保留信息量最大的上下文。
当进一步扩展到智能体工具使用场景时,训练问题会变得更加困难。如前所述,泛化性和鲁棒性在这一设定下尤其重要。为促进泛化,智能体工具使用环境取自我们的环境扩展流水线。单个 batch 里的任务可能跨越多个领域的异构环境,这会放大训练的不稳定和不均衡。在训练策略与基础设施支撑的仔细协同设计下,我们得以大规模地做高效稳定的多域环境训练。泛化到真实世界场景仍然有挑战,因为真实世界环境本质上是不完美的。为提升鲁棒性,我们把环境的不完美显式纳入训练过程,让模型学会在非理想条件下的韧性行为。这些设计共同构成一套统一的训练策略,实现稳定、高效、可扩展的智能体强化学习。
3.3.1 通用训练策略
在大规模强化学习中,训练集横跨难度层级差异极大的任务。因此,对所有任务一视同仁的朴素做法往往导致低效学习。为此我们设计了一组贯穿所有强化学习配方的训练策略。具体来说,我们引入课程学习来逐步提高任务难度,施加动态预算分配把算力集中到当前模型状态下最有信息量的任务上,并纳入自验证作为辅助任务来进一步提升优化的效率与效果。
训练目标。我们采用 Group Sequence Policy Optimization(GSPO)作为训练目标,因为它在 MoE 模型上有经验上的有效性,也为长时程智能体轨迹提供更稳定的序列级优化。给定输入 $x$,我们从旧策略 $\pi_{\theta_{\text{old}}}$ 采样一组 $G$ 条轨迹 $\{y_i\}_{i=1}^G$ 并优化:
$$ \mathcal{J}_{\text{GSPO}}(\theta) = \mathbb{E}_{x \sim \mathcal{D},\, \{y_i\}_{i=1}^G \sim \pi_{\theta_{\text{old}}}(\cdot|x)} \left[ \frac{1}{G} \sum_{i=1}^G \min\!\left( s_i(\theta)\,\hat{A}_i,\; \mathrm{clip}\!\left(s_i(\theta), 1-\epsilon, 1+\epsilon\right)\hat{A}_i \right) \right], $$其中 $\epsilon$ 是裁剪阈值。沿用 Zheng 等人30的做法,我们采用基于组的优势估计,并基于归一化似然在序列层面定义重要性比 $s_i(\theta)$。我们主要依靠面向结果的监督,放松对长轨迹的惩罚,让有效策略在训练中自然涌现。
课程学习。为提升学习效果,我们采用课程学习策略,把训练过程逐步结构化。具体来说,我们的课程沿两个互补的轴组织:任务难度和能力要求。任务难度用模型在优化之前估计出的通过率来量化,通过率越低表示任务越难。与此并行,我们用任务主要考察的智能体能力来刻画它们,比如基本工具调用、多步规划或自主决策。在训练早期,我们优先安排那些更容易学、或者能暴露出「智能体在解更难任务时会自主复用的能力」的任务。随着训练推进,我们逐步转向那些更难、且需要更高级智能体能力组合的任务。这种二维课程让模型先获得可复用的智能体技能,再把它们组合起来解决日益复杂的问题。经验上,这套课程策略提升了整体任务通过率,在最有挑战的任务上收益尤其显著。我们在智能体设定下的分析显示,这些提升主要来自三个因素:
- 工具使用的泛化:从更简单任务中习得的技能——比如工具选择和约束处理——能有效迁移到更复杂的场景,大幅减少工具调用失败。
- 交互效率:对任务指令理解得更好,使内部推理更充分,减少了冗余澄清和不必要的工具调用,从而降低交互轮数。
- 规划能力:在时间、地点、实体等多个约束上的联合推理增强后,模型能更直接地完成任务,纠正性迭代更少。
动态预算分配。我们进一步在训练 batch 内施加动态预算分配,优先照顾那些在当前模型状态下学习价值更高的任务。我们观察到,难度与模型当前能力匹配得当的任务,在固定 rollout 预算下能带来显著更高的学习收益。已有的大规模 RL 流水线通常给所有任务分配统一的 rollout 预算。近期研究开始探索自适应的 rollout 分配31,但大多数方法依赖预定义的价值函数。然而,随着模型能力在训练中持续演化,这个假设就站不住了——能提供最有信息量学习信号的那批任务,也会随之改变。
为解决这一点,我们提出一种适应模型实时训练状态的动态 rollout 预算分配策略。具体来说,我们通过监控实时训练指标 $\mathbf{m}_t$(例如通过率)来量化当前策略 $\pi_{\theta_t}$ 的能力,并通过一个动态价值函数把具体任务 $\tau_i$ 和 $\mathbf{m}_t$ 一起映射:
$$ v_{i,t} = V(\tau_i \mid \pi_{\theta_t}, \mathbf{m}_t) $$其中 $v_{i,t}$ 表示任务 $\tau_i$ 的估计价值,刻画了模型在任务空间上不断演化的偏好分布。基于这一价值估计,我们用一个基于堆的贪心算法计算 rollout 分配,使当前训练 batch 的总学习价值最大化。
自验证。除了把模型仅仅当作生成用的 actor 策略之外,我们还把模型当作 verifier,用来评估它自己 on-policy 轨迹的质量。我们观察到一个显著的不对称:即便是能生成高质量轨迹的先进推理模型,在缺少显式 ground-truth 信号时,也往往难以可靠地判断这些轨迹是否正确。这促使我们显式增强模型的自验证能力,并把它当作辅助信号来提升特定领域的推理能力。
具体来说,我们把 on-policy 自验证引入为强化学习期间一个动态激活的训练阶段。当生成器显现出停滞或收敛到局部最优的迹象时,我们触发一个验证阶段,让模型评估自己的 rollout 轨迹。与生成相比,验证是一个相对更容易的任务,通常也能拿到更高的奖励。为进一步提升自验证的有效性,我们采用了一套定制的训练配方:我们确保验证被侧重在困难样例上,并且验证的影响与相应生成轨迹的质量耦合,使这个辅助信号鼓励的是生成能力的忠实提升,而不是退化的捷径行为。经验上,把 on-policy 自验证作为辅助任务引入能加速模型收敛,带来更好的生成表现。
3.3.2 智能体专用策略
在智能体场景中,交互模式自然地从单轮生成转向交错模型推理与工具调用的 多轮轨迹。随着任务复杂度上升,交互轮数和工具返回的长度都在增长,使总上下文长度高度可变且往往难以控制。实践中这经常导致上下文窗口溢出、推理链被截断、任务执行不完整。因此,在有限上下文窗口下做带工具使用的强化学习,有效的上下文管理成为必要组件。
上下文管理。我们设计了一套混合上下文管理策略,在有限上下文窗口下支撑长时程轨迹。已有的智能体模型主要采用两种上下文管理策略:
- 基于摘要的管理:当累计上下文长度超过预设的 token 阈值时,历史工具调用结果被蒸馏成一段简洁摘要,替换原有上下文以维持上下文连续性。基于 ReSum32 的框架,我们用模型自身作为摘要工具,并针对不同 token 阈值做了一系列对比实验,最终确定 80K token 这个最优阈值,细节见附录 B。此外,为提升模型的摘要表现,我们专门为冷启动阶段合成了一份 1.5 万条样本的高质量数据集。实验结果表明这带来约 3% 的准确率提升。
- 基于丢弃的管理:当上下文长度超过预设阈值时,模型丢弃全部或部分历史上下文,然后基于被截断的上下文恢复或重启生成过程。沿用 DeepSeek-V3.210 的做法,我们在本工作中采用 discard-all 策略。
把上述两种策略结合起来,我们设计出一套面向智能体推理的混合上下文管理方法。具体来说,只要上下文窗口超过我们预设的 80K token 上限,就先施加基于摘要的压缩;当交互超过最大轮数时,就触发一次 discard-all 重置,用从原始问题导出的初始化 system prompt 和 user prompt 重启生成。
我们在 BrowseComp 基准33上评测这三种策略。如图 7 所示,在异构算力预算下,上下文管理通过让模型扩展测试时计算资源,带来了实质性的性能提升。值得注意的是,混合策略在大多数情况下优于另外两种,并在整个实验中展现出最高的效率,从 55.8% 起步、达到 73.1% 的峰值。这种优越表现源自在压缩与重置之间的动态切换——由上下文窗口和交互轮数约束共同支配——在关键推理上下文的保留与算力开销的控制之间取得了有利的权衡。此外,我们采用渐进式的丢弃调度,逐步提高丢弃阈值,让更难的样本能获得渐增的推理步数。
图 7:不同上下文管理策略下 BrowseComp 的 Pass@1 准确率。
译注:正文说混合策略「在大多数情况下优于另外两种」,但图 7 显示的不完全是这样。三条曲线的起点分别是 Summary 57.8%、Hybrid 55.7%、Discard-all 54.0%(都在约 78 步处),而在两条曲线重叠的整个区间(约 78–260 步)里 Summary 一直在 Hybrid 之上。Hybrid 的优势在于它跑得更远:Summary 在约 292 步、71.0% 处就停住了,Hybrid 一直延伸到约 385 步、73.1%。Discard-all 最慢但走得最远(约 535 步、72.9%)。所以准确的说法是混合策略在高算力预算区间胜出,而不是全程领先。
3.3.3 扩展环境下的训练策略
引入扩展后的环境,会把强化学习的复杂度推到工具增强设定之上。在这一阶段,我们在跨多个领域、异质性很高的环境上做大规模训练。我们期望在这样多样的环境上训练能促使模型习得可迁移的智能体行为,泛化到领域特定模式之外。这种异质性在算法和系统两个层面都带来新挑战:训练过程必须同时维持跨领域泛化、在高度多样的任务分布下保证稳定优化,并在长尾且不均衡的环境负载下保持高效。为应对这些挑战,我们采用多域环境训练范式,在每个训练 batch 内跨多样环境联合优化。为同时保证稳定性和可扩展性,我们需要训练策略与异步基础设施的协同设计。受环境扩展构造过程的启发,我们注意到真实世界环境本质上是不完美的,因此显式地在训练中引入环境噪声,以提升对异构且不可靠的环境反馈的鲁棒性。
多域环境训练
图 8:LongCat-Flash-Thinking-2601 在大规模多环境智能体 RL 期间的训练奖励。
图 9:LongCat-Flash-Thinking-2601 在 RL 训练期间的智能体基准表现,训练中仅使用合成的通用智能体数据。
为提升跨环境泛化和训练稳定性,我们采用多域环境训练策略,在每个训练 batch 内跨多样环境联合优化。通过环境扩展,我们构造出跨越 20 多个领域的数万个环境,为异构交互模式提供了广泛覆盖。
在这一设定下训练会带来非平凡的系统挑战。具体来说,为维持训练稳定,必须保证所有领域对整体训练过程的贡献大致相当,同时防止任何单个训练 batch 被少数几个领域主导。这条算法约束显著拖累了 DORA 系统的效率,因为它破坏了异步的设计原则:trainer 可能被迫等待缓慢或稀有的长尾领域产出足够样本,而更快的领域则堆积过多的 rollout 轨迹,造成调度气泡和设备利用率不足。为缓解这一问题,我们支持为不同数据类型和领域配置各自的过采样比例。实践中,我们给更难或低吞吐的领域提高 rollout 配额,让它们能贡献足够样本而不阻塞整条流水线,同时以更低的有效速率采样更快的领域。这一设计放松了严格的 batch 内均衡约束,保住了 DORA 异步训练的高吞吐特性,同时在训练阶段仍维持大致均衡的数据混合,保证训练收敛。
为让动态预算分配在这一训练设定下与我们的异步基础设施兼容,我们基于每个任务的历史通过率为它引入一个过采样系数。成功率更低的任务被赋予更高的过采样系数,实际效果是给更难的任务分配更多 rollout 预算。具体来说,每个任务按其过采样系数被复制成多个组,各组在训练时独立计算优势。这一设计在近似动态预算分配的同时,保住了 DORA 简单而完全异步的调度行为,用最小的系统复杂度实现了动态 token 预算控制。
图 8 给出 LongCat-Flash-Thinking-2601 的训练奖励曲线,图 9 给出对应训练步上的智能体基准表现。图 8 中的训练奖励在整个训练过程中呈现稳定一致的上升趋势,说明我们的算法—基础设施协同设计有效保证了大规模下的训练稳定性。此外,图 9 中的智能体基准表现在多个基准上展现出强泛化,验证了我们环境合成流水线的有效性。经验上,多域环境训练在各环境上取得了更高的平均任务完成率,在最具挑战性的环境上提升尤其显著。此外,模型在随机生成的环境中也取得强表现,展现出很强的泛化能力。
译注:图 8 图内的统计框给出了正文没写的几个数:起始准确率 20.75%,峰值准确率 82.78%,绝对提升 +62.03 个百分点,相对增益 +298.90%,训练跑了约 1050 步。图 9 是九张子图($\tau^{2}$-bench 的 airline / retail / telecom / overall,以及 vitabench 的 cross_domain / cross_domain(noise) / delivery / instore / ota),横轴都是 0 到约 1440 步,九条曲线全部单调上行。
鲁棒 RL
表 1:不同训练策略下的性能对比。
| 数据集 | 冷启动 | 无噪声训练 | 带噪声训练 |
|---|---|---|---|
| VitaBench (Avg@4) | 10.0 | 28.6 | 29.3 |
| VitaBench-Noise (Avg@4) | 6.3 | 13.3 | 20.5 |
| Tau2Bench (Avg@4) | 78.8 | 87.1 | 88.2 |
| Tau2Bench-Noise (Avg@4) | 58.8 | 62.2 | 67.1 |
我们把环境的不完美显式纳入训练过程以提升鲁棒性。已有的智能体模型在部署到此前未见或不完美的环境时会出现显著的性能退化。这个问题很大程度上源于当前智能体训练范式的一个普遍假设:智能体通常在精心整理的指令下训练,与稳定、良好受控的环境交互。而真实世界环境本质上是不完美的——用户有各式各样的交互风格和不可预测的行为,工具可能失败、返回带噪输出,或者因为各种外部因素给出不完整的结果。与其在训练时假设理想化环境、指望智能体事后自行适应,我们系统地分析真实世界噪声,并设计一条自动化流水线把环境不完美显式纳入训练过程。为避免引入不可靠或误导性的奖励信号,我们保证注入的不完美不会让任务变得不可解,而只是提高交互过程的难度和随机性。具体来说,我们建模真实智能体场景中两大类交互噪声:指令噪声,刻画用户交互模式中的歧义与多变;工具噪声,模拟外部工具的执行失败、响应不一致和部分结果。
在智能体强化学习期间,我们用基于课程的策略逐步引入这些噪声。我们把智能体模型的鲁棒性度量为同一任务在完美环境与不完美环境之间的性能差距。从轻微扰动出发,当模型在当前层级展现出足够鲁棒性时,我们再逐步提高噪声的难度和多样性。这一自适应过程保证训练始终有信息量而不至于压垮模型,也避免在过度嘈杂的区间里做低效探索。
表 1 给出我们鲁棒训练策略在不完美环境下的消融研究。结果显示,带噪声训练在标准智能体基准上取得相当甚至略好的表现,同时在带噪、不完美的条件下带来实质性提升。
4 通过 Heavy Thinking 实现测试时扩展
图 10:Heavy Thinking 模式的框架。
测试时扩展(TTS)已经成为一种有效范式,通过在推理时扩展算力来提升模型在复杂推理任务上的表现。近期进展表明,增加推理深度——通过带自反思的长思维链——能让模型迭代地精化自己的推理过程34535。与此并行,自洽性(self-consistency)和蒙特卡洛树搜索(MCTS)这类做法沿宽度维度扩展算力,探索多条推理轨迹以更好地逼近模型的推理边界。更近一些,若干前沿模型引入了 heavy thinking3637938,目标是在测试时同时扩展推理的深度与宽度。经验上,这些模式优于只扩展深度或只扩展宽度的策略。然而这类 heavy thinking 的具体实现细节基本没有公开,限制了它们的可复现性和系统性研究。
为进一步释放推理能力、突破现有性能天花板,我们提出一个简单有效的 heavy thinking 框架,把测试时算力分解成两个互补阶段:并行推理和 heavy thinking。如图 10 所示,第一阶段我们让一个 thinking 模型并行地生成,产出多条候选推理轨迹以扩大探索的广度。第二阶段我们用一个 summary 模型对这些轨迹做反思式推理,综合它们的中间推理与结果,得出最终决策。为支持工具使用和多轮对话场景,我们还引入一个上下文记忆模块来存储消息历史。如图 11 所示,每一轮 summary 模型都会收到并行推理阶段的历史消息以感知上下文。我们设计了专门的 prompt 模板来组织当前轮并行轨迹的排列(只保留答案内容),引导 summary 模型生成最终响应,其目标是聚合或精化并行推理阶段得出的答案。我们还约束 summary 模型的最终输出响应在风格和格式上与并行推理阶段保持一致,使 summary 模型的响应能直接拼接进消息历史。值得注意的是,thinking 模块和 summary 模块既可以共享同一份模型参数,也可以实例化成不同的模型。
为进一步提升表现,我们还引入一个专门针对 summary 阶段的额外 RL 阶段。经验上我们发现 heavy thinking 在很宽的设定范围内都有效,包括长思维链推理、工具集成推理和完全的智能体工具使用场景。通过让测试时算力沿推理深度与宽度自适应地扩展,heavy thinking 持续优于自洽性,而且随着测试时算力预算增长,它的优势会愈发明显。
图 11:并行推理与 heavy thinking 的上下文消息管理。
译注:图 11 画的是多轮场景下消息历史怎么拼。每一轮里并行推理产出 $K$ 组 Thinking/Answer,heavy thinking 阶段的输入只取其中的 Answer 1-1 到 1-$K$(不带 Thinking),加上 SYSTEM 和 User Message 1;它输出 Sum. Thinking 1 和 Sum. Answer 1。进入第 2 轮时,写回历史的只有 Sum. Answer 1——并行推理阶段那 $K$ 条轨迹和 summary 自己的思考过程都不进历史。这就是正文说「约束最终输出与并行推理阶段风格格式一致,从而可直接拼接」的具体形态。
5 评测
表 2:多个基准上的性能(%)对比。加粗为全场最佳,斜体为开源最佳。† 表示分数来自外部报告,‡ 表示使用我们的 heavy 模式得到的分数,∗ 表示带工具的结果不可得、因而报告对应的无工具结果。关于 BrowseComp,我们同时报告不带和带上下文管理技术的表现。
| 基准 | DeepSeek-V3.2-Thinking | Kimi-K2-Thinking | Qwen3-235B-A22B-Thinking-2507 | GLM-4.7-Thinking | Claude-Opus-4.5-Thinking | Gemini-3-Pro | GPT-5.2-Thinking-xhigh | LongCat-Flash-Thinking-2601 |
|---|---|---|---|---|---|---|---|---|
| 架构 | MoE | MoE | MoE | MoE | - | - | - | MoE |
| 总参数量 | 671B | 1T | 235B | 355B | - | - | - | 560B |
| 激活参数量 | 37B | 32B | 22B | 32B | - | - | - | 27B |
| 数学推理(带工具) | ||||||||
| AIME-25 (Avg@16) | 93.5∗ | 99.1† | 92.6∗ | 95.3∗ | 100.0 | 99.8 | 100.0 | 99.6 / 100.0‡ |
| HMMT-25 (Avg@16) | 93.5∗ | 95.1† | 83.9∗ | 98.1∗ | 98.6 | 99.8 | 99.6 | 93.4 / 97.5‡ |
| IMO-AnswerBench (Avg@4) | 77.7∗ | 78.7∗ | 73.0∗ | 84.0∗ | 82.8 | 86.7 | - | 78.6 / 86.8‡ |
| AMO-Bench EN (Avg@16) | 51.9∗ | 56.0∗ | 47.8∗ | 62.4∗ | 66.0 | 72.5 | - | 61.6 / 66.0‡ |
| AMO-Bench CH (Avg@16) | 52.0∗ | 51.8∗ | 28.8∗ | 35.1∗ | 67.7 | 74.9 | - | 56.8 / 67.5‡ |
| 智能体搜索 | ||||||||
| BrowseComp (Pass@1) | 51.4† / 67.6† | - / 60.2† | - | 52.0† / 67.5† | - | - | 65.8† / - | 56.6 / 73.1 |
| BrowseComp-zh (Pass@1) | 65.0† / - | - / 62.3† | - | 66.6† / - | - | - | - | 69.0 / 77.7 |
| RW Search (Pass@1) | 74.0 | 63.0 | 20.5 | 69.0 | 75.5 | 74.5 | 82.0 / - | 79.5 |
| 智能体工具使用 | ||||||||
| $\tau^{2}$-Retail (Avg@4) | 81.8† | - | 71.9† | - | 88.9† | - | 82.0† | 88.6 |
| $\tau^{2}$-Airline (Avg@4) | 63.8† | - | 58.6† | - | - | - | - | 76.5 |
| $\tau^{2}$-Telecom (Avg@4) | 96.2† | - | 47.3 | - | 98.2† | - | 98.7† | 99.3 |
| $\tau^{2}$-Avg (Avg@4) | 80.6 | 74.3† | 59.3 | 87.4† | 82.4 | 90.7† | 80.6 | 88.2 |
| $\tau^{2}$-Noise (Avg@4) | 64.1 | 63.1 | 44.3 | 66.0 | 59.4 | 57.3 | 65.0 | 67.1 |
| VitaBench (Avg@4) | 24.0 | 12.8 | 14.5 | 18.3 | 28.5 | 31.5 | 24.3 | 29.3 |
| VitaBench-Noise (Avg@4) | 14.0 | 9.2 | 6.5 | 10.8 | 20.3 | 20.8 | 19.0 | 20.5 |
| Random Complex Tasks (Avg@4) | 32.5 | 29.7 | 28.3 | 25.3 | 32.6 | 32.5 | 17.2 | 35.8 |
| 通用问答 | ||||||||
| HLE 纯文本(无工具) | 24.1 | 24.4 | 17.8 | 26.9 | 32.0 | 40.3 | 34.5† | 25.2 |
| GPQA-Diamond (Avg@16) | 86.9 | 85.4 | 80.5 | 84.9 | 86.9 | 91.9 | 92.9 | 80.5 / 85.2‡ |
| 编码 | ||||||||
| LCB (24.08-25.05) (Avg@4) | 82.4 | 75.1 | 76.2 | 84.8 | 82.8 | 88.1 | - | 82.8 |
| OJBench (Pass@1) | 41.8 | 42.3 | 35.6 | 44.6 | 46.7 | 61.2 | - | 42.2 |
| OIBench EN (Pass@1) | 43.3 | 39.0 | 36.8 | 30.8 | 50.0 | 58.2 | - | 47.7 |
| SWE-bench Verified (Avg@5) | 73.1 | 71.3 | - | 73.8 | 80.9 | 76.2 | 80.0 | 70.0 |
译注:三点说明。其一,原表表头有三行——第一行把八列分成「开源权重推理模型」(前四列)、「闭源权重推理模型」(中间三列)、「本文模型」(最后一列),第二三行才是拆成两截的模型名。markdown 表不支持合并单元格,这里把模型名拼回一行,分组信息写在这条译注里。其二,原文用下划线标注「开源模型中的最佳」,markdown 没有下划线,这里改用斜体,加粗仍表示全场最佳。其三,原表用
\multicolumn做的能力分组行(数学推理、智能体搜索等)在这里变成了首列加粗、其余留空的整行。
5.1 基准与配置
我们的评测覆盖模型能力的五个方面:数学推理、智能体搜索、智能体工具使用、通用推理和编码。
数学推理。我们用标准的奥赛级基准评测数学推理,包括 AIME 202539、HMMT 2025(二月场)40和 IMO-AnswerBench41。除这些标准基准之外,我们引入 AMO-Bench42——现有奥赛级基准中最有挑战性的数据集。它包含 50 道由人类专家设计的题目,有英文和中文两个版本,可以分析跨语言的数学推理能力。我们公开了 AMO-Bench 的英文版和评测脚本43。由于这些数据集规模有限,我们报告 Avg@k 指标,IMO-AnswerBench 用 $k=4$,其余数学基准都用 $k=16$。我们主要关注工具集成推理的表现,这里的工具指代码执行。对支持代码执行的外部模型,我们在评测时启用这一功能;对不支持代码的模型,我们报告官方结果(若有)或它们的无工具表现。
智能体搜索。我们在 BrowseComp33 和 BrowseComp-ZH44 上评测智能体搜索能力,并同时报告带和不带上下文管理两种设定下的结果。对 BrowseComp-zh,我们注意到原始标注里有一些错误,人工修订了其中 24 个样例的答案45。我们尝试在自己的智能体搜索框架下复现开源和闭源模型在这些基准上报告的结果,但观察到的表现一致地低于其报告数字。因此,对外部模型我们采用它们官方报告的结果。为实现对搜索能力公平且受控的对比,我们额外构造了 RWSearch46——一个有挑战性的智能体搜索基准,包含 200 条需要复杂推理和多步信息检索的真实世界搜索查询。所有模型在 RWSearch 上都不使用上下文管理来评测,以保证公平比较。
智能体工具使用。我们在 $\tau^{2}$-Bench47、VitaBench48、$\tau^{2}$-Noise、Vita-Noise 和 Random Complex Tasks 上评测智能体工具使用能力。对 $\tau^{2}$-Bench,我们观察到默认的用户模拟器偶尔会出现异常行为,给评测引入不受控的噪声。为解决这个问题,我们把原模拟器换成 GPT-4.1 并相应调整 prompt 策略7498。对 $\tau^{2}$-Bench 的 airline 子集,我们进一步识别出若干标注和环境问题,它们会导致虚假失败和不可靠的评测7498。因此我们在一个固定的、清洗过的 airline 子集上评测所有模型,其中 19 个有问题的样例已被修正。所有这些改动都已公开发布以便复现50。对 VitaBench,我们更新了评测设置:把 verifier 模型升级到公开可得的最强版本,并采用更严格的评测标准,从而进一步提升基准的可靠性。这个更新版的 VitaBench 我们也已公开发布51。
下面介绍 $\tau^{2}$-Noise、Vita-Noise 和 Random Complex Tasks 的构造与评测协议。
- $\tau^{2}$-Noise 与 Vita-Noise。为评估智能体推理能力的鲁棒性,我们系统分析真实世界环境中观察到的偏差,设计了一条自动化噪声注入流水线,能把真实感的噪声注入任意基准。基于这条流水线,我们反复随机地向 $\tau^{2}$ 和 Vita 基准注入噪声,构造出 $\tau^{2}$-Noise 和 Vita-Noise,并报告多次带噪实例化上的平均表现。
- Random Complex Tasks。为评估智能体推理能力的泛化性,我们引入一套新的评测协议 Random Complex Tasks,建立在一个自动化任务合成过程之上——受我们环境扩展流水线的启发,随机生成跨多样场景的复杂、可执行、可验证的智能体任务。每次评测运行时,我们随机采样 100 个跨越四个以上领域的多样复杂任务,计算 Avg@4 分数。为保证可靠性,我们重复三次独立运行并报告跨运行的平均结果。
我们将发布噪声注入流水线,并把 Random Complex Tasks 集成进一个开放评测平台,以支撑后续的可复现性和基准测试。
通用问答。我们在 GPQA-Diamond52 和 HLE53 上评测通用推理,它们覆盖广泛的知识密集型和推理导向任务。对 GPQA-Diamond,我们报告 Avg@16 以降低采样随机性带来的方差。对 HLE,由于我们的模型是纯文本模型,我们在纯文本子集上报告结果,并保证所有对比模型都遵循同样的设定。我们观察到 HLE 的结果对 prompt 模板和打分模型很敏感。为保证公平对比,所有模型都用 HLE 官方推荐的 prompt 模板评测,并用官方的 o3-mini 打分模型和模板来打分。
编码。我们在两种设定下评测编码能力:代码推理和智能体编码。对代码推理,我们使用 LiveCodeBench54、OJBench55 和 OIBench56。对 LiveCodeBench,我们在 2408–2505 子集上评测,覆盖最近两次发布、共 454 道题,报告 Avg@4。对 OJBench 和 OIBench,由于评测成本和思考模型所需的长推理轨迹,我们报告 Pass@1。对 智能体编码,我们使用 SWE-bench Verified——软件工程智能体的标准基准,并采用第三方智能体框架 R2E-Gym57 作为执行骨架。为保证正确性,我们人工清理并修复了原基准中少量的 Docker 镜像(主要是库升级引入的依赖不匹配),保证所有 gold patch 都可执行。
5.2 主要结果
如表 2 所示,我们把 LongCat-Flash-Thinking-2601 与若干先进的开源权重和闭源权重推理模型作了对比。开源权重模型包括 DeepSeek-V3.2-Thinking10、Kimi-K2-Thinking9、Qwen3-235B-A22B-Thinking-250758 和 GLM-4.7-Thinking59,闭源权重模型包括 Claude-Opus-4.5-Thinking7、Gemini-3-Pro8 和 GPT-5.2-Thinking-xhigh49。在一整套综合基准上,LongCat-Flash-Thinking-2601 在传统推理任务上取得极具竞争力的表现,并在智能体推理能力上展现出明显优势。除非另有说明,推理时的采样参数为 temperature $=1.0$、top-$k=-1$、top-$p=1.0$。下面按能力逐项拆解。
- 数学推理:在有挑战性的数学推理基准上,LongCat-Flash-Thinking-2601 展现出强工具集成推理能力,持续处于第一梯队。特别是配上 heavy 模式后,LongCat-Flash-Thinking-2601 达到了与领先闭源模型相当的水平。具体来说,带 heavy 模式的 LongCat-Flash-Thinking-2601 在 AIME-2025 上取得满分,在 IMO-AnswerBench 上取得 86.8 的最先进分数,在 AMO-Bench 上取得开源最先进结果。值得注意的是,虽然在 AMO-Bench(EN)上略落后于最强的闭源模型,LongCat-Flash-Thinking-2601 仍是表现最好的开源模型。此外,LongCat-Flash-Thinking-2601 在 AMO-Bench 的英文版和中文版上表现相当,说明它在非英语设定下也具备先进的数学推理与工具使用能力。
- 智能体搜索:LongCat-Flash-Thinking-2601 在 BrowseComp 和 BrowseComp-ZH 上都取得最先进表现。启用上下文管理后,它在 BrowseComp 上取得 73.1,在 BrowseComp-ZH 上取得 77.7,超过所有参评模型。在 RWSearch——一个用来评测真实世界复杂搜索场景的私有基准——上,LongCat-Flash-Thinking-2601 取得 79.5,仅次于 GPT-5.2-Thinking。
- 智能体工具使用:LongCat-Flash-Thinking-2601 在开源模型中展现出最先进的智能体工具使用能力。它在 $\tau^{2}$-Bench 和 VitaBench 上取得强表现,在它们的噪声增强变体上也有竞争力的结果。特别地,我们的模型在使用任意生成工具的 random complex tasks 上取得最先进结果。这些结果表明模型对真实世界环境噪声有很强的鲁棒性,对此前未见的任务分布也有出色的泛化能力。
- 通用问答:LongCat-Flash-Thinking-2601 在扩展智能体和工具集成推理的同时,在通用问答基准上保持了强表现。它在 HLE 纯文本子集上取得 25.2,在 heavy 模式下于 GPQA-Diamond 上取得 85.2,接近开源最先进水平。
- 编码:LongCat-Flash-Thinking-2601 在代码推理和智能体编码两类基准上都表现有竞争力。在 LiveCodeBench 系列的算法解题任务上,它位列开源模型前茅。在 OJBench 和 OIBench 这类更难的基准上,我们的模型分别取得开源第二和开源第一。值得注意的是,与 GLM-4.7 相比,LongCat-Flash-Thinking-2601 以显著更低的推理成本取得相近表现——每道题大约 45k token,对方是 57k token。在 SWE-bench Verified 上,LongCat-Flash-Thinking-2601 处于开源模型第一梯队,进一步验证了它在真实软件工程任务上的能力。
译注:OJBench 上「开源第二」这个说法和表 2 对不上。表里五个开源模型的分数是 GLM-4.7 的 44.6、Kimi-K2 的 42.3、LongCat 的 42.2、DeepSeek-V3.2 的 41.8、Qwen3 的 35.6,LongCat 排第三,只比 Kimi 低 0.1。表 2 里 OJBench 那行的开源最佳下划线也标在 GLM-4.7 的 44.6 上。OIBench 的「开源第一」倒是对的:LongCat 的 47.7 高过第二名 DeepSeek 的 43.3。
6 One More Thing:Zig-Zag 注意力设计
长上下文效率已经成为现代大语言模型日益关键的挑战。推理轨迹越来越长这个稳定趋势,对标准全注意力构成了根本限制——它的平方级复杂度在长上下文智能体训练和推理中很快变得难以承受。此外,在 heavy thinking 模式下,多条并行推理轨迹同时解码会进一步放大推理延迟,让高效注意力机制更加不可或缺。已有做法——包括 稀疏注意力和 线性注意力方法60616263——试图通过降低注意力的计算复杂度来缓解这个问题。然而这些方法通常需要大量重训练才能让模型适应新的注意力架构,带来可观的额外算力开销和工程成本。为解决这一局限,我们探索了一种实验性的高效注意力设计,并同步开源了一个模型 LongCat-Flash-Thinking-ZigZag64。具体来说,我们提出 Zigzag Attention,一种稀疏注意力机制,能让已有的全注意力模型在中期训练期间高效地转换成稀疏变体。这一转换只带来可忽略的开销,同时让模型能高效扩展到超长上下文,支持最长 100 万 token 的序列长度。
具体地,Zigzag Attention65 把 Multi-head Latent Attention(MLA)与 Streaming Sparse Attention(SSA)66结合起来,实现了随完整上下文长度亚平方增长的计算量。对每个查询 token $h_t$,注意力被限制在一个固定的键值 token 集合上,它由两部分构成:(i)最近 token 组成的 局部窗口,(ii)序列开头的一小组初始 token。形式化地,注意力输出计算为:
$$ u_t = \mathrm{Attn}\!\left( h_t,\; \{h_s \mid s \in [t-W, t] \cup [0, B)\} \right), $$其中 $W$ 表示局部上下文窗口大小,$B$ 表示保留的前缀 token 数。与全注意力相比,这一设计在保留短程上下文和全局锚点的同时,显著降低了计算和内存复杂度。
(a)Prefill。
(b)Decode。
图 12:LongCat-Flash-Thinking 与配备 Zigzag Attention 的 LongCat-Flash-Thinking-ZigZag 之间的推理效率对比。加速比在生产推理集群上测得。
译注:两张子图的横轴都是上下文长度(4K 到 256K),纵轴是相对 LongCat-Flash-Thinking-2601 的加速比。加速比随上下文增长:prefill 从 4K 处的约 1.0 涨到 256K 处的约 1.55,decode 从约 1.0 涨到约 1.45。4K 时两者基本持平(ZigZag 甚至略低于 1.0),说明这套设计的收益完全来自长上下文。
Zigzag 连通性。Zigzag Attention 采用逐层交错的稀疏化策略。具体来说,大约 50% 的全注意力层被替换成 SSA 层,其余层保留基于 MLA 的全注意力。这种层级稀疏避免了头级稀疏化常见的计算不均衡和 GPU 线程发散,带来更高效的硬件利用率。虽然每个 SSA 层内部的注意力是稀疏且局部的,全局信息通过跨层组合被保留下来。通过交替排布稀疏层和全注意力层,信息在多个层之上跨越遥远位置传播,沿序列形成一条 Z 字形(zigzag)的连通路径。因此,尽管每层都是稀疏的,长程依赖依然可达。
Zigzag 集成。Zigzag Attention 在中期训练期间通过一套结构化稀疏化流程引入。第一步,我们用一份标定数据集估计预训练模型中各注意力层的相对重要性。第二步,把重要性得分最低的那批层替换成 SSA 层。稀疏化之后,模型继续做长上下文中期训练,并配合基于 YaRN 的位置编码扩展,使上下文长度可达 100 万 token。实践中我们采用 128 的块大小,配 1 个 sink 块和 7 个局部块,因此每层的有效注意力跨度是 1,024 个 token。把大约一半的全注意力层替换成 Zigzag Attention,带来约 $1.5\times$ 的端到端推理加速(如图 12 所示),同时在各基准上保持推理性能和智能体能力。
为解锁处理更长上下文的能力,我们给这些配方配上 YaRN67,使 LongCat-Flash-Thinking-ZigZag 能自行外推到处理最多 100 万 token。除此之外,我们再给出模型涉及的几个关键参数:块大小是 128,sink 块数量是 1,局部块数量是 7,合计 1,024 个 token。
LongCat-Flash-Thinking-ZigZag 在性能与速度之间取得了不错的权衡。图 13 快速展示了它如何在提升效率的同时保持有竞争力的表现。
图 13:性能与相对成本的关系。箭头上标注的百分比表示在相关数据集上做基准测试时降低后的成本。
译注:图注这句「降低后的成本」(the reduced cost)容易读反。图里箭头从菱形(LongCat-Flash-Thinking-2601,相对成本恒为 1.0)指向圆点(ZigZag 版),百分比标的是圆点所在的横坐标,也就是剩余的相对成本,不是降幅。六个数据集的读数是:OJBench 82%(42.2 → 约 41.2)、AMO-Bench En 84%(61.6 → 约 60.5)、GPQA-Diamond 92%(80.5 → 约 80.6)、BrowseComp 72%(56.6 → 约 55.3)、BrowseComp Zh 72%(69.0 → 约 71.8)、$\tau^{2}$-Bench 83%(88.2 → 约 87.0)。所以真正的降幅是 8% 到 28%。另外值得一提的是,BrowseComp Zh 和 GPQA-Diamond 这两项上 ZigZag 版不降反升。
7 结论
我们推出 LongCat-Flash-Thinking-2601,一个开源权重的 560B MoE 推理模型,具备出色的智能体推理能力。这个模型建立在一条统一的端到端训练流水线之上,协同设计了架构、预训练、后训练、数据构造和可扩展的 RL 基础设施,全部明确面向长时程、交互驱动的智能体推理。支撑 LongCat-Flash-Thinking-2601 的核心创新如下:(i)一套可扩展的环境构造与多域强化学习框架,使可泛化的智能体技能能被稳定地习得;(ii)一条鲁棒的智能体训练流水线,通过基于课程的强化学习系统性地纳入真实世界环境噪声;(iii)一个 Heavy Thinking 模式,通过同时拓展推理宽度与深度实现有效的推理测试时扩展。通过这套整体设计,LongCat-Flash-Thinking-2601 在广泛的智能体基准上确立了开源模型中的最先进表现,缩小了与领先闭源模型之间的差距。
附录 A 最优超参数预测
图 14:最优 batch size 与学习率的 scaling 曲线。圆点和方块分别代表 MoE-1.8B 和 MoE-100M 模型。虚线是带置信区间的幂律拟合。这些 scaling law 先在 MoE-3B 和 MoE-6B 模型上验证,再外推去预测 MoE-26B 的最优配置。
高效地找出最优超参数是大规模中期训练的核心挑战之一——搜索空间巨大,算力成本又很高。为应对这一挑战,我们提出一种预测最优超参数的新方法,专门用来最小化寻找最佳配置的算力成本。
我们的做法由两个关键步骤组成:
- 超参数映射:我们用不同超参数训练小模型,借助验证损失和 FLOPS 把最优超参数映射到它们的算力成本上(见图 14),从而理解配置如何影响训练效率与性能。
- 超参数预测:对给定的持续训练 checkpoint,我们用验证损失估计其等效算力成本——也就是若从零开始在这批持续训练数据上训练、达到同样损失所需的算力。然后基于这个估计和实际算力负载来预测最优超参数。
通过这一方法,我们能预测出支撑高效持续训练的最优超参数,以最小的算力开销提升模型表现。
译注:图 14 是两张并排子图,纵轴都是 FLOPS(对数刻度)。(a)Batch Size Scaling Curve 的横轴是最优 batch size(0 到 8000),(b)Learning Rate Scaling Curve 的横轴是最优学习率(5e-05 到 1e-03,对数刻度)。实测点来自 MoE-1.8B(图例写作 MoE-1d8B)和 MoE-100M 两档,3B、6B、26B 三档都是外推出的预测点。学习率那张图的斜率是负的——模型越大、算力越多,最优学习率越小。
附录 B token 阈值上下文管理的性能评估
如图 15 所示,我们在不同的摘要上下文 token 长度下评测 BrowseComp 的 Pass@1 准确率,上下文轮数上限设为 500。准确率从 20K token 时的 63.86% 稳步上升到 80K token 时的峰值 66.58%,然后在 100K token 时回落到 65.9%。这确定了 80K 是基于摘要的上下文管理的最优上下文长度,因此我们在所有后续实验中都把 80K 上下文长度固定为触发摘要的阈值。
图 15:不同摘要上下文 token 长度下 BrowseComp 的 Pass@1 准确率。
译注:图上标出了五个点,正文只提了其中三个。完整读数是 20K → 63.86%、40K → 64.22%、60K → 66.46%、80K → 66.58%、100K → 65.9%。60K 到 80K 之间其实只差 0.12 个百分点,曲线在这一段已经基本走平。
-
Meituan LongCat Team (2026). LongCat-Flash-Thinking-2601 Technical Report. arXiv:2601.16725 ↩︎
-
LongCat Chat:https://longcat.ai ↩︎
-
模型权重:https://huggingface.co/meituan-longcat/LongCat-Flash-Thinking-2601 ↩︎
-
代码仓库:https://github.com/meituan-longcat/LongCat-Flash-Thinking-2601 ↩︎
-
DeepSeek-AI (2025). DeepSeek-r1: incentivizing reasoning capability in llms via reinforcement learning. arXiv:2501.12948 ↩︎ ↩︎
-
Z. Shao, Y. Luo, C. Lu, Z. Z. Ren, J. Hu, T. Ye, Z. Gou, S. Ma, and X. Zhang (2025). DeepSeekMath-v2: towards self-verifiable mathematical reasoning. arXiv:2511.22570 ↩︎
-
Anthropic (2025). Introducing claude opus 4.5. https://www.anthropic.com/news/claude-opus-4-5 ↩︎ ↩︎ ↩︎ ↩︎
-
Google (2025). A new era of intelligence with gemini 3. https://blog.google/products-and-platforms/products/gemini/gemini-3/#note-from-ceo ↩︎ ↩︎ ↩︎ ↩︎
-
MoonshotAI (2025). Kimi-k2 documentation. https://moonshotai.github.io/Kimi-K2/ ↩︎ ↩︎ ↩︎
-
DeepSeek-AI, A. Liu, A. Mei, B. Lin, B. Xue, B. Wang, B. Xu, B. Wu, B. Zhang, C. Lin, et al. (2025). DeepSeek-v3.2: pushing the frontier of open large language models. arXiv:2512.02556 ↩︎ ↩︎ ↩︎
-
MiniMax (2025). MiniMax m2 and agent: ingenious in simplicity. https://www.minimax.io/news/minimax-m2 ↩︎
-
M. L. Team, Bayan, B. Li, B. Lei, B. Wang, B. Rong, C. Wang, C. Zhang, C. Gao, C. Zhang, et al. (2025). LongCat-flash technical report. arXiv:2509.01322 ↩︎ ↩︎
-
X. Zhang, C. Ren, C. Tu, R. Weng, S. Wang, H. Yan, J. Wang, and X. Cai (2025). Expanding reasoning potential in foundation model by learning diverse chains of thought patterns. arXiv:2509.21124 ↩︎
-
C. Tu, X. Zhang, R. Weng, R. Li, C. Zhang, Y. Bai, H. Yan, J. Wang, and X. Cai (2025). A survey on llm mid-training. arXiv:2510.23081 ↩︎
-
Z. Xu, R. Li, J. Li, R. Weng, J. Wang, X. Cai, and X. Wang (2026). Unlocking implicit experience: synthesizing tool-use trajectories from text. arXiv:2601.10355 ↩︎
-
M. L. Team, A. Gui, B. Li, B. Tao, B. Zhou, B. Chen, C. Zhang, C. Han, C. Yang, C. Zhang, et al. (2025). LongCat-flash-thinking technical report. arXiv:2509.18883 ↩︎
-
O. Sener and S. Savarese (2018). Active learning for convolutional neural networks: A core-set approach. In ICLR (Poster). https://arxiv.org/html/2601.16725v1#S3.SS1.SSS2.Px1.p1.1 “General Thinking ‣ 3.1.2 Initial Policy ‣ 3.1 RL Preparation ‣ 3 Scaling Reinforcement Learning ‣ LongCat-Flash-Thinking-2601 Technical Report” ↩︎
-
Q. Du, C. Zong, and J. Zhang (2023). MoDS: model-oriented data selection for instruction tuning. arXiv:2311.15653 ↩︎
-
S. Wu, K. Lu, B. Xu, J. Lin, Q. Su, and C. Zhou (2023). Self-evolved diverse data sampling for efficient instruction tuning. arXiv:2311.08182 ↩︎
-
T. Jiang, S. Li, Y. Song, L. Zhang, H. Zhu, Y. Zhao, X. Xu, K. Taura, and H. H. Wang (2025). Importance-aware data selection for efficient LLM instruction tuning. arXiv:2511.07074 ↩︎
-
J. Zhang, C. Zhang, Y. Liu, Y. Jin, X. Yang, B. Zheng, Y. Liu, and L. Guo (2025). D3: diversity, difficulty, and dependability-aware data selection for sample-efficient LLM instruction tuning. In IJCAI, pp.8348–8356. https://arxiv.org/html/2601.16725v1#S3.SS1.SSS2.Px1.p1.1 “General Thinking ‣ 3.1.2 Initial Policy ‣ 3.1 RL Preparation ‣ 3 Scaling Reinforcement Learning ‣ LongCat-Flash-Thinking-2601 Technical Report” ↩︎
-
W. Fu, J. Gao, X. Shen, C. Zhu, Z. Mei, C. He, S. Xu, G. Wei, J. Mei, J. Wang, et al. (2025). AReaL: a large-scale asynchronous reinforcement learning system for language reasoning. arXiv:2505.24298 ↩︎
-
H. Zhang, X. Liu, B. Lv, X. Sun, B. Jing, I. L. Iong, Z. Hou, Z. Qi, H. Lai, Y. Xu, et al. (2025). AgentRL: scaling agentic reinforcement learning with a multi-turn, multi-task framework. arXiv:2510.04206 ↩︎
-
H. Lu, Z. Liu, S. Xiong, Y. He, W. Gao, Y. Wu, W. Wang, J. Liu, Y. Li, H. Zhao, et al. (2025). Part ii: roll flash–accelerating rlvr and agentic training with asynchrony. arXiv:2510.11345 ↩︎
-
M. L. Team, A. Gui, B. Li, B. Tao, B. Zhou, B. Chen, C. Zhang, C. Han, C. Yang, C. Zhang, et al. (2025). Introducing longcat-flash-thinking: a technical report. arXiv:2509.18883(与脚注 16 是同一篇 LongCat-Flash-Thinking 报告,原文参考文献里以 2025b / 2025c 两条重复收录,arXiv 编号相同) ↩︎ ↩︎
-
P. Damania, S. Li, A. Desmaison, A. Azzolini, B. Vaughan, E. Yang, G. Chanan, G. J. Chen, H. Jia, H. Huang, et al. (2023). Pytorch rpc: distributed deep learning built on tensor-optimized remote procedure calls. Proceedings of Machine Learning and Systems 5, pp.219–231. https://arxiv.org/html/2601.16725v1#S3.SS2.SSS0.Px2.p1.1 “Scaling to Large-scale Agentic Training ‣ 3.2 Scalable Asynchronous Agentic RL Framework ‣ 3 Scaling Reinforcement Learning ‣ LongCat-Flash-Thinking-2601 Technical Report” ↩︎
-
Y. Zhong, S. Liu, J. Chen, J. Hu, Y. Zhu, X. Liu, X. Jin, and H. Zhang (2024). distserve}}: Disaggregating prefill and decoding for goodput-optimized large language model serving. In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24), pp.193–210. https://arxiv.org/html/2601.16725v1#S3.SS2.SSS0.Px3.p1.1 “PD Disaggregation with CPU Swapping ‣ 3.2 Scalable Asynchronous Agentic RL Framework ‣ 3 Scaling Reinforcement Learning ‣ LongCat-Flash-Thinking-2601 Technical Report” ↩︎
-
R. Qin, Z. Li, W. He, J. Cui, H. Tang, F. Ren, T. Ma, S. Cai, Y. Zhang, M. Zhang, et al. (2024). Mooncake: a kvcache-centric disaggregated architecture for llm serving. ACM Transactions on Storage. https://arxiv.org/html/2601.16725v1#S3.SS2.SSS0.Px3.p1.1 “PD Disaggregation with CPU Swapping ‣ 3.2 Scalable Asynchronous Agentic RL Framework ‣ 3 Scaling Reinforcement Learning ‣ LongCat-Flash-Thinking-2601 Technical Report” ↩︎
-
原文行内脚注:请求负载率是一个 0 到 1 之间的连续值,在整个 rollout 期间对所有生成设备聚合得到。举例来说,当最大响应长度设为 64K 时,只考虑设备上可用的 KV cache 块、且要避免重算的话,我们的加速器大约能容纳 4 个请求。那么这台加速器上有 1 个请求时请求负载率就是 25%,没有请求时是 0%——长尾生成场景下尤其如此。 ↩︎
-
C. Zheng, S. Liu, M. Li, X. Chen, B. Yu, C. Gao, K. Dang, Y. Liu, R. Men, A. Yang, J. Zhou, and J. Lin (2025). Group sequence policy optimization. arXiv:2507.18071 ↩︎
-
Z. Li, C. Chen, T. Yang, T. Ding, R. Sun, G. Zhang, W. Huang, and Z. Luo (2025). Knapsack RL: unlocking exploration of llms via optimizing budget allocation. arXiv:2509.25849 ↩︎
-
X. Wu, K. Li, Y. Zhao, L. Zhang, L. Ou, H. Yin, Z. Zhang, X. Yu, D. Zhang, Y. Jiang, et al. (2025). ReSum: unlocking long-horizon search intelligence via context summarization. arXiv:2509.13313 ↩︎
-
J. Wei, Z. Sun, S. Papay, S. McKinney, J. Han, I. Fulford, H. W. Chung, A. T. Passos, W. Fedus, and A. Glaese (2025). BrowseComp: A simple yet challenging benchmark for browsing agents. arXiv:2504.12516 ↩︎ ↩︎
-
OpenAI (2024). Introducing openai o1. https://openai.com/o1/ ↩︎
-
DeepMind (2025). Gemini 2.5 pro. https://deepmind.google/models/gemini/pro/ ↩︎
-
G. Team (2025). Gemma 3 technical report. arXiv:2503.19786 ↩︎
-
OpenAI (2025). Introducing gpt-5. https://openai.com/index/introducing-gpt-5/ ↩︎
-
J. Hu, Y. Zhang, S. Shang, X. Yang, Y. Peng, Z. Huang, H. Zhou, X. Wu, J. Cheng, F. Wan, et al. (2025). PaCoRe: learning to scale test-time compute with parallel coordinated reasoning. https://github.com/stepfun-ai/PaCoRe/blob/main/pacore_report.pdf ↩︎
-
Y. Zhang and T. Math-AI (2025). American invitational mathematics examination (aime) 2025. https://arxiv.org/html/2601.16725v1#S5.SS1.SSS0.Px1.p1.1 “Mathematical Reasoning ‣ 5.1 Benchmarks and Configurations ‣ 5 Evaluation ‣ LongCat-Flash-Thinking-2601 Technical Report” ↩︎
-
HMMT (2025). HMMT 2025. https://www.hmmt.org/ ↩︎
-
T. Luong, D. Hwang, H. H. Nguyen, G. Ghiasi, Y. Chervonyi, I. Seo, J. Kim, G. Bingham, J. Lee, S. Mishra, et al. (2025). Towards robust mathematical reasoning. arXiv:2511.01846 ↩︎
-
S. An, X. Cai, X. Cao, X. Li, Y. Lin, J. Liu, X. Lv, D. Ma, X. Wang, Z. Wang, and S. Zhou (2025). AMO-bench: large language models still struggle in high school math competitions. arXiv:2510.26768 ↩︎
-
P. Zhou, B. Leon, X. Ying, C. Zhang, Y. Shao, Q. Ye, D. Chong, Z. Jin, C. Xie, M. Cao, et al. (2025). BrowseComp-zh: benchmarking web browsing ability of large language models in chinese. arXiv:2504.19314 ↩︎
-
BrowseComp-ZH-revised:https://github.com/AGI-Eval-Official/BrowseComp-ZH-revised ↩︎
-
V. Barres, H. Dong, S. Ray, X. Si, and K. Narasimhan (2025). $\tau^{2}$-bench: evaluating conversational agents in a dual-control environment. arXiv:2506.07982 ↩︎
-
W. He, Y. Sun, H. Hao, X. Hao, Z. Xia, Q. Gu, C. Han, D. Zhao, H. Su, K. Zhang, et al. (2025). VitaBench: benchmarking LLM agents with versatile interactive tasks in real-world applications. arXiv:2509.26490 ↩︎
-
OpenAI (2025). Introducing gpt-5.2. https://openai.com/index/introducing-gpt-5-2/ ↩︎ ↩︎ ↩︎
-
tau2-bench-revised:https://github.com/AGI-Eval-Official/tau2-bench-revised ↩︎
-
D. Rein, B. L. Hou, A. C. Stickland, J. Petty, R. Y. Pang, J. Dirani, J. Michael, and S. R. Bowman (2023). GPQA: A graduate-level google-proof q&a benchmark. arXiv:2311.12022 ↩︎
-
L. Phan, A. Gatti, Z. Han, N. Li, J. Hu, H. Zhang, S. Shi, M. Choi, A. Agrawal, A. Chopra, et al. (2025). Humanity’s last exam. arXiv:2501.14249 ↩︎
-
N. Jain, K. Han, A. Gu, W. Li, F. Yan, T. Zhang, S. Wang, A. Solar-Lezama, K. Sen, and I. Stoica (2025). LiveCodeBench: holistic and contamination free evaluation of large language models for code. In ICLR. https://arxiv.org/html/2601.16725v1#S5.SS1.SSS0.Px5.p1.1 “Coding ‣ 5.1 Benchmarks and Configurations ‣ 5 Evaluation ‣ LongCat-Flash-Thinking-2601 Technical Report” ↩︎
-
Z. Wang, Y. Liu, Y. Wang, W. He, B. Gao, M. Diao, Y. Chen, K. Fu, F. Sung, Z. Yang, T. Liu, and W. Xu (2025). OJBench: A competition level code benchmark for large language models. arXiv:2506.16395 ↩︎
-
Y. Zhu, J. Wang, Y. Li, L. Qiu, Z. Wang, J. Xu, X. Cao, Y. Wei, M. Wang, X. Cai, and R. Ma (2025). OIBench: benchmarking strong reasoning models with olympiad in informatics. arXiv:2506.10481 ↩︎
-
R2E-Gym:https://github.com/R2E-Gym/R2E-Gym ↩︎
-
A. Yang, A. Li, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Gao, C. Huang, C. Lv, et al. (2025). Qwen3 technical report. arXiv:2505.09388 ↩︎
-
Z.AI (2025). GLM-4.7: advancing the coding capability. https://z.ai/blog/glm-4.7 ↩︎
-
J. Yuan, H. Gao, D. Dai, J. Luo, L. Zhao, Z. Zhang, Z. Xie, Y. Wei, L. Wang, Z. Xiao, et al. (2025). Native sparse attention: hardware-aligned and natively trainable sparse attention. In ACL (1), pp.23078–23097. https://arxiv.org/html/2601.16725v1#S6.p1.1 “6 One More Thing: Zig-Zag Attention Design ‣ LongCat-Flash-Thinking-2601 Technical Report” ↩︎
-
E. Lu, Z. Jiang, J. Liu, Y. Du, T. Jiang, C. Hong, S. Liu, W. He, E. Yuan, Y. Wang, et al. (2025). MoBA: mixture of block attention for long-context llms. arXiv:2502.13189 ↩︎
-
J. Du, W. Sun, D. Lan, J. Hu, and Y. Cheng (2025). MoM: linear sequence modeling with mixture-of-memories. arXiv:2502.13685 ↩︎
-
W. Sun, D. Lan, T. Zhu, X. Qu, and Y. Cheng (2025). Linear-moe: linear sequence modeling meets mixture-of-experts. arXiv:2503.05447 ↩︎
-
LongCat-Flash-Thinking-ZigZag 权重:https://huggingface.co/meituan-longcat/LongCat-Flash-Thinking-ZigZag ↩︎
-
C. Zhang, Y. Bai, J. Li, A. Gui, K. Wang, F. Liu, G. Wu, Y. Jiang, D. Bu, L. Wei, et al. (2026). Efficient context scaling with longcat zigzag attention. arXiv:2512.23966 ↩︎
-
G. Xiao, J. Tang, J. Zuo, J. Guo, S. Yang, H. Tang, Y. Fu, and S. Han (2024). DuoAttention: efficient long-context LLM inference with retrieval and streaming heads. arXiv:2410.10819 ↩︎
-
B. Peng, J. Quesnelle, H. Fan, and E. Shippole (2024). YaRN: efficient context window extension of large language models. In The Twelfth International Conference on Learning Representations, ICLR 2024, Vienna, Austria, May 7-11, 2024. https://openreview.net/forum?id=wHBfxhZu1u ↩︎
Author houmin
Publish July 30, 2026
LastMod July 31, 2026
License 本作品采用 CC BY-NC-ND 4.0 许可协议进行许可,转载时请注明原文链接
如果你在浏览博客的过程中发现了任何问题,欢迎在对应文章下评论。如果你有其他事情想要咨询,可以通过邮件联系我。