ERNIE 5.0:从零训练的统一全模态自回归模型
本文译自百度的 ERNIE 5.0 Technical Report1,2026 年 2 月 4 日提交于 arXiv,36 页 10 图 12 表。原文没有摘要,直接从引言开始。这里是全文翻译,覆盖 §1 引言、§2 架构、§3 预训练、§4 后训练、§5 基础设施、§6 评测、§7 结论。§8 贡献者名单与参考文献不在译文范围内。
原文投稿的参考文献没能被 arXiv 的 LaTeXML 渲染出来(References 一节在 HTML 版里是空的),所以下面脚注里的条目是按正文中的 citation key 逐条回查、并用 arXiv API 核过标题得到的。回查不到的只标出原文的 key,不做推测。
1 引言
大语言模型与视觉-语言模型近来的进展——包括 ERNIE2、Gemini3、GPT4、Claude5、DeepSeek6 和 Qwen7——表明大规模自回归序列建模为语言与多模态理解提供了强有力的基础。把各种输入都建模成 token 序列,这些模型在跨模态上展现出很强的推理与对齐能力。然而在多数现有系统里,自回归建模服务于多模态理解,而输出仍然是以文本为中心的,这限制了模型参与各类多模态交互的能力。为突破这一限制,近来的做法是给预训练语言模型加挂模态专用的解码器或生成器,通过 late-fusion 设计连到语言主干上8。这类设计对单个模态而言是有效的,但它们把多模态生成与理解解耦开来,依赖模态专用的、非自回归的目标函数,这既妨碍了深层的跨模态整合,也常常迫使人在多模态整合与核心语言性能之间做取舍。在这样的背景下,设计一套统一的自回归范式仍是一个突出的开放挑战。这样的框架必须原生支持多模态理解与生成,保持强的单模态能力,并且在模型与数据规模持续增长时仍能有效扩展。
本报告介绍 ERNIE 5.0,一个原生设计的下一代基础模型,它在统一自回归框架下整合文本、图像、音频与视频能力,同时覆盖多模态理解与生成。ERNIE 5.0 不是给预训练语言模型加挂模态专用组件,而是从零开始同时训练所有模态,这缓解了 later-fusion 方案中观察到的「能力跷跷板」问题,确保所有模态共同演进而不牺牲彼此的性能。具体而言,异构输入被映射到一个共享 token 空间,所有模态的建模统一在一个 Next-Group-of-Tokens Prediction(下一组 token 预测)目标下,从而避免了显式的模态边界和不一致的优化轨迹。为支持可扩展性,ERNIE 5.0 采用带模态无关专家路由的超稀疏 Mixture-of-Experts(MoE) 主干。路由决策以统一的 token 表示为条件,而不是以模态标识符为条件,这让来自各种模态的 token 都能被分派到一个共享的专家池。这套超稀疏、模态无关的架构免去了启发式的模态专用专家分配,为模态特化行为之间的分化与协作都提供了足够的容量。
在 ERNIE 5.0 的预训练中,我们提出一种新的弹性训练范式,让单次预训练就能产出一族容量-效率权衡各异的模型。我们的弹性训练方法不去优化一个静态架构,而是按预定义的调度,为每个训练实例动态采样深度、宽度、路由稀疏度各不相同的子模型。被采样的子模型与全模型在同一个反向传播过程中、在同一个自回归目标下一起优化。子模型采样策略提升了参数的功能完整性,即使只有一部分参数可用也能维持有竞争力的性能。深度与宽度上的弹性有利于产出更小尺寸的模型,而稀疏度弹性则减少推理时激活的专家数,带来更高的吞吐和更好的计算效率。同时,弹性训练让子模型能从全模型继承知识,并在后续后训练阶段灵活实例化小模型,从而不必预训练多个不同尺寸的模型、也不必依赖定制的压缩方案,使 ERNIE 5.0 很适合在各种硬件、内存与时延约束下部署。
在统一预训练之后,我们执行一套多阶段后训练流程,把 监督微调(SFT)与统一多模态强化学习(UMRL)结合起来。异构多模态输入与超稀疏 MoE 架构同时存在,带来了可观的优化难题,使 UMRL 对采样偏差、稀疏奖励信号和熵坍缩都更加敏感。为应对这些问题,我们构建了统一的 verifier 系统,并开发出一套可扩展的技术来提升 RL 训练的稳定性与效率。无偏 replay buffer 被用来在保持数据分布均衡的同时提升 rollout 效率。多粒度重要性采样加上正样本掩码,稳定了策略优化并有效缓解了熵坍缩。对于奖励稀疏的困难任务,我们引入自适应 hint 强化学习,在需要时提供辅助引导。通过保证后训练的稳定与高效,这些设计支撑起了 ERNIE 5.0 出色的多模态推理能力。
基础设施方面,我们采用带细粒度内存控制的混合并行,以支持万亿参数超稀疏 MoE 模型的有效训练。为实现统一多模态训练,tokenizer 与 MoE 主干解耦、部署在独立的 GPU 节点上,使每个组件都能采用最适合自己的并行策略。为适配视觉中的局部双向注意力,我们采用 FlashMask9 来高效处理逐样本异构的注意力掩码。最后,我们设计了一套可扩展的分离式 RL 基础设施,协调训练、rollout 与环境交互,以确保高吞吐且数值一致的后训练。
我们在覆盖感知、推理、理解与生成的多样文本与多模态 benchmark 上评估 ERNIE 5.0。在这些任务上,ERNIE 5.0 持续追平或超过专用 baseline,说明统一训练保留了强的模态专项性能而没有造成架构上的割裂。消融结果进一步印证了模态无关专家路由与弹性训练的有效性。尽管跨模态只用了一套共享的路由机制,专家仍然表现出清晰的特化模式,而且这些模式主要由任务需求而非模态边界塑造。推理时把路由 top-$k$ 降到 25%,带来超过 15% 的解码加速而精度只有轻微损失;跨深度、宽度、稀疏度的弹性训练,则在只用 53.7% 激活参数和 35.8% 总参数的情况下保持了接近全模型的性能。这为下一代统一多模态模型指出了一条可扩展且高效的路径。
在接下来的章节里,我们系统地介绍模型架构设计及其核心技术组件,随后详细描述训练与优化流程。然后我们在一套全面的 benchmark 上评估 ERNIE 5.0,验证所提统一框架的有效性。最后我们分享模型训练过程中的一些关键技术洞察,希望对未来关于可扩展通用基础模型的研究有所帮助。
2 架构
如图 1 所示,ERNIE 5.0 采用超稀疏 mixture-of-experts 架构,在单一自回归框架内整合语言、图像、视频与音频,同时覆盖多模态理解与生成。模型由一个用于统一序列建模的共享主干,以及把多模态输入转换成统一 token 序列的视觉与音频 tokenizer 组成。所有模态都在一个共享的 Next-Group-of-Tokens Prediction 目标下训练,从而在端到端优化中实现深层的跨模态交互。本节我们先在 §2.1 描述自回归主干——它是 ERNIE 5.0 的核心——然后在 §2.2 和 §2.3 描述视觉与音频的处理流程。
2.1 带超稀疏 MoE 的统一自回归主干
异构模态在 token 语义、时序结构与优化动力学上差异很大,天真的跨模态参数共享容易导致优化不稳定和性能退化,在单个模型里同时建模理解与生成时尤其如此。
为解决这些挑战,ERNIE 5.0 被设计成在统一自回归框架下从零训练。文本、图像、视频、音频等多模态输入被投影到共享 token 空间,序列化成统一序列,并在 Next-Group-of-Tokens Prediction 目标下优化。具体而言,文本生成遵循标准的 Next-Token Prediction(NTP)范式,并用 Multi-Token Prediction(MTP) 机制10增强,以同时提升输出质量与推理效率。对视觉和音频模态,生成被表述为一个「一组 token」的预测任务,从而把它们的生成过程与文本的自回归目标对齐。视觉生成采用 Next-Frame-and-Scale Prediction(NFSP)11,音频生成采用 Next-Codec Prediction(NCP)来捕捉时序与频谱结构。把异构模态统一到单一优化目标之下,所有 token 都在一致的序列预测范式内训练,这既让从零训练成为可能,也让统一主干里的深层 token 级多模态交互成为可能。
统一学习范式虽有助于缩小模态间差异,却无法彻底消除模态的内在区别,因此仍需要相当的模型容量来承载多样的多模态知识。为此,ERNIE 5.0 采用稀疏 MoE 架构来高效扩展模型容量,同时控制训练与推理成本。这套架构的核心是模态无关专家路由:路由决策以统一的 token 表示为条件,而非以显式模态标识符为条件。router 把不同模态的 token 分派到共享专家池,实现了有效的跨模态参数共享。与我们之前模型2里模态隔离的路由策略相比,这种统一路由机制促进了跨模态的知识泛化,并通过共享专家自发涌现的特化提升了单模态性能。而且它免去了启发式模态专用专家分配的需要——在实践中这件事往往并不容易,涉及两种以上模态时尤其如此。凭借超稀疏、细粒度的 MoE 架构,ERNIE 5.0 把激活率压到 3% 以下,使模型能在计算开销不成比例增长的前提下大幅扩展有效容量。训练还通过 auxiliary-loss-free 负载均衡12进一步稳定,从而在万亿参数尺度上保证稳健的专家利用率。
基于统一优化目标与共享参数空间,ERNIE 5.0 在形式上把多模态理解与生成整合进了单一自回归主干。但这种形式上的统一之外,要学到能同时令人信服地支撑两类任务的表示,仍有一些挑战。通常多模态理解关注抽象的、语义层面的概念,而生成需要对细粒度感知细节的精确建模。因此 ERNIE 5.0 被设计成学习一种既捕捉高层语义、又保留细粒度细节的统一表示,使理解与合成得以统一。在这个统一框架里,语义层面的信号引导生成建模走向全局一致性,而生成训练反过来强化了细粒度感知与对细节敏感的推理。这种互相强化让单一主干得以稳健地支撑感知、推理与创造性生成。基于这一设计哲学,我们在后续小节进一步引入统一的视觉与音频输入-输出接口及其对应的处理流程,这也是 ERNIE 5.0 相较此前模型的鲜明特征。
2.2 视觉建模
在 ERNIE 5.0 里,图像被当作视频的一个特例(即单帧视频)来处理,与视觉理解和生成共享同一套设计哲学。视觉理解建立在一种同时编码全局语义信息与局部感知细节的混合表示之上,在支持高层推理的同时保留对细粒度视觉的敏感。对图像和视频生成,我们提出一种视觉自回归范式,在离散 token 空间里支持跨空间与时间维度的连贯建模,如图 2 所示。下面我们先介绍视觉 tokenization,然后介绍我们为视觉理解与生成量身定制的设计。
2.2.1 视觉 tokenization
为在空间与时间两个维度上支持自回归视觉建模,ERNIE 5.0 提出 Next-Frame-and-Scale Prediction(NFSP):图像生成被表述为一个 Next-Scale Prediction 问题,视频生成则用 Next-Frame Prediction 进一步扩展这一表述11。为此我们先为图像训练一个因果 2D 多尺度 tokenizer,通过大规模图像预训练提供强空间表示。在这个图像 tokenizer 的基础上,我们把它膨胀(inflate)成一个因果 3D 卷积 tokenizer,从而把图像与视频的 tokenization 统一在单个模型里。这种渐进式设计保留了从图像学到的空间建模能力,同时为视频引入时序感知,使得场景文字、人脸这类高层视觉元素得以忠实重建。
在 tokenizer 训练中,我们引入辅助监督信号来提升表示质量与训练稳定性。具体而言,我们用来自 GAN 判别器的对抗损失13来改善分布保真度。同时我们加入一个语义分支,并施加一个由大规模视觉基础模型导出的语义正则化损失,以保持高层语义一致性。这些互补的目标提升了视觉 token 的可学习性与稳定性,也有利于统一主干中的有效自回归建模。
按照 bit-wise 量化策略,我们把统一的视觉隐表示量化成一组 bit-code,其中 bit 数直接对应离散词表的大小14。基于这一机制,我们预训练了一系列 bit 数递增的 tokenizer。在 ERNIE 5.0 的训练中,我们采用渐进式 tokenizer 切换策略:从低 bit tokenizer(即小词表)开始,逐步过渡到更高 bit 的变体(即更大词表)。先用小词表学习粗粒度、低 bit 的表示,再逐步引入更细粒度、更高 bit 的 tokenizer,主干因此遵循一条更平滑稳定的优化轨迹,有效缓解了早期训练不稳定,并带来更好的视觉生成质量。
2.2.2 用双路混合表示做视觉理解
上面的设计主要针对统一自回归建模与生成中的视觉 tokenization。我们观察到,在量化之前,视觉特征通常会被一个下采样模块压缩成低维表示,其维度与 tokenizer 的 bit 宽度对齐。这种压缩不可避免地损失细粒度语义信息,而这一点已被广泛观察到会限制视觉理解任务的性能15。
为解决这个问题,ERNIE 5.0 直接利用量化之前的双路视觉特征:我们把 卷积神经网络(CNN)提取的感知特征与 Vision Transformer(ViT)编码的语义特征整合起来。然而这两路产生的表示在空间结构上是错位的;我们的实证研究表明,用基于 MLP 的 adapter 粗糙地融合 CNN 与 ViT 特征,往往无法充分发挥二者的互补优势,还会引入表示层面的干扰,导致理解性能下降。这一观察促成了下面的 Attention-based Patch Merger。
形式化地说,给定图像里的一个空间 token 或视频里的一个时空 token,我们提取两组特征:$\mathbf{F}_{cnn} \in \mathbb{R}^{N \times K \times D_{cnn}}$ 和 $\mathbf{F}_{vit} \in \mathbb{R}^{N \times K \times D_{vit}}$,其中 $N$ 是视觉理解 token 的数量,$K$ 是每个 token 所归组的局部 patch 数,$D_{cnn}$ 与 $D_{vit}$ 是特征维度。在图像理解任务中我们把 $K=4$ 个空间相邻的 patch 归为一组,在视频理解任务中则把跨 $4$ 个相邻帧的 $K=16$ 个 patch 归为一组。特征融合之前,我们先把 CNN 特征投影到 ViT 特征空间,然后沿 patch 维度拼接对齐后的 CNN 与 ViT patch 特征,得到 $\mathbf{F}_{mrg} \in \mathbb{R}^{N \times 2K \times D_{vit}}$。接着对拼接后的 patch token 施加多头自注意力,$\mathbf{Z} = \mathrm{Attn}(\mathbf{F}_{mrg})$,注意力机制在这里同时建模 CNN 与 ViT 特征之间的相关性,以及这组 patch 之间的空间与时间依赖。输出保持相同形状,$\mathbf{Z} \in \mathbb{R}^{N \times 2K \times D_{vit}}$。最后我们在 patch 维度上做均值池化,得到紧凑表示 $\mathbf{F}_{out} \in \mathbb{R}^{N \times D_{vit}}$,再投影到与统一主干的 embedding 维度对齐。
特征融合方式的选择对模型性能影响显著,而朴素的 MLP 融合已被证明不足以有效整合 CNN 与 ViT 特征。相比之下,我们提出的基于注意力的聚合模块在大量 benchmark 上持续超过 CNN-only 和 ViT-only 两个 baseline,且没有引入明显的计算开销,在文档与图表理解以及通用视觉理解任务上的增益尤为突出。更重要的是,ERNIE 5.0 被设计成视觉理解与生成的统一框架,其视觉表示不仅要支撑判别式任务,还要支撑像素级图像与视频编辑这类细粒度生成任务。借助注意力,该模块能自适应地把局部 patch 与高层语义信息聚合起来,在减少视觉 token 数量的同时捕捉关键视觉特征。这带来了一种紧凑而富有表达力的视觉表示,为各类视觉-语言任务提供了坚实稳定的基础。
2.2.3 用 Next-Frame-and-Scale Prediction 做视觉生成
回顾一下视觉 tokenization 中引入的 Next-Frame-and-Scale Prediction(NFSP)范式:它以自回归方式表述视觉生成,把图像生成视为单帧视频生成的一个特例。在这一表述下,模型为图像生成在每张图(或每一帧)内跨多个空间尺度预测视觉 token,为视频生成则沿时间维度做逐帧预测。预测某个尺度上的 token 时,模型把此前已生成的各尺度作为输入,并施加一个尺度级因果注意力掩码:当前尺度内的 token 彼此双向可见并被并行预测,而所有先前尺度与历史帧的 token 则以因果(单向)方式可见。NFSP 范式把空间与时间建模解耦开——帧内从低分辨率到高分辨率的预测捕捉细粒度空间结构,而下一帧预测建模帧间时序依赖。
为支持跨空间与时间维度的异构 token 的位置建模,我们引入统一时空旋转位置编码(Uni-RoPE),并把它应用于 ERNIE 5.0 中的所有 token。对长度为 $N$ 的统一序列,第 $i$ 个 token 的位置编码定义为 $\mathrm{Uni}$-$\mathrm{RoPE}_i = (t_i, h_i, w_i), i \in \{1, \ldots, N\}$。对文本与音频 token,我们令 $t_i = h_i = w_i$,共享的取值就是该 token 在序列中的索引。对视觉 token,$t_i$ 用于帧索引、单调递增以保持时序,$(h_i, w_i)$ 对应帧内的空间位置。为保证多尺度之间的空间一致性,我们采用中心对齐的坐标策略,让不同尺度上的 token 按各自尺度的几何中心对齐。
实证上,自回归视觉生成在极长 token 序列上容易出现误差累积。为缓解这一点,我们在训练时通过随机翻转 bit 来污染历史 token,同时监督模型朝当前尺度的 ground-truth token 自我纠正。这种基于污染的训练策略提升了模型在长程生成中对复合误差的鲁棒性。同时我们施加损失重加权策略来强调早期阶段的预测,缓解多尺度 tokenization 引入的 token 数量不均衡。特别对视频生成,我们还进一步引入窗口化时序注意力与历史帧随机掩码,促使模型聚焦于相关的时序上下文并提升鲁棒性11。
在基于 token 的建模范式下,在固定的模态 token 预算内训练视觉生成能力,对高分辨率图像与视频是一个根本性挑战:提高视觉分辨率会拉长 token 序列,进而减小有效训练 batch size 并劣化优化稳定性。为解决这个挑战,我们在自回归主干之上采用一个级联的 diffusion refiner。主干生成语义与结构布局精确的低分辨率样本,refiner 则专注于在更高分辨率上增强细粒度视觉细节。diffusion refiner 与主干分开训练,用的是经过受控退化的低分辨率样本与对应高分辨率图像或视频组成的配对数据。这种解耦的训练方案既实现了高保真的精修,又保留了自回归模型产出的完整语义与结构,还避免了在共享主干里同时引入自回归损失与 diffusion 损失所导致的优化冲突。
2.3 音频建模
与视觉模态类似,ERNIE 5.0 中的音频建模同样被表述在一个统一的、基于 token 的自回归框架下,同时支持理解与高保真生成。受神经音频 codec 成功经验的启发16,音频信号被表示成层级化的离散 codec token,既捕捉较高层的语义,也捕捉细粒度的声学细节。为避免把多码本 token 展平成单一序列所导致的序列长度膨胀,我们引入一种 depth-wise 自回归架构,跨 codec 维度做结构化预测,如图 3 所示。
2.3.1 音频 tokenization
给定输入波形,我们先用一个 codec 风格的 tokenizer 把连续音频信号映射成一串离散 token,token 率为 12.5 Hz。音频量化模块遵循残差向量量化(RVQ)设计,把信号分解成多个不同粒度层级的 token。在这种设计下,第一个 token 被明确指定去编码高层音频语义,其余 token 则编码细节逐步精细的残差声学信息。为确保第一个 token 捕捉到音频-文本建模所需的丰富语义信息(包括语言学与音素线索),我们从预训练的 Whisper 模型17蒸馏知识:具体而言,我们把第一个音频 token 的表示与 Whisper 的 encoder 输出对齐,并对 Whisper 表示做平均池化以匹配我们音频 tokenizer 的 token 率,从而消解 teacher 与 student 之间的时间粒度错配。与第一个语义 token 互补,残差声学 token 保留音频信号的细粒度特征,如音色和韵律。这套层级化 tokenization 过程把语义内容与声学实现解耦开,提供了一种能自然接入 ERNIE 5.0 统一自回归主干的紧凑音频表示。
2.3.2 用 Next-Codec Prediction 做音频理解与生成
基于上述音频 tokenization,我们借鉴视觉生成中发展出的由粗到细的预测范式18,用一种 depth-wise 自回归架构来建模音频 token,同时服务理解与生成。ERNIE 5.0 不把所有残差音频 token 展平成一条长序列,而是把残差 code 的预测分布到各个 transformer 层上。每一层建模某个特定粒度层级的音频信息,这让多层级音频表示得以在统一框架内被高效处理。
对音频理解任务,文本 token 用标准的文本 embedding 层嵌入,音频 token 则通过 depth-wise 相加式 embedding 机制表示。每个音频 token 由多个对应不同残差层级的离散 code 组成。在每个层级上,code 经由该层级专属的 embedding 矩阵映射成一个 embedding,所有层级的 embedding 相加构成最终的 codec 表示。这种相加式聚合反映了音频表示的残差性质——每个深度都在从粗到细的不同粒度上贡献互补信息。得到的音频 token 表示被放到输入序列的对应位置,与文本 token 一起被自回归主干统一处理,从而实现无缝的多模态理解。
对音频生成任务,ERNIE 5.0 引入 Next-Codec Prediction(NCP),以由粗到细的方式生成层级化音频 token。多个音频 head 被插入到顶部的若干 transformer 层以支持 depth-wise 预测。以多模态上下文为条件,模型先预测第一个语义 code,然后依次为后续残差层级生成 code。每次预测之后,生成的 code 被映射成对应的 embedding 并加回到隐状态上,再作为下一层级预测的条件。训练时采用 teacher forcing,反馈的 embedding 取自 ground-truth code。这一迭代过程持续到所有层级都被预测完,让高层语义信息得以引导越来越细粒度的声学细节的合成。一旦拿到完整的层级化音频 code,音频解码器就把它们转换成波形。对语音合成,我们把一个 speaker embedding 作为条件上下文的一部分插入,以实现可控的音色,在不改变深层语义内容和 depth-wise 预测结构的前提下引导声学实现。总体来看,NCP 的表述与音频理解所用的残差设计是兼容的,这保证了音频输入与输出之间的结构对齐。
3 预训练
预训练阶段构成了 ERNIE 5.0 的基础,模型在这一阶段学习跨多个模态的可泛化表示。本节我们先描述预训练数据的构成(§3.1),然后描述训练 recipe 的一部分(§3.2)。最后我们聚焦于 ERNIE 5.0 引入的弹性训练技术(§3.3)——它让单次预训练就能产出多个不同尺寸的模型,在保持效率与性能的同时大幅降低训练一系列模型的计算成本。
3.1 预训练数据
ERNIE 5.0 在一个大规模、高质量的多模态数据集上训练,这个数据集体现了它原生全模态的设计和理解、生成兼备的双重能力。与传统的 late-fusion 方案不同,ERNIE 5.0 从训练的最开始就同时接触文本、图像、视频和音频。这套统一训练范式让模型能学到整合所有模态语义信息的表示,同时也要求大量预训练数据来支撑每个模态从零开始的学习。为管理如此多样的数据,我们搭建了一个标准化平台,并按输入与输出模态组织所有数据。基于这一组织方式,预训练数据大体分为两类:文本数据和多模态数据。
文本数据。文本部分涵盖大量多语种网页爬取、精选语料、书籍、科学出版物、代码仓库以及结构化知识源,选取标准是广度、多样性与语言丰富度。我们重新训练了文本 tokenizer 以更好地支持大规模多语种建模。具体而言,我们用 UTF-16BE 编码文本,以提供稳定的字节级 fallback 和对许多非拉丁符号更紧凑的表示,从而提升多语种训练的数据吞吐;我们还使用 BPE dropout19来减少对高频模式的过拟合。值得一提的是,对没有显式空白词边界的语言(如中文),我们过滤掉那些能被标准分词工具拆开的长的无空格短语,这有助于降低词表稀疏性、提升训练效率并增强模型泛化。
多模态数据。对视觉与音频模态,我们精选了一个包含图文对、视频-文本对、音频-文本对,以及各种文本与图像、视频、音频交织的多模态序列的数据集,全部配有元数据与 caption。这样的数据构成把文本概念与视觉、音频上下文在空间和时间两个维度上连接了起来。通过显式建模跨模态对齐,模型不仅能学到单个模态内部的语义关系,也能学到不同模态之间的语义关系,从而支撑从多模态理解到创造性多模态生成的广泛任务。
我们在规模化的前提下施加了严格的预处理与质量控制,以同时维持信号完整性与多样性。启发式与基于模型的过滤器移除低质量和不安全内容,大量去重防止记忆化产物,去污染措施把 benchmark 挡在训练数据之外。最终的预训练语料由数万亿文本 token 和多模态实例组成,在规模与高保真语义内容之间取得平衡。这个大规模、多样且经过良好过滤的数据集,是 ERNIE 5.0 在文本和多模态理解、推理、生成 benchmark 上取得强劲表现的根本。
3.2 训练 recipe
ERNIE 5.0 用一套精心设计的 recipe 训练,以确保训练稳定性、可扩展性和计算资源的高效利用。训练遵循多阶段预训练策略,逐步扩展上下文长度,同时维持稳定的优化动力学。
阶段 1:8K 预训练。初始阶段使用 8K token 的最大上下文长度。我们在这一阶段采用 Warmup-Stable-Decay(WSD)学习率调度20。学习率在 2,000 步内从零线性 warmup 到峰值 $1\times 10^{-4}$,然后在 8K 训练阶段的剩余部分保持恒定。为在规模化时提升训练效率与稳定性,我们采用 batch size 调度策略,在训练早期把全局 batch size 从 14M token 逐步增大到 56M token。为便于后续无缝的长上下文扩展, RoPE base 从 8K 阶段起就设为 1,000,000。这一设计选择避免了后续上下文长度扩展时的重参数化或插值,确保长上下文训练无损且稳定。
阶段 2:32K & 128K 中期训练。在中期训练阶段,我们把上下文长度逐步扩展到 32K 和 128K,同时保持全局 batch size 不变。这一阶段我们切换到 cosine 学习率调度,把学习率从 $1\times 10^{-4}$ 退火到 $1\times 10^{-5}$。
对 MoE 专项优化,auxiliary-loss-free 负载均衡12的 bias 更新速度在 8K 预训练阶段设为 $1\times 10^{-4}$,中期训练时降到 $1\times 10^{-5}$,这有效抑制了大规模 MoE 训练中观察到的迭代级振荡。MTP 损失权重21从 8K 阶段的 0.3 降到中期训练的 0.1,确保模型扩展到更长上下文时的平稳适应。此外我们引入一种基于后验的损失加权策略,把不同模态的自回归损失重新缩放到同一区间,从而提升训练稳定性并防止模态间失衡。
3.3 Once-For-All:弹性训练
现代模型的规模扩张带来一个根本性挑战:万亿参数的模型虽然在广泛任务上取得了出色表现,但其高昂的计算与部署成本限制了它在那些要求灵活与高效的场景中的适用性。
传统做法通常遵循「先训练后压缩」的流程,用剪枝22、知识蒸馏23或更高效的基于融合的变体24等技术来产出更小的模型。然而这一范式仍有明显局限。模型压缩需要一个专门的剪枝或蒸馏阶段,这既需要专门的基础设施,也带来可观的计算开销。而且模型一旦被压缩,其架构就固定了下来。于是要造出其他尺寸的模型就必须把整个压缩流程重跑一遍,从而限制了部署灵活性。
为解决这些问题,我们提出一种新的弹性训练策略,并首次把它应用到 ERNIE 5.0 上。弹性训练不是在预训练后对模型做事后压缩,而是在预训练期间同时优化一族子网络,使单个大模型能按需高效产出更小的、可部署的变体。它把 Once-For-All 的设计哲学25扩展到了预训练:深度、宽度、稀疏度各异的子网络配置与全尺寸模型一起训练。结果是 ERNIE 5.0 能灵活地选取参数子集来构造不同规模的模型,相比传统剪枝或蒸馏方法降低了计算与工程开销。
弹性训练如图 4 所示,它沿三个正交维度引入结构灵活性:
弹性深度。为支持弹性深度,ERNIE 5.0 在训练时随机改变活跃 transformer 层的数量,从而能抽取出不同深度的子网络。大部分时间使用全深度网络以确保所有层都被充分优化,偶尔采样较浅的子网络以培养对层移除的韧性。具体而言,全模型以 $75\%$ 的概率训练,降低深度的子网络以 $25\%$ 的概率激活。通过这种训练方案,即便某些层被跳过,中间表示也被鼓励保持信息量,模型因此支持在不同深度配置下灵活部署而无需单独训练。
弹性宽度。与弹性深度互补,ERNIE 5.0 还通过改变每个 MoE 层的专家总数来支持弹性宽度。训练过程不总是激活完整专家池,而是在两种模式之间交替:以 $80\%$ 的概率让所有专家参与路由,保持全宽度配置;剩下 $20\%$ 的情况把路由限制在随机采样的专家子集上,得到更窄的有效模型宽度。通过让模型同时接触完整与缩减的专家配置,最终模型只用部分专家就能支持不同的容量预算,适合部署在无法承载全部专家的内存受限环境里。
弹性稀疏度。为在不改变部署模型尺寸的前提下提升推理效率,我们通过改变每个 token 激活的专家数来引入弹性稀疏度。与专家总数的弹性类似,训练时以 $80\%$ 的概率应用默认路由配置;以 $20\%$ 的概率,路由 top-$k$ 从一个预定义范围里随机采样,其中 $k$ 小于标准配置——换言之,每个 token 激活的专家数被减少。最终模型兼容不同的计算预算,并在时延受限的推理场景下表现出更好的鲁棒性。
通过训练一个弹性超网络,ERNIE 5.0 得以沿层数、专家总数、激活专家数选取参数子集,产出各种配置的小模型。表示维度(即 hidden size)上的弹性,如近期工作26所探索的,与我们的设计正交,可以自然地作为未来扩展纳入进来。这些子网络可以按需实例化以满足不同的时延和内存约束,并作为中期训练或微调的有效起点。相比从零训练多个独立模型或依赖事后压缩技术,我们的弹性训练策略大幅降低了整体计算开销与工程复杂度。详细实验结果与消融研究见 §6.4.2。
4 后训练
统一预训练之后,我们沿用与 ERNIE 4.52 相同的后训练流程来得到最终的 ERNIE 5.0,它包含两个阶段:监督微调(SFT)和统一多模态强化学习(UM-RL)。通过精选一套全面的高质量指令对,SFT 赋予模型基本的指令遵循能力,并强化它进行长链思考的能力。在 UM-RL 阶段,我们把推理、agent、指令遵循等各类任务的训练合并进一个多阶段 RL 流程,从而在多样的任务与模态上取得均衡的性能。我们进一步扩展了统一 verifier 系统,为广泛多模态场景下的模型回复生成准确一致的 奖励信号,为统一多模态 RL 训练提供可靠监督。本节我们讨论 RL 训练的关键挑战并描述我们提出的解法。
ERNIE 5.0 的 RL 训练面临若干挑战。第一,RL 训练在计算上代价高昂,而 ERNIE 5.0 的巨大规模又把这一点放大了。第二,超稀疏 MoE 架构加剧了 训练-推理差异并损害稳定性。第三,相比数学推理或代码生成这类独立的 RLVR 任务,训练一个同时支持多种场景和模态的模型,复杂度要高得多。为突破这些瓶颈,我们实现了一套协同的工程与算法优化,让大规模超稀疏 MoE 模型的 RL 训练得以稳定进行。在接下来的小节里,我们逐一说明这一过程中遇到的严峻挑战并给出相应的解法。
4.1 用无偏 replay buffer 提升 rollout 效率
rollout 生成占 RL 总训练时间的 90% 以上,而其效率常常受制于 rollout 回复长度的长尾分布:少数异常长的回复会拖住整个 batch,让 GPU 闲置、利用不足。近期工作如 APRIL27 试图通过超额发放 rollout 请求来缓解长尾低效:一旦收集到目标数量的回复就终止生成,未完成的回复则被回收,在后续步骤里继续。然而 APRIL 倾向于用推理步骤较短的轨迹来更新模型参数,而这些轨迹通常对应较容易的 query。相比之下,长程样本被推迟,导致数据难度分布非平稳。于是数据难度的周期性漂移可能妨碍收敛,最终损害模型性能。
U-RB:无偏 replay buffer 生成。我们提出 U-RB,它是 APRIL 的一个无偏扩展,用来加速 RL 中的 rollout 生成。如图 5 所示,U-RB 引入一条数据顺序约束:只有在初始化时就分配给当前迭代的数据组,才被允许参与后续训练过程。具体而言,U-RB 搭建两个模块。第一个是高吞吐推理池 $\mathcal{P}_{infer}$,容量为 $\Omega_{RBS}=\Omega_{BS}*N$,其中 $\Omega_{BS}$ 是训练 batch size、$N$ 是 buffer 大小。第二个组件是训练池 $\mathcal{P}_{train}$,容量为 $\Omega_{BS}$,负责收集已完成的轨迹供 RL 训练使用。在第 $t$ 次迭代,推理引擎 $\pi_{infer;\theta_t}$ 并行生成 rollout 来填充推理池。推理一直进行到分配给迭代 $t$ 的数据组 $\mathcal{D}_t$ 中最长的那条 rollout 到达终止状态(即 [EOS])为止。此时与 $\mathcal{D}_t$ 关联的 rollout 从 $\mathcal{P}_{infer}$ 移入训练池 $\mathcal{P}_{train}$,使训练引擎 $\pi_{train;\theta_t}$ 得以更新模型参数。这些 rollout 里可能包含从更早的推理轮次恢复继续的轨迹。通过动态划分 rollout 生成,U-RB 既避免了个别长 rollout 造成的算力闲置,又维持了无偏的数据分布。
4.2 通过缓解熵坍缩来稳定训练
多模态模型中快速熵坍缩的现象,表现为 RL 早期策略熵的急剧上升或下降。在整合文本、视觉、音频信息的多模态决策任务中,这种坍缩会逐步侵蚀模型跨模态融合信息以进行灵活推理的能力,并暴露出明显的模态偏好。
近期研究28把熵坍缩主要归因于两个因素。第一,当下多数 RL 框架依赖分离的训练与推理引擎,这引入了数值计算上的不一致,最终破坏策略优化的稳定性。对 MoE 模型而言这个问题更严重,因为动态路由进一步放大了数值失配问题。第二,策略模型在训练早期常常对简单 query 过拟合。这种行为加速了熵坍缩,并限制了模型发现替代推理路径的能力。为解决这些问题,我们引入多粒度重要性采样裁剪(MISC)和已学会正样本掩码(WPSM)来在规模化条件下稳定 RL 训练。
译注:原文图 6 是两张并排的 TensorBoard 截图,这里拆成 6a/6b 分别配图注。值得注意的是浅蓝线($\mathfrak{J}_{IcePop}^{GSPO}$)的熵是在第 110 步之后急剧上升而非下降,同时准确率在第 130 步左右见顶回落。这与 §4.2 开头把熵坍缩定义为「策略熵的急剧上升或下降」是一致的——这里发作的是熵爆炸那一侧,而不是通常说的熵归零。
MISC:多粒度重要性采样裁剪。IcePop29 通过在 GRPO30 上做双侧掩码校准来抑制训练-推理失配:
$$ \begin{aligned} \mathfrak{J}_{IcePop}^{GRPO}(\theta) &= \mathbb{E}_{x \sim D,\{y_i\}_{i=1}^G \sim \pi_{infer}(\cdot|x;\theta_{old})} \\ & ~~~~ \left[\frac{1}{G}\sum_{i=1}^{G}\frac{1}{|y_i|}\sum_{j=1}^{|y_i|}[\mathfrak{M}(\frac{\pi_{train}(y_{i,j}|x,y_{i,为解决这个问题,我们把 $\mathfrak{J}_{IcePop}^{GSPO}$ 修改为 $\mathfrak{J}_{IcePop}^{Mixed}$:
$$ \begin{aligned} \mathfrak{J}_{IcePop}^{Mixed}(\theta) &= \mathbb{E}_{x \sim D,\{y_i\}_{i=1}^G \sim \pi_{infer}(\cdot|x;\theta_{old})} \\ & ~~~~ \left[\frac{1}{G}\sum_{i=1}^{G}[\mathfrak{M}_{j \in [1, |y_i|]}(\frac{\pi_{train}(y_{i,j}|x,y_{i,译注:式 1–3 的核心差别在 $\mathfrak{M}$ 作用的粒度。式 1(GRPO 版)是 token 级:每个 token 各自算训练-推理概率比、各自决定掩不掩掉。式 2(GSPO 版)是序列级:先把整条回复的概率比取几何平均,再用一个标量决定整条回复的去留——这就是文中说的「剪掉大量低熵回复」的来源。式 3(Mixed)的写法是 $\mathfrak{M}_{j \in [1, |y_i|]}$,掩码判据回到 token 级逐个算,但被掩的对象仍是序列级的 $s_i(\theta)$,所以叫 Mixed。原文没有明说 $\mathfrak{M}_{j}$ 这个下标如何把 $|y_i|$ 个 token 的判据聚合成一个门控(全部通过才保留?还是逐 token 加权?),也没给 $\alpha, \beta$ 的具体取值。
另外,式 1–3 在原文 LaTeX 里的定界符是没闭合的:
min(缺右括号、\mathfrak{M}前的方括号缺右方括号;式 2 的 $\pi_{train}$ 写成了\pi_{train(y_i|x;\theta_{old})}(把整个实参吞进下标),式 2、3 的 $s_i(\theta)$ 展开式里\pi_{train}(y_{i,j}|x,y_{i,<j});\theta_{old})的右括号也放错了位置。这里补齐了定界符、把括号归位,公式内容未作改动。
WPSM:已学会正样本掩码。我们引入一种样本掩码策略,防止模型在已经掌握的 query 上过度优化,其中熟练度由每个 query 维护的一个成功率来追踪。对给定 query $x$ 及其 rollout 组 $\mathcal{Y}^x=\{y^x_1,y^x_2,...,y^x_G\}$($G$ 是组大小),如果第 $t$ 次迭代的平均准确率 $acc^x_t$ 超过阈值 $\tau$,则当 rollout $y^x_i$ 的策略熵 $\mathcal{H}_{y^x_i}(\pi_\theta)$ 低于稳定性界 $\eta$ 时,我们把 $\mathcal{Y}^x$ 中的这条 $y^x_i$ 标记为「已学会」的回复。训练时「已学会」的回复按如下方式被掩掉:
$$ \begin{aligned} \mathfrak{J}(\theta) &= \mathbb{E}_{x \sim D,\{y_i\}_{i=1}^G \sim \pi_{\theta_{old}}(\cdot|x)} \left[\frac{1}{G}\sum_{i=1}^{G}[1-\mathbb{M}_{mask}^i]min(s_{i}(\theta)\hat{A_i},~clip(s_i(\theta), 1-\epsilon, 1+\epsilon)\hat{A_i})\right] \\ & ~~~~~\mathbb{M}_{mask}^{i} = \begin{cases} \alpha & \mathcal{H}_{y^x_i}(\pi_\theta) < \eta ~~ and ~~ acc^{x}_{t} > \tau \\ 0 & otherwise \end{cases} \end{aligned} \tag{4} $$其中 $s_i(\theta)$ 表示重要性比率,$\alpha \in [0,1]$ 控制对「已学会」回复施加的补充学习程度。在这一设计下,梯度预算被转移到更难的样本上,比如那些奖励稀疏或推理路径多样的样本。通过掩掉冗余的正向信号,WPSM 缓解了对简单 query 过拟合所致的熵坍缩,并促使模型去提升那些有挑战性、表现较差的任务。
译注:式 4 在原文里写作 $[1-\mathbb{M}_{mask}^i]min(s_{i}(\theta))\hat{A_i},~clip(\cdots)\hat{A_i}$——
min只裹住了 $s_i(\theta)$ 一个参数,$\hat{A_i}$ 和整个 clip 项都掉在 min 外面,与式 1–3 里 $min(a\hat{A},~clip(a)\hat{A})$ 的形式不一致。这里按式 1–3 的形式把 min 的两个参数补回括号内。另外注意 $\mathbb{M}_{mask}^i$ 取值是 $\alpha$ 而不是 1,所以「掩掉」实际是按 $1-\alpha$ 的比例衰减梯度而非完全屏蔽,$\alpha=1$ 才是硬掩码。
4.3 用基于 hint 的学习提升样本效率
近期研究32表明,尽管 GRPO30、 DAPO33 等最先进的 RL 方法通过强化高奖励补全提升了 pass@1 指标,它们在 base 模型本就表现很差的困难任务上有明显局限。具体来说,当所有 rollout 都拿到零奖励时,GRPO 框架无法为策略优化提供有效的梯度信号。这种情况下,困难 query 上的 RL 训练往往推进得慢得多,因为稀疏奖励和有限的样本效率阻碍了学习。为应对这一挑战,我们提出自适应 hint 强化学习(AHRL),一种缓解困难 query 上奖励稀疏问题的方法。如图 7 所示,AHRL 引入部分 hint,把复杂问题分解成中间步骤,逐步提升被训练模型的表现。下面详细描述这一机制。
AHRL:自适应 hint 强化学习。与那些修改奖励函数或优化算法的做法不同,AHRL 的设计是在 RL 训练期间往 query 里注入部分 think 草图。通过把问题分解成中间步骤,AHRL 提高了 base 模型生成正确回复的倾向,也提升了样本效率。结果是模型被驱动去攻克最难的问题,这加速了 RL 训练过程。
对给定 query $x$,其回复由一段思考轨迹和一个最终解答组成,记为 $y=(think, solution)$;AHRL 把 $x$ 增强成 $\tilde{x}^{(p)}$,做法是把 think 的前 $p_{hint}$ 个 token 附加到原 query 上。$p_{hint}$ 表示被揭示的思考所占的比例,从而能细粒度地控制 query 难度。具体而言,概率 $p_{hint}$ 遵循一个退火调度:
$$ p_{hint}(x^{t}) = p_{initial} \cdot \exp(-\gamma \cdot t \cdot pass_{initial}^{x}) \tag{5} $$其中 $t$ 是训练迭代数,$\gamma$ 是衰减率,$pass_{initial}^{x}$ 是 query $x$ 在 SFT 模型上评出的 pass@k 分数。随着训练推进、模型表现提升,被揭示的 hint 比例逐步下降,把模型过渡到完全的自主探索。这一机制提供了必要的「脚手架」,弥合初始探索与成功完成任务之间的落差。它防止训练在那些有效推理路径统计上极为稀有的复杂任务里停滞,并确保跨模态的一致性能提升。
5 基础设施
ERNIE 5.0 的训练建立在飞桨 PaddlePaddle34 之上。在 ERNIE 4.52 的基础设施基础上,我们进一步应对原生多模态训练、超稀疏 MoE 模型和大规模 RL 流程带来的独特挑战。
巨大的内存压力与通信开销。ERNIE 5.0 的超稀疏 MoE 架构给高效训练带来两大挑战:超稀疏的专家激活导致沉重的跨节点通信,而大规模的专家参数带来显著的内存压力。为缓解这些挑战,我们提出一套为 MoE 架构量身定制的混合并行策略,并与细粒度内存控制相结合。
多 tokenizer 的多模态训练。作为一个同时支持文本、视觉、音频的统一模型,ERNIE 5.0 依赖多个模态专用的 tokenizer 模型。它们的计算特征与 MoE 主干差异显著,很难对所有部分套用传统的端到端优化策略。为化解这一错配,我们采用一种解耦架构,把 tokenizer 与 MoE 主干在物理上分开、部署在不同的 GPU 节点上,使每个组件都能使用最适合自己的并行策略。
跨模态的灵活注意力模式。ERNIE 5.0 处理来自多个模态的输入,它们的注意力模式各不相同:视觉输入通常需要双向注意力,而文本和音频输入依赖单向注意力。虽然 FlexAttention35 之类的现有方案也支持灵活的注意力,但当注意力掩码模式在同一 batch 内逐样本变化时,它们的效率就不高了。因此我们在这里采用自研的 FlashMask9 来加速注意力掩码计算。
吞吐与一致性双重约束下的可扩展 RL。万亿参数模型的强化学习需要训练、推理与环境交互三者协同执行。这类异构负载带来的挑战包括:维持训练与 rollout 之间的数值一致性、缓解异步流水线中的数据分布偏差、以及最大化各类硬件资源的利用率。为此我们设计了一套可扩展的分离式 RL 基础设施,在保持严格计算确定性的前提下解决这些瓶颈。
5.1 面向规模化训练的混合并行
为应对超稀疏 MoE 架构带来的严重内存压力和通信开销,我们开发了一套能适应不同训练资源的分布式并行策略。最终配置组合了 4 路张量并行36、带 virtual stage 的 12 路 pipeline 并行37、64 路专家并行38、ZeRO-1 数据并行39,以及用于长上下文训练的 context 并行40。我们还用 DeepEP41 来实现高效的跨节点通信,同时用 virtual pipeline 并行来最小化流水线气泡。为保证最终性能,ERNIE 5.0 全程采用 no-token-dropping 策略,而专家路由不均衡有时会引发显存溢出(OOM),训练初期尤其如此。为缓解这些问题、稳定大规模 MoE 训练,我们开发了下面这一系列技术。
为确保内存充足,我们实现了以下策略:
- FP8 混合精度训练。沿用 ERNIE 4.52 的实践,我们采用 FP8 混合精度训练并以 FP8 格式存储激活张量,这有效降低了训练期间的峰值内存占用。
- 激活内存的动态自适应 offload。前向传播时,所有为反向计算保留的激活张量都被追踪。我们扩展了内存分配器,使其在遇到 OOM 事件时能自适应地 offload 选定的激活张量;内存充足时则不触发 offload。这项技术以极小的性能开销保证了训练所需的总内存。
为减少内存碎片,我们实现了以下策略:
- 子 batch 计算。我们用子 batch 计算把大的内存分配请求拆解成一系列更小的请求,降低了内存碎片引发 OOM 的概率。
- 自动内存碎片整理。基于 CUDA 虚拟内存管理(VMM),我们开发了一个具备自动碎片整理能力的内存分配器,确保在极端条件下也能成功分配内存。
通过上述技术,我们保证了在内存受限场景下预训练 ERNIE 5.0 的可行性与可靠性。
5.2 面向多模态训练的分离式架构
ERNIE 5.0 整合异构多模态输入,每个模态由专门的 tokenizer 负责把原始信号转换成 token 序列。序列长度与计算成本在不同模态之间差异很大,甚至同一模态内的不同样本之间也是如此。把所有 tokenizer 与主干一起部署在同构硬件上会造成显著的负载不均衡,进而拖累整体训练效率。
为解决这个问题,我们设计了一套 tokenizer-主干分离架构。我们把 tokenizer 从主干中解耦出来,作为独立的、可水平扩展的服务部署在专用计算节点上,采用数据并行配置。训练时主干通过远程调用与这些 tokenizer 服务交互以取回编码后的表示。这种架构上的分离让每个组件都能采用适合自身负载的并行策略,提升了分布式多模态训练的可扩展性与效率。
5.3 用 FlashMask 支持灵活的多模态注意力
在 ERNIE 5.0 中,注意力模式因模态而异,甚至可能因样本而异。文本建模通常依赖因果注意力,而视觉特征常采用双向注意力——也就是说,对视觉样本,注意力在整体上遵循因果结构,同时允许局部的双向交互以捕捉空间依赖。因此高效支持这类异构掩码模式,对统一多模态训练至关重要。
为满足这些需求,我们采用 FlashMask9,它不仅满足了 ERNIE 5.0 灵活多样的注意力掩码需求,还显著加速了注意力掩码运算的计算效率。实践中,FlashMask 在算子级别相比 FlexAttention35 取得最高 200% 的加速,端到端训练加速超过 20%。此外我们在 kernel 级别把 FlashMask 与 context 并行40做了集成,相比 Megatron-LM 方案取得 80% 的性能提升。
5.4 可扩展的分离式 RL 基础设施
把强化学习扩展到万亿参数的统一多模态模型上,在计算一致性、数据分布偏差和异构资源利用方面带来独特挑战。为突破这些瓶颈,我们提出 ERNIE 5.0 RL 基础设施,一套为编排大规模异步训练而设计的分离式系统。通过优先保障高吞吐执行与计算确定性,我们的系统确保了稳定高效的 RL 训练。
关键架构组件总结如下:
- 面向异步 RL 的分离式控制平面。我们引入一个围绕中心化 RL controller 构建的完全分离的控制平面来最大化系统吞吐,它以异步方式协调训练、推理、环境交互和奖励评估。这些子系统之间的逻辑解耦带来了灵活的扩展和高效的流水线管理,构成了大规模异步多模态 RL 的基础。
- 训练推理一致的统一 FP8 栈。精度分歧是低比特 RL 训练中的常见问题。为缓解这一情况,我们构建了统一的 FP8 执行引擎。通过在训练与推理(rollout)两个阶段使用完全相同的高性能算子,并集成 Rollout Router Replay42 策略,该引擎最小化了数值失配,确保了低精度设定下的稳定收敛。
- 缓解序列长度偏差的 replay buffer。RL 中的异步 rollout 可能引入序列长度偏差——较短的回复更早进入训练,扭曲数据分布。我们设计了一个无偏 replay buffer,配合 §4.1 描述的算法,保持原始数据顺序,从而确保数据到达的一致性、缓解异步完成造成的偏差。
- 弹性 CPU 池化的异构资源优化。为应对 GPU 主导的 AI 集群中常见的 CPU 资源利用不足,我们实现了一种弹性 CPU 池化策略。这一弹性机制把集群中闲置的 CPU 容量隔离并虚拟化出来,用于驱动密集 RL 环境交互和结果验证这类逻辑密集型任务。它有效放大了可用于环境 rollout 的计算资源,使超大规模并行仿真成为可能。因此它在缩短训练迭代 wall-clock 时间的同时,显著提升了底层硬件的总拥有成本(TCO)效率。
6 评测
我们用内部评测框架 ERNIE-Eval43 在文本(§6.1)、视觉(§6.2)和音频(§6.3)benchmark 上把 ERNIE 5.0 与最先进的模型做系统对比。接下来我们进一步深入分析两个关键设计选择:模态无关专家路由(§6.4.1)与弹性训练(§6.4.2)。
6.1 语言 benchmark 评测
为全面评估大规模预训练与后训练所习得的以文本为中心的能力,我们在一组多样的 benchmark 上评测 ERNIE 5.0,覆盖事实知识、推理、数学解题、编码、多语种理解、指令遵循和面向 agent 的任务。选取这些 benchmark 是为了同时涵盖核心语言建模能力与进阶的推理、决策技能,从而系统检验统一架构与训练策略如何转化为下游文本性能。
Benchmark:
- 知识:PreciseWikiQA、PopQA、HotPotQA、ChineseSimpleQA、SimpleQA。
- 通用:MMLU-Pro、MMCU、AGIEval、MMLU、MMLU-Redux、C-Eval、CMMLU、BBH、WinoGrande、Humanity’s Last Exam(HLE)。
- STEM:MATH(CoT)、GPQA-Diamond、AIME 2025、HMMT 2025。
- 编码:LiveCodeBench v6(2408 到 2505)、HumanEval+、MBPP+、CRUXEval。
- 多语种:MMMLU、INCLUDE。
- 推理:ZebraLogic、BBEH。
- 指令遵循:IFEval、Multichallenge、Multi-IF。
- Agent:TAU2-Bench、ACEBench、BFCL v4、BrowseComp、SpreadSheetBench。
预训练模型评测。
| 类别 | Benchmark | DS V3.2-Exp-Base | Kimi K2-Base | ERNIE 5.0-Base |
|---|---|---|---|---|
| 知识 | PreciseWikiQA(10-shot) | 52.60 | 61.66 | 74.48 |
| 知识 | PopQA(10-shot) | 48.73 | 51.74 | 65.24 |
| 知识 | HotPotQA(10-shot) | 53.11 | 57.07 | 67.08 |
| 知识 | ChineseSimpleQA(10-shot) | 74.19 | 78.29 | 90.09 |
| 通用 | MMLU-Pro(5-shot) | 68.27 | 67.19 | 75.58 |
| 通用 | MMCU(5-shot) | 91.16 | 90.63 | 93.92 |
| 通用 | AGIEval(5-shot) | 78.20 | 76.43 | 80.22 |
| 通用 | MMLU(5-shot) | 88.60 | 88.40 | 90.58 |
| 通用 | MMLU-Redux(5-shot) | 90.50 | 89.88 | 92.19 |
| 通用 | C-Eval(5-shot) | 90.70 | 92.49 | 91.98 |
| 通用 | CMMLU(5-shot) | 88.43 | 90.61 | 89.69 |
| 通用 | BBH(5-shot,w.o.-cot / Direct) | 73.50 | 70.07 | 75.69 |
| 通用 | WinoGrande(5-shot) | 88.87 | 87.61 | 92.66 |
| STEM | MATH(CoT,8-shot) | 65.70 | 65.90 | 73.89 |
| STEM | GPQA-Diamond(5-shot) | 53.01 | 48.10 | 57.30 |
| 编码 | LiveCodeBench v6(1-shot) | 24.90 | 26.30 | 31.94 |
| 编码 | HumanEval+(0-shot) | 53.99 | 70.73 | 80.86 |
| 编码 | MBPP+(0-shot) | 78.77 | 79.36 | 79.10 |
| 编码 | CRUXEval-I(1-shot) | 59.54 | 73.64 | 79.75 |
| 编码 | CRUXEval-O(1-shot) | 71.28 | 81.61 | 84.01 |
| 多语种 | MMMLU(5-shot) | 70.99 | 61.50 | 78.94 |
| 多语种 | INCLUDE(5-shot) | 77.45 | 72.29 | 77.81 |
表 1:预训练模型在各类语言 benchmark 上的对比。每行的最佳成绩以粗体标出。
表 1 汇总了 ERNIE 5.0 在一组多样文本 benchmark 上与强开源 baseline 的预训练结果对比。在这些 benchmark 上,ERNIE 5.0 在知识、推理、数学、编码和多语种任务上展现出持续强劲且均衡的表现:
在知识密集型 benchmark 上,ERNIE 5.0-Base 相对 DeepSeek V3.2-Exp-Base(DS V3.2-Exp-Base)和 Kimi K2-Base 有清晰而显著的优势,在中英文问答任务上尤其如此。这些数据集上的大幅领先说明,大规模统一预训练有效地巩固了事实知识,并在多语种设定下支撑起稳健的检索式推理。
在通用推理与考试类 benchmark 上,ERNIE 5.0-Base 在一系列有挑战性的评测上取得最好成绩,包括 MMLU-Pro、MMLU、MMCU、AGIEval、MMLU-Redux 和 BBH。值得注意的是,在 MMLU-Pro 这类更难的 benchmark 上的显著增益说明推理深度与鲁棒性有所提升,这可以归因于共享主干与模态无关 MoE 路由所促成的有效专家特化。
在 STEM 任务上,ERNIE 5.0-Base 在 MATH(CoT)和 GPQA-Diamond 上持续超过强 baseline,展现出稳健的多步推理和解答一致性。这些改进反映了深层统一架构带来的更强长程依赖建模,以及弹性预训练下的稳定优化。
在编码领域,ERNIE 5.0-Base 在 LiveCodeBench v6 和 CRUXEval 上取得 state-of-the-art 表现,在 MBPP+ 上也保持竞争力,说明大规模预训练学到的算法与过程性推理有很好的泛化。
在多语种 benchmark 上,ERNIE 5.0-Base 在 MMMLU 和 INCLUDE 上大幅超过 baseline,验证了统一 tokenization 与共享专家路由在学习稳健多语种表示上的有效性。
这些结果表明,所提出的统一架构与弹性预训练策略共同带来了跨多样文本任务的强泛化能力,为后续的后训练与部署提供了坚实而通用的基础。
后训练模型评测。
| 类别 | Benchmark | DS V3.2-Thinking | Gemini 2.5-Pro | GPT-5 (High) | Gemini 3-Pro | ERNIE 5.0 |
|---|---|---|---|---|---|---|
| 知识 | SimpleQA | 28.02 | 54.00 | 51.30 | 69.33 | 74.01 |
| 知识 | ChineseSimpleQA | 72.37 | 76.50 | 75.10 | 84.08 | 86.03 |
| 通用 | MMLU-Pro | 85.00 | 86.20 | 87.10 | 86.88 | 83.80 |
| 通用 | HLE | 25.10 | 21.60 | 24.80 | 37.50 | 25.81 |
| STEM | GPQA-Diamond | 82.40 | 86.40 | 85.70 | 91.90 | 86.36 |
| STEM | AIME 2025 | 93.10 | 88.00 | 94.60 | 95.00 | 89.06 |
| STEM | HMMT 2025 | 86.67 | 81.20 | 93.30 | 93.33 | 79.58 |
| 编码 | LiveCodeBench v6 | 81.06 | 72.90 | 81.70 | 86.34 | 76.21 |
| 编码 | HumanEval+ | 90.80 | 94.50 | 92.70 | 95.12 | 94.48 |
| 编码 | MBPP+ | 81.48 | 73.80 | 83.10 | 86.21 | 82.54 |
| 推理 | ZebraLogic | 97.60 | 92.90 | 98.80 | 95.50 | 96.50 |
| 推理 | BBEH | 67.04 | 68.80 | 69.00 | 78.80 | 66.63 |
| 指令遵循 | IFEval | 91.87 | 89.50 | 94.10 | 92.24 | 93.35 |
| 指令遵循 | MultiChallenge | 42.43 | 51.50 | 58.30 | 62.50 | 65.98 |
| 指令遵循 | Multi-IF | 71.17 | 76.10 | 70.00 | 81.15 | 85.56 |
| Agent | TAU2-Bench | 80.30 | 56.20 | 80.10 | 85.40 | 78.79 |
| Agent | ACEBench-en | 81.40 | 80.90 | 79.30 | 80.90 | 87.70 |
| Agent | ACEBench-zh | 83.40 | 87.50 | 83.60 | 85.00 | 89.60 |
| Agent | BFCL v4 | 61.18 | 52.30 | 61.60 | 68.14 | 66.47 |
| Agent | BrowseComp-zh | 65.00 | 28.70 | 61.90 | 63.67 | 64.71 |
| Agent | SpreadSheetBench | 35.29 | 27.70 | 34.00 | 55.36 | 40.08 |
表 2:后训练模型在广泛语言 benchmark 上的评测。
如表 2 所示,后训练的 ERNIE 5.0 在一大批以文本为中心的 benchmark 上取得有竞争力或领先的表现,在知识、指令遵循、编码和面向 agent 的任务上追平强开源与闭源模型,同时保持了强的通用推理能力——而它还是一个原生统一的全模态模型:
在 SimpleQA、ChineseSimpleQA 这类知识密集型 benchmark 上,ERNIE 5.0 在本已很强的预训练结果之上进一步提升。这说明后训练有效地增强了事实召回与答案校准,同时保留了大规模预训练所习得的底层知识表示。
在通用推理、数学和编码 benchmark 上,ERNIE 5.0 相对强后训练 baseline 表现稳定且有竞争力。虽然 Gemini 3-Pro 在若干特别有挑战性的 benchmark 上领先,包括 GPQA-Diamond、AIME 2025、HMMT 2025 和 LiveCodeBench,但 ERNIE 5.0 在多数 benchmark 上持续追平或超过 DeepSeek-V3.2-Thinking(DS-V3.2-Thinking)、Gemini 2.5-Pro 和 GPT-5 (High)。这一行为与预训练阶段的观察一致,说明 ERNIE 5.0 强调的是稳健均衡的能力发展,而不是朝极端推理或竞赛类任务的激进优化。
在指令遵循 benchmark 上,ERNIE 5.0 在多指令评测上有明显优势,在 MultiChallenge 和 Multi-IF 上取得最佳成绩,在 IFEval 上也接近榜首。这些结果说明后训练有效强化了指令服从和组合式指令理解,与强预训练基础形成互补。
在面向 agent 的 benchmark 上,ERNIE 5.0 表现有竞争力且常常领先,在 ACEBench(中英文皆是)和 BrowseComp-zh 上尤为突出。虽然 Gemini 3-Pro 在某些工具密集型任务上更出色,ERNIE 5.0 在多样的 agent 场景中展现出强泛化能力,说明它在复杂交互环境里具备实用性。
预训练与后训练结果的对比,勾勒出 ERNIE 5.0 一条一致的能力轨迹:预训练阶段确立的事实知识与通用鲁棒性优势,在后训练之后几乎被完整保留,而指令遵循和 agent 能力则得到显著增强。尽管 ERNIE 5.0 在通用推理、数学和编码任务上保持竞争力,但在最有挑战性的推理 benchmark 上,相比 Gemini 3-Pro 这类模型仍存在中等程度的差距。我们未来的工作将进一步借助架构设计与进阶训练策略,更好地支撑复杂的长程推理。
6.2 视觉 benchmark 评测
为评估原生多模态训练所带来的视觉理解与生成能力,我们在各类以图像和视频为中心的 benchmark 上评测 ERNIE 5.0。这些评测覆盖视觉推理、文档理解、视觉问答、视频理解以及图像和视频生成,全面考察统一多模态架构如何在感知、推理和生成任务上体现为具体表现。
视觉理解与生成 benchmark:
- STEM 与推理:MMMU-Pro、MathVista、MathVerse、MathVision、VisualPuzzle、VisuLogic、VLMAreBlind、MMMU。
- 文档理解:ChartQA、AI2D、DocVQA(val)、OCRBench、ChartXiv-RQ、ChartXiv-DQ。
- 通用 VQA:SimpleVQA、HallusionBench、MMStar、BLINK、CV-Bench、CountBench。
- 视频理解:VideoMME、Video-MMMU、MMVU。
- 图像与视频生成:GenEval、VBench。
视觉理解评测。
| 类别 | Benchmark | Qwen3-VL Thinking | Gemini 2.5-Pro | GPT-5 (High) | Gemini 3-Pro | ERNIE 5.0 |
|---|---|---|---|---|---|---|
| STEM & 推理 | MMMU-Pro | 68.28 | 68.80 | 78.40 | 81.00 | 68.63 |
| STEM & 推理 | MathVista | 86.80 | 82.70 | 82.10 | 89.20 | 84.80 |
| STEM & 推理 | MathVerse | 83.96 | 86.27 | 84.19 | 91.62 | 85.13 |
| STEM & 推理 | MathVision | 71.84 | 73.30 | 78.06 | 87.27 | 74.34 |
| STEM & 推理 | VisualPuzzle | 57.01 | 61.51 | 57.75 | 71.48 | 64.82 |
| STEM & 推理 | VisuLogic | 31.93 | 32.80 | 29.80 | 37.60 | 32.00 |
| STEM & 推理 | VLMAreBlind | 75.13 | 76.54 | 69.60 | 80.83 | 91.38 |
| 文档理解 | ChartQA | 84.60 | 84.08 | 78.24 | 89.44 | 87.80 |
| 文档理解 | AI2D | 96.96 | 97.09 | 95.63 | 97.70 | 96.89 |
| 文档理解 | DocVQA$_{\textit{val}}$ | 95.44 | 91.43 | 94.16 | 90.70 | 95.45 |
| 文档理解 | OCRBench | 863 | 866 | 804 | 909 | 878 |
| 文档理解 | ChartXiv-RQ | 63.00 | 67.80 | 81.10 | 81.40 | 67.10 |
| 文档理解 | ChartXiv-DQ | 92.92 | 93.38 | 91.17 | 95.95 | 89.05 |
| 通用 VQA | SimpleVQA | 62.37 | 68.19 | 55.84 | 74.06 | 67.64 |
| 通用 VQA | HallusionBench | 64.01 | 63.70 | 66.58 | 73.48 | 63.87 |
| 通用 VQA | MMStar | 76.88 | 77.50 | 82.10 | 82.96 | 75.54 |
| 通用 VQA | BLINK | 66.60 | 70.60 | 70.39 | 77.49 | 70.02 |
| 通用 VQA | CV-Bench | 87.57 | 84.87 | 84.99 | 90.07 | 87.19 |
| 通用 VQA | CountBench | 92.67 | 91.00 | 88.88 | 97.35 | 96.54 |
| 视频理解 | VideoMME$_{\textit{(w sub)}}$ | 80.97 | 86.90 | 87.36 | 88.40 | 81.35 |
| 视频理解 | Video-MMMU | 80.00 | 83.60 | 84.60 | 87.60 | 81.11 |
| 视频理解 | MMVU | 71.10 | 76.10 | 87.34 | 76.30 | 72.24 |
表 3:后训练模型在广泛视觉 benchmark 上的评测。
| 模型 | MathVista | MathVerse | MathVision | VisualPuzzle | VisuLogic | ChartQA | AI2D |
|---|---|---|---|---|---|---|---|
| ERNIE 5.0-Base | 84.40 | 81.45 | 68.75 | 54.24 | 28.50 | 87.68 | 96.02 |
| 模型 | OCRBench | ChartXiv-RQ | ChartXiv-DQ | SimpleVQA | MMStar | BLINK | CV-Bench |
|---|---|---|---|---|---|---|---|
| ERNIE 5.0-Base | 875 | 62.70 | 90.35 | 61.54 | 74.07 | 64.12 | 86.96 |
表 4:我们的预训练模型在广泛视觉 benchmark 上的评测。公开可得的视觉 base 模型及其结果很少,这里我们只报告自己模型的结果。
译注:原文表 4 是一张 14 列的宽表,用
\multirow把「ERNIE 5.0-Base」这个行标签跨两个折排块合并,页面上呈现为「7 列表头 + 一行数据 + 另 7 列表头 + 另一行数据」。markdown 表不支持这种折排,这里拆成上下两张表,数据未改。
| Benchmark | Nano Banana Pro | Seedream 4.0 | GPT-Image | Qwen-Image | ERNIE 5.0-Base | ERNIE 5.0 |
|---|---|---|---|---|---|---|
| GenEval | 89.0 | 85.4 | 84.0 | 91.0 | 88.4 | 90.1 |
表 5:在 GenEval 上与专用模型的图像生成能力对比。
| Benchmark | 指标 | HunyuanVideo-1 | Wan2.1-14B-0725 | Veo3 | ERNIE 5.0-Base | ERNIE 5.0 |
|---|---|---|---|---|---|---|
| VBench | Quality | 85.07 | 85.59 | 85.70 | 84.14 | 84.40 |
| VBench | Semantic | 76.88 | 76.11 | 82.49 | 82.31 | 83.40 |
| VBench | Overall | 83.43 | 83.69 | 85.06 | 83.78 | 84.20 |
表 6:在 VBench 上与专用模型的视频生成能力对比。
表 3 和表 4 分别展示了 ERNIE 5.0 在指令微调设定下(ERNIE 5.0)和其原生多模态基座(ERNIE 5.0-Base)的多模态能力。这一对比让我们更清楚地看到指令微调如何与统一多模态预训练范式相互作用。
ERNIE 5.0-Base 在视觉推理、文档理解和通用 VQA benchmark 上展现出强劲而全面的表现,尽管它没有经过指令微调。这说明核心的多模态感知与跨模态推理能力大部分是在预训练期间习得的,得益于视觉与文本 token 的早期融合以及模态无关的表示学习。这一行为不同于模块化或 late-fusion 设计——在那些设计里,可比的能力通常要经过大量任务专项调优才会出现。在这一基础上,ERNIE 5.0 在多数 benchmark 上持续提升,在需要显式推理、组合式理解和稳健视觉-语言对齐的任务上尤其明显。
与其他强多模态 baseline 相比,ERNIE 5.0 在广泛的推理、文档理解和通用 VQA 任务上取得有竞争力或更优的结果,同时保持均衡表现而非针对单个 benchmark 做优化。这说明 ERNIE 5.0 中的指令微调主要是在精修推理与对齐行为,而不是在弥补感知容量的不足。
在文档理解场景中,ERNIE 5.0-Base 相对强劲的成绩已经体现出有效的版面感知推理与文字抽取能力,而 ERNIE 5.0 进一步增强了对复杂视觉文档的问题理解与结构化推理。通用 VQA 和视频理解 benchmark 上也观察到类似趋势:指令微调在不改变底层架构的前提下提升了鲁棒性与时序推理。
视觉生成评测。我们在广泛使用的图像与视频生成 benchmark 上评测 ERNIE 5.0,并与领先的商业和开源模型作对比。
对图像生成,如表 5 所示,ERNIE 5.0 在 GenEval benchmark 上取得有竞争力的表现。具体而言,ERNIE 5.0 与 Nano-Banana Pro3 和 Qwen-Image44 这类最先进的商业系统持平,与 GPT-Image4 和 Seedream 4.08 相当。这说明 ERNIE 5.0 有能力生成高美学、语义对齐强且视觉细节精细的图像。
对视频生成,表 6 汇总了 VBench benchmark 上的结果。ERNIE 5.0 在 VBench-Semantic 上取得最佳表现,超过 Veo345 这类强商业模型,这表明它在视频生成中的语义对齐更胜一筹。这一优势与统一多模态架构相吻合——高层语义表示被有效地迁移到了生成任务上。同时 ERNIE 5.0 在 overall 和 quality 指标上保持竞争力,展现出扎实的视觉保真度与时序一致性。此外 ERNIE 5.0 与 HunyuanVideo-146 和 Wan2.1-14B-072547 这类领先开源模型持平,说明所提架构即便在后训练之前也提供了强的视频生成基础。总体而言,这些结果验证了 ERNIE 5.0 在生成语义准确、视觉连贯的视频上的有效性。
6.3 音频 benchmark 评测
为评估原生多模态训练所带来的音频理解与生成能力,我们在一套多样的语音与音频类 benchmark 上评测 ERNIE 5.0。这些评测覆盖自动语音识别、语音对话、通用音频理解以及语音生成,全面呈现统一多模态架构如何在多样的语言与声学环境下转化为稳健的音频感知、语义理解和生成性能。
音频理解与生成 benchmark:
- 自动语音识别:AISHELL-1、AISHELL-2、WenetSpeech、LibriSpeech、Fleurs。
- 语音聊天:VoiceBench。
- 音频理解:MMAU、CochlScene、TUT2017、ClothoAQA、VocalSound。
- 语音生成:Seed-TTS。
音频理解评测。
| Benchmark | Kimi Audio | GPT-4o-Audio | Qwen3-Omni-Instruct | LongCat-Flash-Omni | Gemini-3-Pro | ERNIE 5.0-Base | ERNIE 5.0 |
|---|---|---|---|---|---|---|---|
| 自动语音识别($\downarrow$) | |||||||
| AISHELL-1 | 0.60 | 3.52 | 0.84 | 0.63 | 3.04 | 0.75 | 0.31 |
| AISHELL-2 | 2.56 | 4.26 | 2.34 | 2.78 | 4.98 | 2.90 | 2.64 |
| WenetSpeech net / meeting | 5.37 / 6.28 | 15.30 / 32.27 | 4.69 / 5.89 | 6.09 / 6.69 | 10.94 / 12.08 | 11.57 / 22.85 | 7.27 / 7.36 |
| LibriSpeech clean / other | 1.28 / 2.42 | 1.39 / 3.75 | 1.22 / 2.48 | 1.57 / 4.01 | 2.74 / 4.40 | 1.47 / 3.73 | 1.16 / 2.61 |
| Fleurs-en | 4.44 | 3.32 | 2.72 | 5.02 | 3.63 | 4.39 | 3.14 |
| Fleurs-zh | 2.69 | 2.44 | 2.20 | 3.99 | 4.98 | 1.58 | 0.83 |
| VoiceBench($\uparrow$) | |||||||
| AlpacaEval | 4.46 | 4.73 | 4.74 | 4.94 | 4.80 | 4.65 | 4.62 |
| CommonEval | 3.97 | 4.37 | 4.54 | 4.32 | 4.68 | 4.39 | 3.74 |
| SD-QA | 63.12 | 90.10 | 76.90 | 82.46 | 94.39 | 86.44 | 77.58 |
| MMSU | 62.17 | 78.90 | 69.00 | 81.95 | 92.16 | 76.61 | 84.68 |
| OpenBookQA | 83.52 | 87.90 | 89.70 | 93.41 | 96.26 | 88.35 | 92.97 |
| IFEval | 61.10 | 66.81 | 77.80 | 77.99 | 87.45 | 71.17 | 72.67 |
| AdvBench | 100.00 | 99.23 | 99.30 | 100.00 | 98.46 | 98.65 | 99.23 |
| 音频理解($\uparrow$) | |||||||
| MMAU | 65.20 | 68.40 | 77.50 | 75.90 | 80.80 | 80.80 | 80.40 |
| TUT2017 | 65.25 | 20.74 | 40.74 | 65.43 | 61.42 | 57.65 | 68.09 |
| CochlScene | 80.42 | 34.94 | 43.03 | 70.02 | 74.60 | 75.24 | 82.77 |
| ClothoAQA | 72.21 | 61.87 | 75.16 | 72.83 | 74.41 | 65.70 | 73.68 |
| VocalSound | 94.85 | 82.37 | 91.60 | 92.76 | 92.01 | 91.48 | 90.73 |
表 7:与专用模型在自动语音识别、语音转文本对话和音频理解能力上的对比。自动语音识别用词错误率(WER)作指标(越低越好),其他任务用准确率或分数(越高越好)。
译注:WenetSpeech 和 LibriSpeech 两行每格是两个数(net / meeting、clean / other),原文用
||分隔,这里改用/——竖线在 markdown 表里是列分隔符,原样保留会把表撕开。表 8 的 test-zh / test-en 同理。
我们在 ASR、语音聊天和其他音频理解 benchmark 上把 ERNIE 5.0 与其他领先的专用及通用模型作对比。如表 7 和表 8 所示,ERNIE 5.0 在语音识别、语音转文本对话、音频理解和语音生成 benchmark 上展现出 state-of-the-art 或有竞争力的表现。
在自动语音识别(ASR)任务上,ERNIE 5.0 在中英文 benchmark 上都取得低词错误率,包括 AISHELL 和 LibriSpeech,说明它在不同语言和声学条件下表现稳健。虽然某些模型在 WenetSpeech 这类特定数据集上成绩更强,ERNIE 5.0 在广泛的 ASR benchmark 上保持了持续稳定的表现,体现出良好的泛化。
在 VoiceBench 上,ERNIE 5.0 在 MMSU 和 OpenBookQA 这类任务上保持竞争力,反映出它处理基于语音的交互与知识依赖推理的能力。
在音频理解任务上,ERNIE 5.0 在 TUT2017 和 CochlScene 这类声学场景与环境声 benchmark 上表现出色,在 MMAU 和 ClothoAQA 等更多样的 benchmark 上取得相当的结果。总体来看,模型在广泛的非语音与通用音频理解任务上表现一致,说明它有能力捕捉语音内容之外的音频语义。
音频生成评测。
| Benchmark | 模型 | 性能 |
|---|---|---|
| SEED-TTS($\downarrow$)test-zh / test-en | Seed-TTS$_{\text{ICL}}$ | 1.11 / 2.24 |
| Seed-TTS$_{\text{RL}}$ | 1.00 / 1.94 | |
| MaskGCT | 2.27 / 2.62 | |
| E2 TTS | 1.97 / 2.19 | |
| F5-TTS | 1.56 / 1.83 | |
| Spark TTS | 1.20 / 1.98 | |
| CosyVoice 2 | 1.45 / 2.57 | |
| CosyVoice 3 | 0.71 / 1.45 | |
| Qwen2.5-Omni | 1.42 / 2.33 | |
| Qwen3-Omni | 1.07 / 1.39 | |
| ERNIE 5.0-Base | 3.41 / 2.44 | |
| ERNIE 5.0 | 1.35 / 1.54 |
表 8:在 SEED-TTS 上与专用模型的文本转语音能力对比。用词错误率(WER)评估内容一致性,越低越好。
在 SEED-TTS 上,ERNIE 5.0 在中英文测试集(test-zh、test-en)上都取得有竞争力的内容一致性,与 Qwen3-Omni 这类近期音频-语言模型相当。虽然专用 TTS 系统(如 CosyVoice-3)成绩更强,ERNIE 5.0 在没有任务专项 TTS 优化的情况下展现出可靠的内容保持能力。
综合来看,表 7 的结果表明 ERNIE-5.0 是一个有竞争力的统一音频-语言模型,在单一框架内平衡了语音识别精度、语音交互、通用音频理解与语音生成。
6.4 讨论
为更好地理解 ERNIE 5.0 在大规模多模态训练中的行为,我们剖析两个关键架构设计:模态无关专家路由与弹性训练。下面两个小节分析这两个组件及其对效率与可扩展性的影响。
6.4.1 模态无关专家路由
ERNIE 5.0 采用模态无关的专家路由机制,不引入模态专用的参数或路由规则。文本、图像、视频、音频等所有输入都由同一个路由网络处理、共享同一个专家池。本节我们考察 MoE 模型的专家路由行为,重点关注模态特定的利用模式、跨模态专家重叠以及跨层的路由均衡。
译注:原文图 8 是横排的三张子图,这里拆成 8a/8b/8c 竖排。每张图内部从上到下的六个子面板依次是文本、图像理解、视频理解、图像生成、视频生成、音频理解与生成。另外图注说纵轴是「专家激活频率」,而图上印的轴标签是
Modality specialization (%),两者说的是同一件事的两种叫法。
专家利用与特化视角。图 8 揭示出明显非均匀的专家激活分布,说明在模态无关专家路由设定下,不同专家仍然扮演着不同的功能角色。一部分专家在文本、图像、视频、音频输入上被反复激活,而其余专家则表现出强烈的模态特定激活模式。图像、视频、音频输入的专家激活明显比纯文本输入更集中。从任务层面看,视觉生成和音频类任务导致的专家激活比文本和视觉理解任务更集中。
跨模态专家协作视角。图 9 通过报告各层中每个模态按激活频率排名前 25% 的专家之间的交并比(IoU),进一步分析跨模态专家协作。从重叠模式看,文本与音频的共激活程度高于与其他模态,而它与图像、视频的重叠在更深的层里变得越来越明显。这一趋势说明多模态表示逐步从低层的模态特定特征转向高层的统一语义特征,从而在深层与文本形成更强的协作。对视觉模态,图像理解与视频理解任务表现出很高的专家重叠,图像生成与视频生成任务也呈现类似模式,这与「把图像视作单帧视频」的架构设计相吻合。相比之下,视觉理解与生成之间的重叠仍然相对较低,且没有明显偏向任何一方。
译注:原文图 9 同样是横排三张,这里拆成 9a/9b/9c;矩阵的六行六列依次是文本、图像理解、视频理解、图像生成、视频生成、音频理解与生成。把三张 IoU 矩阵的具体数字放在一起看更清楚:文本-音频从首层的 0.12 升到末层的 0.40,文本-视频理解从 0.03 升到 0.38,文本-图像理解从 0.03 升到 0.29——这就是「深层协作增强」的量化形态。反向的例子是图像理解-视频理解,首层 0.98(几乎完全共享一批专家)、中间层 0.52、末层 0.64,说明这两类任务在浅层几乎不分家,越往深越分化。而文本与图像生成、视频生成的重叠在末层反而降到 0.09 和 0.08,是全表最低的一对。
负载均衡视角。图 10 报告了跨层、跨模态的专家路由归一化熵(NE),定义为 $\mathrm{NE} = \frac{-\sum_{i=1}^{N} p_i \log(p_i)}{\log N}$,它提供了一个专家负载均衡的定量度量。这里 $N$ 是专家数,$p_i$ 是被路由到第 $i$ 个专家的 token 比例。$\mathrm{NE}$ 的取值落在 $[0,1]$,值越大对应专家利用越均匀。
从逐层视角看,文本模态在几乎所有层上都保持持续高且稳定的归一化熵,只在最后一层观察到轻微下降。值得注意的是,首层并未表现出严重的不均衡,这与「MoE 早期层需要 dense 设计来维持路由稳定」这一常见假设21相矛盾。
对视觉理解,专家利用在最低层和最高层变得不太均衡,而中间层维持相对均匀的路由,说明视觉感知在中间的特征抽象阶段受益于均衡的专家共享。相比之下,视觉生成和音频类任务呈现出不同的趋势:首层表现出中等程度的均衡,随后在较低层熵下降,在中低层部分恢复,在较高层则波动式下滑。这一模式表明,对生成类和音频类任务,专家的特化与再整合沿深度交替出现。
综合这些分析,ERNIE 5.0 中跨层、跨模态、跨任务的专家利用模式是清晰的。尽管路由机制在训练时是模态无关的,跨模态的显著专家特化仍然涌现出来,这说明 router 能够捕捉模态结构并以自驱动的方式分配专家容量。从系统视角看,统一路由机制简化了整体设计,避免了跨模态的手工专家划分。除了实证观察,这些路由行为与负载均衡特性也为未来的模型设计提供了实用指引。例如,层感知的专家分配、自适应均衡策略以及模态共享的专家配置,都有潜力成为构建下一代原生多模态架构的有效原则。
| 训练配置 | 推理配置(层数) | 验证损失 |
|---|---|---|
| Baseline(Layers=16) | Layers=16 | 1.945 |
| 弹性深度(Layers $\in[1,16]$) | Layers=16 | 1.941 |
| 弹性深度(Layers $\in[1,16]$) | Layers=12 | 2.137 |
表 9:小规模 MoE 模型在弹性深度训练与推理配置下的验证损失。弹性深度略微提升了全深度性能,并产出退化可预测的降深度子网络,无需重训就能灵活部署。
| 训练配置 | 推理配置(专家数) | 验证损失 |
|---|---|---|
| Baseline(Experts=64) | Experts=64 | 1.957 |
| 弹性宽度(Experts $\in\{64,32\}$) | Experts=64 | 1.964 |
| 弹性宽度(Experts $\in\{64,32\}$) | Experts=32 | 2.218 |
表 10:小规模 MoE 模型在弹性宽度配置下的验证损失。弹性宽度在满容量下只带来轻微退化,而降宽度的模型仍然可用,支持在受限参数预算下部署。
| 训练配置 | 推理配置(MoE 路由 Top-$k$) | 验证损失 |
|---|---|---|
| Baseline(Top-$k=8$) | Top-$k=8$ | 1.945 |
| 弹性稀疏度(Top-$k\in[1,8]$) | Top-$k=8$ | 1.969 |
| 弹性稀疏度(Top-$k\in[1,8]$) | Top-$k=4$ | 1.971 |
| 弹性稀疏度(Top-$k\in[1,8]$) | Top-$k=2$ | 2.003 |
| 弹性稀疏度(Top-$k\in[1,8]$) | Top-$k=1$ | 2.175 |
表 11:小规模 MoE 模型在不同路由稀疏度下的验证损失。弹性稀疏度让模型在各种路由预算下都能稳定推理,激进稀疏化下性能优雅退化。
| 模型 | AVG. | ZebraLogic | LiveCodeBench v6 | TAU2 | MMMU | MathVista | VisualPuzzle | SimpleVQA |
|---|---|---|---|---|---|---|---|---|
| ERNIE 5.0-Exp | 75.55 | 95.00 | 73.35 | 79.35 | 74.11 | 83.70 | 59.93 | 63.40 |
| ERNIE 5.0-Exp-ES 25.0% | 74.43 | 94.10 | 70.70 | 77.34 | 73.78 | 84.90 | 57.98 | 62.19 |
| ERNIE 5.0-Exp-EA 35.8% | 75.17 | 95.20 | 70.93 | 77.23 | 75.11 | 84.50 | 60.39 | 62.86 |
表 12:完整 ERNIE 5.0-Exp 与它在降低路由稀疏度(ERNIE 5.0-Exp-ES)以及全部弹性配置(ERNIE 5.0-Exp-EA)下的弹性变体之间的性能对比。弹性稀疏度在提升解码效率的同时保持了相当的精度,而全弹性模型尽管激活计算与参数用量大幅减少,仍取得有竞争力的表现。
6.4.2 弹性训练
弹性训练在让 ERNIE 5.0 适应不同计算、内存与时延约束这件事上起核心作用。本节我们通过在小规模 MoE 模型上的受控消融研究来分析弹性训练策略,并报告在 ERNIE 5.0 上的关键发现。除非另有说明,所有弹性配置都来自同一个预训练 checkpoint。
受控规模实验。我们用一个 64 专家、454M 激活参数、3.2B 总参数的小规模 MoE 模型做消融研究。模型在 250B token 上训练,默认路由配置为 top-$k=8$。全程报告留出数据上的验证损失。基于这一实验设定,我们分别沿三个维度分析弹性。
- 弹性深度。我们首先通过在训练时改变活跃 transformer 层数来研究弹性深度。与 ERNIE 5.0 的配置一致,80% 的训练样本保留全深度模型,其余 20% 用降深度子网络。如表 9 所示,弹性深度略微提升了全深度性能,说明偶尔的丢层带来了正则化效应。而且降深度子网络表现出平滑可预测的性能退化,说明中间表示在层被移除时仍然稳健。总体而言,弹性深度提供了一种低风险、高性价比的机制,从单个预训练 checkpoint 派生出多个可部署的子模型。
- 弹性宽度。接着我们评估 MoE 宽度上的弹性。训练时 80% 的样本保留全部 64 个专家,其余 20% 的样本配置 32 个专家。表 10 显示弹性宽度在满容量下只引入轻微退化。降宽度配置虽然会让较大模型出现轻微的性能波动,但它们无需重训就能保持可用,从而支持在严格内存约束下部署。
- 弹性稀疏度。我们还通过在推理时改变路由 top-$k$ 来分析弹性稀疏度。训练时大多数实例采用默认配置($k=8$),其余实例则用减少的激活专家数训练。如表 11 所示,弹性 top-$k$ 训练在全激活配置下带来适度的退化,同时让模型在大幅缩减的路由预算下仍能稳定有效地推理。
译注:这里的「与 ERNIE 5.0 的配置一致,80% / 20%」与 §3.3「弹性深度」小节写的「全模型以 75% 的概率训练,降低深度的子网络以 25% 的概率激活」对不上。原文两处都没有交代哪个是 ERNIE 5.0 正式采用的比例;宽度和稀疏度两个维度在两处则都是 80/20,一致。
扩展到 ERNIE 5.0。在受控规模实验之外,我们进一步在预训练的实验模型 ERNIE 5.0-Exp-Base 及其后训练模型 ERNIE 5.0-Exp 上评估弹性训练的有效性。从 ERNIE 5.0-Exp 出发,我们先通过在推理时把路由 top-$k$ 降到 25% 来分析弹性稀疏度。如表 12 所总结,ERNIE 5.0-Exp-ES 25.0% 在广泛的文本与视觉 benchmark 上保持了相当的性能。由此产生的精度下降仍然很小,而路由稀疏度的降低带来可观的效率收益,解码速度提升超过 15%。此外,我们沿深度、宽度、稀疏度联合启用弹性,从 ERNIE 5.0-Exp-Base 派生出一个紧凑的预训练模型,它只用 53.7% 的激活参数和 35.8% 的总参数。用相同的数据与训练策略做中期训练和后训练,我们得到后训练模型 ERNIE 5.0-Exp-EA 35.8%。尽管计算足迹大幅缩减,这个弹性变体在各 benchmark 上仍取得有竞争力的表现,平均分为 $75.17$,而完整 ERNIE 5.0-Exp 为 $75.55$。而且它在 ZebraLogic、VisualPuzzle 这类有挑战性的推理与感知任务上展现出很强的鲁棒性,说明弹性训练有效缓解了通常伴随激进计算与参数缩减而来的性能退化。
总体而言,这些结果凸显出弹性不只是一种事后压缩技术,而是一种有原则的训练范式。通过在预训练期间联合优化深度、宽度和稀疏度,弹性模型学会了跨层、跨模态地重新分配表示容量,带来了有利的性能-效率权衡。
7 结论
我们提出 ERNIE 5.0,一个原生统一的基础模型,它用一个共享的 next-group-of-tokens prediction 目标整合了文本、图像、视频、音频的多模态理解与生成。据我们所知,ERNIE 5.0 是在统一的万亿级自回归框架内实现多模态理解与生成的首例。带模态无关专家路由的超稀疏 mixture-of-experts 架构,让可扩展的跨模态建模无需依赖模态专用设计。我们探索了一种新的弹性训练范式,它在单个预训练模型内支持灵活的部署配置,并被证明能同时保住训练效率与性能。我们还解决了大规模多模态模型强化学习中的关键挑战,确保了后训练的稳定与高效。大量实验表明模型在各模态上都有有竞争力且均衡的表现。总体来看,这些结果表明自回归统一多模态与弹性预训练,为下一代基础模型提供了一条可扩展的路径。
-
ERNIE 5.0 Technical Report,arXiv:2602.04705。 ↩︎
-
ERNIE 4.5,原文标注
ernie45tech。技术报告与模型见 https://github.com/PaddlePaddle/ERNIE。 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ -
Gemini,原文标注
gemini2.5、gemini3.0。前者为 Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities,arXiv:2507.06261;后者即 Gemini 3 系列,§6.2 中的 Nano-Banana Pro 也标注这一条。 ↩︎ ↩︎ -
GPT,原文标注
gpt4o、gpt5。前者为 GPT-4o System Card,arXiv:2410.21276;§6.2 中的 GPT-Image 标注的是gpt4o这一条。 ↩︎ ↩︎ -
Claude,原文标注
claude。 ↩︎ -
DeepSeek,原文标注
deepseekv3、deepseekv3.2。前者为 DeepSeek-V3 Technical Report,arXiv:2412.19437。 ↩︎ -
Qwen,原文标注
qwen3、qwen3-vl。前者为 Qwen3 Technical Report,arXiv:2505.09388。 ↩︎ -
late-fusion 的代表工作,原文标注
qwen3-omni、seedream4。前者为 Qwen3-Omni Technical Report,arXiv:2509.17765;后者即 Seedream 4.0,§6.2 的图像生成对比中也标注这一条。 ↩︎ ↩︎ -
FlashMask: Efficient and Rich Mask Extension of FlashAttention,arXiv:2410.01359。 ↩︎ ↩︎ ↩︎
-
Multi-Token Prediction,原文标注
gloeckle2024better、deepseekv3。前者为 Better & Faster Large Language Models via Multi-token Prediction,arXiv:2404.19737。 ↩︎ -
原文标注
ji2026videoar,ERNIE 5.0 的 NFSP、窗口化时序注意力与历史帧随机掩码都出自这项工作。arXiv 的 HTML 渲染未生成参考文献列表,无法给出完整条目。 ↩︎ ↩︎ ↩︎ -
Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts,arXiv:2408.15664。 ↩︎ ↩︎
-
原文标注
stylegan,即 A Style-Based Generator Architecture for Generative Adversarial Networks,arXiv:1812.04948。 ↩︎ -
Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis,arXiv:2412.04431。 ↩︎
-
原文标注
unitok2025,即 UniTok: A Unified Tokenizer for Visual Generation and Understanding,arXiv:2502.20321。 ↩︎ -
神经音频 codec,原文标注
kumar2023high、zhang2024speechtokenizer。前者为 High-Fidelity Audio Compression with Improved RVQGAN,arXiv:2306.06546;后者为 SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models,arXiv:2308.16692。 ↩︎ -
Whisper,即 Robust Speech Recognition via Large-Scale Weak Supervision,arXiv:2212.04356。 ↩︎
-
原文标注
chen2024spark,即 Spark-TTS,Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens,arXiv:2503.01710。 ↩︎ -
BPE-Dropout: Simple and Effective Subword Regularization,arXiv:1910.13267。 ↩︎
-
WSD 学习率调度出自 MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies,arXiv:2404.06395。 ↩︎
-
DeepSeek-V3 Technical Report,arXiv:2412.19437。MTP 损失权重的设置与 §6.4.1 中「MoE 早期层需要 dense 设计」的假设都指向这一条。 ↩︎ ↩︎
-
剪枝,原文标注
sajjad2023effect、xia2023sheared、men2025shortgpt。 ↩︎ -
知识蒸馏,原文标注
gu2023minillm、xu2024survey。前者为 MiniLLM: On-Policy Distillation of Large Language Models,arXiv:2306.08543。 ↩︎ -
基于融合的高效变体,原文标注
wang2023learning、chen2024lemon、chen2024dha。 ↩︎ -
Once-For-All 路线,原文标注
devvrit2023matformer、cai2024flextron、gu2025elastic。前两者分别为 MatFormer: Nested Transformer for Elastic Inference(arXiv:2310.07707)和 Flextron: Many-in-One Flexible Large Language Model(arXiv:2406.10260)。 ↩︎ -
原文标注
chen2024mixture,探索表示维度(hidden size)上的弹性。 ↩︎ -
APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-tail Generation,arXiv:2509.18521。 ↩︎
-
原文标注
cui2025entropy、wang2025beyond。前者为 The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models,arXiv:2505.22617。 ↩︎ -
IcePop 出自 Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model,arXiv:2510.18855。 ↩︎
-
GRPO,原文标注
deepseekr1,即 DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning,arXiv:2501.12948。 ↩︎ ↩︎ -
Group Sequence Policy Optimization,arXiv:2507.18071。 ↩︎
-
原文标注
yue2025does、liu2025prorl、zhao2025echo。前两者分别为 Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?(arXiv:2504.13837)和 ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models(arXiv:2505.24864)。 ↩︎ -
DAPO: An Open-Source LLM Reinforcement Learning System at Scale,arXiv:2503.14476。 ↩︎
-
飞桨 PaddlePaddle,https://github.com/PaddlePaddle/Paddle。 ↩︎
-
Flex Attention: A Programming Model for Generating Optimized Attention Kernels,arXiv:2412.05496。 ↩︎ ↩︎
-
Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism,arXiv:1909.08053。 ↩︎
-
GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism,arXiv:1811.06965。 ↩︎
-
GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding,arXiv:2006.16668。 ↩︎
-
ZeRO: Memory Optimizations Toward Training Trillion Parameter Models,arXiv:1910.02054。 ↩︎
-
Ring Attention with Blockwise Transformers for Near-Infinite Context,arXiv:2310.01889。 ↩︎ ↩︎
-
Rollout Router Replay 出自 Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers,arXiv:2510.11370。 ↩︎
-
这是原文的脚注:对代码相关任务,评测用 LiveCodeBench(LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code,arXiv:2403.07974)和 SandboxFusion(https://github.com/bytedance/SandboxFusion)进行,以确保评估可靠且基于实际执行。 ↩︎
-
Qwen-Image Technical Report,arXiv:2508.02324。 ↩︎
-
Veo 3,原文标注
veo3。 ↩︎ -
HunyuanVideo: A Systematic Framework For Large Video Generative Models,arXiv:2412.03603。 ↩︎
-
Wan: Open and Advanced Large-Scale Video Generative Models,arXiv:2503.20314。 ↩︎
Author houmin
Publish July 30, 2026
LastMod July 31, 2026
License 本作品采用 CC BY-NC-ND 4.0 许可协议进行许可,转载时请注明原文链接
如果你在浏览博客的过程中发现了任何问题,欢迎在对应文章下评论。如果你有其他事情想要咨询,可以通过邮件联系我。