本文译自美团 LongCat 团队的 LongCat-Next: Lexicalizing Modalities as Discrete Tokens1,2026 年 3 月 29 日提交于 arXiv,43 页 25 图 9 表。这里是全文翻译,覆盖摘要、§1 引言、§2 方法、§3 主实验、§4 实现细节、§5 基础设施、§6 优势与未来工作、§7 结论,以及附录 §9.1–§9.6。§8 贡献者名单与致谢、参考文献列表不在译文范围内。

模型与 tokenizer 已开源在 GitHub2 和 Hugging Face3

摘要

主流的 Next-Token Prediction(NTP)范式通过离散自回归建模驱动了大语言模型的成功。然而当代多模态系统仍然是语言中心的,往往把非语言模态当作外挂附件,导致架构割裂、整合不充分。为超越这一限制,我们提出 Discrete Native Autoregressive(DiNA,离散原生自回归),一个把多模态信息统一表示在共享离散空间里的框架,使得跨模态的自回归建模保持一致且有原则。其中的关键创新是 Discrete Native Any-resolution Visual Transformer(dNaViT),它能在任意分辨率下做 tokenization 与 de-tokenization,把连续视觉信号转换成层级化的离散 token。在此基础上,我们开发了 LongCat-Next——一个原生多模态模型,它在单一自回归目标下处理文本、视觉和音频,模态专用设计降到最低。作为一个工业级基础模型,它在同一个框架内同时擅长「看」「画」「说」,在广泛的多模态 benchmark 上取得了强劲表现。特别地,LongCat-Next 解决了离散视觉建模在理解任务上长期存在的性能天花板,并为调和理解与生成之间的冲突提供了一条统一路径。大量实验表明,离散 token 能够普遍地表示多模态信号,并被深度内化进单一 embedding 空间,为这套统一训练范式提供了有意思的洞察。作为迈向原生多模态的一次尝试,我们开源 LongCat-Next 及其 tokenizer,希望能促进社区的进一步研究与发展。

图 1:LongCat-Next 的 benchmark 表现
图 1:LongCat-Next 的 benchmark 表现

1 引言

大语言模型(LLM)已经收敛到 Next Token Prediction(NTP)范式456789,智能从大规模离散自回归建模中涌现1011。然而语言只捕捉到真实世界丰富感知信息中有限的一部分,而现实世界本质上横跨多个模态,例如文本、视觉和音频。尽管如此,大多数主流多模态系统仍然把非语言模态当作从属的、外挂的组件,与语言建模松散耦合1213。这种分离意味着一份尚未被开发的潜力:从当下的「语言 + 辅助」范式,走向原生多模态建模。

当多模态被概念化为语言的一种原生语言学扩展时,问题会大幅简化:所有模态都被表示成可互操作的 token 序列,受一个共享的自回归目标支配。尽管概念上有这些优势,这个领域仍然缺少一份能在大规模上实现真正统一多模态模型的工业级训练配方。核心问题在于:非语言模态该如何有效地表示在离散 token 空间里?本质上,把所有模态 tokenize 成一个通用接口,正是 多模态建模的核心所在1415

由于语言天然通过语音表达,离散自回归建模在音频领域已经取得了显著进展161718,其中离散音频 token 不仅捕捉与文本对齐的语义,也捕捉情绪、语气、环境上下文等丰富的副语言信息。然而把离散自回归建模扩展到视觉,概念上直白、实践中却远非平凡。与天然紧凑、离散的词不同,视觉信号是高维且连续的。人们普遍怀疑离散视觉建模能否在理解与自回归生成两方面都取得强表现——毕竟把丰富的视觉信息压进一个有限码本,不可避免地会限制表示容量。

为应对这一挑战,我们指出离散视觉建模存在一个根本性的双重瓶颈:(i)视觉表示的容量,(ii)离散化带来的信息损失。对前者,我们强调实现语义完备性的重要性,并指出语义对齐编码器(Semantic-and-Aligned Encoders, SAE)这一类模型是很强的基础。有意思的是,我们发现即便没有重建监督,编码器的残差架构本身就为低层信号的传播保留了一条隐式通路。对离散化的信息瓶颈,我们利用视觉信号的层级性质,通过残差向量量化(Residual Vector Quantization, RVQ)19去建模「残差的残差」,有效地为理解与生成两端都保住了信息。

基于这些洞察,我们提出 Discrete Native Resolution Vision Transformer(dNaViT),一个被设计成与语言 tokenizer 功能类似的统一视觉 tokenizer。通过精心设计的训练流程,dNaViT 可以执行成对的 tokenization 与 de-tokenization:把图像编码成具备语义完备性、可供理解使用的离散 ID,同时又能把 token 序列解码回图像用于重建与生成,两个方向都支持任意分辨率,压缩比高达 28×。通过把多层级残差 token 当作一种共享的表示「货币」,dNaViT 首先实现了图像与离散 ID 之间的双向映射。在自回归建模阶段,我们对多层 token 采用加性编码,并用一个 DepthTransformer 做高效解码,从而为多层级 token 解锁了指数级的表示空间,同时维持单个自回归步的计算效率。这一设计让视觉得以像语言一样被离散化进统一 token 空间,在表示保真度与压缩率之间取得了最优平衡。

同样的设计原则在音频建模上也成立:我们采用基于 RVQ 的架构做离散表示。音频 tokenizer 用一个 Whisper 编码器20同时捕捉语义与副语言特征,把波形压缩成 12.5 Hz 的离散 token。音频 de-tokenizer 用一个配对的解码器和一个基于 flow matching 的精修网络实现高保真重建。对音频的自回归建模,我们进一步引入一套统一训练范式,用随机延迟把段级的文本 token 与音频 token 对齐,从而同时支持并行与串行的文本引导语音生成。这一做法提升了语音生成的语言学质量,也便于在多样交互场景之间无缝切换。

图 2:LongCat-Next 架构总览。它在 Discrete Native Autoregression(DiNA)范式下设计,通过成对的 tokenizer 把多模态扩展成一个原生的、语言风格的建模框架
图 2:LongCat-Next 架构总览。它在 Discrete Native Autoregression(DiNA)范式下设计,通过成对的 tokenizer 把多模态扩展成一个原生的、语言风格的建模框架

这项工作关注原生多模态的根本挑战,其设计哲学以简洁性为先,把视觉和音频当作语言的内在扩展。基于 Mixture-of-Experts(MoE) 主干721,我们把这一基础实例化为 LongCat-Next,一个把语言、视觉、音频统一在单一内聚框架里的离散原生多模态模型,在多样的多模态领域交付工业级性能与有竞争力的结果。本工作的主要贡献如下:

  • 离散原生自回归范式(DiNA)。我们提出 DiNA,一个通过把所有模态表示在共享离散 token 空间里、从而把 next-token prediction 从语言扩展到原生多模态的统一范式。通过把多样模态内化进这一统一接口,DiNA 让多模态建模与标准 decoder-only 架构对齐,使单个模型能在一致的自回归目标下处理文本、视觉和音频。在这一范式下,核心挑战被约化为设计模态专用的 tokenizer–detokenizer 对,模型则变成一个跨模态的统一多任务学习器。这一设计既保持了架构上的简洁,又能沿用大语言模型成熟的训练基础设施,提供了一个统一的多模态基础。

  • 离散原生分辨率视觉 Transformer(dNaViT)。我们提出 dNaViT,一个把视觉输入表示成离散「视觉词」的统一接口,以语义完备性为原则来突破离散视觉建模的能力天花板。具体而言,我们利用语义对齐编码器(SAE)来保证语义完备的表示,并把它与残差向量量化(RVQ)结合,构造出既保留高层语义、又保留细粒度细节的层级化离散 token。这一设计支持跨分辨率的动态 tokenization 与 de-tokenization,既支持任意分辨率的视觉理解,也支持任意分辨率的图像重建。此外,dNaViT 与现有大语言模型即插即用兼容,不会带来性能退化。

  • 在单一模型里同时擅长看、画、说。LongCat-Next 突破了离散视觉建模长期以来的瓶颈:在与专用视觉理解模型可比的性能之外,即便在 28× 压缩比下仍保持了强劲的任意分辨率生成质量。在 DiNA 之内,视觉理解与生成被重述为同一个预测过程的两个实例,差别只在于条件先验不同(例如生成文本时以图像 token 为条件,生成图像时以文本 token 为条件)。这一统一表述有效调和了传统上互相竞争的理解与生成目标,在实践中显著缓解了两者的建模冲突。这套统一离散建模框架同样赋予 LongCat-Next 先进的音频理解能力、低时延且准确的语音对话,以及可定制的音色克隆功能。

这套简洁架构的驱动力,来自一种把视觉与音频当作语言中心自回归范式内在扩展、而非外部附件的设计。这种原生整合催生了一种跨模态天然统一的表示:多模态信号被以类比语言 token 的方式内化,这与松散耦合的混合式做法形成对照(图 12)。

模型基于 LongCat-Flash-Lite21 实例化,规模为 A3B(总参数 68.5B),训练了超过 2T token。大量实验表明,LongCat-Next 不仅有效调和了传统上互相竞争的多模态目标,而且没有牺牲其基础语言能力。作为一个统一模型,LongCat-Next 在看、画、说三方面都很出色,突破了离散视觉建模的性能天花板。因此它超过了 Qwen3-Omni 这类现有统一框架,在视觉理解 benchmark 上超过 Qwen3VL-A3B 这类专用模型,在高保真图像生成(尤其是文字渲染)上与 Flux-dev 有一战之力。在语音相关 benchmark 上,LongCat-Next 分别超过了同等参数规模的全模态模型和语音专用模型,如 Gemini 3.1 Flash-Lite preview 与 MiMo-Audio。这些结果说明,原生离散范式不只是一个概念上的替代方案,而是一个可扩展的、工业级的基础——它或许能让我们离真正统一的通用多模态智能更近一步。

2 方法

虽然离散自回归范式已经为语言建模建立起成熟且可扩展的生态,但其他模态的做法仍然割裂、缺乏可比的系统级支持。从概念上说,如果把多模态视为统一离散框架内的一种语言学建模——把多样的多模态信号抽象进共享的离散 token 空间——这个框架会带来若干关键优势,尽管这个类比主要服务于概念目的。

具体而言,关键优势如下:(1)架构协同,多模态数据可以复用大语言模型(LLM)已有的优化与扩展基础设施,保证高效训练与部署;(2)理解与生成的统一,单一 NTP 目标把判别式理解与高保真生成合并起来,把二者当作同一底层预测逻辑的两个侧面;(3)无缝跨模态交互,视觉、语言、音频及其他模态之间的自然交互无需任务专用设计;(4)原生数据扩展与统一自监督,一个通用离散空间把多模态内容摊平成统一 token 序列,使 NTP 目标可以充当自监督机制,直接从大规模、未经整理的野生数据中学到结构与语义先验。

尽管概念上很有吸引力,这个领域仍然缺少一份能把这类统一系统扩展起来的工业级训练配方。要从概念演示走向可替代专用架构的生产级方案,这样的框架必须满足以下标准:

  • 性能持平乃至超越:框架必须在理解与生成两方面追平或超过专用模型的 SOTA 性能。如果存在实质性的性能差距、无法替代现有专用系统,那么通用范式就不实用。

  • 模态协同而非妥协:把模型扩展到覆盖多模态,不能降低其基础语言能力。额外模态应当引入互补信号、促成跨模态协同,而不是制造优化上的取舍。

  • 对基础设施友好的演进:架构应当对基础设施保持友好,以最小的模态专用归纳偏置实现从纯语言模型到原生多模态系统的平滑过渡,同时保持与现有大规模框架的兼容。

为满足上述标准,我们把整套方案完全建立在离散自回归基础之上。与主流的「语言 + 辅助」范式不同,我们不再需要把非语言信号当作连续的外部输入投影进语言模型,而是把优化目标本身统一为 next-token prediction,把视觉、音频、语言内化进单一共享的 token 表示。这种概念上的统一,把原生多模态的目标翻译成了一个统一的学习范式。

2.1 模型架构

为把这套离散建模方法实例化,系统建立在 LongCat-Flash 的 Mixture-of-Experts(MoE)主干之上721。如图 3 所示,我们采取一种结构性分解:部署模态专用的 tokenizer 与 detokenizer 对来负责原始信号与离散 ID 之间的转换。因此,decoder-only 主干保持模态无关,充当一个多任务学习器。这一设计让模型能在单一预测流水线里原生地执行语言、视觉理解与生成、音频理解与合成。本节介绍所提方法,深入分析与实现细节见 §3.2 和 §4。

译注:原文这里指向图 3,但图 3 是 dNaViT 的设计总览;给出整体架构分解的其实是图 2。原文照录。

2.2 视觉 tokenizer

俗话说,一图胜千言。一张图像承载着极宽的信息谱系,从高层语义结构一直到细粒度纹理与视觉细节。把高维视觉信号压进有限的离散码本,不可避免地引入信息损失,往往导致离散建模与连续表示之间出现性能差距。于是一种主流观点认为,视觉离散化施加了一个内禀的性能天花板。这一挑战还被另一件事加剧:为理解优化的表示与为生成优化的表示之间存在分歧,使得一个语义完备且统一的视觉接口很难实现。

为克服这一挑战,我们提出 Discrete Native Vision Transformer(dNaViT)。语言 tokenizer 为统一自回归建模提供了灵活、近乎无损的基础,dNaViT 效仿这一角色,充当同时服务于任意分辨率下视觉理解与生成的统一 tokenizer。我们从两个核心组件入手来解决离散建模的局限:视觉表示的容量,以及离散化的信息损失。接下来几节我们给出各自的解法,以确保离散空间具备在视觉理解与生成两端都出色所必需的语义完备性。

2.2.1 设计动机

语言建模的成功,根基在于通过 subword tokenization 实现的近乎无损的离散压缩:语言 tokenizer 编码语义内容,同时在离散空间里保留了足以忠实重建的结构。在这一基础上,Next-Token Prediction(NTP)范式通过直接在 token 序列上操作,把理解与生成统一进单一自回归框架。

图 3:离散原生分辨率视觉 Transformer(dNaViT)设计总览
图 3:离散原生分辨率视觉 Transformer(dNaViT)设计总览

与词不同,视觉信息本质上是稠密且连续的。开发一个可比的视觉 tokenizer,会受到视觉信号显著更高的信息密度的阻碍。为解决这一点,我们提出语义完备性原则:一个统一的离散表示必须从原始视觉信号中保留足够的信息,以同时支撑判别式理解与高保真生成。

语义完备性:具体而言,一个离散表示的语义完备性,指的是它在广泛的下游任务上作为原始视觉信号的近似无损代理的能力。形式化地,设 $I$ 表示从连续视觉流形 $\mathcal{M}$ 上采样的一张输入图像,$z=\{idx_{1},idx_{2},\dots,idx_{n}\}$ 表示由量化映射 $Q(\cdot)$ 产生的离散索引序列。若对任意与任务 $\mathcal{T}$ 相关的图像中心询问 $\mathcal{Q}$,以 $z$ 为条件的后验分布都近似于以原图 $I$ 为条件的后验分布,则称离散表示 $z$ 满足语义完备性:

$$ \mathcal{P}(A \mid z, \mathcal{Q}) \approx \mathcal{P}(A \mid I, \mathcal{Q}), \tag{1} $$

其中 $A$ 表示对应该询问的最优回答或潜在输出。这一等价关系蕴含两条基本性质:

  • 判别不变性:离散化过程应当保留原图的核心语义属性。从细粒度识别到语义推理的各类任务,离散表示 $z$ 都必须保留原始像素 $I$ 中的关键信息,确保量化过程不会降低下游判别性能。

  • 生成充分性:鉴于像素空间的高冗余,离散码 $z$ 应当捕捉忠实图像生成所需的本质视觉语义。特别地,de-tokenizer $D(\cdot)$ 应当能够重建图像的结构与纹理内容($I' \approx D(z)$)。更重要的是,$z$ 应当充当一个语义充分的描述子,为语言模型提供一份紧凑却保留信息的表示。

由于 tokenizer 通常在大规模自回归训练之前就已固定,它所诱导的表示容量就成了决定模型性能天花板的关键因素。现有做法大致分为三类:(i)低层重建式模型(如 VAE22、VQ-VAE23),在 EMU 系列1424、Chameleon15、LWM25、VILA-U26 等工作中已被成功放大,能达到出色的像素级保真度,但在高层概念推理上吃力;(ii)自监督语义编码器(如 DINOv227、SigLIP28),被广泛用于捕捉结构或对比特征29303132,以 Janus 系列3334为代表,但缺少生成式重建所需的显式语义 grounding;(iii)无编码器的原始像素 tokenization,由 EVE 系列3536和 NEO37 这类方法所倡导,简洁且可扩展,但受制于像素冗余。本节我们要强调另一类潜力巨大却在很大程度上未被充分探索的表示:语义对齐编码器(SAE)。它们能提供语义丰富、同时支撑视觉理解与生成的表示,为统一离散视觉建模打下了坚实基础。

2.2.2 语义对齐编码器(SAE)

我们认为语言对齐的语义编码器特别适合充当量化前的空间,因为它们在多样的图像中心任务上接受过大规模的语言 grounded 监督。这赋予表示两条关键性质:(i)语义丰富性,同时捕捉高层概念与细粒度视觉细节(例如文字细节);(ii)与语言模型的亲和性,使其能无缝整合进统一的离散 token 空间。形式化地,我们把 SAE 定义为一个映射 $\mathbf{z_{p}}=\mathcal{E}_{\text{sae}}(I)$,它把图像 $I$ 投影到量化前表示 $z_{p}$,并要求后者保留回答多样图像中心询问 $\mathcal{Q}$(如 captioning、OCR、QA、视觉推理)所需的信息,形式上即 $\mathcal{P}(A\mid\mathbf{z_{p}},\mathcal{Q})\approx\mathcal{P}(A\mid I,\mathcal{Q})$,其中 $A$ 表示 ground-truth 回答。为促成这一性质,SAE 用大规模多方面对齐目标训练:

$$ \mathcal{L}_{\text{SAE}} = \mathbb{E}_{(I,\mathcal{Q},A)} \left[ -\log P(A \mid \mathbf{z_p}, \mathcal{Q}) \right]. \tag{2} $$

实践中,语义完备性是通过大规模视觉-语言训练隐式施加的。这一过程可以拆成几个渐进阶段:(i)全局对齐,通过 CLIP 风格的对比学习建立粗粒度跨模态对应;(ii)细节学习,模型超越粗粒度对比对齐(如原版 SigLIP),转而通过多方面的语言条件监督(如多样的 QA)捕捉细粒度细节与微妙语义。

重要的是,这一视角让我们可以把现有的视觉-语言模型当作很强的 SAE 近似。QwenViT38、MoonViT39、AIMv240 这一类编码器都可以直接拿来当候选。这就免去了从零训练一个专门 SAE 的昂贵代价,同时仍然让离散化的 token 继承到丰富的语义结构,可用于统一多模态建模。

2.2.3 Tokenization

虽然 SAE 提供了一个语义完备的流形,后续的离散化仍然必须在有限的离散空间内保住这份信息密度。为了在连续特征与离散 token 之间架桥、又不承受单阶段量化典型的保真损失,我们采用残差向量量化(RVQ)19,把 SAE 特征 $\mathbf{z}$ 的量化分解为 $L$ 级级联码本。每一级 $l\in\{1,\dots,L\}$ 不做单步映射,而是递归地编码上一级的残差误差。这种层级化精修让量化能以显著更高的保真度逼近高维、语义丰富的 SAE 空间,确保产出的 token 对理解与生成都是充分的代理。

原生分辨率下的语义 tokenization。我们把 RVQ 应用在 SAE 产生的潜在表示上。这一设计带来两个关键优势:(i)语义结构化:由于被离散化的特征已经过大规模视觉-语言预训练精炼,产出的 token 天然与语言空间相关,有利于多模态自回归训练的收敛。(ii)原生分辨率:我们不依赖固定尺寸的瓶颈,而是在变长条件下直接操作编码器的原生分辨率潜在表示41。这让 tokenizer 能处理任意输入分辨率,同时与语言模型保持架构上的一致。SAE 输出 $\mathbf{z}$ 先经过一个可学习映射 $f_{\text{proj}}$ 投影,再经 $L$ 级级联码本量化:

$$ \mathbf{r}_0 = f_{\text{proj}}(\mathbf{z}), \quad \hat{\mathbf{q}}_l = \operatorname{VQ}(\mathbf{r}_{l-1}), \quad \mathbf{r}_l = \mathbf{r}_{l-1} - \hat{\mathbf{q}}_l, \quad \hat{\mathbf{z}} = \sum_{l=1}^{L} \hat{\mathbf{q}}_l, \tag{3} $$

图 4:所提 dNaViT 的 tokenizer 与 de-tokenizer 训练流水线。它通过 RVQ 把图像编码成离散 token,再通过一个 pixel decoder 在任意分辨率下把它们解码回图像空间
图 4:所提 dNaViT 的 tokenizer 与 de-tokenizer 训练流水线。它通过 RVQ 把图像编码成离散 token,再通过一个 pixel decoder 在任意分辨率下把它们解码回图像空间

其中 $\mathbf{r}_{0}=f_{\text{proj}}(\mathbf{z})$ 是投影后的潜在表示,$\hat{\mathbf{q}}_{l}=\text{VQ}(\mathbf{r}_{l-1})$ 是第 $l$ 级的量化特征,$\mathbf{r}_{l}=\mathbf{r}_{l-1}-\hat{\mathbf{q}}_{l}$ 表示残差误差,$\hat{\mathbf{z}}=\sum_{l=1}^{L}\hat{\mathbf{q}}_{l}$ 是最终的量化表示。

给定投影层输出的一批连续残差向量 $\{\mathbf{r}_{j}\}$,我们用指数滑动平均(EMA)2319而非梯度下降来更新码本条目。具体而言,对每个码本条目 $\mathbf{e}_{k}$,我们维护一个滑动的簇大小 $N_{k}\leftarrow\gamma N_{k}+(1-\gamma)|\mathcal{S}_{k}|$ 和一个 embedding 和 $\mathbf{m}_{k}\leftarrow\gamma\mathbf{m}_{k}+(1-\gamma)\sum_{j\in\mathcal{S}_{k}}\mathbf{r}_{j}$,其中 $\mathcal{S}_{k}=\{\mathbf{r}_{j}:\arg\min_{i}\|\mathbf{r}_{j}-\mathbf{e}_{i}\|=k\}$ 表示被分配给条目 $k$ 的残差向量集合,$\gamma$ 是衰减因子。码本条目随后按下式更新:

$$ \mathbf{e}_k \leftarrow \frac{\mathbf{m}_k}{N_k}. \tag{4} $$

我们对 $N_{k}$ 施加 Laplace 平滑以保证数值稳定,并从当前 batch 重新初始化不活跃的条目($N_{k}<1$)以维持码本利用率。为给 $f_{\text{proj}}$ 提供监督,我们引入一个轻量解码器,从量化后的 embedding 重建量化前的语义特征。整体量化目标定义为:

$$ \mathcal{L}_{\text{quant}} = \lambda_c \mathcal{L}_{\text{commit}} + \lambda_s \mathcal{L}_{\text{semantic}}, \tag{5} $$

其中 $\mathcal{L}_{\text{commit}}$ 是标准的 commitment loss,鼓励投影表示 $\mathbf{r}_{0}$ 靠近被分配的码本条目,在全部 $L$ 个残差级上取平均;$\mathcal{L}_{\text{semantic}}$ 是用特征余弦相似度算的语义重建损失。于是整条 tokenization 流水线由三个阶段组成:(1)通过 SAE 做语义对齐的特征提取,(2)用 EMA 更新码本的 RVQ 做层级化离散化,(3)语义 token 作为输入,供多模态理解与生成的自回归建模使用。

2.2.4 De-tokenization

tokenization 训练完成后,SAE 编码器与码本都被冻结。这一设计的动机在于:如果量化前的表示是语义完备的,那么产出的离散 token 本身就应当保留了足够的信息,无需进一步适配。具体而言,de-tokenizer 以一个 pixel decoder 为核心——它是一个 Vision Transformer42,被训练成仅从离散码 embedding 重建图像。pixel decoder 直接从量化表示中恢复空间布局、物体结构和可辨识的内容,产出结构上忠实的重建。我们用如下目标训练 pixel decoder:

$$ \mathcal{L}_{\text{dec}} = \lambda_1 \mathcal{L}_{\text{pixel}} + \lambda_2 \mathcal{L}_{\text{percep}} + \lambda_3 \mathcal{L}_{\text{align}}, \tag{6} $$

仅凭这些目标,pixel decoder 就已经能直接从离散 token 恢复连贯的空间布局、物体结构和语义内容,证明量化表示保留了足以忠实重建的信息。但重建出的图像往往过度平滑,高频细节与感知锐度都有所衰减。为略微提升视觉保真度,我们引入一个用 flow-matching 目标 $\mathcal{L}_{\text{flow}}$ 训练的轻量图像 refiner,它以 pixel decoder 的重建结果和离散码 embedding 为条件。重建结果充当结构锚点,约束精修过程,让模型专注于增强细粒度纹理而不引入明显伪影。

关于信息恢复的讨论

要实现语义完备性,统一表示 $\mathbf{z}_{\mathbf{p}}$ 不仅要支撑语义理解,还必须具备生成充分性,即恢复原始视觉信号的能力。此前的工作4344(如 RAE)把重建能力主要归因于语义丰富的潜在先验,我们则采取另一种视角,认为这种可恢复性也来自编码器内禀的架构性质。我们把这一性质称为内禀信息恢复(intrinsic information recovery)

图 5:不同冻结视觉编码器配一个轻量 pixel decoder 训练后的视觉重建结果。结果表明残差连接本身就为低层信号的传播保留了一条隐式通路
图 5:不同冻结视觉编码器配一个轻量 pixel decoder 训练后的视觉重建结果。结果表明残差连接本身就为低层信号的传播保留了一条隐式通路

经验上我们观察到,即便是随机初始化的 ViT-Base45 也展现出很强的重建能力,重建保真度还超过它的预训练版本(见 §3.2.2)。这说明有效的信息恢复不只是习得语义的结果,也与底层网络结构密切相关。这一现象可以通过现代视觉编码器的残差架构来理解:残差架构本身就为低层信号的传播保留了一条隐式通路,使得没有监督也能有效重建。形式化地,我们把编码器写成 $L$ 个残差块的序列。最终潜在表示 $\mathbf{z}_{p}$ 可以表示为初始投影与后续特征增量的加性累积:

$$ \mathbf{z}_p = \mathbf{x}_0 + \sum_{l=1}^{L} \mathcal{F}_l( \mathbf{x}_{l-1}) = \underbrace{\mathbf{x}_0 + \mathcal{F}_1(\mathbf{x}_0) + \dots + \mathcal{F}_L(\mathbf{x}_{L-1})}_{\textit{pixel-level} \xrightarrow{\hspace{2cm}} \textit{semantic-level}}, \quad \text{where} \quad \mathbf{x}_l = \underbrace{\mathbf{x}_{l-1} + \mathcal{F}_l(\mathbf{x}_{l-1})}_{\text{residual connection}}, \tag{7} $$

其中恒等映射 $\mathbf{x}_{l-1}$ 确保早期层的细粒度视觉信号不会被更高层的语义抽象覆盖掉。相反,它们会经由网络 $\mathcal{F}_{L}$ 传播、并逐步整合进 $\mathbf{z}_{p}$,得到一个与原图保持高互信息 $\mathcal{I}(I;\mathbf{z}_{p})$ 的表示。令人意外的是,这一分析表明现代编码器——哪怕是主要为语义对齐优化的编码器(如 SAE)——都天然保留了图像恢复所需的结构性要素,为离散化之前的语义完备性提供了结构基础。

2.2.5 dNaViT:离散原生分辨率视觉 Transformer

基于语义完备性原则与离散量化方法,我们提出 Discrete Native-Resolution Vision Transformer(dNaViT),一个被设计成在大语言模型中扮演类似语言 tokenizer 角色的视觉 tokenizer。dNaViT 的核心目标,是建立一个离散视觉接口,让图像完全通过语义有意义的 token 序列来表示、处理和生成。

与依赖固定分辨率输入的常规视觉编码器不同,dNaViT 直接在图像的原生分辨率上操作,避免了缩放、裁剪、padding 引入的信息损失与空间畸变。这一设计让模型能在任意图像尺度上忠实保留视觉细节。更重要的是,dNaViT 构造出一个层级化的、语义对齐的离散 token 体系,作为视觉内容的结构化代理。这些 token 超越了低层量化,跨多个语义层级编码信息,在统一的离散表示中同时保留全局结构与局部细节。

在这一层级表示之上,dNaViT 有效地诱导出一套类语言的视觉词表:图像被表达为离散符号序列,直接与自回归建模兼容。在这个符号空间内,图像理解与生成被统一进单一表述——captioning 与合成对应于在共享 token 表示上互为逆向的序列建模,使得单个自回归模型能同时处理视觉感知与生成。

原生视觉表示。dNaViT 提供了一个把图像映射到离散 token 序列的拓扑接口,为多模态建模提供统一的符号表示。在这个接口之外,语义内容并不固化在 tokenizer 里,而是被内化进语言模型的视觉 embedding 空间。具体而言,视觉码本 embedding 是随机初始化的,随后在共享的自回归目标下与语言 token 共同演化。通过这一联合优化过程,模型学到完全适配 LLM 内部表示空间的原生视觉表示。这一机制让模型为视觉发展出一门「母语」,把表示范式从外部定义的量化 ID 转变为习得的、模型内部的视觉语义,从而实现真正原生的多模态建模框架。

2.3 音频 tokenizer

我们设计了一个音频 tokenizer,把连续语音转换成离散 token,同时保留语义与声学信息。如图 6 所示,输入音频首先送进一个 Whisper 编码器20做音频特征提取。特征随后被 4 倍降采样,再由一个 8 层的残差向量量化器(RVQ)量化成离散 token。

图 6:音频 tokenizer 框架示意
图 6:音频 tokenizer 框架示意

产出的离散音频 token 会分两路前传。第一路送进一个冻结的预训练大语言模型(LLM)。通过在多样音频理解任务上的大量训练,这些 token 编码了下游任务所需的语义与声学信息,同时与 LLM 的文本 embedding 空间对齐。这些音频表示可以跨 LLM 架构和词表迁移。基于这一发现,我们在 tokenizer 训练阶段采用一个更小的 LLM——Qwen3-1.7B6——以提升效率,并在后续阶段把它丢弃。

第二路把音频 token 送进一个架构与编码器对称的解码器。它从输入 token 重建粗糙的 Mel 频谱。为进一步提升重建保真度,我们在解码器之后引入一个 flow-matching 模型46来精修粗糙的 Mel 频谱。精修后的 Mel 频谱再由一个 vocoder47 转换成音频波形。音频 tokenizer 的训练目标包括 Mel 频谱重建损失、RVQ commit 损失,以及用于音频理解的 LLM 损失:

$$ \mathcal{L}_{\text{audio}} = \lambda_1 \mathcal{L}_{\text{recon}} + \lambda_2 \mathcal{L}_{\text{commit}} + \lambda_3 \mathcal{L}_{\text{llm}}. \tag{8} $$

2.4 语言模型主干

在 DiNA 框架下,我们观察到配备模态无关 MoE 的语言主干本身就充当了一个跨模态的多任务学习器,能在无需模态专用设计的情况下动态地为多个目标分配容量。我们采用 LongCat-Flash-Lite A3B21 作为 decoder-only 主干,从零训练,总参数 68.5B,平均激活参数 3B(依上下文在 2.9B 到 4.5B 之间浮动),架构上沿用了 Zero-Expert 与 Shortcut MoE 的设计7。常规多模态整合做法往往引入模态专用分支3238(例如模态感知 MoE、3D RoPE 或双向注意力),我们的框架则强制一个统一的潜在空间:文本、视觉、声学的所有 token 都走同一条模态无关通路。进一步的分析与实证发现见 §3.2.5。

图 7:带内部语言引导的两种语音生成策略。用户的输入音频被当作纯音频模态,而 LongCat-Next(或者说 assistant)生成的输出被视为文本引导音频模态。为标示模态转换、便于段落对齐,我们引入三个特殊 token:AS(Audio Start)、AE(Audio End)、TE(Text End),分别表示一个音频段的开始与结束,以及一个文本段的结束
图 7:带内部语言引导的两种语音生成策略。用户的输入音频被当作纯音频模态,而 LongCat-Next(或者说 assistant)生成的输出被视为文本引导音频模态。为标示模态转换、便于段落对齐,我们引入三个特殊 token:AS(Audio Start)、AE(Audio End)、TE(Text End),分别表示一个音频段的开始与结束,以及一个文本段的结束

2.5 多模态组件

常规多模态做法把连续视觉特征投影进语言模型的 embedding 空间,我们不同:所有多模态 embedding 都是随机初始化的,与原生模型联合训练,确保视觉、音频、语言共享统一的 token 级表示范式。

2.5.1 端到端多模态 embedding

具体而言,视觉 embedding 使用一个尺寸为(8 × 16,384)的码本,多层级 token 通过多层级求和来做高效表示。这些 embedding 不跨层级共享,使每一级都能捕捉互补信息。音频组件遵循相同设计,但码本尺寸逐级递减;它的多层级 embedding 同样随机初始化、在训练中学习。重要的是,这些 embedding 是端到端学到的,以同时支撑多模态理解与生成。量化前的特征仅用于在残差向量量化(RVQ)过程中确定离散聚类分配,而不直接决定 embedding 的取值。

2.5.2 多模态 head

在这个架构里,原生模型负责学习语义级压缩,模态专用信号则通过模态感知 tokenizer 压紧。视觉与音频输入被编码成多层级离散 token,从而高效表示丰富的感知信息。训练时我们采用多层级监督方案:语言模型执行单步自回归预测,多层级 token 则并行解码以重建模态专用细节。具体而言,LLM head 是标准 MLP,多模态 token 则由一个任务感知的 DepthTransformer19 解码,它生成多层级输出以恢复结构化的视觉与音频信息。

2.5.3 内部语言引导

对近来的大型语音语言模型而言,语音交互能否继承与文本相同的语言能力是一个重要话题。沿用 Moshi16 的做法,我们通过把文本显式建模为语音生成过程的一部分,来提供内部语言引导。在我们的方法里,段级对齐的文本 token 与音频 token 先各自经专门的输入 embedding 层嵌入,再通过逐元素求和融合。我们把这种格式称为文本引导音频模态。相对地,在文本引导常常不可得的实时用户输入场景中,我们把这类实例定义为纯音频模态。如图 7 所示,在文本引导音频模态内,LongCat-Next 支持两种生成策略:(1)并行生成:模型在每一步同时生成文本和音频 token,但刻意把第一个音频 token 的生成延迟若干步,以保持与文本的对齐。图 7 展示的是延迟为 1 的情形。这一策略消除了响应时延,更适合全双工建模。(2)串行生成:模型先生成引导文本段,再生成对应的音频段。在这一策略下,模型每步只需预测单一模态的 token,简化了过程、避免了模态表示之间的冲突。因此这一做法能保证生成语音的高语言质量。

为统一这两种策略,我们为文本引导音频模态提出一套通用训练范式:对每个对齐的文本-音频段,延迟从 1 到该文本段长度之间随机选取。这一做法促使模型学到文本与音频表示之间稳健的语义对齐,使其能在任意延迟步数下生成文本引导的语音。因此串行生成与并行生成可以被视为这一统一框架下的两个极端情形。

3 主实验

我们的模型是一个能同时处理文本、视觉与语音的统一全模态系统。因此我们选择当前 SOTA 的全模态模型 Qwen3-Omni-A3B-Instruct 作为主要 baseline,把我们的模型放进全模态系统的竞争格局里定位。此外,为严格地单独评估模型的视觉理解能力,我们进一步纳入 Qwen3-VL-A3B——一个纯为视觉理解优化的专用视觉-语言模型——作为补充参照。在音频领域,我们还对比了 MiMo-Audio18、Kimi-Audio48、Step-Audio-2-mini49 等音频专用模型。我们在以下几个维度上做了全面评估:

3.1 主结果

3.1.1 视觉理解

STEM。

我们在一套多样的多模态推理 benchmark 上全面评估模型,以严格考察它在复杂逻辑下的推理能力。所评测的数据集涵盖多学科询问(MMMU50、MMMU-Pro51)和数学向任务(MathVista52、MathVision53)。在数学推理 benchmark 上,我们的模型表现优异,在 MathVista(83.1)和 MathVision(64.7)上取得所有对比模型中的最高分。值得注意的是,它在这些领域超过了 InternVL3.5-A3B-Flash 和 Qwen3-VL-A3B-Instruct 这类专家 MLLM。在综合性的多学科评测上,模型表现出有竞争力的水平:在 MMMU(70.6)和 MMMU-Pro(60.3)上都超过了 Qwen3-Omni-A3B-Instruct。

我们把评估扩展到 VisuLogic54 和 BabyVision55,二者是视觉中心推理的严苛试验台。虽然我们并未针对这些数据集专门优化,实证结果却出乎意料地强。在 VisuLogic 上,我们的模型以 29.4 分位居第一,超过 InternVL3.5-A3B-Flash(28.4)和 Gemini2.5-Flash-Lite(26.1)等 baseline。在 BabyVision 上,模型保持 14.4 的有竞争力分数,超过 InternVL3.5-A3B-Flash 和 Qwen3-Omni-A3B-Instruct,与 Gemini2.5-Flash-Lite(19.6)和 Qwen3-VL-A3B-Instruct(16.0)相比略有落后。这些意料之外的增益说明,模型在破解复杂视觉逻辑谜题上发展出了稳健的、涌现式的泛化能力。

OCR。 为全面评估模型在多种文档类型上的文档理解与信息抽取能力,我们在 OCRBench56、OCRBenchV257、DocVQA58、OmniDocBench59 上做了评测。OmniDocBench 是一个全面且有挑战性的 benchmark,涵盖学术论文、财务报表、行政表单等广泛的文档类型。如表 1 所示,LongCat-Next-A3B 在 $\text{OmniDocBench}_{\text{en}}$ 上取得 0.152、在 $\text{OmniDocBench}_{\text{zh}}$ 上取得 0.226,优于所列的其他 baseline,说明即便在高复杂度、文字密集的条件下,离散建模也不必牺牲细粒度的文字感知。在 OCRBench 上,我们的模型取得 865 分,超过 Qwen3-Omni-A3B-Instruct、GPT5-minimal、Gemini2.5-Flash-Lite 等 baseline。

译注:正文写的 OCRBench「865 分」与表 1 里的 86.5 是同一个数的两种刻度——OCRBench 满分 1000,86.5 是折算成百分制后的写法。表 1 里其余模型的 OCRBench 数值也都是百分制。

此外,为评估模型处理图表中结构化视觉信息的能力,我们额外在 ChartQA60、CharXiv61、InfoVQA62 上做了测试。如表 1 所示,我们的模型在 $\text{CharXiv}_{\text{RQ}}$ 和 ChartQA 上取得所有模型中的最好成绩,分别为 60.1 和 88.0。在 $\text{CharXiv}_{\text{DQ}}$ 上取得 89.9,优于其他 baseline,仅次于 Gemini2.5-Flash-Lite。

图 8:LongCat-Next 在任意分辨率下的理解与生成案例
图 8:LongCat-Next 在任意分辨率下的理解与生成案例

通用领域。

我们在 MMBench63、RealWorldQA64、MMStar65 等多个主流 benchmark 上做了全面评估,以系统地衡量通用 VQA 能力。在通用领域评测上,我们提出的模型表现相当有竞争力。在 MMStar 上,模型取得 69.3,超过 Qwen3-Omni-A3B-Instruct(68.5)和 GPT5-minimal(65.2)等 baseline。值得注意的是,它维持了与 Qwen3-VL-A3B-Instruct(72.1)等专家 多模态大语言模型(MLLM)相当接近的水平。同样地,在 RealWorldQA(72.0)上模型给出稳健结果,成功超过 Gemini2.5-Flash-Lite(70.5)。在 CountBench 上,模型取得 82.5 的不错成绩,与 Qwen3-Omni-A3B-Instruct(83.8)相当,尽管在这一项上略落后于 Gemini2.5-Flash-Lite(90.0)等最好的模型。

译注:正文说 CountBench 是 82.5,表 1 里是 82.1。原文两处不一致,这里都照录。

图形用户界面(GUI)。

我们通过 OSWorld-G66、ScreenSpot-V267 这类 GUI grounding 任务,评估模型在多样数字环境中的 UI 感知能力。我们的模型表现相当有竞争力,与 Qwen3-Omni-A3B-Instruct 和 Qwen3-VL-A3B-Instruct 持平。这验证了我们的架构有效捕捉到复杂界面所需的视觉粒度。虽然当前的数据配比中高分辨率样本占比有限,把更高密度的建模优化上去仍是我们下一版的关键目标。

表 1:LongCat-Next 与顶尖模型在视觉 benchmark 上的对比。带 * 的数值来自公开报告。

基准 LongCat-Next Qwen3-Omni-A3B-Instruct GPT5-minimal Gemini2.5-Flash-Lite InternVL3.5-A3B-Flash(专家 MLLM) Qwen3-VL-A3B-Instruct(专家 MLLM)
STEM 与推理
MMMU-Pro 60.3 57.0* 62.7* 64.1 60.4*
MMMU$_{\text{val}}$ 70.6 69.1* 74.4* 74.9 75.6* 74.2*
MathVista$_{\text{mini}}$ 83.1 75.9* 50.9* 78.2 80.9* 80.1*
MathVision 64.7 56.3* 45.8* 61.9 55.7* 60.2*
VisuLogic 29.4 20.0 26.1 28.4 23.0*
BabyVision 14.4 11.9 19.6 11.3 16.0
OCR、文档与图表
OmniDocBench$_{\text{en}}$ $\downarrow$ 0.152 0.289 0.174* 0.240 0.246 0.183*
OmniDocBench$_{\text{zh}}$ $\downarrow$ 0.226 0.406 0.389* 0.312 0.359 0.253*
CharXiv$_{\text{DQ}}$ 89.9 78.8 79.5* 91.2 81.8* 85.5*
CharXiv$_{\text{RQ}}$ 60.1 42.8 57.8* 60.0 48.0* 48.9*
ChartQA 88.0 86.8* 59.1* 79.0 87.4* 86.8*
InfoVQA$_{\text{test}}$ 83.3 84.4 69.9* 82.2 81.4* 81.8*
DocVQA$_{\text{test}}$ 94.2 94.1 89.6* 91.8 94.2* 95.0*
OCRBench 86.5 85.4* 78.7* 84.8 88.0* 90.3*
OCRBenchV2$_{\text{en}}$ 58.5 62.0 48.2* 51.5 47.0 63.2*
OCRBenchV2$_{\text{zh}}$ 59.3 60.5 37.7* 39.5 48.2 57.8*
Agent
OSWorld-G 58.3 60.3 42.4* 60.5*
ScreenSpot-V2 88.3 91.8 87.3* 87.7
通用
MMStar 69.3 68.5* 65.2* 74.93 72.0 72.1
RealWorldQA 72.0 72.9 77.3* 70.5 72.3 73.7
CountBench 82.1 83.8 87.8* 90.0 84.2 90.6

译注:原文表 1 的表头是两行,最后两列在「Specialist MLLMs」这个合并表头之下。markdown 表不支持合并单元格,这里把「专家 MLLM」并进各自的列名。

3.1.2 视觉生成

我们在一组多样的公开 benchmark 上评估模型的文生图(T2I)能力,覆盖组合推理、prompt 保真度、长文本理解、世界知识和文字渲染。评测集包括 GenEval68(组合对齐)、DPG-Bench69(prompt 遵循)、WISE70(世界知识与推理),以及 LongText-Bench71 / TIFF72 / CVTG-2K73(文字渲染)。Baseline 分为两组:(i)统一多模态模型,(ii)专用 T2I 模型。

表 2:与专用 T2I 模型的对比。尽管模型规模显著更小,我们的模型在多个 benchmark 上仍取得有竞争力的表现,展现出扎实的工业级生成能力。带 * 的数值来自公开报告。

模型 GenEval DPG LongText-EN LongText-ZH WISE TIFF CVTG
Emu-3.524 72.67 ${89.42}^{*}$ ${97.60}^{*}$ ${92.80}^{*}$ 57.64 ${89.48/88.18}^{*}$ ${91.23}^{*}$
Qwen-Image 250713 ${87.00}^{*}$ ${88.32}^{*}$ ${94.30}^{*}$ ${94.60}^{*}$ ${63.00}^{*}$ ${86.10}^{*}$ / ${86.80}^{*}$ ${82.88}^{*}$
Gemini 2.5 Flash Image5 79.67 85.82 86.04 - 76.27 90.53 / 90.80 ${73.64}^{*}$
FLUX.1-dev74 ${66.00}^{*}$ ${84.00}^{*}$ ${60.70}^{*}$ ${0.50}^{*}$ ${50.00}^{*}$ ${71.10/71.80}^{*}$ ${49.65}^{*}$
Seeddream 3.075 - ${94.31}^{*}$ ${89.60}^{*}$ ${87.80}^{*}$ - ${86.02/84.31}^{*}$ ${59.24}^{*}$
LongCat-Next 84.44 84.66 93.15 89.08 57.00 82.85 / 84.38 76.36
结果分析。

(1)相对统一多模态模型的明显优势。我们的模型在多数 benchmark 上超过了此前的统一方案,为统一架构内的生成能力确立了新的水位。增益在长文本理解与文字渲染(LongText、TIFF、CVTG-2K)上尤其显著,我们的模型相对现有方法有清晰的优势。我们把这一改进归因于统一架构:它把语言理解与图像生成紧密整合起来。通过在合成之前实现更强的语义规划,模型在多物体组合、文字渲染这类复杂场景中更好地保住了文本意图,而此前的统一模型在这些场景中往往吃力。(2)与专用 T2I 模型可比的性能。尽管是统一模型,我们的做法相对专用 T2I 系统仍取得有竞争力的表现。值得注意的是,它在 GenEval 和 LongText-Bench 上追平甚至超过更大的模型,在文字渲染 benchmark 上也保持竞争力。这说明强生成能力不必依赖专门的任务特化架构,而且把理解与生成整合起来能带来超出纯粹规模扩展的互补收益。总的来说,我们的结果表明,当配备更强的语言引导生成机制时,统一多模态模型可以突破此前在生成质量上的限制。这在能力、效率与部署实用性之间达成了一个理想的平衡。

表 3:与统一多模态模型的对比。我们在理解与生成两类 benchmark 上做了评测。我们的模型(LongCat-Next)在多数生成 benchmark 上持续超过此前的统一方案,同时保持相当有竞争力的理解能力,为统一的生成-理解模型确立了新的 SOTA。所有结果均来自公开报告。

模型 MMMU(理解) MathVista(理解) OCRBench(理解) DocVQA(理解) MMStar(理解) GenEval(生成) DPG(生成) LT-EN/ZH(生成) WISE(生成) TIFF(生成) CVTG(生成)
Janus-Pro34 41.0 80 84.19 1.90 / 0.60 35 65.50 / 68.80
Show-o276 48.9 56.6 76 86.14 – / – 65.80 / 65.00
OneCAT77 41.9 61.7 91.2 90 84.53 – / –
Mogao78 44.2 89 84.33 – / –
BAGEL32 55.3 73.1 80.9 92.2 69.3 82 85.07 43.70 4.70 / 49 71.50 / 71.70 35.60
NEO-unify79 68.9 81.5 91.6 65.5 85 86.71 91.40 / 75.50 42
Ovis-U180 51.1 69.4 88.3 89 83.72 3.00 / 5.10 42 66.70 / 68.20 9.30
Lumina81 58.6 88 86.04 43.70 / 4.70 40 74.70 / 72.00 59.00
OmniGen282 53.1 80 83.57 56.10 / 5.90
UniWorld-V183 58.6 80 81.38 – / – 55
X-Omni71 70.4 83 87.65 90.00 / 81.40
InternVL-U84 54.7 83.9 85 85.18 73.80 / 86.00 46 74.90 / 73.90 62.30
BLIP3-o85 50.6 84 81.60 – / – 62
LongCat-Next 70.6 83.1 86.5 94.2 69.3 84 84.66 93.15 / 89.08 57 82.85 / 84.38 76.36

译注:两处需要说明。其一,原文表 3 的表头也是两行(前 5 列在「Understanding」下、后 6 列在「Generation」下),这里把归属并进列名。其二,BAGEL 那一行在原始 tex 里就是错位的:LT-EN/ZH 格只有一个 43.70WISE 格却是 4.70 / 49。按其他行的格式,它应该是 LT-EN/ZH = 43.70 / 4.70、WISE = 49。这里保持原文的错位不改,只在此说明。

3.1.3 音频

我们对 LongCat-Next 的音频能力做了全面评估,覆盖自动语音识别(ASR)、语音合成(TTS)、音频理解和语音到文本对话。ASR 与 TTS 是评估语音理解与生成的基础任务。为评测 ASR 性能,我们使用 LibriSpeech86、AISHELL-187、AISHELL-288、FLEURS89、WenetSpeech90 等一系列 benchmark 数据集。TTS 方面则使用 SeedTTS91 的中文与英文版本以保证覆盖全面。ASR 与 TTS 任务我们都报告 WER 指标。除这些任务外,音频理解关注模型感知与推理输入音频中细粒度声学信息的能力,例如语音、环境声、音乐、说话人性别、年龄、口音等。因此我们采用 MMAU92(v05.15.25 test-mini)、VocalSound93、TUT201794、ClothoAQA95 作为这方面的标准 benchmark。此外,为衡量 LongCat-Next 在音频指令对话中的表现,我们用 OpenAudioBench17 作为评测 benchmark,考察模型在世界知识、数学能力和推理能力上的水平。为保证结果标准化、可复现,我们采用 Kimi-Audio-Evalkit96 发布的评测方法。音频问答这类任务我们使用 gpt-4o-2024-08-06 作为裁判模型。通过多方面的评测手段,我们对模型在多样音频任务上的表现给出了完整评估。

表 4:LongCat-Next 与顶尖模型在音频 benchmark 上的对比。带 * 的数值来自公开报告。

基准 LongCat-Next Gemini-3.1-Flash-Lite-preview Gemini-2.5-Flash-Lite-preview Qwen3-Omni-A3B-Instruct MiMo-Audio Kimi-Audio Step-Audio-2-mini
ASR
LibriSpeech$_{\text{test-clean}}$ $\downarrow$ 1.63 2.38 3.14 1.22* 2.47 1.28* 1.33*
LibriSpeech$_{\text{test-other}}$ $\downarrow$ 3.42 5.68 7.19 2.48* 6.13 2.42* 2.86*
AISHELL-1 $\downarrow$ 1.47 6.00 11.64 0.84* 1.69 0.60* 0.78*
AISHELL-2 $\downarrow$ 2.82 8.00 15.33 2.34* 3.02 2.56* 2.16*
Fleurs$_{\text{zh}}$ $\downarrow$ 3.24 3.88 7.77 2.20* 9.29 2.69* 2.53*
Fleurs$_{\text{en}}$ $\downarrow$ 5.24 5.96 6.84 2.72* 6.33 4.44* 3.05*
WenetSpeech$_{\text{test-meeting}}$ $\downarrow$ 8.19 20.37 23.04 5.89* 9.49 6.28* 4.87*
WenetSpeech$_{\text{test-net}}$ $\downarrow$ 5.98 16.15 24.83 4.69* 7.64 5.37* 4.82*
TTS
SeedTTS$_{\text{zh}}$ $\downarrow$ 1.90 - - 1.07* 1.96* 13.46 2.13*
SeedTTS$_{\text{en}}$ $\downarrow$ 1.89 - - 1.39* 5.37* 29.45 3.18*
音频理解
MMAU 76.40 71.70 74.80 78.20 75.80 70.31 71.30
ClothoAQA 73.45 60.53 63.27 75.16* 68.85 72.21* 68.39*
TUT2017 43.09 23.15 22.47 40.74* 15.06 65.25* 30.67*
VocalSound 85.91 69.81 57.67 91.59* 87.94 94.85* 87.58*
语音到文本对话
AlpacaEval 86.83 62.56 89.05 90.10 85.67 78.74 53.06
LlamaQuestions 79.67 82.67 83.33 82.33 75.00 79.33 69.70
ReasoningQA 87.52 65.64 74.06 87.62 75.34 68.61 63.86
TriviaQA 67.60 68.40 66.90 76.60 50.30 62.10 45.30
Webquestions 69.10 69.10 70.00 75.90 61.30 70.30 56.90

表 4 汇总了音频能力的评测结果,对比对象包括 Gemini-3.1-Flash-Lite-preview、Gemini-2.5-Flash-Lite-preview5、Qwen3-Omni-A3B-Instruct97、MiMo-Audio18、Kimi-Audio48、Step-Audio-2-mini49。LongCat-Next 展现出令人印象深刻的基础音频能力,在音频识别与合成两方面都很出色。值得注意的是,它在语音合成上的准确性超过了大多数对比模型。此外,LongCat-Next 在广泛的音频理解任务上取得了 SOTA 表现。这些发现说明 LongCat-Next 具备处理与理解通用及复杂声学信息的先进能力,远超传统语音识别系统。另外,LongCat-Next 在音频指令问答 benchmark 上也表现强劲,凸显了它广博的世界知识与先进的推理能力。

3.1.4 文本

表 5:LongCat-Next 与其他模型的对比。带 * 的数值来自公开报告。

基准 LongCat-Next Kimi-Linear-48B-A3B Qwen3-Next-80B-A3B-Instruct Qwen3-Omni-A3B-Instruct
Agentic 工具使用
Tau2-Airline(avg@8) 56.50 44.00 45.5* 27.00
Tau2-Retail(avg@8) 73.68 18.86 57.3* 40.80
Tau2-Telecom(avg@8) 62.06 15.68 13.2* 4.39
VitaBench(avg@4) 5.80 - 5.80 -
Agentic 编码
SWE-Bench(acc) 43.00 32.80 37.60 -
TerminalBench(acc) 18.75 20.00 15.19 -
通用领域
MMLU(acc) 83.95 79.91 89.28 87.10
MMLU-Pro(acc) 77.02 67.22 82.93 79.89
CEval(acc) 86.80 78.48 90.91 88.50
CMMLU(acc) 82.13 76.26 86.50 85.76

表 5 给出 LongCat-Next 在文本模态上的基础评测。为全面考察它的纯语言认知能力——这对支撑复杂跨模态推理至关重要——我们的评测框架围绕三个关键维度展开:agentic 工具使用、编码能力和通用领域知识。结果表明 LongCat-Next 建立了一个相当强的基线,在实际执行层面尤其出色。(1)Agentic 工作流与编码上的优势。我们通过 VitaBench98、一份降噪整理过的 $\tau^{2}$-Bench99、SWE-Bench100 和 TerminalBench101 来衡量模型的环境交互与复杂软件工程能力。LongCat-Next 在这些场景中展现出明显且压倒性的优势。在工具使用评测上,它在全部 $\tau^{2}$-Bench 子场景中都清晰领先,尤其在 Telecom 领域取得 62.06 的突出成绩,把 Qwen3-Omni-A3B-Instruct(4.39)和 Kimi-Linear-48B(15.68)远远甩开。这份能力延伸到编码:它在极具挑战性的 SWE-Bench 上取得 43.0 的准确率,显著超过 Kimi-Linear-48B 和 Qwen3-Next。这些结果凸显了它在动态环境导航、复杂工具依赖解析和真实代码库操作上的过人能力。(2)扎实的基础知识与推理。在执行能力之外,LongCat-Next 成功缓解了「多模态税」——即扩展非语言模态时文本能力常见的性能退化。我们在标准的百科与数学 benchmark 上考察广泛的多学科知识与推理,包括 MMLU102、MMLU-Pro103、C-Eval104、CMMLU105。LongCat-Next 持续超过 Kimi-Linear-48B,与多模态的 Qwen3-Omni-A3B-Instruct 高度接近。虽然严格为文本优化的 Qwen3-Next-80B-Instruct 在这些传统学术测试上自然设定了上界,LongCat-Next 仍维持了相当有韧性的认知基线,确保其多模态输出有深度逻辑推理作为支撑。

3.2 方法的实验分析

我们做了消融研究来分析方法的关键组件及其设计背后的动机。由于全尺寸实验的计算成本,部分研究在缩减设定下进行,语言主干换成 Qwen-7B。详细实验如下。

3.2.1 弥合离散与连续建模之间的理解差距

图 9(左):pre-align 阶段的损失对比
图 9(左):pre-align 阶段的损失对比

图 9(右):离散版与连续版的性能对比。

少量数据 放大数据
实验 ID I II III IV V VI VII
表示类型 连续 离散 连续 离散 离散 连续 离散
PT tokens 0.1B 0.1B 5B 5B 5B 5B 5B
MT&SFT tokens 4B 4B 4B 4B 4B 300B 300B
Pre-Buffer - - -
OCR、文档与图表
OCRBench 779 598 776 720 705 858 844
DocVQA 88.2 78.0 88.9 86.7 85.2 96.0 96.0
ChartQA 80.1 71.6 80.6 76.8 75.4 84.0 84.0
STEM 与推理
MMMU$_{\text{val}}$ 49.8 44.8 49.1 48.0 49.8 58.0 60.0
MathVista 59.6 47.3 56.1 54.2 56.7 75.0 74.0

译注:图 9 在原文里是「左图 + 右表」的组合,共用一个图注。这里把左边的损失曲线和右边的表格拆开排。图上有两处放大内嵌:4B–6B 处离散(带 Pre-Buffer)与连续基线的差距是 $\Delta=0.0205$,到 33B–35B 处两条线已经基本重合——这正是正文说的「差距可以靠拉长训练和放大数据来抹平」的直接证据。第三条绿线是不带 Pre-Buffer 的离散版,全程都停在明显更高的位置。

建模分析。如 §2.2 所述,SAE 加 RVQ 的构造有效解决了语义完备性的挑战。在此基础上,我们进一步考察离散表示能在多大程度上逼近其连续对应物,并为此设计了一个预对齐实验。在这一设定下,除了冻结的语言主干和视觉编码器(即离散 dNaViT 对连续 NaViT)之外的所有模块都参与优化。这一阶段我们用 captioning 损失作为代理,量化离散化相对连续版引入的信息损失。

如图 9 所示,我们的实证分析给出三条关键洞察:(1)初始训练损失显著高于连续基线。这说明连续特征在早期阶段本身就更容易对齐。虽然差距随训练推进而收窄,但在原始的离散构造下仍然残留可观的性能差异(实验 I 与 II)。(2)Pre-Buffer。我们推测这一差距源于多层级 embedding 求和之后的再编码不足。为此我们引入一个轻量的 Pre-Buffer 模块(实现为单层 FFN),在码本查表之后重新映射视觉表示、并对多层级求和后的特征做再编码。尽管设计简单,这个模块显著加快了收敛、提升了离散 token 的表达力。(3)更长训练。与连续设定不同,离散视觉 embedding 是完全从零学起的。因此它们需要更多数据才能达到可比的性能。跨实验的对比(如实验 I 对 II、实验 IV 对 VII)表明,这一性能差距在很大程度上可以通过延长训练和扩大数据规模来缩小。

追平连续模型的理解能力。图 9 的表格显示,dNaViT 不仅取得了可比的训练损失,下游性能也维持在连续基线约 1% 的范围以内。虽然在训练数据有限时离散模型初期落后,但随着数据规模扩大,这一差距逐步收窄,损失渐近逼近连续对应物。例如实验 VI 与 VII 表明离散构造已接近与连续模型持平。这一结论进一步被 LongCat-Next 上的大规模实验所印证——它取得了与 Qwen3-VL-A3B-Instruct 这类专用连续模型有竞争力的表现。这些结果说明,离散建模并没有内禀的性能天花板;它的性能主要受训练数据影响。只要有恰当的数据扩展与质量提升,离散表示的全部潜力就能被释放出来。

译注:原文这一段引用的是「Tab. 9」,但从上下文看指的是图 9 右侧那张表(即上面这张),而不是附录里的表 9(Qwen-7B 上的 RL 结果)。译文按语义改指图 9 的表格。

3.2.2 信息恢复分析

我们提供一个此前未被充分探索的视角:语义编码器的重建能力不只由监督决定,也与残差连接这类架构性质内在相关。如图 5 和表 6 所示,所有解码器都配一个轻量的 ViT 解码器,以便隔离出编码器本身的特性。带残差通路的语义编码器在没有显式重建监督的情况下也展现出不可忽视的重建能力(例如 ResNet50)。相对地,去掉 merger 模块的 QwenViT 达到了可比的重建性能,而引入 merger 则因激进的降采样($14\times\rightarrow 28\times$)导致明显退化,如图 5 所示。定性可视化进一步表明,这类 SAE 风格的编码器(如 QwenViT)仍然保有恢复粗粒度图像结构的能力,只是在重建细粒度高频细节上效果较弱。这为重新思考像素级信息与语义级信息之间的权衡提供了一个有意思的视角。

表 6:不同视觉编码器架构的定量重建性能。PSNR 和 SSIM 代表重建保真度($\uparrow$),rFID 衡量感知差异($\downarrow$)。

指标 ResNet50 ViT-B/16(预训练) ViT-B/16(随机初始化) QwenViT(去掉 merger)
PSNR($\uparrow$) $20.88\pm 3.44$ $21.86\pm 3.14$ $30.52\pm 3.42$ $18.16\pm 2.61$
SSIM($\uparrow$) $0.509\pm 0.174$ $0.581\pm 0.139$ $0.887\pm 0.051$ $0.46\pm 0.14$
rFID($\downarrow$) 0.4619 0.8850 0.5847 0.987

有意思的是,随机初始化权重的原版 ViT 取得了最好的重建性能,PSNR 在对比模型中最高。一种可能的解释是:随机初始化 ViT 的输出倾向于类噪声的信号,这对解码器而言在重建时更容易去噪。同时,架构中的残差通路可能仍然保留了一部分原始像素级信息。

图 10:DiNA 框架下视觉理解与生成的交互
图 10:DiNA 框架下视觉理解与生成的交互

3.2.3 理解与生成之间的冲突

鉴于 DiNA 通过统一自回归目标把理解与生成整合起来,我们设计了一组颇具启发性的实验来考察两个任务之间是冲突还是协同。所有训练都在完全相同的实验设定下、从同一个模型 checkpoint 出发。具体而言,我们分别用 100B token 的理解数据和生成数据训练 Pure-Und. 与 Pure-Gen. 模型。此外,我们在两者各 50B token 的 1:1 混合数据上训练一个 Unified 模型。由于在相同 token 预算下 Unified 模型拿到的任务专用数据只有纯模型的一半,我们按比例缩放了它的损失曲线,同时保留未缩放的原始版本作为参照。图 10 显示,在可比的 token 数下,Unified 模型相对 Pure-Und. 模型只有 0.006 的边际损失差异,而比 Pure-Gen. 模型的损失低 0.02。这说明生成不会损害理解,而理解反过来主动增强了生成

3.2.4 并行与串行音频生成的语义对比

在并行的内部文本引导生成中,每个解码步同时产出文本和音频输出。这种混合的多模态表示给语义准确的回复带来了相当的挑战。相对地,串行生成通过顺序生成回避了这一问题,本身就具备更强的语义一致性。为此我们提出基于随机延迟的统一建模范式来做内部语言引导。借助这一做法,LongCat-Next 能在上下文中自适应地学会对齐音频与文本语义,显著缩小两种生成策略之间的差距。

为验证方法有效性,我们以 audio-to-audio 的方式在 LlamaQuestions 和 ReasoningQA 上系统评测了文本引导的准确率。结果显示并行生成达到了与串行生成可比的表现:LlamaQuestions 上 79.33 对 81.67,ReasoningQA 上 74.95 对 80.30。尽管有轻微差距,并行做法仍保持了很强的语义保真度,说明它能在提升效率的同时保住回复质量。

3.2.5 模态无关 MoE 的训练动力学

我们观察到,当语言模型演化成原生多模态架构时,Mixture-of-Experts(MoE)层的内部动力学会发生显著变化,如图 11 所示。为更好地理解这一转变,我们分析了 LongCat-Next 的中间 MoE 层,把纯文本模型与原生训练的多模态版本作对比。

首先,即便 MoE 设计是模态无关的,仍有一部分专家逐渐产生功能特化,对视觉或音频这类特定模态表现出清晰偏好。其次,路由机制变得更加结构化,router 在专家上形成了越来越清晰且稳定的选择模式。此外,引入多模态训练之后,每个专家平均被路由到的 token 数从 507.1 上升到 584.6,说明专家容量中被利用的比例更大了。这暗示多模态学习不只诱导了功能分化,也有效扩大了模型的容量利用率。综合这些结果可以看出,原生多模态训练在 MoE 架构内同时诱导了功能特化和更高效的模型容量使用。

图 11:多模态训练前后模态无关 MoE 的训练动力学。左:token 在专家上的分布。右:一个初始模态无关的 MoE 内部涌现出的模态特化角色
图 11:多模态训练前后模态无关 MoE 的训练动力学。左:token 在专家上的分布。右:一个初始模态无关的 MoE 内部涌现出的模态特化角色

3.2.6 柏拉图表示假说

图 12:模态感知的特征分布散度:传统的 Qwen2.5-VL、数据层面原生训练的 Qwen3.5,与我们架构层面原生多模态的 LongCat-Next 之间的对比
图 12:模态感知的特征分布散度:传统的 Qwen2.5-VL、数据层面原生训练的 Qwen3.5,与我们架构层面原生多模态的 LongCat-Next 之间的对比

我们假设,在这样一个原生离散 token 空间里,模态 token 应当与文本 token 互补、在 embedding 空间中形成交织的分布,而不是各自聚成模态专属的簇。这一直觉与柏拉图表示视角106相关:文本与视觉可以被看作同一底层现实的不同表达,因此理想情况下它们应当共享一个共同的语义空间。

经验上,对训练后 token 级表示的分析显示,在 DiNA 范式下训练的 LongCat-Next 自然地在视觉与文本 token 之间呈现交织的 embedding。具体而言,我们用图文输入、通过 t-SNE 以 50,000 个采样点可视化视觉与文本 token 的联合 embedding 空间,如图 12 所示。相对地,非原生的 Qwen2.5-VL 产生的是基本分离的模态簇,而原生训练的 Qwen3.5 只表现出部分跨模态对齐。值得注意的是,LongCat-Next 展现出更强的把不同模态内化并对齐到共享空间的能力。

这些结果说明,原生离散多模态设计能更有效地促成统一的语义空间,其中不同模态的特征表现得像同一批底层概念的多语种表达。另一个观察是:视觉 tokenizer 的量化映射虽然在接入语言主干之前就被完全冻结,适配到 LongCat 架构上时性能退化却可以忽略。这说明离散语义空间本身就与语言表示空间对齐,能实现无缝的跨模态整合。

4 实现细节

4.1 训练阶段

DiNA 的优化可以简洁地分成两个阶段:模态专用 tokenizer 训练,和统一多模态训练,如图 13 所示。(1)Tokenizer 训练:过程从独立训练模态专用的 tokenizer 与 detokenizer 开始,以建立一个结构良好的离散表示空间。(2)原生多模态训练:这一阶段从 Pre-align 开始,此时码本 embedding 和 DepthTransformer 解码器被预热,语言主干保持冻结,以促成离散化 token 与主干模型之间的对齐。随后整个框架——语言主干、所有模态 embedding 和解码器——全部解冻做端到端训练,tokenizer 则保持固定。这一阶段包含 Pre-train、Mid-training 和 SFT。这样一套统一训练范式使多模态理解与生成得以无缝整合,让模型能作为一个跨模态的、单一而内聚的系统运作。

4.1.1 视觉 tokenizer

构造语义完备的 dNaViT tokenizer 的方法论已在 §2.2 中描述。本工作我们聚焦于 dNaViT tokenizer 本身的开发,绕开了计算量巨大的 SAE 训练阶段——那通常涉及大规模的视觉-语言预训练。我们直接采用 Qwen2.5-ViT38(28× 空间压缩比)作为编码器,把精力集中在 tokenization 与 de-tokenization 过程上。虽然一个优化得更好的 SAE 或许能带来进一步提升,我们发现这个选择对当前版本的目标而言已经够用。下面我们详述 dNaViT 如何被训练成支持任意分辨率下的 tokenization 与 de-tokenization。

  • 阶段 1:视觉 tokenization。 如 §2.2.3 所述,这一阶段把 SAE 特征的连续流形映射进离散潜在空间。我们用 RVQ 最小化量化误差,把稠密视觉信号转换成离散 token ID。为支持任意分辨率的编解码,我们采用灵活的基于序列的建模范式41:不同分辨率的图像被摊平进一条序列,用 变长 FlashAttention107108高效处理。训练可以分两个阶段进行:先做固定分辨率训练以快速收敛,再做带 RVQ 的任意分辨率训练,让量化过程适配变长 token,其中最大训练序列长度设为 8192。训练语料的设计同时服务于理解与生成,包含来自 LAION109、COYO110、DataComp111、TextAtlas112 的多样图像集合,以及一部分内部视觉理解数据集。为进一步提升生成质量,我们加入了高保真合成数据(例如 MidJourney)。训练在约 5000 万张任意分辨率图像上进行直到收敛,最大图像分辨率设为 1,736×1,736。经验上我们发现,产出的离散表示有效保住了判别信息与生成信息,很适合自回归建模。

  • 阶段 2:视觉 de-tokenization。 一旦离散码本建立起来,我们就着手训练 de-tokenizer(见 §2.2.4),从离散 token ID 重建像素级图像。pixel decoder 是一个从零训练的 400M 参数 Vision Transformer45113。它接收投影后的离散码 embedding,先由一个可学习的、基于 MLP 的 patch unmerger 处理——这一步逆转了 SAE 编码器施加的空间 merge,从而恢复原始 patch 序列。unmerge 后的特征随后通过一叠带 2D RoPE 位置编码的 transformer 层,最后由一个线性 head 把末层隐状态投影到像素空间。为进一步增强感知锐度与高频细节,我们从 OmniGen282 初始化一个图像 refiner,用 flow-matching 损失继续训练。refiner 接收两种条件:(1)pixel decoder 的重建结果,沿通道维与噪声 latent 拼接,提供空间引导;(2)投影后的离散码 embedding,提供语义条件。整体而言,这一阶段的训练数据复用阶段 1 的同一批图像语料,并补充了 SAM-1B114、RenderedText115、IDL116 和一批高分辨率内部图像。SAE 编码器与码本在整个阶段保持冻结,de-tokenizer 在原生分辨率下训练直到收敛。

4.1.2 音频 tokenizer

利用音频 tokenizer 上观察到的 scaling law117,我们从预训练的 Whisper-large-v3118 初始化编码器,并在我们的任务上继续训练。得到的模型对语音、环境声和音乐都表现出很强的语义理解能力,同时保持稳健的声学重建保真度。

训练语料由两部分组成:(i)大规模的网络采集中英文语音数据,已经过清洗并用开源 ASR 模型自动转写;(ii)一份精选数据集,包含高质量的多语种与方言 ASR 数据、内部合成语音,以及音乐/声音 captioning 数据集。训练语料总计约 250 万小时。

音频 tokenizer 分三个阶段训练:

  • 阶段 1:解码器预热。 编码器和 LLM 分别用 Whisper-large-v3 和 Qwen3-1.7B 初始化,解码器随机初始化。这一阶段编码器和 LLM 保持冻结,解码器在 Mel 频谱重建任务上训练。

  • 阶段 2:语义-声学联合训练。 这一阶段除 LLM 和 flow-matching 模块外的所有模块都参与更新。训练目标合并上述三项损失。RVQ 模块也在此启用,它由 8 层组成,码本尺寸依次为 8k、4k、2k、1k、1k、1k、1k、1k。

  • 阶段 3:解码器微调。 这一阶段旨在用高质量数据进一步提升解码器的音频重建能力。我们采集了大量 24kHz 高质量音频。解码器被重构成一个 Diffusion Transformer(DiT)模块,用于去除 RVQ 引入的伪影。这一精修产出适配下游 vocoder 的 24kHz Mel 频谱表示。

4.1.3 原生多模态模型

训练流水线由四个阶段组成:warm-up、全模态预训练、mid-training 和 SFT(总计约 2 万亿训练 token)。预训练利用多样的多模态数据源。mid-training 阶段我们引入额外的合成数据与高质量精选数据集;理解分支用长思维链推理数据增强,视觉生成分支则纳入任意分辨率特征训练。最后 SFT 阶段进一步提升模型的指令遵循能力。

图 13:LongCat-Next 的训练阶段
图 13:LongCat-Next 的训练阶段

表 7:各训练阶段的详细配置与数据,涵盖 V(视觉)、A(音频)、T(文本)三种模态。

阶段 Stage 1 Stage 2 Stage 3 Stage 4
目的 Pre-Align 预训练 Mid-training SFT
数据集 V:图文对;A:纯音频、ASR、TTS、交错数据 +V:交错数据、OCR、grounding、定分辨率生成;A:同上一阶段;T:纯文本 +V:长 CoT、通用 QA、视频、GUI、任意分辨率生成;A:高质量数据、多轮对话;T:同上一阶段 V:高质量指令、推理、任意分辨率生成;A:指令数据;T:长纯文本
Batch Size 8192 8192 1024 128
序列长度 8K 8K 32K 64K
可训练部分 Embed.、DepthT. 全部 全部 全部

4.2 视觉理解

我们为视觉-语言理解收集了一份大规模、多样的多模态语料,主要包含以下组成部分:图像 caption 数据、图文交错数据、OCR 数据、grounding 数据、STEM 数据和 GUI 数据。每个部分都经过精心整理以保证覆盖广泛、质量过关,使模型能在广泛的任务与领域上发展出稳健的多模态理解能力。

4.2.1 数据收集

图像 caption 数据

为促成稳健的视觉-语言对齐,我们通过一条三阶段清洗流水线整理出一份大规模高质量图文数据集。第一步,我们施加启发式过滤,剔除损坏文件、异常分辨率和低质量图像。第二步,为缓解网络数据的噪声,我们用多个开源 LVLM 做 recaption,把稀疏的标签转成细致、语义丰富的描述。最后,我们用基于 SigLIP 的相似度阈值剪掉不匹配的图文对,只保留高度准确的匹配。这条流水线产出一份均衡多样的数据集,为 dNaViT 的统一离散建模提供了语义 grounded 的基础。

图文交错数据

图文交错数据由两部分组成,用于增强多模态理解。第一部分来自开放网页的图文对,用 CLIP 分数过滤掉噪声大、对齐差的样本。第二部分来自视频数据,按场景切分并抽取关键帧,文本内容通过 ASR 和 OCR 提取。它们被组织成交错的 token 序列,用于细粒度的时序与跨模态学习。两者合在一起提供了多样的数据,强化视觉-语言对齐与推理。

光学字符识别(OCR)

细粒度视觉感知是多模态大语言模型(MLLM)的根本,它支撑起 STEM 推理和 GUI 交互这类复杂任务。

为此我们构建了一份大规模 OCR 数据集,其中 75% 是内部合成数据,25% 是从 90 多个开源数据集中过滤出的真实数据。这种混合做法保证了跨场景鲁棒性和指令遵循能力。分领域的 OCR 数据构造策略如下:

  • 文档。 借助内部数据合成工具,段落、公式和各类图文版式被转成结构化的 Markdown 格式,表格数据则被细致地标注成 HTML 格式。

  • 图表与信息图。

我们从 arXiv 合成了一份 420 万条的「图表→代码/表格/JSON」三元组数据集,以提升结构与数值抽取能力。此外,我们标注了一份由网络爬取的信息图、演示文稿和流程图组成的异构语料,以便解析复杂的视觉结构。

  • 场景文字与合成文字。

来自 ST-VQA119 和过滤后 Common Crawl 的自然场景图像被严格去污染并重新标注。为缓解语言先验与幻觉,我们引入了词表外(OOV)的文字组合。此外,我们利用专门工具(如 SynthDoG120、LaTeX)生成有挑战性的样例——包括艺术字体、手写体和扭曲表面——以增强 OCR 鲁棒性。

这条数据构造流水线保证了跨领域的精确字符级对齐。预训练建立基础感知能力,SFT 阶段则通过增强指令遵循与结构化输出能力,把模型精炼成一个可用的 OCR agent。我们从高质量数据集(如 IDL-WDS116、ChartGalaxy121、WildReceipt122、Hiertext123、CORD124)中整理出面向任务的 query,分三个难度层级:(1)简单(直接抽取),(2)中等(标准化格式化),(3)复杂(关系推理与推断)。为确保训练信号稳健,数据质量还通过基于规则的过滤、LLM-as-a-judge 评估和拒绝采样进一步优化。

STEM

稳健的 STEM 推理是下一代人工智能的认知基石,直接支撑算法问题求解、自动化科学发现这类高级分析任务。为增强模型的逻辑推理能力,我们构建了一份高质量数据集,其中 60% 开源、40% 自有/合成。这一构成提供了坚实的训练基础,兼顾广泛的知识面与深层的推理结构。具体构造策略如下:

  • 公开数据整理:我们系统地收集并整合了 70 多个开源数据集(如 MAVIS125、AI2D126、MMK12127、ViRL39K128)。为提升数据质量与代表性,我们对原始数据做了深度去重与重采样,确保模型接触到从基础教育到高等教育层级的多样 STEM 知识内容。

  • 私有数据合成:我们着力于加强合成数据的质量控制与领域知识的深度建模。

这涉及对 K12 与 STEM 内容的大规模内部采集与结构化处理。这份整理后的数据不仅包含专家标注的逻辑推理链,还引入了复杂的多步推理合成样本,显著提升了数据集的逻辑严谨性与表达精确度,从而弥补开源数据在支撑深层推理能力上的不足。此外,对艺术这类相对专门的领域,我们合成了高质量图文样本,以补足模型在跨学科语境下的知识表示。

我们重构了数据集以增强模型在复杂 STEM 任务上的多步推理能力。首先,我们清洗并改写题干以去除噪声、提升清晰度。接着,我们为每个实例构造结构化的推理链,把复杂问题拆解成可追溯的、逐步的节点。这一做法强化了模型的多步推理、长程依赖处理和隐式逻辑建模能力。

GUI

我们 GUI agent 的训练数据把真实采集与开源数据集结合起来,用定制的处理流水线保证数据质量与跨平台适应性。真实数据方面,基于近来的自动化合成方法(如 UI-TARS129、EvoCUA130),我们部署了数以万计的并发会话来采集原始交互轨迹。随后我们施加一条严格的精炼流水线:首先去除视觉噪声以隔离出基本的可交互元素;接着把采集到的指令与我们模型的输入格式对齐,以保证坐标预测的精确;最后把原始元数据翻译成自然语言意图,并仔细微调空间坐标。开源数据方面,我们聚合已有的数据集(如 AgentNet131、ScaleCUA132)并立即过滤掉异常样本。为确保模型稳健地处理各种屏幕布局,我们在不同操作系统和应用之间平衡了这批数据。我们还改写了不清晰或残缺的指令,以准确反映用户的真实意图。为挽救复杂的边界情形,我们引入一套双模型修复流程:一个轻量模型过滤空间噪声,一个更强的推理模型修复语义错误并重新校准坐标,从而保留有价值的长尾数据。

Grounding 与计数

视觉 grounding 把语义识别与空间定位连起来,同时回答「有什么」和「在哪里」。我们用 bounding box 做区域级推理来增强这一能力,并把它扩展到支持数量计数。(1)Grounding:我们聚合十余个公开来源构建了一份大规模多源数据集,包括 GRiT133、Visual Genome134、RefCOCO/+/g135136137、Objects365138 和 OpenImages139。为保证数据质量,我们施加 bounding box 并用预训练 VLM 过滤掉不匹配的标注。这条流水线产出约 6000 万样本的精选数据集,保证了稳健的 grounding 与高精度的视觉 prompting。(2)计数:在 grounding 的基础上,我们开发了一份 800 万样本的计数数据集,基于 PixMo-Points140 做基于点的计数、基于 TallyQA141 做复杂推理。基于 VLM 的过滤流程进一步提升了标注质量。这些数据集支持直接计数与基于点的计数,采用 [0, 1,000] 的归一化坐标系以获得更好的分辨率鲁棒性和更简单的下游应用。

4.2.2 数据清洗、过滤与采样

去污染与去重

为保证数据质量与评测公平,我们采用一条多阶段去污染流水线,在图像和文本两个层面过滤训练样本。具体而言,我们对图像做基于 pHash 的匹配、对文本做 N-gram 重叠检测,以移除与公开 benchmark 高度相似的样本,缓解记忆效应。此外,我们通过聚类做语义级去重,消除冗余或过于相似的 query,从而提升数据多样性与覆盖度、降低过拟合风险。

质量过滤

我们设计了一套多方面的过滤策略,从逻辑结构与知识表示两个角度提升数据质量:(1)基于规则的过滤:我们施加启发式规则,剔除 CoT 中的网页链接、格式错误和冗余文本这类异常。这提升了推理链的信息密度与效率。(2)基于模型的过滤:我们用自动化评估把 CoT 推理与 ground-truth 答案作对比,移除有缺陷的推导路径和错误结果。此外,我们对图像 caption 的知识密度打分,优先保留图文对齐强、语义内容丰富的专业级高质量样本。

数据采样

我们建立了一套完整的元数据管理系统,以确保 SFT 数据分布能支撑模型的泛化与鲁棒性。我们为每个条目标注来源、难度、领域和质量分,从而实施差异化的采样策略:(1)难度比例控制:我们用模型在多次 rollout 上的正确率来量化样本难度,动态调整易、中、难样本的比例,让模型既能巩固基础知识又能掌握复杂推理。(2)推理长度平衡:我们按任务复杂度平衡 CoT 推理链的长度分布,确保步数覆盖多样,引导模型生成逻辑紧凑高效的路径,避免过于冗长或过于简略。(3)多样性保持机制:我们为每个数据源设定最低保留比例,以确保领域表示的多样性。这防止了过度过滤导致的专门任务能力退化,保证多源学习的均衡。

4.3 视觉生成

基础文生图模型通常从网络规模的图文数据中获得生成能力,而其中很大一部分样本集中在高频模式上(例如通用人像或常见物体),导致严重的长尾分布和偏低的语义密度。这使得模型把大量容量花在记忆重复模式上,而不是学习它真正需要的广泛多样的视觉概念。

为超越纯粹靠规模驱动的做法,我们围绕最大化有效语义覆盖与密度来设计数据策略。我们的整理流水线遵循一条多阶段递进路线(见图 14):从广泛的基础对齐出发,推进到分布再平衡,最终收束到指令驱动的精炼。按照这一策略,我们从多样的公开来源和网络平台整理出一份约 3 亿图文对的内部数据集142。与单一来源的数据集相比,这种多源做法显著增强了语义多样性与视觉覆盖度。此外,我们特别强调富文字的视觉内容,因为精确的文字渲染在真实应用中仍是一个关键挑战。我们的文字中心语料包括:(1)合成的排版图像;(2)嵌有文字的自然场景;(3)专业的海报与广告版式;(4)信息密集的信息图与图表类内容。通过为复杂版式与视觉-语言交互提供更强的监督,这一策略在保持数据集规模可控、训练高效的同时最大化了概念覆盖。

图 14:左:数据整理与训练流程由三个阶段构成——(I)预训练,用过滤与 recaption 做基础对齐;(II)Mid-training,用语义聚类与再平衡处理数据不均衡;(III)在高质量指令遵循数据上做监督微调,改善美学与文字渲染。右:图像来源的分布
图 14:左:数据整理与训练流程由三个阶段构成——(I)预训练,用过滤与 recaption 做基础对齐;(II)Mid-training,用语义聚类与再平衡处理数据不均衡;(III)在高质量指令遵循数据上做监督微调,改善美学与文字渲染。右:图像来源的分布

4.3.1 阶段 I:预训练

我们首先通过过滤与 recaption 建立稳健的视觉-文本对齐。

数据过滤。我们施加多阶段过滤以保证数据质量:(1)去重:用基于 SigLIP 的 embedding 配余弦相似度移除近重复样本;(2)质量控制:分辨率 $\geq 384\times 384$、纵横比约束,以及 HPS v3 打分143;(3)内容过滤:水印检测(Qwen3-VL-8B)与 AIGC 过滤,移除合成或损坏的样本。结构化 recaption。我们用 Qwen3-VL-8B 做 recaption,生成结构化描述(总览、细节属性和标签),提升语义丰富度与对齐质量。对富文字图像,我们整合 OCR 信号(PaddleOCR)以增强文字-图像一致性。

4.3.2 阶段 II:Mid-training —— 基于聚类的再平衡

模型学会基本的视觉-文本对齐之后,训练瓶颈就转移到分布不均衡上。激进的美学过滤会把模型收窄到一种同质化的「AI 味」美学,代价是牺牲多样性。为解决这一点,我们通过一套基于聚类的再平衡流程重组数据集:

语义聚类:我们用 SigLIP2 编码所有图像,通过 FAISS 做大规模分布式 K-Means 聚类,把数据集划分成数百万个语义簇。簇内去重:在高密度簇内部,我们施加激进的去重以移除近乎冗余的样本。簇间重加权:我们采用幂律再平衡策略,提高稀疏簇(例如罕见植物或专门的科学仪器)的采样概率,有效地把分布压平,使长尾概念在训练中获得足够的梯度更新。

4.3.3 阶段 III:监督微调

最后一个阶段做监督微调(SFT),把模型与复杂的人类指令对齐。SFT 数据集由三个互补来源构成:

簇代表采样:从阶段 II 得到的语义簇中,我们在每个簇心附近挑选质量最高的样例,既保持广泛多样性又剔除噪声样本。高美学数据:我们纳入一批精选的专业摄影与数字艺术作品,以改善光照、构图和细粒度细节。富文字数据:为解决文字渲染瓶颈,我们纳入一个专门子集,包含合成排版版式和真实的 OCR grounded 场景(例如海报和信息图),为精确的字符生成提供稠密监督。

通过让训练数据逐级演进——从大规模噪声图文对,到语义再平衡后的簇,最后到高保真指令微调集——我们的模型在高效的计算预算内取得了广泛的概念覆盖与出色的美学质量。

4.4 音频

4.4.1 数据收集与处理

大规模音频预训练严重依赖网络爬取的录音,但原始音频往往远不如图文数据均匀,监督噪声大、有重复、有背景干扰,说话人分布也高度不均衡。为超越纯粹靠规模驱动的采集,我们围绕广泛的声学覆盖、可控的配对监督,以及对专门感知任务的定向支持来设计音频数据策略。如图 15 所示,这一策略通过三类互补的数据源实现:大规模网络音频、合成语音-文本数据,以及为副语言感知、音频事件理解这类难以从自然采集音频中获得的能力所准备的精选任务专用数据集。

网络音频整理。这套数据配方通过一条多阶段整理流水线实现。从 1990 万小时的开放网络音频出发,我们施加三大整理步骤:(1)过滤与对齐:用 VAD、强制对齐、去重、双 ASR 一致性过滤、基于 DNSMOS 的质量过滤和背景噪声过滤,移除噪声大或不可靠的样本,提升监督保真度;(2)说话人分布控制:用基于说话人 embedding 的聚类保留中频说话人簇,同时抑制过度表示的合成语音模式和极度稀疏的离群类别,从而降低分布偏斜、提升说话人多样性;(3)重新切分:对话语重新切分,使其长度分布更贴合自然语音的幂律结构,在规模上提升语料一致性与训练可用性。这些步骤共同把原始网络音频转化成一份更干净、更均衡的语音语料,同时保留了声学多样性。整理之后保留 320 万小时处理后音频,占原始采集量的 16.2%。

图 15:音频数据流水线
图 15:音频数据流水线

译注:图 15 在 arXiv 的 HTML 版里没有 caption([Uncaptioned image]),图注来自 tex 源里的 \captionof{figure}{Audio data pipeline.}

合成语音-文本数据。

基于从整理后网络音频语料中导出的代表性说话人簇,我们构造参考音色,合成了 120 万小时的语音-文本数据。这部分充当可控配对监督的来源,在目标文本内容或监督结构无法从原始网络音频中可靠获得时尤其有用。合成过程中,我们施加基于模型的说话人相似度与 ASR 一致性控制,以提升生成语音-文本对的质量与可靠性。

任务专用数据。

此外,我们从开源与内部资源采集了 40 万小时的任务专用数据集,以补足主语料中表示不足的能力,特别是副语言感知与音频事件理解。这些数据集为精选网络音频和合成语音-文本数据未能很好覆盖的专门感知与理解任务提供了定向监督。

表 8:音频预训练数据的详细统计。Text-Guided Audio 在此缩写为 TextAudio。

任务 数据格式 占比(%)
自动语音识别(ASR) <prompt, audio, transcript> 11
连续 TextAudio(TTS) <textaudio_1, textaudio_2, textaudio_3, …> 40
音频与文本交错(INTLV) <audio_1, text_2, audio_3, text_4, …> 22
音频与 TextAudio 交错(INTLV-TA) <audio_1, textaudio_2, audio_3, textaudio_4, …> 22
纯音频 <audio> 2
其他(AQA、S2TT 等) <prompt, audio, response> 3

4.4.2 数据类型学与统计

预训练所用的音频数据包含几种格式:自动语音识别(ASR)、纯音频、连续文本引导音频、音频与文本交错(INTLV)、音频与文本引导音频交错(INTLV-TA),以及少量的音频问答(AQA)、语音到文本翻译(S2TT)等任务类型。这些任务类型的数据格式与占比汇总在表 8 中。

ASR 与 S2TT 数据确保模型具备文本与音频之间基本的语义对齐能力。值得注意的是,连续文本引导音频数据由单个或多个用特殊标记分隔的文本引导音频段构成。这一格式本质上对应 TTS 任务:串行生成类比于非流式 TTS,并行生成则对应流式 TTS。通过对连续文本引导音频做切分,音频与文本 token 之间的长程对应被削弱,从而简化了模型在文本监督下生成音频的学习过程。交错数据分为两类:INTLV 和 INTLV-TA。INTLV 由纯音频与文本模态交替构成,增强模型在给定音频上下文时补全文本的能力。INTLV-TA 则由纯音频与文本引导音频模态交替构成,旨在强化模型的音频续写能力。这些交错格式有利于跨模态的知识迁移学习。预训练阶段我们使用了少量纯音频数据。我们认为这对训练基于 depth transformer 的音频 head 有好处,也有助于模型在生成音频时保住音色。

由于无条件音频生成极具挑战、且会削弱模型的跨模态续写能力,我们沿用 Baichuan-Audio17 的做法,在 ASR、INTLV 和 INTLV-TA 数据中对纯音频模态不计算损失。相对地,对 TTS 和 INTLV-TA 中的文本-音频模态,我们对文本 token 和音频 token 联合计算损失。

5 基础设施

多模态模型的计算负载天然是异构的。embedding 层和模态专用损失模块(例如 DepthTransformer)的执行时间与核心 LLM transformer 层的执行时间差异显著。而且这一时延还会随每个样本中各模态 token 分布的不同而动态波动。在朴素的线性、均匀切分的流水线并行配置下,这种异构性会导致明显的 stage 间负载不均衡,还会加剧点对点(P2P)通信开销,造成大量流水线气泡、拉低硬件利用率。

5.1 基于 VHalf 的流水线并行

为解决这一问题,我们提出一套基于 V-Half144 流水线并行架构的、profile 引导的负载均衡流水线调度。它包含两项核心架构选择:(1)V 形调度:我们不做线性分配,而是把流水线折成 V 形,把第一个计算 stage(embedding 层)和最后一个计算 stage(模态专用损失模块)放在同一块物理设备上。(2)共享 buffer:我们在 V 形流水线的第一个 stage 构造一个共享 buffer,让模态损失模块可以直接访问 embedding 查表后对应 RVQ 多层级 token 的隐状态来计算损失。

具体而言,我们先 profile 出 embedding 层、模态专用损失模块、LLM head 和单个 LLM transformer 层的确切执行时延。基于这些实测值,我们按如下方式实现 V 形 stage 分配(如图 16 所示):(1)共置 embedding 与模态损失:embedding 层和模态损失模块作为独立 chunk 部署在同一个流水线 stage 上。虽然模态损失模块的执行时间随输入数据变化,我们的 profile 引导分配确保这些异构组件的合计时延严格控制在理想的均匀 chunk 时延之内。(2)解耦 LLM head:为避免压垮 V 形的锚点设备,我们有意把 LLM head 与模态专用损失模块分开。LLM head 与少量 LLM transformer 层捆在一起,分配到一个单独的流水线 stage。(3)自适应 LLM 层分布:其余的标准 LLM transformer 层均匀分布在剩下的 chunk 上。这确保每个流水线 stage 的基础计算成本在整个集群上大致一致。

这一 V 形配置带来两项显著的系统级收益:(1)有效缓解气泡:通过折叠流水线并仔细隔离异构负载,embedding 与模态损失模块的动态计算开销被调度所吸收。这防止了这些波动模块成为系统性瓶颈,大幅缓解了流水线气泡,达成近乎完美的负载均衡。(2)消除跨 stage 通信:由于 embedding 层与其对应的模态损失模块共置在同一块设备上,二者之间的前向激活传递与反向梯度传输都通过设备内的零拷贝内存访问完成。这一设计从根本上消除了这些边界模块通常需要的高昂跨 stage 通信开销。

图 16:为 LongCat-Next 设计的基础设施训练流水线
图 16:为 LongCat-Next 设计的基础设施训练流水线

6 优势与未来工作

在 DiNA 框架下,多模态建模天然继承了离散训练的优势,包括生成与理解的统一,以及对基础设施友好的部署。此外在后训练阶段,离散视觉表示可以用与语言类似的建模策略来优化,为统一离散建模范式的潜力提供了初步证据。

6.1 强化学习

强化学习(RL)中的离散表示有一些内禀优势,使其特别适合多模态任务。离散视觉潜在空间天然可以充当动作空间,与 Group Relative Policy Optimization(GRPO)145 这类已有的语言模型 RL 方法无缝兼容。这避免了采样过程转换的需要(例如 flow 模型中的 ODE-to-SDE146147),同时维持一个有限的马尔可夫决策过程(MDP)结构以便高效的策略优化。本工作我们利用这些优势,把基于 GRPO 的优化同时应用到图像理解与图像生成任务上,展示离散表示在多模态应用中的通用性。

文生图的 RL。RL 在文生图任务中展现出更强的适应性与泛化能力,在数据稀缺、场景复杂或需求含糊时尤其如此85146。RL 的奖励驱动优化,在文生图的精确对齐与专项能力增强上有显著优势。

给定一个输入 prompt,策略生成一串离散 token,随后由一个冻结的解码器解码成图像。生成的图像再由一组多维度 奖励模型评估,算出一个标量奖励信号。前向过程中,模型通过 depth transformer 为每个量化层级 $l$ 输出概率分布 $\pi_{\theta}^{(l)}$。为做策略优化,我们计算一个加权目标,把所有层级的 GRPO 损失都纳入考虑,从而在训练中平衡它们的贡献。修改后的 GRPO 目标表述为:

$$ \begin{align} r_t^{(l)} &= \frac{\pi_\theta^{(l)}(a_t^{(l)}|s_t)}{\pi_{\text{old}}^{(l)}(a_t^{(l)}|s_t)}, \tag{9} \\ \mathcal{L}_{GRPO} &= \mathbb{E} \left[ \sum_{l=1}^{L} w_l \cdot \min \left( r_t^{(l)} \cdot \hat{A}_t,\; \mathrm{clip}(r_t^{(l)}, 1-\epsilon, 1+\epsilon) \cdot \hat{A}_t \right) \right], \tag{10} \end{align} $$

其中 $L$ 表示 RVQ 中量化层级的数量,$w_{l}$ 是层级 $l$ 的权重系数。$\pi_{\theta}^{(l)}(a_{t}^{(l)}|s_{t})$ 和 $\pi_{\text{old}}^{(l)}(a_{t}^{(l)}|s_{t})$ 分别是当前策略与此前策略赋予的概率。$\hat{A}_{t}$ 是优势估计,$\epsilon$ 是裁剪参数。

我们的奖励模型围绕四个关键维度设计:综合能力评估、OCR 能力增强、图文语义对齐,以及图像质量评估。

(1)综合能力增强。 为整体提升生成质量,我们评估生成图像与 prompt 之间的物体数量、颜色准确性、空间位置和属性一致性。我们先检测物体,再识别其属性,然后推断空间关系。数据集包含从简短短语到细致描述的不同长度 prompt,从而在这些维度上做定量评估。

(2)OCR 能力增强。 对视觉文字渲染,我们用 GOT-OCR 2.0148 模型识别渲染图像中的文字,包括纯文本、公式、表格和几何图形。通过量化渲染文字与 ground truth 文字之间的编辑距离,我们客观评估文字保真度。Prompt 包含 2 到 20 段文字,我们对不同文字长度做分桶采样。

(3)图文语义对齐。 我们用视觉-语言模型(VLM)作为奖励模型,评估生成图像是否准确表达了 prompt 描述。基于 VLM 的奖励信号能有效引导模型产出与输入 prompt 有更深层概念对齐的图像。

(4)图像质量评估。 为做全面的质量评估,我们采用 HPS148143、Aesthetic Score149 和 Unified Reward150 来做人类偏好对齐与视觉质量评估。这些互补指标同时捕捉主观的美学偏好与客观的质量度量。

这套多维度奖励框架使文生图在若干关键方面得以系统性改进,每个组件针对特定挑战,并有效缓解了单一奖励优化所伴随的 reward hacking 问题。

图像理解的 RL。我们进一步在图像理解任务上做了 RL 训练。我们遇到一个严重挑战:熵爆炸

随着训练推进,策略熵与 训练-推理失配的程度同时上升,导致 rollout 时生成带噪声的乱码 token。当低概率 token 进入训练数据后,它们的采样概率被进一步放大,形成一个正反馈回路,加剧熵的爆炸式增长。由于失配在 token 上的累积效应,这一现象在长 rollout 序列上尤其严重。

我们判断核心问题在于大量带噪声的乱码序列涌入训练过程。为解决这一问题,我们提出序列级过滤机制,包括基于熵的过滤器训练-推理差异过滤器

基于熵的过滤器。 训练时我们计算每个 minibatch 中序列级熵的均值和方差。任何熵 $H_{\text{seq}}$ 超出 batch 均值 $\mu_{H}$ 达 $n$ 个标准差 $\sigma_{H}$ 的序列都被视为离群值,按 $H_{\text{seq}}>\mu_{H}+n\sigma_{H}$ 过滤掉。

基于训练-推理差异的过滤器。 对每次 rollout,我们监控采样策略与 actor 策略之间的逐 token 概率差。如果序列中任何一个 token 的绝对差超过预设阈值 $\delta$,即 $|\pi_{\text{sampler}}(a_{t}|s_{t})-\pi_{\text{actor}}(a_{t}|s_{t})|>\delta$,整条序列就被认为存在严重的训练-推理失配,因而被丢弃。

把这两个序列级过滤器整合进 GRPO 目标,得到一个稳定化的损失表述。修改后的目标 $\mathcal{L}_{\text{GRPO-Filtered}}$ 通过指示函数施加过滤,在计算标准裁剪代理损失之前把有问题的序列掩掉:

$$ \begin{aligned} \mathcal{L}_{\text{GRPO-Filtered}} = \mathbb{E}_{(s_t, a_t) \sim \mathcal{D}} \Bigg[ & \underbrace{\mathbb{I} \left\{ H_{\text{seq}}(s_t) \le \mu_H + n \sigma_H \right\}}_{\text{(1) Entropy Filter}} \; \cdot \; \underbrace{\mathbb{I} \left\{ \max_{t' \in \mathcal{T}_y} |\pi_{\text{sampler}}(a_{t'}|s_{t'}) - \pi_{\text{actor}}(a_{t'}|s_{t'})| \le \delta \right\}}_{\text{(2) Prob. Diff. Filter}} \\ & \cdot \; \min \Big( r_t(\theta) \cdot \hat{A}_t, \; \mathrm{clip}\big(r_t(\theta), 1-\epsilon, 1+\epsilon\big) \cdot \hat{A}_t \Big) \Bigg], \end{aligned} \tag{11} $$

其中 $\mathbb{I}\{\cdot\}$ 充当硬性二值掩码;一条序列只有同时通过两个过滤器才会贡献梯度。

总的来说,这套整合式过滤方案提供了一个既能诊断又能预防的解法。它诊断性地识别出包含关键失效模式的序列,并预防性地把它们从梯度更新中移除。由于是在序列级别做这件事,它直接击中了根因,超越了 token 级的近似做法,为大幅训练-推理失配下的训练提供了必要的稳定性。更多分析见附录 §9.1。

图 17a:图像理解奖励
图 17a:图像理解奖励

图 17b:GenEval 奖励(综合能力)
图 17b:GenEval 奖励(综合能力)

图 17c:OCR 奖励
图 17c:OCR 奖励

图 17d:Case 奖励(图文语义对齐)
图 17d:Case 奖励(图文语义对齐)

图 17e:HPSv 奖励(图像质量)
图 17e:HPSv 奖励(图像质量)

译注:原文图 17 只有一句总图注「Reward Scores in RL」,五张子图各自没有单独图注。这里的 17a–17e 小标题是按原文里图片文件的顺序(imge_undgeneval_rewardocr_math_equalcase_rewardshpsv_reward)和 §6.1 里四个奖励维度的对应关系补上的。

图 17 展示了图像理解与图像生成的奖励曲线。图像生成的奖励覆盖综合能力、OCR 表现、语义对齐和图像质量。每条曲线都展现出模型在不同任务上的渐进改善,反映出奖励值随训练步数稳步上升。

6.2 讨论与未来工作

这项工作代表了在统一离散自回归框架内迈向原生多模态建模的第一步。受计算资源与数据可得性所限,当前研究在范围上仍然有限,若干重要方面尚未被充分探索。我们把这些局限视为未来研究的机会,也欢迎社区的讨论与合作。一些潜在的未来工作如下:

视觉 tokenizer。当前版本的首要任务是用 dNaViT 实现离散编解码的流程。由于模型目前聚焦在图像理解与生成任务上,tokenizer 尚未被充分优化。值得注意的是,当前的 de-tokenizer 主要关注语义解码的一致性,而非像素保真度。然而尽管它并非最先进的 tokenizer 版本,我们在理解与生成任务上仍取得了很强的表现,验证了这一做法的有效性。这说明模型能力可以通过扩大数据规模进一步提升。我们会在后续迭代中更新 tokenizer,以更好地匹配下一版的目标。

超越理解与生成。我们当前的评测通过图生文、文生图这类任务强调语义完整性。然而一个真正原生的多模态系统不应当被局限在这些标准方向上。一个自然的下一步是推广到 any-to-any 生成和交错式多模态推理,其中输入与输出跨越文本、视觉、音频的任意组合。这包括长上下文多模态交互、多轮 grounded 对话,以及各模态动态互为条件的组合式生成。实现这种灵活的统一交互,将是从任务专项能力走向通用多模态智能的关键。

数据扩展与表示学习。一个核心的开放问题是:多模态能否引入超出语言已捕捉范围之外的能力?语言编码了人类知识高度压缩的抽象,而感知模态提供了扎根于物理世界的互补信号。有效利用这种互补性,不仅需要扩大数据规模,还需要改善数据的结构与对齐。特别地,大规模感知预训练与离散 token 建模之间的交互仍未被充分探索。我们的初步结果表明,常规的预训练范式并不能直接转化为一致的增益,这暗示连续表示与离散建模之间可能存在某种失配。未来工作或许需要协同设计数据、预训练目标与离散化策略,以学到能更好支撑统一多模态推理的语义对齐表示。

总的来说,我们把这项工作视为一次初步探索,许多组件仍有待验证与扩大规模。未来的努力将沿这些方向展开,配以更全面的实验、更强的模型和更广泛的评测,力求更接近真正统一的多模态智能。

7 结论

在这项工作中,我们重新审视原生多模态中的一个根本问题:如何在统一的学习范式内表示和建模世界的多样模态。通过引入 LongCat-Next,我们探索了这样一种可能性:语言风格的离散自回归建模可以自然地超越文本,在共享的 token 接口内涵盖视觉与音频。我们的结果表明,只要 tokenizer 与训练策略设计得当,连续的感知信号就可以被有效离散化,同时保持强劲的能力。作为这个方向上的第一步,我们希望这项工作为多模态建模提供一个不同的视角,并为社区构建真正统一的多模态基础模型提供洞察。

9 附录

9.1 RL 中的训练-推理失配分析

图 18a:Actor 熵
图 18a:Actor 熵

图 18b:Actor 梯度范数
图 18b:Actor 梯度范数

图 18c:Critic 分数均值
图 18c:Critic 分数均值

图 18d:训练-推理概率差 &gt; 0.4 的样本数
图 18d:训练-推理概率差 &gt; 0.4 的样本数

译注:原文图 18 同样只有一句总图注「Training metrics comparison in RL」,四张子图各自没有单独图注,这里的 18a–18d 小标题取自各图内印的标题。图 18d 里五条曲线的对比最能说明问题:Baseline 在约第 95 步崩掉,TIS 撑到约 120 步,MIS 约 140 步,Seq-TIS 约 200 步,而本文的序列级过滤(Ours)跑完全部 380 步都没有失控——这就是正文说的「重要性采样修正只是把熵爆炸推迟了几个训练步」的量化形态。

RL 训练中我们发现一个关键现象:序列坍塌常常是由序列中仅仅少数几个、甚至单个 token 上的严重训练-推理失配触发的。某个 token 在采样策略 $\pi_{\text{sampler}}$ 下的概率可能超过 $0.4$,而在训练策略 $\pi_{\text{actor}}$ 下的估计概率却可以低到 $10^{-2}$;与此同时,同一序列中其余 token 的平均概率差只在 $10^{-3}$ 量级。这类异常 token 对整体序列质量有灾难性影响。它们本质上是极低概率的噪声——正常情况下很难被 rollout 出来——却由于硬件或数值精度上的失配而渗入了数据。更关键的是,后续以这些噪声 token 为条件的生成都变得不可靠,导致错误在整条序列上传播。图 18 展示了一个 batch 中至少有一个 token 的训练-推理概率散度超过 $0.4$ 的样本数。如图所示,熵爆炸、梯度范数飙升和训练-推理策略散度上升三者呈正相关。这一连锁反应最终导致奖励下滑。

为缓解这一问题,我们尝试了若干 重要性采样修正技术,包括 Truncated Importance Sampling(TIS)151 和 Multiple Importance Sampling(MIS)152。如图 18 所示,这些做法只是把熵爆炸的发作推迟了几个训练步,并没有解决根本问题。

一些序列级修正方法153在这一场景下也可能失效、导致奖励下降。少数异常 token 的极端散度会被序列中大量正常 token 的比值平均掉。因此我们采取一种更根本、更直接的干预策略:把阈值 $\delta$ 直接作用在逐 token 的概率绝对差 $|\pi_{\text{sampler}}-\pi_{\text{actor}}|$ 上。这让我们的过滤器能够直接检测并定位最细粒度的、token 级的不一致。通过施加这些严格的过滤策略,我们有效阻止了噪声数据进入训练过程。

9.2 RL 的实验分析

这个实验我们用 Qwen-7B 作为语言主干,验证离散化 RL 的有效性。除 LLM 主干外,其他所有模型架构与配置都与预训练模型保持一致。我们在图像理解与图像生成两类任务上评估性能。

图像理解任务上,我们用开源数据集 VIRL39K128 和 Orsta-Data-47k154 加上内部数据做 RL 训练。我们按图像哈希和 prompt 合并去重,用 base 模型做四次 rollout,剔除全对或全错的实例。最终保留约 3 万条 RL 数据样本。图像生成任务上,我们采集了约 4 万条数据样本,每个 prompt 可能关联多个奖励分数。详细性能结果见表 9。

表 9:基于 Qwen-7B 的图像理解与图像生成性能。

数据集 MMMU(STEM) MMMU-Pro(STEM) MathVista(STEM) MathVision(STEM) MMStar(通用) RealWorldQA(通用) MMVP(通用)
baseline 64.22 51.27 80.30 49.28 66.33 66.01 73.33
RL 66.45 53.58 81.90 53.52 71.13 72.54 74.66
数据集(OCR 与文档) CharXiv$_{\text{DQ}}$ CharXiv$_{\text{RQ}}$ InfoVQA ChartQA AI2D OmniDocBench-zh $\downarrow$ OmniDocBench-en $\downarrow$
baseline 85.45 51.8 81.69 88.56 81.57 0.187 0.256
RL 87.35 56.7 83.85 92.08 85.13 0.169 0.266
数据集(GenEval) Overall single_obj two_obj counting colors position color_attr
baseline 83.94 100.00 92.71 71.25 92.74 74.75 72.19
RL 87.33 99.69 93.18 78.75 94.15 81.50 76.75

译注:原文表 9 是一张竖着叠了三块的表(STEM/通用、OCR 与文档、GenEval),三块共用一套列宽但列含义各不相同。这里拆成三张表。另外 OCR 那一块的 OmniDocBench(zh / en) 在原文里用 \multicolumn{2} 横跨最后两列,所以 baseline 的 0.187 / 0.256 和 RL 的 0.169 / 0.266 分别是 zh 和 en 的值,这里拆成两列写明。

RL 在 STEM、通用 VQA 和 OCR benchmark 上都带来显著提升。例如 MMMU 和 MathVision 这类数据集上的分数相对 base 模型有明显增益,说明模型的多步推理与问题求解能力有实质性增强。此外,在 RealWorldQA、MathStar、ChartQA 这类通用 VQA 与 OCR 任务上,模型同样取得约 5% 的显著改进,表明泛化能力得到全面提升。在图像生成的 GenEval 评测集上,我们的模型也取得可观的性能增益:计数准确率提升 7.50%,位置准确率提升 6.75%,颜色属性准确率提升 4.56%。这些结果凸显了奖励反馈驱动的强化学习的有效性。

9.3 离散量化策略

图 19:不同离散量化策略下的特征重建损失对比
图 19:不同离散量化策略下的特征重建损失对比

为选出信息损失最小的离散量化策略,我们用特征重建损失作为代理任务,评估各方法的信息保留能力。如图 19 所示,两级 RVQ 略优于原版 VQ。而当把 RVQ 扩展到八级时,特征重建损失显著下降。这说明 RVQ 的残差机制与可组合性,对于实现信息损失最小的离散量化是必不可少的。实证验证表明,八级 RVQ 在不引入过度计算开销的前提下达到了足够低的信息损失,完全满足我们的需求。因此我们把它作为模型的默认设置。

9.4 DiNA 下的视觉理解与生成

在 DiNA 的自回归建模过程中(如图 20 所示),我们通过多层级编解码有效平衡了性能与效率。理解阶段,视觉信号被编码成层级化的离散 token,跨层级相加之后送进大语言模型(LLM),确保所有层级的信息都被充分利用。生成阶段,隐表示被传给 DepthTransformer,由它解码成多层级 token。整个过程在单个自回归步内完成,在保持高质量生成的同时实现了高效的并行解码。这一做法让视觉理解与生成得以在统一框架内无缝进行,克服了传统模型中的信息损失与计算瓶颈。

译注:原文这句写的是「as in Fig. 19」,但从上下文看指的是紧随其后的图 20(DiNA 范式下统一的 tokenizer 与 detokenizer),而不是上一节的 RVQ 损失曲线。译文按语义改指图 20。

图 20:DiNA 范式下同时服务于理解与生成的统一 tokenizer 与 detokenizer
图 20:DiNA 范式下同时服务于理解与生成的统一 tokenizer 与 detokenizer

9.5 定性示例

图 21:数学文本与公式识别的定性结果。版式上刻意把源图像和开头的文本放在左边,把较长的推导延续到右边
图 21:数学文本与公式识别的定性结果。版式上刻意把源图像和开头的文本放在左边,把较长的推导延续到右边

图 22:我们的模型能在 OCR 识别阶段产出格式化输出并执行数值比较,从而提升识别结果的准确性与可解释性
图 22:我们的模型能在 OCR 识别阶段产出格式化输出并执行数值比较,从而提升识别结果的准确性与可解释性

图 23:LongCat-Next 通过多步推理求解复杂数学逻辑谜题的两个例子。上半部分展示模型在十字形视觉结构中识别算术模式、推出缺失数字的能力。下半部分展示进阶的空间推理与约束满足:模型系统地测试不同假设,推出 3×3 网格中数字的正确摆放并算出所需的和
图 23:LongCat-Next 通过多步推理求解复杂数学逻辑谜题的两个例子。上半部分展示模型在十字形视觉结构中识别算术模式、推出缺失数字的能力。下半部分展示进阶的空间推理与约束满足:模型系统地测试不同假设,推出 3×3 网格中数字的正确摆放并算出所需的和

图 24:LongCat-Next 求解几何问题的两个例子。上半部分展示模型通过嵌套几何关系推出正方形面积的能力,下半部分则突出它把复杂四边形分解成三角形、并验证直角性质来计算总面积的能力
图 24:LongCat-Next 求解几何问题的两个例子。上半部分展示模型通过嵌套几何关系推出正方形面积的能力,下半部分则突出它把复杂四边形分解成三角形、并验证直角性质来计算总面积的能力

9.6 视觉 de-tokenizer 的分析

图 25:视觉 de-tokenizer 中 pixel decoder 与 refiner 模块的效果
图 25:视觉 de-tokenizer 中 pixel decoder 与 refiner 模块的效果

在当前版本中,我们主要关注生成质量,重建只要求保持语义一致性。模型的 de-tokenizer 组件包含 Vision Transformer(ViT)pixel decoder 和 diffusion refiner 模块,二者协同从图像中重建语义信息。可视化结果见图 25。ViT 解码器单独就能重建图像的语义内容,但冻结的 SAE 编码器限制了捕捉高频与细粒度细节的能力。在这一点上,专为细节恢复设计的 refiner 就扮演了关键角色,能在语义层面忠实地恢复原图。此外,在 LLM 自回归的框架下,预测出的离散 token 本身就编码了语义内容,例如图像的版式与结构元素。值得注意的是,这些离散 token 在 OCR 任务上表现出色,因为它们本身包含语义完备的信息,从而能忠实重建文字信息。


  1. Meituan LongCat Team (2026). LongCat-Next: Lexicalizing Modalities as Discrete Tokens. arXiv:2603.27538 ↩︎

  2. LongCat-Next 代码仓库:https://github.com/meituan-longcat/LongCat-Next ↩︎

  3. LongCat-Next 模型权重:https://huggingface.co/meituan-longcat/LongCat-Next ↩︎

  4. A. Hurst, A. Lerer, A. P. Goucher, A. Perelman, A. Ramesh, A. Clark, A. Ostrow, A. Welihinda, A. Hayes, A. Radford, et al. (2024). Gpt-4o system card. arXiv:2410.21276 ↩︎

  5. G. Comanici, E. Bieber, M. Schaekermann, I. Pasupat, N. Sachdeva, I. Dhillon, M. Blistein, O. Ram, D. Zhang, E. Rosen, L. Marris, S. Petulla, C. Gaffney, A. Aharoni, and many others (2025). Gemini 2.5: pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities. arXiv:2507.06261 ↩︎ ↩︎ ↩︎

  6. A. Yang, A. Li, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Gao, C. Huang, C. Lv, et al. (2025). Qwen3 technical report. arXiv:2505.09388 ↩︎ ↩︎

  7. Meituan (2025). LongCat-flash technical report. arXiv:2509.01322 ↩︎ ↩︎ ↩︎ ↩︎

  8. K. Team, T. Bai, Y. Bai, Y. Bao, S. Cai, Y. Cao, Y. Charles, H. Che, C. Chen, G. Chen, et al. (2026). Kimi k2.5: visual agentic intelligence. arXiv:2602.02276 ↩︎

  9. B. Xiao, B. Xia, B. Yang, B. Gao, B. Shen, C. Zhang, C. He, C. Lou, F. Luo, G. Wang, et al. (2026). Mimo-v2-flash technical report. arXiv:2601.02780 ↩︎

  10. A. Radford, J. Wu, R. Child, D. Luan, D. Amodei, I. Sutskever, et al. (2019). Language models are unsupervised multitask learners. OpenAI blog 1 (8), pp.9. ↩︎

  11. T. Brown, B. Mann, N. Ryder, M. Subbiah, J. D. Kaplan, P. Dhariwal, A. Neelakantan, P. Shyam, G. Sastry, A. Askell, et al. (2020). Language models are few-shot learners. Advances in neural information processing systems 33, pp.1877–1901. ↩︎

  12. H. Liu, C. Li, Q. Wu, and Y. J. Lee (2023). Visual instruction tuning. Advances in neural information processing systems 36, pp.34892–34916. ↩︎

  13. C. Wu, J. Li, J. Zhou, J. Lin, K. Gao, K. Yan, S. Yin, S. Bai, X. Xu, Y. Chen, Y. Chen, Z. Tang, Z. Zhang, Z. Wang, A. Yang, B. Yu, C. Cheng, D. Liu, D. Li, H. Zhang, H. Meng, H. Wei, J. Ni, K. Chen, K. Cao, L. Peng, L. Qu, M. Wu, P. Wang, S. Yu, T. Wen, W. Feng, X. Xu, Y. Wang, Y. Zhang, Y. Zhu, Y. Wu, Y. Cai, and Z. Liu (2025). Qwen-image technical report. arXiv:2508.02324 ↩︎ ↩︎

  14. X. Wang, X. Zhang, Z. Luo, Q. Sun, Y. Cui, J. Wang, F. Zhang, Y. Wang, Z. Li, Q. Yu, et al. (2024). Emu3: next-token prediction is all you need. arXiv:2409.18869 ↩︎ ↩︎

  15. C. Team (2024). Chameleon: mixed-modal early-fusion foundation models. arXiv:2405.09818 ↩︎ ↩︎

  16. A. Défossez, L. Mazaré, M. Orsini, A. Royer, P. Pérez, H. Jégou, E. Grave, and N. Zeghidour (2024). Moshi: a speech-text foundation model for real-time dialogue. arXiv:2410.00037 ↩︎ ↩︎

  17. T. Li, J. Liu, T. Zhang, Y. Fang, D. Pan, M. Wang, Z. Liang, Z. Li, M. Lin, G. Dong, et al. (2025). Baichuan-audio: a unified framework for end-to-end speech interaction. arXiv:2502.17239 ↩︎ ↩︎ ↩︎

  18. D. Zhang, G. Wang, J. Xue, K. Fang, L. Zhao, R. Ma, S. Ren, S. Liu, T. Guo, W. Zhuang, et al. (2025). MiMo-audio: audio language models are few-shot learners. arXiv:2512.23808 ↩︎ ↩︎ ↩︎

  19. D. Lee, C. Kim, S. Kim, M. Cho, and W. Han (2022). Autoregressive image generation using residual quantization. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp.11523–11532. ↩︎ ↩︎ ↩︎ ↩︎

  20. A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, and I. Sutskever (2023). Robust speech recognition via large-scale weak supervision. ICML, pp.28492–28518. arXiv:2212.04356 ↩︎ ↩︎

  21. H. Liu, J. Zhang, C. Wang, X. Hu, L. Lyu, J. Sun, X. Yang, B. Wang, F. Li, Y. Qian, et al. (2026). Scaling embeddings outperforms scaling experts in language models. arXiv:2601.21204 ↩︎ ↩︎ ↩︎ ↩︎

  22. D. P. Kingma and M. Welling (2013). Auto-encoding variational bayes. arXiv:1312.6114 ↩︎

  23. A. Van Den Oord, O. Vinyals, et al. (2017). Neural discrete representation learning. Advances in neural information processing systems 30. ↩︎ ↩︎

  24. Y. Cui, H. Chen, H. Deng, X. Huang, X. Li, J. Liu, Y. Liu, Z. Luo, J. Wang, W. Wang, et al. (2025). Emu3.5: native multimodal models are world learners. arXiv:2510.26583 ↩︎ ↩︎

  25. H. Liu, W. Yan, M. Zaharia, and P. Abbeel (2024). World model on million-length video and language with blockwise ringattention. arXiv:2402.08268 ↩︎

  26. Y. Wu, Z. Zhang, J. Chen, H. Tang, D. Li, Y. Fang, L. Zhu, E. Xie, H. Yin, L. Yi, et al. (2024). Vila-u: a unified foundation model integrating visual understanding and generation. arXiv:2409.04429 ↩︎

  27. M. Oquab, T. Darcet, T. Moutakanni, H. Vo, M. Szafraniec, V. Khalidov, P. Fernandez, D. Haziza, F. Massa, A. El-Nouby, et al. (2023). Dinov2: learning robust visual features without supervision. arXiv:2304.07193 ↩︎

  28. X. Zhai, B. Mustafa, A. Kolesnikov, and L. Beyer (2023). Sigmoid loss for language image pre-training. In Proceedings of the IEEE/CVF international conference on computer vision, pp.11975–11986. ↩︎

  29. Y. Jiao, H. Qiu, Z. Jie, S. Chen, J. Chen, L. Ma, and Y. Jiang (2025). Unitoken: harmonizing multimodal understanding and generation through unified visual encoding. In Proceedings of the Computer Vision and Pattern Recognition Conference, pp.3600–3610. ↩︎

  30. L. Fan, L. Tang, S. Qin, T. Li, X. Yang, S. Qiao, A. Steiner, C. Sun, Y. Li, T. Zhu, et al. (2025). Unified autoregressive visual generation and understanding with continuous tokens. arXiv:2503.13436 ↩︎

  31. J. Zou, B. Liao, Q. Zhang, W. Liu, and X. Wang (2025). Omnimamba: efficient and unified multimodal understanding and generation via state space models. arXiv:2503.08686 ↩︎

  32. C. Deng, D. Zhu, K. Li, C. Gou, F. Li, Z. Wang, S. Zhong, W. Yu, X. Nie, Z. Song, G. Shi, and H. Fan (2025). Emerging properties in unified multimodal pretraining. arXiv:2505.14683 ↩︎ ↩︎ ↩︎

  33. C. Wu, X. Chen, Z. Wu, Y. Ma, X. Liu, Z. Pan, W. Liu, Z. Xie, X. Yu, C. Ruan, et al. (2025). Janus: decoupling visual encoding for unified multimodal understanding and generation. In Proceedings of the Computer Vision and Pattern Recognition Conference, pp.12966–12977. ↩︎

  34. X. Chen, Z. Wu, X. Liu, Z. Pan, W. Liu, Z. Xie, X. Yu, and C. Ruan (2025). Janus-pro: unified multimodal understanding and generation with data and model scaling. arXiv:2501.17811 ↩︎ ↩︎

  35. H. Diao, Y. Cui, X. Li, Y. Wang, H. Lu, and X. Wang (2024). Unveiling encoder-free vision-language models. Advances in Neural Information Processing Systems 37, pp.52545–52567. ↩︎

  36. H. Diao, X. Li, Y. Cui, Y. Wang, H. Deng, T. Pan, W. Wang, H. Lu, and X. Wang (2025). Evev2: improved baselines for encoder-free vision-language models. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp.21014–21025. ↩︎

  37. H. Diao, M. Li, S. Wu, L. Dai, X. Wang, H. Deng, L. Lu, D. Lin, and Z. Liu (2025). From pixels to words–towards native vision-language primitives at scale. arXiv:2510.14979 ↩︎

  38. S. Bai, Y. Cai, R. Chen, K. Chen, X. Chen, Z. Cheng, L. Deng, W. Ding, C. Gao, C. Ge, et al. (2025). Qwen3-vl technical report. arXiv:2511.21631 ↩︎ ↩︎ ↩︎

  39. K. Team, A. Du, B. Yin, B. Xing, B. Qu, B. Wang, C. Chen, C. Zhang, C. Du, C. Wei, et al. (2025). Kimi-vl technical report. arXiv:2504.07491 ↩︎

  40. E. Fini, M. Shukor, X. Li, P. Dufter, M. Klein, D. Haldimann, S. Aitharaju, V. G. T. da Costa, L. Béthune, Z. Gan, et al. (2025). Multimodal autoregressive pre-training of large vision encoders. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp.9641–9654. ↩︎

  41. M. Dehghani, B. Mustafa, J. Djolonga, J. Heek, M. Minderer, M. Caron, A. Steiner, J. Puigcerver, R. Geirhos, I. M. Alabdulmohsin, et al. (2023). Patch n’pack: navit, a vision transformer for any aspect ratio and resolution. Advances in Neural Information Processing Systems 36, pp.2252–2274. ↩︎ ↩︎

  42. A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, G. Heigold, S. Gelly, J. Uszkoreit, and N. Houlsby (2021). An image is worth 16x16 words: transformers for image recognition at scale. arXiv:2010.11929 ↩︎

  43. S. Tong, B. Zheng, Z. Wang, B. Tang, N. Ma, E. Brown, J. Yang, R. Fergus, Y. LeCun, and S. Xie (2026). Scaling text-to-image diffusion transformers with representation autoencoders. arXiv:2601.16208 ↩︎

  44. B. Zheng, N. Ma, S. Tong, and S. Xie (2025). Diffusion transformers with representation autoencoders. arXiv:2510.11690 ↩︎

  45. A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, G. Heigold, S. Gelly, et al. (2020). An image is worth 16x16 words: transformers for image recognition at scale. arXiv:2010.11929(与脚注 42 是同一篇 ViT 论文,原文参考文献里重复收录了 arXiv 版和 ICLR 版两条) ↩︎ ↩︎

  46. Y. Lipman, R. T. Chen, H. Ben-Hamu, M. Nickel, and M. Le (2022). Flow matching for generative modeling. arXiv:2210.02747 ↩︎

  47. J. Kong, J. Kim, and J. Bae (2020). Hifi-gan: generative adversarial networks for efficient and high fidelity speech synthesis. Advances in neural information processing systems 33, pp.17022–17033. ↩︎

  48. D. Ding, Z. Ju, Y. Leng, S. Liu, T. Liu, Z. Shang, K. Shen, W. Song, X. Tan, H. Tang, et al. (2025). Kimi-audio technical report. arXiv:2504.18425 ↩︎ ↩︎

  49. B. Wu, C. Yan, C. Hu, C. Yi, C. Feng, F. Tian, F. Shen, G. Yu, H. Zhang, J. Li, et al. (2025). Step-audio 2 technical report. arXiv:2507.16632 ↩︎ ↩︎

  50. X. Yue, Y. Ni, K. Zhang, T. Zheng, R. Liu, G. Zhang, S. Stevens, D. Jiang, W. Ren, Y. Sun, et al. (2024). Mmmu: a massive multi-discipline multimodal understanding and reasoning benchmark for expert agi. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp.9556–9567. ↩︎

  51. X. Yue, T. Zheng, Y. Ni, Y. Wang, K. Zhang, S. Tong, Y. Sun, B. Yu, G. Zhang, H. Sun, et al. (2025). Mmmu-pro: a more robust multi-discipline multimodal understanding benchmark. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp.15134–15186. ↩︎

  52. P. Lu, H. Bansal, T. Xia, J. Liu, C. Li, H. Hajishirzi, H. Cheng, K. Chang, M. Galley, and J. Gao (2023). Mathvista: evaluating mathematical reasoning of foundation models in visual contexts. arXiv:2310.02255 ↩︎

  53. K. Wang, J. Pan, W. Shi, Z. Lu, H. Ren, A. Zhou, M. Zhan, and H. Li (2024). Measuring multimodal mathematical reasoning with math-vision dataset. Advances in Neural Information Processing Systems 37, pp.95095–95169. ↩︎

  54. W. Xu, J. Wang, W. Wang, Z. Chen, W. Zhou, A. Yang, L. Lu, H. Li, X. Wang, X. Zhu, W. Wang, J. Dai, and J. Zhu (2025). VisuLogic: a benchmark for evaluating visual reasoning in multi-modal large language models. arXiv:2504.15279 ↩︎

  55. L. Chen, W. Xie, Y. Liang, H. He, H. Zhao, Z. Yang, et al. (2026). BabyVision: visual reasoning beyond language. arXiv:2601.06521 ↩︎

  56. Y. Liu et al. (2023). OCRBench: on the hidden mystery of ocr in large multimodal models. arXiv:2305.07895 ↩︎

  57. L. Fu et al. (2025). OCRBench v2: an improved comprehensive benchmark for ocr evaluation in large vision-language models. arXiv:2501.00595 ↩︎

  58. M. Mathew, D. Karatzas, and C.V. Jawahar (2021). DocVQA: a dataset for vqa on document images. In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV),. ↩︎

  59. L. Ouyang et al. (2024). OmniDocBench: benchmarking large language models for diverse document parsing. arXiv:2412.07626 ↩︎

  60. A. Masry, D. X. Long, J. Q. Tan, S. Joty, and E. Hoque (2022). ChartQA: a benchmark for question answering about charts with visual and logical reasoning. In Findings of the Association for Computational Linguistics: ACL 2022,. ↩︎

  61. Z. Wang et al. (2024). CharXiv: charting gaps in realistic chart understanding in multimodal llms. arXiv:2406.18521 ↩︎

  62. M. Mathew, V. Bagal, R. Tito, D. Karatzas, E. Valveny, and C.V. Jawahar (2022). InfographicVQA. In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV),. ↩︎

  63. Y. Liu, H. Duan, Y. Zhang, B. Li, S. Zhang, W. Zhao, Y. Yuan, J. Wang, C. He, Z. Liu, K. Chen, and D. Lin (2024). MMBench: is your multi-modal model an all-around player?. In Computer Vision - ECCV 2024 - 18th European Conference, Milan, Italy, September 29-October 4, 2024, Proceedings, Part VI, A. Leonardis, E. Ricci, S. Roth, O. Russakovsky, T. Sattler, and G. Varol (Eds.), Lecture Notes in Computer Science, Vol. 15064, pp.216–233. ↩︎

  64. xAI (2024). RealWorldQA: a benchmark for real-world spatial understanding. https://huggingface.co/datasets/xai-org/RealworldQA ↩︎

  65. L. Chen, J. Li, X. Dong, P. Zhang, Y. Zang, Z. Chen, H. Duan, J. Wang, Y. Qiao, D. Lin, and F. Zhao (2024). Are we on the right way for evaluating large vision-language models?. In Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2024, NeurIPS 2024, Vancouver, BC, Canada, December 10 - 15, 2024, A. Globersons, L. Mackey, D. Belgrave, A. Fan, U. Paquet, J. M. Tomczak, and C. Zhang (Eds.),. http://papers.nips.cc/paper%5C_files/paper/2024/hash/2f8ee6a3d766b426d2618e555b5aeb39-Abstract-Conference.html ↩︎

  66. T. Xie, J. Deng, X. Li, J. Yang, H. Wu, J. Chen, W. Hu, X. Wang, Y. Xu, Z. Wang, Y. Xu, J. Wang, D. Sahoo, T. Yu, and C. Xiong (2025). Scaling computer-use grounding via user interface decomposition and synthesis. arXiv:2505.13227 ↩︎

  67. Z. Wu, Z. Wu, F. Xu, Y. Wang, Q. Sun, C. Jia, K. Cheng, Z. Ding, L. Chen, P. P. Liang, et al. (2024). Os-atlas: a foundation action model for generalist gui agents. arXiv:2410.23218 ↩︎

  68. D. Ghosh, H. Hajishirzi, and L. Schmidt (2023). GenEval: an object-focused framework for evaluating text-to-image alignment. arXiv:2310.11513 ↩︎

  69. X. Hu, R. Wang, Y. Fang, B. Fu, P. Cheng, and G. Yu (2024). ELLA: equip diffusion models with llm for enhanced semantic alignment↩︎

  70. Y. Niu, M. Ning, M. Zheng, W. Jin, B. Lin, P. Jin, J. Liao, C. Feng, K. Ning, B. Zhu, and L. Yuan (2025). WISE: a world knowledge-informed semantic evaluation for text-to-image generation. arXiv:2503.07265 ↩︎

  71. Z. Geng, Y. Wang, Y. Ma, C. Li, Y. Rao, S. Gu, Z. Zhong, Q. Lu, H. Hu, X. Zhang, Linus, D. Wang, and J. Jiang (2025). X-omni: reinforcement learning makes discrete autoregressive image generative models great again. CoRR abs/None. ↩︎ ↩︎

  72. X. Wei, J. Zhang, Z. Wang, H. Wei, Z. Guo, and L. Zhang (2025). TIIF-bench: how does your t2i model follow your instructions?. arXiv:2506.02161 ↩︎

  73. N. Du, Z. Chen, S. Gao, Z. Chen, X. Chen, Z. Jiang, J. Yang, and Y. Tai (2025). Textcrafter: accurately rendering multiple texts in complex visual scenes. arXiv:2503.23461 ↩︎

  74. B. F. Labs, S. Batifol, A. Blattmann, F. Boesel, S. Consul, C. Diagne, T. Dockhorn, J. English, Z. English, P. Esser, S. Kulal, K. Lacey, Y. Levi, C. Li, D. Lorenz, J. Müller, D. Podell, R. Rombach, H. Saini, A. Sauer, and L. Smith (2025). FLUX.1 kontext: flow matching for in-context image generation and editing in latent space. arXiv:2506.15742 ↩︎

  75. Y. Gao, L. Gong, Q. Guo, X. Hou, Z. Lai, F. Li, L. Li, X. Lian, C. Liao, L. Liu, et al. (2025). Seedream 3.0 technical report. arXiv:2504.11346 ↩︎

  76. J. Xie, Z. Yang, and M. Z. Shou (2025). Show-o2: improved native unified multimodal models. arXiv:2506.15564 ↩︎

  77. H. Li, X. Peng, Y. Wang, Z. Peng, X. Chen, R. Weng, J. Wang, X. Cai, W. Dai, and H. Xiong (2025). OneCAT: decoder-only auto-regressive model for unified understanding and generation. arXiv:2509.03498 ↩︎

  78. C. Liao, L. Liu, X. Wang, Z. Luo, X. Zhang, W. Zhao, J. Wu, L. Li, Z. Tian, and W. Huang (2025). Mogao: an omni foundation model for interleaved multi-modal generation. arXiv:2505.05472 ↩︎

  79. H. Diao, M. Li, S. Wu, L. Dai, X. Wang, H. Deng, L. Lu, D. Lin, and Z. Liu (2026). From pixels to words – towards native vision-language primitives at scale. arXiv:2510.14979 ↩︎

  80. G. Wang, S. Zhao, X. Zhang, L. Cao, P. Zhan, L. Duan, S. Lu, M. Fu, X. Chen, J. Zhao, Y. Li, and Q. Chen (2025). Ovis-u1 technical report. arXiv:2506.23044 ↩︎

  81. Y. Xin, Q. Qin, S. Luo, K. Zhu, J. Yan, Y. Tai, J. Lei, Y. Cao, K. Wang, Y. Wang, J. Bai, Q. Yu, D. Jiang, Y. Pu, H. Chen, L. Zhuo, J. He, G. Luo, T. Li, M. Hu, J. Ye, S. Ye, B. Zhang, C. Xu, W. Wang, H. Li, G. Zhai, T. Xue, B. Fu, X. Liu, Y. Qiao, and Y. Liu (2025). Lumina-dimoo: an omni diffusion large language model for multi-modal generation and understanding. arXiv:2510.06308 ↩︎

  82. C. Wu, P. Zheng, R. Yan, S. Xiao, X. Luo, Y. Wang, W. Li, X. Jiang, Y. Liu, J. Zhou, Z. Liu, Z. Xia, C. Li, H. Deng, J. Wang, K. Luo, B. Zhang, D. Lian, X. Wang, Z. Wang, T. Huang, and Z. Liu (2025). OmniGen2: exploration to advanced multimodal generation. arXiv:2506.18871 ↩︎ ↩︎

  83. B. Lin, Z. Li, X. Cheng, Y. Niu, Y. Ye, X. He, S. Yuan, W. Yu, S. Wang, Y. Ge, Y. Pang, and L. Yuan (2025). UniWorld-v1: high-resolution semantic encoders for unified visual understanding and generation. arXiv:2506.03147 ↩︎

  84. C. Tian, D. Yang, G. Chen, E. Cui, Z. Wang, Y. Duan, P. Yin, S. Chen, G. Yang, M. Liu, Z. Zhu, Z. Fan, L. Gu, H. Wang, Q. Wei, J. Yin, X. Yang, Z. Zhong, Q. Qin, Y. Xin, B. Fu, Y. Liu, J. Ge, Q. Guo, G. Luo, H. Li, Y. Qiao, K. Chen, and H. Zhang (2026). InternVL-u: democratizing unified multimodal models for understanding, reasoning, generation and editing. arXiv:2603.09877 ↩︎

  85. J. Chen, Z. Xu, X. Pan, S. Yang, C. Qin, A. Yan, H. Zhou, Z. Chen, T. Zhou, S. Savarese, L. Xue, C. Xiong, and R. Xu (2025). BLIP3o-next: a next-generation multimodal foundation model. https://jiuhaichen.github.io/BLIP3o-NEXT.github.io/ ↩︎ ↩︎

  86. V. Panayotov, G. Chen, D. Povey, and S. Khudanpur (2015). Librispeech: an asr corpus based on public domain audio books. In 2015 IEEE international conference on acoustics, speech and signal processing (ICASSP), pp.5206–5210. ↩︎

  87. H. Bu, J. Du, X. Na, B. Wu, and H. Zheng (2017). Aishell-1: an open-source mandarin speech corpus and a speech recognition baseline. In 2017 20th conference of the oriental chapter of the international coordinating committee on speech databases and speech I/O systems and assessment (O-COCOSDA), pp.1–5. ↩︎

  88. J. Du, X. Na, X. Liu, and H. Bu (2018). Aishell-2: transforming mandarin asr research into industrial scale. arXiv:1808.10583 ↩︎

  89. A. Conneau, M. Ma, S. Khanuja, Y. Zhang, V. Axelrod, S. Dalmia, J. Riesa, C. Rivera, and A. Bapna (2023). Fleurs: few-shot learning evaluation of universal representations of speech. In 2022 IEEE Spoken Language Technology Workshop (SLT), pp.798–805. ↩︎

  90. B. Zhang, H. Lv, P. Guo, Q. Shao, C. Yang, L. Xie, X. Xu, H. Bu, X. Chen, C. Zeng, et al. (2022). Wenetspeech: a 10000+ hours multi-domain mandarin corpus for speech recognition. In ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp.6182–6186. ↩︎

  91. P. Anastassiou, J. Chen, J. Chen, Y. Chen, Z. Chen, Z. Chen, J. Cong, L. Deng, C. Ding, L. Gao, et al. (2024). Seed-tts: a family of high-quality versatile speech generation models. arXiv:2406.02430 ↩︎

  92. S. Sakshi, U. Tyagi, S. Kumar, A. Seth, R. Selvakumar, O. Nieto, R. Duraiswami, S. Ghosh, and D. Manocha (2024). Mmau: a massive multi-task audio understanding and reasoning benchmark. arXiv:2410.19168 ↩︎

  93. Y. Gong, J. Yu, and J. Glass (2022). Vocalsound: a dataset for improving human vocal sounds recognition. In ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp.151–155. ↩︎

  94. A. Mesaros, T. Heittola, and T. Virtanen (2016). TUT database for acoustic scene classification and sound event detection. In 2016 24th European signal processing conference (EUSIPCO), pp.1128–1132. ↩︎

  95. S. Lipping, P. Sudarsanam, K. Drossos, and T. Virtanen (2022). Clotho-aqa: a crowdsourced dataset for audio question answering. In 2022 30th European Signal Processing Conference (EUSIPCO), pp.1140–1144. ↩︎

  96. Kimi-Audio-Evalkit:https://github.com/MoonshotAI/Kimi-Audio-Evalkit ↩︎

  97. J. Xu, Z. Guo, H. Hu, Y. Chu, X. Wang, J. He, Y. Wang, X. Shi, T. He, X. Zhu, et al. (2025). Qwen3-omni technical report. arXiv:2509.17765 ↩︎

  98. W. He, Y. Sun, H. Hao, X. Hao, Z. Xia, Q. Gu, C. Han, D. Zhao, H. Su, K. Zhang, M. Gao, X. Su, X. Cai, X. Cai, Y. Yang, and Y. Zhao (2025). VitaBench: benchmarking llm agents with versatile interactive tasks in real-world applications. arXiv:2509.26490 ↩︎

  99. tau2-bench-revised:https://github.com/AGI-Eval-Official/tau2-bench-revised ↩︎

  100. C. E. Jimenez, J. Yang, A. Wettig, S. Yao, K. Pei, O. Press, and K. Narasimhan (2023). Swe-bench: can language models resolve real-world github issues?. arXiv:2310.06770 ↩︎

  101. M. A. Merrill, A. G. Shaw, N. Carlini, B. Li, H. Raj, I. Bercovich, L. Shi, J. Y. Shin, T. Walshe, E. K. Buchanan, J. Shen, G. Ye, H. Lin, J. Poulos, M. Wang, M. Nezhurina, J. Jitsev, D. Lu, O. M. Mastromichalakis, Z. Xu, Z. Chen, Y. Liu, R. Zhang, L. L. Chen, A. Kashyap, J. Uslu, J. Li, J. Wu, M. Yan, S. Bian, V. Sharma, K. Sun, S. Dillmann, A. Anand, A. Lanpouthakoun, B. Koopah, C. Hu, E. Guha, G. H. S. Dreiman, J. Zhu, K. Krauth, L. Zhong, N. Muennighoff, R. Amanfu, S. Tan, S. Pimpalgaonkar, T. Aggarwal, X. Lin, X. Lan, X. Zhao, Y. Liang, Y. Wang, Z. Wang, C. Zhou, D. Heineman, H. Liu, H. Trivedi, J. Yang, J. Lin, M. Shetty, M. Yang, N. Omi, N. Raoof, S. Li, T. Y. Zhuo, W. Lin, Y. Dai, Y. Wang, W. Chai, S. Zhou, D. Wahdany, Z. She, J. Hu, Z. Dong, Y. Zhu, S. Cui, A. Saiyed, A. Kolbeinsson, J. Hu, C. M. Rytting, R. Marten, Y. Wang, A. Dimakis, A. Konwinski, and L. Schmidt (2026). Terminal-bench: benchmarking agents on hard, realistic tasks in command line interfaces. arXiv:2601.11868 ↩︎

  102. D. Hendrycks, C. Burns, S. Basart, A. Zou, M. Mazeika, D. Song, and J. Steinhardt (2021). Measuring massive multitask language understanding. arXiv:2009.03300 ↩︎

  103. Y. Wang, X. Ma, G. Zhang, Y. Ni, A. Chandra, S. Guo, W. Ren, A. Arulraj, X. He, Z. Jiang, T. Li, M. Ku, K. Wang, A. Zhuang, R. Fan, X. Yue, and W. Chen (2024). MMLU-Pro: a more robust and challenging multi-task language understanding benchmark. arXiv:2406.01574 ↩︎

  104. Y. Huang, Y. Bai, Z. Zhu, J. Zhang, J. Zhang, T. Su, J. Liu, C. Lv, Y. Zhang, J. Lei, Y. Fu, M. Sun, and J. He (2023). C-Eval: a multi-level multi-discipline chinese evaluation suite for foundation models. In Advances in Neural Information Processing Systems,. ↩︎

  105. H. Li, Y. Zhang, F. Koto, Y. Yang, H. Zhao, Y. Gong, N. Duan, and T. Baldwin (2023). CMMLU: measuring massive multitask language understanding in chinese. arXiv:2306.09212 ↩︎

  106. M. Huh, B. Cheung, T. Wang, and P. Isola (2024). The platonic representation hypothesis. arXiv:2405.07987 ↩︎

  107. T. Dao, D. Fu, S. Ermon, A. Rudra, and C. Ré (2022). Flashattention: fast and memory-efficient exact attention with io-awareness. Advances in neural information processing systems 35, pp.16344–16359. ↩︎

  108. T. Dao (2023). Flashattention-2: faster attention with better parallelism and work partitioning. arXiv:2307.08691 ↩︎

  109. C. Schuhmann, R. Beaumont, R. Vencu, C. Gordon, R. Wightman, M. Cherti, T. Coombes, A. Katta, C. Mullis, M. Wortsman, et al. (2022). Laion-5b: an open large-scale dataset for training next generation image-text models. Advances in neural information processing systems 35, pp.25278–25294. ↩︎

  110. M. Byeon, B. Park, H. Kim, S. Lee, W. Baek, and S. Kim (2022). COYO-700m: image-text pair dataset. https://github.com/kakaobrain/coyo-dataset ↩︎

  111. S. Y. Gadre, G. Ilharco, A. Fang, J. Hayase, G. Smyrnis, T. Nguyen, R. Marten, M. Wortsman, D. Ghosh, J. Zhang, et al. (2023). Datacomp: in search of the next generation of multimodal datasets. Advances in Neural Information Processing Systems 36, pp.27092–27112. ↩︎

  112. A. J. Wang, D. Mao, J. Zhang, W. Han, Z. Dong, L. Li, Y. Lin, Z. Yang, L. Qin, F. Zhang, et al. (2025). TextAtlas5M: a large-scale dataset for dense text image generation. arXiv:2502.07870 ↩︎

  113. Y. Zhao, F. Xue, S. Reed, L. Fan, Y. Zhu, J. Kautz, Z. Yu, P. Krähenbühl, and D. Huang (2025). QLIP: text-aligned visual tokenization unifies auto-regressive multimodal understanding and generation. arXiv:2502.05178 ↩︎

  114. A. Kirillov, E. Mintun, N. Ravi, H. Mao, C. Rolland, L. Gustafson, T. Xiao, S. Whitehead, A. C. Berg, W. Lo, P. Dollár, and R. Girshick (2023). Segment anything. arXiv:2304.02643 ↩︎

  115. C. Wendler (2024). RenderedText dataset. Hugging Face. https://huggingface.co/datasets/wendlerc/RenderedText ↩︎

  116. A. F. Biten, R. Tito, L. Gomez, E. Valveny, and D. Karatzas (2022). Ocr-idl: ocr annotations for industry document library dataset. arXiv:2202.12985 ↩︎ ↩︎

  117. J. D. Parker, A. Smirnov, J. Pons, C. Carr, Z. Zukowski, Z. Evans, and X. Liu (2024). Scaling transformers for low-bitrate high-quality speech coding. arXiv:2411.19842 ↩︎

  118. A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, and I. Sutskever (2022). Robust speech recognition via large-scale weak supervision. arXiv:2212.04356(与脚注 20 是同一篇 Whisper 论文,原文参考文献里重复收录了 arXiv 版和 ICML 版两条) ↩︎

  119. A. F. Biten, R. Tito, A. Mafla, L. Gomez, M. Rusinol, E. Valveny, C. Jawahar, and D. Karatzas (2019). Scene text visual question answering. In Proceedings of the IEEE/CVF international conference on computer vision, pp.4291–4301. ↩︎

  120. G. Kim, T. Hong, M. Yim, J. Nam, J. Park, J. Yim, W. Hwang, S. Yun, D. Han, and S. Park (2022). Ocr-free document understanding transformer. In European Conference on Computer Vision, pp.498–517. ↩︎

  121. Z. Li, D. Li, Y. Guo, X. Guo, B. Li, L. Xiao, S. Qiao, J. Chen, Z. Wu, H. Zhang, et al. (2025). Chartgalaxy: a dataset for infographic chart understanding and generation. arXiv:2505.18668 ↩︎

  122. H. Sun, Z. Kuang, X. Yue, C. Lin, and W. Zhang (2021). Spatial dual-modality graph reasoning for key information extraction. arXiv:2103.14470 ↩︎

  123. S. Long, S. Qin, D. Panteleev, A. Bissacco, Y. Fujii, and M. Raptis (2022). Towards end-to-end unified scene text detection and layout analysis. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp.1049–1059. ↩︎

  124. S. Park, S. Shin, B. Lee, J. Lee, J. Surh, M. Seo, and H. Lee (2019). Cord: a consolidated receipt dataset for post-ocr parsing. In Workshop on document intelligence at NeurIPS, Vol. 2019, pp.5. ↩︎

  125. R. Zhang, X. Wei, D. Jiang, Z. Guo, Y. Zhang, C. Tong, J. Liu, A. Zhou, S. Zhang, P. Gao, and H. Li (2025). MAVIS: mathematical visual instruction tuning with an automatic data engine. In The Thirteenth International Conference on Learning Representations, ICLR 2025, Singapore, April 24-28, 2025,. https://openreview.net/forum?id=MnJzJ2gvuf ↩︎

  126. A. Kembhavi, M. Salvato, E. Kolve, M. J. Seo, H. Hajishirzi, and A. Farhadi (2016). A diagram is worth a dozen images. In Computer Vision - ECCV 2016 - 14th European Conference, Amsterdam, The Netherlands, October 11-14, 2016, Proceedings, Part IV, B. Leibe, J. Matas, N. Sebe, and M. Welling (Eds.), Lecture Notes in Computer Science, Vol. 9908, pp.235–251. ↩︎

  127. F. Meng, L. Du, Z. Liu, Z. Zhou, Q. Lu, D. Fu, B. Shi, W. Wang, J. He, K. Zhang, P. Luo, Y. Qiao, Q. Zhang, and W. Shao (2025). MM-eureka: exploring visual aha moment with rule-based large-scale reinforcement learning. CoRR abs/2503.07365. ↩︎

  128. H. Wang, C. Qu, Z. Huang, W. Chu, F. Lin, and W. Chen (2025). VL-rethinker: incentivizing self-reflection of vision-language models with reinforcement learning. CoRR abs/2504.08837. ↩︎ ↩︎

  129. Y. Qin, Y. Ye, J. Fang, H. Wang, S. Liang, S. Tian, J. Zhang, J. Li, Y. Li, S. Huang, et al. (2025). Ui-tars: pioneering automated gui interaction with native agents. arXiv:2501.12326 ↩︎

  130. T. Xue, C. Peng, M. Huang, L. Guo, T. Han, H. Wang, J. Wang, X. Zhang, X. Yang, D. Zhao, et al. (2026). EvoCUA: evolving computer use agents via learning from scalable synthetic experience. arXiv:2601.15876 ↩︎

  131. X. Wang, B. Wang, D. Lu, J. Yang, T. Xie, J. Wang, J. Deng, X. Guo, Y. Xu, C. H. Wu, et al. (2025). Opencua: open foundations for computer-use agents. arXiv:2508.09123 ↩︎

  132. Z. Liu, J. Xie, Z. Ding, Z. Li, B. Yang, Z. Wu, X. Wang, Q. Sun, S. Liu, W. Wang, et al. (2025). Scalecua: scaling open-source computer use agents with cross-platform data. arXiv:2509.15221 ↩︎

  133. Z. Peng, W. Wang, L. Dong, Y. Hao, S. Huang, S. Ma, and F. Wei (2023). Kosmos-2: grounding multimodal large language models to the world. arXiv:2306.14824 ↩︎

  134. R. Krishna, Y. Zhu, O. Groth, J. Johnson, K. Hata, J. Kravitz, S. Chen, Y. Kalantidis, L. Li, D. A. Shamma, et al. (2017). Visual genome: connecting language and vision using crowdsourced dense image annotations. International journal of computer vision 123 (1), pp.32–73. ↩︎

  135. S. Kazemzadeh, V. Ordonez, M. Matten, and T. Berg (2014). Referitgame: referring to objects in photographs of natural scenes. In Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP), pp.787–798. ↩︎

  136. V. K. Nagaraja, V. I. Morariu, and L. S. Davis (2016). Modeling context between objects for referring expression understanding. In European Conference on Computer Vision, pp.792–807. ↩︎

  137. L. Yu, P. Poirson, S. Yang, A. C. Berg, and T. L. Berg (2016). Modeling context in referring expressions. In European conference on computer vision, pp.69–85. ↩︎

  138. S. Shao, Z. Li, T. Zhang, C. Peng, G. Yu, X. Zhang, J. Li, and J. Sun (2019). Objects365: a large-scale, high-quality dataset for object detection. In Proceedings of the IEEE/CVF international conference on computer vision, pp.8430–8439. ↩︎

  139. A. Kuznetsova, H. Rom, N. Alldrin, J. Uijlings, I. Krasin, J. Pont-Tuset, S. Kamali, S. Popov, M. Malloci, A. Kolesnikov, et al. (2020). The open images dataset v4: unified image classification, object detection, and visual relationship detection at scale. International journal of computer vision 128 (7), pp.1956–1981. ↩︎

  140. M. Deitke, C. Clark, S. Lee, R. Tripathi, Y. Yang, J. S. Park, M. Salehi, N. Muennighoff, K. Lo, L. Soldaini, et al. (2025). Molmo and pixmo: open weights and open data for state-of-the-art vision-language models. In Proceedings of the Computer Vision and Pattern Recognition Conference, pp.91–104. ↩︎

  141. M. Acharya, K. Kafle, and C. Kanan (2019). Tallyqa: answering complex counting questions. In Proceedings of the AAAI conference on artificial intelligence, Vol. 33, pp.8076–8084. ↩︎

  142. M. L. Team, B. Wang, B. Xiao, B. Zhang, B. Rong, B. Chen, C. Wan, C. Zhang, C. Huang, C. Chen, et al. (2025). Longcat-flash-omni technical report. arXiv:2511.00279 ↩︎

  143. Y. Ma, X. Wu, K. Sun, and H. Li (2025). Hpsv3: towards wide-spectrum human preference score. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp.15086–15095. ↩︎ ↩︎

  144. P. Qi, X. Wan, N. Amar, and M. Lin (2024). Pipeline parallelism with controllable memory. arXiv:2405.15362 ↩︎

  145. Z. Shao, P. Wang, Q. Zhu, R. Xu, J. Song, X. Bi, H. Zhang, M. Zhang, Y. Li, Y. Wu, et al. (2024). Deepseekmath: pushing the limits of mathematical reasoning in open language models. arXiv:2402.03300 ↩︎

  146. J. Liu, G. Liu, J. Liang, Y. Li, J. Liu, X. Wang, P. Wan, D. Zhang, and W. Ouyang (2025). Flow-grpo: training flow matching models via online rl. arXiv:2505.05470 ↩︎ ↩︎

  147. Z. Xue, J. Wu, Y. Gao, F. Kong, L. Zhu, M. Chen, Z. Liu, W. Liu, Q. Guo, W. Huang, et al. (2025). Dancegrpo: unleashing grpo on visual generation. arXiv:2505.07818 ↩︎

  148. X. Wu, Y. Hao, K. Sun, Y. Chen, F. Zhu, R. Zhao, and H. Li (2023). Human preference score v2: a solid benchmark for evaluating human preferences of text-to-image synthesis. arXiv:2306.09341。译注:原文用这同一个 citation key 既指 HPS,又指 GOT-OCR 2.0 —— 用在 HPS 那处是对的,用在「我们用 GOT-OCR 2.0 模型识别渲染图像中的文字」那处显然是错的,参考文献里也确实没有 GOT-OCR 的条目。 ↩︎ ↩︎

  149. C. Schuhmann (2022). Laion aesthetics↩︎

  150. Y. Wang, Y. Zang, H. Li, C. Jin, and J. Wang (2025). Unified reward model for multimodal understanding and generation. arXiv:2503.05236 ↩︎

  151. F. Yao, L. Liu, D. Zhang, C. Dong, J. Shang, and J. Gao (2025). Your efficient rl framework secretly brings you off-policy rl training. https://fengyao.notion.site/off-policy-rl ↩︎

  152. J. Liu, Y. Li, Y. Fu, J. Wang, Q. Liu, and Y. Shen (2025). When speed kills stability: demystifying rl collapse from the inference-training mismatch. https://yingru.notion.site/When-Speed-Kills-Stability-Demystifying-RL-Collapse-fromthe-Inference-Training-Mismatch-271211a558b7808d8b12d403fd15edda ↩︎

  153. J. Liu, Y. Li, Y. Fu, J. Wang, Q. Liu, and Z. Jiang (2025). When speed kills stability: demystifying RL collapse from the training-inference mismatch. https://richardli.xyz/rl-collapse ↩︎

  154. Y. Ma, L. Du, X. Shen, S. Chen, P. Li, Q. Ren, L. Ma, Y. Dai, P. Liu, and J. Yan (2025). One rl to see them all: visual triple unified reinforcement learning. arXiv:2505.18129 ↩︎