本文译自阶跃星辰的 Step3-VL-10B Technical Report1,2026 年 1 月 14 日提交于 arXiv,50 页 7 图 8 表。这里翻译的是正文 §1 引言、§2 预训练、§3 后训练、§4 评测、§5 讨论、§6 结论与未来工作,外加附录 A 定性案例与附录 B 的 PaCoRe 序列化模板。附录 C「评测细节」是约 50 个 benchmark 的评测 prompt 模板与协议说明,不在译文范围内;作者名单与参考文献同样不译。

模型权重在 Hugging Face2 和魔搭3 上都有。

译注:原文的表 1、表 2、表 3 用粗体标最优、下划线标次优。markdown 没有下划线,下面这三张表里粗体表示最优斜体表示次优,其余照抄原文。

图 1:Step3-VL-10B 与当前最强多模态基础模型的性能对比。借助 PaCoRe(Parallel Coordinated Reasoning,并行协同推理),Step3-VL-10B 通过扩展推理时算力,弥合了自己与 100B+ 参数模型之间在感知与推理上的性能差距。图中六组柱状分别是 MMMU、MathVista、MathVision、MMBench、AIME2025、MultiChallenge,浅蓝为 Step3-VL-10B、深蓝为 Step3-VL-10B(PaCoRe),灰色系依次是 GLM-4.6V-106B-A12B、Qwen3VL-235B-A22B-Thinking、Seed-1.5-VL-Thinking、Gemini-2.5-Pro
图 1:Step3-VL-10B 与当前最强多模态基础模型的性能对比。借助 PaCoRe(Parallel Coordinated Reasoning,并行协同推理),Step3-VL-10B 通过扩展推理时算力,弥合了自己与 100B+ 参数模型之间在感知与推理上的性能差距。图中六组柱状分别是 MMMU、MathVista、MathVision、MMBench、AIME2025、MultiChallenge,浅蓝为 Step3-VL-10B、深蓝为 Step3-VL-10B(PaCoRe),灰色系依次是 GLM-4.6V-106B-A12B、Qwen3VL-235B-A22B-Thinking、Seed-1.5-VL-Thinking、Gemini-2.5-Pro

摘要

我们提出 Step3-VL-10B,一个轻量级开源基础模型,目标是重新定义「紧凑高效」与「前沿多模态智能」之间的权衡。Step3-VL-10B 靠两个策略性转变实现:其一,在 1.2T 多模态 token 上做统一的、全参数解冻的预训练,把一个语言对齐的 Perception Encoder 与 Qwen3-8B 解码器整合起来,建立起内在的视觉-语言协同;其二,一套规模化的后训练流水线,包含超过 1k 次迭代的强化学习。关键在于,我们实现了并行协同推理(Parallel Coordinated Reasoning,PaCoRe)来扩展推理时算力,把资源投向可扩展的感知推理——探索并综合多样的视觉假设。因此,尽管只有紧凑的 10B 体量,Step3-VL-10B 追平甚至超过了 10 到 20 倍大的模型(例如 GLM-4.6V-106B、Qwen3-VL-235B),以及 Gemini 2.5 Pro、Seed-1.5-VL 这类顶级闭源旗舰。它交出了同级最佳的成绩:MMBench 92.2%、MMMU 80.11%,复杂推理方面 AIME2025 94.43%、MathVision 75.95%。我们开源完整的模型套件,为社区提供一个强大、高效、可复现的基线。

1 引言

多模态大语言模型(MLLM)的发展,很大程度上是由对规模的不懈追求驱动的。Gemini-3-Pro4 和 GPT-5.25 这类闭源前沿模型通过大规模扩展推进了多模态智能的边界,但它们沉重的算力需求,给真实世界的实际部署设下了门槛。反过来,轻量模型(10B 参数以下)传统上被贴上「高效但受限」的标签——在受限的参数预算内,它们很难把精细推理和感知能力做上去。

本文我们介绍 Step3-VL-10B,一个重新定义紧凑高效与前沿多模态智能之间权衡的基础模型。尽管参数量只有 10B,Step3-VL-10B 在视觉感知、复杂推理和以人为中心的对齐上都表现出色。它持续优于 10B 以下规模的模型,并追平甚至超过明显更大的开放权重模型(10–20 倍于它的体量),例如 GLM-4.6V(106B-A12B)6 和 Qwen3-VL-Thinking(235B-A22B)7,以及 Gemini-2.5-Pro8、Seed-1.5-VL9 这类成名已久的闭源旗舰。在代表性 benchmark 上,Step3-VL-10B 拿到 MathVision 75.95%、MMMU 80.11%,以及惊人的 AIME2025 94.43%(图 1)。

Step3-VL-10B 的成功来自我们在「如何构建高效而强大的多模态模型」上的两个关键策略性设计:

  • 在高质量多模态语料上做统一预训练。我们在一份 1.2T token 的多模态语料上实施单阶段、全参数解冻的训练策略,聚焦两项基础能力:推理(例如通用知识与教育类任务)与感知(例如 grounding、计数、光学字符识别与图形用户界面交互)。通过联合优化 Perception Encoder10 与 Qwen3-8B11 解码器,Step3-VL-10B 建立起内在的视觉-语言协同。
  • 规模化的多模态强化学习与并行推理。我们靠一套严格的后训练流水线释放前沿能力:两阶段监督微调(SFT)加上超过 1k 次迭代的强化学习,同时使用可验证奖励(RLVR)和人类反馈(RLHF)。在顺序推理之外,我们采用并行协同推理(PaCoRe)12,把推理时算力分配给「从并行视觉探索中聚合证据」这件事。这些设计让一个 10B 模型能够解决那些通常需要大得多的系统才能解决的复杂感知与推理任务。

为理解这份效率背后的驱动力,我们在 §5 深入分析了模型的内部机制,重点是 RL 扩展所解锁的学习动力学。特别地,为了对抗感知任务特有的长度收缩现象,我们用 PaCoRe 促成一种多智能体综合:并行的提议者生成多样的假设,随后经由顺序的交叉检验被蒸馏出来。这种涌现出的综合行为,有效地把隐式的视觉处理过程外化了出来,为扩展感知推理指出了一个有希望的方向。

这条轨迹不仅揭示了模型如何逐步弥合智能与物理世界交互之间的鸿沟(§6),也促使我们下决心补上开放生态里那些关键的技术缺口。通过发布最终的模型权重和详细的训练文档,Step3-VL-10B 表明:只要有恰当的、以感知与推理为中心的设计,「紧凑」与「前沿」之间的差距不再是不可逾越的。

2 预训练

我们的预训练框架旨在构建一个能力强的视觉基础模型,为后续后训练阶段设定一个高的上限;相比不必要的复杂度,我们优先考虑数据质量与架构协同。

2.1 架构

Step3-VL-10B 整合了 1.8B 的语言优化版 Perception Encoder(一个 ViT 系视觉主干)10——之所以选它而不是空间优化版本,是因为它预先对齐好的语言学特征能保证更好的收敛。这个视觉主干与 Qwen3-8B11 配对,后者用作解码器,看重的是它扎实的文本生成基础,以及在多模态适配上已被证明的可塑性。与 Step-313 和 DeepSeek-OCR14 类似,这两个组件之间由一个 projector 桥接,它通过两个连续的 stride-2 层做 16 倍空间下采样,在保留关键信息的同时有效压缩了视觉 token。为了高效捕捉细粒度细节,我们采用 multi-crop 策略15,把图像分解成一个 728×728 的全局视图和多个 504×504 的局部裁剪块。这个设计利用 batch 维度上的并行,绕开了 变长打包16的复杂度。最后,我们通过在每行 patch 后追加换行 token 来编码空间结构,并采用标准的一维 RoPE17 做位置建模——在我们的设定下,更花哨的变体没有带来显著收益。

2.2 数据构建

为了让 Step3-VL-10B 同时具备细粒度感知与复杂推理能力,我们纳入了一份大规模文本语料18,并构建了一份覆盖以下关键领域的综合性多模态预训练数据集。

知识。我们从多条互补渠道整理知识密度高的视觉数据,既覆盖结构化的图文交错数据,也覆盖多样的图文对。

  • 图文交错数据。我们从 Common Crawl19 和我们自研的、面向国内互联网的爬虫 StepCrawl 收集图文交错数据,并进一步用基于关键词的搜索结果扩充这份语料。为抑制网页规模数据固有的噪声,我们丢弃图片下载失败率过高(>90%)的网页、二维码内容,以及长宽比极端的图像。
  • 图文对。我们把图文对组织成四类互补来源:(1)开源数据集,包括 LAION20、COYO21、BLIP-CCS22 和 Zero23。为缓解长尾概念的不均衡,我们用基于 CLIP24 的聚类做概念均衡重采样。(2)基于关键词的检索,从高质量知识网站挖掘关键词,用它们去查询商业搜索引擎(例如百度和 Bing),以采集有针对性的领域数据。(3)从交错数据中抽取的图文对:对每张图,我们从其上下文(上方、下方以及 alt 文本)中抽取候选描述,然后用基于 CLIP 的相似度评估对齐程度、用美学分数评估图像质量,从中挑出最合适的一条。(4)Mosaic 增强,把四张图拼接成单个输入。这有效扩展了输入分辨率,提高了每个样本内的视觉内容密度,并促使模型学习跨多个区域的空间与位置推理。

教育。我们整理了一份约 1500 万样本的数据集,横跨 K-12 教育、高等教育与成人学习。K-12 子集覆盖数学、物理、化学与人文,包含化学式与结构图这类专门数据(来自开源数据集,并用 CoSyn25 合成生成),以及由合成数据与带标注图注的真实考试图片混合构建的几何(含解析几何)题目。除此之外,这份数据集还延伸到大学层面的领域,包括 STEM、医学、艺术与金融,以及驾照考试、CPA、法律考试这类成人教育场景。考题来自获得授权的考试材料与开源题库262728的组合,配套的知识内容则来自教科书、习题册与高质量教育网站。

光学字符识别(OCR)。我们整理了一份综合性 OCR 语料,横跨图像级与文档级的文字识别,以及视觉到代码的重建。

  • 图到文。我们整理了一份包含 1000 万张真实图像与 3000 万合成样本的数据集,覆盖多样的字体、版式与文字朝向。真实数据从开源数据集2930收集,并用 PaddleOCR31 标注;合成样本用 SynthDog32 生成。
  • 图到代码。我们按目标代码形式来组织这份数据集,横跨标记类与程序化图形两类。(1)标记类代码。对 Markdown、LaTeX 和 Matplotlib,我们把来自开源数据集333435的 1000 万以上样本,与一条能产出 1500 万以上合成信息图的自动化数据生成流水线结合起来。我们没有把生成任务完全交给 LLM25,而是在多种渲染工具上强制执行细粒度的渲染规则。(2)程序化图形代码。对 TikZ、Graphviz 这类语言,我们整理了约 500 万个重建任务,要求把视觉输入翻译成可执行代码,视觉输入涵盖自然图像、人工制作的表格与几何图形。
  • 文档到文本。这份数据集包含约 8000 万整页文档。具体来说,我们用 PaddleOCR 或 MinerU 2.036 给从书籍和学术论文收集来的页面做标注。
  • 文档到代码。我们整理了横跨 HTML、Markdown 和 LaTeX 三种主要标记语言的数据。HTML 数据聚焦以表格为中心的内容,来自渲染网页的代码以及 Markdown 转换。Markdown 数据覆盖表格与轻量文档,来自渲染后的 GitHub README 文件以及 HTML 转换。LaTeX 数据从 arXiv 语料大规模抽取,约含 400 万张表和 1 亿条公式。渲染过程中我们显式处理了引用和超链接这类元素,避免视觉与文本内容之间对不上。此外,我们纳入开源数据集37383940来进一步丰富这个子集。

Grounding 与计数。我们收集了约 4 亿样本来支撑细粒度的感知理解。Grounding 数据既有基于边界框的、也有基于点的标注,来自 OpenImages41、COCO42、Merlin4344 和 PixMo45 这类开放检测数据集,以及我们内部的文本段落检测任务。计数数据取自开源计数数据集4647,并进一步通过把高质量目标检测标注转换成计数形式来构造。

视觉问答(VQA)。这个子集包含约 1000 万样本,针对整体的图像内容理解。它包括经过筛选的开源 VQA 数据集4849,以及从图像 caption 数据自动生成的高质量问答对。此外,我们构建了一个约 2000 万样本的 OCR VQA 子集,把开源数据505152与从其他 OCR 相关任务生成的问答对结合起来。

图形用户界面(GUI)。我们按 Step-GUI53 的做法构建了一份大规模 GUI 数据集,约 2300 万样本,赋予模型实用且可执行的 UI 理解与交互能力。这份数据集覆盖移动平台(含 Android 和 iOS)与桌面环境(横跨 Windows、Linux 和 macOS),数据采自 200 多个应用。值得一提的是,精确的 grounding 标注是与轨迹数据一起生成的,这保证了动作执行与感知之间的监督信号是一致的。

  • Caption。这个子集为 UI 界面提供 70 万条详细描述,把页面布局与功能区域的显式知识传达出来,以支撑对界面的结构化理解。
  • 知识 VQA。我们纳入 100 万以上问答对,强化对 UI 元素的精确定位与功能理解。
  • 轨迹建模。为建模真实的顺序人机交互,我们整理了 200 万以上轨迹样本,定义在一个由 12 个原子动作(例如 CLICK、SLIDE、TYPE)构成的细粒度动作空间上。这些轨迹强化了动作输出格式、状态总结与决策能力,覆盖操作执行、信息检索与信息总结等多种任务。
  • Grounding。数据集还包含 1900 万以上 grounding 样本,横跨多样的界面布局与分辨率,同时有基于点和基于边界框的形式。
  • OCR。针对面向 Browser-use-GUI 的网页界面,我们爬取了约 3000 万网页,抽取文本内容连同精确的元素坐标,以支撑细粒度的、感知版式的理解。

2.3 训练配方

我们采用单阶段、全参数解冻的训练策略,用 AdamW54 优化($\beta_1 = 0.9$、$\beta_2 = 0.95$、$\varepsilon = 10^{-8}$,权重衰减 $= 0.01$),在总计 1.2T token 上训练 370K 次迭代,全局 batch size 为 8,192、序列长度 4,096。

为了在训练规模与数据质量之间取得平衡,我们采用两阶段学习率调度。第一阶段覆盖最初的 900B token,学习率从 $5 \times 10^{-5}$ 衰减到 $1 \times 10^{-5}$,强调广泛的表示学习。第二阶段覆盖剩下的 300B token,我们切换到更高质量的数据配比,并把学习率从 $1 \times 10^{-5}$ 进一步退火到 $6 \times 10^{-6}$,充当一个冷却阶段来夯实细粒度感知(例如 OCR 和 grounding)与推理能力。

3 后训练

在后训练阶段,我们采用两阶段 监督微调(SFT)策略,随后是强化学习(RL)。RL 阶段我们用 Proximal Policy Optimization(PPO)55配合广义优势估计(GAE)56作为核心优化算法,并搭配一套精心设计的奖励系统。关键在于,我们通过从顺序推理推进到并行协同推理来扩展推理算力,目标是彻底释放 Step3-VL-10B 的感知与推理能力。

3.1 监督微调

数据构建。我们的 SFT 策略聚焦多模态、高质量、面向推理的数据。我们最初从开源社区5758收集了数百万条 prompt,横跨数学、编程、科学、逻辑推理等多个领域。我们还纳入了用于视觉感知与识别的开源数据集596061,包括 grounding、OCR 与复杂文档/图表理解,以确保模型能精确感知视觉元素并在其上推理。基于这些 prompt,我们从内部前沿模型蒸馏出高质量回复。这份基础数据集经过了一道严格的「双管」过滤:先用预定义规则消除退化模式(例如无限重复),再通过精确匹配与 $N$-gram 匹配($N = 64$)做全面的 benchmark 去污染。

两阶段 SFT 策略。我们实施分阶段的训练方式,逐步对齐模型跨模态的推理能力。训练用的全局 batch size 为 $32$,序列长度扩展到 $128$k 以支持长上下文理解。

  • 阶段 1:文本主导的推理。数据配比设为文本与多模态样本 $9:1$,建立扎实的逻辑与语言基础。
  • 阶段 2:多模态整合。我们把配比调整到 $1:1$,有效平衡文本推理与视觉智能,以提升模型在图文交错任务上的表现。

训练配方。我们采用余弦学习率调度,带 $200$ 步 warmup,学习率峰值 $1 \times 10^{-4}$、退火到最终的 $1 \times 10^{-5}$。为了优化在多样数据源上的学习过程,我们在 dataloader 里实现了按领域区分的采样权重,这在实际效果上意味着不同领域的 epoch 数不同。整个两阶段过程中,模型在阶段 1 训练了约 $190$B token、阶段 2 约 $36$B。

3.2 强化学习

3.2.1 优化算法

我们采用 PPO 结合 GAE 作为 强化学习的优化算法,做法上跟随 Open-Reasoner-Zero62 和 Open-Vision-Reasoner63

形式上,给定一个由图像 $I$ 与文本 prompt $q$ 构成的多模态输入元组,策略网络 $\pi_\theta$ 生成一条长度为 $T$ 的回复轨迹 $\tau = (s_0, a_0, \ldots, s_{T-1}, a_{T-1})$。状态 $s_t$ 封装了输入上下文 $(I, q)$ 以及第 $t$ 步之前生成的 token 序列,而 $a_t$ 表示在第 $t$ 步采样出的动作(token)。

为了在策略梯度估计中有效平衡偏差-方差权衡,我们用 GAE 来计算优势。状态-动作对 $(s_t, a_t)$ 的优势估计量 $\hat{A}_t$ 定义为:

$$ \hat{A}_t = \sum_{l=0}^{T-t-1} (\gamma \lambda)^l \delta_{t+l}, \quad \text{with} \quad \delta_{t'} = r_{t'} + \gamma V_\phi(s_{t'+1}) - V_\phi(s_{t'}), $$

其中 $r_{t'}$ 是第 $t'$ 步的奖励,$V_\phi$ 表示以 $\phi$ 为参数的价值函数,$\gamma, \lambda \in [0, 1]$ 分别是折扣因子与 GAE 平滑参数。

策略参数 $\theta$ 通过最大化 clipped surrogate 目标来更新,这个目标会惩罚过大的策略偏移,从而维持训练稳定:

$$ \mathcal{J}_{\text{PPO}}(\theta) = \hat{\mathbb{E}}_{t} \left[ \min \left( \rho_t(\theta) \hat{A}_t, \text{clip} \left( \rho_t(\theta), 1 - \epsilon, 1 + \epsilon \right) \hat{A}_t \right) \right], $$

其中 $\rho_t(\theta) = \frac{\pi_\theta(a_t | s_t)}{\pi_{\text{old}}(a_t | s_t)}$ 是概率比,$\epsilon$ 是裁剪超参数。

与此同时,价值函数通过最小化估计值与目标值 $V_t^{\text{target}}$ 之间的均方误差来更新,目标值通常取估计的折扣回报 $G_t = \hat{A}_t^{\text{GAE}(\gamma, \lambda)} + V_\phi(s_t)$:

$$ \mathcal{J}_{\text{value}}(\phi) = \frac{1}{2} \mathbb{E}_{\tau \sim \pi_{\theta_{\text{old}}}} \left[ \sum_{t=0}^{T-1} \left( V_\phi(s_t) - V_t^{\text{target}} \right)^2 \right], $$

具体地,我们在 off-policy 设定下采用一个带 GAE($\gamma = 1, \lambda = 1$)的 PPO 变体,省略了标准的重要性采样。每次迭代把样本切成四个 mini-batch。actor 与 critic 的学习率分别设为 $2 \times 10^{-6}$ 和 $5 \times 10^{-6}$。为缓解 训练-推理不一致,我们按文献64的做法应用截断重要性采样比,阈值 $C = 8$。整个 RL 阶段跑 1,400 次训练迭代,只更新解码器、保持编码器冻结。

3.2.2 奖励系统

为了支撑跨异构模态与任务类型的可扩展训练,我们设计了一套一分为二的 奖励框架,显式区分可验证任务(客观正确性能被可靠评判)与不可验证任务(对齐必须由偏好建模与约束来引导)。

可验证奖励:精确性与一致性。对于有现成 ground truth 的任务,我们的奖励设计优先考虑严格的正确性与推理一致性。我们实现了一条多层面的验证流水线,把基于感知的信号与模型辅助的信号结合起来。

  • 感知奖励。对于指点与 grounding 这类感知任务,我们跟随 Perception-R165,用 IoU(交并比)或欧氏距离这类度量,把模型的几何输出与确定性的 ground truth 对齐。关键在于,我们采用严格的、随距离衰减的奖励塑形,以保证优化地形清晰无歧义、RL 收敛稳健。
  • 基于模型的验证。对于一般视觉任务,我们部署 GPT-OSS-120B66 作为答案验证器。相比简单的字符串匹配或 mathverify 式的启发式规则,这套基于模型的验证机制对噪声大或不完美的 ground truth 鲁棒得多,也显著改善了训练稳定性。具体来说,它提供了对解析不敏感的评估(能扛住格式差异,例如奇形怪状的 LaTeX),能识别数学上等价的表达式或换了顺序的推导步骤,并通过惩罚假阳性——即模型经由有缺陷或缺乏依据的推理却得到正确最终答案的情形——来强制过程一致性。这些性质合在一起,为监督复杂推理行为提供了更可靠的奖励信号。

不可验证奖励:偏好与约束。对于没有 ground truth 的开放式生成,我们依靠学到的偏好模型与启发式约束来引导以人为中心的对齐。

  • 生成式奖励建模(GenRM)。我们采用成对偏好框架,让 GenRM 把 rollout 与一个能力更强的教师模型生成的回复放在一起评判。我们的 GenRM 不止步于直接的结果连续打分,而是在推导出细粒度标量分数之前先做一次显式的推理判断,以分辨看上去都说得过去的回复之间的细微质量差异。
  • 行为正则化。为了缓解「reward hacking」并在优化过程中强制安全与可靠性约束,我们把一组基于模型的惩罚项作为行为正则化引入。具体来说,我们施加语言一致性惩罚来抑制语码转换和问答语言不匹配;应用严格的引用验证,一旦检测到编造的参考文献或链接就把奖励清零,直接从源头打击幻觉;并引入认识论校准惩罚来压制无依据的笃定或过度自信的断言,鼓励模型在模糊或信息不足的场景下恰当地表达不确定性。这些约束合在一起充当护栏,稳定了偏好优化,并把模型行为与安全、可信的目标对齐。

3.2.3 扩展顺序推理

我们的目标是通过激励更长的顺序思考过程来扩展模型的 推理能力,把推理时算力有效地转换成性能收益。具体来说,我们把顺序推理训练组织成:先在可验证任务上建立稳固的逻辑基础,再与主观的人类偏好对齐。

基于可验证奖励的强化学习(RLVR)。我们在一批多样的可验证多模态任务上训练,取材于 Open-Vision-Reasoner63 这类大规模开源数据集——它们覆盖数学、几何、物理、科学推理、感知、识别、基于图表的推理和谜题——再加上来自 Perception-R165 的视觉 grounding 任务以及内部的 K–12 教育资源。

为保证监督信号的质量,我们沿三条轴设计了一条多维过滤流水线。(1)可检验性:用 GPT-OSS-120B 对每条 prompt 做四次独立验证,只保留四次全部一致的样本。(2)视觉相关性:用一个早期版本的 Step3-VL-10B 来评估图像与问题之间的语义相关性与相互贡献,滤掉冗余或对不上的图文配对。(3)最后是难度控制:每条 prompt 做 24 次 rollout,识别出「部分通过」(some-accept)的样本,也就是既不会被轻易解出、也不会一直失败的那些。每一道过滤都在保证长期训练稳定、支撑性能持续提升上起了实打实的作用。RLVR 阶段执行 600 次迭代,最大序列长度 24k。每次迭代采样 512 条 prompt、每条 prompt 16 次 rollout,用前述可验证奖励系统做优化。

基于人类反馈的强化学习(RLHF)。在 RLVR 产出的、以推理为重心的 checkpoint 之上,我们用开放式任务进一步把模型与人类偏好对齐。我们从开源的竞技场数据集676869和内部指令池中筛选 prompt,显式挑出那些缺乏确定性 ground truth 的不可检验查询。对这些 prompt,我们用最强的内部模型生成高质量参考回复,作为偏好学习的锚点。这个阶段执行 300 次迭代,最大序列长度 32k。我们保持每次迭代 512 条 prompt、每条 8 次 rollout 的吞吐,针对不可验证奖励系统做优化,以打磨模型的对话与对齐能力,同时保住它底层的推理实力。

3.2.4 进一步扩展并行协同推理

为了把推理时算力扩展到顺序生成的极限之外,我们跟随 PaCoRe12 采用并行协同推理范式。这套做法把算力分配给「并行探索多样的感知假设」,再把它们综合成一个统一的结论。

为构造并行推理的训练数据,我们把 RLVR 阶段的难度过滤(第 3 条轴)延伸了一步。我们把难度打标阶段的那 24 次 rollout 重新利用为一个消息缓存池。从已识别出的 some-accept prompt 出发,我们施加一道二次的综合过滤来确保「协同可解」:(1)我们模拟并行推理过程——从池中采样 16–24 条消息,作为「综合上下文」喂回模型来重新生成回复。(2)我们严格只保留那些在这种协同设定下仍然被归为 some-accept 的实例。关键在于,这既避免了任务被简化到无意义(从而保住有效的奖励信号),又迫使模型执行多视角的自我验证与交叉检验。

模型在严格 on-policy 的设定下用 PPO 优化 500 次迭代。我们采用 64k 的最大序列长度以容纳聚合后的上下文。每次迭代采样 64 条 prompt、每个实例 16 次 rollout,针对可验证奖励系统稳定地优化协同行为。

4 评测

为了严格验证 Step3-VL-10B 的能力,我们在多模态与纯文本两大类的一批广泛 benchmark 上做了大量评测。结果把 Step3-VL-10B 摆在了 10B 参数级别最强开源模型的位置:它不只是显著优于 7–10B 的开源模型,在推理与感知领域还能与前沿开源系统(10–20 倍大)以及闭源旗舰掰手腕。

4.1 评测设定

Benchmark 协议。我们在 60 多个 benchmark 组成的综合套件上评测 Step3-VL-10B。为了做出与所报结果一致的整体评估,我们把这些 benchmark 按多模态与纯文本两种模态划分到具体的能力域中。

I. 多模态 benchmark。我们在九个不同的领域上评估视觉-语言能力:

  • STEM / 多模态推理:科学与数学推理用 MMMU(Standard/Pro)70、MathVista71、MathVision72、MathVerse73、DynaMath74、We-Math75 和 PhyX76。逻辑与解谜能力通过 LogicVista77、ZeroBench78、VisuLogic79 和 HLE80 检验。
  • 识别 / 通用 VQA:通用感知用 MMBench(EN/CN)81、SimpleVQA82 和 MMStar83 评估。鲁棒性与细粒度识别通过 HallusionBench84、MMVP85、ReMI86、M3GIA87 和 DoYouSeeMe88 评估。
  • 计数:我们用 CountBench89、CountQA90 和 PixMo-Count45 来评估精确的目标计数。
  • 指令遵循:多模态合规性在 MM-MT-Bench91、MIA-Bench92 和 MM-IFEval93 上检验。
  • 多模态代码:视觉编程能力用 HumanEval-V94 和 Design2Code(含 Design2Code-Hard)95 评估。
  • OCR:富文本图像理解通过 OCRBench96、OmniOCR97 和 CC-OCR98 评估。
  • 2D / 3D 空间理解:我们用 BLINK99、CVBench100、MMSI-Bench101、ERQA102、OmniSpatial103、All-Angles-Bench104、MindCube-tiny105、RealWorldQA106、SpatialViz-Bench107、STARE108、CoreCognition109、V*110 和 ViewSpatial111 做了大量空间推理测试。
  • 文档与图表理解:复杂解析在 CharXiv(RQ)112、AI2D113、OmniDocBench114 和 CSVQA115 上检验。
  • GUI Grounding:为评估可执行的智能,我们采用 ScreenSpot-Pro116、ScreenSpot-V2117、OSWorld-G118 和 MMBench-GUI119

II. 纯文本 benchmark。我们在六个类别上验证 LLM 底座:

  • 考试:通用知识在 MMLU-Pro120、GPQA-Diamond121、SuperGPQA122 和 LiveBench123 上评估。
  • 数学:数学推理在 AIME(2024/2025)124125、Beyond-AIME126、HMMT25127、CNMO 2024128 和 IMO-AnswerBench129 上严格检验。
  • 代码:纯文本编程通过 LiveCodeBench(2408-2505)130 评估。
  • 指令遵循:我们用 IFEval131、IFBench132 和 MultiChallenge133
  • 主观:开放式生成质量在 Arena-Hard-V2134 和 WildBench135 上评估。
  • 医学:领域专项知识在 HealthBench136 上检验。

推理设定。我们用固定配置评测 Step3-VL-10B(temperature=1.0、top-p=1.0、top-k=0)。默认情况下模型使用顺序推理(Sequential Reasoning,SeRe),在给出答案之前生成包在 <think></think> 标签里的思考内容,最大长度 65,536 token。对于复杂感知与高阶推理任务,我们采用并行协同推理(PaCoRe)12:把 16 条 SeRe rollout 综合成一段上下文,再据此做最终推理(更多细节见附录 B)。PaCoRe 模式下最大长度扩展到 131,072 token 以容纳扩张后的上下文,其余超参保持一致。

对比模型。我们把 Step3-VL-10B 与代表性的 7B–10B 开源模型作对比,包括 GLM-4.6V-Flash(9B)6、Qwen3-VL-Thinking(8B)7、InternVL-3.5(8B)137 和 MiMo-VL-RL-2508(7B)138。为做可扩展性分析,我们还与更大的系统对比:GLM-4.6V(106B-A12B)6、Qwen3-VL(235B-A22B)7、Gemini-2.5-Pro8 和 Seed-1.5-VL9

4.2 多模态评测结果

在表 1 中,我们把 Step3-VL-10B 与 7B–10B 参数区间内的强开源模型做了对比。结果表明,Step3-VL-10B 为紧凑模型立下了新的性能标准,在几乎所有能力域上都占据首位。下面我们逐项拆解。

表 1:与当前最强的开源模型(7B–10B)在多模态 benchmark 上的对比。粗体为最优、斜体为次优(原文用下划线)。† 表示引自原论文报告的结果。

类别 Benchmark Step3-VL-10B (10B) GLM-4.6V Flash (9B) Qwen3-VL Thinking (8B) InternVL 3.5 (8B) MiMo-VL RL-2508 (7B)
STEM / 多模态推理 MMMU 78.11 71.17 73.53 71.69 71.14
STEM / 多模态推理 MMMU-Pro 64.08 59.93 60.94 59.11 60.29
STEM / 多模态推理 MathVision 70.81 54.05 59.60 52.05 59.65
STEM / 多模态推理 MathVista 83.97 82.85 78.50 76.78 79.86
STEM / 多模态推理 LogicVista 66.89 60.29 64.37 54.03 63.37
STEM / 多模态推理 DynaMath 56.39 48.40 45.11 39.47 51.65
STEM / 多模态推理 ZeroBench (main) 1.00 0.50 0.50 0.75 0.50
STEM / 多模态推理 ZeroBench (sub) 27.54 24.03 20.58 18.56 21.18
STEM / 多模态推理 MathVerse (vision) 75.73 71.41 73.19 65.18 73.19
STEM / 多模态推理 We-Math 73.03 61.86 67.31 51.26 63.24
STEM / 多模态推理 VisuLogic 29.68 26.50 27.82 27.20 24.52
STEM / 多模态推理 PhyX 59.45 52.28 57.67 50.51 56.00
STEM / 多模态推理 HLE 10.73 3.82 5.98 4.51 5.90
识别 / 通用 VQA MMBench EN 92.05 91.04 90.55 88.20 89.91
识别 / 通用 VQA MMBench CN 91.55 89.56 89.75 86.24 88.79
识别 / 通用 VQA SimpleVQA 53.08 52.09 48.69 41.43 49.65
识别 / 通用 VQA MMStar 77.48 74.26 73.58 69.83 72.93
识别 / 通用 VQA HallusionBench 64.91 59.92 62.23 58.79 63.53
识别 / 通用 VQA MMVP 68.16 63.33 57.17 51.33 63.50
识别 / 通用 VQA ReMI 67.29 60.75 57.17 52.65 63.13
识别 / 通用 VQA M3GIA 78.36 76.66 76.86 62.38 65.84
识别 / 通用 VQA DoYouSeeMe 67.48 65.52 56.90 38.22 60.92
计数 CountBench 88.75 90.22 88.85 82.18 83.60
计数 CountQA 33.69 33.79 23.35 22.32 27.41
计数 PixMo-Count 70.85 76.42 69.51 63.24 69.98
指令遵循 MM-MT-Bench 8.14 6.94 8.16 7.46 8.08
指令遵循 MIA-Bench 92.00 89.99 92.35 90.89 90.91
指令遵循 MM-IFEval 61.87 60.78 60.93 60.80 61.28
代码 HumanEval-V 66.05 29.26 26.94 24.31 31.96
代码 Design2Code 79.55 25.93 72.21 64.15 82.54
代码 Design2Code (hard) 54.69 19.37 48.75 46.25 59.38
OCR OCRBench 86.75 85.97 82.85 83.70 85.40
OCR OmniOCR 76.98 80.24 75.53 70.97 74.38
OCR CC-OCR (Multi-Lang-OCR) 76.59 70.85 69.25 66.42 72.06
2D / 3D 空间理解 BLINK 66.79 64.90 62.78 55.40 62.57
2D / 3D 空间理解 CVBench 83.49 86.01 84.81 77.52 82.04
2D / 3D 空间理解 MMSI-Bench 32.18 31.13 29.05 28.12 29.60
2D / 3D 空间理解 ERQA 48.87 45.13 44.31 38.88 41.94
2D / 3D 空间理解 OmniSpatial 51.58 49.41 46.56 47.49 46.74
2D / 3D 空间理解 All-Angles-Bench 57.21 53.24 45.88 45.29 51.62
2D / 3D 空间理解 MindCube-tiny 62.81 45.00 41.06 34.65 39.06
2D / 3D 空间理解 RealWorldQA 74.44 76.93 71.93 66.93 72.78
2D / 3D 空间理解 SpatialViz-Bench 45.51 33.79 35.15 32.42 28.94
2D / 3D 空间理解 STARE 61.75 56.45 54.95 48.20 55.06
2D / 3D 空间理解 CoreCognition 66.69 65.11 64.04 61.70 65.30
2D / 3D 空间理解 V* 82.85 83.51 81.02 66.89 83.38
2D / 3D 空间理解 ViewSpatial 46.14 43.26 45.20 35.96 40.19
文档与图表理解 CharXiv (RQ) 59.52 59.70 53.48 47.15 59.32
文档与图表理解 AI2D 89.35 88.93 83.32 82.34 84.96
文档与图表理解 CSVQA 63.33 54.99 61.32 46.62 60.23
文档与图表理解 OmniDocBench NED↓ 21.51 24.88 23.38 29.47 23.30
GUI Grounding ScreenSpot-Pro 51.55 45.68 46.60† 15.39 34.84
GUI Grounding OSWorld-G 59.02 54.71 56.70† 31.91 50.54
GUI Grounding ScreenSpot-V2 92.61 92.14 93.60† 84.02 90.82
GUI Grounding MMBench-GUI (L2) 81.50 78.46 76.60 63.95 75.69

STEM 与多模态推理。在所有针对数学与科学推理的 benchmark 上,Step3-VL-10B 都持续优于 7B–10B 区间内有竞争力的开源模型。Step3-VL-10B 在 MMMU(Standard/Pro)上拿到 78.11%/64.08%,尤其在 MathVision 上,它比 MiMo-VL-RL-2508 和 Qwen3-VL 这类强基线高出 10 分以上。这些增益主要可归因于充分的预训练以及规模化的 RL 算力。

识别与通用 VQA。Step3-VL-10B 在视觉识别与 VQA 任务上持续表现出优越性能,在所有被评测的 benchmark 上都超过了现有基线。值得一提的是,Step3-VL-10B 在 MMBench(EN/CN)上拿到 92.05%/91.55%,在 10B 参数规模内确立了最强表现。我们把这份出色表现归功于大规模、高质量的多模态预训练,尤其是把 Perception Encoder 扩展到 1.8B 这件事。

2D / 3D 空间理解。尽管没有做针对性的数据整理,Step3-VL-10B 在 2D 和 3D 环境下都展现出令人瞩目的空间感知与推理能力。这种涌现出来的能力,凸显了它作为下游可执行场景(例如 具身智能与机器人控制)稳健基座的巨大潜力。

OCR 与文档理解。Step3-VL-10B 展现出前沿级的文档智能,OCRBench 86.75%、AI2D 89.35%。这份能力源自我们系统化的 OCR 数据构建——大规模真实数据采集与高保真合成生成的结合。

GUI Grounding 与交互。在可执行智能方面,Step3-VL-10B 以 ScreenSpot-V2 92.61%、OSWorld-G 59.02% 领跑榜单。这些优势验证了我们的轨迹建模思路:在细粒度动作轨迹(例如 CLICK、SCROLL)上训练,能有效把视觉元素落到可执行动作上,胜过只靠静态描述的方法。值得注意的是,这些增益还被与感知奖励系统结合的 RL 进一步放大,显著增强了模型在复杂 GUI 环境中的泛化能力。

4.3 纯文本评测结果

表 2 表明,Step3-VL-10B 在扩展多模态训练的同时保住了高保真的语言智能。与此前的 VL 模型不同,Step3-VL-10B 有效避开了文本与视觉模态之间的性能取舍。

表 2:与最强开源模型(7B–10B)在纯文本 benchmark 上的对比。粗体为最优、斜体为次优。

类别 Benchmark Step3-VL-10B (10B) GLM-4.6V Flash (9B) Qwen3-VL Thinking (8B) InternVL 3.5 (8B) MiMo-VL RL-2508 (7B)
考试 MMLU-Pro 76.02 72.30 77.09 76.03 73.81
考试 GPQA-Diamond 70.83 49.37 67.55 65.12 59.97
考试 SuperGPQA 50.38 42.95 49.52 42.35 45.69
考试 LiveBench(2024-11-25) 69.71 44.11 70.79 55.62 54.35
数学 AIME2024 90.94 37.92 74.06 78.18 75.36
数学 AIME2025 87.66 33.02 62.92 62.50 66.51
数学 HMMT25 78.18 19.17 45.21 35.78 47.34
数学 CNMO2024 78.20 61.72 79.22 66.56 76.17
数学 BeyondAIME 63.23 11.80 30.59 66.56 43.94
数学 IMO-AnswerBench 62.12 22.62 38.69 35.00 48.44
代码 LiveCodeBench (2408-2505) 75.77 22.17 51.05 45.90 39.65
指令遵循 IFEval 82.16 74.86 83.23 79.72 68.62
指令遵循 IFBench 43.28 27.47 36.65 28.14 23.47
指令遵循 MultiChallenge 62.64 42.49 49.82 37.73 44.69
主观 Arena-Hard-V2 58.57 9.26 47.34 15.57 28.59
主观 WildBench 86.04 34.04 72.36 56.45 63.09
医学 HealthBench 44.67 31.80 47.45 35.54 43.58

数学与代码。Step3-VL-10B 在复杂推理任务上明显甩开同侪。它在 IMO-AnswerBench(62.12%)、LiveCodeBench(2408-2505)(75.77%)这类有挑战性的 benchmark 上的出色表现,有力证明了它稳健的逻辑推断能力,使它成为需要高阶问题求解技能的任务上的领先模型。

人类对齐。Step3-VL-10B 出色的指令遵循能力与主观任务表现,进一步显示出它与人类偏好的高度对齐,有效弥合了 10B 尺寸模型历来存在的可用性缺口。我们内部基于 Elo 的评估确认,Step3-VL-10B 拿到的偏好分数能够匹配明显更大的开源模型,说明它具备高质量真实部署的潜力。

4.4 与更大模型的对比

为评估 Step3-VL-10B 的性能上限,我们把它与强开源模型(10–20 倍大)以及闭源旗舰做了对标。如表 3 所示,Step3-VL-10B 有效弥合了有限参数规模(10B)与前沿智能之间的差距。在标准 benchmark 上,Step3-VL-10B 在感知、识别与复杂推理任务上都胜过 GLM-4.6V(106B-A12B),同时与 Qwen3-VL-Thinking(235B-A22B)保持竞争力。值得注意的是,它拿到 MathVision 70.81%、AIME 2025 87.66%、MMStar 77.48%,在紧凑的 10B 预算内展现出卓越的多模态智能。

表 3:与 10–20 倍大的模型以及领先闭源系统在多模态与纯文本 benchmark 上的对比。SeRe 与 PaCoRe 分别指顺序推理与并行协同推理12。粗体为最优、斜体为次优。† 表示引自原论文报告的结果。

类别 Benchmark Step3-VL-10B SeRe (10B) Step3-VL-10B PaCoRe (10B) GLM-4.6V (106B-A12B) Qwen3-VL Thinking (235B-A22B) Gemini-2.5 Pro Seed-1.5-VL Thinking
多模态 benchmark
STEM / 多模态推理 MMMU 78.11 80.11 75.20 78.70 83.89 79.11
STEM / 多模态推理 MMMU-Pro 64.08 67.18 65.84 72.37 76.96 70.60
STEM / 多模态推理 MathVision 70.81 75.95 63.50† 72.10 73.30† 68.70†
STEM / 多模态推理 MathVista 83.97 85.50 83.51 85.10 83.88 85.60
STEM / 多模态推理 LogicVista 66.89 71.36 64.88 73.15 69.80 72.93
STEM / 多模态推理 DynaMath 56.39 61.48 56.29 60.30 52.30 58.88
STEM / 多模态推理 ZeroBench (main) 1.00 5.00 1.00 3.00 4.00 1.00
STEM / 多模态推理 ZeroBench (sub) 27.54 29.94 29.04 28.40 33.53 31.74
STEM / 多模态推理 MathVerse (vision) 75.73 78.30 72.84 76.65 78.30 77.79
STEM / 多模态推理 We-Math 73.03 73.90 71.14 74.70 80.10 79.05
STEM / 多模态推理 VisuLogic 29.68 32.70 28.30 31.80 31.40 34.30
STEM / 多模态推理 PhyX 59.45 66.01 59.70 66.30 67.56 62.53
识别 / 通用 VQA MMBench EN 92.05 92.38 92.75 92.70 93.19 92.11
识别 / 通用 VQA MMBench CN 91.55 91.96 91.88 91.80 93.13 91.76
识别 / 通用 VQA SimpleVQA 53.08 54.64 57.95 59.30 66.85 64.72
识别 / 通用 VQA MMStar 77.48 77.64 75.30 76.80 79.18 77.91
识别 / 通用 VQA HallusionBench 64.91 64.54 60.63 65.58 65.63 64.13
识别 / 通用 VQA MMVP 68.16 68.00 71.33 71.30 70.67 74.00
识别 / 通用 VQA ReMI 67.29 69.12 64.42 74.70 71.69 72.19
识别 / 通用 VQA M3GIA 78.33 73.50 78.72 81.00 83.11 83.22
识别 / 通用 VQA DoYouSeeMe 67.48 68.54 67.50 72.89 71.19 71.94
计数 CountBench 88.75 88.80 92.06 92.46 87.78 91.85
计数 CountQA 33.69 38.29 36.32 45.62 38.02 48.89
计数 PixMo-Count 70.85 71.61 76.47 79.80 75.54 83.38
OCR OCRBench 86.75 89.00 86.20 87.30 85.90 85.20
OCR OmniOCR 76.98 78.14 84.53 87.20 66.05 87.80
OCR CC-OCR (Multi-Lang-OCR) 76.59 77.51 74.08 80.80 81.10 78.82
2D / 3D 空间理解 BLINK 66.79 67.39 68.17 67.12 72.01 71.54
2D / 3D 空间理解 CVBench 83.49 85.92 83.72 87.86 84.36 86.27
2D / 3D 空间理解 MMSI-Bench 32.18 36.40 30.80 32.50 40.40 30.60
2D / 3D 空间理解 ERQA 48.87 51.75 47.75 53.50 62.25 48.50
2D / 3D 空间理解 OmniSpatial 51.58 52.58 50.49 53.10 55.64 51.99
2D / 3D 空间理解 All-Angles-Bench 57.21 64.71 62.94 60.59 65.88 57.65
2D / 3D 空间理解 MindCube-tiny 62.81 68.58 52.83 47.58 58.92 39.83
2D / 3D 空间理解 RealWorldQA 74.44 75.56 77.78 78.80 77.78 79.61
2D / 3D 空间理解 SpatialViz-Bench 45.51 52.03 37.46 46.36 45.34 35.25
2D / 3D 空间理解 STARE 61.75 64.57 60.38 70.89 62.36 62.99
2D / 3D 空间理解 CoreCognition 66.69 71.54 69.50 72.66 78.78 72.38
2D / 3D 空间理解 V* 82.85 84.29 85.86 89.53 80.63 90.58
2D / 3D 空间理解 ViewSpatial 46.14 48.41 43.87 48.58 44.15 44.14
纯文本 benchmark
考试 MMLU-Pro 76.02 77.09 79.96 83.75 86.45 83.39
考试 GPQA-Diamond 70.83 73.99 69.19 77.68 84.06 71.91
考试 SuperGPQA 50.38 53.15 53.28 64.20 65.00 60.50
考试 LiveBench(2024-11-25) 69.71 71.69 62.75 80.14 76.34 65.62
数学 AIME2024 90.94 93.33 80.63 91.93 79.53 79.48
数学 AIME2025 87.66 94.43 71.88 83.59 83.96 64.06
数学 HMMT25 78.18 92.14 57.29 67.71 65.68 51.30
数学 CNMO2024 78.20 81.17 72.11 88.36 74.53 83.67
数学 BeyondAIME 63.23 74.00 39.83 57.42 54.45 42.83
数学 IMO-AnswerBench 62.12 76.66 51.25 69.25 72.00 44.75
代码 LiveCodeBench (2408-2505) 75.77 76.43 48.71 69.45 72.01 57.10

我们进一步通过并行协同推理设定扩展推理时算力,来探索模型的极限。如表 3 所示,Step3-VL-10B 的 PaCoRe 模式持续超过它自己的标准 SeRe 模式,并在若干推理密集与感知为主的 benchmark 上达到前沿水平,甚至超过 Gemini-2.5-Pro 和 Seed-1.5-VL。具体来说,Step3-VL-10B 在多模态理解与推理 benchmark MMMU 上拿到 80.11%。在有挑战性的多模态数学推理 benchmark MathVision 和 MathVista 上,它分别拿到 75.95% 和 85.50%。此外,在 MMBench 和 MMStar 这类代表性视觉识别任务上,它分别达到 92.17%(CN 与 EN 的平均)和 77.64%。这些结果表明 Step3-VL-10B 在多模态感知与推理上已经达到领先水平。更值得注意的是,在 AIME2025 和 HMMT25 这类高难度纯文本数学任务上,它拿到了 94.43% 和 92.14% 这样惊人的分数。这些结果大幅超过竞品模型,印证了智能并不严格受模型尺寸约束。

5 讨论

本节我们从两个方面分析塑造了 Step3-VL-10B 的经验发现。第一,我们提炼出关于模型架构与优化策略的关键设计洞察——正是它们决定了我们最终的配置。第二,我们刻画 RLVR 过程中的学习动力学,以及后续 RL 扩展所带来的涌现能力。

5.1 消融与设计洞察

视觉编码器的选择:PE-lang 还是 DINOv3。我们把 Perception Encoder(PE-lang,为消融实验专门选的 300M 参数版本)与 DINOv3(ViT-large-16,300M 参数)139作为视觉主干做了对比。DINOv3 在纯视觉任务上很强,但在我们的多模态设定下,因为模态间隙的存在,它收敛很慢。反过来,显式与 LLM 预对齐过的 PE-lang 取得了更好的数据效率与 benchmark 表现(表 4)。这说明:视觉编码器里的语言对齐仍然是高效 VL 建模的前提条件,与后续是否有万亿级的生成式训练无关。

表 4:视觉编码器对比:DINOv3 与 PE-lang。这里 Omni. 和 SVQA 分别指 OmniSpatial 和 SimpleVQA。

视觉编码器 BLINK Omni. MMVP OCRBench MMStar SVQA CCBench V* MMMU ReMI
DINOv3 42.35 43.31 28.00 57.60 41.43 22.18 56.32 34.55 46.56 24.50
PE-lang(本文) 41.19 43.57 32.00 70.10 42.10 21.15 59.39 37.17 47.67 26.08
$\Delta$ -1.16 +0.26 +4.00 +12.50 +0.67 -1.03 +3.07 +2.62 +1.11 +1.58

译注:原表把前四列(BLINK、Omni.、MMVP、OCRBench)归为「感知」、后六列归为「通用」。markdown 表撑不起两层表头,这里拉平成一行。表 5、表 6 同此。

优化器的选择:Muon 还是 AdamW。我们考察了 Muon140——一种利用 Newton-Schulz 迭代141来规整权重拓扑的矩阵级优化器。Muon 有效应对了大规模多模态数据固有的噪声与不均衡,在长尾知识任务上带来了可观的提升(表 5 中 SimpleVQA +6.48%)。这些结果说明 Muon 有效降低了对数据稀缺的敏感度。尽管有这些优点,我们最终没有把 Muon 放进最终架构,原因是初始化不匹配。近期文献142指出,Muon 对那些最初由 AdamW 这类逐元素方法优化过的权重很敏感。在我们的设定下,这要求一段很长的 warmup 才能让过渡稳定下来,反而使整体训练效率不如一个调好的 AdamW 基线。因此我们把对 Muon 更彻底的探索留给未来工作。

表 5:AdamW 与 Muon 优化器在选定 benchmark 上的对比。

优化器 BLINK Omni. MMVP OCRBench MMStar SVQA CCB V* MMMU ReMI
Muon 41.14 42.73 32.00 67.70 44.58 27.08 60.72 36.65 47.56 22.23
Adam(本文) 40.72 44.94 29.33 71.10 41.77 20.60 60.13 39.27 46.11 25.00
$\Delta$ -0.42 +2.21 -2.67 +3.40 -2.81 -6.48 -0.59 +2.62 -1.45 +2.77

Deepstack 的消融。我们考察了 Deepstack143 的效用——这是一种深度扩展技术,在 Qwen3-VL7 里被成功用过。启用 Deepstack 确实有效加快了训练收敛,但如表 6 所示,这种优化层面的改进并没有转化成下游评测 benchmark 上有意义的收益。考虑到它的计算开销与边际效用不成正比,我们把它从最终模型配置里排除了。

表 6:Deepstack 架构扩展的消融研究。

技术 BLINK Omni. MMVP OCRBench MMStar SVQA CCB V* MMMU ReMI
带 DeepStack 40.72 42.92 26.00 71.20 43.31 28.66 63.94 36.65 47.44 26.96
不带 DeepStack(本文) 40.61 43.57 31.33 69.30 42.44 25.20 62.80 38.22 47.78 26.96
$\Delta$ -0.11 +0.65 +5.33 -1.90 -0.87 -3.46 -1.14 +1.57 +0.34 +0.00

5.2 RL 动力学、表现与涌现

训练动力学与持续改进。我们跟踪了 RLVR 在 600 次训练迭代上的演化,监控奖励的推进、平均 rollout 长度,以及多模态推理、识别、OCR 与 grounding 任务上的下游表现(每 100 次迭代评一次)。如图 2(右)和图 3 所示,模型展现出稳健的两段式增长轨迹:前 200 次迭代里奖励与各项指标都快速攀升,随后转为平稳的线性增长。值得注意的是,奖励持续逼近 $0.8$ 而没有出现饱和,下游指标也同步持续上涨。

独特的长度动力学。与纯文本 RL 中常见的「顺序扩展」(即推理路径逐渐变长)14462不同,Step3-VL-10B 的平均 rollout 长度并不单调增长。它先是上升,但最终回落到了起始水平(见图 2 左)。我们把这判断为两种相反的扩展性质之间的相消效应

  1. 推理任务(例如 STEM、谜题):呈现标准的顺序扩展,模型表现与推理时算力的延展(即思维链长度)正相关。
  2. 确定性感知任务(例如 grounding、OCR):呈现出经由策略精炼的长度收缩。与推理所需的那种铺展开的「思考」链条不同,感知上的 RL 收益来自熵的降低145。具体来说,RL 优化通过剪掉冗余的探索性 token,诱导搜索空间发生系统性坍缩。这个过程把概率质量集中到那个唯一的确定性模式上,有效地把高温下的 Pass@N 探索转换成了稳健的 Pass@1 准确率146。在这个区间里,更短的 rollout 长度直接可以当作模型置信度更高、感知焦点更锐利的代理指标。

图 2:RLVR 动力学。奖励持续上升且没有饱和(右),而平均 rollout token 数在初期上升之后回落到起始水平(左)。左图纵轴 Rollout Tokens 从 2000 升到约 3700 后回落至约 2900,右图纵轴 Reward 从 0.53 单调升至约 0.77,横轴均为 0–600 训练步
图 2:RLVR 动力学。奖励持续上升且没有饱和(右),而平均 rollout token 数在初期上升之后回落到起始水平(左)。左图纵轴 Rollout Tokens 从 2000 升到约 3700 后回落至约 2900,右图纵轴 Reward 从 0.53 单调升至约 0.77,横轴均为 0–600 训练步

图 3:RLVR 过程中代表性多模态推理与感知指标的趋势。每 100 次迭代评一次,表现与奖励动力学同步:先快速增长、随后稳步提升。四个子图分别是 MathVision(62→70)、We-Math(67.8→73.1)、MMMU-Pro(58.4→63.2)、ReMI(63.1→69.0),横轴均为训练步 100–600
图 3:RLVR 过程中代表性多模态推理与感知指标的趋势。每 100 次迭代评一次,表现与奖励动力学同步:先快速增长、随后稳步提升。四个子图分别是 MathVision(62→70)、We-Math(67.8→73.1)、MMMU-Pro(58.4→63.2)、ReMI(63.1→69.0),横轴均为训练步 100–600

「缺失轨迹」假说。既然 RL 扩展严格依赖于初始策略的行为覆盖度147148,我们猜想感知上的这种「反扩展」源自一项关键的数据缺失。人类视觉认知依赖迭代的、由粗到细的过程(例如「先扫一眼再聚焦」或者类似 o3149、RePer150 的「试错-纠正」机制),但这些内部心智状态在训练语料里很少被显式地用语言表述出来。结果就是,RL 的优化地形缺少那些能自发激励出顺序感知推理的「认知轨迹」。

表 7:一个并行协同推理的感知案例:模型先聚合参考答案,再交叉验证它们的有效性,最终识别出最终答案背后的规律。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
Question: Locate the mish and Mennonite section in the image. <image> …
Now, based on the original problem and reference responses above, please provide your own comprehensive solution.

Response: <think>
Got it, let's look at the references.
The references have different x-coordinates (like 220, 228, 227, etc.) but the common y is 185 or around there.
Let's check the problem's context.
The references' labels mention …
Let's see the reference 5 has 228, reference 6 227, reference 9 228, etc.
To create a new point, we need to follow the logic. Let's check the references' labels and their coordinates' variations.
Maybe the key is to find a value that's in the middle of the range. Alternatively, check the problem's structure.

译注:原文这一「表」其实是一个思考过程的排版框,不是数据表;这里改成代码块原样呈现。加粗那句(「参考答案的 x 坐标各不相同(220、228、227 之类),但共同的 y 是 185 上下」)是原文用粗体标出的关键交叉验证步骤。省略号是原文自己打的省略。

经由 PaCoRe 的涌现。为解决这个局限,我们采用 PaCoRe12——一种能有效把这些隐式视觉过程说出来的推理时扩展策略。从概念上讲,这套做法呼应了 Faster R-CNN151 里区域提议网络(RPN)那类经典计算机视觉架构的「先提议后精炼」哲学。在这个框架下,模型先采样出多个感知假设(提议);再以这些提议为条件,做一次多方面的综合来导出最终输出。如表 7 所示,这个过程在推理时自发涌现出了复杂的、类人的验证行为。

关键在于,这套范式展现出两个独特的扩展性质:(1)回复长度稳定而审慎地增长,说明模型有能力有效地把额外算力分配给假设验证。(2)PaCoRe 模式相对朴素 SeRe 模式有显著的性能增益,如表 3 所示。这些增益在推理密集的 benchmark 上很明显,例如 MathVision(+5.14%)和 DynaMath(+5.09%);在需要穷尽式感知(尤其依赖高召回率)的任务上同样明显,包括视觉计数(CountQA,+4.6%)、OCR(OCRBench,+2.25%),以及尤其是空间理解(All-Angles-Bench,+7.50%;SpatialViz-Bench,+6.52%)。

把 System 2 压缩成 System 1。PaCoRe 作为一个初级的多智能体框架,确实实现了感知上的扩展:提议者并行生成大量视觉提议,控制者随后执行顺序的交叉检验与自我验证。展望未来,我们希望用 自蒸馏把这些被物化出来的并行协同推理轨迹内化掉。通过把并行审议的逻辑直接注入模型参数,我们想把昂贵的「慢思考」152轨迹转化成高保真的内在直觉,最终培育出一个更高效也更准确的感知基座。

6 结论与未来工作

以一份精心整理的 1.2T 多模态 token 语料为锚,经由超过 1k 次顺序与并行协同 RL 迭代的打磨,Step3-VL-10B 在感知、推理与对齐上取得了足以与最强闭源和开源前沿掰手腕的能力。然而,原始能力并不等同于系统性的成熟。在通往全面多模态智能的路上,我们识别出两处关键瓶颈:计算密度与物理接地。我们的战略路线图旨在把这些局限转化为下一轮增长的引擎。

通过普适的 RL 扩展最大化 token 效率。我们坚持这样一条原则:训练与推理期间的每一份算力,都必须直接贡献于智能密度。

  • 把算力从预训练转向 RL。RL 扩展展现出持续的、不饱和的性能跃升,这是单靠预训练无法维持的。我们打算激进地把计算资源转向 RL。通过在深度(顺序推理)与宽度(并行探索)两个方向上普适地扩展,我们希望挖掘出高价值的感知与推理轨迹,把各种规模模型的多模态智能上限往上推。
  • 优化推理密度。我们希望弥合「大规模搜索的高性能」与「标准推理的低时延」之间的差距。目标是把并行探索的收益内化,消除冗余的「过度思考」。我们设想一种能持续压缩推理路径的机制:把显式的协同搜索转化为高效的顺序过程,并最终把这些能力蒸馏成本能式的、类 System 1 的回复。

弥合现实鸿沟。虽然模型在数字任务上表现出色,「现实鸿沟」仍然是关键前沿。我们认为弥合这道鸿沟需要一次范式转变:从被动的数据消费,走向主动的物理接地。

  • 从语义世界模型到物理世界模型。我们把当前基于文本的多智能体综合视为奠基性的一步——它构造的是一个语义世界模型。要实现真正的具身,我们必须把这种综合扩展到海量的视频轨迹与感觉运动动作序列上。这会把不同模态统一进一个整体的世界模型,超越语言逻辑去内化物理因果与时空动力学。
  • 把物理定律当作终极验证器。当前的多模态 RL 常常依赖静态或带噪声的代理标签。我们打算接入高保真的仿真环境,让奖励严格由不可动摇的物理定律来支配。这会把学习范式从表层的模仿,转向由交互驱动的掌握,把模型的推理接地在可验证的因果性上而非统计相关性上。
  • 具身思维链(E-CoT)。我们设想把推理上下文扩展到显式建模时间动力学与物理状态转移。通过训练模型在动作之前先预测动力学、从而把「物理直觉」讲出来,我们希望培育出能在动态开放世界环境中做稳健长程规划的智能体。

附录 A 更多结果

定性结果。本节展示一批定性示例,通过模型对各种 prompt 生成的回复来说明 Step3-VL-10B 的能力。这些案例凸显了模型在细粒度感知与结构化逻辑推理上的出色能力。更重要的是,它们展现出高度的认知系统性——能有效整合领域知识来执行多步任务。

译注:附录 A 的四个案例在 arXiv 的 HTML 渲染里丢失了(casepromptcasethinkingcaseanswer 三个自定义环境整块没转出来,只剩配图),下面的 prompt、思考与答案是从投稿 LaTeX 源码取回的。案例 1 的思考过程原文就是中文,照抄未译。四段思考里的「…」都是原文自己打的省略,不是这里删的。

案例 1:视觉模式匹配与顺序解码

图 4:摩尔斯电码对照表。表分三列,左列 A–I、中列 J–R、右列 S–Z,每个字母后跟点划组合
图 4:摩尔斯电码对照表。表分三列,左列 A–I、中列 J–R、右列 S–Z,每个字母后跟点划组合

提问:根据该表生成"STEPFUN"的编码

思考:用户现在需要把每个字母转换成莫尔斯电码,先看每个字母在表中的编码。首先分解"STEPFUN"每个字母:S、T、E、P、F、U、N。先逐个找:

  • S:看右边第三列第一个,S 是 $\bullet\bullet\bullet$(三个点)
  • T:第三列第二个,T 是 $-$(一个短横)
  • E:左边第一列第五个,E 是 $\bullet$(一个点)
  • P:中间列(J 到 R)中 P 对应的符号是 $\bullet--\bullet$(点、短横、短横、点)
  • F:最左侧列第六行,F 的符号是 $\bullet\bullet-\bullet$(两个点、一个短横、一个点)
  • U:最右侧列第三行,U 的符号是 $\bullet\bullet-$(两个点、一个短横)
  • N:中间列(J 到 R)第五行,N 的符号是 $-\bullet$(一个短横、一个点)

再将每个字母的编码按顺序拼接(字母间用空格分隔更清晰),“STEPFUN"的莫尔斯电码为:$\bullet\bullet\bullet \quad - \quad \bullet \quad \bullet--\bullet \quad \bullet\bullet-\bullet \quad \bullet\bullet- \quad -\bullet$

答案:$\bullet\bullet\bullet \quad - \quad \bullet \quad \bullet--\bullet \quad \bullet\bullet-\bullet \quad \bullet\bullet- \quad -\bullet$

案例 2:细粒度视觉计数与语义过滤

图 5:编译器截图。一个 LaTeX 编辑器界面,左侧是文档结构树,中间是 thesis.tex 源码,右侧是 PDF 预览,顶部有一排标签页
图 5:编译器截图。一个 LaTeX 编辑器界面,左侧是文档结构树,中间是 thesis.tex 源码,右侧是 PDF 预览,顶部有一排标签页

提问:截图显示的是一名学生撰写博士论文时使用的 LaTeX 文本编辑器的快照。这名学生至少打开了多少个章节 .tex 文件?

思考:那么,我们来看编辑器顶部的标签页。 可见的标签页有:

  • chapte…(最左边,可能是居中显示的活动文件 chapter1.tex)
  • chapte…(下一个)
  • thesis…(这是 thesis.tex,不是章节文件)
  • chapte…(下一个)
  • chapte…(下一个)
  • chapte…(暗色主题部分之前的最后一个)

为确定打开的章节 .tex 文件的最小数量,我们分析编辑器顶部的标签页。1. 识别标签页:图中显示了多个标为 chapte…(是 chapter… 的截断)的标签页和一个标为 thesis… 的标签页。2. 排除非章节标签页:thesis… 不是章节文件,所以我们只数 chapte… 标签页。3. 数章节标签页:共有 5 个可见的 chapte… 标签页(不含 thesis… 标签页)。

答案:5

案例 3:低分辨率视觉细节识别

图 6:失焦目标。一张景深很浅的照片,画面里有一台显示器,底座上的品牌标识处于失焦状态
图 6:失焦目标。一张景深很浅的照片,画面里有一台显示器,底座上的品牌标识处于失焦状态

提问:图中显示器的品牌名是什么?用左移 5 位的凯撒密码给它编码,把答案合并成一个字符串给出。

思考:好的,我们来拆解一下。首先,找出显示器的品牌。 显示器底座上的标识是 HP。然后,我们需要做一个左移 5 位的凯撒密码。

  • 首先,H 是第 8 个字母(A=1,B=2…H=8)。左移 5 位:8-5=3 → C。
  • 然后,P 是第 16 个字母。16-5=11 → K。

所以 “HP” 左移 5 位是 “CK”。

答案:HPCK

案例 4:拓扑图分析与最小权重搜索

图 7:带权图。一张有 25 个节点(A–Y)的有向图,边上标注权重,权重范围 1 到 14
图 7:带权图。一张有 25 个节点(A–Y)的有向图,边上标注权重,权重范围 1 到 14

提问:有多少条边的长度最短?

思考:为确定长度最短的边有多少条,我们先找出图中最小的边权重。 最小权重是 1。接下来,我们数出所有标为 1 的边:

  • $A \rightarrow T$:标为 1
  • $T \rightarrow X$:标为 1
  • $P \rightarrow O$:标为 1
  • $W \rightarrow X$:标为 1

没有其他边的权重是 1。因此,长度最短的边有 4 条。

答案:4

附录 B PaCoRe 综合过程的序列化细节

表 8:PaCoRe 综合的输入序列化模板。我们用这个模板把当前问题 $x$(记作 original_prompt)与紧凑消息集 $M$(记作 ref_responses)嵌入模型的上下文。在消息集为空这个退化情形下($M = \emptyset$),这个模板会被跳过,原始问题输入原封不动地交给模型。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
You are given a problem and a list of reference responses. Your job is to analyze these references and provide your own response.
Original Problem:
{{ original_prompt }}

Reference Responses:
{% for response in ref_responses %}
Reference {{ loop.index }}:
{{ response }}
{% endfor %}

Now, based on the original problem and reference responses above, please provide your own comprehensive solution.

如表 8 所详述,我们把紧凑消息包装成「Reference Responses」(参考回复),以鼓励模型综合多样的视角。通过把「Original Problem」(原始问题)这个槽位填上最新的观测、同时在上下文里维持交互历史,PaCoRe 保证了与现有推理生态的无缝兼容。关于综合过程的更多实现细节,见 Hu 等人12的第 C 节。



  1. Step3-VL-10B 团队,Step3-VL-10B Technical ReportarXiv:2601.09668 ↩︎

  2. 模型权重(Hugging Face):https://huggingface.co/collections/stepfun-ai/step3-vl-10b ↩︎

  3. 模型权重(魔搭):https://modelscope.cn/collections/stepfun-ai/Step3-VL-10B ↩︎

  4. G. Team (2025). Gemini 3 pro: the frontier of vision ai. https://blog.google/technology/developers/gemini-3-pro-vision/ ↩︎

  5. OpenAI (2025). Introducing gpt-5.2. https://openai.com/index/introducing-gpt-5-2/ ↩︎

  6. V. Team, W. Hong, W. Yu, X. Gu, G. Wang, G. Gan, et al (2025). Glm-4.5v and glm-4.1v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning. arXiv:2507.01006 ↩︎ ↩︎ ↩︎

  7. S. Bai, Y. Cai, R. Chen, K. Chen, X. Chen, Z. Cheng, et al (2025). Qwen3-vl technical report. arXiv:2511.21631 ↩︎ ↩︎ ↩︎ ↩︎

  8. G. Team (2025). Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities. arXiv:2507.06261 ↩︎ ↩︎

  9. D. Guo, F. Wu, F. Zhu, F. Leng, G. Shi, H. Chen, et al (2025). Seed1. 5-vl technical report. arXiv:2505.07062 ↩︎ ↩︎

  10. D. Bolya, P.-Y. Huang, P. Sun, J. H. Cho, A. Madotto, C. Wei, et al (2025). Perception encoder: The best visual embeddings are not at the output of the network. arXiv:2504.13181 ↩︎ ↩︎

  11. A. Yang, A. Li, B. Yang, B. Zhang, B. Hui, B. Zheng, et al (2025). Qwen3 technical report. arXiv:2505.09388 ↩︎ ↩︎

  12. J. Hu, Y. Zhang, S. Shang, X. Yang, Y. Peng, Z. Huang, et al (2026). Pacore: Learning to scale test-time compute with parallel coordinated reasoning. arXiv:2601.05593 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  13. S. Team (2025). Step-3 is large yet affordable: Model-system co-design for cost-effective decoding. arXiv:2507.19427 ↩︎

  14. H. Wei, Y. Sun, Y. Li (2025). Deepseek-ocr: Contexts optical compression. arXiv:2510.18234 ↩︎

  15. M. Caron, I. Misra, J. Mairal, P. Goyal, P. Bojanowski, A. Joulin (2021). Unsupervised learning of visual features by contrasting cluster assignments. arXiv:2006.09882 ↩︎

  16. J. Shah, G. Bikshandi, Y. Zhang, V. Thakkar, P. Ramani, T. Dao (2024). Flashattention-3: Fast and accurate attention with asynchrony and low-precision↩︎

  17. J. Su, M. Ahmed, Y. Lu, S. Pan, W. Bo, Y. Liu (2024). Roformer: Enhanced transformer with rotary position embedding↩︎

  18. E. Bakouch, L. Ben Allal, A. Lozhkov, N. Tazi, L. Tunstall, C. M. Patiño, et al (2025). SmolLM3: smol, multilingual, long-context reasoner. https://huggingface.co/blog/smollm3 ↩︎

  19. CommonCrawl. Common crawl. https://commoncrawl.org/ ↩︎

  20. C. Schuhmann, R. Beaumont, R. Vencu, C. Gordon, R. Wightman, M. Cherti, et al (2022). Laion-5b: An open large-scale dataset for training next generation image-text models. arXiv:2210.08402 ↩︎

  21. M. Byeon, B. Park, H. Kim, S. Lee, W. Baek, S. Kim (2022). Coyo-700m: Image-text pair dataset. https://github.com/kakaobrain/coyo-dataset ↩︎

  22. J. Li, D. Li, C. Xiong, S. Hoi (2022). Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. arXiv:2201.12086 ↩︎

  23. C. Xie, H. Cai, J. Li, F. Kong, X. Wu, J. Song, et al (2023). Ccmb: A large-scale chinese cross-modal benchmark. Proceedings of the 31st ACM International Conference on Multimedia, page 4219–4227. http://dx.doi.org/10.1145/3581783.3611877 ↩︎

  24. A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agarwal, et al (2021). Learning transferable visual models from natural language supervision. arXiv:2103.00020 ↩︎

  25. Y. Yang, A. Patel, M. Deitke, T. Gupta, L. Weihs, A. Head, et al (2025). Scaling text-rich image understanding via code-guided synthetic multimodal data generation. arXiv:2502.14846 ↩︎ ↩︎

  26. H. R. Sujet AI, Allaa Boutaleb (2024). Sujet-finance-qa-vision-100k: A large-scale dataset for financial document vqa. https://huggingface.co/datasets/sujet-ai/Sujet-Finance-QA-Vision-100k ↩︎

  27. A. Ben Abacha, S. A. Hasan, V. V. Datla, J. Liu, D. Demner-Fushman, H. Müller (2019). Vqa-med: Overview of the medical visual question answering task at imageclef. Working Notes of CLEF 2019, volume 2380 of CEUR Workshop Proceedings, Lugano, Switzerland, September 9-12 2019. https://ceur-ws.org/Vol-2380/paper_272.pdf ↩︎

  28. X. He, Y. Zhang, L. Mou, E. Xing, P. Xie (2020). Pathvqa: 30000+ questions for medical visual question answering. arXiv:2003.10286 ↩︎

  29. B. Shi, C. Yao, M. Liao, M. Yang, P. Xu, L. Cui, et al (2017). Icdar2017 competition on reading chinese text in the wild (rctw-17). 2017 14th iapr international conference on document analysis and recognition (ICDAR), volume 1, pages 1429–1434. ↩︎

  30. C. Yao, X. Bai, W. Liu, Y. Ma, Z. Tu (2012). Detecting texts of arbitrary orientations in natural images. https://pages.ucsd.edu/~ztu/publication/cvpr12_textdetection.pdf ↩︎

  31. C. Cui, T. Sun, M. Lin, T. Gao, Y. Zhang, J. Liu, et al (2025). Paddleocr 3.0 technical report. arXiv:2507.05595 ↩︎

  32. G. Kim, T. Hong, M. Yim, J. Nam, J. Park, J. Yim, et al (2022). Ocr-free document understanding transformer. European Conference on Computer Vision (ECCV), 2022. ↩︎

  33. A. Masry, P. Kavehzadeh, X. L. Do, E. Hoque, S. Joty (2023). Unichart: A universal vision-language pretrained model for chart comprehension and reasoning↩︎

  34. R. Xia, B. Zhang, H. Peng, H. Ye, X. Yan, P. Ye, et al (2023). Structchart: Perception, structuring, reasoning for visual chart understanding. arXiv:2309.11268 ↩︎

  35. J. Chen, L. Kong, H. Wei, C. Liu, Z. Ge, L. Zhao, et al (2024). Onechart: Purify the chart structural extraction via one auxiliary token. Proceedings of the 32nd ACM International Conference on Multimedia, pages 147–155, 2024a. ↩︎

  36. B. Wang, C. Xu, X. Zhao, L. Ouyang, F. Wu, Z. Zhao, et al (2024). Mineru: An open-source solution for precise document content extraction. arXiv:2409.18839 ↩︎

  37. M. Chai, Z. Shen, C. Zhang, Y. Zhang, X. Wang, S. Dou, et al (2025). Docfusion: A unified framework for document parsing tasks. arXiv:2412.12505 ↩︎

  38. Y. Yuan, X. Liu, W. Dikubab, H. Liu, Z. Ji, Z. Wu, X. Bai (2022). Syntax-aware network for handwritten mathematical expression recognition. arXiv:2203.01601 ↩︎

  39. H. Laurençon, L. Tronchon, V. Sanh (2024). Unlocking the conversion of web screenshots into html code with the websight dataset↩︎

  40. C. Liu, H. Wei, J. Chen, L. Kong, Z. Ge, Z. Zhu, et al (2024). Focus anywhere for fine-grained multi-page document understanding. arXiv:2405.14295 ↩︎

  41. A. Kuznetsova, H. Rom, N. Alldrin, J. Uijlings, I. Krasin, J. Pont-Tuset, et al (2020). The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale. http://dx.doi.org/10.1007/s11263-020-01316-z ↩︎

  42. T.-Y. Lin, M. Maire, S. Belongie, L. Bourdev, R. Girshick, J. Hays, et al (2015). Microsoft coco: Common objects in context. arXiv:1405.0312 ↩︎

  43. E. Yu, L. Zhao, Y. Wei, J. Yang, D. Wu, L. Kong, et al (2024). Merlin: Empowering multimodal llms with foresight minds. European Conference on Computer Vision, pages 425–443. ↩︎

  44. E. Yu, K. Lin, L. Zhao, Y. Wei, Z. Zhu, H. Wei, et al (2025). Unhackable temporal rewarding for scalable video mllms. arXiv:2502.12081 ↩︎

  45. M. Deitke, C. Clark, S. Lee, R. Tripathi, Y. Yang, J. S. Park, et al (2024). Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models. arXiv:2409.17146 ↩︎ ↩︎

  46. Kaggle. Fcs dataset. https://www.kaggle.com/datasets/xuncngng/fsc147-0 ↩︎

  47. SakiRinn. Locount dataset. https://github.com/SakiRinn/mmdetection-locount ↩︎

  48. X. Liu, W. Wang, Y. Yuan, J. tse Huang, Q. Liu, P. He, Z. Tu (2025). Insight over sight: Exploring the vision-knowledge conflicts in multimodal llms. arXiv:2410.08145 ↩︎

  49. R. Zellers, Y. Bisk, A. Farhadi, Y. Choi (2019). From recognition to cognition: Visual commonsense reasoning. arXiv:1811.10830 ↩︎

  50. J. Poznanski, A. Rangapur, J. Borchardt, J. Dunkelberger, R. Huff, D. Lin, et al (2025). olmocr: Unlocking trillions of tokens in pdfs with vision language models. arXiv:2502.18443 ↩︎

  51. aallail. Nyu-book-eval-eg2 dataset. https://huggingface.co/datasets/aallail/nyu_book_eval_eg2 ↩︎

  52. H. Wei, C. Liu, J. Chen, J. Wang, L. Kong, Y. Xu, et al (2024). General ocr theory: Towards ocr-2.0 via a unified end-to-end model. arXiv:2409.01704 ↩︎

  53. H. Yan, J. Wang, X. Huang, Y. Shen, Z. Meng, Z. Fan, et al (2025). Step-gui technical report. arXiv:2512.15431 ↩︎

  54. I. Loshchilov, F. Hutter (2017). Decoupled weight decay regularization. arXiv:1711.05101 ↩︎

  55. J. Schulman, F. Wolski, P. Dhariwal, A. Radford, O. Klimov (2017). Proximal policy optimization algorithms. arXiv:1707.06347 ↩︎

  56. J. Schulman, P. Moritz, S. Levine, M. Jordan, P. Abbeel (2015). High-dimensional continuous control using generalized advantage estimation. arXiv:1506.02438 ↩︎

  57. E. Guha, R. Marten, S. Keh, N. Raoof, G. Smyrnis, H. Bansal, et al (2025). Openthoughts: Data recipes for reasoning models. arXiv:2506.04178 ↩︎

  58. J. LI, E. Beeching, L. Tunstall, B. Lipkin, R. Soletskyi, S. C. Huang, et al (2024). Numinamath↩︎

  59. L. Wiedmann, O. Zohar, A. Mahla, X. Wang, R. Li, T. Frere, et al (2025). Finevision: Open data is all you need. arXiv:2510.17269 ↩︎

  60. P. Tong, E. Brown, P. Wu, S. Woo, A. J. V. IYER, S. C. Akula, et al (2024). Cambrian-1: A fully open, vision-centric exploration of multimodal llms↩︎

  61. X. An, Y. Xie, K. Yang, W. Zhang, X. Zhao, Z. Cheng, et al (2025). Llava-onevision-1.5: Fully open framework for democratized multimodal training. arXiv:2509.23661 ↩︎

  62. J. Hu, Y. Zhang, Q. Han, D. Jiang, X. Zhang, H.-Y. Shum (2025). Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model. arXiv:2503.24290 ↩︎ ↩︎

  63. Y. Wei, L. Zhao, J. Sun, K. Lin, J. Yin, J. Hu, et al (2025). Open vision reasoner: Transferring linguistic cognitive behavior for visual reasoning. arXiv:2507.05255 ↩︎ ↩︎

  64. F. Yao, L. Liu, D. Zhang, C. Dong, J. Shang, J. Gao (2025). Your efficient RL framework secretly brings you off-policy RL training. https://fengyao.notion.site/off-policy-rl ↩︎

  65. E. Yu, K. Lin, L. Zhao, J. Yin, Y. Wei, Y. Peng, et al (2025). Perception-r1: Pioneering perception policy with reinforcement learning. arXiv:2504.07954 ↩︎ ↩︎

  66. OpenAI (2025). Gpt-oss-120b and gpt-oss-20b model card. arXiv:2508.10925 ↩︎

  67. C. Chou, L. Dunlap, K. Mashita, K. Mandal, T. Darrell, I. Stoica, et al (2024). Visionarena: 230k real world user-vlm conversations with preference labels. arXiv:2412.08687 ↩︎

  68. K. Tang, W.-L. Chiang, A. N. Angelopoulos (2025). Arena explorer: A topic modeling pipeline for llm evals & analytics↩︎

  69. W.-L. Chiang, L. Zheng, Y. Sheng, A. N. Angelopoulos, T. Li, D. Li, et al (2024). Chatbot arena: An open platform for evaluating llms by human preference↩︎

  70. X. Yue, Y. Ni, K. Zhang, T. Zheng, R. Liu, G. Zhang, et al (2024). Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 9556–9567, 2024. ↩︎

  71. P. Lu, H. Bansal, T. Xia, J. Liu, C. Li, H. Hajishirzi, et al (2023). Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts. arXiv:2310.02255 ↩︎

  72. K. Wang, J. Pan, W. Shi, Z. Lu, M. Zhan, H. Li (2024). Measuring multimodal mathematical reasoning with math-vision dataset. arXiv:2402.14804 ↩︎

  73. R. Zhang, D. Jiang, Y. Zhang, H. Lin, Z. Guo, P. Qiu, et al (2024). Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems?. arXiv:2403.14624 ↩︎

  74. C. Zou, X. Guo, R. Yang, J. Zhang, B. Hu, H. Zhang (2024). Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models↩︎

  75. R. Qiao, Q. Tan, G. Dong, M. Wu, C. Sun, X. Song, et al (2024). We-math: Does your large multimodal model achieve human-like mathematical reasoning?. arXiv:2407.01284 ↩︎

  76. H. Shen, T. Wu, Q. Han, Y. Hsieh, J. Wang, Y. Zhang, et al (2025). Phyx: Does your model have the” wits" for physical reasoning?. arXiv:2505.15929 ↩︎

  77. Y. Xiao, E. Sun, T. Liu, W. Wang (2024). Logicvista: Multimodal llm logical reasoning benchmark in visual contexts. arXiv:2407.04973 ↩︎

  78. J. Roberts, M. R. Taesiri, A. Sharma, A. Gupta, S. Roberts, I. Croitoru, et al (2025). Zerobench: An impossible visual benchmark for contemporary large multimodal models. arXiv:2502.09696 ↩︎

  79. W. Xu, J. Wang, W. Wang, Z. Chen, W. Zhou, A. Yang, et al (2025). Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models. arXiv:2504.15279 ↩︎

  80. H. Team (2025). Humanity’s last exam. arXiv:2501.14249 ↩︎

  81. Y. Liu, H. Duan, Y. Zhang, B. Li, S. Zhang, W. Zhao, et al (2024). Mmbench: Is your multi-modal model an all-around player?. European conference on computer vision, pages 216–233. ↩︎

  82. X. Cheng, W. Zhang, S. Zhang, J. Yang, X. Guan, X. Wu, et al (2025). Simplevqa: Multimodal factuality evaluation for multimodal large language models. arXiv:2502.13059 ↩︎

  83. L. Chen, J. Li, X. Dong, P. Zhang, Y. Zang, Z. Chen, et al (2024). Are we on the right way for evaluating large vision-language models?. arXiv:2403.20330 ↩︎

  84. T. Guan, F. Liu, X. Wu, R. Xian, Z. Li, X. Liu, et al (2024). Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 14375–14385, 2024. ↩︎

  85. S. Tong, Z. Liu, Y. Zhai, Y. Ma, Y. LeCun, S. Xie (2024). Eyes wide shut? exploring the visual shortcomings of multimodal llms. arXiv:2401.06209 ↩︎

  86. M. Kazemi, N. Dikkala, A. Anand, P. Devic, I. Dasgupta, F. Liu, et al (2024). Remi: A dataset for reasoning with multiple images. arXiv:2406.09175 ↩︎

  87. W. Song, Y. Li, J. Xu, G. Wu, L. Ming, K. Yi, et al (2024). M3gia: A cognition inspired multilingual and multimodal general intelligence ability benchmark. arXiv:2406.05343 ↩︎

  88. A. Kanade, T. Ganu (2025). Do you see me : A multidimensional benchmark for evaluating visual perception in multimodal llms. arXiv:2506.02022 ↩︎

  89. R. Paiss, A. Ephrat, O. Tov, S. Zada, I. Mosseri, M. Irani, T. Dekel (2023). Teaching clip to count to ten. arXiv:2302.12066 ↩︎

  90. J. S. Tamarapalli, R. Grover, N. Pande, S. Yerramilli (2025). Countqa: How well do mllms count in the wild?. arXiv:2508.06585 ↩︎

  91. K. Ying, F. Meng, J. Wang, Z. Li, H. Lin, Y. Yang, et al (2024). Mmt-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask agi. arXiv:2404.16006 ↩︎

  92. Y. Qian, H. Ye, J.-P. Fauconnier, P. Grasch, Y. Yang, Z. Gan (2025). Mia-bench: Towards better instruction following evaluation of multimodal llms. arXiv:2407.01509 ↩︎

  93. S. Ding, S. Wu, X. Zhao, Y. Zang, H. Duan, X. Dong, et al (2025). Mm-ifengine: Towards multimodal instruction following. arXiv:2504.07957 ↩︎

  94. F. Zhang, L. Wu, H. Bai, G. Lin, X. Li, X. Yu, et al (2025). Humaneval-v: Benchmarking high-level visual reasoning with complex diagrams in coding tasks. arXiv:2410.12381 ↩︎

  95. C. Si, Y. Zhang, R. Li, Z. Yang, R. Liu, D. Yang (2025). Design2code: Benchmarking multimodal code generation for automated front-end engineering. arXiv:2403.03163 ↩︎

  96. Y. Liu, Z. Li, M. Huang, B. Yang, W. Yu, C. Li, et al (2024). Ocrbench: on the hidden mystery of ocr in large multimodal models. http://dx.doi.org/10.1007/s11432-024-4235-6 ↩︎

  97. OmniAI. Omni ocr benchmark. https://getomni.ai/blog/ocr-benchmark ↩︎

  98. Z. Yang, J. Tang, Z. Li, P. Wang, J. Wan, H. Zhong, et al (2024). Cc-ocr: A comprehensive and challenging ocr benchmark for evaluating large multimodal models in literacy. arXiv:2412.02210 ↩︎

  99. X. Fu, Y. Hu, B. Li, Y. Feng, H. Wang, X. Lin, et al (2024). Blink: Multimodal large language models can see but not perceive. European Conference on Computer Vision, pages 148–166. ↩︎

  100. S. Tong, E. Brown, P. Wu, S. Woo, M. Middepogu, S. C. Akula, et al (2024). Cambrian-1: A fully open, vision-centric exploration of multimodal llms. arXiv:2406.16860 ↩︎

  101. S. Yang, R. Xu, Y. Xie, S. Yang, M. Li, J. Lin, et al (2025). Mmsi-bench: A benchmark for multi-image spatial intelligence. arXiv:2505.23764 ↩︎

  102. G. R. Team, S. Abeyruwan, J. Ainslie, J.-B. Alayrac, M. G. Arenas, T. Armstrong, et al (2025). Gemini robotics: Bringing ai into the physical world. arXiv:2503.20020 ↩︎

  103. M. Jia, Z. Qi, S. Zhang, W. Zhang, X. Yu, J. He, et al (2025). Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models. arXiv:2506.03135 ↩︎

  104. C.-H. Yeh, C. Wang, S. Tong, T.-Y. Cheng, R. Wang, T. Chu, et al (2025). Seeing from another perspective: Evaluating multi-view understanding in mllms. arXiv:2504.15280 ↩︎

  105. B. Yin, Q. Wang, P. Zhang, J. Zhang, K. Wang, Z. Wang, et al (2025). Spatial mental modeling from limited views. arXiv:2506.21458 ↩︎

  106. X.AI (2024). Grok-2 beta release. https://x.ai/blog/grok-2 ↩︎

  107. S. Wang, L. Sun, C. Deng, K. Shao, M. Pei, Z. Tian, et al (2025). Spatialviz-bench: Automatically generated spatial visualization reasoning tasks for mllms↩︎

  108. L. Li, M. Bigverdi, J. Gu, Z. Ma, Y. Yang, Z. Li, et al (2025). Unfolding spatial cognition: Evaluating multimodal models on visual simulations. arXiv:2506.04633 ↩︎

  109. Y. Li, Q. Gao, T. Zhao, B. Wang, H. Sun, H. Lyu, et al (2025). Core knowledge deficits in multi-modal language models. arXiv:2410.10855 ↩︎

  110. P. Wu, S. Xie (2023). V*: Guided visual search as a core mechanism in multimodal llms. arXiv:2312.14135 ↩︎

  111. D. Li, H. Li, Z. Wang, Y. Yan, H. Zhang, S. Chen, et al (2025). Viewspatial-bench: Evaluating multi-perspective spatial localization in vision-language models. arXiv:2505.21500 ↩︎

  112. Z. Wang, M. Xia, L. He, H. Chen, Y. Liu, R. Zhu, et al (2024). Charxiv: Charting gaps in realistic chart understanding in multimodal llms. arXiv:2406.18521 ↩︎

  113. A. Kembhavi, M. Salvato, E. Kolve, M. Seo, H. Hajishirzi, A. Farhadi (2016). A diagram is worth a dozen images. arXiv:1603.07396 ↩︎

  114. L. Ouyang, Y. Qu, H. Zhou, J. Zhu, R. Zhang, Q. Lin, et al (2024). Omnidocbench: Benchmarking diverse pdf document parsing with comprehensive annotations. arXiv:2412.07626 ↩︎

  115. A. Jian, W. Qiu, X. Wang, P. Wang, Y. Hao, J. Pei, et al (2025). Csvqa: A chinese multimodal benchmark for evaluating stem reasoning capabilities of vlms. arXiv:2505.24120 ↩︎

  116. K. Li, Z. Meng, H. Lin, Z. Luo, Y. Tian, J. Ma, et al (2025). Screenspot-pro: Gui grounding for professional high-resolution computer use. arXiv:2504.07981 ↩︎

  117. Z. Wu, Z. Wu, F. Xu, Y. Wang, Q. Sun, C. Jia, et al (2024). Os-atlas: A foundation action model for generalist gui agents. arXiv:2410.23218 ↩︎

  118. T. Xie, J. Deng, X. Li, J. Yang, H. Wu, J. Chen, et al (2025). Scaling computer-use grounding via user interface decomposition and synthesis. arXiv:2505.13227 ↩︎

  119. X. Wang, Z. Wu, J. Xie, Z. Ding, B. Yang, Z. Li, et al (2025). Mmbench-gui: Hierarchical multi-platform evaluation framework for gui agents. arXiv:2507.19478 ↩︎

  120. Y. Wang, X. Ma, G. Zhang, Y. Ni, A. Chandra, S. Guo, et al (2024). Mmlu-pro: A more robust and challenging multi-task language understanding benchmark. Advances in Neural Information Processing Systems, NeurIPS 2024, 2024c. ↩︎

  121. D. Rein, B. L. Hou, A. C. Stickland, J. Petty, R. Y. Pang, J. Dirani, et al (2023). Gpqa: A graduate-level google-proof q&a benchmark. arXiv:2311.12022 ↩︎

  122. M.-A.-P. Team, X. Du, Y. Yao, K. Ma, B. Wang, T. Zheng, et al (2025). Supergpqa: Scaling llm evaluation across 285 graduate disciplines. arXiv:2502.14739 ↩︎

  123. C. White, S. Dooley, M. Roberts, A. Pal, B. Feuer, S. Jain, et al (2025). Livebench: A challenging, contamination-free LLM benchmark. The Thirteenth International Conference on Learning Representations, 2025. ↩︎

  124. MAA (2024). American Invitational Mathematics Examination 2024. https://maa.org/maa-invitational-competitions/ ↩︎

  125. MAA (2025). American Invitational Mathematics Examination 2025. https://maa.org/maa-invitational-competitions/ ↩︎

  126. ByteDance-Seed (2025). Beyondaime: Advancing math reasoning evaluation beyond high school olympiads↩︎

  127. HMMT (2025). Hmmt 2025. https://www.hmmt.org/ ↩︎

  128. CNMO Committee (2024). Chinese national mathematical olympiad (cnmo)↩︎

  129. T. Luong, D. Hwang, H. H. Nguyen, G. Ghiasi, Y. Chervonyi, I. Seo, et al (2025). Towards robust mathematical reasoning. arXiv:2511.01846 ↩︎

  130. N. Jain, K. Han, A. Gu, W.-D. Li, F. Yan, T. Zhang, et al (2024). Livecodebench: Holistic and contamination free evaluation of large language models for code. arXiv:2403.07974 ↩︎

  131. J. Zhou, T. Lu, S. Mishra, S. Brahma, S. Basu, Y. Luan, et al (2023). Instruction-following evaluation for large language models. arXiv:2311.07911 ↩︎

  132. V. Pyatkin, S. Malik, V. Graf, H. Ivison, S. Huang, P. Dasigi, et al (2025). Generalizing verifiable instruction following↩︎

  133. V. Sirdeshmukh, K. Deshpande, J. Mols, L. Jin, E.-Y. Cardona, D. Lee, et al (2025). Multichallenge: A realistic multi-turn conversation evaluation benchmark challenging to frontier llms. arXiv:2501.17399 ↩︎

  134. T. Li, W.-L. Chiang, E. Frick, L. Dunlap, T. Wu, B. Zhu, et al (2024). From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline. arXiv:2406.11939 ↩︎

  135. B. Y. Lin, Y. Deng, K. Chandu, F. Brahman, A. Ravichander, V. Pyatkin, et al (2024). Wildbench: Benchmarking llms with challenging tasks from real users in the wild. arXiv:2406.04770 ↩︎

  136. R. K. Arora, J. Wei, R. S. Hicks, P. Bowman, J. Quiñonero-Candela, F. Tsimpourlas, et al (2025). Healthbench: Evaluating large language models towards improved human health. arXiv:2505.08775 ↩︎

  137. W. Wang, Z. Gao, L. Gu, H. Pu, L. Cui, X. Wei, et al (2025). Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency. arXiv:2508.18265 ↩︎

  138. C. Team, Z. Yue, Z. Lin, Y. Song, W. Wang, S. Ren, et al (2025). Mimo-vl technical report. arXiv:2506.03569 ↩︎

  139. O. Siméoni, H. V. Vo, M. Seitzer, F. Baldassarre, M. Oquab, C. Jose, et al (2025). Dinov3. arXiv:2508.10104 ↩︎

  140. J. Keller (2024). Muon: An optimizer for hidden layers in neural networks. https://kellerjordan.github.io/posts/muon/ ↩︎

  141. J. Bernstein, L. Newhouse (2024). Old optimizer, new norm: An anthology. arXiv:2409.20325 ↩︎

  142. J. Liu, J. Su, X. Yao, Z. Jiang, G. Lai, Y. Du, et al (2025). Muon is scalable for llm training. arXiv:2502.16982 ↩︎

  143. L. Meng, J. Yang, R. Tian, X. Dai, Z. Wu, J. Gao, Y.-G. Jiang (2024). Deepstack: Deeply stacking visual tokens is surprisingly simple and effective for lmms↩︎

  144. D. Guo, D. Yang, H. Zhang, J. Song, R. Zhang, R. Xu, et al (2025). Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv:2501.12948 ↩︎

  145. G. Cui, Y. Zhang, J. Chen, L. Yuan, Z. Wang, Y. Zuo, et al (2025). The entropy mechanism of reinforcement learning for reasoning language models. arXiv:2505.22617 ↩︎

  146. Y. Yue, Z. Chen, R. Lu, A. Zhao, Z. Wang, S. Song, G. Huang (2025). Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?. arXiv:2504.13837 ↩︎

  147. Z. Wang, F. Zhou, X. Li, P. Liu (2025). Octothinker: Mid-training incentivizes reinforcement learning scaling. arXiv:2506.20512 ↩︎

  148. R.-Z. Fan, Z. Wang, P. Liu (2025). Megascience: Pushing the frontiers of post-training datasets for science reasoning. arXiv:2507.16812 ↩︎

  149. OpenAI (2025). Introducing openai o3 and o4-mini. https://openai.com/index/introducing-o3-and-o4-mini/ ↩︎

  150. Y. Wei, L. Zhao, K. Lin, E. Yu, Y. Peng, R. Dong, et al (2025). Perception in reflection. arXiv:2504.07165 ↩︎

  151. S. Ren, K. He, R. Girshick, J. Sun (2016). Faster r-cnn: Towards real-time object detection with region proposal networks. arXiv:1506.01497 ↩︎

  152. D. Kahneman (2011). Thinking, fast and slow↩︎