本文译自 Mistral AI 的 Ministral 31,2026 年 1 月 13 日提交于 arXiv,14 页 6 图 5 表 2 段伪代码。原文是全文翻译,覆盖摘要、§1 引言、§2 模型架构、§3 训练配方、§4 结果、§5 讨论、§6 结论。文末的贡献者名单(4 位 core contributors 与 116 条 contributors 署名,其中 Tom Bewley 重复出现了一次)不在译文范围内。

摘要

我们推出 Ministral 3 系列,一族面向算力和内存受限场景设计的参数高效 dense 语言模型,提供 3B、8B、14B 三个参数规模。每个规模下我们都发布三个变体:通用用途的预训练 base 模型、一个 instruction finetuned 模型,以及面向复杂问题求解的 reasoning 模型。此外,我们给出了通过 Cascade Distillation 级联蒸馏——一种迭代式的剪枝加带蒸馏的继续训练技术——推导出 Ministral 3 模型的配方。每个模型都带图像理解能力,全部采用 Apache 2.0 许可。

网页2 与模型集合3

1 引言

在这项工作里我们推出 Ministral 3,一族以算力高效、数据高效的方式训练出来的 dense 模型,做法是从一个预训练好的父模型出发反复缩小并蒸馏。Qwen34 和 Llama35 这类流行的预训练模型分别在 36 万亿和 15 万亿 token 上训练,而我们借助 Mistral Small 3.1 这个能力很强的 24B 参数父模型,用 1 到 3 万亿 token 的训练量就做出了有竞争力的模型。

Ministral 3 提供 3B、8B、14B 三个规模,全部是 Mistral Small 3.16 的后代,通过 Cascade Distillation 得到。每个规模我们都给出三个变体——base、instruct、reasoning——每个都带图像理解能力,上下文长度最长 256k token(reasoning 模型是 128k)。

Ministral 3 的一个关键部件是我们的 Cascade Distillation 训练策略,一种迭代式的剪枝加蒸馏方法,它把预训练知识从一个大的父模型逐级传递给一族紧凑的子模型。这个配方让我们在训练预算小得多的情况下拿到有竞争力的表现。举个例子,Ministral 3 14B Base 模型与 Mistral Small 3.1 Base 相当接近,而体量小了 40% 以上、训练路程也短得多。

后训练之后,我们与同量级的开源权重模型——比如 Gemma 37、Qwen 348,以及 Mistral Small 3.2 2506——取得了有竞争力的结果。

Figure 1:Ministral 3 训练配方总览。左侧是 §3.1 预训练:Mistral Small 3.1 剪枝出 14B Init.,经蒸馏训练得到 14B Short Ctx.,再蒸馏得到 Ministral 3 14B Base;14B Short Ctx. 同时被剪枝成 8B Init. 重复该过程,8B 一路再剪出 3B。红色虚线是蒸馏(教师一律为 Mistral Small 3.1),灰色虚线是剪枝。右上是 §3.2 instruction-following 后训练(SFT → ODPO),右下是 §3.3 reasoning 后训练(带 CoT 的 SFT → GRPO → ODPO)
Figure 1:Ministral 3 训练配方总览。左侧是 §3.1 预训练:Mistral Small 3.1 剪枝出 14B Init.,经蒸馏训练得到 14B Short Ctx.,再蒸馏得到 Ministral 3 14B Base;14B Short Ctx. 同时被剪枝成 8B Init. 重复该过程,8B 一路再剪出 3B。红色虚线是蒸馏(教师一律为 Mistral Small 3.1),灰色虚线是剪枝。右上是 §3.2 instruction-following 后训练(SFT → ODPO),右下是 §3.3 reasoning 后训练(带 CoT 的 SFT → GRPO → ODPO)

主要贡献总结如下:

  • 我们推出 Ministral 3,一族 9 个 dense 语言模型——14B、8B、3B 三个参数规模,每个规模下各有一个预训练模型、一个 instruction finetuned 模型和一个 reasoning 模型。全部 Ministral 3 模型(3 个规模 × 3 个变体)都以 Apache 2.0 许可开放权重。
  • 我们给出一套算力高效的预训练配方 Cascade Distillation,用它预训练这些模型的成本只是从头预训练的一小部分。
  • 我们独立验证了先前工作的几个发现:(a)存在一个「capacity gap」,预训练阶段更强的教师并不产出更强的学生模型,但后训练依然从更强的教师中受益;(b)预训练学生模型时,从后训练过的教师而不是预训练教师蒸馏,benchmark 分数更好;(c)从做过人类偏好优化的教师蒸馏,比只做过 SFT 的教师更好。

2 模型架构

Table 1:Ministral 3 系列的架构规格与超参数。所有模型的词表大小都是 131K token。

层数 latent 维度 Q/KV 头数 FFN 维度 共享 embedding 上下文长度
Ministral 3 14B 40 5120 32 / 8 16384 256k
Ministral 3 8B 34 4096 32 / 8 14336 256k
Ministral 3 3B 26 3072 32 / 8 9216 256k

Ministral 3 系列基于 decoder-only 的 transformer 架构9。所有模型共享一套共同的架构基底,只按规模缩放。如 Table 1 所示,这一族由 3B、8B、14B 三个规模组成,层数分别是 26、34、40。其他架构选择包括 Grouped Query Attention10(32 个 query head、8 个 key-value head)、 RoPE 位置编码11 SwiGLU 激活12,以及 RMSNorm13。长上下文扩展我们用 YaRN14 和 attention 层里基于位置的 softmax 温度缩放1516。3B 模型用了输入输出 embedding 共享,避免 embedding 参数在总参数量里占主导。所有模型的词表都是 131K token,支持最长 256K token 的上下文。

Vision encoder。所有 Ministral 3 模型都用一个 410M 参数的 ViT 作为图像理解的 vision encoder,它从 Mistral Small 3.1 Base 拷贝过来并保持冻结,架构与 Pixtral17 里描述的相同。我们丢掉 ViT 到语言模型空间的那个预训练 projection 层,为每个模型训练一个新的 projection。

3 训练配方

Figure 1 展示了 Ministral 3 模型的训练流水线,由一个预训练阶段、后接两个各自独立的后训练阶段组成,产出 instruction finetuned 和 reasoning 两个变体。

3.1 预训练

Algorithm 1:Cascade Distillation。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
model = MS3 # Mistral Small 3.1

for model_size in [14B, 8B, 3B]:

  # 剪枝(见 Algo. 2)
  model = prune(model, model_size)

  # 短上下文蒸馏
  model = model.train(
    data=short_data,
    teacher_model=MS3,
  )

  # 长上下文蒸馏
  final_model = model.train(
    data=long_data,
    teacher_model=MS3,
  )
  yield (model_size, final_model)

Figure 2:Cascade Distillation 图示。横轴是训练进度(0 到 1),纵轴是 EMA 平滑后的 CE loss(对数刻度)。14B Short-Ctx 从 0 训到 0.3,在 0.3 处剪枝,loss 尖峰后 8B Short-Ctx 接着训到 0.6,再剪枝,3B Short-Ctx 训到 1.0。虚线是教师模型的 loss,三段收敛到的 loss 随模型变小依次抬高
Figure 2:Cascade Distillation 图示。横轴是训练进度(0 到 1),纵轴是 EMA 平滑后的 CE loss(对数刻度)。14B Short-Ctx 从 0 训到 0.3,在 0.3 处剪枝,loss 尖峰后 8B Short-Ctx 接着训到 0.6,再剪枝,3B Short-Ctx 训到 1.0。虚线是教师模型的 loss,三段收敛到的 loss 随模型变小依次抬高

Cascade Distillation。Ministral 3 模型的预训练从 Mistral Small 3.1 Base(MS3.1)出发。我们用 Cascade Distillation,一种迭代式地把 MS3.1 剪枝并蒸馏成更小后继者的方法。给定一个预训练好的更大父模型,Cascade Distillation 是一个算力高效的过程,用来预训练目标尺寸递减的一系列子模型。如 Algorithm 1 所总结,它依赖一个迭代的「剪枝—蒸馏—重复」思路:

  1. 剪枝:通过剪一个更大的预训练模型来初始化子模型的权重。
  2. 蒸馏:用教师模型的 logit 蒸馏,把刚剪出来的模型 up-train 一遍。
  3. 重复:反复施加这个策略,把子模型缩得更小。

每一级的模型剪枝都沿用与 Minitron 和 Wanda 相近的做法181920,所有变体的蒸馏教师都是 Mistral Small 3.1。剪枝和蒸馏的细节见下面几段。

与从头训练每个小模型相比,Cascade Distillation 产出的模型在 FLOP 上要高效得多。还值得一提的是,整个端到端过程可以看成是对父模型做带权重剪枝的 continual pretraining。如 Figure 2 所示,整个过程中数据没有重复使用——Cascade Distillation 在一次运行里走完整个 data mix,剪枝是在路上顺便做的。

剪枝。与 Minitron 类似,我们的剪枝策略设计目标是在缩小模型的同时,保住原模型(在一个验证集上)最关键的部件。我们采用以下关键剪枝技术:

  • 层剪枝:Sreenivas 等人19 依赖逐层移除后的反事实下游 perplexity,我们不这样做——我们发现输入激活范数与输出激活范数之比是一个更简单但同样很强的层重要性代理指标。
  • hidden 维度剪枝:对所有层的 attention normalization 和 feed-forward normalization 层的激活拼接起来做主成分分析(PCA)。这产出一个在整个网络上一致的旋转矩阵,它把模型投影到一个更低维的空间,同时最大化被解释的方差。
  • feedforward 维度剪枝:对于用 gated-linear 激活函数(比如 SwiGLU12)的 MLP,在一个非常大的 batch $x$ 下写成 $W_2(SiLU(W_1x) * W_3x)$,我们剪掉矩阵 $W_1, W_2, W_3$ 的维度。要确定 $W_1, W_3$ 保留哪些列,我们计算重要性分数,定义为上面这个表达式每一维上的绝对值的平均。然后只保留 $W_2$ 中与上面得到的下标相对应的那些行。

Algorithm 2 给出我们剪枝策略的更多细节:

Algorithm 2:Cascade Distillation 的剪枝阶段。它接受一个预训练模型和要剪到的目标尺寸配置作为输入。我们用 input_xoutput_x 指代来自一个大 calibration batch 的激活。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
def prune(model, target_size):

    target_n_layers, target_dim, target_ffn_dim = get_config(target_size)

    # 层剪枝
    scores = []
    for layer in model.layers:
        input_norm = layer.input_x.norm(dim=-1)
        output_norm = layer.output_x.norm(dim=-1)
        scores.append(
            (output_norm / input_norm).mean()
        )

    layers_to_keep = topk(scores, k=target_n_layers)
    model = remove_layers(model, layers_to_keep)

    # hidden 维度剪枝
    norm_inputs = []
    for layer in model.layers:
        norm_inputs.extend([
            layer.attn_norm.input_x,
            layer.ffn_norm.input_x,
        ])

    rotation = PCA(norm_inputs, n_components=n_dims)
    model = apply_rotation(model, rotation, target_dim)

    # feedforward 剪枝
    for layer in model.layers:
        importance = abs(
            silu(layer.ffn.w1.output_x) * layer.ffn.w3.output_x
        ).mean(dim=(0,1))
        dims_to_keep = topk(importance, k=target_ffn_dim)
        layer.ffn = prune_hidden_dims(layer.ffn, dims_to_keep)


  return model

蒸馏。权重初始化之后,每个子模型都在纯文本与图文交错数据的混合上训练,带来自教师模型的 logit 蒸馏。我们发现只用 forward KL 蒸馏目标训练,比去调那种给蒸馏目标和 next token prediction 目标分配不同权重的目标函数的系数要更好。所有阶段、所有模型规模,我们都用父模型作为教师模型(更多细节见 §5.1)。

预训练阶段由两级组成:

  1. 短上下文阶段,上下文窗口长度 16,384。这一阶段的输出就是下一个子模型剪枝阶段的输入。
  2. 长上下文阶段,用 YaRN14 和基于位置的温度缩放1516 把上下文窗口从 16,384 扩到 262,144。

3.2 后训练:Ministral Instruct

为了赋予模型 instruction-following 能力21,预训练模型在一份精挑的高质量多模态与纯文本 instruction-following 数据集上做微调。微调阶段同样由两级组成:Supervised Fine-Tuning( SFT)和 Online Direct Preference Optimization(ODPO)。

3.2.1 Supervised Fine-tuning

我们用 fp8 量化跑 SFT,损失里带一个来自强教师的 logit 蒸馏项。与预训练不同,这里每个模型都从 Mistral Medium 322 模型蒸馏(更多细节见 §5.1)。和预训练阶段一样,vision encoder 保持冻结,adapter 可训练。

3.2.2 Online Direct Preference Optimization 阶段

Direct Preference Optimization(DPO)23 提供了一个轻量的人类偏好优化框架,直接从离线的成对偏好中学习。对 Ministral 3 模型,我们采用它的在线变体 Online Direct Preference Optimization(ODPO)24:对每条样本,我们用温度 $T{=}0.7$ 从当前 policy 采两个候选回答,再用一个基于文本的 reward model 给这两个回答排序。

这个方法依赖一个 Pairwise Reward Model(PWRM)来动态给候选回答排序。PWRM 是在结构化的成对数据上做监督微调(SFT)训出来的:给定一段对话历史和两个候选回答,它预测哪个更受偏好。此外,我们改进了经典的 DPO 损失,把 PWRM 的二项式概率输出纳进来——用一个双边损失替代硬性的胜/负标签,按每个回答被偏好的概率给它加权。为了稳住学习过程,我们还做了两处改动:(1)调整 PWRM 的温度来校准胜/负概率;(2)采用一种 $\beta$-rescaling 技术,让 DPO 损失的缩放对 beta 更不敏感。

实践中,在线这个变体对缓解模型自身引入的 artifact 特别重要,比如无限生成。一些启发式做法也帮了忙:采样时凡是出现无限循环的回答就自动判为「败者」,避免这种行为被强化。最后,我们在生成时允许工具执行,这提升了模型的工具使用表现。

总结起来,我们发现用在线偏好优化在与人类偏好的对齐上显著优于 SFT 和离线变体两者。这一阶段产出的模型我们发布为 Ministral 3-14B/8B/3B Instruct。

3.3 后训练:Ministral Reasoning

reasoning 模型的后训练从预训练 checkpoint 开始,而不是从 ODPO 变体开始。我们用一条由 SFT、GRPO、ODPO 组成的三级流水线训练模型做 inference-time scaling,起点是长上下文预训练 checkpoint。经过这个面向推理的微调阶段发布的模型称为 Ministral 3 14B/8B/3B Reasoning。

3.3.1 Reasoning Supervised Fine-Tuning

在这一级,模型在短 CoT 和长 CoT 样本的混合上微调。前者取自我们的通用 SFT 数据混合,后者由带上了推理专用 system prompt 前缀的推理轨迹构成。

这些推理轨迹来自多个领域,包括数学、代码、通用对话、instruction following、多语言任务、工具使用和视觉推理。我们做了轻量过滤,剔掉格式糟糕、包含过度重复、或者有不该出现的语言切换的样本,确保模型看到的是干净、结构良好的思维链。

3B 的 SFT:对 3B 模型,朴素的 SFT 得到的模型很脆,输出过度冗长、大量重复、还会无限生成。为缓解这一点,我们做了以 Magistral Small 1.2 为教师的 logit 蒸馏。这帮助降低了 verbosity,也稳住了后续的 RL 训练。

3.3.2 强化学习

我们在 SFT checkpoint 之上做 GRPO25,打磨模型的思考过程、进一步提升推理任务上的表现。训练分两级进行:

STEM RL:第一级我们在数学、代码和视觉推理任务上训练模型。我们从多种开源和自有来源收集问答对。样本经过一条严格的多步流水线过滤清洗(细节见 Rastogi 等人26),剔掉无效的、不完整的以及过易/过难的题目。

General RL:第二级我们把范围扩到 STEM 之外。我们为一批多样的 prompt 生成原子级的评分 rubric,覆盖通用对话、instruction-following 和开放式推理任务。GRPO 过程中,一个 LLM judge 按这些 rubric 评判每条模型 rollout(比如对 prompt 的忠实度、回答质量),最终奖励设为被满足的启发式条目的比例。这一级提升了模型的 instruction following 和通用对话能力,同时保持、有时甚至提升了 STEM benchmark 上的表现。

两级我们都沿用 Rastogi 等人26 的 GRPO 训练配方。最大生成长度从 32K 提到 80K,因为我们观察到 RL 过程中有相当一部分生成被截断。允许更长的输出让模型能在最难的题目上把推理走完,带来了额外的性能收益。

3.3.3 Online Direct Preference Optimization

最后,我们把 ODPO 作为 RL 之后的对齐阶段施加上去,以更好地对齐用户偏好、打磨模型的对话与遵循指令的行为。整体流程与我们非推理 instruct 模型所用的设置相同,只有一处改动——把模型生成里的 thinking 片段剥掉之后,再送给 reward model 打分。更多实验细节在 §5.3 讨论。

4 结果

这一节我们汇报 Ministral 3 模型在各类 benchmark 上的结果。我们也把 Ministral 3 与同量级的其他开源权重模型对比,即 Qwen 3 系列48 和 Gemma 3 系列7。对于外部模型,我们用自己的评测流水线重跑了所有 benchmark,以保证比较公平。

我们在以下 benchmark 上评测。通用:MMLU27、MMLU-Redux28、ARC-Challenge29、RACE High30、TriviaQA31、NaturalQS32、AGIEval33。数学与代码:MATH34、GPQA Diamond35、MBPP36。多模态:MMMU37、MathVista38。后训练:Arena Hard39、WildBench40、MM MTBench41、AIME 2024/2025、HMMT 2025、PhyBench42、LiveCodeBench43

Table 2:Ministral 3 Base 模型与 Gemma 3 base 模型、Qwen 3 base 模型在预训练 benchmark 上的对比。所有结果都是用我们内部的 harness 在相同配置下跑评测后汇报的。

模型 MMLU-Redux (5-shot) TriviaQA (5-shot) MATH (CoT 2-Shot) AGIEval (5-shot) Multilingual MMLU (5-Shot)
Qwen 3 14B 83.7 70.3 62.0 66.1 75.4
Ministral 3 14B 82.0 74.9 67.6 64.8 74.2
Gemma 3 12B 76.6 78.8 48.7 58.7 69.0
Qwen 3 8B 79.4 63.9 57.6 59.6 70.0
Ministral 3 8B 79.3 68.1 62.6 59.1 70.6
Gemma 3 4B 62.6 64.0 29.4 43.0 51.6
Qwen 3 4B 75.9 53.0 40.5 57.0 67.7
Ministral 3 3B 73.5 59.2 60.1 51.1 65.2

Table 3:Ministral 3 Base 系列与教师模型 Mistral Small 3.1 24B 在通用推理、数学与代码、多语言、多模态 benchmark 上的评测结果。表现随模型规模平滑变化,但剪枝出来的 Ministral 3 各变体在参数量大幅削减的情况下仍保住了教师能力的很大一部分。

评测 Mistral Small 24B Ministral 3 14B Ministral 3 8B Ministral 3 3B
通用
MMLU (5-shot) 81.0 79.4 76.1 70.7
MMLU-Redux (5-shot) 82.7 82.0 79.3 73.5
ARC-Challenge 91.6 89.9 88.0 85.5
RACE High 52.1 52.3 49.7 49.3
TriviaQA (5-shot) 79.3 74.9 68.1 59.2
NaturalQS (5-shot) 34.4 29.9 25.8 21.9
数学与代码
MATH (CoT 2-Shot) 55.8 67.6 62.6 60.1
GPQA Diamond (0-shot) 36.9 39.9 39.9 33.8
MBPP (3-shot Pass@1) 71.6 71.6 70.0 63.0
多语言 MMLU
欧洲语言均值 $^\dagger$ (5-shot) 78.8 76.9 73.4 68.4
中文 (5-shot) 75.7 75.1 71.3 64.1
日文 (5-shot) 76.7 75.9 72.2 65.7
韩文 (5-shot) 59.3 59.0 55.3 48.9
多模态
MMMU (2-shot) 59.1 59.9 55.1 52.4
MathVista 51.3 43.6 35.7 23.3

$^\dagger$ 在德语、西班牙语、法语、意大利语、葡萄牙语上取平均。

4.1 预训练结果

在 Table 2 中,我们把 Ministral 3 Base 模型与 Gemma 3 系列、Qwen 3 系列中体量相近的其他开源权重模型作对比。

在 14B 这个规模上,Ministral 3 表现很强,在 TriviaQA 和 MATH 上超过 Qwen 3 14B,在其他 benchmark 上有竞争力。我们的 14B 模型在所有 benchmark 上也都明显好于 Gemma 12B。在 8B 规模上我们观察到类似的趋势。还值得指出的是,Ministral 3 8B 在多数评测上(TriviaQA 除外)都超过了更大的 Gemma 12B,凸显了 Ministral 3 模型很强的参数效率。

在 3B 规模上,整体趋势依然成立,但模型之间的差距变得更明显。Ministral 3 Base 模型连同教师模型的更多预训练评测结果放在 Table 3。

4.2 后训练结果

Table 4:Ministral 3 instruct 模型与 Qwen 3、Gemma 3 系列中 instruction-tuned baseline 的性能对比。模型按体量分组,便于同量级对照。

模型 Arena Hard WildBench MATH (maj@1) MM MTBench
Qwen3 14B (Non-Thinking) 42.7 65.1 87.00 N/A
Ministral 3 14B 55.1 68.5 90.40 84.90
Gemma3-12B-Instruct 43.6 63.2 85.40 67.00
Qwen3-VL-8B-Instruct 52.8 66.3 94.60 80.00
Ministral 3 8B 50.9 66.8 87.60 80.80
Gemma3-4B-Instruct 31.8 49.1 75.90 52.30
Qwen3-VL-4B-Instruct 43.8 56.8 90.00 80.08
Ministral 3 3B 30.5 56.8 83.00 78.30
Qwen3-VL-2B-Instruct 16.3 42.2 78.60 63.60

在 Table 4 中,我们把 Ministral 3 Instruct 模型与 Gemma 3 系列、Qwen 3 系列的 Instruct 模型作对比。对 Qwen 3,我们汇报的是它最新的带视觉能力的 instruct 变体(Qwen3-VL)的结果。

在 Table 5 中,我们把 Ministral 3 Reasoning 模型与 Qwen 3 系列的 reasoning 模型作对比。为保证比较公平,所有模型都用同一套评测流水线评测。为降低方差,我们汇报 pass@16,LiveCodeBench 例外,它用 pass@5 评测。

Table 5:Ministral 3 reasoning 模型与体量对齐的 Qwen 3 reasoning 对手在数学、科学、代码 benchmark 上的对比。

Benchmark Qwen 3 14B Ministral 3 14B Qwen3-VL 8B Ministral 3 8B Qwen3-VL 4B Ministral 3 3B
AIME 2024 83.7 89.8 86.0 86.0 72.9 77.5
AIME 2025 73.7 85.0 79.8 78.7 69.7 72.1
HMMT 2025 55.8 67.5 57.5 55.8 50.8 51.7
GPQA Diamond 66.3 71.2 67.1 66.8 60.1 53.4
PhyBench 22.0 26.0 22.0 20.0 9.0 15.0
LiveCodeBench v6 59.3 64.6 58.0 61.6 51.3 54.8

5 讨论

5.1 蒸馏教师模型的选择

Figure 3:Ministral 3 14B 的预训练消融,对比从 Mistral Small 3.1(MS3.1)和 Mistral Medium 3(MM3)蒸馏。柱状图覆盖 MMLU REDUX (5-shot)、HellaSwag、TriviaQA、MATH、AGI-EVAL、Winogrande 六个 benchmark,MS3.1 教师在其中每一个上都略高于 MM3
Figure 3:Ministral 3 14B 的预训练消融,对比从 Mistral Small 3.1(MS3.1)和 Mistral Medium 3(MM3)蒸馏。柱状图覆盖 MMLU REDUX (5-shot)、HellaSwag、TriviaQA、MATH、AGI-EVAL、Winogrande 六个 benchmark,MS3.1 教师在其中每一个上都略高于 MM3

在为蒸馏过程挑选合适的教师模型时,我们发现了几个值得一提的现象,它们实质性地影响了我们的设计选择:

更强的教师并不带来更好的结果。对预训练而言,从 Mistral Small 3.1 蒸馏优于从强得多的 Mistral Medium 3 蒸馏,即使在非 FLOP 对齐的设置下也是如此,这与 Busbridge 等人44 的观察类似(Figure 3)。然而在后训练阶段,Ministral 3 模型确实从能力更强的 Mistral Medium 3.1 的蒸馏中受益。

Figure 4:Ministral 3 3B 的预训练消融,对比从 Mistral Small 3.1 的 base 变体和后训练变体(instruct/reasoning)蒸馏。在 MMLU REDUX、HellaSwag、TriviaQA 上两者几乎持平,在 MATH (maj@4) 上 instruct 教师明显更高,MBPP 和 MMMU (2-shot) 上小幅更高
Figure 4:Ministral 3 3B 的预训练消融,对比从 Mistral Small 3.1 的 base 变体和后训练变体(instruct/reasoning)蒸馏。在 MMLU REDUX、HellaSwag、TriviaQA 上两者几乎持平,在 MATH (maj@4) 上 instruct 教师明显更高,MBPP 和 MMMU (2-shot) 上小幅更高

教师版本(base/instruct)的选择很重要。与 Goyal 等人45 一致,我们发现在预训练阶段从一个后训练过的教师而不是预训练教师蒸馏,会得到更强的模型(Figure 4)。具体来说,这对数学(MATH)和代码能力影响很大,对多模态评测(比如 MMMU)有小而一致的影响,对知识类指标(MMLU / Trivia-QA)影响可忽略。

做过人类偏好调优的模型是更好的教师。我们用 Mistral Medium 3 的两个内部版本来回答这个问题——SFT 期间,从 SFT checkpoint 蒸馏好,还是从偏好调优过的 checkpoint 蒸馏好?我们发现从偏好调优过的 checkpoint 蒸馏总是好得多。而且即使学生模型后来自己也经历了偏好调优阶段,这些收益依然存在。

5.2 模型 verbosity

Figure 5:Ministral 3 instruction-following 与 reasoning 模型在 GPQA Diamond 上的 verbosity(输出 token 数)与准确率关系。Ministral3 14B/8B Instruct 落在左上角的高效率低成本区域(不到 5000 output token 就拿到 50 以上),Qwen3-VL 8B/4B Instruct 分数相近但要花 15000–20000 token;Gemma3 12B/4B Instruct 与 Ministral3 3B Instruct 位于左下
Figure 5:Ministral 3 instruction-following 与 reasoning 模型在 GPQA Diamond 上的 verbosity(输出 token 数)与准确率关系。Ministral3 14B/8B Instruct 落在左上角的高效率低成本区域(不到 5000 output token 就拿到 50 以上),Qwen3-VL 8B/4B Instruct 分数相近但要花 15000–20000 token;Gemma3 12B/4B Instruct 与 Ministral3 3B Instruct 位于左下

我们对 Ministral 3 Instruct 的后训练与 Qwen 3 不同之处在于,我们没有在「General RL」阶段之前做「Reasoning RL」(见 Yang 等人4 的 Fig. 1),这很可能造成了两个模型在 verbosity 上的差异,如 Figure 5 所示。

在一个试图让 Ministral 3 Instruct 模型产出更长思维链的实验里,我们考察了往 SFT 训练数据中掺入不同比例的长思维链(CoT)推理轨迹、并配上精心设计的 system prompt。提高这类 Long CoT 数据的比例改善了 STEM benchmark 上的表现;但它也导致了过度的反思、内心独白和回溯行为(如下所示),这对一个通用对话模型来说既不理想也不自然。

Instruct 模型里的推理行为

好,我们一步一步来解这道题。问题是:求所有满足 $17_b$ 整除 $97_b$ 的整数进制 $b > 9$ 之和。首先,我需要回忆一下怎么把 $b$ 进制的数转成十进制。$b$ 进制下的数 $d_n d_{n-1} \dots d_1 d_0$ 等于十进制下的 $d_n b^n + d_{n-1} b^{n-1} + \dots + d_1 b + d_0$。

……

等等,题目说的是 $b > 9$,所以我们需要检查 56 的大于 9 的那些约数(因为 $b = d - 7$

……

等等,我们换个方式验算一下。不用同余,我们可以对某个整数 $k \geq 1$ 列出方程 $9b + 7 = k(b + 7)$

……

我想就是这样了。关键是把这些数转成十进制、列出整除条件,并意识到进制必须大于 9,所以我们只考虑那些让 $b > 9$ 的 56 的约数。

……

因此,有效的进制是 21 和 49。它们之和为:$21 + 49 = 70$。所以答案是 $\boxed{70}$。

5.3 Ministral 3 Reasoning 的 ODPO

Figure 6:ODPO 对 Ministral 3 reasoning 模型对话 benchmark 的影响,施加在 GRPO 训练过的 checkpoint 之上。三组柱子分别是 14B、8B、3B,实心部分是 ODPO 前的分数,斜纹部分是 ODPO 带来的增量。14B 和 8B 在 ArenaHard、EQBench、WildBench 三项上都有大幅增益,3B 的增量很小
Figure 6:ODPO 对 Ministral 3 reasoning 模型对话 benchmark 的影响,施加在 GRPO 训练过的 checkpoint 之上。三组柱子分别是 14B、8B、3B,实心部分是 ODPO 前的分数,斜纹部分是 ODPO 带来的增量。14B 和 8B 在 ArenaHard、EQBench、WildBench 三项上都有大幅增益,3B 的增量很小

推理模型虽然更擅长解难题,但在通用对话质量上往往落后,这个模式我们在 Ministral 3 reasoning 变体上也观察到了。为解决这一点,我们在 RL 训练过的 checkpoint 之上做了 ODPO 训练。如 Figure 6 所示,这在对齐类 benchmark 上显著改善了 14B 和 8B 模型。但 3B 模型在这一阶段之后并没有在公开 benchmark 上表现出显著提升46

6 结论

我们推出了 Ministral 3,一族面向资源受限环境设计的高效 dense 语言模型。通过从更大的教师模型(Mistral Small 3.1 和 Medium 3)迭代蒸馏,我们做出了三个模型规模(14B、8B、3B),每个都有 base、instruction-following 和推理增强三个变体。所有模型都支持视觉能力,能处理最长 256K 的上下文。总的来说,Ministral 3 模型体现了 Mistral 对支持和推进开源事业的持续投入。我们希望它们能为社区带来价值,为一个更强、更有活力的开源生态做出贡献。


  1. Ministral 3, https://arxiv.org/abs/2601.08584 ↩︎

  2. Mistral 3 发布页, https://mistral.ai/news/mistral-3 ↩︎

  3. Ministral 3 模型集合, https://huggingface.co/collections/mistralai/ministral-3 ↩︎

  4. A. Yang et al., Qwen3 Technical Report, https://arxiv.org/abs/2505.09388 ↩︎ ↩︎ ↩︎ ↩︎

  5. A. Dubey et al., The Llama 3 Herd of Models, https://arxiv.org/abs/2407.21783 ↩︎

  6. Mistral Small 3.1, https://mistral.ai/news/mistral-small-3-1 ↩︎

  7. A. Kamath et al., Gemma 3 Technical Report, https://arxiv.org/abs/2503.19786 ↩︎ ↩︎

  8. S. Bai et al., Qwen3-VL Technical Report, https://arxiv.org/abs/2511.21631 ↩︎ ↩︎

  9. A. Vaswani et al., Attention Is All You Need, NeurIPS 2017, https://arxiv.org/abs/1706.03762 ↩︎

  10. J. Ainslie et al., GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints, https://arxiv.org/abs/2305.13245 ↩︎

  11. J. Su et al., RoFormer: Enhanced Transformer with Rotary Position Embedding, https://arxiv.org/abs/2104.09864 ↩︎

  12. N. Shazeer, GLU Variants Improve Transformer, https://arxiv.org/abs/2002.05202 ↩︎ ↩︎

  13. B. Zhang and R. Sennrich, Root Mean Square Layer Normalization, NeurIPS 2019, https://arxiv.org/abs/1910.07467 ↩︎

  14. B. Peng et al., YaRN: Efficient Context Window Extension of Large Language Models, https://arxiv.org/abs/2309.00071 ↩︎ ↩︎

  15. K. M. Nakanishi, Scalable-Softmax Is Superior for Attention, https://arxiv.org/abs/2501.19399 ↩︎ ↩︎

  16. MetaAI, The Llama 4 Herd: The Beginning of a New Era of Natively Multimodal AI Innovation, https://ai.meta.com/blog/llama-4-multimodal-intelligence/ ↩︎ ↩︎

  17. P. Agrawal et al., Pixtral 12B, https://arxiv.org/abs/2410.07073 ↩︎

  18. M. Sun et al., A Simple and Effective Pruning Approach for Large Language Models, https://arxiv.org/abs/2306.11695 ↩︎

  19. S. T. Sreenivas et al., LLM Pruning and Distillation in Practice: The Minitron Approach, https://arxiv.org/abs/2408.11796 ↩︎ ↩︎

  20. S. Muralidharan et al., Compact Language Models via Pruning and Knowledge Distillation, https://arxiv.org/abs/2407.14679 ↩︎

  21. L. Ouyang et al., Training Language Models to Follow Instructions with Human Feedback, NeurIPS 2022, https://arxiv.org/abs/2203.02155 ↩︎

  22. Mistral Medium 3.1 文档, https://docs.mistral.ai/models/mistral-medium-3-1-25-08 ↩︎

  23. R. Rafailov et al., Direct Preference Optimization: Your Language Model Is Secretly a Reward Model, https://arxiv.org/abs/2305.18290 ↩︎

  24. S. Guo et al., Direct Language Model Alignment from Online AI Feedback, https://arxiv.org/abs/2402.04792 ↩︎

  25. DeepSeek-AI et al., DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, https://arxiv.org/abs/2501.12948 ↩︎

  26. A. Rastogi et al., Magistral, https://arxiv.org/abs/2506.10910 ↩︎ ↩︎

  27. D. Hendrycks et al., Measuring Massive Multitask Language Understanding, https://arxiv.org/abs/2009.03300 ↩︎

  28. A. Perez et al., Are We Done with MMLU?, https://arxiv.org/abs/2406.04127 ↩︎

  29. P. Clark et al., Think You Have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge, https://arxiv.org/abs/1803.05457 ↩︎

  30. G. Lai et al., RACE: Large-Scale ReAding Comprehension Dataset From Examinations, EMNLP 2017, https://arxiv.org/abs/1704.04683 ↩︎

  31. M. Joshi et al., TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension, https://arxiv.org/abs/1705.03551 ↩︎

  32. T. Kwiatkowski et al., Natural Questions: A Benchmark for Question Answering Research, TACL 7 (2019) 453–466 ↩︎

  33. W. Zhong et al., AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models, https://arxiv.org/abs/2304.06364 ↩︎

  34. D. Hendrycks et al., Measuring Mathematical Problem Solving with the MATH Dataset, https://arxiv.org/abs/2103.03874 ↩︎

  35. D. Rein et al., GPQA: A Graduate-Level Google-Proof Q&A Benchmark, CoLM 2024, https://arxiv.org/abs/2311.12022 ↩︎

  36. J. Austin et al., Program Synthesis with Large Language Models, https://arxiv.org/abs/2108.07732 ↩︎

  37. X. Yue et al., MMMU: A Massive Multi-Discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI, CVPR 2024, https://arxiv.org/abs/2311.16502 ↩︎

  38. P. Lu et al., MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts, ICLR 2024, https://arxiv.org/abs/2310.02255 ↩︎

  39. T. Li et al., From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline, https://arxiv.org/abs/2406.11939 ↩︎

  40. B. Y. Lin et al., WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild, https://arxiv.org/abs/2406.04770 ↩︎

  41. MM-MT-Bench 数据集, https://huggingface.co/datasets/mistralai/MM-MT-Bench ↩︎

  42. Z. Liu et al., PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models, https://arxiv.org/abs/2504.16074 ↩︎

  43. N. Jain et al., LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code, https://arxiv.org/abs/2403.07974 ↩︎

  44. D. Busbridge et al., Distillation Scaling Laws, https://arxiv.org/abs/2502.08606 ↩︎

  45. S. Goyal et al., Distilled Pretraining: A Modern Lens of Data, In-Context Learning and Test-Time Scaling, https://arxiv.org/abs/2509.01649 ↩︎

  46. 原文脚注:我们还发现 3B base 在微调时比 14B 和 8B 对超参数选择更敏感。这个模型在我们的内部人工评测里表现更好,所以我们还是选了 ODPO checkpoint 作为发布候选。 ↩︎