本文译自百川智能的 Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-Making1,2026 年 2 月 6 日提交于 arXiv。正文全译,覆盖摘要、§1 引言、§2 训练基础设施、§3 任务专用训练方法、§4 评测、§5 推理优化、§6 结论、§7 局限与未来工作、§8 贡献者;附录 A 只译四组消融实验的结论与图表,实验配置细节从略。参考文献一节不译,正文里的引用走脚注。

这篇报告的重心和 garden 里其他模型报告很不一样:它几乎不谈架构和预训练——235B 这个规模只出现在 Table 2 的行标签和开源仓库名里,专家数、激活参数量、预训练数据一个字都没写。全文讲的是后训练怎么做:怎么把医生的问诊流程拆成可以分别给奖励的四个阶段(Segmented Pipeline RL 与 SPAR)、怎么让幻觉惩罚在模型能力还不够时先让路(Fact-Aware RL),以及怎么把三个专家模型融合成一个策略(Task RL → 离线蒸馏 → MOPD)。

摘要

我们推出 Baichuan-M3,一个医疗增强的大语言模型,其设计目标是把范式从被动的问答转向主动的、临床级的决策支持。针对现有系统在开放式问诊中的局限,Baichuan-M3 用一套专门的训练流水线来建模医生的系统性工作流程。关键能力包括:(i) 主动获取信息以消解歧义;(ii) 长程推理,把散落的证据统一成连贯的诊断;(iii) 自适应的幻觉抑制,以保证事实可靠性。实证评测表明,Baichuan-M3 在 HealthBench、新提出的 HealthBench-Hallu 和 ScanBench 上取得了 state-of-the-art 的结果,在临床问诊、健康咨询和安全性上显著超过 GPT-5.2。模型已公开发布在 huggingface.co/collections/baichuan-inc/baichuan-m3

1 引言

大语言模型(LLM)正在快速发展2345,在医疗健康领域的应用也随之扩大678910。于是人们的期待正在从一次性的问答转向端到端的临床决策支持1112。这一趋势反映在 OpenAI 的 GPT-5.213、ChatGPT Health14 和 Claude in Healthcare15 这些领先系统上。但关键的局限仍然存在:尽管在静态、条件明确的 benchmark 上分数更高了,模型在开放式的临床交互中往往做不到扎根于证据、也做不到对不确定性保持敏感——在这类场景里信息是缺失的、决策是长程的,幻觉因此更难控制16。所以我们的目标是超越「可靠的问答」,走向能在实践中安全运行的决策支持伙伴。

为了弥合被动检索与主动临床支持之间的差距,近期的研究沿着两条部分脱节的范式来评测:(i) 以事实性为核心的单轮 benchmark,(ii) 以过程为导向的多轮问诊模拟。HealthBench17 和 Med-HALT18 这类 benchmark 衡量事实一致性和常见错误模式,包括幻觉。它们经常显示出:在需要复杂、多约束临床推理的困难样例上性能会下降,而且模型可能产生没有依据的断言。与此同时,OSCE(Objective Structured Clinical Examination,客观结构化临床考试)设定下的交互式病史采集(Interactive History Taking,IHT)也受到越来越多关注,这类设定考察模型引出缺失信息、遵循临床工作流程的能力。Google 的 AMIE1920 这类系统在这些 rubric 下,于模拟接诊中展示出很强的沟通质量。

然而,把这两个维度统一起来仍存在一个关键的空白。已有方法往往把对话交互和临床推理当作彼此正交的目标,而不是同一个连贯系统的两个组成部分。以知识为中心的模型表现出「问诊惰性」(inquiry inertia),缺少主动引出缺失证据的能动性;而以交互为中心的模型可能牺牲诊断深度,把流畅度放在有原则的鉴别推理之上。

把交互和推理整合起来之所以困难,有三个技术瓶颈。第一,各类临床任务的训练环境是异质的,这妨碍了稳定的多任务融合。第二,长程交互放大了强化学习(RL)里的 credit assignment 问题212223:当监督信号主要来自最终结果时,模型很难判断是哪些对话轮次真正导致了诊断成功。第三,为了加深推理而做的努力经常撞上 reward saturation,也就是学习信号在性能接近平台期时衰减——有时还伴随着幻觉增加,因为模型会试图去满足复杂的逻辑约束2425

为了应对这些挑战,我们推出 Baichuan-M3,一个新一代医疗 LLM,设计目标是把临床问诊和可靠决策统一起来。Baichuan-M3 强调三项与真实临床工作流程对齐的核心能力:(i) 主动获取信息,(ii) 构造连贯的推理轨迹,(iii) 自适应的幻觉抑制。

在方法上,我们提出一个三阶段的训练框架,由任务专用强化学习(Task-Specific Reinforcement Learning,TaskRL)、离线策略蒸馏(Offline Policy Distillation)和多教师 on-policy 蒸馏(Multi-Teacher Online Policy Distillation,MOPD)组成。这个分层设计先解耦各项能力的独立优化,再把它们整合进一个统一策略。为了提升长程问诊的表现,我们引入 Segmented Pipeline Reinforcement Learning,它把复杂任务分解成若干阶段,每个阶段有独立的奖励信号。我们还通过动态 rubric 演化(Dynamic Rubric Evolution)和针对幻觉抑制的 RL 目标来强化诊断推理。

译注:MOPD 这个缩写在原文里对应两个不同的展开。§1 这里写的是 Multi-Teacher Online Policy Distillation,而 §2.3 的 Stage 3 标题写的是 Multi-Teacher On-Policy Distillation。考虑到缩写是 MOPD、Stage 3 引的正是 Thinking Machines 那篇 On-Policy Distillation26、而且该阶段用的是 reverse KL 正则,应以 On-Policy 为准。

Baichuan-M3 在三个权威 benchmark 上取得 state-of-the-art 表现:(1) HealthBench-Hard 上 44.4,超过 GPT-5.2;(2) ScanBench(我们提出的 OSCE 式 benchmark)的三个维度全部第一——临床问诊(74.9)、检验检查(72.1)、诊断(74.4)——同时超过 GPT-5.2-High 和人类专家基线;(3) 在不使用工具的幻觉评测中有更好的事实可靠性。总结起来,我们的贡献有三点:

  • 打通问诊与推理。我们提出 Baichuan-M3,目标是把 LLM 从被动的信息检索者变成稳健的决策支持伙伴。通过对完整临床决策过程的建模,我们的系统展示出主动引出缺失数据的能动性,同时保持严格的诊断逻辑,从而应对开放式场景中「靠假设来幻觉」(hallucination via assumption)这一关键局限。
  • 与临床流程对齐的优化。我们引入一套模仿专业医学训练的训练范式,用 Segmented Pipeline RL 把模型行为与临床问诊的不同阶段(问诊、检验检查、诊断)对齐。这一方法与动态 rubric 演化结合,确保模型学会优先做基于证据的推理,而不是单纯追求对话流畅度或者硬凑逻辑。
  • 实证结果领先。大量实验表明 Baichuan-M3 在事实可靠性和交互流程严谨性两方面都处于领先。它在 HealthBench-Hard 和我们提出的 ScanBench 上创造了新的 state-of-the-art,相比 GPT-5.2 这类领先的闭源模型和人类专家基线,在幻觉抑制和诊断准确率上都有显著提升。

2 训练基础设施

这一节我们介绍 Baichuan-M3 的训练基础设施,包括一个稳定的患者模拟环境、一套融合 rubric 评估与事实感知评估的验证系统、以及一条渐进式的多阶段训练流水线。这几个组件共同为长程医疗训练提供可靠的交互信号和可扩展的优化支持。

2.1 患者模拟器

在我们之前的工作7里,我们引入了一个用于医患交互的患者模拟器。在实际部署中我们发现,模拟主动型患者时这个模拟器会变得不稳定。具体来说,这类行为会打断问诊的流程,导致模拟难以复现。为了在随机性带来的泛化收益与长程训练所需的稳定性之间取得平衡,我们改用被动性格的患者模拟器,并实现了两种互补的、脚本驱动的模式,称为 Passive Interaction Mode 和 Interruption-Injected Mode。

Passive Interaction Mode(75% 采样概率)。这种模式只提供患者档案、问诊 rubric 和行为约束 rubric,不给任何预设的对话历史。它模拟的是初诊的开场阶段。从空的交互状态出发,这个模式考察医生 agent 在高不确定性下主动引出相关信息、形成初步诊断假设的能力。

Interruption-Injected Mode(25% 采样概率)。这种模式在基本患者信息之外加入一段预设的对话片段,用来模拟问诊进行到一半的状态。这段片段以一个患者主动提出的问题结尾(往往是出于对严重程度或治疗的焦虑),建模的是问诊中常见的一种打断。不过,把这段片段暴露给患者模拟器可能会让它模仿片段里的说话风格,偏离我们设定的被动应答协议,从而引入不稳定。因此我们采用一种非对称可见性机制:这段片段只对医生 agent 可见,对患者模拟器隐藏。医生回答该问题并继续问诊,而模拟器只被动接收并回应后续提问。

为了减小模拟环境与真实线上问诊之间的分布差异,我们在 Interruption-Injected Mode 里进一步引入细粒度的概率配置。具体来说,轮末提问占 50% 的情形,此时患者的问题只出现在片段的末尾,考察模型处理突然打断的能力。剩下 50% 是轮中提问,把问题注入到进行中的一轮里,以模拟多轮交互。这种混合配置确保模型在交互噪声下——包括频繁的打断、质疑和焦虑驱动的追问——仍能保持稳健的诊断表现。

2.2 验证系统

为了保证生成回复的可靠性和临床安全性,我们构建了一套完整的验证系统(Verify System),它是强化学习奖励信号的主要来源。通用领域的对话模型往往只要流畅、有帮助就够了,而医疗 agent 面临双重挑战:既要严格遵循诊断规程,又要保证绝对的事实精确。单一的整体奖励模型往往难以把这两个正交的维度拆开——它有可能鼓励流畅的幻觉而不是死板的准确。为此,我们的系统把评估过程解耦成两条并行的流:一个 Rubric Verifier,通过细粒度的评判标准评估结构质量和对临床指南的遵循程度;一个 Fact Verifier,严格地拿外部权威来源核验每一条原子断言(atomic claim)在生物学和医学上是否成立。这种混合方式确保模型同时朝着专业合规性和事实扎根性两个方向被优化。

2.2.1 Rubric Verifier

M3 的验证栈沿用 M27 里引入的 rubric-based verifier 范式2728。我们不把医疗回复质量当成单一的整体偏好信号,而是把每一次交互分解成一组可独立判定的 rubric 子句。一个基于 LLM 的 judge29 逐条评估每个子句,得到的判定再聚合成一个标量奖励用于策略优化。

给定一个样本 $x$ 和一组 rubric $\mathcal{R}=\{r_i\}_{i=1}^{N}$,每条 rubric $r_i$ 被赋予一个带符号的权重 $w_i \in [-10, 10]$,其中 $w_i > 0$ 表示奖励、$w_i < 0$ 表示惩罚。LLM judge 输出一个二元判定 $a_i \in \{0, 1\}$,表示 $r_i$ 是否被满足。任务奖励通过 min-max 归一化得到:

$$ R_{\text{task}} = \frac{\sum_{i=1}^N w_i a_i - \sum_{i:w_i<0} w_i}{\sum_{i=1}^N |w_i|} \tag{1} $$

这个归一化把奖励的量纲从 rubric 的条数和权重大小中解耦出来,压到 $[0,1]$ 区间。结果是不同样本、不同 rubric 配置之间的奖励分布保持可比,同时可以用整数权重以一种可解释的方式直接编码子句之间的相对重要性。

为了提高 RL 流水线的效率,奖励评估与 rollout 过程是异步调度的:策略一产出回复,我们就立刻启动对应的 rubric 评判作业,把 judge 的计算与其他不冲突的 RL 动作(比如计算 $\pi_{\text{ref}}/\pi_{\text{old}}$ 的 log 概率)重叠起来以加速训练。此外我们为 judge 采用了一种 prefix-affinity 的 prompt 设计:系统约束、输出 schema 和对话上下文共享同一个模板前缀,只有后缀被替换成具体的 rubric 子句。这样的处理会做 micro-batching 以最大化 KV cache30 复用,大幅降低时间开销。

2.2.2 Fact Verifier

Baichuan-M27 主要依靠 rubric-based 的奖励来塑造医疗推理。当性能在常见评判标准上趋于饱和后,模型倾向于通过补充更罕见的临床细节来榨取边际收益,而这会提高幻觉风险;因此我们同时优化完整性和可靠性。为了把「低幻觉率」这个目标变得可量化、可优化,我们在已有的长文本事实性评测方法3132之上构建了一条 Fact-Aware Verification Pipeline。这条流水线采用两阶段架构:首先,把长文本回复分解成细粒度、可独立核验的原子断言;其次,用一个搜索增强的验证 agent 拿权威来源逐条核验。这个模块作为服务与 Rubric Verifier 并行运行,把延迟压到最低。

原子断言抽取模型。这条流水线的基础是把非结构化的模型输出转换成离散的、可核验的单元,也就是 atomic claim。这些 claim 必须自包含,脱离原始上下文之后仍然可核验。为满足这一要求,我们施加以下规则:

  1. 原子性与指代消解。我们把复杂的复合句分解成单一事实单元,并把代词还原,以保证语义独立。
  2. 噪声与干扰项过滤。我们丢弃那些缺少足够上下文、无法构成事实陈述的单元。特别地,在多选题场景下,我们明确排除对错误选项(干扰项)的复述,避免它们被误判成幻觉。
  3. 保序去重。语义上冗余的断言被消除,同时保持推理链的原有逻辑顺序。

在评测阶段我们最初用 GPT-533 作为高质量的抽取器;但它的推理延迟对在线 RL 来说是无法承受的。因此我们从 GPT-5 蒸馏出一个高效的 8B 抽取模型,训练数据横跨多个医疗子任务,并把它作为最终的抽取器,详细的保真度评测见附录 A.2.1。

搜索增强的 verifier。抽取完成后,原子断言被送进一个搜索增强的验证 agent。这个 agent 在临床指南等权威医学来源上做迭代式检索,并自主判断收集到的证据是否足以支撑一个结论。每条 claim 最终被标注为三类之一:Supported、Refuted 或 Uncertain。相比那些只依赖模型参数化知识或静态知识库的方法,这种基于动态搜索的机制能够跟上最新的临床证据,也更能应对医学知识的持续演进。

用于加速的两级缓存系统。把细粒度的事实核验引入在线 RL 循环带来了显著的计算挑战。一次 RL 迭代可能产生数千条原子断言,为每条都做实时的外部检索在成本和延迟上都不可接受。

为了加速训练,我们设计了一套两级 claim 缓存系统,其依据是一个关键观察:对同一个临床问题,模型采样出的多个回复在措辞上不同,但底层的医学断言有很高比例是共享的。

  • 一级缓存(精确匹配)。我们用 Redis 缓存相同 claim 字符串的核验结果,实现毫秒级查找和结果复用。
  • 二级缓存(语义匹配)。我们把历史 claim 的 embedding 存进向量数据库,用 ANN 检索找出语义等价的 claim 并复用其核验结果。

随着缓存池增长,整体命中率从早期的不到 40% 提升到约 80%。这把外部检索请求减少了约 85%,使得事实核验对训练的影响可以忽略。语义缓存不可避免会引入一些系统性偏差,比如剂量上有细微差别的 claim 可能被错误地当成等价。我们用 §3.2.2 描述的信号去噪机制来处理这个问题。

2.3 多任务训练流水线

为了缓解多任务学习中的取舍问题3435、降低开发复杂度,Baichuan-M3 的训练流水线被分解为三个渐进的阶段:能力学习(Capability Learning)、分布融合(Distribution Fusion)和策略统一(Policy Unification)。通过把专家能力的获取从学生模型中隔离出来,这个设计实现了稳定的融合过程,并显著提升了整体性能。整条流水线的示意图见图 1。

Figure 1:三阶段流水线示意。Stage 1 Task RL 从 Init Model 出发,分别在 Clinical、Healthcare、General 三条 RL Pipeline 上训出三个 Expert;Stage 2 Offline Policy Distillation 让各 Expert 做 Teacher Rollout,学生按 Clip-Forward KL 更新——teacher 分布 $\pi_t$ 与学生分布 $\pi_\theta$ 比较,满足 $\pi_\theta < \pi_t$ 时做梯度更新、否则 mask 掉;Stage 3 MOPD 里学生自己 rollout,同时受 Reverse KL 和多领域环境 Rewards 约束,产出 Final Model
Figure 1:三阶段流水线示意。Stage 1 Task RL 从 Init Model 出发,分别在 Clinical、Healthcare、General 三条 RL Pipeline 上训出三个 Expert;Stage 2 Offline Policy Distillation 让各 Expert 做 Teacher Rollout,学生按 Clip-Forward KL 更新——teacher 分布 $\pi_t$ 与学生分布 $\pi_\theta$ 比较,满足 $\pi_\theta < \pi_t$ 时做梯度更新、否则 mask 掉;Stage 3 MOPD 里学生自己 rollout,同时受 Reverse KL 和多领域环境 Rewards 约束,产出 Final Model

Stage 1:Task RL。在第一阶段,我们的目标是构造一组多样且高质量的专家教师。从共享的初始化出发,我们针对特定能力域部署独立的 RL 流水线。具体来说,为了应对医疗应用的多样需求,我们显式地为临床问诊(Clinical Inquiry)和健康咨询(Healthcare Consultation)训练专门的专家,确保模型捕捉到真实诊断对话和以患者为中心的健康建议的细微之处。此外,我们还训练一个聚焦基础能力(包括指令遵循和通用推理)的通才专家。

36的启发,这里的核心理念是分化而非统一。让不同模型在各自的任务专用奖励下充分探索,我们就能得到一组有着强而不同的归纳偏置的领域专家教师。这种分而治之的策略36有效地隔离了跨任务的梯度干扰,避免了多任务混合训练早期常见的优化冲突,从而为后续融合提供高置信度的行为指导。

Stage 2:Offline Policy Distillation。第二阶段的重点是通过离线蒸馏把多个教师的能力「压缩」进单个学生模型。我们冻结所有教师模型,让它们在各自领域内做 rollout 以构造一个离线轨迹数据集 $\mathcal{D}$。学生模型再以 off-policy 的方式从这些数据中学习。

为了适应离线数据「单样本」的现实、并保证融合过程的数值稳定,我们引入一个基于 Clip-Forward-KL 的受限蒸馏目标来代替标准的 KL 散度。对每个样本 $(s,a) \in \mathcal{D}$ 及其对应的教师策略 $\pi_t$,我们把损失函数定义为:

$$ \mathcal{L}_{\text{clip-FKL}}(\theta) = \mathbb{E}_{(s, a) \sim \mathcal{D}} \left[ \mathbb{I} \left( \log \pi_\theta(a|s) < \log \pi_t(a|s) \right) \cdot \left( - \log \pi_\theta(a|s) \right) \right] \tag{2} $$

其中 $\mathbb{I}(\cdot)$ 表示指示函数,$\pi_\theta(\cdot)$ 和 $\pi_t(\cdot)$ 分别表示学生模型和教师模型的 token 级概率。这个设计施加的是单边更新,只在教师的经验支撑集上要求「不劣于」,而不是去过拟合完整的条件分布。这样做避免了单样本情形下的概率过度放大,并隐式地在数据支撑集之外保留了熵。它能缓解 mode collapse,为 Stage 3 后续的 mode-seeking 优化留出探索空间。

借助 Forward KL 的 mode-covering 性质,这一阶段让学生模型能够广泛覆盖不同专家分布的高概率区域。这有利于行为模式的稳定继承,也消除了直接做多目标 RL 时冷启动带来的不稳定。

Stage 3:多教师 on-policy 蒸馏(MOPD)37。在第三阶段,学生模型重新进入在线交互环境,在混合的领域分布上做 rollout。此时模型同时受到真实任务奖励和多教师先验的约束。与第二阶段的分布模仿不同,这一阶段采用 reverse KL 正则26

借助 Reverse KL 的 mode-seeking 特性,当多个教师给出彼此冲突的建议时,学生会被驱动去选择最优的那个 mode,而不是被动地对它们求平均。在真实奖励信号的引导下,学生从「模仿者」转变为「决策者」,在策略层面实现深度的统一和能力的去噪。

教师能力的演进。我们提出的框架不是一条静态流水线,它支持循环式的迭代精炼。MOPD 之后得到的统一模型可以作为 Stage 1 的新初始化,用于领域专项增强,然后再做一轮蒸馏。这种灵活性使得模型能力可以以很低的边际成本持续改进。

3 任务专用训练方法

临床实践涵盖了一整个谱系的认知活动,从主动采集症状病史,到严格地给出基于证据的建议。单一的训练方式往往无法兼顾这些场景各自不同的要求——具体来说,诊断所需的演绎逻辑,与咨询服务所需的严格事实遵循,是两回事。为此,我们针对医疗交互的不同模态采用任务专用的优化策略。这一节我们介绍两项核心能力的专门方法:深度临床问诊(Deep Clinical Consultation),我们用一条分段流水线加上 Step-Penalized Advantage with Relative baseline 算法来掌握多轮诊断轨迹;以及可信健康咨询(Credible Healthcare Advisory),它利用动态 rubric 演化和 Fact-Aware Reinforcement Learning 来保证医疗信息的安全性与可核验性。

Figure 2:左侧 Segmented Pipeline RL,右侧策略学习算法。左侧横轴为 Global Steps,每个 Task Slot 是一个全局步上的 batch:第一个 slot 只有 Inquiry(T1),第二个是 Inquiry(T2) 与 DDX(T1),第三个是 Inquiry(T3)、DDX(T2)、Lab Test(T1),第四个是 Inquiry(T4)、DDX(T3)、Lab Test(T2)、Diagnose(T1)。同一个病例沿对角线依次走完四个阶段,相邻阶段之间标着 Context Reuse;不同病例则在同一个 slot 内并行占据不同阶段。右侧 Rollout 产生 Trajectory 后分两路——For Each Step 走 Step Verifier → Step Penalty,For Total Trajectory 走 Global Verifier → Global Reward——两路汇入 SPAR,算出 Step-wise Advantage 再 Update 回 Policy Model
Figure 2:左侧 Segmented Pipeline RL,右侧策略学习算法。左侧横轴为 Global Steps,每个 Task Slot 是一个全局步上的 batch:第一个 slot 只有 Inquiry(T1),第二个是 Inquiry(T2) 与 DDX(T1),第三个是 Inquiry(T3)、DDX(T2)、Lab Test(T1),第四个是 Inquiry(T4)、DDX(T3)、Lab Test(T2)、Diagnose(T1)。同一个病例沿对角线依次走完四个阶段,相邻阶段之间标着 Context Reuse;不同病例则在同一个 slot 内并行占据不同阶段。右侧 Rollout 产生 Trajectory 后分两路——For Each Step 走 Step Verifier → Step Penalty,For Total Trajectory 走 Global Verifier → Global Reward——两路汇入 SPAR,算出 Step-wise Advantage 再 Update 回 Policy Model

3.1 深度临床问诊

随着医疗 AI 的发展,「输入症状就即时得到诊断」的需求激增38。然而临床医学不只是简单的知识检索,它是一门以严格证据和演绎逻辑为基础的学科。因为相同的症状可能源自不同的病因,而患者各自的风险阈值也不同,可靠的临床决策必须依赖细粒度的数据、系统化的风险评估和可追溯的推理3940

我们引入深度临床问诊框架,它把问诊重新设想成一个临床级的、结构化的、可审计的信息生产过程。我们的目标是在简短的交互内收集到关键的临床数据,同时维持严格的安全标准。为此我们提出一个训练框架(见图 2),由 Segmented Pipeline RL 架构和 SPAR(Step-Penalized Advantage with Relative baseline)算法组成。

3.1.1 Segmented Pipeline RL

我们把问诊形式化为一个 $K$ 阶段的生成过程,其中 $K=4$。令 $[K]=\{1,\dots,K\}$ 为阶段索引,$\mathcal{S}=\{\text{Inq},\text{DDX},\text{Lab},\text{Diag}\}$ 为阶段类型的集合。对患者病例 $i$ 在阶段 $k$,令 $x_{k}^{(i)}$ 表示当前输入上下文,它封装了整条轨迹的历史加上当前阶段的具体指令(例如「基于以上信息,建议做哪些检验」)。策略 $\pi_\theta$ 生成一个回复片段 $y_{k}^{(i)}$:

$$ y_{k}^{(i)} \sim \pi_\theta(\cdot | x_{k}^{(i)}) \tag{3} $$

如图 2 所示,我们采用一条异步多任务流水线:在全局步 $t$,多个任务槽(task slot)在不同的流水线阶段(也可能是不同的患者病例)上并行运行;这些阶段专属任务的并集构成训练 batch $\mathcal{B}_t$。

多任务训练目标。优化的对象是生成片段 $y_k$ 相对于该阶段目标的质量。对一批活跃上下文 $\mathcal{B}_t=\{x_{k_i}^{(i)}\}_{i=1}^{N}$,联合目标函数为:

$$ \mathcal{J}(\theta) = \frac{1}{|\mathcal{B}_t|} \sum_{x_{k}^{(i)} \in \mathcal{B}_t} \mathcal{L}_{\text{RL}} \left( y_{k}^{(i)}, \mathcal{G}_{k}^{(i)} \right) \tag{4} $$

其中 $\mathcal{G}_k$ 是为阶段 $k$ 定制的奖励函数。这个形式把彼此不同的推理能力(采集信息 vs 演绎推断)统一进单一的生成式模型。

通过门控转移复用上下文。这条流水线依赖上下文的自回归累积。下一阶段的输入 $x_{k+1}^{(i)}$ 由当前上下文追加生成的回复 $y_{k}^{(i)}$ 和下一阶段的指令 $p_{k+1}$ 构成:

$$ x_{k+1}^{(i)} = [ x_{k}^{(i)}, y_{k}^{(i)}, p_{k+1} ] \tag{5} $$

然而开放式生成有误差传播的风险。为了落实「垃圾进、垃圾出」的原则,我们实现了一种质量门控转移(Quality-Gated Transition)。后续阶段的训练池 $\mathcal{D}_{k+1}$ 通过一个过滤过程来填充:

$$ \mathcal{D}_{k+1} \leftarrow \begin{cases} \mathcal{D}_{k+1} \cup \{ [ x_{k}^{(i)}, y_{k}^{(i)}, p_{k+1} ] \}, & \text{if } \mathcal{V}_{k}^{(i)} \ge \tau \\ \mathcal{D}_{k+1}, & \text{otherwise (Discard)} \end{cases} \tag{6} $$

其中 $\mathcal{V}_{k}^{(i)}$ 是阶段 $k$ 的质量 verifier 给出的分数,$\tau$ 是接受阈值。这保证了只有逻辑链在临床上成立的轨迹才会被延展,从而把错误路径从训练课程里剪掉。

3.1.2 策略学习算法:SPAR

传统的 RL 方法,比如带全局奖励的 GRPO2141,在长程的医疗问诊上有明显局限。这些局限包括 reward hacking(靠冗余提问来抬高 recall)、逻辑碎片化(临床衔接脱节)以及 credit assignment 失效。在长上下文对话中,轨迹级的奖励无法隔离局部错误42,往往会在惩罚特定缺陷的同时连带惩罚了正确的推理链,从而引发训练不稳定。

为了应对这些挑战,我们提出 SPAR(Step-Penalized Advantage with Relative baseline),它引入细粒度的步级惩罚和一种解耦的优势估计机制,从而诱导出一种自适应的课程学习效果。

奖励构造。SPAR 采用分层的奖励结构。对一个由 $L$ 个逻辑交互步 $[z_1,\dots,z_L]$ 组成的生成回复 $y$,我们把每一步 $z_j$ 定义为一次完整的对话交换(即一个用户轮次加上紧随的助手轮次)。我们首先针对完整轨迹、按一组预先定义的临床 rubric(比如诊断准确性、证据完整性)评估,算出全局奖励 $R_{\text{global}}$。

同时,一个步级 verifier 对每个交互步 $z_j$ 做实时校验。令 $\mathbb{V}_j$ 表示步 $z_j$ 触发的违规类型集合(比如冗余、安全风险)。我们把步级有效性因子 $\gamma_j \in (0,1]$ 定义为:

$$ \gamma_j = \begin{cases} 1, & \text{if } \mathbb{V}_j = \emptyset \\ \min\limits_{v \in \mathbb{V}_j} (\lambda_v), & \text{otherwise} \end{cases} \tag{7} $$

其中 $\lambda_v \in (0,1)$ 是违规类型 $v$ 的惩罚系数。这个形式贯彻的是最小有效性原则:如果某一步犯了多个错误,只施加其中最严厉的那个惩罚($\lambda$ 最小的那个)。该步的有效回报随之被调制为 $R_j = \gamma_j \cdot R_{\text{global}}$。

步级优势估计。SPAR 的核心创新在于它的优势计算,它把局部惩罚与组内 baseline 解耦。传统方法用被惩罚过的分布来归一化奖励,而 SPAR 则是拿步级惩罚后的回报去和一个未经惩罚的组均值比较,来计算步 $z_j$ 的优势 $\hat{A}_j$:

$$ \hat{A}_{j} = \frac{\gamma_{j} R_{\text{global}} - \mu_{\text{raw}}}{\sigma_{\text{raw}} + \epsilon} \tag{8} $$

其中 $\mu_{\text{raw}}$ 和 $\sigma_{\text{raw}}$ 表示采样组内原始全局奖励($R_{\text{global}}$)的均值和标准差,不含任何步级惩罚。这里的采样组指的是在同一个 prompt(即同一个问诊上下文)下生成的多条 rollout,这使得候选之间可以做相对比较。

我们随后应用 GSPO 式的策略更新43,用步级优势 $\hat{A}_j$ 来加权 likelihood-ratio 目标,这样惩罚就被归因到真正造成违规的那个交互步上。

隐式课程机制。这种优势设计通过按错误严重程度自然地安排优化优先级,形成了一种隐式的课程44

  • 阶段 1:纠正严重错误。对严重违规(比如重复),我们施加严厉的惩罚(例如 $\lambda \approx 0.1$)。这会让有效回报 $\gamma_j R_{\text{global}}$ 显著低于组内 baseline $\mu_{\text{raw}}$,产生一个很大的负优势($\hat{A}_j \ll 0$)。这个占主导的梯度信号迫使模型在训练早期优先修正影响可用性的根本缺陷。
  • 阶段 2:打磨细节。对细微的不完美(比如措辞生硬),施加较温和的惩罚(例如 $\lambda \approx 0.9$)。一开始,这点小偏差会被全局奖励的高方差($\sigma_{\text{raw}}$)掩盖。但随着策略趋于稳定、$\sigma_{\text{raw}}$ 下降,这些细粒度的信号开始主导梯度方向,引导模型走向风格上的完善。

通过隔离特定步级行为的影响,SPAR 实现了精确的 credit assignment,把局部瑕疵与整体诊断成功区分开来。

3.2 可信健康咨询

这一节详述我们针对可信健康咨询的训练方法,重点是把临床可信度和交互实用性综合起来。为了克服静态反馈的局限,我们首先引入一个动态 rubric 演化框架,用来缓解 reward hacking,确保模型追求的是真正的推理而不是表面的模式。此外,我们提出一种 Fact-Aware Reinforcement Learning 策略来增强模型的事实推理能力。这一方法超越了朴素的惩罚机制,在有效抑制不忠实幻觉的同时规避了被诱导出的保守倾向,从而保住模型给出详尽、有信息量的医疗建议的能力。

3.2.1 动态 rubric 演化

在我们之前的工作7里,我们提出了一种基于 rubric 的 RL 方法来增强临床推理能力。但我们观察到这个方法非常容易受到 reward hacking 的影响。模型倾向于追求表面上的「高分表现」而不是真正的推理,表现为消极的堆字数、防御性的模板套话,或者幻觉出细节。根本原因在于,此前的 rubric 构造只依赖输入问题。问题一旦固定,rubric 就是静态的,形成一个可预测的结构,模型很容易利用它。

为了解决这个问题,我们在 M3 上对反馈信号的根本质量做了一次显著升级(相比其前代 M2)。受4546的启发,我们提出一种人机协同的动态演化机制(Human-AI Collaborative Dynamic Evolution),其关键在于把模型的回复也纳入 rubric 的合成过程。具体来说,我们把约束分为两个不同的类别:

  • Core Rubric Set:只基于问题合成,这一组引导模型优化的总体方向,并确保基本的安全性。
  • Dynamic Rubric Set:基于问题和模型的历史回复动态合成。这一组的目标是约束训练过程中发现的不合规行为和具体弱点。

这个动态集合的构建与维护依赖两个关键模块:质量控制,以及准入与退出规则。

质量控制。为了保证动态生成的 rubric 有效且具临床相关性,我们实现了一个「挖掘—核验—注入」(Mine-Verify-Inject)的闭环工作流。首先,我们识别出高置信度样本——那些在当前系统下得分很高但隐藏着潜在缺陷的回复。接着,Rubric 挖掘 agent 分析这些样本,识别出对抗性模式并起草候选约束。最后,人类专家介入核验这些候选项。专家不必从零撰写规则,而是审阅 agent 的输出,评估其边界确定性以及是否符合元原则(例如安全性 $\gg$ 经验性)。这确保 rubric 激励的是推理,而不只是把 reward hacking 的着力点挪个位置。

准入与退出规则。为了防止规则爆炸、保持奖励信号的效力,动态 rubric 集合遵循一种「问题驱动」的生命周期:

  • 准入:一条候选 rubric 不会仅因为它成立就被采纳;只有当它针对的是一个统计上显著的失败模式(即在模型回复中有较高的违规率)时才会被激活。这确保反馈始终聚焦在当前活跃的行为缺陷上。
  • 退出:一旦某条约束在连续多个训练 epoch 里都被稳定满足(违规率 $\rightarrow 0$),它就自动从动态集合中退役。这种「剪枝」机制防止奖励信号被稀释,确保优化焦点严格停留在新出现和尚未解决的问题上,不被冗余的正向奖励冲淡。

3.2.2 Fact-Aware Reinforcement Learning

在 RLVR(Reinforcement Learning with Verification Rewards)范式下,朴素的幻觉抑制策略通常把核验信号直接转换成标量惩罚3147。标准的目标形式定义为

$$ R = R_{task} + \alpha \cdot R_{hallu} \tag{9} $$

这里 $R_{hallu}$ 用的是一个基于计数的幻觉率指标($-N_{\text{hallu}}/N_{\text{total}}$)。虽然这个目标意在通过一个惩罚项来降低幻觉、同时保住核心的医疗推理能力($R_{task}$),它在长文本生成中容易遭到两种主要形式的 reward hacking:

  • 冗余稀释(Redundancy-Induced Dilution):模型通过产出大量事实正确但价值很低的陈述来把分母 $N_{\text{total}}$ 撑大,从而在没有纠正核心错误的情况下降低了测出来的幻觉率。
  • 惩罚诱导的保守(Penalty-Induced Conservatism):严厉的惩罚会鼓励过度保守的策略(比如缩短输出以规避惩罚),这损害了探索以及复杂推理行为的获得。

为了解决这些问题,我们提出一个联合优化框架,由结构化信号去噪和动态多目标聚合组成,如图 3 所示。

Figure 3:Fact-Aware RL 算法的四段流水线。Rollout 段:Medical Query → Policy Model → Response;Claim Decomposition, De-noising &amp; Weighting 段:Claim1–Claim5 先按语义聚成 Claim Cluster(Claim2、Claim4 被折叠成灰色),每簇选出一个代表 Claim A/B/C 并带上 importance 权重;Online Fact Verification 段:Cache System 与由 LLM → WebSearch → WebFetch 组成的 Multi-Turn Search 之间做 Write/Search,输出 TRUE / UNCERTAIN / FALSE 三类核验结果;Reward Aggregation 段:Hallucination Reward 与 Task Reward 经 Dynamic Weighter(权重随 capability 变化的 S 型曲线)聚合,最后经底部 Policy Update / RL Optimizer(e.g. GSPO)回到 Rollout
Figure 3:Fact-Aware RL 算法的四段流水线。Rollout 段:Medical Query → Policy Model → Response;Claim Decomposition, De-noising &amp; Weighting 段:Claim1–Claim5 先按语义聚成 Claim Cluster(Claim2、Claim4 被折叠成灰色),每簇选出一个代表 Claim A/B/C 并带上 importance 权重;Online Fact Verification 段:Cache System 与由 LLM → WebSearch → WebFetch 组成的 Multi-Turn Search 之间做 Write/Search,输出 TRUE / UNCERTAIN / FALSE 三类核验结果;Reward Aggregation 段:Hallucination Reward 与 Task Reward 经 Dynamic Weighter(权重随 capability 变化的 S 型曲线)聚合,最后经底部 Policy Update / RL Optimizer(e.g. GSPO)回到 Rollout

结构化信号去噪。为了建立一个对冗余稳健的奖励信号,我们把原子断言的核验重新表述为一种基于语义密度的加权评估。这确保了核心诊断陈述里的幻觉所付的代价,显著高于边缘内容里的幻觉。

我们首先通过一个语义编码器 $\mathcal{E}(\cdot)$ 把回复句子序列 $\{s_j\}$ 和抽取出的断言 $\{c_i\}$ 映射到向量空间。为了防止通过同义改写来操纵指标,我们用一个余弦相似度阈值做语义聚类。为每个簇 $\mathcal{C}_k$ 选出一个代表性断言 $c_k^{*}$,我们就把评估指标从词法频次转换成了语义单元密度。接着我们用一个 saliency weight $w(c_k^{*})$ 来量化每条断言的信息贡献,它定义为该断言与回复各句之间的最大语义相关度:

$$ w(c_k^*) = \max_{1 \le j \le M} \cos(\mathcal{E}_{c_k^*}, \mathcal{E}_{s_j}) \tag{10} $$

事实性奖励 $R_{fact}$ 计算为一个加权的惩罚项:

$$ R_{fact} = - \frac{\sum_{k=1}^{K} w(c_k^*) \cdot \mathbb{I}(c_k^*)}{\sum_{k=1}^{K} w(c_k^*) + \epsilon} \tag{11} $$

其中 $\mathbb{I}(c_k^{*})$ 是核验惩罚指示函数,定义为:

$$ \mathbb{I}(c_k^*) = \begin{cases} 1 & \text{if } c_k^* \in \{\text{Refuted}, \text{Uncertain}\} \\ 0 & \text{otherwise} \end{cases} \tag{12} $$

从机制上看,加权的分母中和了把 claim 数量撑大这种做法(反稀释),而依赖 saliency 的分子确保惩罚集中在核心错误上而不是边缘文本上,从而保住了推理的效用。

动态多目标聚合。为了在医疗推理的强化与幻觉抑制之间取得平衡,我们实现了一种动态聚合机制。我们引入一个软门控系数 $\lambda(R_{task})$,它根据 on-policy 生成的回复所拿到的任务奖励来调制惩罚强度。

给定某个回复对应的 $R_{task}$,我们严格以任务奖励为自变量、用一个整形后的 Sigmoid 函数计算动态系数 $\lambda(R_{task})$:

$$ \lambda(R_{task}) = \sigma \left( \kappa \cdot \frac{R_{task} - \mu}{\Delta} \right) \tag{13} $$

其中 $\sigma(\cdot)$ 是标准 sigmoid 函数,中心在 $\mu=(\tau_{min}+\tau_{max})/2$,尺度为 $\Delta=\tau_{max}-\tau_{min}$(陡度 $\kappa=10$)。

这些阈值通过对任务奖励分布做后验分析来校准。我们特意设定 $\tau_{min}=0.75$、$\tau_{max}=0.95$,以界定出反映有效医疗推理的那个关键区间。这个设定把惩罚强度与模型已经展现出的能力对齐:

  • 保护区($R_{task} < \tau_{min}$):$\lambda(R_{task}) \to 0$。惩罚被压制,以优先做能力优化,把基础推理技能的获得过程屏蔽起来不受干扰。
  • 过渡区($\tau_{min} \le R_{task} \le \tau_{max}$):$\lambda(R_{task})$ 非线性增长。在这个阶段,系统逐步引入事实性约束。
  • 约束区($R_{task} > \tau_{max}$):$\lambda(R_{task}) \to 1$。一旦模型展现出足够的推理能力,就施加完整的惩罚以最大化幻觉抑制。

最终的总奖励 $R$ 把任务效用和门控后的事实性惩罚聚合起来:

$$ R = R_{task} + \lambda(R_{task}) \cdot R_{fact} \tag{14} $$

这个形式实现了一种隐式课程:先确保推理能力,再施加严格的安全约束。我们在附录 A.2.2 通过对比消融实验实证验证了这个行为。

4 评测

为了全面评测 Baichuan-M3 的临床实用性和安全性,我们在两个互补的维度上做了严格的实验:动态临床工作流程模拟(ScanBench)和宽谱的医疗推理(HealthBench17)。我们把 Baichuan-M3 和一组多样的强 baseline 做对比以保证评估的稳健性。这些 baseline 包括以推理能力著称的 state-of-the-art 通用 LLM(比如 GPT-5.2-High13Deepseek-V3.2-Thinking48Qwen3-235B-thinking-250749)、有代表性的医疗专用模型(比如 AntAngelMed50),以及我们的上一代模型(Baichuan-M27)。尤为关键的是,为了拿真实世界的专业标准来衡量模型,我们显式引入了一个人类基线,由三甲医院的主治医师组成,每位都有至少 5 年临床经验。这一对比分析旨在验证模型相对于通用巨头、领域专家模型和人类专家,在复杂决策、专科知识运用和幻觉抑制上的进步。

4.1 ScanBench

与传统的静态问答 benchmark 不同,ScanBench 模拟的是「问诊 $\rightarrow$ 检验检查 $\rightarrow$ 诊断」这一真实的临床工作流程。这个数据集计划开源,它把各类临床病例转化成一条可观测、可量化的决策路径,划分为三个递进的阶段。

4.1.1 数据集构成与统计

ScanBench 的构建目标是在三个维度上高保真地模拟真实临床环境:病例多样性、问诊粒度和检查复杂度。

临床病例多样性。如 Table 1 所示,ScanBench 包含来自 12 个科室的 303 个病例。它同时覆盖常见病(比如全科医学)和长尾专科(比如风湿免疫科、血液科)。

Table 1:临床样本按科室的分布。

科室 数量 科室 数量
全科医学 111 肾内科 15
外科 50 心内科 14
妇科 26 呼吸内科 14
神经内科 25 内分泌科 7
消化内科 18 风湿免疫科 6
血液科 15 老年医学科 2

问诊粒度与严谨性。为了量化问诊过程,我们标注了 8,857 个 checklist 条目作为 ground truth。

  • 信息密度:每个病例平均含 29.23 个条目(范围 20–35),需要持续的多轮上下文跟踪。
  • 逻辑分布:checklist 镜像了临床诊断逻辑:现病史占主导(55.8%),其次是既往史(19.6%)和个人史/社会史(14.6%),在相关时还包括妇产科史(5.4%)和家族史(4.7%)。
  • 关键性加权:我们区分核心安全要点和一般信息:51.3% 被标为 Level 2(关键),用于诊断或风险排除,剩下 48.7% 是 Level 1(补充)。

完整的检查动作空间。在辅助检查阶段,模型在一个包含 38 个不同类别的统一动作空间内操作,复现真实医院的资源管理复杂度。这包括:

  • 常规与生化:血/尿/便常规、肝/肾功能、电解质、CRP、糖代谢(含 OGTT/HbA1c)等。
  • 影像与功能:CT、MRI、超声、X 光、ECG、EEG 和肺功能检查。
  • 病理与专项:肿瘤标志物、病毒标志物、自身抗体、激素、骨髓穿刺和内镜。

这个庞大的候选集要求模型精准地选出必要的检查,同时避免资源浪费。

4.1.2 工作流与评测方法

评测流水线从 Station 1:问诊开始,模型在这里与一个标准化病人做多轮交互。为了评估过程质量,我们引入 SCAN 框架,它把问诊表现分解为四个维度:安全分层(Safety Stratification)、信息澄清(Information Clarification)、关联性提问(Associative Questioning)和规范化输出(Normative Output)。我们用 GPT-4.12 来核验对 OSCE 衍生出的关键临床要点的覆盖情况,同时排除那些非诊断性(或者很容易被刷)的、在每次问诊里都反复出现的内容(比如复述年龄性别,或者模板化的自我介绍)。

译注:SCAN 这四个维度在原文里有两套名字。§4.1.2 这里定义的是 Safety Stratification / Information Clarification / Associative Questioning / Normative Output,而 §4.1.3 的分析和图 5、图 6 的坐标轴用的是 Safety Stratification / Clarity Matters / Association & Inquiry / Normative Protocol。两套名字一一对应,讲的是同四个维度,不是八个。

在拿到引出的证据之后,Station 2:检验检查同时评估资源效率和解读准确性。模型提出一个鉴别诊断,并从统一的候选池里选择检验或影像检查,候选检查按其对临床诊断和决策的贡献被划分为必要组和可选组。表现用加权 F1 分数评估,其中必要检查的 recall 被赋予更高的权重,以此反映它们在诊断流程中更高的重要性,同时保持对整体 precision 和覆盖度的平衡评估。

整条工作流以 Station 3:诊断收尾,模型在这里整合此前所有信息推断出最终诊断。我们采用基于 ICD-10 分类体系的层级匹配准则,奖励正确的叶节点匹配,同时惩罚跨分支的预测。

4.1.3 性能分析

如图 4 所示,Baichuan-M3 展现出全面的优势,在三个 station 上都排第一。最值得注意的是,在有挑战性的临床问诊阶段,它拿到 74.9 分,比第二名(GPT-5.2-High)高 12.4 分,比人类基线高出 20 分以上。这种优势延伸到检验检查(72.1)和最终诊断(74.4),说明 Baichuan-M3 具备稳健的端到端医疗推理能力,而不只是在孤立的任务上表现突出。

Figure 4:ScanBench 整体性能对比,三张横向条形图。Clinical Inquiry Score:Baichuan-M3 74.9、GPT-5.2-High 62.5、Human 53.5、Baichuan-M2 48.5、Qwen3-235B-Thinking-2507 47.5、DeepSeek-V3.2-Thinking 44.3、AntAngelMed 41.8。Lab Test Score:Baichuan-M3 72.1、GPT-5.2-High 70.4、Human 69.9、AntAngelMed 68.9、Baichuan-M2 68.0、DeepSeek-V3.2-Thinking 66.9、Qwen3-235B-2507 63.6。Diagnosis Score:Baichuan-M3 74.4、GPT-5.2-High 73.5、Human 71.3、DeepSeek-V3.2-Thinking 65.1、Qwen3-235B-Thinking-2507 62.6、Baichuan-M2 62.2、AntAngelMed 56.2
Figure 4:ScanBench 整体性能对比,三张横向条形图。Clinical Inquiry Score:Baichuan-M3 74.9、GPT-5.2-High 62.5、Human 53.5、Baichuan-M2 48.5、Qwen3-235B-Thinking-2507 47.5、DeepSeek-V3.2-Thinking 44.3、AntAngelMed 41.8。Lab Test Score:Baichuan-M3 72.1、GPT-5.2-High 70.4、Human 69.9、AntAngelMed 68.9、Baichuan-M2 68.0、DeepSeek-V3.2-Thinking 66.9、Qwen3-235B-2507 63.6。Diagnosis Score:Baichuan-M3 74.4、GPT-5.2-High 73.5、Human 71.3、DeepSeek-V3.2-Thinking 65.1、Qwen3-235B-Thinking-2507 62.6、Baichuan-M2 62.2、AntAngelMed 56.2

用 SCAN 框架进一步分解问诊能力(图 5)可以看到,Baichuan-M3 是唯一在全部四个维度上都展现出主导性领先的模型,稳定地超过 SOTA LLM 和人类专家。

具体来说,在安全分层上 Baichuan-M3 拿到 75.8 这个突出的分数,与第二名 Qwen3-235B(48.3)拉开很大差距,几乎是人类基准(40.1)的两倍。这说明它对「red flag」症状和关键风险有更强的敏感度。在关联提问方面,模型得分 72.6,显著超过 GPT-5.2-High(54.5)。这体现出它对鉴别诊断的精细掌握,使它能够主动挖掘出用户初始描述之外的隐藏临床线索。此外,Baichuan-M3 在信息澄清(84.5)和规范化流程(59.9)上也表现优异,确保采集到的信息既细致又结构规范。把这些优势整合起来,Baichuan-M3 成功构成了一个精准问诊与安全决策的闭环,其规范化程度超过人类水平。

Figure 5:问诊能力的细分对比,四张横向条形图。Safety Stratification:Baichuan-M3 75.8、Qwen3-235B-Thinking 48.3、GPT-5.2-High 43.2、Human 40.1、Baichuan-M2 39.9、AntAngelMed 36.4、Deepseek-V3.2-Thinking 33.9。Clarity Matters:Baichuan-M3 84.5、GPT-5.2-High 81.4、Human 74.6、AntAngelMed 68.1、Baichuan-M2 67.5、Deepseek-V3.2-Thinking 66.3、Qwen3-235B-Thinking 66。Association &amp; Inquiry:Baichuan-M3 72.6、GPT-5.2-High 54.5、Human 47.6、Baichuan-M2 40.8、Qwen3-235B-Thinking 37.4、Deepseek-V3.2-Thinking 34.4、AntAngelMed 28.6。Normative Protocol:Baichuan-M3 59.9、GPT-5.2-High 43.2、Qwen3-235B-Thinking 41.4、Deepseek-V3.2-Thinking 39.4、AntAngelMed 38.8、Human 37.2、Baichuan-M2 35.3
Figure 5:问诊能力的细分对比,四张横向条形图。Safety Stratification:Baichuan-M3 75.8、Qwen3-235B-Thinking 48.3、GPT-5.2-High 43.2、Human 40.1、Baichuan-M2 39.9、AntAngelMed 36.4、Deepseek-V3.2-Thinking 33.9。Clarity Matters:Baichuan-M3 84.5、GPT-5.2-High 81.4、Human 74.6、AntAngelMed 68.1、Baichuan-M2 67.5、Deepseek-V3.2-Thinking 66.3、Qwen3-235B-Thinking 66。Association &amp; Inquiry:Baichuan-M3 72.6、GPT-5.2-High 54.5、Human 47.6、Baichuan-M2 40.8、Qwen3-235B-Thinking 37.4、Deepseek-V3.2-Thinking 34.4、AntAngelMed 28.6。Normative Protocol:Baichuan-M3 59.9、GPT-5.2-High 43.2、Qwen3-235B-Thinking 41.4、Deepseek-V3.2-Thinking 39.4、AntAngelMed 38.8、Human 37.2、Baichuan-M2 35.3

4.1.4 动态问诊效率

图 6 把模型得分对对话轮数作图。为了减少极少数超长对话带来的噪声,我们丢弃了样本量不足总量 10% 的轮数区间。这让跨轮次的趋势更容易解读。

基础能力趋同,推理能力分化。图 6b 显示大多数模型在症状澄清上都很快达到相近的水平(约 0.7–0.8)。差距在关联提问上才显现出来(图 6c):Baichuan-M3 随着对话进行持续改善,而通用模型(比如 Deepseek 和 Qwen)掉在后面——在更长的时间跨度上形成了接近两倍的优势。

风险敏感度与上下文遵循。在安全分层上(图 6a),Baichuan-M3 对风险信号更敏感,随着证据积累,其得分升到约 0.7。相比之下,GPT-5.2-High 即使对话变长也一直停在 0.5 左右,说明它对急性风险的识别更弱。在规范化流程上(图 6d),表现倾向于在后面的轮次改善,说明持续跟踪上下文有助于模型遵循结构化的临床工作流程。

Figure 6:模型表现随对话轮数的演化,四张折线图,横轴为 Number of Turns(0–35),纵轴为 Average Score,两条竖虚线在第 5 和第 10 轮把过程分成 Triage / General Inquiry / Inpatient Inquiry 三段。(a) Safety Stratification:Baichuan-M3 单调上升到约 0.75,GPT-5.2-High 约 0.57,其余在 0.34–0.55 之间。(b) Clarity Matters:各模型收敛到 0.65–0.85 的窄带内。(c) Association &amp; Inquiry:Baichuan-M3 升到约 0.73,GPT-5.2-High 约 0.53,Qwen3 与 Deepseek 停在 0.36–0.38。(d) Normative Protocol:Baichuan-M3 升到约 0.59,其余在 0.31–0.40 之间
Figure 6:模型表现随对话轮数的演化,四张折线图,横轴为 Number of Turns(0–35),纵轴为 Average Score,两条竖虚线在第 5 和第 10 轮把过程分成 Triage / General Inquiry / Inpatient Inquiry 三段。(a) Safety Stratification:Baichuan-M3 单调上升到约 0.75,GPT-5.2-High 约 0.57,其余在 0.34–0.55 之间。(b) Clarity Matters:各模型收敛到 0.65–0.85 的窄带内。(c) Association &amp; Inquiry:Baichuan-M3 升到约 0.73,GPT-5.2-High 约 0.53,Qwen3 与 Deepseek 停在 0.36–0.38。(d) Normative Protocol:Baichuan-M3 升到约 0.59,其余在 0.31–0.40 之间

总的来说,通用 LLM 足以应付基础的信息采集,但临床场景所需的复杂推理和安全保障离不开专门的训练。

4.2 HealthBench

HealthBench 是一个严格的 benchmark,用于评测 LLM 的临床推理能力和安全边界。通过在不同难度层级和不同维度上评估表现,它给出了模型在真实医疗场景中效用的全面视图。

4.2.1 HealthBench-Main

如图 7 所示,Baichuan-M3 在所有关键指标上都建立了新的 state-of-the-art(SOTA)。在综合的 HealthBench Total 上,Baichuan-M3 拿到 65.1 分,明显超过第二名 GPT-5.2-High(63.3)。值得注意的是,在有挑战性的 HealthBench Hard 子集上,Baichuan-M3 以 44.4 分进一步扩大领先,显著超过 GPT-5.2-High(42.0)和 AntAngelMed(39.6)这些强劲对手。此外,Baichuan-M3 以 3.5% 的最低幻觉率展现出卓越的可靠性,说明相比其他模型,它在深度临床推理和事实准确性之间取得了稳健的平衡。

Figure 7:HealthBench 整体性能对比,三张横向条形图。HealthBench Total:Baichuan-M3 65.1、GPT-5.2-High 63.3、AntAngelMed 62.5、Baichuan-M2 60.1、Qwen3-235B-Thinking-2507 55.2、DeepSeek-V3.2-Thinking 53、Gemini-3-Pro 46.2、medgemma-27b-text-it 37.4。HealthBench Hard:Baichuan-M3 44.4、GPT-5.2-High 42、AntAngelMed 39.6、Baichuan-M2 34.7、Qwen3-235B-Thinking-2507 25.9、DeepSeek-V3.2-Thinking 21.7、Gemini-3-Pro 15.2、medgemma-27b-text-it 8.5。Hallucination Rate(越低越好):Baichuan-M3 3.5、GPT-5.2-High 3.8、medgemma-27b-text-it 5.5、DeepSeek-V3.2-Thinking 6.1、Gemini-3-Pro 7.1、AntAngelMed 8.2、Baichuan-M2 8.4、Qwen3-235B-Thinking-2507 11.4
Figure 7:HealthBench 整体性能对比,三张横向条形图。HealthBench Total:Baichuan-M3 65.1、GPT-5.2-High 63.3、AntAngelMed 62.5、Baichuan-M2 60.1、Qwen3-235B-Thinking-2507 55.2、DeepSeek-V3.2-Thinking 53、Gemini-3-Pro 46.2、medgemma-27b-text-it 37.4。HealthBench Hard:Baichuan-M3 44.4、GPT-5.2-High 42、AntAngelMed 39.6、Baichuan-M2 34.7、Qwen3-235B-Thinking-2507 25.9、DeepSeek-V3.2-Thinking 21.7、Gemini-3-Pro 15.2、medgemma-27b-text-it 8.5。Hallucination Rate(越低越好):Baichuan-M3 3.5、GPT-5.2-High 3.8、medgemma-27b-text-it 5.5、DeepSeek-V3.2-Thinking 6.1、Gemini-3-Pro 7.1、AntAngelMed 8.2、Baichuan-M2 8.4、Qwen3-235B-Thinking-2507 11.4

在与 M2 对比的细粒度能力上,M3 在大多数评测维度上都有广泛提升,形成了一个更稳健、更均衡的医疗服务能力画像(见图 8)。提升在 context seeking 和 context awareness 上尤为明显。我们把这些收益归因于增强后的深度临床问诊训练带来的迁移:M3 更主动地引出缺失的病史和风险因素,同时能识别出那些影响临床决策的上下文约束。结果是它给出的治疗建议和分诊评估更完整、更可靠。总体而言,这些结果说明 M3 把在问诊任务里学到的「问诊—澄清—决策」交互范式,泛化到了更广泛的一组医疗场景上。

Figure 8:HealthBench 上 M2 与 M3 的细粒度对比,两张雷达图,蓝线为 M2、橙线为 M3。左图 7 个 theme:context seeking 0.558 → 0.637、communication 0.686 → 0.711、emergency referrals 0.746 → 0.754、hedging 0.635 → 0.678、global health 0.571 → 0.642、health data tasks 0.476 → 0.534、complex responses 0.414 → 0.449。右图 5 个 axis:communication quality 0.619 → 0.623、completeness 0.672 → 0.699、context awareness 0.480 → 0.562、accuracy 0.649 → 0.689、instruction following 0.598 → 0.593
Figure 8:HealthBench 上 M2 与 M3 的细粒度对比,两张雷达图,蓝线为 M2、橙线为 M3。左图 7 个 theme:context seeking 0.558 → 0.637、communication 0.686 → 0.711、emergency referrals 0.746 → 0.754、hedging 0.635 → 0.678、global health 0.571 → 0.642、health data tasks 0.476 → 0.534、complex responses 0.414 → 0.449。右图 5 个 axis:communication quality 0.619 → 0.623、completeness 0.672 → 0.699、context awareness 0.480 → 0.562、accuracy 0.649 → 0.689、instruction following 0.598 → 0.593

4.2.2 HealthBench-Hallu

虽然 HealthBench 这类 benchmark 已经为医疗 LLM 的评测建立了标准,临床安全性对医疗 AI 的落地仍然是最重要的。医疗幻觉——即生成表面上可信但事实上错误的信息——是监管机构和研究界都已确认的重大关切185152。这个问题在复杂的医疗推理任务里尤为突出,因为模型输出往往是信息密度很高的长段文字,涵盖精确的药物剂量、罕见的临床表现这类专业知识。生成长度长加上语言连贯,这两者结合创造出细粒度事实错误可能躲过检测的条件,从而带来实质的临床风险。因此我们引入 HealthBench-Hallu,一个细粒度的评测框架,用于评估模型在 HealthBench 任务上生成的回复的事实完整性。通过把这些输出分解成离散的原子断言、并拿外部证据核验,这个指标给出了对医疗幻觉的严格量化。

指标设计。HealthBench-Hallu 聚焦模型生成内容中嵌入的医疗事实性谬误,主要表现为:

  • 错误或误用的医学知识:陈述错误的临床事实,或者把正确的知识套用到不恰当的语境上。
  • 编造或扭曲的医学证据:虚构不存在的参考文献、伪造临床数据,或者编造因果关系。

HealthBench-Hallu 评测。HealthBench-Hallu 复用了 Fact-Aware Verification Pipeline(见 §2.2.2),但跑的是高精度(而非高吞吐)配置:我们把 claim 抽取器升级为 GPT-5 以提高对细粒度原子断言的覆盖,并强制实时的多轮检索核验,而不依赖缓存的证据。基于这条核验流水线产出的证据标签,我们计算加权幻觉率($H$):

$$ H = \frac{\sum_{i=1}^{N} w_i}{|\text{Total Claims}|} \tag{15} $$

权重 $w_i$ 按事实风险分层赋值:Refuted(1.0)代表严重的事实谬误;Uncertain(0.5)代表证据不足或有歧义风险的陈述;Supported(0.0)代表正确的陈述。这个指标直接反映了模型在应对复杂医疗问题时的可信度边界。

实验结果。Table 2 表明,引入 Fact-Aware RL 使 Baichuan-M3-235B 能够在保住医疗推理能力的同时有效抑制幻觉。模型维持了有竞争力的任务表现(HealthBench 得分 65.1),与不做该强化学习的变体(66.2)相当,同时把 refuted 回复率和不确定率都大幅降低了约 50%。这些结果说明这种自适应加权策略有效缓解了安全约束与模型效用之间常见的取舍,避免了过度保守的方法通常引发的推理能力退化。

Table 2:幻觉抑制与能力之间的取舍。

模型 HealthBench 得分 Refuted 率 Uncertain 率
GPT-5.2-High 63.3 2.37% 2.78%
Baichuan-M2-32B 60.1 5.73% 5.43%
M3 - w/o Fact Aware RL 66.2 4.68% 3.64%
Baichuan-M3-235B 65.1 2.45% 2.07%

译注:原文没点明 Table 2 和图 7 的换算关系,但按上面 $H$ 的定义(Refuted 权重 1.0、Uncertain 权重 0.5)拿这张表一算就对上了:M3 是 $2.45\% + 0.5 \times 2.07\% = 3.49\%$,正是图 7 里的 3.5%;GPT-5.2-High 是 $2.37\% + 0.5 \times 2.78\% = 3.76\%$,对应图 7 的 3.8%;Baichuan-M2 是 $5.73\% + 0.5 \times 5.43\% = 8.45\%$,对应 8.4%。图 7 那一列「Hallucination Rate」就是这里的加权幻觉率。

用知识探针分析幻觉。为了阐明 Fact-Aware RL 降低幻觉率的内在机制,我们用知识探针(knowledge probe)来分析模型的内部认知(参数化的真实性)与其外部输出(生成的断言)之间的对齐情况,如图 9 所示。这一分析让我们能够拆解错误的来源,考察模型的输出到底是忠实反映了它的内部参数,还是因为生成不稳定而偏离了。

Figure 9:知识边界对齐分析。我们把内部参数与生成断言之间的对齐关系分为三种状态:Consistent(输出与内部认知一致)、Inconsistent(部分不匹配)、Contradictory(输出与内部认知相反)。值得注意的是,在幻觉(Refuted Claims)这个语境下,Consistent 状态表示的是源自错误内部知识的一次「诚实的错误」。图为两张百分比堆叠条形图,左图 Knowledge Consistency on Supported Claims(事实):Baichuan-M3 的 Inconsistent 10.1%、Consistent 88.3%;M3 w/o Fact Aware RL 11.2% / 87.1%;Baichuan-M2 13.5% / 84.2%;GPT-5.2 15.2% / 83.5%。右图 Knowledge Consistency on Refuted Claims(幻觉),按 Contradictory / Inconsistent / Consistent 排列:Baichuan-M3 26.4% / 28.7% / 44.9%;M3 w/o Fact Aware RL 30.4% / 29.9% / 39.7%;Baichuan-M2 35.4% / 28.0% / 36.6%;GPT-5.2 9.2% / 32.6% / 58.2%
Figure 9:知识边界对齐分析。我们把内部参数与生成断言之间的对齐关系分为三种状态:Consistent(输出与内部认知一致)、Inconsistent(部分不匹配)、Contradictory(输出与内部认知相反)。值得注意的是,在幻觉(Refuted Claims)这个语境下,Consistent 状态表示的是源自错误内部知识的一次「诚实的错误」。图为两张百分比堆叠条形图,左图 Knowledge Consistency on Supported Claims(事实):Baichuan-M3 的 Inconsistent 10.1%、Consistent 88.3%;M3 w/o Fact Aware RL 11.2% / 87.1%;Baichuan-M2 13.5% / 84.2%;GPT-5.2 15.2% / 83.5%。右图 Knowledge Consistency on Refuted Claims(幻觉),按 Contradictory / Inconsistent / Consistent 排列:Baichuan-M3 26.4% / 28.7% / 44.9%;M3 w/o Fact Aware RL 30.4% / 29.9% / 39.7%;Baichuan-M2 35.4% / 28.0% / 36.6%;GPT-5.2 9.2% / 32.6% / 58.2%

结果揭示出 Fact-Aware RL 在模型对齐动态上引起的一种明显的分化。对事实正确的输出(Supported Claims),内部认知与外部输出之间的一致性稳定保持在 88.3%,说明模型的事实性真值牢固地锚定在它的内部参数里。更关键的是,对错误的输出(Refuted Claims),一致率显著上升到 44.9%。这个上移意味着「不忠实幻觉」(unfaithful hallucination)明显减少了——所谓不忠实幻觉指的是模型内部认知本来是对的,却生成了与之矛盾的错误信息。数据说明剩下的幻觉主要是诚实的错误,也就是外部输出忠实地反映了模型参数里本身就有的一个错误认知。

归根结底,这些发现意味着 Fact-Aware RL 的主要功效不在于注入新知识,而在于调节模型的生成策略,使其严格收敛在自身真实的知识边界之内。

5 推理优化

为了让 Baichuan-M3 在医疗应用中更易获取、部署更高效,我们实现了两项推理优化策略。第一,为了加速文本生成,引入了 Gated Eagle-3 投机解码方法,使推理吞吐大幅提升。第二,应用了先进的量化方法,在不牺牲精度的前提下显著降低模型的显存需求。这些推理优化降低了部署的实际门槛,为先进医疗大语言模型的更广泛应用提供支撑。

5.1 Speculative Decoding

Speculative decoding 是一种针对自回归生成的推理期加速技术。它用一个轻量的 draft model 提出多个候选 token,再由目标模型并行核验。该算法接受经过核验的最长前缀、丢弃其余候选,使目标模型每次核验步能提交多个 token,从而提升解码吞吐。

Eagle-353 框架里,draft model 还额外以目标模型的 hidden state 为条件,以利用更丰富的语义信息。然而目标模型与 draft model 之间显著的容量差距可能引发表示失配(representation mismatch):高维、信息密集的 hidden state 可能压垮轻量的 draft model,削弱它有效利用这个辅助信号的能力。这往往导致候选接受率下降,进而限制可达到的加速比。

为了缓解这个问题,我们在 Eagle-3 的 draft model 里加入一个 Gated-Attention54 模块(称为 Gated Eagle-3,见图 10),提供一种动态且可学习的机制来调节被注入的信息。具体来说,attention 的输出被路由经过一个门控单元,与一个由当前层输入动态生成的 gate 向量做逐元素相乘来调制。这个设计实现了细粒度、逐维度的信息流控制,突出显著特征、抑制冗余或含噪的成分。

如附录 A.4 所述,Gated Eagle-3 相比 Eagle-3 base 取得了平均接受长度提升 0.31、平均吞吐提升 12% 的效果。这些结果说明,有选择地调节来自目标模型的信息,能更可靠地转化为实际的解码加速,为后续改进提供了有用的启示。

Figure 10:Gated Eagle-3 draft model 示意。左侧目标模型为 Embedding → Decoder Layer(×N)→ Head;中间 Gated Eagle-3 Draft Decoder Layer 以目标模型的 Hidden state 与 Embedding 拼接为输入,经 Norm → Gated Attention → 残差相加 → Norm → MLP → 残差相加 → Head;右侧展开 Gated Attention 的内部结构:q proj / k proj / v proj 送入 GQA,同时 Gate proj 经 $\sigma$ 生成 gate 向量,与 GQA 输出做 Element-wise multiply 后再过 o proj
Figure 10:Gated Eagle-3 draft model 示意。左侧目标模型为 Embedding → Decoder Layer(×N)→ Head;中间 Gated Eagle-3 Draft Decoder Layer 以目标模型的 Hidden state 与 Embedding 拼接为输入,经 Norm → Gated Attention → 残差相加 → Norm → MLP → 残差相加 → Head;右侧展开 Gated Attention 的内部结构:q proj / k proj / v proj 送入 GQA,同时 Gate proj 经 $\sigma$ 生成 gate 向量,与 GQA 输出做 Element-wise multiply 后再过 o proj

5.2 量化

为了降低 Baichuan-M3 在资源受限场景下的显存占用,我们应用了 INT4 权重量化。然而 Mixture-of-Experts 模型稀疏激活的本质给标准的量化校准带来挑战55:校准语料通常只激活一部分专家,导致校准有偏。结果是被频繁激活的专家量化得很准,而很少被激活的专家则承受更大的量化误差,这会在推理时造成不稳定、不可预测的精度退化。

为了解决这个问题,我们提出一种自生成的校准方案,促使专家覆盖更均匀。具体来说,我们构造一个多领域的 prompt 集,用 BF16 模型生成高质量回复作为校准数据。这个做法有两个关键好处:(i) 多样的 prompt 能激活几乎所有专家,为每个专家提供足够的样本,缓解校准偏差;(ii) 自生成的回复促使量化后的模型去匹配 BF16 模型的输出分布,从而减小分布差异。量化参数的训练基于 AutoRound56 框架,量化格式遵循 GPTQ57 标准。

实证上,得到的 INT4 量化版 M3 模型在主流 benchmark 上相对其 BF16 对照几乎无损。这些结果验证了我们提出的 MoE 专用量化校准策略的有效性,也为大规模稀疏模型的部署提供了实践指导。

6 结论

我们推出 Baichuan-M3,一个把临床问诊与可靠医疗决策统一起来的医疗增强大语言模型。通过显式建模临床工作流程,Baichuan-M3 实现了主动的信息获取、连贯的多步推理和有效的幻觉抑制。借助一套结合任务专用强化学习与多教师蒸馏的三阶段训练范式,模型在事实性和过程性两类 benchmark 上都取得了很强的表现,包括 HealthBench、HealthBench-Hallu 以及 OSCE 式的 ScanBench。这些结果表明,与工作流程对齐的优化是推进临床级医疗 LLM 的一条有效路径。

7 局限与未来工作

Baichuan-M3 目前局限于单次就诊式的、纯文本的临床场景,尚未完整覆盖纵向的疾病管理、多模态的临床信号,以及跨患者病程的超长程推理。虽然幻觉控制已有实质改善,罕见的高风险错误、以及在循证来源上显式扎根不足,仍是待解的挑战。未来工作将聚焦于把模型扩展到带多模态输入的全路径临床推理、长上下文优化,以及更紧密地整合证据检索、安全约束和基于环境的强化学习。

8 贡献者

贡献者按名字首字母顺序排列。星号(*)表示已不在团队中的成员。

核心贡献者

Chengfeng Dou, Fan Yang, Fei Li, Jiyuan Jia, Qiang Ju, Shuai Wang, Tianpeng Li, Xiangrong Zeng*, Yijie Zhou

贡献者

Hongda Zhang, Jinyang Tai, Linzhuang Sun, Peidong Guo, Yichuan Mo

专家与顾问

Xiaochuan Wang, Hengfu Cui, Zhishou Zhang

附录 A

这份附录给出补充的实验结果和详细分析,以进一步验证我们提出的方法。具体来说,我们提供 SPAR 算法和 Clip-Forward-KL 目标的消融实验,以及 Fact-Aware RL 框架和 Gated Eagle-3 投机解码机制的扩展评测。训练和评测所用的具体 prompt,详见配套的 GitHub 仓库。

以下四节只译结论与图表,实验配置细节从略。

A.1 SPAR 的消融实验

消融对比四种配置:Backbone(RL 之前的 Baichuan-M3 base 模型)、GRPO(只用最终问诊结果的全局奖励,不含中间反馈)、Global Penalty(在 GRPO 基础上加一个全局的重复惩罚)、以及 SPAR(本文提出的步级奖励计算算法)。四个指标都归一化到 $[0,1]$:Repeat Score(衡量非冗余程度)、Logical Score、Rubrics Score 和 Average Turns,其中前两个由 GPT-5 按三档($0,1,2$)评判对话日志后归一化得到。

Figure 11:多轮医疗问诊任务上 SPAR 与各 baseline 的表现对比。四组柱状图,图例依次为 baseline / grpo / global penalty / baichuan-m3,左轴为归一化得分、右轴为平均轮数。Repeat Score:0.99 / 0.63 / 0.90 / 0.95。Logical Score:0.65 / 0.55 / 0.28 / 0.51。Rubrics Score:0.47 / 0.67 / 0.69 / 0.76。Avg Turns:10.4 / 21.7 / 20.9 / 20.4
Figure 11:多轮医疗问诊任务上 SPAR 与各 baseline 的表现对比。四组柱状图,图例依次为 baseline / grpo / global penalty / baichuan-m3,左轴为归一化得分、右轴为平均轮数。Repeat Score:0.99 / 0.63 / 0.90 / 0.95。Logical Score:0.65 / 0.55 / 0.28 / 0.51。Rubrics Score:0.47 / 0.67 / 0.69 / 0.76。Avg Turns:10.4 / 21.7 / 20.9 / 20.4

结论:只用全局奖励做 GRPO 训练,Rubrics Score 稳步提升(0.47 → 0.67),但同时也增加了冗余的提问(体现为 Repeat Score 从 0.99 掉到 0.63)。加上全局重复惩罚虽然有效降低了冗余(回到 0.90),却导致 Logical Score 急剧下降(0.55 → 0.28),说明出现了严重的逻辑碎片化。这些结果说明粗粒度的全局惩罚可能会实质性地扰乱模型自然的推理流。相比之下,SPAR 取得了更好的平衡:它显著减少重复(0.95)的同时保住了逻辑连贯性(0.51),并且 Rubrics Score 最高(0.76)。这种双重优化让模型能在有限的问诊轮数内提取出更高密度的关键医疗信息。

A.2 Fact-Aware RL

A.2.1 蒸馏版 claim 抽取模型的评测

离线的 claim 抽取以 GPT-5 作为参照抽取器,但把这么大的教师模型用于在线强化学习在算力上不可承受。为此我们通过 SFT 微调更小的模型,作为在线 RL 期间的高效 claim 抽取器。抽取保真度用三个相对 GPT-5 的指标衡量:Recall(SFT 模型相对参照基线的覆盖度)、SFT 独有率(SFT 模型识别出但 GPT-5 参照中没有的 claim 占比,反映潜在的过度生成或者新发现)、GPT 独有率(GPT-5 识别出但 SFT 模型没捕捉到的 claim 占比,反映信息损失)。

Table 3:不同规模的 claim 抽取模型对比实验。

模型 Recall (%) 本方独有率 (%) GPT 独有率 (%) Claim 数
Qwen3-8B 30.45 31.02 69.55 8.50
Qwen3-32B 37.68 33.29 62.32 12.81
SFT-A3B-30B 69.69 46.89 30.31 47.19
SFT-8B 72.80 45.60 27.20 46.66
SFT-32B 73.00 47.15 27.01 46.78

结论:SFT 大幅提升了抽取表现,8B 模型达到 72.80% 的 recall,而未微调的基线只有 30.45%。32B 变体只带来边际的性能提升,其显著更高的部署成本对在线 RL 流水线来说不值得。我们采用 SFT-8B 作为 claim 抽取器,在抽取保真度和实际部署约束之间取得平衡。

A.2.2 奖励组件的消融实验

我们从一个中间的 SFT checkpoint 出发,把本文方法与两个对照组比较:一个 w/o Fact Aware RL 模型(只优化任务奖励),以及一个 Baseline(使用式 (9) 那种静态的幻觉惩罚)。

Figure 12:不同优化策略的训练动态,两张折线图,横轴为 Steps(0–300),三条曲线依次为 w/o Fact Aware RL(灰)、Baseline(蓝)、Denoise &amp; Reweight(橙)。左图 HealthBench Score:灰线从 0.663 起伏后升到 0.680;蓝线从 0.663 一路降到约 0.635;橙线在 0.654–0.675 之间波动,收在 0.660。右图 Hallucination Rate:灰线从 0.065 漂移上升到 0.0805;蓝线降到约 0.030;橙线降到约 0.034
Figure 12:不同优化策略的训练动态,两张折线图,横轴为 Steps(0–300),三条曲线依次为 w/o Fact Aware RL(灰)、Baseline(蓝)、Denoise &amp; Reweight(橙)。左图 HealthBench Score:灰线从 0.663 起伏后升到 0.680;蓝线从 0.663 一路降到约 0.635;橙线在 0.654–0.675 之间波动,收在 0.660。右图 Hallucination Rate:灰线从 0.065 漂移上升到 0.0805;蓝线降到约 0.030;橙线降到约 0.034

结论:w/o Fact Aware RL 模型(灰)拿到最高的 HealthBench 得分($\sim$ 0.68),但幻觉出现显著漂移(升到 0.08)。这个观察说明,不加约束的优化目标倾向于把模型推向生成更铺张的内容,而这可能无意中损害了事实稳定性。Baseline(蓝)纠正了这个漂移但过度补偿了;它对幻觉的激进抑制导致推理能力严重退化,正是惩罚诱导保守的典型表现。

我们的 Denoise & Reweight 策略(式 (14))有效地把安全对齐与能力损失解耦。它取得了与 Baseline 相当的幻觉下降幅度(降到 $\sim$ 0.035),同时把推理得分维持在($\sim$ 0.665)接近无约束模型的起点。这种稳定性验证了我们双重保护设计的有效性——边缘噪声过滤与基于能力的门控协同起作用。因此,这个方法成功引导模型走向事实正确,同时保住了它核心的医疗效用。

A.3 Clip-Forward-KL 用于离线专家融合的消融实验

学生模型从一个医疗问诊专家初始化,通过离线蒸馏并入一个健康咨询专家。问诊数据和健康咨询数据分别用 Clip-Forward-KL 或标准 Forward-KL 蒸馏,初始化、数据集和训练配置完全相同。ScanBench 主要反映医疗问诊能力的保留程度,而 HealthBench 和 HealthBench-Hard 评估的是并入更广泛健康咨询专长的有效性。

Table 4:Clip-Forward-KL 用于离线专家融合的消融。在相同训练配置下,Clip-Forward-KL 提升了 HealthBench 和 HealthBench-Hard,同时维持了相当的 ScanBench 表现。

方法 ScanBench HealthBench HealthBench-Hard
Forward-KL 73.7 58.6 33.2
Clip-Forward-KL 73.5 61.1 38.5

结论:Clip-Forward-KL 在保住问诊表现的同时显著改善了健康咨询类 benchmark,说明它对新领域专长的融合更有效。这提示标准的 Forward-KL 倾向于在稀疏的离线样本上过度放大概率,而这干扰的是新健康咨询能力的并入,而不是既有问诊能力的保留。通过对教师支撑的动作施加单边下界约束,Clip-Forward-KL 实现了更保守的融合,并为后续的 on-policy 优化产出了一个初始化。

A.4 Gated Eagle-3 投机解码的消融实验

原版 Eagle-3 draft model 与我们提出的 Gated Eagle-3 在相同的训练数据和相同的训练协议下对比,并在统一的推理配置下、于一组有代表性的 benchmark(GSM8K58、HumanEval59、MT-Bench60 和 HealthBench)上评估。训练用 SpecForge61 框架,推理用 SGLang62 执行。

Table 5:Eagle-3 Base 与 Gated Eagle-3 的平均接受长度对比。

方法 GSM8K HumanEval MT-Bench HealthBench
Eagle-3 Base 3.59 3.58 2.97 2.41
Gated Eagle-3 3.84 4.03 3.23 2.70
$\Delta$(增益) +0.25 +0.45 +0.26 +0.29

Table 6:Eagle-3 Base 与 Gated Eagle-3 的吞吐(tokens/s)对比。

方法 GSM8K HumanEval MT-Bench HealthBench
Eagle-3 Base 376.98 576.19 451.39 356.94
Gated Eagle-3 431.26 646.17 490.12 400.52
$\Delta$(增益) +14.40% +12.15% +8.58% +12.21%

结论:Gated Eagle-3 相比 Eagle-3 base 取得平均接受长度提升 0.31(Table 5)。吞吐对比在并行度为 8 的条件下测得(Table 6)。


  1. Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-Making, https://arxiv.org/abs/2602.06570 ↩︎

  2. GPT-4 Technical Report, https://arxiv.org/abs/2303.08774 ↩︎ ↩︎

  3. OpenAI o1 System Card, https://arxiv.org/abs/2412.16720 ↩︎

  4. Baichuan 2: Open Large-scale Language Models, https://arxiv.org/abs/2309.10305 ↩︎

  5. Baichuan-Omni-1.5 Technical Report, https://arxiv.org/abs/2501.15368 ↩︎

  6. Baichuan-M1: Pushing the Medical Capability of Large Language Models, https://arxiv.org/abs/2502.12671 ↩︎

  7. Baichuan-M2: Scaling Medical Capability with Large Verifier System, https://arxiv.org/abs/2509.02208 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  8. MedGemma Technical Report, https://arxiv.org/abs/2507.05201 ↩︎

  9. Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning, https://arxiv.org/abs/2506.07044 ↩︎

  10. Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding, https://arxiv.org/abs/2510.08668 ↩︎

  11. MedDM: LLM-executable clinical guidance tree for clinical decision-making, https://arxiv.org/abs/2312.02441 ↩︎

  12. ArgMed-Agents: Explainable Clinical Decision Reasoning with LLM Disscusion via Argumentation Schemes, BIBM 2024, https://doi.org/10.1109/BIBM62325.2024.10822109 ↩︎

  13. Introducing GPT-5.2, https://openai.com/index/introducing-gpt-5-2/ ↩︎ ↩︎

  14. Introducing ChatGPT Health, https://openai.com/index/introducing-chatgpt-health ↩︎

  15. Advancing Claude in healthcare and the life sciences, https://www.anthropic.com/news/healthcare-life-sciences ↩︎

  16. LLM Lies: Hallucinations are not Bugs, but Features as Adversarial Examples, https://arxiv.org/abs/2310.01469 ↩︎

  17. HealthBench: Evaluating Large Language Models Towards Improved Human Health, https://arxiv.org/abs/2505.08775 ↩︎ ↩︎

  18. Med-HALT: Medical Domain Hallucination Test for Large Language Models, CoNLL 2023, https://doi.org/10.18653/v1/2023.conll-1.21 ↩︎ ↩︎

  19. Towards Conversational Diagnostic AI, https://arxiv.org/abs/2401.05654 ↩︎

  20. Towards physician-centered oversight of conversational diagnostic AI, https://arxiv.org/abs/2507.15743 ↩︎

  21. DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning, Nature 645.8081, https://doi.org/10.1038/s41586-025-09422-z ↩︎ ↩︎

  22. Baichuan Alignment Technical Report, https://arxiv.org/abs/2410.14940 ↩︎

  23. An Overview of Deep Reinforcement Learning, CACRE 2019, https://doi.org/10.1145/3351917.3351989 ↩︎

  24. Are Reasoning Models More Prone to Hallucination?, https://arxiv.org/abs/2505.23646 ↩︎

  25. The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination, https://arxiv.org/abs/2510.22977 ↩︎

  26. On-Policy Distillation, Thinking Machines Lab, https://thinkingmachines.ai/blog/on-policy-distillation ↩︎ ↩︎

  27. Reinforcement Learning with Rubric Anchors, https://arxiv.org/abs/2508.12790 ↩︎

  28. Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains, https://arxiv.org/abs/2507.17746 ↩︎

  29. A Survey on LLM-as-a-Judge, https://arxiv.org/abs/2411.15594 ↩︎

  30. A Survey on Large Language Model Acceleration based on KV Cache Management, TMLR 2025, https://openreview.net/forum?id=z3JZzu9EA3 ↩︎

  31. FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation, EMNLP 2023, https://doi.org/10.18653/v1/2023.emnlp-main.741 ↩︎ ↩︎

  32. Long-form factuality in large language models, NeurIPS 2024, https://papers.nips.cc/paper_files/paper/2024/hash/937ae0e83eb08d2cb8627fe1def8c751-Abstract-Conference.html ↩︎

  33. OpenAI GPT-5 System Card, https://arxiv.org/abs/2601.03267 ↩︎

  34. Navigating the Trade-Off between Multi-Task Learning and Learning to Multitask in Deep Neural Networks, https://arxiv.org/abs/2007.10527 ↩︎

  35. Multi-Task Learning Improves Synthetic Speech Detection, ICASSP 2022, https://doi.org/10.1109/ICASSP43922.2022.9746059 ↩︎

  36. Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training, https://arxiv.org/abs/2510.13361 ↩︎ ↩︎

  37. MiMo-V2-Flash Technical Report, https://github.com/XiaomiMiMo/MiMo-V2-Flash/blob/main/paper.pdf ↩︎

  38. MedChain: Bridging the Gap Between LLM Agents and Clinical Practice with Interactive Sequence, https://arxiv.org/abs/2412.01605 ↩︎

  39. Task-oriented Dialogue System for Automatic Disease Diagnosis via Hierarchical Reinforcement Learning, https://arxiv.org/abs/2004.14254 ↩︎

  40. Integrating Physician Diagnostic Logic into Large Language Models: Preference Learning from Process Feedback, Findings of ACL 2024, https://doi.org/10.18653/v1/2024.findings-acl.144 ↩︎

  41. DCPO: Dynamic Clipping Policy Optimization, https://arxiv.org/abs/2509.02333 ↩︎

  42. Let’s Verify and Reinforce Image Generation Step by Step, CVPR 2025, https://doi.org/10.1109/CVPR52734.2025.02669 ↩︎

  43. Group Sequence Policy Optimization, https://arxiv.org/abs/2507.18071 ↩︎

  44. Curriculum learning, ICML 2009, https://doi.org/10.1145/1553374.1553380 ↩︎

  45. DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research, https://arxiv.org/abs/2511.19399 ↩︎

  46. Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training, https://arxiv.org/abs/2509.21500 ↩︎

  47. Learning to Reason for Factuality, https://arxiv.org/abs/2508.05618 ↩︎

  48. DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models, https://arxiv.org/abs/2512.02556 ↩︎

  49. Qwen3 Technical Report, https://arxiv.org/abs/2505.09388 ↩︎

  50. AntAngelMed: Open-Source Medical Language Model, https://github.com/MedAIBase/AntAngelMed ↩︎

  51. Medical Hallucinations in Foundation Models and Their Impact on Healthcare, https://arxiv.org/abs/2503.05777 ↩︎

  52. K-QA: A Real-World Medical Q&A Benchmark, BioNLP@ACL 2024, https://doi.org/10.18653/v1/2024.bionlp-1.22 ↩︎

  53. EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test, https://arxiv.org/abs/2503.01840 ↩︎

  54. Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free, https://arxiv.org/abs/2505.06708 ↩︎

  55. MoQa: Rethinking MoE Quantization with Multi-stage Data-model Distribution Awareness, https://arxiv.org/abs/2503.21135 ↩︎

  56. Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs, Findings of EMNLP 2024, https://doi.org/10.18653/v1/2024.findings-emnlp.662 ↩︎

  57. GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers, https://arxiv.org/abs/2210.17323 ↩︎

  58. Training Verifiers to Solve Math Word Problems, https://arxiv.org/abs/2110.14168 ↩︎

  59. Evaluating Large Language Models Trained on Code, https://arxiv.org/abs/2107.03374 ↩︎

  60. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, NeurIPS 2023, https://papers.nips.cc/paper_files/paper/2023/hash/91f18a1287b398d378ef22505bf41832-Abstract-Datasets_and_Benchmarks.html ↩︎

  61. SpecForge: Train speculative decoding models effortlessly, https://github.com/sgl-project/specforge ↩︎

  62. SGLang: Efficient Execution of Structured Language Model Programs, NeurIPS 2024, https://papers.nips.cc/paper_files/paper/2024/hash/724be4472168f31ba1c9ac630f15dec8-Abstract-Conference.html ↩︎