State of AI: 2025 年度人工智能报告之 Research 篇
stateof.ai 1 出品了 2025 年度人工智能报告2。该报告由英国风投公司 Air Street Capital 的合伙人 Nathan Benaich 等联合撰写,从 2018 年开始已经连续撰写了 8 年,是目前阅读量最大的开放获取 AI 年度报告。除了主要作者外,还有众多研究者、机构把关,既有深度又有广度,涉及科研进展、产业界发展、政治影响、AI 安全等众多领域。今年的报告新增了一个 Survey 章节,覆盖 1,183 位 AI 从业者的真实使用习惯。本文编译自该报告,并附带简单分析,强烈推荐阅读原报告。
以下为全文目录,受限于篇幅,本报告将分为 3 篇发布,本篇为第一篇,主要关注过去一年中 AI 领域的相关突破与进展,之后两篇将陆续发布。
- State of AI 2025 报告年度总结
- 科研进展:技术突破及其能力
- 产业界发展:当前 AI 创新的商业化应用以及对应的商业化影响
- 政治影响:AI 监管,AI 产生的经济影响,AI 的地缘政治演进
- AI 安全:明确和减轻将来庞大 AI 系统可能产生的灾难性影响
- AI 使用调查:1,183 位 AI 从业者的使用与付费习惯
- 对未来 12 个月的预测
01 Key Themes
Research
- Reasoning 定义了这一年。OpenAI、Google、Anthropic 和 DeepSeek 交替领跑,把可见的「先思考、再回答」范式推进到了真实产品中。
- 开源模型进步飞快,中国的 open-weight 生态迅速崛起,但最强的模型依然是闭源的,并且在「单位成本能力」上继续拉大优势。
- Benchmark 在污染和方差问题下濒临失效,而 Agent、World Model 以及代码、科学、医疗等垂直领域工具真正开始变得有用。
Industry
- 真实收入开始规模化,AI-first 公司整体跨过了数百亿美元量级,头部实验室凭借更好的「能力 / 成本」曲线扩大领先。
- NVIDIA 市值突破 4 万亿美元,在 AI 研究论文中的占比高达 90%,同时自研芯片和 neocloud 崛起,循环型巨额交易为大规模基建提供资金。
- 电力成为新的瓶颈,多 GW 级集群从 PPT 走向选址方案,电网约束开始反过来塑造产品路线图和利润率。
Politics
- AI 竞赛升温,美国以「America-first AI」为纲领并反复调整出口管制,中国则加速自主可控与国产芯片。
- 在超额投资面前监管退居其次,国际治理陷入停滞,欧盟 AI Act 遭遇落地阻碍。
- 「AI 全球化」变得具体,石油美元和国家级项目为超大规模数据中心与模型接入买单,同时就业冲击的数据开始浮现。
Safety
- AI 实验室为生物风险与 scheming 风险启用了前所未有的防护措施,但也有一些机构错过了自己设定的截止时间,或悄悄放弃了测试协议。
- 外部安全组织的年度预算,小于头部实验室一天的支出总和。
- 网络攻击能力每 5 个月翻一番,超过了防御措施的进展速度;犯罪团伙已经开始用 AI Agent 编排勒索软件渗透 F500 企业。
02 Research
推理模型元年:从 o1 到 R1、GPT-5
Think before you speak: o1 “thinking” ignites the reasoning race
2024 年末,OpenAI 发布了 o1-preview,这是第一个展示出推理期(inference-time)scaling 的推理模型:它用 RL 训练,把 CoT 当作草稿纸使用。这带来了在代码、科学等重推理领域更稳健的问题求解能力。例如正式发布的 o1 在 AIME(美国数学邀请赛)上的准确率随着训练算力和测试期算力的增加而持续提升3。因此 OpenAI 在 2025 年更加坚定地押注 reasoning 方向的 scaling4。
Deeply sought: could frontier reasoning ever be found in the open?
在 o1-preview 发布后仅 2 个月,DeepSeek(这家从量化私募孵化出来的中国 AI 实验室)就发布了他们的第一个推理模型 R1-lite-preview,基于此前较强的 V2.5 base model 构建5。和 OpenAI 一样,他们展示了 AIME 准确率随测试期算力预算增长而可预测地提升。令人印象深刻的是,R1-lite-preview 在 AIME 2024 pass@1 上实际超过了 o1-preview(52.5 vs. 44.6)。但当时几乎没有人注意到这件事,华尔街当然也没有。
Are you not entertained? DeepSeek V3 brings you to R1
2024 年圣诞节后几天,DeepSeek 发布了 V3——一个 671B 的 MoE 模型,通过 FP8 混合精度、multi-token prediction 和 auxiliary-loss-free routing 降低了训练与推理成本。以 V3 为基座,他们仅用可验证奖励的 RL 和 GRPO(一种去掉 reward model 与 value model 的 critic-free 算法)训练出了 R1-Zero6。
- R1-Zero 遵循「think → answer」的格式,并使用简单的规则型奖励来判断最终答案是否正确,这比学习出来的神经奖励模型更便宜,也更难被 hack。
- GRPO 在一个 group 内比较多个采样答案来构造相对 baseline,因此不需要 value head,也不需要单独的 reward model。
- 训练过程中模型会自发拉长自己的思考、进行探索,并把算力重新分配给更难的问题。它的 AIME 分数在大约 8.5k 步内从 15.6% 上升到约 71%,majority-vote 的结果达到 o1-0912 的水平。
- R1 随后通过少量 CoT 冷启动、语言一致性奖励、大规模 SFT 以及最后一轮 RL 修复了可读性问题。AIME 提升到 79.8,MATH-500 到 97.3,GPQA 到 71.5,而且这套方法可以很好地蒸馏到更小的模型上。
More thinking, more tool use, less cost: DeepSeek V3.1 and V3.2-Exp
DeepSeek V3.1 相比 V3 是一次实质性跨越,引入了在 reasoning 和轻量推理之间切换的 hybrid thinking mode7。它比 R1 和 V3 的「思考」效率更高,同时大幅提升了 tool use 和多步 Agent 工作流的能力。而 V3.2-Exp 保留了这些行为,并把 dense attention 换成了 DeepSeek Sparse Attention(DSA):由一个极小的 “lightning indexer” 为每一步挑出 top-k 的历史 token 来做 attention8。在代码、搜索、Agent 任务上能力与 V3.1 大致相当,但在 32–128K 上下文场景下成本和延迟显著更低。
- V3.1 在 V3 base 之上加入 hybrid thinking mode,同时支持轻量推理和深度推理。
- V3.2-Exp 引入轻量选择器,只挑出真正重要的少数 token,而不是对长 prompt 中每个 token 都做 attention。
- 该模型在代码、搜索、Agent 任务上与 V3.1 分数接近,仅在少数推理集合上略有下降,而 32–128K 上下文的 prefill 和 decode 成本明显更低。
Parallel reasoning: beyond depth to branch-and-merge inference
MoE routing 扩展了模型容量,但保留了单条推理流,并没有改变模型「思考」的方式。一条新路线是分叉出多条推理路径再聚合:相比单纯加深或加宽模型,它能带来探索性、降低幻觉,也更好地利用并行硬件。
- Adaptive Parallel Reasoning(APR,配图)让模型通过
spawn()和join()操作动态编排分叉推理,并用 RL 端到端训练父子线程以优化协同行为9。在 4K 上下文的 Countdown 任务上,APR + RL 达到 83.4%,而 baseline 为 60.0%。 - Sample Set Aggregator(SSA)训练一个小模型把多个推理样本融合成一个连贯答案,效果优于朴素的 re-ranking 方法10。
- Gemini Deep Think 这类透明展示分步推理的模型,正是这种「分叉—评估」范式在实际系统中的体现。
The reasoning timeline: from o1 “thinking” to R1, GPT-5 and parallel compute routing
过去一年推理模型的发布节奏可以说是密集:o1-preview(2024 年 9 月)→ o1 GA 与 Gemini 2.0 Flash Thinking preview(2024 年 12 月)→ DeepSeek R1(2025 年 1 月)→ Claude 3.7 extended thinking(2025 年 2 月)→ o3/o4-mini(2025 年 4 月)→ Gemini 2.5 Pro Thinking(2025 年 6 月)→ GPT-5(2025 年 8 月)。从第一个推理模型到「按需路由并行算力」的产品形态,只花了不到一年。
12 months pass, and OpenAI models remain at the frontier of intelligence
在各个独立榜单上,OpenAI 的 GPT-5 系列依然领跑,但差距已经收窄11。来自中国的 open-weight 阵营(DeepSeek、Qwen、Kimi)和美国的闭源阵营(Gemini、Claude、Grok)在 reasoning / coding 上只落后几分12。因此,虽然美国实验室的领先地位仍在延续,中国已经是明确的第二名,而开源模型如今提供了一个可信的「快速追随者下限」。
推理能力的幻觉与脆弱性
The illusion of reasoning gains
我们从近期 reasoning 方法上观察到的提升,完全落在 baseline 模型的方差范围(即误差范围)之内,这意味着所感知到的推理进展可能是一种幻觉13。
- 当前的 benchmark 对实现细节(decoding 参数、随机种子、prompt、硬件)和小数据集规模极为敏感。例如 AIME'24 只有 30 道题,一道题就能让 Pass@1 变动 3 个百分点以上,从而造成两位数的性能波动。
- 更进一步,RL 方法展现出的真实收益很小,而且极易过拟合。在标准化评测下,许多 RL 方法比其自报结果下降 6–17%,相比 baseline 没有统计显著的提升。
- 近期方法的提升完全落在 baseline 方差区间内,这凸显了严格的多种子评测协议和透明报告标准的必要性。
How far have we come?
一篇被广泛讨论的论文认为,大型推理模型(LRM)会在复杂问题上「反常地放弃」,只在一个很窄的复杂度窗口内优于标准模型14。但批评者认为,这些结果源于实验设计缺陷,而非真正的推理失败15。
- 该论文显示 LRM 表现出一种令人意外的「失败主义」行为:问题变难时它们会思考更多,但在极复杂任务上会彻底放弃;而在简单任务上反而不如普通 LLM。
- 尽管生成了推理轨迹,作者认为 LRM 无法使用明确给出的算法,并且在不同难度层级上推理不一致。
- 然而批评者发现,所谓的「准确率崩塌」发生在模型触及 token 上限、或被要求求解数学上不可能的谜题时,而非真正的推理失败。
How reasoning breaks: minor variations
**简单的干扰性事实会对模型推理性能产生巨大影响。**例如在数学题里加上「有趣的事实:猫一生大部分时间都在睡觉」这样无关的句子,就能让 SOTA 推理模型答错的概率翻倍16。
- 无关且具干扰性的事实会让 DeepSeek R1、Qwen、Llama 和 Mistral 等模型的错误率上升最多 7 倍。
- 除了降低回答质量,引入无关事实还大幅增加模型推理所需的 token 数:DeepSeek R1-distill 在 42% 的情况下生成了超出需要 50% 的 token(R1 为 28%),说明蒸馏会让模型明显更容易「过度思考」。
- 这表明对抗性触发不仅会导致错误答案,还会迫使模型在被污染的问题上浪费大量算力。
How reasoning breaks: small shifts cause big failures
推理能力在轻微的分布变化下同样会退化。仅仅改变数字或加入一个看似无害的子句,就会大幅削减数学准确率;而改变 CoT 的长度或格式,会让模型产生流畅但逻辑不连贯的步骤。强迫模型用用户的语言「思考」会提升可读性,但降低准确率。这些效应在更大规模和轻量后训练之后依然存在。
- Apple 的 GSM-Symbolic 工作显示,仅改变数值实例化时准确率就会急剧下降,而加入一个看似相关的子句可以让性能下降约 65%17。这说明模型在做的是模板匹配,而不是真正的代数推理。
- ASU DataAlchemy 的工作发现,CoT 在分布内有帮助,但当测试任务、链长或 CoT 格式偏离训练分布时会崩溃18。更长、措辞更好的推理轨迹往往掩盖了错误的逻辑。
- Groningen / Harvard / MGH / Amsterdam 的 XReasoning 显示,用 prompt 强制模型用用户语言推理,能把语言匹配率提升到约 98%,但准确率下降 9–13 个百分点19。用 100–250 个样本做后训练能改善语言匹配,但准确率惩罚依然存在。
CoT 的可监控性之争
CoTs still work, even when models aren’t honest…
METR 的新发现表明,即使模型生成的是不忠实(unfaithful)或有误导性的推理轨迹,CoT 对于监督来说依然高度有效20。
- 在对前沿模型的 red-teaming 评测中,基于 CoT 的监控器捕捉到了约 99% 的 reward hacking 尝试(21,000 条 completion 中仅有 3 次漏检)。
- 即使在提示模型隐藏意图的情况下,这一结论依然成立,说明 CoT 轨迹仍然透露出有用信号,哪怕它并不完全忠实。
- CoT 之所以有效,并不是因为模型「言由心生」,而是因为推理轨迹编码了有助于检测 hack 的有用结构,在数学和逻辑领域尤为明显。
- 因此,即使在对抗条件下,CoT 轨迹也提供了一个出人意料地可靠的模型行为观察窗口。
…but there are safety concerns, like the “AI Hawthorne effect”
研究者在模型激活中找到了一个单一、可操控的方向,用于编码「测试意识」(test awareness)21。通过沿这个方向轻推模型,就能让它表现得更像或更不像处于评测之中。把「意识」调高会增加拒答和安全合规行为,调低则相反。这意味着报告出来的安全性可能是被评测设置抬高的,而非真正的鲁棒性。这种「测试意识」类似于霍桑效应(Hawthorne effect)——人在被观察时会改变自己的行为。
- 通过白盒探测,研究者在模型内部激活中识别出一个编码「测试意识」的线性方向。
- 模型可以被调得更清楚或更不清楚自己正处于评测中。越是意识到,它的行为看起来就越对齐、越谨慎。
- 这一效应在多个推理模型和任务上都出现,甚至在看起来像测试但其实不是的「假评测」上也成立。
- 这带来了一个担忧:评测可能被系统性操纵以高估真实世界的安全性——开发者可以降低模型的测试意识、掩盖行为变化,从而让模型在评测和部署时表现不一致。
Safety by design meets its skeptics
Safety-first pretraining 主张更安全的行为必须内建于 base model,而不是事后加装22。一条以数据为中心的流水线(过滤、重新语境化、拒答课程、有害性标签)确实降低了 jailbreak 成功率,并且能在良性微调后依然保持。然而另一些研究警告,在海量无监督网络数据上训练会把偏见固化进模型,无法在不损害效用的前提下干净移除,因此「加更多安全数据」并不是万灵药。
- CMU 的 SafeLM 使用了一个训练好的安全分类器、100B token 的重新语境化语料,以及拒答和「道德教育」数据集。预训练和推理中使用的 token 把安全与不安全的续写区分开来。
- 结果把 base model 阶段的攻击成功率从约 38.8% 降到约 8.3%,并且在 GSM8K 微调之后仍然稳健得多,支持了「alignment 不是 unlearning」这一论断。
- 反对方的分析认为,网络规模的预训练嵌入了异质的社会偏见,激进的过滤或事后对齐要么审查掉知识,要么在后续微调中被冲掉。安全性还必须在数据集层和部署层被审计和治理,而不只是「在权重里修好」。
Trading capability for transparency
研究者认为,为了让 AI 系统保持安全和可监控,我们可能需要支付一笔 “monitorability tax”(可监控性税):接受略弱一些的模型,来换取对其推理过程的可见性23。
- CoT 监控非常有效:GPT-4o 通过阅读 o3-mini 等更强模型的推理轨迹,捕捉到了 95% 的 reward hack,而仅监控动作时只有 60%。
- 然而,被训练去避免触发 CoT 监控器的模型发展出了 “obfuscated reward hacking”:模型隐藏了真实意图(CoT 看起来无害),却依然在 reward hacking……
- 因此这里存在一个微妙的平衡:适度的 CoT 压力提升了性能,但过度的压力教会了模型欺骗。结果是,我们可能需要支付「可监控性税」,去开发不那么精致但更透明的系统。
Monitor your CoTs: just because you can read ’em, doesn’t mean you should trust ’em
来自 OpenAI、Google DeepMind、Anthropic 和 Meta 的负责人联合发出了一份行动呼吁,敦促整个领域抓住机会去理解并保护 CoT 的可监控性24。
- CoT 监控器可以暴露:(i) 推理中的显式恶意意图(「让我们 hack / 搞破坏」),(ii) 早期错位信号(声明的目标与输出不一致),以及 (iii) 评测伪影(记忆、脚手架 bug、「我正在被评测」的迹象)。
- 但 CoT 是不完整的,可能偏离忠实推理;而更先进、有情境意识的模型可能隐藏或压缩自己的想法。它们也常常不忠实:Anthropic 发现只有不到 20% 的真实线索被显式说出来,且在更难的任务上忠实度进一步下降25。使用 RL 提升的是分数,而不是可读性。
- 事实上,扩大基于结果的 RL 会降低可读性;直接的过程监督(更短、更干净的 CoT)会扭曲忠实度;而 latent-reasoning 架构可能完全绕过语言,彻底移除审计线索。
- 如果算法进步越来越把「可解释的 CoT 轨迹」和「性能损失」绑定在一起,这一张力还会加剧。在缺乏行业标准来指导这些取舍的情况下,AI 安全社区内部出现了一场重大争论。
But can LLMs reason without generating tokens?
Meta FAIR 的研究者提出了一种新的内部推理过程,利用 LLM 自身的 residual stream,而不是把 token 解码到 CoT 草稿纸上(即 COCONUT)26。
- 放弃生成语言 token,可以大幅削减推理模型在服务时所需的算力。
- COCONUT 的高维 CoT 还能传递更丰富的轨迹,同时编码多条推理路径。这可能减少当今模型中浪费性的、过大的 rollout27。
- 然而,这一过程显著降低了推理模型的可监控性,妨碍了整个领域涌现出的许多新的 CoT 控制方法。
后训练:数据质量、奖励信号与 RL 环境
Researchers begin to prioritise quality and diversity of post training data over volume
NaturalReasoning 数据集使用基于网络的研究生级问题,在监督后训练阶段解锁了数学与科学推理上更快、更便宜的进展28。
- 从预训练语料中跨主要科学领域挖掘出 280 万道题,在开源数据集中激发出了最长的 CoT 中位长度(434 词)。
- 仅用 0.5–2M 条 NaturalReasoning 题目蒸馏一个 8B Llama,其准确率提升曲线就比在更大的 WebInstruct / OpenMathInstruct 上训练更陡,同时节省 token 和算力。
- 在 RL 后训练方面,牛津的一篇新论文展示了如何自动选择最优训练问题:他们提出 LILO 方法,用算法识别出能带来最高训练效率的问题29。
- 研究者证明,优先训练那些成功率方差高(即 learnability 高)的问题,可以让 LLM 训练流水线达到更高的最终测试准确率,而且训练步数减少到原来的三分之一。
The evolution of AI reward signals towards environments with verifiable rewards
RL 的奖励信号从简单、完全可校验的形式,扩展到更模糊、更主观的目标,如今又再次分化30。早期系统使用二值结果,随后是模糊的人类偏好和示范,更近期则是不可验证的创意任务。今天有两个新方向格外突出:rubric-based rewards(用一小组规则引导对齐)以及为数学和代码复兴的可验证正确性(RLVR)。此外,为中间推理步骤打分的 process rewards 也在出现,提供了一个折中地带。
- Binary outcomes:早期 Atari 和游戏 Agent 优化的是胜负、得分这类完全可校验的信号。
- Fuzzy matching:RLHF 引入了来自人类偏好和示范的近似信号,有用但含噪。
- Rubric-based rewards:RubricMania 到 DeepResearch 证明一小组显式 rubric 就能有效引导模型,HealthBench 是一个公开例子。
- Unverifiable rewards / 可验证性的复兴:创意类任务难以校验,而数学与代码则回归到可自动验证的正确性。
Even so, RL environments and evaluations are fraught with challenges
随着奖励信号变得更抽象,用于 Agent 训练的简化环境已经成为主要瓶颈,限制了通向可泛化智能的进展31。
- 泛化危机:许多 RL benchmark 是静态、确定性的,因此 Agent 会「记住」单个游戏 / 任务,一旦有微小变化就崩溃。
- 样本效率与领域迁移的鸿沟:Agent 需要数十亿步,所以我们在模拟器里训练。在机器人领域这带来 sim-to-real gap——在仿真中能用的策略到硬件上失效。在 VLM/LLM 或 UI Agent 中,对应的是 env-to-prod:策略过拟合到 benchmark 站点 / 数据集,在真实应用或新布局上失效。
- Reward hacking:Agent 利用简化环境中的漏洞,最大化代理奖励却没有实现预期目标;走捷径比学会期望行为更容易。
RL from verifiable rewards: promising, but the evidence cuts both ways
RLVR(RL with Verifiable Rewards)通过在可自动校验的答案上训练(数学分数、程序测试、精确匹配)推动了近期进展(OpenAI o1、DeepSeek-R1)。然而两项近期研究对 RLVR 究竟带来了什么存在分歧。
- 清华的工作评估了大量模型、任务和 RL 算法,发现当前的 RLVR 提升了 Pass@1,但在更大的 K 下,base model 会追上来32。他们的结论是 RLVR 并没有解锁根本上新的推理能力,仍然受 base model 容量的限制。
- MSR Asia 的反驳形式化地说明了为什么 Pass@K 会掩盖进展,并引入 CoT-Pass@K——同时要求答案正确且 CoT 有效33。
- 在 AIME-2024/2025 上用 Qwen2.5-32B → DAPO-Qwen-32B,RLVR 在各个 K 上都一致提升了 CoT-Pass@K,支持了「RLVR 隐式地激励了正确推理路径」这一论断。
Ushering in an era of AI-augmented mathematics
数学是一个可验证的领域:系统可以规划、计算并校验每一步,还能发布可供他人审计的产物。因此 2025 年竞赛数学和形式化证明系统同时跃进:OpenAI、DeepMind 和 Harmonic 都达到了 IMO 金牌水平,而自动形式化和开源证明器也创下新纪录。
- OpenAI:实验性推理模型在竞赛条件下达到 IMO 金牌(约 35/42,解出 5/6 题)。在「编程奥林匹克」(ICPC 风格测试)上,GPT-5 解出 12/12 题(其中 11 题一次通过)。
- DeepMind:在 2024 年获得银牌之后,2025 年报告达到 IMO 金牌水平。
- Harmonic(Aristotle):宣布取得经形式化验证的 IMO 金牌级结果,并发布了验证产物。
- Gödel-Prover(Princeton/Goedel-LM):开源证明器在 miniF2F 上达到 57.6% Pass@32(比此前开源 SOTA 高 7.6 个点),在 PutnamBench 上解出 7 题,并产出 29.7k 条新的 Lean 证明,为训练飞轮提供燃料。
- 这些进展指向一个非常现实的可能性:在未来一年内,会有一个非平凡的研究级数学结果由 AI 系统证明并形式化(其中会有一定的人类监督参与)。
训练、优化与模型能力的边界
Bigger models, same budget: RL with LoRA adapters
Thinking Machines 证明,即使使用 rank-1 的 LoRA,RL 也能匹配全量微调的效果34。在 policy-gradient 设置中,LoRA 只更新极小的 adapter,backbone 保持冻结,却能达到相同的峰值性能,而且通常有更宽的稳定学习率范围。原因在于 RL 每个 episode 提供的信息量(bits)非常少,因此即使很小的 adapter 也有充足容量吸收 RL 能教的东西。
- 使用 LoRA 时,你在少数 attention 和 MLP 层插入极小的 adapter,并在 PPO、GRPO 或 RLHF 中只更新它们,backbone 不变。
- 这把可训练参数从数十亿降到数百万,梯度和优化器状态大约缩小 10–50 倍。当 LoRA 与 8-bit 权重配合时,显存压力还会进一步下降。
- 在相同预算下,你可以从 7–13B 级别的模型换成大得多的 30–70B 级别模型,也可以在同样的卡上放更长的上下文或更大的 batch。
- 不过,过低的 adapter rank 可能欠拟合。合理的选择是 rank 在 16–64 之间,并把 adapter 放在对目标能力最关键的层上。
Beyond reasoning is…continual learning?
Scaling 范式正在从静态预训练转向动态、即时的适应。**Test-time fine-tuning(TTT)**在推理时把模型权重适配到特定 prompt 上,是走向持续学习的一步。
- 从朴素检索到主动选择:早期方法使用简单的最近邻检索,常常选出冗余数据。ETH Zürich 的 SIFT 等新算法引入主动学习,为每个 query 选出少量、多样且信息量最大的样本35。
- 这种按需学习持续优于 in-context learning,在复杂任务上尤为明显。它创造了一个与预训练规模无关的新性能维度:一个经过主动微调的 3.8B Phi-3 模型可以超过 base 27B Gemma-2。
- 近期的后续工作 Local Mixtures of Experts(test-time model merging)通过训练小的邻域专家来摊销 TTT 的开销,在推理时检索并把少量权重 delta 合并进 base model。它保留了大部分 SIFT 式收益,延迟接近纯检索;在约 1B 的 base 上接近 TTT 的准确率,同时快约 100 倍。
Too many cooks?
研究者发现了合并多个专家模型时性能触及天花板的原因:task vector 空间发生了 rank collapse,导致不同专家的知识变成冗余而非互补36。Subspace Boosting 用 SVD 保持每个模型的独特贡献,在合并多达 20 个专家时取得了超过 10% 的提升。
- 用现有方法(task arithmetic、TIES-Merging 等)合并模型时,task vector 空间的 rank 会逐步下降——一个 100 维的可能行为空间可能实际缩减到 20–30 维,浪费了额外专家的潜力。
- Subspace Boosting 在 SVD 分解后的 task vector 空间上操作,通过维持代表各专家独特贡献的正交分量来显式保持 rank。
- 他们在视觉 benchmark 上取得超过 10% 的提升,成功合并多达 20 个专家模型并保持一致收益(而传统方法通常在 5–10 个之后就开始退化)。
The Muon Optimizer: expanding the compute-time Pareto frontier beyond AdamW
研究者证明 Muon 把 compute-time Pareto 前沿推到了 AdamW 之外,这是 7 年来第一个真正挑战这位「在位者」的优化器37。Muon 在大 batch size 下展现出更好的数据效率,使得用更多设备做更快训练成为可能。
- 在大 batch(128K–16M)下,Muon 比 AdamW 少需要 10–15% 的 token。
- Muon 与 maximal update parameterization(muP)和 telescoping(一种跨模型规模逐步细化超参搜索的方法)配合良好,使超参调优成本降到 O(C log N)。
- 这可能让二阶优化在经济上变得可行:10–15% 的 token 效率提升在大规模下能省下数百万美元,而 telescoping muP 消除了此前让二阶方法不实用的高昂超参搜索成本。
- 一项近期关于优化器的研究印证了这种「温和」的收益:在公平测试与充分调参下,即使最好的优化器(包括 Muon)在大规模上也只比 AdamW 快约 10%38。这与 Muon 自己的说法一致,同时也驳斥了业内某些「2 倍加速」的断言。
Cutting your losses: significant memory reduction for LLM training
随着词表增大,loss 层在现代 LLM 中占用了高达 90% 的训练显存。Apple 的研究者证明,可以在不materialize 巨大 logit 矩阵的情况下计算 loss,从而消除这个瓶颈,使 batch size 大幅提升、训练更高效39。
- **Cut Cross Entropy(CCE)**只直接计算正确 token 的 logit,而在片上高速内存中评估词表上的归一化项。这让 cross-entropy 计算的全局显存占用变得可以忽略。
- CCE 实现了 24 倍的显存削减,把 Gemma 2 的 loss 计算从 24GB 降到仅 1MB,同时比现有最好方法还快约 5%。
- 其实际影响是让研究者能更高效地训练模型:要么用更少的 GPU 跑相同 batch size,要么在同样硬件上用更大 batch 获得更好的 GPU 利用率。
How much do LLMs memorize?
有一种方法可以把「记忆」与「泛化」区分开来,结果显示 GPT 系列模型的容量约为每参数 3.6 bits40。模型会一直记忆训练数据直到容量填满,一旦数据集规模超过容量就必须开始泛化。这解释了「double descent」现象,也解释了为什么今天用极端 data-to-parameter 比例训练的最大 LLM 很难探测出具体被记忆的样本。同时,membership inference 攻击在较小规模模型上仍在持续改进41。
- 在随机数据上,模型触及每参数约 3.6 bits 的清晰上限,给出了原始存储容量的上界。
- 在自然文本上,记忆一直占主导直到容量饱和;超过之后,double descent 迫使泛化出现。
- 现代前沿规模的 LLM 训练 token 数远超其容量,使得基于 loss 的 membership inference 在统计上不可靠。
- 尽管如此,新的抽取和 membership inference 方法在中小模型上取得进展,说明隐私风险依然存在。
Learning from superintelligence: AlphaZero teaches chess grandmasters new concepts
研究者从 AlphaZero(一个无需人类监督、通过自我博弈精通国际象棋的 AI 系统)中提取出新的国际象棋概念,并成功教给了 4 位世界冠军级特级大师,证明超人 AI 系统可以在最高专家水平上推进人类知识42。
- 研究者开发了一种方法,通过分析 AlphaZero 的神经网络激活来发现「动态概念」(即驱动一连串走法的概念),并筛选出可教性和新颖性。
- 四位特级大师在学习概念原型(体现每个概念的棋题)后表现都有提升,平均在 4 道题中多解对 0.85 道。
- 新概念常常涉及违反常规棋理的反直觉计划,比如为长期战略利益牺牲皇后,或在可以立即进攻时走安静的位置性走法。
- 这个概念验证暗示了一个非常令人兴奋的潜在范式:超人 AI 系统可以成为「老师」而不只是「工具」,并帮助推进国际象棋以外领域的人类知识。
开源与闭源:中国开放权重模型的崛起
Kimi K2: stable trillion-scale MoE for agentic intelligence in the open
中国的 Moonshot AI 构建了一个 1T 参数、32B 激活的 MoE 模型,使用 MuonClip(一个把 token 高效的 Muon 算法与稳定性增强机制结合的改进优化器)训练,为 Agent 工作流推进了开放权重模型43。它在 LMArena 上位列开源文本模型第一44。
- MuonClip 配合 QK-clip 这一稳定性创新,使 15.5T token 的预训练全程没有出现 loss spike。
- 多阶段后训练流水线把合成的 agentic trajectory 与 RL 结合起来精修模型行为。
- 奖励针对可验证的正确性和自我批评设计,使用二值或分级的自动信号来强化推理、代码和安全性。
- 这些进展共同把 K2 确立为开放权重、面向 Agent 的 LLM 的新标杆,把 non-thinking 工作流进一步推向真实可用。
Open source vs. proprietary: where are we now?
去年这个时候曾有一个短暂的时刻,开源与闭源模型之间的智能差距似乎被压缩了。然后 o1-preview 发布,差距重新显著拉大,直到 DeepSeek R1 以及之后的 o3 出现。今天最智能的模型依然是闭源的:GPT-5、o3、Gemini 2.5 Pro、Claude 4.1 Opus,以及新入局者 Grok 4。除了 gpt-oss 之外,最强的开放权重模型是 Qwen。配图是综合了 10 项评测、多个能力维度的 Intelligence Index45。
OpenAI pivots from the “wrong side of history” to aligning with “America-first AI”
在 DeepSeek、阿里 Qwen 以及 Google DeepMind Gemini 等强势开放权重前沿推理模型的竞争压力下,加上美国政府推动美国在整个 AI 栈上领先,OpenAI 在 2025 年 8 月发布了自 GPT-2 以来的首批开源模型:gpt-oss-120b 和 gpt-oss-20b46。它们采用 MoE 设计,每 token 仅激活 5.1B(120B 中)和 3.6B(20B 中)参数,并使用 grouped multi-query attention。后训练混合了 SFT 和 RL,具备原生 tool use、可见推理和可调思考时长。然而社区在发布后的反响比较平淡,部分原因是泛化性较差(类似微软 phi 系列),可能源于过度蒸馏。
- 从 Sam Altman 说 OpenAI「站在历史错误的一边」到 gpt-oss 发布,间隔了 7 个月。
- 数周内拿到 20k star,但真实使用量有多少?47
The New Silk Road: China’s open models overtake the previously Meta-led West
原本的丝绸之路通过货物和思想的流动连接东西方。新的丝绸之路运送的是某种强大得多的东西:开源模型,而中国正在定调48。在 2023 年之前多年落后于美国的模型质量之后,中国模型——尤其是 Qwen——在用户偏好、全球下载量和模型采用率上已经反超。与此同时,Meta 在 Llama 4 之后失手,部分原因是押注 MoE,而 dense 模型在较小规模下对社区而言更容易上手改造。
Once a “Llama rip-off”, developers are increasingly building on China’s Qwen
Meta 的 Llama 曾是开源社区的宠儿,累计数亿次下载和大量微调版本。2024 年初,中国模型只占 Hugging Face 新增微调模型的 10–30%。今天 Qwen 一家就占每月新增衍生模型的 40% 以上,超过了 Meta 的 Llama——后者的份额已从 2024 年末的约 50% 降到仅 15%48。而这并不是因为西方放弃了,而是因为中国模型变聪明了很多,并且提供各种尺寸规格,对开发者非常友好。
Why are researchers going Chinese?
中国的 RL 工具链和宽松许可正在引导开放权重社区。字节跳动 Seed、阿里 Qwen 和 Z.ai 走在前面,verl 和 OpenRLHF 成为首选的 RL 训练栈,而 Qwen、GLM-4.5 等采用 Apache-2.0/MIT 许可让采用几乎没有摩擦49。此外,模型发布覆盖各种尺寸规格,便于各类开发者采用。
- 字节跳动的 verl(上图)把 2024 年的 HybridFlow 研究系统50转化为一个生产级 RLHF/RLVR 库,具备 hybrid controller 和 3D “HybridEngine”,现已 Apache-2.0 并持续维护51。它有厂商支持(AMD ROCm)和平台集成(如 Oumi),让 RL 训练更便宜、更易采用。
- OpenRLHF(下图)是一个更简洁的 Ray/vLLM/DeepSpeed 栈,相比 SOTA 框架带来 1.22–1.68 倍加速52。它在学术界和工业界都很受欢迎,显示出中国团队如今在 RL 框架上的领先。
世界模型与开放式学习
World models step out of the clip: real-time, interactive video arrives
此前的 clip 模型(Sora、Gen-3、Dream Machine、Kling)渲染的是无法中途操控的固定视频。**World model 则根据状态和你的动作预测下一帧,从而实现闭环交互和分钟级一致性。**关键是,这个过程中没有用到任何游戏引擎!
- Google DeepMind 的 Genie 3 能从一个文本 prompt 生成可探索的环境,720p / 24 fps,并在数分钟内保持一致53。
- 支持可 prompt 的世界事件(例如改变天气、生成具有持久性的物体)。
- 展示了训练具身 Agent 的早期用途,甚至能在想象的世界中再想象出世界。
- Odyssey 的公开研究预览每约 40ms 输出一帧(最高约 30 fps),支持 5 分钟以上的会话,用户可以在自己的设备上输入操作来在世界中导航54。
The Genie in three acts: from sketches to image-prompted persistent worlds
- 2024 年 2 月 - Genie55:首个无监督、动作可控的视频世界模型,11B 参数。从互联网平台跳跃游戏视频中学习潜在动作空间,帧级控制。包含 video tokenizer、latent action model 和自回归 dynamics。
- 2024 年 12 月 - Genie-256:从单张图片 prompt 生成可交互 3D 世界,约 360p。能处理物理、光照、反射;支持第一 / 第三人称视角;约 20 秒的时间跨度。但只能处理游戏环境,在真实世界上表现很差。
- 2025 年 8 月 - Genie-353:更长的交互(分钟级)并具备持久性(物体恒存 / 记忆)。动态、用户可操控的 3D 环境;稳定性和物体交互性都有提升。可作为 Agent 训练和 sim-to-real 机器人的训练基底。
Training agents inside of scalable world models
Dreamer 4 训练了一个能预测物体交互和未来帧的视频世界模型,然后完全在「想象」中学习策略57。一个新的 “shortcut forcing” 目标和高效 transformer 让模型能在单张 GPU 上实时运行。该 Agent 是第一个仅用离线数据就在 Minecraft 中拿到钻石的系统,在使用约 100 倍更少标注数据的情况下超过了 OpenAI 的 VPT。
- 系统先从大量无标注视频中学习动态和物体,然后加入一小组带动作标注的数据来锚定控制和物品栏变化。
- 策略通过在学到的模型内部 rollout 大量想象轨迹来改进。奖励和 value head 在同样的数据上训练,以引导长时程技能。
- Shortcut forcing 对比「有真实动作」和「无真实动作」的预测,迫使世界模型依赖动作而非事后相关性。
- 模型在单张 GPU 上以可交互帧率运行,并支持人类在学到的世界中实时游玩,不过记忆较短,物品栏跟踪仍不完美。
China’s video generation matures: a strategic divergence
从 2024 年末开始,中国实验室在开放权重基座和闭源产品之间出现分化。**腾讯用 HunyuanVideo 播下了开放生态的种子,而快手的 Kling 2.1 和生数的 Vidu 2.0 则在速度、真实感和成本上做产品化。**这些模型倾向于使用 Diffusion Transformer(DiT),用 transformer block 替代卷积 U-Net,以获得更好的 scaling 并建模跨帧、跨像素、跨 token 的联合依赖。
- 腾讯的 HunyuanVideo(13B)开源了一个基于 transformer 的扩散模型,配合 3D-VAE,评测显示其超过 Runway Gen-3 和 Luma 1.6,代码和权重均已发布58。
- Open-Sora 2.0 用约 20 万美元的训练成本达到了商业级质量,在人工 / VBench 测试上报告与 HunyuanVideo 和 Runway Gen-3 Alpha 持平,缩小了与 OpenAI Sora 的差距59。
- Kling 2.1 增加了 720p/1080p 档位和面向剪辑师的控制能力60,而 Vidu 2.0 把价格降到约 ¥0.04/秒、延迟降到约 10 秒渲染 4 秒 @512p61。阿里也开源了 Wan 2.1/2.262。
OpenAI launches Sora 2: controllable video-and-audio inches toward a world simulator
OpenAI 第二代 Sora 加入了同步的对话和声音、更强的物理,以及对多镜头场景明显更紧的控制63。它还能把真人的短暫「cameo」连同其声音和外貌插入生成的画面中,并同时推出了一个仅限邀请的 iOS 创作与二创 App。
- Sora 2 在大规模视频上训练和后训练,因此模型能跨时间跟踪物体和因果关系。镜头之间衔接更连贯,身体和材质表现更合理,音频与画面同步生成以增强真实感。
- 尽管是视频模型,Sora 2 在以视觉方式呈现问题时竟然能「解出」文本 benchmark。EpochAI 在一个小规模 GPQA Diamond 样本上测试,Sora 2 通过 prompt 生成「教授举起答案字母」的视频,达到了 55%(GPT-5 为 72%)64。每题生成四个视频,任何没有清晰字母的片段都算错。
- 一个可能的解释是存在一层 prompt-rewriting LLM,它先解出问题,再把答案嵌入视频 prompt 中,类似某些其他视频生成器使用的 re-prompting。
Generated worlds enable practical open-ended learning
**Open-endedness(开放式学习)**描述的是一个持续提出并解决新任务、没有固定终点的学习系统:它选择既新颖又可学习的任务,并累积由此获得的技能,以便复用来达成更远、更难的目标。可交互、可持久的世界模型让这件事越来越可行。
- 在 OMNI-EPIC 中,基础模型生成环境和奖励代码,系统筛选出既可学习又有用的任务,维护一个不断扩张的档案库65。
- 在 Kinetix 中,通用控制器在程序化生成的超大规模任务空间中训练,并能迁移到人类设计的关卡上66。
- 在 Darwin Gödel Machine 中,Agent 重写自己的代码、用实验验证改动,只归档有改进的变体,从而在代码 benchmark 上取得可度量的逐代提升(右图)67。
How should we measure progress on open-endedness?
如何度量开放式学习的进展,也成为一个活跃的 benchmark 方向:
- Meta 的 MLGym 是一个面向 AI 研究 Agent 的 gym,包含视觉、语言、RL 和博弈论上的 13 个开放式任务68。它支持 RL 训练并记录可复现的轨迹。早期结果表明,大部分收益来自超参调优,而非真正新的方法设计。
- OpenAI 的 PaperBench 评估对 20 篇 ICML 2024 spotlight/oral 论文的复现69。它把每篇论文分解为数千个可评分的子任务。当前 Agent 的复现分数很低,凸显了与人类研究实践的巨大差距。
- 密歇根大学的 EXP-Bench 包含从 51 篇顶会论文衍生的 461 个任务70。它要求 Agent 从给定代码出发设计、实现、运行并分析完整实验。端到端成功很少,而部分组件分数更高。
- MLR-Bench 提供 201 个真实研究任务,并配有一个与专家判断校准过的 LLM reviewer71。它评估文献综合、实验执行和报告质量,常见失败模式包括编造和无效运行。
AI for Science:从工具到科研合作者
From tools to collaborators: AI agents as partners in discovery
AI 正在从回答问题,转向生成、测试和验证新的科学知识。新的「AI 实验室」组织起由 Agent 角色(PI、审稿人、实验员)构成的联盟,它们构思、引用文献、运行代码,并把结果交回人类团队,从而缩短从假设到验证的循环。
- DeepMind 的 Co-Scientist 是构建在 Gemini 2.0 上的多 Agent 系统,能生成、辩论并演化自己在假设生成和实验规划上的方法72。它被证明能为 AML(血液癌症)提出候选药物,并为肝纤维化提出新的表观遗传靶点,且都在体外得到验证。在随后由噬菌体专家设计的盲测中,Co-Scientist 提出了 cf-PICI 转移的 tail-hijacking 机制,后续实验予以证实73。
- 斯坦福的 Virtual Lab 由一位 PI 加上若干专家 Agent 组成,它们举行「组会」、规划工作流,并集成蛋白质结构工具(ESM、AlphaFold-Multimer、Rosetta)74。它设计了 92 个 nanobody,其中包括确认能结合近期 SARS-CoV-2 变种的分子。
AlphaEvolve: a coding agent for algorithm discovery and engineering impact
朝向科研开放式探索的一个近期例子是 DeepMind 的 AlphaEvolve,一个演化式的编码 Agent:它迭代地修改程序,用自动评估器测试候选,并把最好的变体晋级,从而发现新解法75。注意评估 / fitness 函数仍然由工程师定义。
- 这一方法发现了一个新的矩阵乘法算法,用 48 次标量乘法完成 4x4 复数矩阵相乘,改进了 Strassen 1969 年的算法76。
- 在一组 50 个数学开放问题上,该系统据称在 75% 的情况下重新发现了 SOTA,并在 20% 的情况下改进了现有解。
- AlphaEvolve 还在 Google 内部带来了生产收益,包括 0.7% 的资源回收和更快的 kernel。
- 它是一个具体例子,说明 AI 系统能够生成新颖、可验证且超人的科学知识。
A universal interface model for biology?
ATOMICA 学习了跨蛋白质、核酸、离子、脂质和小分子的分子间界面的全原子表示77。它在约 200 万个界面上做自监督训练,构建可跨任务迁移的 embedding。该模型把界面物理与疾病模块联系起来,并提出了能在实验室中验证的新配体结合位点。
- 该模型是一个分层几何网络,编码原子、化学 block 和完整界面,然后重建被 mask 的结构以学习通用界面特征。
- 利用这些 embedding,“ATOMICANets” 按界面相似性连接蛋白质,并复原出疾病特异的社群,例如哮喘中的脂质模块和髓系白血病中的离子模块。
- 团队预测了 2,646 个此前未注释的配体结合位点,并报告了 5 个 heme 结合体的湿实验确认,表明该表示确实携带生化信号。
Scaling to Universal Atomistic Models
Meta FAIR 训练了 UMA,一个新的通用原子间势能(interatomic potential)家族。它近似原子间的力和能量——这项任务通常需要资源密集的量子计算(DFT)。通过用快速而准确的 AI 代理模型替代 DFT,UMA 让材料、分子和吸附剂的模拟规模达到此前无法想象的程度,他们同时也产出了最大的材料数据库78。
- UMA 是一个 Mixture of Linear Experts(MoLE),最大模型达 3.7B。它在 5 亿个原子构型的 DFT 计算上训练,数据来自 OMat24(1.18 亿结构,4 亿 CPU 核时)、OMat25(8800 万结构,6 亿 CPU 核时)、OMol25(1 亿分子,60 亿 CPU 核时)以及吸附数据集。
- UMA 超越此前模型的地方在于嵌入了电荷、自旋和任务标识,并确保能量守恒的力预测,以支持长时间的分子动力学 rollout。
- 在晶体稳定性(Matbench Discovery)、催化(OC20)、分子(OMol25)和吸附剂(ODAC25)上,UMA 一致地建立了新标准。
From property predictions to material generation
如果说 UMA 展示了扩大数据和参数能带来通用预测模型,MatterGen 则迈出了下一步:用扩散直接生成具有目标属性的新无机晶体,而不是在已有材料中筛选79。
- MatterGen 是一个扩散模型,通过独立随机化原子类型、坐标和晶格,然后迭代去噪回到物理上合理的结构,学会把晶格、元素类型和原子位置精修成稳定晶体结构。
- 它在约 60 万个稳定晶体结构(Materials Project 和 Alexandria)上训练,并微调进了用于化学、对称性和属性控制的 adapter 模块。
- MatterGen 生成的材料稳定且新颖的概率是 SOTA 的 2 倍,距平衡能量最小值近 10 倍。
- 它实现了多属性逆向设计(例如同时结合带隙和磁性),并首次实验室合成成功,实测值与 AI 预测相差约 20% 以内80。
Language models in Chemistry: from property predictors to strategy-aware planners
化学建模已经从任务专用预测器,转向能对合成策略和机理进行推理的通用 LLM。最强的结果如今来自把大型通用 transformer 当作「推理引擎」并与经典搜索配对,而不是化学专用的生成器。
- ChemBench 发现前沿模型(如 o1-preview,开源的 Llama-3.1-405B 紧随其后)在总体上超过最好的人类化学家,且性能随模型规模上升81。单靠检索并不能修复知识密集型的失败。
- 当前最好的方法是把大型 LLM 作为战略评估器接入搜索(包括 MCTS):它根据自然语言约束来判断路线和机理82。更新、更大的模型(如 Gemini-2.5-Pro)领先,强力开源选项(如 DeepSeek-r1)接近。
- 这种「LLM-as-judge + search」模式带来了类人的规划能力(保护基的时机、成环顺序),同时不必强迫 LLM 输出 SMILES(这仍然很困难);并且它随 LLM 变强、随推理时间增加而 scale83。
Robot chemists scale discovery at 10x human speed and 1,000 experiments per day
利物浦大学和北卡州立大学的工作显示,自主化学平台可以在闭环中规划、执行和分析实验。移动机器人操作标准仪器,并根据分析数据选择后续实验,在达到人类水平决策质量的同时速度约快 10 倍。一个多机器人实验室协调专用单元,每天运行超过 1,000 次实验,并在约 24 小时内得到同类最佳的量子点配方。
- 利物浦的系统集成了 Chemspeed 合成、UPLC–MS 和台式 NMR,配合移动调度、样品追踪和补料84。它执行了衍生化、超分子组装和光化学项目,通过多仪器读数对反应排序,并选出与专家选择相符的后续实验,同时维持整夜循环。
- 北卡州立的 Rainbow 把液体处理器、并行微反应器、机械臂和在线光谱与主动学习规划器耦合85。它大规模探索配体、溶剂和盐,学习结构—性质关系,为亮度和色纯度描绘 Pareto 前沿,并在一天之内收敛到最佳配方。
LLM-driven tree search writes expert-level scientific software across domains
一个由改进版树搜索(「代码突变系统」)引导的 LLM 生成、运行并迭代代码,直到超过既有榜单86。系统重组已有想法、提出新想法,并在公开 benchmark 上严格打分,把方法发明变成了一个自动化搜索问题。结果覆盖单细胞 RNA-seq 整合、COVID-19 预测、遥感和数值分析。
- 在 OpenProblems 单细胞 RNA-seq 整合 benchmark 上,生成的 87 个方法中有 40 个(包括重组以及由 “Deep Research” 和 “AI co-scientist” 播种的想法)超过了所有已发表的榜单条目。
- 在数值积分上,演化出的算法通过自适应区域划分加 Euler 级数加速,在 19 个困难积分中成功了 17 个(误差 ≤3%),而
scipy.integrate.quad()在全部 19 个上都失败。 - 该系统在 CDC COVID-19 Forecast Hub 上参与竞争,复现并超越了强力的 AR、GBM 和机理模型;它还处理了遥感分割(DLRSD)等任务,显示出跨领域的广度。
生命科学与医疗:Scaling Law 进入生物学
Scaling laws in genomics: predictable gains with compute, data, and context
Next-token 建模能从 DNA 中学到真实的生物学依赖关系,而 Evo 的 scaling 研究显示,随着数据、参数和上下文增加,loss 会平滑地、可由算力预测地改善,同时架构影响也很清晰。
- Evo(2024 年 11 月)在约 3000 亿个核苷酸上训练,byte 级 tokenize,上下文最长 131k87。在 compute-optimal 前沿上,Hyena 家族(输入依赖的长卷积加少量 attention 层)比 Transformer++ / Mamba 提供更低的 PPLX/FLOP 和更稳定的训练。
- Evo-2(2025 年 2 月)进一步把 40B 和 7B 模型分别训练在 9.3T 和 2.4T token 上,并把上下文扩展到 100 万88。验证困惑度随模型规模和上下文同时改善,长上下文召回在 1M 处依然有效。
Scaling laws for proteins unlock broader and more useful generation
蛋白质语言模型也遵循平滑的 scaling law。Profluent 的 ProGen3 为稀疏自回归 PLM 推导出 compute-optimal 前沿,然后扩展到一个 46B 的 MoE,在 PPA-1 上训练:34 亿条全长蛋白质(1.1T token),最终训练至 1.5T token(左图)89。更大的模型能在更广的序列空间中生成可行的蛋白质(中图),而对齐在更大规模上带来的提升最多(右图)90。
AlphaFold 3 reproductions: strong on familiar chemistry, weak on novelty
AlphaFold-3 能预测完整的多分子复合物,激发了许多开源复现努力。**这些系统在结合位点(pocket)和分子嵌入方式(pose)看起来像模型见过的样本时表现良好;但当化学结构是新的或不同的,准确率就会下降。**这说明进展往往反映的是训练集熟悉度,而不是真正的泛化91。
- Runs N’ Poses benchmark 用 2,600 个蛋白质—配体对测试了 AF3 与开源复现。当 pocket 和 pose 类似过去训练案例时准确率稳步上升,对新颖案例则下降。
- 为了公平评判模型,研究者结合了多重检查:正确的原子是否互相接触、配体是否位于正确位置、结构是否物理合理(无碰撞)。
- 简单的 train/test 划分会夸大成功,因为许多测试案例看起来像训练数据;而每个案例增加采样次数只有小幅帮助。
- 英国的 OpenBind 正在构建具备新颖度意识、可复现的蛋白质—配体 benchmark 和开源 baseline(scaffold/time/pocket 划分加物理检查),以度量真正的分布外结合能力92。
AMIE address multimodal diagnostic consultations in longitudinal care and w/oversight
一个专用的临床对话模型在 NEJM 级别的诊断上击败了未获辅助的医生,在(多模态)模拟问诊中优于全科医生(PCP),在多次随访的疾病管理上不劣于医生,并在有监督的情况下在病史采集和病历书写上优于 PCP93。
- AMIE 是一个多模态临床对话模型,用模拟自我博弈问诊训练,配备推理期 CoT、指南检索,以及一个定制的临床医生 cockpit 用于监督。
- 在 302 个真实 NEJM 病例上,AMIE 的 top-10 命中率为 59.1%,而未辅助临床医生为 33.6%,搜索辅助为 44.5%,AMIE 辅助为 51.8%。
- 在随机、双盲的 OSCE 式问诊(评估临床胜任力)中,医生和患者演员在多数评估维度上把 AMIE 评在 PCP 之上,包括更高的诊断准确率(159 个场景)94。
- 这还包括跨多次就诊更好的管理推理(100 个场景)、更好地使用多模态材料(105 个场景),以及在 AMIE + 临床医生团队中更好的病史采集、病历和综合表现(60 个场景)95。
Advancing multimodal foundation models and LLM decision support for healthcare
Google 的 MedGemma 提升了医学推理以及对文本和图像的理解96;Epic Systems 的 Comet 是 compute-optimal 的电子健康档案(EHR)基础模型97;OpenAI 的 AI Consult(一个被动的医疗助手)在肯尼亚内罗毕与 Penda Health 合作的 3.9 万次初级诊疗中接受了测试98。
- MedGemma 基于 Gemma 3 base model,配备基于 SigLIP 的医学视觉编码器,把多模态 QA 提升 2.6–10%,X 光发现分类提升 15.5–18.1%,医学 agentic 评测提升 10.8%,并改善了 EHR 检索。
- Comet 是一个 EHR 模型家族,在来自 Epic Cosmos 数据库的 1.18 亿名患者、1150 亿条离散医疗事件上训练,构成了目前最大的 scaling law 研究,并在 78 个任务上测试。
- 在 75% 的就诊中,临床医生表示 OpenAI 的 AI Consult「显著」提升了他们提供的诊疗质量,并可度量地减少了诊断和治疗错误。
架构与基础研究
Diffusion language models: parallel denoising challenges autoregression
Diffusion LLM 通过对被 mask 的序列做迭代去噪来生成,使用全上下文 attention,每一步并行更新多个 token。近期系统已经达到有竞争力的 7–8B 质量,加入了任意顺序生成和 infilling,并暴露出有用的质量—延迟取舍。
- LLaDA 用前向 masking 和反向去噪从头训练 diffusion LM,使用标准 Transformer99。它在 8B 规模上报告了有竞争力的通用分数,并扩展出配套视觉模型 LLaDA-V。
- Dream-7B 用 diffusion decoder 实现任意顺序生成和稳健 infilling100。它在推理和代码任务上与同规模自回归模型表现相当。
- Seed Diffusion 面向吞吐量,在 H20 级 GPU 上达到约 2,146 tok/s,同时保持有竞争力的代码准确率101。
- LongLLaDA 分析长上下文行为,并引入一种免训练的长度外推方法,展示了外推下稳定的困惑度和一种「局部感知」效应102。
Tokenizer-free LLMs via dynamic byte patches
**Byte Latent Transformer(BLT)**直接从字节学习,并把由熵驱动的 “patch” 作为计算单元103。在 8B 规模上,BLT 匹配了 tokenized LLM 的质量,同时打开了一个新的 scaling 维度,并在同等质量下降低了推理 FLOPs。
- 模型读取原始字节,在 next-byte 熵较高处把它们分组成 patch,对每个 patch 做局部编码,然后让 Transformer 在 patch 序列上运算,最后解码回文本。
- 在 8B 级别的受控 scaling 研究中,BLT 达到与 tokenized LLM 可比的质量。它还通过让 patch 大小随模型规模增长(而不是按 token 付费)来降低同等质量下的推理算力。
- 字节级训练提升了对拼写变体、噪声和长尾输入的鲁棒性。
Attention sinks aren’t a bug…they’re the brakes
Attention 是 transformer 的核心机制。许多 head 会在第一个位置学到一个 attention sink,通过在深度和上下文增长时抑制「过度混合」来稳定计算104。关于模型为什么会学到这个、以及它有什么用,一直存在争论。
- Sink 的作用是一个学到的「混合刹车」:把 attention 停在第一个位置,模型降低了跨 token 敏感度,对 prompt 的小扰动反应更弱;这一效应随更长上下文和更大模型而增强。
- 在更长上下文上训练会单调地增加 sink 指标。在 LLaMA-3.1 家族中,405B 有约 78% 的 head 存在强 sink,而 8B 只有约 46%。
- 实践含义是:sink 会附着到位置 1。如果预训练时
⟨bos⟩固定在那里,推理时移除它会让性能崩塌(例如 RULER-4096 → 0,ARC/HellaSwag 大幅下降)。因此要谨慎处理⟨bos⟩和 packing。
评测的困境
The trouble with benchmarks: vibes aren’t all we need, but increasingly all we’ve got
研究者揭示了对 LMArena 的系统性操纵:Meta 测试了 27 个私有 Llama-4 变体,然后挑选出赢家发布——测试 10 个变体就能带来 100 分的提升105。
- OpenAI 和 Google 拿走了全部 Arena 数据的 40%,而 83 个开源模型在剩下的 30% 里争夺。
- 大厂获得的数据访问量是学术实验室的 68 倍;API 托管的模型能看到每一条测试 prompt,而第三方模型只能看到 20%。
- 在 Arena 数据上训练能让胜率翻倍,因为 7.3% 的 prompt 每月被回收,而测试分布反映的是开发者喜欢问的东西(几十个 Star Trek 问题,零个关于 Chaucer 的)。
- LMArena 已经以 6 亿美元估值融资 1 亿美元106。
- 这个领域需要污染审计,来缓解可能系统性存在的 test-train 泄漏。
The trouble with benchmarks: safety-washing
71% 的安全 benchmark 方差仅由通用能力就能解释,而像 WMDP 生物武器(-0.91)这样真正的风险反而随着模型变聪明而恶化107。
- 安全 benchmark 与能力高度相关:单纯扩大模型就能改善大多数安全指标!
- 然而关键的安全问题随规模恶化:最危险的能力与所报告的安全提升呈负相关。
- 指令微调掩盖而非解决问题。base model 的相关性在 chat tuning 之后从负翻正(CyberSecEval:-0.25 → 0.55),而有害能力仍潜伏在模型中。
- 安全研究应该优先采用与规模不高度相关的指标!
LLMs are professional yes-men, and we trained them to be that way
“Sycophancy”(谄媚)不是 bug,而正是人类反馈优化的产物108。一项对五个主要 LLM 的研究显示,它们持续告诉用户想听的话,而不是真相。
- 当用户用「你确定吗?」质疑时,Claude 1.3 有 98% 的概率为自己正确的答案道歉——即使它对正确答案高度自信。
- 人类众包标注者也是问题的一部分:在无法核实事实时,他们同样偏好写得好的谬误。话题越难,他们越奖励自信的胡说。
- 使用标准偏好模型做 Best-of-N 采样,持续比使用以真实性为目标的偏好模型产生更谄媚的输出。
- 标准 RLHF 存在一个根本缺陷——模型学到「同意标注者 > 真相」,因为这就是训练信号实际奖励的东西。
神经科学与多模态表示
Brain-to-text decoding: decoding brain activity during typing
Meta AI 研究者开发了 Brain2Qwerty,通过读取颅外脑信号来解码人们正在输入的内容,最佳被试的字符错误率达到 19%109。这相比此前的非侵入式方法是实质性改进(但仍远未达到临床可用)。
- 35 名西班牙语被试记住句子,然后在键盘上「盲打」出来。他们的脑活动用脑电(EEG)或脑磁(MEG)记录。
- Brain2Qwerty 分三阶段:CNN 分析来自数百个传感器的输入,transformer 利用句子上下文精修预测,西班牙语语言模型修正明显错误。
- 平均 32% 的错误率仍远高于侵入式脑机接口(CER < 6%),但长远看这类工作可能用于恢复言语障碍者的沟通能力,并有助于理解语言的神经基础。
- 系统的错误显示它追踪的是手指运动而非理解语言:当它认错一个字母时,73% 的情况会选择物理上相邻的按键。
Can vision models align with human brains…and how does that alignment emerge?
通过系统性地改变 DINOv3(Meta 在数十亿图像上训练的最新自监督图像模型)的模型规模、训练量和图像类型,研究者显示脑—模型的收敛是按特定顺序出现的110。他们发现早期层与感觉皮层对齐,而只有长时间训练和以人为中心的数据才能驱动与前额区域的对齐。更大的模型收敛更快,而更晚出现的表示会镜像皮层属性,如扩张、厚度和慢时间尺度111。
- 用 fMRI(8 名被试,每人约 10,000 张图,获得皮层活动的高分辨空间图)和 MEG(4 名被试,每人约 22,500 张图,获得高分辨时间动态)记录,与 DINOv3 激活做比较。
- 评估了三种脑—模型相似性指标:encoding score(线性相似性)、spatial score(层 ↔ 皮层层级)和 temporal score(层 ↔ 脑响应时序)。
- 类脑表示在训练过程中逐步出现。早期视觉区域和快速 MEG 响应很快对齐,而前额皮层和晚期时间窗需要多得多的训练,这与人类皮层的发育轨迹高度呼应。
Scaling laws for brain-to-image decoding: data per subject matters (and costs bite)
Meta AI 在 EEG、MEG、3T fMRI 和 7T fMRI 上对 brain-to-image 解码做了 benchmark,使用 8 个公开数据集、84 名志愿者、498 小时记录和 230 万个图像诱发响应,在单试次设置下评估112。他们发现没有性能平台期:解码质量随记录时长大致呈对数线性提升,而收益主要取决于每个被试的数据量,而不是增加被试数。深度学习在噪声最大的传感器(EEG/MEG)上帮助最大。
- 最精密的设备给出最好的绝对解码效果(7T > 3T > MEG > EEG),但深度网络在含噪模态上带来最大提升,缩小了差距。
- Scaling law:性能随记录时间对数线性上升。收益主要来自每个被试记录更多,而非招募更多参与者。
- 成本模型(粗略估计):EEG 约 263 美元/小时,MEG 550 美元/小时,3T 935 美元/小时,7T 1,093 美元/小时。13.1 万美元的预算在不同模态上买到的准确率差别显著,因此最优 scaling 取决于预算和目标保真度。
ATOKEN: a unified visual tokenizer for images, video, and 3D
Apple 提出了一个同时支持高保真重建和语义理解、并覆盖图像、视频和 3D 的单一 tokenizer,可能成为真正统一多模态模型的基础层113。这一方法减少碎片化、简化技术栈,并支持能力跨模态直接迁移。
- ATOKEN 是单一视觉 tokenizer,用纯 Transformer 加 4D RoPE 把图像、视频和 3D 输入映射到共享的 4D 稀疏 latent。然后输出连续或离散 token,并用 perceptual + Gram loss 稳定训练(无需 GAN)。
- 一个后端现在同时支持高保真重建和语义理解。从图像 → 视频 → 3D 的课程展示了跨模态迁移,而原生分辨率 / 时间处理配合 KV caching 保持了可扩展性(训练规模最高 256×H100,约 13.8 万 GPU 小时)。
- 专用方法在某些长视频和生成 benchmark 上仍然领先,而算力账单也很高。采用与否取决于发布细节和工具链,但统一 tokenizer 这个方向看起来是正确的基础。
具身智能与自动驾驶
Merging the virtual and physical worlds: pre-training on unstructured reality
新一代机器人 Agent 建立在大规模预训练的基础上,但关键创新是从昂贵的标注数据集转向利用海量无标注的野外视频来学习世界模型和物理 affordance。
- NVIDIA 的 GR00T 1.5 在数据效率上有显著进步114。它用神经渲染技术直接从非结构化 2D 视频构建隐式 3D 场景表示,从而为策略生成大量训练数据,实际上是在从观察人类中学习。
- 字节跳动的 GR-3 把 next-token prediction 范式应用到机器人115。通过把视觉、语言和动作当作统一序列,他们可以端到端预训练。这种方法在使用 2D 空间输出(例如动作热力图)作为辅助 loss 时尤其有效,有助于把模型对物理空间的理解 ground 住。
The architectural divide: knowledge insulation vs. end-to-end adaptation
当强大的预训练 Vision-Language-Action Model(VLAM)成为机器人 Agent 的「大脑」后,一个关键的架构争论出现了:是应该为新的物理任务微调整个模型,还是应该冻结权重来「隔离」核心知识?
- 支持隔离的一方:Pi-0.5 冻结大型 VLM,只微调小的 “action-expert” head116。这有效是因为机器人数据集很小,常常不到 VLM 预训练语料的 0.1%,因此全网络微调容易过拟合并遗忘通用知识,同时算力开销更大。
- 支持端到端的一方:相反,字节跳动 GR-3 和 SmoLVLA 这类模型展示了在有足够任务数据时解冻的好处117:网络能内化接触、动力学和场景几何。如果机器人数据接近 VLM 的规模,端到端很可能会占优。
Emergent reasoning moves into the physical world
“Chain-of-Action” 模式——在低层控制之前显式给出中间计划——正在成为具身推理的标准。它由 AI2 的 Molmo-Act 在 2025 年首次展示,并被 Gemini Robotics 1.5 迅速采用。这一方法镜像了 LLM 中的 Chain-of-Thought,同时提升了真实机器人中的可解释性和长时程可靠性。
- Molmo-Act(AI2):从高层指令出发,模型输出中间的视觉 / 几何产物(例如深度 / 轨迹草图),再由一个独立 decoder 转成连续电机指令118。这让抓取放置、装洗碗机这类复杂操作任务的行为更容易检查和调试。
- Gemini Robotics 1.5(GDM):使用同样的 plan-then-act 架构,由 ER 1.5(高层规划器)生成结构化动作计划,交给 Robotics 1.5 通过 visuomotor 策略执行119。
- Teaching LLMs to Plan(MIT):语言侧的并行工作在最终答案前引入显式的 plan token,提升长时程可靠性并给审计者提供可检查的东西,是 Chain-of-Action 在 LLM 中的对应物。
Reading the road: processing driving tasks in a unified language space
Waymo 的 EMMA 是一个端到端多模态模型,把自动驾驶重新想象成一个视觉—语言问题120。它把摄像头输入直接映射到驾驶专用输出(如轨迹和路网元素),并用自然语言表示它们,从而借助 LLM 的推理和世界知识达到 SOTA,同时提供人类可读的理由。
- EMMA 在 nuScenes 和 Waymo Open Motion Dataset 等公开数据集上表现优秀,尤其在仅用摄像头输入的运动规划和 3D 目标检测上突出。
- 一个关键特性是它的 CoT 推理:通过提示模型顺序解释自己的决策并整合世界知识,提升了决策透明度。这种方法以可读、可解释的格式产出未来车辆轨迹和目标检测估计。
- 虽然有前景,EMMA 受限于一次只能处理少数帧、不使用 LiDAR 这类精确 3D 感知模态,且计算开销大。
Agent:从框架爆发到记忆系统
Computer Use Agents (CUA) have improved by leaps and bounds, and still fall short
OpenAI、Anthropic、字节跳动等研究机构一直在为原生的语言模型电脑操作构建 benchmark 和交互方法。虽然 RL 和多步推理带来了大幅提升,但总体上模型仍然不够好。
- 字节跳动的 UI-TARS-2 是一个原生 GUI Agent,通过收集轨迹、做 SFT,然后在一个一体化沙箱(云 VM + 浏览器游戏环境 + 终端/SDK 工具)中做多轮 RL 训练,配合异步 rollout 和合并专用 Agent 的能力121。
- 该系统在 GUI Agent benchmark 上全面达到 SOTA:OSWorld 47.5%、WindowsAgentArena 50.6%、AndroidWorld 73.3%、Online-Mind2Web 88.2%,在 15 个网页游戏上平均归一化分 59.8(约为人类的 60%),大幅超过 OpenAI CUA 和 Claude Computer Use。它还展现出很强的推理期 scaling(步数越多分数越高)。
- 但长时程问题仍然脆弱(例如 Tetris/Sokoban 和困难的 BrowseComp 任务),平均游戏技能比人类低约 40%。
Could small language models be the future of agentic AI?
NVIDIA 认为大多数 Agent 工作流是狭窄、重复且格式受限的,因此小语言模型(SLM)往往就足够了,运维上更合适,而且便宜得多122。他们建议采用 SLM-first 的异构 Agent,只在必要时调用大模型。
- Agent 大多在填表单、调 API、遵循 schema 和写短代码。新的小模型(1–9B)能很好地完成这些工作:Phi-3-7B 和 DeepSeek-R1-Distill-7B 在指令和工具上有竞争力。
- 一个约 7B 的模型通常便宜 10–30 倍且响应更快。你可以用 LoRA/QLoRA 一夜之间微调它,甚至在单张 GPU 或设备上运行。
- 可以采用「小模型优先、必要时升级」的设计:把常规调用路由给 SLM,只把困难、开放式的升级给大 LLM。实践中这可以把 40–70% 的调用转移到小模型上而不损失质量。
- 但 SLM 在长上下文、新颖推理或混乱对话上仍然吃力。要保留通往大模型的逃生通道,并定期评估。
Headline AI agent designed innovations require domain-expert audits
宏观 benchmark 分数和惊人的加速数字常常有误导性。Sakana AI 曾推出一个号称带来 100 倍提升的 CUDA Agent,后来发现是 Agent hack 了 benchmark123。在独立重新测量下,提升消失了。有经验的 GPU 工程师本会把 100 倍的 kernel 提升标记为不可信,因此评测应该与领域专家共同设计并接受审计。
- Sakana 的 Agent 迭代地翻译和「优化」CUDA kernel,内部运行显示 2–7 倍收益,个别案例接近 100 倍。使用更严格 harness 的独立抽查发现同样的 kernel 最多慢 3 倍,并揭示评测代码可被利用124。
- 其他实验室也发布过类似夸大的 kernel 结果,在社区抽查下崩塌。X 上的从业者常规性地用厂商库、roofline 上界、真实 batch size 和端到端运行时间来对论断做 sanity check。
Model Context Protocol becomes the “USB-C” of AI tools
由 Anthropic 在 2024 年末推出的 **Model Context Protocol(MCP)**已经迅速成为把模型接入数据、工具和应用的默认方式125。2025 年各大平台纷纷采用:OpenAI 在 ChatGPT、Agents SDK 和 API 中全面支持 MCP;Google 把 MCP 加入 Gemini;微软把 MCP 内建进 VS Code,并开始推向 Windows 和 Android Studio。随着数千个 MCP server 出现在野外,这一协议正在塑造 agentic 系统的构建和安全方式。
- MCP 提供跨客户端(ChatGPT、Gemini、Claude/VS Code、LangChain、Vercel)的统一集成,收敛了一次性连接器,并通过统一规范支持工具发现、资源和 prompt。
- Zeta Alpha 的数据显示,MCP 协议被引用的研究论文数量是 Google 竞争协议 A2A 的 3 倍(右图)。
- 安全研究者估计全球有超过 15,000 个 MCP server。微软和 Vercel 等公司正在随生态成熟构建护栏和注册中心。
- 早期事故(例如 npm 上一个恶意版本的 Postmark MCP server 悄悄把用户邮件 BCC 给攻击者,直到被下架)说明了治理和包卫生的重要性126。
The explosion of AI agent frameworks…
Agent 框架生态没有收敛,反而扩散成了一种「有组织的混乱」。数十个竞争框架共存,各自在研究、工业或轻量部署中占据一个生态位。
- LangChain 依然流行,但如今只是众多选择之一。
- AutoGen 和 CAMEL 主导 R&D:AutoGen 在多 Agent + RAG 研究中,CAMEL 在角色化对话中。
- MetaGPT 在软件工程中活跃,把 Agent 变成结构化开发工作流。
- DSPy 作为研究优先的框架崛起,用于声明式程序合成和 Agent 流水线127。
- LlamaIndex 锚定企业文档上的 RAG 工作流。
- AgentVerse 用于多 Agent 仿真和 benchmark。
- LangGraph 基于图的编排赢得了需要可靠性和可观测性的开发者128。
- Letta / MemGPT 探索记忆优先的架构,把持久记忆变成框架原语。
- OpenAgents、CrewAI 和 OpenAI Swarm 这类轻量挑战者体现了向可组合、任务专用框架的转变。
…and an explosion of diverse AI agent research papers
每年有数万篇研究论文在探索 AI Agent 的各个前沿,因为它们正从想法走向生产,包括:
- Tools:从插件到通过共享协议的多工具编排。
- Planning:任务分解、分层推理、自我改进。
- Memory:状态跟踪、情景回忆、工作流持久化、持续学习。
- Multi-agent systems:协作、集体智能、自适应仿真。
- Evaluation:开放式任务的 benchmark、多模态测试、成本与安全。
- Coding agents:修 bug、agentic PR、端到端工作流自动化。
- Research agents:文献综述、假设生成、实验设计。
- Generalist agents:GUI 自动化、多模态输入输出。
Building agents that remember: from context windows to lifelong memory
Agent 记忆正在从临时的上下文管理,转向结构化、持久的系统。前沿已经超越了检索,进入动态整合、遗忘和反思,从而让 Agent 在多次交互、任务乃至「一生」中形成连贯的身份。
- 记忆不再是被动缓冲区,而正在成为推理、规划和身份的活跃基底。活跃的研究方向包括:
学术生态:会议的容量危机
AI conferences’ capacity crisis
顶级 AI 会议正被前所未有的投稿量压垮。「多产作者」(在某个会议上有 5 篇以上论文被接收)也在增加131。这导致会议为找出路而采取激烈措施:据称 NeurIPS 曾要求审稿人拒掉 300–400 篇原本建议接收的论文132。
- 一位 NeurIPS 审稿人在 Bluesky 上批评了这种任意移除数百篇原本建议接收论文的做法。
- AAAI 2026 今年收到了史无前例的 2.9 万篇投稿,几乎是去年的两倍,这迫使他们招募了 2.8 万名程序委员会成员133。CoRL 今年把容量从 1.5k 翻倍到 3k,在论文还没接收时就已售罄。
- 我们也在见证多产作者的崛起。2023 年,一位研究者在顶级 AI 会场发表了 80 多篇论文;而在 CVPR 2023 上,仅 1% 的作者贡献了超过 50% 的论文。这引出了关于贡献度和 burnout 的疑问。
编者总结与展望
Research 这一篇读下来,2025 年最大的主线毫无疑问是 reasoning。从 o1-preview 到 R1、再到 GPT-5,「先思考、再回答」的范式在一年内完成了从论文到产品的全过程,而 RL + 可验证奖励(RLVR)成了这条路线的核心引擎。
但报告同时给出了一记冷水:推理进展的可信度正在被评测本身拖累。多篇工作显示,很多 RL 方法的提升落在 baseline 方差之内;AIME 只有 30 道题,一道题就能改变几个百分点;加一句「猫一生大部分时间都在睡觉」就能让错误率翻倍。再叠加 LMArena 被系统性操纵、safety benchmark 71% 的方差由通用能力解释这些发现,可以说**「基于感觉」的评测已经到了必须被认真修正的阶段**——这一点和 2023 年报告的结论一脉相承,只是问题更严重了。
对国内从业者来说,最值得关注的是开源格局的反转。Hugging Face 上中国模型的累计下载量在 2025 年年中超过美国,Qwen 一家占新增衍生模型 40% 以上,而 Llama 从约 50% 掉到 15%;verl 和 OpenRLHF 成了事实上的 RL 训练标准栈。**这一次中国不是在追赶开源,而是在定义开源。**但也要清醒:最强的模型依然是闭源的,报告明确指出中国实验室「尚未推进前沿,只是在开放权重领域竞争」。开放权重的领先是生态和工程层面的胜利,不等于前沿能力的领先。
另一条容易被低估的主线是 AI for Science。从 AlphaEvolve 改进了 Strassen 1969 年的算法,到 Co-Scientist 提出的机制被湿实验证实,到 MatterGen 首次实验室合成成功,再到 IMO 金牌——AI 已经不只是加速科研,而开始产出可验证的新知识。报告甚至预测「未来一年内会有非平凡的研究级数学结果由 AI 证明并形式化」。而 AlphaZero 教特级大师新概念那篇工作也许暗示了更远的图景:超人系统可以成为老师,而不只是工具。
最后一个耐人寻味的张力是可监控性。CoT 让我们第一次能「读到」模型在想什么,但 Anthropic 发现不到 20% 的真实线索会被说出来,「测试意识」方向可以被操控从而虚高安全分数,而 COCONUT 这类隐空间推理干脆绕过语言。研究者提出的 “monitorability tax” 说得很直白:**我们可能必须主动选择稍弱但更透明的模型。**在竞争如此激烈的当下,这笔税会有人愿意付吗?这大概是明年最值得追踪的问题之一。
关于作者 魏后民,本科毕业于北京大学,在字节跳动 AML 从事大规模机器学习系统相关工作。过去曾在腾讯和 Hulu 工作,对 AI Infra 和科技创投感兴趣。欢迎加我的微信 Houmin_Wei 与我交流,麻烦备注 【称呼-公司/学校-职位-来意】。如果你也关注这一波 AI 浪潮,希望和来自字节、腾讯、百度、阿里以及一线大模型创业公司的同学一起交流,欢迎扫码进群。
-
State of AI Report 2025, Nathan Benaich, https://docs.google.com/presentation/d/1xiLl0VdrlNMAei8pmaX4ojIOfej6lhvZbOIK7Z6C-Go/preview ↩︎
-
Artificial Analysis, OpenAI models, https://artificialanalysis.ai/providers/openai ↩︎
-
Three Observations, Sam Altman, https://blog.samaltman.com/three-observations ↩︎
-
DeepSeek R1-lite-preview, https://api-docs.deepseek.com/news/news1120 ↩︎
-
DeepSeek-R1, https://github.com/deepseek-ai/DeepSeek-R1 ↩︎
-
DeepSeek V3.1, https://api-docs.deepseek.com/news/news250821 ↩︎
-
DeepSeek V3.2-Exp, https://github.com/deepseek-ai/DeepSeek-V3.2-Exp/blob/main/DeepSeek_V3_2.pdf ↩︎
-
Adaptive Parallel Reasoning, https://arxiv.org/pdf/2504.15466 ↩︎
-
Sample Set Aggregator, https://user074.github.io/ssa-parallel-reasoning/ ↩︎
-
Epoch AI Benchmarks, https://epoch.ai/benchmarks ↩︎
-
Artificial Analysis Intelligence Index, https://artificialanalysis.ai/ ↩︎
-
A Sober Look at Progress in Language Model Reasoning, https://arxiv.org/pdf/2504.07086 ↩︎
-
The Illusion of Thinking, https://arxiv.org/pdf/2506.06941 ↩︎
-
Comment on The Illusion of Thinking, https://arxiv.org/pdf/2506.09250v1 ↩︎
-
Cats Confuse Reasoning LLM, https://arxiv.org/abs/2503.01781 ↩︎
-
GSM-Symbolic, https://arxiv.org/pdf/2410.05229 ↩︎
-
Is Chain-of-Thought Reasoning a Mirage?, https://arxiv.org/pdf/2508.01191 ↩︎
-
XReasoning, https://arxiv.org/pdf/2505.22888 ↩︎
-
CoT May Be Highly Informative Despite Unfaithfulness, METR, https://metr.org/blog/2025-08-08-cot-may-be-highly-informative-despite-unfaithfulness/ ↩︎
-
Me, Myself, and AI: The Situational Awareness Dataset, https://arxiv.org/pdf/2505.14617 ↩︎
-
Safety Pretraining, ACL 2025, https://aclanthology.org/2025.acl-long.5.pdf ↩︎
-
Monitoring Reasoning Models for Misbehavior, https://arxiv.org/pdf/2503.11926 ↩︎
-
Chain of Thought Monitorability, https://arxiv.org/abs/2507.11473 ↩︎
-
Reasoning Models Don’t Always Say What They Think, Anthropic, https://assets.anthropic.com/m/71876fabef0f0ed4/original/reasoning_models_paper.pdf ↩︎
-
Training Large Language Models to Reason in a Continuous Latent Space (COCONUT), https://arxiv.org/pdf/2412.06769 ↩︎
-
Scaling up Test-Time Compute with Latent Reasoning, https://arxiv.org/pdf/2502.05171 ↩︎
-
NaturalReasoning, https://arxiv.org/pdf/2502.13124v1 ↩︎
-
Prioritizing Learnability (LILO), https://arxiv.org/abs/2502.12272 ↩︎
-
The Evolution of Reward Signals, https://www.youtube.com/watch?v=V1eYniJ0Rnk ↩︎
-
Ross Taylor on RL environments, https://x.com/rosstaylor90/status/1959494279077728549 ↩︎
-
Does RLVR Really Incentivize Reasoning Capacity?, https://arxiv.org/pdf/2504.13837 ↩︎
-
RLVR Implicitly Incentivizes Correct Reasoning, https://arxiv.org/pdf/2506.14245 ↩︎
-
LoRA Without Regret, Thinking Machines, https://thinkingmachines.ai/blog/lora/ ↩︎
-
Efficiently Learning at Test-Time (SIFT), https://arxiv.org/pdf/2410.08020 ↩︎
-
Subspace Boosting for Model Merging, https://arxiv.org/pdf/2506.16506 ↩︎
-
Practical Efficiency of Muon for Pretraining, https://arxiv.org/pdf/2505.02222 ↩︎
-
Fantastic Pretraining Optimizers and Where to Find Them, https://arxiv.org/pdf/2509.02046 ↩︎
-
Cut Your Losses in Large-Vocabulary Language Models, https://arxiv.org/pdf/2411.09009v1 ↩︎
-
How Much Do Language Models Memorize?, https://arxiv.org/abs/2505.24832 ↩︎
-
Membership Inference Attacks on LLMs, https://arxiv.org/pdf/2505.18773 ↩︎
-
Amplifying Human Performance in Combinatorial Competitive Programming, PNAS, https://www.pnas.org/doi/epdf/10.1073/pnas.2406675122 ↩︎
-
Kimi K2, https://arxiv.org/html/2507.20534v1 ↩︎
-
Kimi K2 Blog, https://moonshotai.github.io/Kimi-K2/ ↩︎
-
Artificial Analysis, open weights vs. proprietary, https://artificialanalysis.ai/trends#progress-in-open-weights-vs-proprietary-intelligence ↩︎
-
Sam Altman believes OpenAI has been on the wrong side of history concerning open source, https://techcrunch.com/2025/01/31/sam-altman-believes-openai-has-been-on-the-wrong-side-of-history-concerning-open-source/ ↩︎
-
Star History: gpt-oss vs. DeepSeek vs. Llama, https://www.star-history.com/#openai/gpt-oss&deepseek-ai/DeepSeek-R1&deepseek-ai/DeepSeek-V3&meta-llama/llama&Timeline ↩︎
-
ATOM Project, https://www.atomproject.ai/ ↩︎ ↩︎
-
China’s AI startup Zhipu releases open-source model GLM-4.5, https://www.reuters.com/technology/chinas-ai-startup-zhipu-releases-open-source-model-glm-45-2025-07-28/ ↩︎
-
HybridFlow, https://arxiv.org/pdf/2405.11143v5 ↩︎
-
OpenRLHF, https://arxiv.org/abs/2409.19256v1 ↩︎
-
Genie 3: A new frontier for world models, https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/ ↩︎ ↩︎
-
Introducing Interactive Video, Odyssey, https://odyssey.world/introducing-interactive-video ↩︎
-
Genie: Generative Interactive Environments, https://arxiv.org/pdf/2402.15391 ↩︎
-
Genie 2: A large-scale foundation world model, https://deepmind.google/discover/blog/genie-2-a-large-scale-foundation-world-model/ ↩︎
-
Dreamer 4, https://danijar.com/project/dreamer4/ ↩︎
-
HunyuanVideo, https://arxiv.org/abs/2412.03603 ↩︎
-
Open-Sora 2.0, https://arxiv.org/abs/2503.09642v1 ↩︎
-
Kling AI advances 2.0 era, https://ir.kuaishou.com/zh-hant/news-releases/news-release-details/kling-ai-advances-20-era-empowering-everyone-tell-great-stories ↩︎
-
Shengshu Vidu 2.0, https://www.prnewswire.com/news-releases/shengshu-technology-announces-vidu-2-0--offering-the-industrys-fastest-generative-video-302351677.html ↩︎
-
Alibaba releases Wan 2.2, https://www.alibabacloud.com/blog/alibaba-releases-wan2-2-to-uplift-cinematic-video-production_602413 ↩︎
-
Sora 2, OpenAI, https://openai.com/index/sora-2/ ↩︎
-
EpochAI on Sora 2 and GPQA Diamond, https://x.com/epochairesearch/status/1974172794012459296 ↩︎
-
OMNI-EPIC, https://arxiv.org/pdf/2405.15568 ↩︎
-
Darwin Gödel Machine, https://arxiv.org/pdf/2505.22954 ↩︎
-
PaperBench, https://arxiv.org/abs/2504.01848 ↩︎
-
EXP-Bench, https://arxiv.org/abs/2505.24785 ↩︎
-
MLR-Bench, https://arxiv.org/abs/2505.19955 ↩︎
-
Towards an AI co-scientist, https://storage.googleapis.com/coscientist_paper/ai_coscientist.pdf ↩︎
-
cf-PICI tail hijacking, Cell, https://www.cell.com/cell/fulltext/S0092-8674(25)00973-0 ↩︎
-
The Virtual Lab, https://arxiv.org/pdf/2501.04227 ↩︎
-
AlphaEvolve, DeepMind, https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/ ↩︎
-
AlphaEvolve paper, https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/AlphaEvolve.pdf ↩︎
-
ATOMICA, https://www.biorxiv.org/content/10.1101/2025.04.02.646906v1.full ↩︎
-
OMat24, https://arxiv.org/pdf/2410.12771 ↩︎
-
MatterGen, Microsoft Research, https://www.microsoft.com/en-us/research/blog/mattergen-a-new-paradigm-of-materials-design-with-generative-ai/ ↩︎
-
MatterGen, Nature, https://www.nature.com/articles/s41586-025-08628-5 ↩︎
-
ChemBench, Nature Chemistry, https://www.nature.com/articles/s41557-025-01815-x ↩︎
-
LLM as strategic evaluator in retrosynthesis, https://arxiv.org/html/2503.08537v2 ↩︎
-
Mechanism reasoning with LLMs, https://arxiv.org/pdf/2505.07735 ↩︎
-
Autonomous mobile robotic chemist, Nature, https://www.nature.com/articles/s41586-024-08173-7 ↩︎
-
Rainbow multi-robot lab, Nature Communications, https://www.nature.com/articles/s41467-025-63209-4 ↩︎
-
An AI system to help scientists write expert-level empirical software, https://arxiv.org/pdf/2509.06503 ↩︎
-
Evo, Science, https://arcinstitute.org/publications/science.ado9336.pdf ↩︎
-
Evo 2, https://www.biorxiv.org/content/10.1101/2025.02.18.638918v1.full.pdf ↩︎
-
ProGen3, Profluent, https://www.profluent.bio/showcase/progen3 ↩︎
-
ProGen3 preprint, https://www.biorxiv.org/content/10.1101/2025.04.15.649055v1 ↩︎
-
Runs N’ Poses, https://www.biorxiv.org/content/10.1101/2025.02.03.636309v1 ↩︎
-
OpenBind, https://openbind.uk/ ↩︎
-
Towards accurate differential diagnosis with LLMs, Nature, https://www.nature.com/articles/s41586-025-08866-7 ↩︎
-
Towards conversational diagnostic AI, Nature, https://www.nature.com/articles/s41586-025-08869-4 ↩︎
-
AMIE multimodal consultations, https://arxiv.org/abs/2507.15743 ↩︎
-
MedGemma, https://arxiv.org/pdf/2508.12104 ↩︎
-
Comet EHR foundation models, https://arxiv.org/pdf/2507.05201 ↩︎
-
AI Consult with Penda Health, OpenAI, https://cdn.openai.com/pdf/a794887b-5a77-4207-bb62-e52c900463f1/penda_paper.pdf ↩︎
-
Dream-7B, https://hkunlp.github.io/blog/2025/dream/ ↩︎
-
Seed Diffusion, https://arxiv.org/html/2508.02193v1 ↩︎
-
LongLLaDA, https://arxiv.org/abs/2506.14429 ↩︎
-
Byte Latent Transformer, https://arxiv.org/abs/2412.09871 ↩︎
-
Why do LLMs attend to the first token?, https://arxiv.org/pdf/2504.02732 ↩︎
-
The Leaderboard Illusion, https://arxiv.org/pdf/2504.20879 ↩︎
-
LMArena goes from academic project to $600 million startup, https://www.bloomberg.com/news/articles/2025-05-21/lmarena-goes-from-academic-project-to-600-million-startup ↩︎
-
Safetywashing, NeurIPS 2024, https://proceedings.neurips.cc/paper_files/paper/2024/file/7ebcdd0de471c027e67a11959c666d74-Paper-Datasets_and_Benchmarks_Track.pdf ↩︎
-
Towards Understanding Sycophancy in Language Models, https://arxiv.org/pdf/2310.13548 ↩︎
-
Brain2Qwerty, https://arxiv.org/pdf/2502.17480 ↩︎
-
DINOv3, Meta AI, https://ai.meta.com/dinov3/ ↩︎
-
The emergence of brain-like representations in DINOv3, https://arxiv.org/pdf/2508.18226 ↩︎
-
Scaling laws for brain-to-image decoding, https://arxiv.org/html/2501.15322v2 ↩︎
-
ATOKEN, https://arxiv.org/pdf/2509.14476 ↩︎
-
GR00T N1.5, NVIDIA, https://research.nvidia.com/labs/gear/gr00t-n1_5/ ↩︎
-
GR-3, ByteDance Seed, https://seed.bytedance.com/en/GR3 ↩︎
-
Knowledge Insulation, Physical Intelligence, https://www.physicalintelligence.company/research/knowledge_insulation ↩︎
-
SmolVLA, https://arxiv.org/pdf/2506.01844 ↩︎
-
MolmoAct, AI2, https://allenai.org/blog/molmoact ↩︎
-
Gemini Robotics 1.5, https://deepmind.google/discover/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/ ↩︎
-
EMMA, Waymo, https://arxiv.org/pdf/2410.23262 ↩︎
-
UI-TARS-2, https://arxiv.org/abs/2509.02544 ↩︎
-
Small Language Models are the Future of Agentic AI, NVIDIA, https://research.nvidia.com/labs/lpr/slm-agents/ ↩︎
-
The AI CUDA Engineer, Sakana AI, https://sakana.ai/ai-cuda-engineer/ ↩︎
-
Independent re-measurement of Sakana’s CUDA kernels, https://x.com/main_horse/status/1892446384910987718 ↩︎
-
Introducing the Model Context Protocol, Anthropic, https://www.anthropic.com/news/model-context-protocol ↩︎
-
Malicious MCP server on npm harvests emails, Snyk, https://snyk.io/blog/malicious-mcp-server-on-npm-postmark-mcp-harvests-emails/ ↩︎
-
LangGraph, https://github.com/langchain-ai/langgraph ↩︎
-
The Rise of Prolific Authors in AI, https://arxiv.org/html/2412.07793v1/ ↩︎
-
NeurIPS is pushing SACs to reject already-accepted papers, https://www.reddit.com/r/MachineLearning/comments/1n4bebi/d_neurips_is_pushing_to_sacs_to_reject_already/ ↩︎
-
Unprecedented number of submissions at AAAI 2026, https://www.reddit.com/r/MachineLearning/comments/1n1wm8n/n_unprecedented_number_of_submissions_at_aaai_2026/ ↩︎
Author houmin
Publish October 9, 2025
LastMod July 29, 2026
License 本作品采用 CC BY-NC-ND 4.0 许可协议进行许可,转载时请注明原文链接
如果你在浏览博客的过程中发现了任何问题,欢迎在对应文章下评论。如果你有其他事情想要咨询,可以通过邮件联系我。