模型与算法

  • Llama 2 —— 开放基座模型与微调对话模型:RLHF 那一段写得比同期任何报告都细,reward model 拆成 helpfulness 与 safety 两个、rejection sampling 与 PPO 串联、GAtt 修多轮 system message,成了此后两年对齐配方的公共模板;全译 77 页正文与附录 A
  • 大模型架构大对比 —— 从 DeepSeek V3 到 Gemma 4:Sebastian Raschka 连载九个月的架构横切面,23 个旗舰开源模型只拆结构、不谈 benchmark 和训练算法,看 MLA、MoE 粒度、滑窗与全局注意力的混合比、NoPE、QK-Norm、线性注意力这几条线怎么一家家扩散开的;全译 23 节 66 图
  • 推理努力度是怎么训出来的 —— 推理努力度是怎么训出来的:low/medium/high 这个旋钮在推理侧只是一句 system prompt,在训练侧是三条可叠加的路线;硬性 token 预算是另一件事
  • Baichuan-M3 —— 为可靠的医疗决策建模临床问诊:把一次问诊拆成问诊 / 鉴别诊断 / 检验 / 诊断四段分别给奖励,惩罚只归到犯错的那一步;幻觉惩罚按任务奖励软门控,能力不够时先让路。全译正文,附录 A 只留结论
  • DeepSeekMoE —— 把 expert specialization 做到极致:细粒度切分让 16 选 2 的 120 种组合变成 64 选 8 的 44 亿种,shared expert 把公共知识摘出去、消掉 routed expert 之间的冗余;16B 用约 40% 的计算量追平 LLaMA2 7B。全译 33 页正文与附录 A/B/C,7 图 10 表
  • DeepSeek-V2 —— MLA 的出处:KV cache 不再按 head 各存一份 key 和 value,而是压成一个低秩 latent 向量,上投影矩阵能被吸进 query 与输出投影,推理时根本不用把 key 和 value 解出来;RoPE 与这套压缩不兼容,于是另拆一路解耦的 query 和 key 专门承载位置。236B / 21B 激活,KV cache 只剩 DeepSeek 67B 的 6.7%,生成吞吐 5.76 倍。全译 52 页正文与附录 B–G,5 图 37 表

系统与 Infra

  • megatron-core-moe —— Megatron-Core 的 MoE 训练:内存、通信、计算效率三堵墙彼此耦合,压下一堵就把压力推到另一堵;全译 NVIDIA 88 页报告,含 Parallel Folding、FP8/FP4 recipe、长上下文与调优清单
  • MegaScale-MoE —— 和上面那份是同一问题的相反下注:NVIDIA 接受 EP 跨节点、再拿 kernel 把跨机 all-to-all 做快,MegaScale-MoE 干脆把每个 MoE 层整个关进一个节点,让 EP 的 all-to-all 永远只走 NVLink,跨节点只留 PP 和 DP。注意力与 FFN 各配一套并行策略,算子间与算子内两级重叠,通信压到 BF16 / FP8;352B 在 1,440 张 Hopper 上 1.41M tokens/s。全译 17 页 20 图与附录 A.1
  • MegaScale-Omni —— 把多模态训练的资源划分从空间换成时间:encoder 和 LLM 都铺满全部 GPU、各用各的并行策略,负载漂移时只是两段耗时占比自己变,系统不需要感知也不需要重配置;同一个思路在 LSSP 里再用一次,长短样本靠节点在 DP 与 Ulysses SP 之间时分切换。反直觉的一条是「不要贪心填 bubble」——均匀插入牺牲峰值换结构不变形。§7.4 那节千卡踩坑记录比方法部分更稀缺
  • Hybrid-EP —— NVIDIA 版的 MoE 通信 kernel:dispatch / combine 各自把一个 CUDA block 当成一条独立数据通道,warp group 分工跑 pipeline 的不同阶段,NVLink 走 TMA、RDMA 走 IBGDA,combine 的累加按节点内外分两层做。真正的度量单位是 SM——8 卡 H100 上 8 个 SM 打满 NVLink,跨 4 机 4 个 SM 就接近 400 Gbps 网卡上限,GB200 NVL36 上 16 个 SM 打满 NVLink;Megatron Core 里把 DeepEP 换成它,DeepSeek-V3 提速 14%。全译 5 节 10 图 1 表
  • UltraEP —— 上面那些优化的是 all-to-all 这个 kernel,这篇动的是「哪个专家在哪张卡、哪个 token 发给哪个副本」。EPLB 拿历史负载预测下一段,作者的观测是专家热度在 microbatch、层与数据域之间根本不平稳,预测失准时 EPLB 甚至会把不均衡做得更差;于是改成 gate 之后拿精确负载当场解,每层每 microbatch 都重解一次。能塞进热路径靠两件事:quota 当耦合变量把「建副本」和「token 怎么分」一起解,一个 SM 上的 cooperative block 二分搜索 0.111 ms 出解;专家权重按 tile 流式发、热专家的 fan-out 拆成 chunk streaming 的两级 relay。256 卡上做到强制均衡理想吞吐的 94.3%,rank 间不均衡度压到 1.01–1.04。全译 10 节 17 图 3 表 1 算法

Harness

  • harness-engineering —— Lilian Weng 谈 harness engineering:模型和它周围的脚手架是一起被优化的,agent 的能力上限由两者共同决定

技术报告

按发布时间排的基座模型索引,一个月一张表。带 wikilink 的是已经写完的笔记,其余是待读清单。出处一栏就是透明度:arXiv 或官方 PDF 意味着有完整技术报告,官方博客和模型卡意味着只有发布说明。

这张表的上游是 frontier-labs —— 各家发布渠道的清单:一手信息的第一落点在哪个页面,哪些能订阅成 RSS,哪些只能靠 HF 组织页和公众号手动刷。

2023 年

2023 年是零件定型的一年。 后来被反复使用的那几样东西——GQA、滑动窗口、稀疏 MoE、attention sink、状态空间模型——全部在这一年落地,只是当时还没有人把它们装到同一个模型里。开源侧则是从 LLaMA 起步:2 月权重还只对研究者开放,到 12 月 Mixtral 已经是 Apache 2.0 的稀疏 MoE。这一年发布密度低,所以按季度排。

一季度

日期 报告 / 模型 机构 出处 说明
02.27 LLaMA Meta arXiv:2302.13971 7B–65B;把「小模型多喂 token」这件事做实,成了此后两年所有开源基座的起点。权重当时只对研究者开放
03.15 GPT-4 OpenAI arXiv:2303.08774 近百页的报告里没有架构、参数量、数据和训练方法。闭源前沿「只讲能力不讲做法」的传统从这里开始

二季度

日期 报告 / 模型 机构 出处 说明
05.17 PaLM 2 Google arXiv:2305.10403 同样回避了参数量与数据配比
05.22 RWKV RWKV 社区 arXiv:2305.13048 把 RNN 改写成可并行训练的形式。线性注意力这条线最早的一次认真尝试
05.22 GQA Google arXiv:2305.13245 从多头 checkpoint 直接切出分组 KV。此后几乎每个开源基座都靠它压 KV cache,mimo-v2-flash 的 SWA 与 GA 用的都是 GQA

三季度

日期 报告 / 模型 机构 出处 说明
07.18 Llama 2 Meta arXiv:2307.09288 7B–70B,首次商用可用;RLHF 流程写得足够细,成了此后两年对齐配方的公共模板
08.24 Code Llama Meta arXiv:2308.12950 长上下文靠调 RoPE base frequency 外推,这个手法一直沿用到现在
09.19 Baichuan 2 Baichuan arXiv:2309.10305 中文开源基座的早期一档,罕见地放出了训练全过程的中间 checkpoint
09.28 Qwen Alibaba arXiv:2309.16609 通义第一代技术报告
09.29 StreamingLLM MIT 与 Meta arXiv:2309.17453 发现 attention sink:模型会把大量注意力倾倒在开头几个 token 上。mimo-v2-flash 那个可学习的 sink bias 就是从这个观察长出来的

四季度

日期 报告 / 模型 机构 出处 说明
10.10 Mistral 7B Mistral arXiv:2310.06825 滑动窗口注意力第一次进主流开源基座,窗口 4096;Apache 2.0
12.01 Mamba CMU 与普林斯顿 arXiv:2312.00752 选择性状态空间模型;2024 那批 Mamba-Transformer 混合架构的源头
12.11 Mixtral 8x7B Mistral arXiv:2401.04088 稀疏 MoE 第一次以开源权重形式跑通,47B 总参、13B 激活。模型 12.11 发布,报告 2024.01.08
12.19 Gemini 1 Google arXiv:2312.11805 原生多模态;架构细节同样留白

2024 年

2024 年的关键词是稀疏化。 DeepSeek 一年之内把 MoE 的三块地基连着铺完:1 月 DeepSeekMoE 定下细粒度 expert 加共享 expert,5 月 DeepSeek-V2 拿出 MLA,12 月 V3 把它们和 FP8 训练拼成 671B。同期 GRPO(2 月)成了后来所有 RL 的公共起点,MTP(4 月)和 Gated DeltaNet(12 月)则要再等一到两年才被大规模用上。年底 o1 把推理时算力摆上桌,直接引出 2025 年上半年。8 月和 10 月没有值得单列的基座报告,跳过。

1 月

日期 报告 / 模型 机构 出处 说明
01.05 DeepSeek LLM DeepSeek arXiv:2401.02954 DeepSeek 第一代,7B / 67B;自己重做了一遍 scaling law
01.11 DeepSeekMoE DeepSeek arXiv:2401.06066 细粒度 expert 切分加共享 expert 隔离。V3 到 V4 一路沿用,2026 年多数 MoE 仍是这个骨架

2 月

日期 报告 / 模型 机构 出处 说明
02.05 DeepSeekMath DeepSeek arXiv:2402.03300 GRPO 的出处。此后两年几乎所有 RL 训练都是从这里改出来的
02.27 BitNet b1.58 Microsoft arXiv:2402.17764 权重压到 1.58-bit,量化路线的一次极限尝试

3 月

日期 报告 / 模型 机构 出处 说明
03.07 Yi 01.AI arXiv:2403.04652 6B / 34B;报告重心在数据工程
03.08 Gemini 1.5 Google arXiv:2403.05530 1M 上下文加 MoE;长上下文竞赛的发令枪
03.13 Gemma Google arXiv:2403.08295 Google 的开源权重线开张,2B / 7B
03.26 InternLM2 Shanghai AI Lab arXiv:2403.17297 200K 上下文;数据清洗流程写得很细
03.28 Jamba AI21 arXiv:2403.19887 第一个产品级的 Mamba-Transformer 混合,注意力层与 Mamba 层 1:7。2026 年 Nemotron 那条线的前身

4 月

日期 报告 / 模型 机构 出处 说明
04.18 Llama 3 8B / 70B Meta 官方博客 15T token;报告要等到 07.31 随 405B 一起出
04.22 Phi-3 Microsoft arXiv:2404.14219 「教科书级数据」路线,3.8B 打 8B 档
04.30 Multi-Token Prediction Meta arXiv:2404.19737 一次预测多个 token,既提训练质量又能做 self-speculative decoding。mimo-v2-flash 的 MTP 直接引这篇

5 月

日期 报告 / 模型 机构 出处 说明
05.07 DeepSeek-V2 DeepSeek arXiv:2405.04434 236B / 21B;MLA 首发,把 KV cache 压到 GQA 的一小部分。到 2026 年还在被各家当基线
05.31 Mamba-2 CMU 与普林斯顿 arXiv:2405.21060 状态空间与注意力的对偶(SSD);kimi-k3 的 KDA 往上追就是这条线

6 月

日期 报告 / 模型 机构 出处 说明
06.17 Nemotron-4 340B NVIDIA arXiv:2406.11704 340B 稠密;后训练数据 98% 是合成的
06.18 ChatGLM Z.ai 与清华 arXiv:2406.12793 从 GLM-130B 到 GLM-4 的整条线复盘

7 月

日期 报告 / 模型 机构 出处 说明
07.15 Qwen2 Alibaba arXiv:2407.10671 0.5B–72B,外加一个 57B-A14B 的 MoE
07.23 Llama 3.1 405B Meta arXiv:2407.21783 15.6T token,405B 稠密;那份 92 页报告是当时公开度最高的旗舰级材料。模型 07.23 发布,报告 07.31
07.31 Gemma 2 Google arXiv:2408.00118 9B / 27B;局部与全局注意力 1:1 交错,Gemma 3 的 5:1 是从这里推上去的

9 月

日期 报告 / 模型 机构 出处 说明
09.03 OLMoE AI2 arXiv:2409.02060 完全开放的 MoE,数据与训练过程一并公开
09.18 Qwen2.5-Coder Alibaba arXiv:2409.12186 5.5T token 的代码续训

11 月

日期 报告 / 模型 机构 出处 说明
11.04 Hunyuan-Large Tencent arXiv:2411.02265 389B / 52B,当时最大的开源 MoE
11.20 DeepSeek-R1-Lite-Preview DeepSeek 官方博客 R1 的预告版,第一次展示 o1 式长思考。只有博客
11.28 QwQ-32B-Preview Alibaba 官方博客 开源侧第一个能打的推理模型

12 月

日期 报告 / 模型 机构 出处 说明
12.09 Gated DeltaNet NVIDIA 与 MIT arXiv:2412.06464 给 Mamba2 加 delta rule 和门控。Qwen3-Next 与 2026 年的 Qwen3.5 用的就是它
12.12 Phi-4 Microsoft arXiv:2412.08905 14B;合成数据占比过半
12.19 Qwen2.5 Alibaba arXiv:2412.15115 18T token;模型 09.19 发布,报告 12.19
12.27 deepseek-v3 DeepSeek arXiv:2412.19437 671B / 37B 激活;MLA 加 DeepSeekMoE、FP8 训练、DualPipe。2026 年多数架构讨论的共同基线
12.31 OLMo 2 AI2 arXiv:2501.00656 7B / 13B 全开;模型 11.26 发布,报告年底才挂出

闭源前沿

2023 到 2024 年这批闭源旗舰里,GPT-4、PaLM 2、Gemini 1 和 Gemini 1.5 都有正式报告(虽然架构细节大多留白),已经列进上面的表;这张表放的是只有 card、或者连 card 都没有的。

这一批没有一份文档的标题里写着 System Card——Anthropic 全都叫 Model Card 或 Addendum,是官方后来才把它们统一归档到 /system-cards 下面。

日期 模型 机构 出处 说明
2023.03.14 Claude 1 Anthropic 发布博客 没有 model card,只在 7 月那份合并文档的评测对比里被提到
2023.07.11 Claude 2 Anthropic Model Card 《Model Card and Evaluations for Claude Models》,一份覆盖 Claude 1.3 / 2 / Instant 1.1
2023.11.06 GPT-4 Turbo OpenAI 发布博客 没有自己的 system card,安全说明由 GPT-4(60 页)和 GPT-4V(18 页)两份覆盖。当天上线的其实是 preview,稳定版要等到 2024.04
2023.11.21 Claude 2.1 Anthropic Model Card Claude 2 那份第 14 页起的附录。文档明说「不是新的基座模型,所以只给附录」
2024.02.08 Gemini 1.0 Ultra 上线 Google 技术报告 §10.1 没有独立 model card,Google 官方索引页指向的就是技术报告第 71 页那节附录
2024.03.04 Claude 3 Opus / Sonnet / Haiku Anthropic Model Card 三个模型共用。排版像技术报告,但全文 architecture 出现 0 次、没有参数量。这个 slug 现在给的是并了两份 addendum 的 64 页版,要 2024.03 的 42 页原版得用固定哈希
2024.03.17 Grok-1 开源权重 xAI 发布博客 · 权重 314B MoE 的未微调 base checkpoint,Apache 2.0,没有技术报告。那份 Grok-1 model card 描述的是 2023.11 的对话版,不是这个 checkpoint
2024.05.13 GPT-4o OpenAI System Card 33 页;模型 05.13 发布,card 拖到 08.08
2024.06.20 Claude 3.5 Sonnet Anthropic Addendum 8 页增补而非独立 card。文档署 06.20,博客页显示 06.21
2024.08.13 Grok-2 beta xAI 发布博客 确认没有 model card。权重要等到 2025.08.24 才以 xAI Community License 放出
2024.09.12 o1-preview OpenAI System Card 42 页。HTML 页已被就地覆盖成 12.05 版,只有这份带版本号的 PDF 还冻结着 preview 的内容
2024.10.22 Claude 3.5 Haiku 与升级版 3.5 Sonnet Anthropic Addendum 14 页,两个模型共用;computer use 首次登场
2024.12.05 o1 OpenAI System Card 52 页,12.19 之后又补过一节。不带版本号的 o1-system-card.pdf 返回的还是 9 月版,别用
2024.12.11 Gemini 2.0 Flash Experimental Google Model Card 发布时没有 card,2025.04.15 才补。2025 年表里 02.05 正式版指向的是同一份文档

2025 年

2025 年的主线在年中换了一次。 上半年属于推理:1 月 DeepSeek-R1 证明不用 SFT、纯 RL 也能长出推理链,此后半年几乎每一家都在复现这条路。下半年重心转向 agent 与效率:7 月 Kimi K2 把 agentic 当作发布的主标题,9 月 DeepSeek-V3.2-Exp 用 DSA 把稀疏注意力真正落进旗舰模型——这一步直接定义了 2026 全年。真正的分岔点其实在 2 月:NSA 和 MoBA 前后脚挂出,稀疏注意力的两条路线那时就分好了。

1 月

日期 报告 / 模型 机构 出处 说明
01.14 MiniMax-01 MiniMax arXiv:2501.08313 456B / 45.9B 激活;Lightning Attention 与 softmax 注意力 7:1 混合,4M 上下文。线性注意力第一次做到旗舰规模
01.20 DeepSeek-R1 DeepSeek arXiv:2501.12948 671B / 37B;R1-Zero 证明跳过 SFT、纯 RL 也能长出推理链。模型 01.20 发布,报告 01.22
01.22 Kimi k1.5 Moonshot arXiv:2501.12599 与 R1 同日挂出的另一条 RL 路线:不用价值网络和 MCTS,靠上下文长度做 scaling,再把 long-CoT 蒸回 short-CoT
01.22 Doubao-1.5-pro ByteDance 官方博客 稀疏 MoE,宣称 7 倍稠密等效;只有发布说明
01.26 Qwen2.5-1M Alibaba arXiv:2501.15383 7B / 14B 上到 1M 上下文;双块注意力加渐进式扩窗

2 月

日期 报告 / 模型 机构 出处 说明
02.16 Native Sparse Attention DeepSeek arXiv:2502.11089 硬件对齐、可原生训练的稀疏注意力;粗粒度压缩加细粒度选择。2026 那条主线的源头
02.18 MoBA Moonshot arXiv:2502.13189 块稀疏注意力,与 NSA 前后脚。区别是能在全注意力与稀疏之间无缝切换,已在 Kimi 线上验证过
02.19 Qwen2.5-VL Alibaba arXiv:2502.13923 动态分辨率加绝对时间编码,把 VL 拉到与文本旗舰同代

3 月

日期 报告 / 模型 机构 出处 说明
03.03 Phi-4-Mini Microsoft arXiv:2503.01743 3.8B;用 Mixture-of-LoRAs 挂多模态
03.12 Gemma 3 Google arXiv:2503.19786 1B–27B 四档;局部与全局注意力 5:1 交错,128K。滑窗混合比在开源侧第一次给到这么激进;模型 03.12 发布,报告 03.25
03.13 Command A Cohere arXiv:2504.00698 111B 稠密,企业向;模型 03.13 发布,报告 04.01
03.24 DeepSeek-V3-0324 DeepSeek 模型卡 V3 的增量更新,没出报告
03.26 Qwen2.5-Omni Alibaba arXiv:2503.20215 Thinker-Talker 架构,端到端全模态

4 月

日期 报告 / 模型 机构 出处 说明
04.05 Llama 4 Scout / Maverick Meta 官方博客 Meta 首个 MoE 旗舰,17B 激活,宣称 10M 上下文。没有技术报告,Behemoth 最终没发出来
04.10 Kimi-VL Moonshot arXiv:2504.07491 2.8B 激活的 MoE 视觉语言模型
04.16 BitNet b1.58 2B4T Microsoft arXiv:2504.12285 首个原生 1.58-bit 训练、规模到 2B 的开源权重模型,4T token
04.29 Qwen3 Alibaba arXiv:2505.09388 0.6B–235B 八档,36T token;thinking 与 non-thinking 双模合一。模型 04.29 发布,报告 05.14
04.30 MiMo-7B Xiaomi arXiv:2505.07608 小米第一代,25T token 加 MTP,7B 做 RL 对标 32B。mimo-v2-flash 的预训练配方就沿用这套
04.30 Phi-4-reasoning Microsoft arXiv:2504.21318 14B;精选 SFT 加少量 RL 就能进 o1-mini 档

5 月

日期 报告 / 模型 机构 出处 说明
05.14 Insights into DeepSeek-V3 DeepSeek arXiv:2505.09343 不是新模型,是 deepseek-v3 的硬件—模型协同设计复盘:MLA、FP8、多平面网络各自的取舍
05.16 MegaScale-MoE ByteDance Seed arXiv:2505.11432 不是模型报告,是 MoE 训练系统:把每个 MoE 层整个关进一个节点,EP 的 all-to-all 只走 NVLink;352B 在 1,440 张 Hopper 上 1.41M tokens/s,比 Megatron-LM 快 1.88 倍
05.28 DeepSeek-R1-0528 DeepSeek 模型卡 R1 的增量更新,思考长度大致翻倍

6 月

日期 报告 / 模型 机构 出处 说明
06.12 Magistral Mistral arXiv:2506.10910 Mistral 首个推理模型;纯 RL 把 AIME-24 pass@1 从 26.8 拉到 73.6,报告罕见地把失败实验也写了
06.16 MiniMax-M1 MiniMax arXiv:2506.13585 456B / 45.9B;Lightning Attention 混合加 CISPO,1M 上下文,RL 全程只花 53.5 万美元
06.27 Hunyuan-A13B Tencent 官方 PDF 80B / 13B,256K;1 个共享加 64 个路由 expert 取 8,20T token
06.30 ERNIE 4.5 Baidu 官方 PDF 10 个变体,最大 424B / 47B;异构多模态 MoE,预训练 MFU 47%,Apache 2.0

7 月

日期 报告 / 模型 机构 出处 说明
07.07 Gemini 2.5 Google arXiv:2507.06261 闭源模型里少见的正式报告,尽管训练细节仍大面积留白。之所以进月度表而不是下面的闭源前沿,就是因为它确实有报告
07.11 Kimi K2 Moonshot arXiv:2507.20534 1T / 32B;MuonClip 稳住 15.5T token 预训练,大规模合成 agentic 数据。模型 07.11 发布,报告 07.28
07.25 Step-3 StepFun arXiv:2507.19427 321B / 38B;MFA 加注意力—FFN 解耦(AFD),模型与系统协同设计压解码成本
07.28 GLM-4.5 Z.ai arXiv:2508.06471 355B / 32B;agentic、reasoning、coding 三合一(ARC)。模型 07.28 发布,报告 08.08

8 月

日期 报告 / 模型 机构 出处 说明
08.05 gpt-oss-120b / 20b OpenAI arXiv:2508.10925 OpenAI 时隔六年的开源权重;滑窗与全局 1:1 交错,加可学习的 attention sink。mimo-v2-flash 的 sink bias 直接沿用这套
08.20 Nemotron Nano 2 NVIDIA arXiv:2508.14444 9B Mamba-Transformer 混合;连预训练数据集一起开源
08.20 Seed-OSS-36B ByteDance 模型卡 36B 稠密,512K;可控 thinking budget
08.21 DeepSeek-V3.1 DeepSeek 模型卡 混合思考模式,840B token 长上下文续训;没出报告
08.21 Intern-S1 Shanghai AI Lab arXiv:2508.15763 241B / 28B 科学多模态基座

9 月

日期 报告 / 模型 机构 出处 说明
09.01 LongCat-Flash Meituan arXiv:2509.01322 560B,按 token 动态激活 18.6–31.3B;零计算 expert 加 ScMoE
09.09 Qwen3-Next-80B-A3B Alibaba 模型卡 80B / 3B,激活率 3.7%;Gated DeltaNet 与门控注意力 3:1 混合。Qwen 转线性注意力的起点,2026 年的 Qwen3.5 沿用同一套 3:1
09.22 Qwen3-Omni Alibaba arXiv:2509.17765 文本 / 图像 / 音频 / 视频同一套 Thinker-Talker
09.23 LongCat-Flash-Thinking Meituan arXiv:2509.18883 在 Flash 上加推理与 agentic RL;配 DORA 异步 RL 框架
09.29 DeepSeek-V3.2-Exp DeepSeek 官方 PDF 在 V3.1-Terminus 上续训接 DSA:lightning indexer 打分加 top-k 选择,注意力复杂度从 O(L²) 降到 O(Lk)。2026 全年的起点
09.30 GLM-4.6 Z.ai 模型卡 357B,200K 上下文;这一版没配报告

10 月

日期 报告 / 模型 机构 出处 说明
10.09 Ling-1T Ant Group 模型卡 1T / 约 50B 激活,20T token,128K,MIT 协议;完整报告 10.25 才随 Ling 2.0 补上
10.13 Rollout Routing Replay Xiaomi 与北大 arXiv:2510.11370 让 MoE 的 RL 训练复用 rollout 时的 routed expert,消掉训推路由不一致导致的崩溃。作者与 mimo-v2-flash 高度重叠,后者的 RL infra 直接把它作为 R3 模块用上
10.21 Ring-1T Ant Group arXiv:2510.18855 万亿级思考模型怎么做 RL;IcePop 稳训练加 ASystem 框架。preview 版 9 月就放了出来,mimo-v2-flash 的 MOPD 引的就是 IcePop
10.25 Ling 2.0 Ant Group arXiv:2510.22115 Ling 2.0 家族的完整报告,1/32 激活率下的 MoE scaling law
10.27 MiniMax-M2 MiniMax 模型卡 230B / 10B,agent 向;报告要等到 2026.05.26 才随 M2 系列一起出
10.30 Kimi Linear Moonshot arXiv:2510.26692 KDA(Kimi Delta Attention)与 MLA 3:1 混合,KV cache 降 75%。kimi-k3 两大支柱之一的前身

11 月

日期 报告 / 模型 机构 出处 说明
11.06 Kimi K2 Thinking Moonshot 模型卡 1T / 32B,256K;原生 INT4 QAT,能连着跑 200–300 轮工具调用。没出报告
11.26 Qwen3-VL Alibaba arXiv:2511.21631 Qwen3 视觉版的完整报告
11.27 DeepSeekMath-V2 DeepSeek arXiv:2511.22570 自验证的数学推理;IMO 2025 拿到金牌分数线

12 月

日期 报告 / 模型 机构 出处 说明
12.02 DeepSeek-V3.2 DeepSeek arXiv:2512.02556 V3.2-Exp 的正式版报告:DSA 加可 scale 的 RL 框架;高算力档 V3.2-Speciale 拿下 IMO 与 IOI 双金
12.15 Olmo 3 AI2 arXiv:2512.13961 7B / 32B,数据、代码、中间 checkpoint 全开。透明度这一栏的天花板
12.23 MiniMax-M2.1 MiniMax 模型卡 M2 的增量更新

闭源前沿

同 2026 年的口径,只有 system card 或 model card 的不进月度表。Gemini 2.5 两边都占:3 月的 model card 在这张表,7 月那份正式 arXiv 报告在月度表里。

日期 模型 机构 出处 说明
01.31 o3-mini OpenAI System Card
02.05 Gemini 2.0 Flash Google Model Card 没有「Gemini 2.0」整体 card,按变体拆开发;card 本身 04.15 才挂出,Pro 档始终没有
02.19 Grok 3 xAI 发布博客 全年唯一没有 model card 的,安全说明后来并进 Grok 4 那份。02.17 是发布会直播,博客署期 02.19
02.24 Claude 3.7 Sonnet Anthropic System Card 43 页;首个 hybrid reasoning
02.27 GPT-4.5 OpenAI System Card 官方定位 research preview,Orion 只是内部代号
03.25 Gemini 2.5 Pro Google Model Card 21 页;线上这份已是 06.27 修订版,初版被覆盖
04.14 GPT-4.1 OpenAI 发布博客 没有 system card。OpenAI 公开表态过「不是前沿模型,不会单独发」
04.16 o3 / o4-mini OpenAI System Card 两个模型共用一份
05.22 Claude Opus 4 / Sonnet 4 Anthropic System Card 124 页,两个模型共用一份
07.09 Grok 4 xAI Model Card 8 页;模型 07.09 发布,card 拖到 08.20 才补
08.05 Claude Opus 4.1 Anthropic System Card 23 页,是 Claude 4 那份的增补附录而非独立 card
08.07 GPT-5 OpenAI System Card PDF 内页署 08.13,那是改版日期
09.29 Claude Sonnet 4.5 Anthropic System Card 149 页
10.15 Claude Haiku 4.5 Anthropic System Card 39 页
11.12 GPT-5.1 OpenAI System Card 标题里就写着 Addendum,是 GPT-5 那份的附录,只补了心理健康与情感依赖两类评估
11.17 Grok 4.1 xAI Model Card 6 页
11.18 Gemini 3 Pro Google Model Card 10 页;线上已换成 2026.05 修订版
11.24 Claude Opus 4.5 Anthropic System Card 153 页

Anthropic 和 Google 一律用官方短链,不用 CDN 直链:两家都会把同一份 card 静默替换成新修订版(Claude 4 已从 123 页变成 124 页,Gemini 3 Pro 线上是 2026.05 版),直链会指向旧文件或失效。xAI 相反,data.x.ai 的文件名自带日期,是不可变快照,直接存就行。

2026 年

贯穿 2026 年的主线是稀疏注意力。 DeepSeek 2025 年底用 DSA 开了口子,此后每一家的「1M 上下文」都是自研一版稀疏注意力换来的:GLM-5 直接采用 DSA,GLM-5.2 用 IndexCache 把 indexer 四层复用一次,MiniMax 做 MSA,美团做 LSA,DeepSeek 自己换成 CSA+HCA,Kimi K3 转向 KDA 线性注意力。横向对比这几种设计,是这批报告里最值得单独写一篇的题目。

1 月

日期 报告 / 模型 机构 出处 说明
01.02 mimo-v2-flash Xiaomi arXiv:2601.02780 309B / 15B 激活;滑窗与全局注意力 5:1 混合
01.08 Ministral 3 Mistral arXiv:2601.08584 3B / 8B / 14B 三档,级联蒸馏,均支持图像输入
01.09 Step3-VL-10B StepFun arXiv:2601.09668 10B 视觉语言模型;PaCoRe 把测试时算力投向并行视觉假设而非更长思维链
01.23 LongCat-Flash-Thinking-2601 Meituan arXiv:2601.16725 560B / 27B 推理模型;自动扩展出 1 万+ 可验证工具环境、覆盖 20+ 领域做多域 RL,BrowseComp 73.1

2 月

日期 报告 / 模型 机构 出处 说明
02.02 Kimi K2.5 Moonshot arXiv:2602.02276 1T / 32B;Agent Swarm 自导向并行编排,宽搜延迟降 4.5 倍
02.04 ERNIE 5.0 Baidu arXiv:2602.04705 2.4T 原生多模态 MoE;模型本体 01.22 已发布
02.06 Baichuan-M3 Baichuan arXiv:2602.06570 235B 医疗方向;纯后训练报告,不谈架构与预训练
02.10 step-3-5-flash StepFun arXiv:2602.10604 196B / 11B;SWA 与全局 3:1 加 MTP-3
02.12 MiniMax-M2.5 MiniMax 官方博客 agent-native 中间款;SWE-Bench Verified 80.2,BrowseComp 76.3
02.14 Doubao-Seed-2.0 ByteDance 官方博客 官方系列名 Seed2.0;Pro / Lite / Mini / Code 四档,EgoTempo 上视频理解首次超过人类
02.16 Qwen3.5 Alibaba 官方博客 397B-A17B;Gated DeltaNet 与全注意力 3:1 交替
02.16 Ling 2.5 / Ring 2.5 Ant Group 模型卡 1T / 63B 激活,预训练语料从 20T 扩到 29T tokens
02.17 GLM-5 Z.ai arXiv:2602.15763 744B / 40B;采用 DSA 加异步 agent RL;模型 02.11 发布

3 月

日期 报告 / 模型 机构 出处 说明
03.08 Megatron-Core MoE NVIDIA arXiv:2603.07685 不是模型报告,是训练栈自己的报告:88 页讲 MoE 的内存 / 通信 / 计算三堵墙怎么破,DeepSeek-V3 在 GB300 上做到 1,233 TFLOPS/GPU
03.12 IndexCache Z.ai 与清华 arXiv:2603.12201 跨层复用稀疏注意力 indexer,30B DSA 模型上砍掉 75% indexer 计算;GLM-5.2 落地时改称 IndexShare
03.16 Attention Residuals Moonshot arXiv:2603.15031 · 代码 跨深度的注意力残差;半年后成为 Kimi K3 两大架构支柱之一
03.16 Mistral Small 4 Mistral 官方博客 119B / 6.5B 激活,128 专家取 4,256K 上下文,Apache 2.0
03.18 MiniMax-M2.7 MiniMax 官方博客 M2 系列末代,首次让模型参与自身迭代;细节两个月后并入 M2 系列报告
03.18 MiMo-V2-Pro Xiaomi 官方博客 1T / 42B 激活,1M 上下文;纯 API 发布,没有开源权重
03.29 LongCat-Next Meituan arXiv:2603.27538 把各模态统一词元化为离散 token;dNaViT 视觉 tokenizer 用 SAE + RVQ 兼顾理解与生成

4 月

日期 报告 / 模型 机构 出处 说明
04.07 GLM-5.1 Z.ai 官方博客 754B 加 DSA;SWE-Bench Pro 58.4,支持 8 小时自主执行
04.12 Nemotron 3 Super NVIDIA arXiv:2604.12374 120B / 12B Mamba-Attention MoE;三件首发:25T token 全程 NVFP4 预训练、LatentMoE 替掉标准 MoE 层、原生 MTP 头做投机解码
04.16 Qwen3.6-35B-A3B Alibaba 模型卡 Qwen3.6 的首个开源权重档,主打 agentic coding
04.17 Qwen3.5-Omni Alibaba arXiv:2604.15804 Thinker 和 Talker 两端都换成 Hybrid MoE,256k 上下文吃 10 小时音频 / 400 秒 720P 视频;ARIA 用累计语音-文本比例约束把双通道生成并成单流,补上流式合成的稳定性与韵律;215 项音频与视听子任务 SOTA
04.20 Kimi K2.6 Moonshot 官方博客 架构沿用 K2.5;Agent Swarm 从 100 子 agent / 1500 步扩到 300 / 4000
04.22 Qwen3.6-27B Alibaba 模型卡 27B dense,对标旗舰级编码能力
04.23 Hy3 preview Tencent 模型卡 295B / 21B,256K;混元首个 agent 导向旗舰,腾讯混元社区协议
04.24 deepseek-v4 DeepSeek arXiv:2606.19348 Pro 1.6T/49B 加 Flash 284B/13B;CSA+HCA 混合注意力、mHC 残差、Muon。04.24 随 HF 上的 PDF 发布,arXiv 版 6 月才挂出
04.29 Ling-2.6 Ant Group 模型卡 1T;完整报告要等到 06.13 才随 2.6 家族补上

5 月

日期 报告 / 模型 机构 出处 说明
05.09 ERNIE 5.1 Baidu 官方博客 继承 5.0,总参压到约 1/3、激活约 1/2,预训练成本约为同规模模型的 6%
05.09 MegaScale-Omni ByteDance Seed 与上海交大 arXiv:2605.08962 同样不是模型报告而是训练栈报告:多模态训练里 encoder 与 LLM 的资源划分从空间改成时间复用,千卡生产集群 8M tokens/s。SOSP 收录
05.20 Qwen3.7-Max Alibaba 官方博客 闭源 agent 旗舰。上下文口径不一致:官方 benchmark 用 256K,1M 只见于二手报道
05.26 The MiniMax-M2 Series MiniMax arXiv:2605.26494 229.9B / 9.8B;Forge agent RL;M2.7 展示早期自演化
05.29 Step-3.7-Flash StepFun 官方博客 198B / 11B,256K,Apache 2.0 性价比档

6 月

日期 报告 / 模型 机构 出处 说明
06.01 minimax-m3 MiniMax 模型卡 · 官方博客 428B / 23B,1M 上下文,原生多模态;训练配方与数据未公开
06.04 Nemotron 3 Ultra NVIDIA arXiv:2606.15007 · 官方 PDF 550B / 55B Mamba-Attention MoE,1M 上下文;模型 06.04 发布,报告 06.09。20T token 全程 NVFP4 预训练里两次 loss 发散的复盘;MOPD 把十余个领域 teacher 蒸馏进一个 student;MTP Boosting 专治起草头的训推不匹配
06.11 minimax-sparse-attention MiniMax arXiv:2606.13392 M3 唯一的正式报告,只覆盖注意力本体,且在另一个 109B 模型上验证
06.13 Ling and Ring 2.6 Ant Group arXiv:2606.15079 1T;不重训,在 Ling-2.0 的 checkpoint 上把 GQA 换成 Lightning Attention 加 MLA 7:1,靠 QK Norm 吸收和 Partial RoPE 适配把架构移植做成可恢复的;Ring 用 KPop 做 agent RL,二元 KL 替掉 IcePop 的固定比值
06.16 glm-5-2 Z.ai 官方博客 753B,MIT 许可;上下文 200K→1M;落地 IndexCache(官方叫 IndexShare),每 4 层共享一个 indexer,1M 下 FLOPs 降 2.9 倍;MTP 也用上 IndexShare 加 KVShare,acceptance length +20%。06.13 先向 Coding Plan 用户推送
06.30 LongCat-2.0 Meituan 官方博客 1.6T / 48B 动态激活;LongCat Sparse Attention;5 万卡国产 ASIC 全程训练。没出技术报告,博客是唯一官方材料

7 月

日期 报告 / 模型 机构 出处 说明
07.06 Hy3 Tencent 模型卡 4 月 preview 之后重新后训练的正式版,改用 Apache 2.0
07.19 Qwen3.8-Max-Preview Alibaba 阿里云产品文档 2.4T。没有模型卡、没有 benchmark、没有发布博客,这条产品文档是唯一能证明它存在的官方材料
07.27 kimi-k3 Moonshot arXiv:2607.24653 2.8T / 104B;KDA 加 Attention Residuals 加 Stable LatentMoE,scaling 效率比 K2 提升约 2.5 倍

闭源前沿

只有 system card 或 model card,没有训练细节,所以不进上面的月度表。列在这里是因为它们是开源报告的对照基线——Kimi K3 的对比对象就是 Claude Fable 5 和 GPT-5.6 Sol。

日期 模型 机构 出处 说明
02.05 Claude Opus 4.6 Anthropic System Card 213 页
02.17 Claude Sonnet 4.6 Anthropic System Card 135 页
02.19 Gemini 3.1 Pro Google Model Card ARC-AGI-2 77.1,SWE-Bench Verified 80.6
03.05 GPT-5.4 Thinking OpenAI System Card 官方全名带 Thinking;03.17 补了 mini 附录,04.24 又改过一版
04.07 Claude Mythos Preview Anthropic System Card 245 页;Opus 4.7 与 4.8 的 system card 都拿它当能力上限的参照系
04.16 Claude Opus 4.7 Anthropic System Card 232 页
04.23 GPT-5.5 OpenAI System Card 1M 上下文(API 文档写 1,050,000)。参数量官方从未公开,流传的 9.7T 是第三方外推,区间 3.2T–28.7T
05.19 Gemini 3.5 Flash Google Model Card 06.24 起 computer use 从独立模型改为它的内置工具
05.28 Claude Opus 4.8 Anthropic System Card 246 页
06.09 Claude Fable 5 / Mythos 5 Anthropic System Card 317 页,两个模型共用一份。06.12 因美国出口管制全球下架,06.30 宣布解禁,07.01 实际恢复
06.26 GPT-5.6 Preview OpenAI System Card 受政府要求,只对约 20 家审核过的合作方开放;与 GA 版是两份不同的 card
06.30 Claude Sonnet 5 Anthropic System Card 146 页
07.08 Grok 4.5 SpaceXAI Model Card 23 页,card 署期 07.14。07.06 xAI 更名 SpaceXAI,x.ai 域名未迁移
07.09 GPT-5.6 Sol / Terra / Luna OpenAI System Card 三个变体共用一份。Sol 旗舰,Terra 半价对标 5.5,Luna 最快最省。这一代不再有 openai.com/index/ 下的 card 页
07.24 Claude Opus 5 Anthropic System Card 194 页