Digest
模型与算法
- Llama 2 —— 开放基座模型与微调对话模型:RLHF 那一段写得比同期任何报告都细,reward model 拆成 helpfulness 与 safety 两个、rejection sampling 与 PPO 串联、GAtt 修多轮 system message,成了此后两年对齐配方的公共模板;全译 77 页正文与附录 A
- 大模型架构大对比 —— 从 DeepSeek V3 到 Gemma 4:Sebastian Raschka 连载九个月的架构横切面,23 个旗舰开源模型只拆结构、不谈 benchmark 和训练算法,看 MLA、MoE 粒度、滑窗与全局注意力的混合比、NoPE、QK-Norm、线性注意力这几条线怎么一家家扩散开的;全译 23 节 66 图
- 推理努力度是怎么训出来的 —— 推理努力度是怎么训出来的:low/medium/high 这个旋钮在推理侧只是一句 system prompt,在训练侧是三条可叠加的路线;硬性 token 预算是另一件事
- Baichuan-M3 —— 为可靠的医疗决策建模临床问诊:把一次问诊拆成问诊 / 鉴别诊断 / 检验 / 诊断四段分别给奖励,惩罚只归到犯错的那一步;幻觉惩罚按任务奖励软门控,能力不够时先让路。全译正文,附录 A 只留结论
- DeepSeekMoE —— 把 expert specialization 做到极致:细粒度切分让 16 选 2 的 120 种组合变成 64 选 8 的 44 亿种,shared expert 把公共知识摘出去、消掉 routed expert 之间的冗余;16B 用约 40% 的计算量追平 LLaMA2 7B。全译 33 页正文与附录 A/B/C,7 图 10 表
- DeepSeek-V2 —— MLA 的出处:KV cache 不再按 head 各存一份 key 和 value,而是压成一个低秩 latent 向量,上投影矩阵能被吸进 query 与输出投影,推理时根本不用把 key 和 value 解出来;RoPE 与这套压缩不兼容,于是另拆一路解耦的 query 和 key 专门承载位置。236B / 21B 激活,KV cache 只剩 DeepSeek 67B 的 6.7%,生成吞吐 5.76 倍。全译 52 页正文与附录 B–G,5 图 37 表
系统与 Infra
- megatron-core-moe —— Megatron-Core 的 MoE 训练:内存、通信、计算效率三堵墙彼此耦合,压下一堵就把压力推到另一堵;全译 NVIDIA 88 页报告,含 Parallel Folding、FP8/FP4 recipe、长上下文与调优清单
- MegaScale-MoE —— 和上面那份是同一问题的相反下注:NVIDIA 接受 EP 跨节点、再拿 kernel 把跨机 all-to-all 做快,MegaScale-MoE 干脆把每个 MoE 层整个关进一个节点,让 EP 的 all-to-all 永远只走 NVLink,跨节点只留 PP 和 DP。注意力与 FFN 各配一套并行策略,算子间与算子内两级重叠,通信压到 BF16 / FP8;352B 在 1,440 张 Hopper 上 1.41M tokens/s。全译 17 页 20 图与附录 A.1
- MegaScale-Omni —— 把多模态训练的资源划分从空间换成时间:encoder 和 LLM 都铺满全部 GPU、各用各的并行策略,负载漂移时只是两段耗时占比自己变,系统不需要感知也不需要重配置;同一个思路在 LSSP 里再用一次,长短样本靠节点在 DP 与 Ulysses SP 之间时分切换。反直觉的一条是「不要贪心填 bubble」——均匀插入牺牲峰值换结构不变形。§7.4 那节千卡踩坑记录比方法部分更稀缺
- Hybrid-EP —— NVIDIA 版的 MoE 通信 kernel:dispatch / combine 各自把一个 CUDA block 当成一条独立数据通道,warp group 分工跑 pipeline 的不同阶段,NVLink 走 TMA、RDMA 走 IBGDA,combine 的累加按节点内外分两层做。真正的度量单位是 SM——8 卡 H100 上 8 个 SM 打满 NVLink,跨 4 机 4 个 SM 就接近 400 Gbps 网卡上限,GB200 NVL36 上 16 个 SM 打满 NVLink;Megatron Core 里把 DeepEP 换成它,DeepSeek-V3 提速 14%。全译 5 节 10 图 1 表
- UltraEP —— 上面那些优化的是 all-to-all 这个 kernel,这篇动的是「哪个专家在哪张卡、哪个 token 发给哪个副本」。EPLB 拿历史负载预测下一段,作者的观测是专家热度在 microbatch、层与数据域之间根本不平稳,预测失准时 EPLB 甚至会把不均衡做得更差;于是改成 gate 之后拿精确负载当场解,每层每 microbatch 都重解一次。能塞进热路径靠两件事:quota 当耦合变量把「建副本」和「token 怎么分」一起解,一个 SM 上的 cooperative block 二分搜索 0.111 ms 出解;专家权重按 tile 流式发、热专家的 fan-out 拆成 chunk streaming 的两级 relay。256 卡上做到强制均衡理想吞吐的 94.3%,rank 间不均衡度压到 1.01–1.04。全译 10 节 17 图 3 表 1 算法
Harness
- harness-engineering —— Lilian Weng 谈 harness engineering:模型和它周围的脚手架是一起被优化的,agent 的能力上限由两者共同决定
技术报告
按发布时间排的基座模型索引,一个月一张表。带 wikilink 的是已经写完的笔记,其余是待读清单。出处一栏就是透明度:arXiv 或官方 PDF 意味着有完整技术报告,官方博客和模型卡意味着只有发布说明。
这张表的上游是 frontier-labs —— 各家发布渠道的清单:一手信息的第一落点在哪个页面,哪些能订阅成 RSS,哪些只能靠 HF 组织页和公众号手动刷。
2023 年
2023 年是零件定型的一年。 后来被反复使用的那几样东西——GQA、滑动窗口、稀疏 MoE、attention sink、状态空间模型——全部在这一年落地,只是当时还没有人把它们装到同一个模型里。开源侧则是从 LLaMA 起步:2 月权重还只对研究者开放,到 12 月 Mixtral 已经是 Apache 2.0 的稀疏 MoE。这一年发布密度低,所以按季度排。
一季度
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 02.27 | LLaMA | Meta | arXiv:2302.13971 | 7B–65B;把「小模型多喂 token」这件事做实,成了此后两年所有开源基座的起点。权重当时只对研究者开放 |
| 03.15 | GPT-4 | OpenAI | arXiv:2303.08774 | 近百页的报告里没有架构、参数量、数据和训练方法。闭源前沿「只讲能力不讲做法」的传统从这里开始 |
二季度
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 05.17 | PaLM 2 | arXiv:2305.10403 | 同样回避了参数量与数据配比 | |
| 05.22 | RWKV | RWKV 社区 | arXiv:2305.13048 | 把 RNN 改写成可并行训练的形式。线性注意力这条线最早的一次认真尝试 |
| 05.22 | GQA | arXiv:2305.13245 | 从多头 checkpoint 直接切出分组 KV。此后几乎每个开源基座都靠它压 KV cache,mimo-v2-flash 的 SWA 与 GA 用的都是 GQA |
三季度
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 07.18 | Llama 2 | Meta | arXiv:2307.09288 | 7B–70B,首次商用可用;RLHF 流程写得足够细,成了此后两年对齐配方的公共模板 |
| 08.24 | Code Llama | Meta | arXiv:2308.12950 | 长上下文靠调 RoPE base frequency 外推,这个手法一直沿用到现在 |
| 09.19 | Baichuan 2 | Baichuan | arXiv:2309.10305 | 中文开源基座的早期一档,罕见地放出了训练全过程的中间 checkpoint |
| 09.28 | Qwen | Alibaba | arXiv:2309.16609 | 通义第一代技术报告 |
| 09.29 | StreamingLLM | MIT 与 Meta | arXiv:2309.17453 | 发现 attention sink:模型会把大量注意力倾倒在开头几个 token 上。mimo-v2-flash 那个可学习的 sink bias 就是从这个观察长出来的 |
四季度
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 10.10 | Mistral 7B | Mistral | arXiv:2310.06825 | 滑动窗口注意力第一次进主流开源基座,窗口 4096;Apache 2.0 |
| 12.01 | Mamba | CMU 与普林斯顿 | arXiv:2312.00752 | 选择性状态空间模型;2024 那批 Mamba-Transformer 混合架构的源头 |
| 12.11 | Mixtral 8x7B | Mistral | arXiv:2401.04088 | 稀疏 MoE 第一次以开源权重形式跑通,47B 总参、13B 激活。模型 12.11 发布,报告 2024.01.08 |
| 12.19 | Gemini 1 | arXiv:2312.11805 | 原生多模态;架构细节同样留白 |
2024 年
2024 年的关键词是稀疏化。 DeepSeek 一年之内把 MoE 的三块地基连着铺完:1 月 DeepSeekMoE 定下细粒度 expert 加共享 expert,5 月 DeepSeek-V2 拿出 MLA,12 月 V3 把它们和 FP8 训练拼成 671B。同期 GRPO(2 月)成了后来所有 RL 的公共起点,MTP(4 月)和 Gated DeltaNet(12 月)则要再等一到两年才被大规模用上。年底 o1 把推理时算力摆上桌,直接引出 2025 年上半年。8 月和 10 月没有值得单列的基座报告,跳过。
1 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 01.05 | DeepSeek LLM | DeepSeek | arXiv:2401.02954 | DeepSeek 第一代,7B / 67B;自己重做了一遍 scaling law |
| 01.11 | DeepSeekMoE | DeepSeek | arXiv:2401.06066 | 细粒度 expert 切分加共享 expert 隔离。V3 到 V4 一路沿用,2026 年多数 MoE 仍是这个骨架 |
2 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 02.05 | DeepSeekMath | DeepSeek | arXiv:2402.03300 | GRPO 的出处。此后两年几乎所有 RL 训练都是从这里改出来的 |
| 02.27 | BitNet b1.58 | Microsoft | arXiv:2402.17764 | 权重压到 1.58-bit,量化路线的一次极限尝试 |
3 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 03.07 | Yi | 01.AI | arXiv:2403.04652 | 6B / 34B;报告重心在数据工程 |
| 03.08 | Gemini 1.5 | arXiv:2403.05530 | 1M 上下文加 MoE;长上下文竞赛的发令枪 | |
| 03.13 | Gemma | arXiv:2403.08295 | Google 的开源权重线开张,2B / 7B | |
| 03.26 | InternLM2 | Shanghai AI Lab | arXiv:2403.17297 | 200K 上下文;数据清洗流程写得很细 |
| 03.28 | Jamba | AI21 | arXiv:2403.19887 | 第一个产品级的 Mamba-Transformer 混合,注意力层与 Mamba 层 1:7。2026 年 Nemotron 那条线的前身 |
4 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 04.18 | Llama 3 8B / 70B | Meta | 官方博客 | 15T token;报告要等到 07.31 随 405B 一起出 |
| 04.22 | Phi-3 | Microsoft | arXiv:2404.14219 | 「教科书级数据」路线,3.8B 打 8B 档 |
| 04.30 | Multi-Token Prediction | Meta | arXiv:2404.19737 | 一次预测多个 token,既提训练质量又能做 self-speculative decoding。mimo-v2-flash 的 MTP 直接引这篇 |
5 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 05.07 | DeepSeek-V2 | DeepSeek | arXiv:2405.04434 | 236B / 21B;MLA 首发,把 KV cache 压到 GQA 的一小部分。到 2026 年还在被各家当基线 |
| 05.31 | Mamba-2 | CMU 与普林斯顿 | arXiv:2405.21060 | 状态空间与注意力的对偶(SSD);kimi-k3 的 KDA 往上追就是这条线 |
6 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 06.17 | Nemotron-4 340B | NVIDIA | arXiv:2406.11704 | 340B 稠密;后训练数据 98% 是合成的 |
| 06.18 | ChatGLM | Z.ai 与清华 | arXiv:2406.12793 | 从 GLM-130B 到 GLM-4 的整条线复盘 |
7 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 07.15 | Qwen2 | Alibaba | arXiv:2407.10671 | 0.5B–72B,外加一个 57B-A14B 的 MoE |
| 07.23 | Llama 3.1 405B | Meta | arXiv:2407.21783 | 15.6T token,405B 稠密;那份 92 页报告是当时公开度最高的旗舰级材料。模型 07.23 发布,报告 07.31 |
| 07.31 | Gemma 2 | arXiv:2408.00118 | 9B / 27B;局部与全局注意力 1:1 交错,Gemma 3 的 5:1 是从这里推上去的 |
9 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 09.03 | OLMoE | AI2 | arXiv:2409.02060 | 完全开放的 MoE,数据与训练过程一并公开 |
| 09.18 | Qwen2.5-Coder | Alibaba | arXiv:2409.12186 | 5.5T token 的代码续训 |
11 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 11.04 | Hunyuan-Large | Tencent | arXiv:2411.02265 | 389B / 52B,当时最大的开源 MoE |
| 11.20 | DeepSeek-R1-Lite-Preview | DeepSeek | 官方博客 | R1 的预告版,第一次展示 o1 式长思考。只有博客 |
| 11.28 | QwQ-32B-Preview | Alibaba | 官方博客 | 开源侧第一个能打的推理模型 |
12 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 12.09 | Gated DeltaNet | NVIDIA 与 MIT | arXiv:2412.06464 | 给 Mamba2 加 delta rule 和门控。Qwen3-Next 与 2026 年的 Qwen3.5 用的就是它 |
| 12.12 | Phi-4 | Microsoft | arXiv:2412.08905 | 14B;合成数据占比过半 |
| 12.19 | Qwen2.5 | Alibaba | arXiv:2412.15115 | 18T token;模型 09.19 发布,报告 12.19 |
| 12.27 | deepseek-v3 | DeepSeek | arXiv:2412.19437 | 671B / 37B 激活;MLA 加 DeepSeekMoE、FP8 训练、DualPipe。2026 年多数架构讨论的共同基线 |
| 12.31 | OLMo 2 | AI2 | arXiv:2501.00656 | 7B / 13B 全开;模型 11.26 发布,报告年底才挂出 |
闭源前沿
2023 到 2024 年这批闭源旗舰里,GPT-4、PaLM 2、Gemini 1 和 Gemini 1.5 都有正式报告(虽然架构细节大多留白),已经列进上面的表;这张表放的是只有 card、或者连 card 都没有的。
这一批没有一份文档的标题里写着 System Card——Anthropic 全都叫 Model Card 或 Addendum,是官方后来才把它们统一归档到 /system-cards 下面。
| 日期 | 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 2023.03.14 | Claude 1 | Anthropic | 发布博客 | 没有 model card,只在 7 月那份合并文档的评测对比里被提到 |
| 2023.07.11 | Claude 2 | Anthropic | Model Card | 《Model Card and Evaluations for Claude Models》,一份覆盖 Claude 1.3 / 2 / Instant 1.1 |
| 2023.11.06 | GPT-4 Turbo | OpenAI | 发布博客 | 没有自己的 system card,安全说明由 GPT-4(60 页)和 GPT-4V(18 页)两份覆盖。当天上线的其实是 preview,稳定版要等到 2024.04 |
| 2023.11.21 | Claude 2.1 | Anthropic | Model Card | Claude 2 那份第 14 页起的附录。文档明说「不是新的基座模型,所以只给附录」 |
| 2024.02.08 | Gemini 1.0 Ultra 上线 | 技术报告 §10.1 | 没有独立 model card,Google 官方索引页指向的就是技术报告第 71 页那节附录 | |
| 2024.03.04 | Claude 3 Opus / Sonnet / Haiku | Anthropic | Model Card | 三个模型共用。排版像技术报告,但全文 architecture 出现 0 次、没有参数量。这个 slug 现在给的是并了两份 addendum 的 64 页版,要 2024.03 的 42 页原版得用固定哈希 |
| 2024.03.17 | Grok-1 开源权重 | xAI | 发布博客 · 权重 | 314B MoE 的未微调 base checkpoint,Apache 2.0,没有技术报告。那份 Grok-1 model card 描述的是 2023.11 的对话版,不是这个 checkpoint |
| 2024.05.13 | GPT-4o | OpenAI | System Card | 33 页;模型 05.13 发布,card 拖到 08.08 |
| 2024.06.20 | Claude 3.5 Sonnet | Anthropic | Addendum | 8 页增补而非独立 card。文档署 06.20,博客页显示 06.21 |
| 2024.08.13 | Grok-2 beta | xAI | 发布博客 | 确认没有 model card。权重要等到 2025.08.24 才以 xAI Community License 放出 |
| 2024.09.12 | o1-preview | OpenAI | System Card | 42 页。HTML 页已被就地覆盖成 12.05 版,只有这份带版本号的 PDF 还冻结着 preview 的内容 |
| 2024.10.22 | Claude 3.5 Haiku 与升级版 3.5 Sonnet | Anthropic | Addendum | 14 页,两个模型共用;computer use 首次登场 |
| 2024.12.05 | o1 | OpenAI | System Card | 52 页,12.19 之后又补过一节。不带版本号的 o1-system-card.pdf 返回的还是 9 月版,别用 |
| 2024.12.11 | Gemini 2.0 Flash Experimental | Model Card | 发布时没有 card,2025.04.15 才补。2025 年表里 02.05 正式版指向的是同一份文档 |
2025 年
2025 年的主线在年中换了一次。 上半年属于推理:1 月 DeepSeek-R1 证明不用 SFT、纯 RL 也能长出推理链,此后半年几乎每一家都在复现这条路。下半年重心转向 agent 与效率:7 月 Kimi K2 把 agentic 当作发布的主标题,9 月 DeepSeek-V3.2-Exp 用 DSA 把稀疏注意力真正落进旗舰模型——这一步直接定义了 2026 全年。真正的分岔点其实在 2 月:NSA 和 MoBA 前后脚挂出,稀疏注意力的两条路线那时就分好了。
1 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 01.14 | MiniMax-01 | MiniMax | arXiv:2501.08313 | 456B / 45.9B 激活;Lightning Attention 与 softmax 注意力 7:1 混合,4M 上下文。线性注意力第一次做到旗舰规模 |
| 01.20 | DeepSeek-R1 | DeepSeek | arXiv:2501.12948 | 671B / 37B;R1-Zero 证明跳过 SFT、纯 RL 也能长出推理链。模型 01.20 发布,报告 01.22 |
| 01.22 | Kimi k1.5 | Moonshot | arXiv:2501.12599 | 与 R1 同日挂出的另一条 RL 路线:不用价值网络和 MCTS,靠上下文长度做 scaling,再把 long-CoT 蒸回 short-CoT |
| 01.22 | Doubao-1.5-pro | ByteDance | 官方博客 | 稀疏 MoE,宣称 7 倍稠密等效;只有发布说明 |
| 01.26 | Qwen2.5-1M | Alibaba | arXiv:2501.15383 | 7B / 14B 上到 1M 上下文;双块注意力加渐进式扩窗 |
2 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 02.16 | Native Sparse Attention | DeepSeek | arXiv:2502.11089 | 硬件对齐、可原生训练的稀疏注意力;粗粒度压缩加细粒度选择。2026 那条主线的源头 |
| 02.18 | MoBA | Moonshot | arXiv:2502.13189 | 块稀疏注意力,与 NSA 前后脚。区别是能在全注意力与稀疏之间无缝切换,已在 Kimi 线上验证过 |
| 02.19 | Qwen2.5-VL | Alibaba | arXiv:2502.13923 | 动态分辨率加绝对时间编码,把 VL 拉到与文本旗舰同代 |
3 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 03.03 | Phi-4-Mini | Microsoft | arXiv:2503.01743 | 3.8B;用 Mixture-of-LoRAs 挂多模态 |
| 03.12 | Gemma 3 | arXiv:2503.19786 | 1B–27B 四档;局部与全局注意力 5:1 交错,128K。滑窗混合比在开源侧第一次给到这么激进;模型 03.12 发布,报告 03.25 | |
| 03.13 | Command A | Cohere | arXiv:2504.00698 | 111B 稠密,企业向;模型 03.13 发布,报告 04.01 |
| 03.24 | DeepSeek-V3-0324 | DeepSeek | 模型卡 | V3 的增量更新,没出报告 |
| 03.26 | Qwen2.5-Omni | Alibaba | arXiv:2503.20215 | Thinker-Talker 架构,端到端全模态 |
4 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 04.05 | Llama 4 Scout / Maverick | Meta | 官方博客 | Meta 首个 MoE 旗舰,17B 激活,宣称 10M 上下文。没有技术报告,Behemoth 最终没发出来 |
| 04.10 | Kimi-VL | Moonshot | arXiv:2504.07491 | 2.8B 激活的 MoE 视觉语言模型 |
| 04.16 | BitNet b1.58 2B4T | Microsoft | arXiv:2504.12285 | 首个原生 1.58-bit 训练、规模到 2B 的开源权重模型,4T token |
| 04.29 | Qwen3 | Alibaba | arXiv:2505.09388 | 0.6B–235B 八档,36T token;thinking 与 non-thinking 双模合一。模型 04.29 发布,报告 05.14 |
| 04.30 | MiMo-7B | Xiaomi | arXiv:2505.07608 | 小米第一代,25T token 加 MTP,7B 做 RL 对标 32B。mimo-v2-flash 的预训练配方就沿用这套 |
| 04.30 | Phi-4-reasoning | Microsoft | arXiv:2504.21318 | 14B;精选 SFT 加少量 RL 就能进 o1-mini 档 |
5 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 05.14 | Insights into DeepSeek-V3 | DeepSeek | arXiv:2505.09343 | 不是新模型,是 deepseek-v3 的硬件—模型协同设计复盘:MLA、FP8、多平面网络各自的取舍 |
| 05.16 | MegaScale-MoE | ByteDance Seed | arXiv:2505.11432 | 不是模型报告,是 MoE 训练系统:把每个 MoE 层整个关进一个节点,EP 的 all-to-all 只走 NVLink;352B 在 1,440 张 Hopper 上 1.41M tokens/s,比 Megatron-LM 快 1.88 倍 |
| 05.28 | DeepSeek-R1-0528 | DeepSeek | 模型卡 | R1 的增量更新,思考长度大致翻倍 |
6 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 06.12 | Magistral | Mistral | arXiv:2506.10910 | Mistral 首个推理模型;纯 RL 把 AIME-24 pass@1 从 26.8 拉到 73.6,报告罕见地把失败实验也写了 |
| 06.16 | MiniMax-M1 | MiniMax | arXiv:2506.13585 | 456B / 45.9B;Lightning Attention 混合加 CISPO,1M 上下文,RL 全程只花 53.5 万美元 |
| 06.27 | Hunyuan-A13B | Tencent | 官方 PDF | 80B / 13B,256K;1 个共享加 64 个路由 expert 取 8,20T token |
| 06.30 | ERNIE 4.5 | Baidu | 官方 PDF | 10 个变体,最大 424B / 47B;异构多模态 MoE,预训练 MFU 47%,Apache 2.0 |
7 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 07.07 | Gemini 2.5 | arXiv:2507.06261 | 闭源模型里少见的正式报告,尽管训练细节仍大面积留白。之所以进月度表而不是下面的闭源前沿,就是因为它确实有报告 | |
| 07.11 | Kimi K2 | Moonshot | arXiv:2507.20534 | 1T / 32B;MuonClip 稳住 15.5T token 预训练,大规模合成 agentic 数据。模型 07.11 发布,报告 07.28 |
| 07.25 | Step-3 | StepFun | arXiv:2507.19427 | 321B / 38B;MFA 加注意力—FFN 解耦(AFD),模型与系统协同设计压解码成本 |
| 07.28 | GLM-4.5 | Z.ai | arXiv:2508.06471 | 355B / 32B;agentic、reasoning、coding 三合一(ARC)。模型 07.28 发布,报告 08.08 |
8 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 08.05 | gpt-oss-120b / 20b | OpenAI | arXiv:2508.10925 | OpenAI 时隔六年的开源权重;滑窗与全局 1:1 交错,加可学习的 attention sink。mimo-v2-flash 的 sink bias 直接沿用这套 |
| 08.20 | Nemotron Nano 2 | NVIDIA | arXiv:2508.14444 | 9B Mamba-Transformer 混合;连预训练数据集一起开源 |
| 08.20 | Seed-OSS-36B | ByteDance | 模型卡 | 36B 稠密,512K;可控 thinking budget |
| 08.21 | DeepSeek-V3.1 | DeepSeek | 模型卡 | 混合思考模式,840B token 长上下文续训;没出报告 |
| 08.21 | Intern-S1 | Shanghai AI Lab | arXiv:2508.15763 | 241B / 28B 科学多模态基座 |
9 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 09.01 | LongCat-Flash | Meituan | arXiv:2509.01322 | 560B,按 token 动态激活 18.6–31.3B;零计算 expert 加 ScMoE |
| 09.09 | Qwen3-Next-80B-A3B | Alibaba | 模型卡 | 80B / 3B,激活率 3.7%;Gated DeltaNet 与门控注意力 3:1 混合。Qwen 转线性注意力的起点,2026 年的 Qwen3.5 沿用同一套 3:1 |
| 09.22 | Qwen3-Omni | Alibaba | arXiv:2509.17765 | 文本 / 图像 / 音频 / 视频同一套 Thinker-Talker |
| 09.23 | LongCat-Flash-Thinking | Meituan | arXiv:2509.18883 | 在 Flash 上加推理与 agentic RL;配 DORA 异步 RL 框架 |
| 09.29 | DeepSeek-V3.2-Exp | DeepSeek | 官方 PDF | 在 V3.1-Terminus 上续训接 DSA:lightning indexer 打分加 top-k 选择,注意力复杂度从 O(L²) 降到 O(Lk)。2026 全年的起点 |
| 09.30 | GLM-4.6 | Z.ai | 模型卡 | 357B,200K 上下文;这一版没配报告 |
10 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 10.09 | Ling-1T | Ant Group | 模型卡 | 1T / 约 50B 激活,20T token,128K,MIT 协议;完整报告 10.25 才随 Ling 2.0 补上 |
| 10.13 | Rollout Routing Replay | Xiaomi 与北大 | arXiv:2510.11370 | 让 MoE 的 RL 训练复用 rollout 时的 routed expert,消掉训推路由不一致导致的崩溃。作者与 mimo-v2-flash 高度重叠,后者的 RL infra 直接把它作为 R3 模块用上 |
| 10.21 | Ring-1T | Ant Group | arXiv:2510.18855 | 万亿级思考模型怎么做 RL;IcePop 稳训练加 ASystem 框架。preview 版 9 月就放了出来,mimo-v2-flash 的 MOPD 引的就是 IcePop |
| 10.25 | Ling 2.0 | Ant Group | arXiv:2510.22115 | Ling 2.0 家族的完整报告,1/32 激活率下的 MoE scaling law |
| 10.27 | MiniMax-M2 | MiniMax | 模型卡 | 230B / 10B,agent 向;报告要等到 2026.05.26 才随 M2 系列一起出 |
| 10.30 | Kimi Linear | Moonshot | arXiv:2510.26692 | KDA(Kimi Delta Attention)与 MLA 3:1 混合,KV cache 降 75%。kimi-k3 两大支柱之一的前身 |
11 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 11.06 | Kimi K2 Thinking | Moonshot | 模型卡 | 1T / 32B,256K;原生 INT4 QAT,能连着跑 200–300 轮工具调用。没出报告 |
| 11.26 | Qwen3-VL | Alibaba | arXiv:2511.21631 | Qwen3 视觉版的完整报告 |
| 11.27 | DeepSeekMath-V2 | DeepSeek | arXiv:2511.22570 | 自验证的数学推理;IMO 2025 拿到金牌分数线 |
12 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 12.02 | DeepSeek-V3.2 | DeepSeek | arXiv:2512.02556 | V3.2-Exp 的正式版报告:DSA 加可 scale 的 RL 框架;高算力档 V3.2-Speciale 拿下 IMO 与 IOI 双金 |
| 12.15 | Olmo 3 | AI2 | arXiv:2512.13961 | 7B / 32B,数据、代码、中间 checkpoint 全开。透明度这一栏的天花板 |
| 12.23 | MiniMax-M2.1 | MiniMax | 模型卡 | M2 的增量更新 |
闭源前沿
同 2026 年的口径,只有 system card 或 model card 的不进月度表。Gemini 2.5 两边都占:3 月的 model card 在这张表,7 月那份正式 arXiv 报告在月度表里。
| 日期 | 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 01.31 | o3-mini | OpenAI | System Card | |
| 02.05 | Gemini 2.0 Flash | Model Card | 没有「Gemini 2.0」整体 card,按变体拆开发;card 本身 04.15 才挂出,Pro 档始终没有 | |
| 02.19 | Grok 3 | xAI | 发布博客 | 全年唯一没有 model card 的,安全说明后来并进 Grok 4 那份。02.17 是发布会直播,博客署期 02.19 |
| 02.24 | Claude 3.7 Sonnet | Anthropic | System Card | 43 页;首个 hybrid reasoning |
| 02.27 | GPT-4.5 | OpenAI | System Card | 官方定位 research preview,Orion 只是内部代号 |
| 03.25 | Gemini 2.5 Pro | Model Card | 21 页;线上这份已是 06.27 修订版,初版被覆盖 | |
| 04.14 | GPT-4.1 | OpenAI | 发布博客 | 没有 system card。OpenAI 公开表态过「不是前沿模型,不会单独发」 |
| 04.16 | o3 / o4-mini | OpenAI | System Card | 两个模型共用一份 |
| 05.22 | Claude Opus 4 / Sonnet 4 | Anthropic | System Card | 124 页,两个模型共用一份 |
| 07.09 | Grok 4 | xAI | Model Card | 8 页;模型 07.09 发布,card 拖到 08.20 才补 |
| 08.05 | Claude Opus 4.1 | Anthropic | System Card | 23 页,是 Claude 4 那份的增补附录而非独立 card |
| 08.07 | GPT-5 | OpenAI | System Card | PDF 内页署 08.13,那是改版日期 |
| 09.29 | Claude Sonnet 4.5 | Anthropic | System Card | 149 页 |
| 10.15 | Claude Haiku 4.5 | Anthropic | System Card | 39 页 |
| 11.12 | GPT-5.1 | OpenAI | System Card | 标题里就写着 Addendum,是 GPT-5 那份的附录,只补了心理健康与情感依赖两类评估 |
| 11.17 | Grok 4.1 | xAI | Model Card | 6 页 |
| 11.18 | Gemini 3 Pro | Model Card | 10 页;线上已换成 2026.05 修订版 | |
| 11.24 | Claude Opus 4.5 | Anthropic | System Card | 153 页 |
Anthropic 和 Google 一律用官方短链,不用 CDN 直链:两家都会把同一份 card 静默替换成新修订版(Claude 4 已从 123 页变成 124 页,Gemini 3 Pro 线上是 2026.05 版),直链会指向旧文件或失效。xAI 相反,data.x.ai 的文件名自带日期,是不可变快照,直接存就行。
2026 年
贯穿 2026 年的主线是稀疏注意力。 DeepSeek 2025 年底用 DSA 开了口子,此后每一家的「1M 上下文」都是自研一版稀疏注意力换来的:GLM-5 直接采用 DSA,GLM-5.2 用 IndexCache 把 indexer 四层复用一次,MiniMax 做 MSA,美团做 LSA,DeepSeek 自己换成 CSA+HCA,Kimi K3 转向 KDA 线性注意力。横向对比这几种设计,是这批报告里最值得单独写一篇的题目。
1 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 01.02 | mimo-v2-flash | Xiaomi | arXiv:2601.02780 | 309B / 15B 激活;滑窗与全局注意力 5:1 混合 |
| 01.08 | Ministral 3 | Mistral | arXiv:2601.08584 | 3B / 8B / 14B 三档,级联蒸馏,均支持图像输入 |
| 01.09 | Step3-VL-10B | StepFun | arXiv:2601.09668 | 10B 视觉语言模型;PaCoRe 把测试时算力投向并行视觉假设而非更长思维链 |
| 01.23 | LongCat-Flash-Thinking-2601 | Meituan | arXiv:2601.16725 | 560B / 27B 推理模型;自动扩展出 1 万+ 可验证工具环境、覆盖 20+ 领域做多域 RL,BrowseComp 73.1 |
2 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 02.02 | Kimi K2.5 | Moonshot | arXiv:2602.02276 | 1T / 32B;Agent Swarm 自导向并行编排,宽搜延迟降 4.5 倍 |
| 02.04 | ERNIE 5.0 | Baidu | arXiv:2602.04705 | 2.4T 原生多模态 MoE;模型本体 01.22 已发布 |
| 02.06 | Baichuan-M3 | Baichuan | arXiv:2602.06570 | 235B 医疗方向;纯后训练报告,不谈架构与预训练 |
| 02.10 | step-3-5-flash | StepFun | arXiv:2602.10604 | 196B / 11B;SWA 与全局 3:1 加 MTP-3 |
| 02.12 | MiniMax-M2.5 | MiniMax | 官方博客 | agent-native 中间款;SWE-Bench Verified 80.2,BrowseComp 76.3 |
| 02.14 | Doubao-Seed-2.0 | ByteDance | 官方博客 | 官方系列名 Seed2.0;Pro / Lite / Mini / Code 四档,EgoTempo 上视频理解首次超过人类 |
| 02.16 | Qwen3.5 | Alibaba | 官方博客 | 397B-A17B;Gated DeltaNet 与全注意力 3:1 交替 |
| 02.16 | Ling 2.5 / Ring 2.5 | Ant Group | 模型卡 | 1T / 63B 激活,预训练语料从 20T 扩到 29T tokens |
| 02.17 | GLM-5 | Z.ai | arXiv:2602.15763 | 744B / 40B;采用 DSA 加异步 agent RL;模型 02.11 发布 |
3 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 03.08 | Megatron-Core MoE | NVIDIA | arXiv:2603.07685 | 不是模型报告,是训练栈自己的报告:88 页讲 MoE 的内存 / 通信 / 计算三堵墙怎么破,DeepSeek-V3 在 GB300 上做到 1,233 TFLOPS/GPU |
| 03.12 | IndexCache | Z.ai 与清华 | arXiv:2603.12201 | 跨层复用稀疏注意力 indexer,30B DSA 模型上砍掉 75% indexer 计算;GLM-5.2 落地时改称 IndexShare |
| 03.16 | Attention Residuals | Moonshot | arXiv:2603.15031 · 代码 | 跨深度的注意力残差;半年后成为 Kimi K3 两大架构支柱之一 |
| 03.16 | Mistral Small 4 | Mistral | 官方博客 | 119B / 6.5B 激活,128 专家取 4,256K 上下文,Apache 2.0 |
| 03.18 | MiniMax-M2.7 | MiniMax | 官方博客 | M2 系列末代,首次让模型参与自身迭代;细节两个月后并入 M2 系列报告 |
| 03.18 | MiMo-V2-Pro | Xiaomi | 官方博客 | 1T / 42B 激活,1M 上下文;纯 API 发布,没有开源权重 |
| 03.29 | LongCat-Next | Meituan | arXiv:2603.27538 | 把各模态统一词元化为离散 token;dNaViT 视觉 tokenizer 用 SAE + RVQ 兼顾理解与生成 |
4 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 04.07 | GLM-5.1 | Z.ai | 官方博客 | 754B 加 DSA;SWE-Bench Pro 58.4,支持 8 小时自主执行 |
| 04.12 | Nemotron 3 Super | NVIDIA | arXiv:2604.12374 | 120B / 12B Mamba-Attention MoE;三件首发:25T token 全程 NVFP4 预训练、LatentMoE 替掉标准 MoE 层、原生 MTP 头做投机解码 |
| 04.16 | Qwen3.6-35B-A3B | Alibaba | 模型卡 | Qwen3.6 的首个开源权重档,主打 agentic coding |
| 04.17 | Qwen3.5-Omni | Alibaba | arXiv:2604.15804 | Thinker 和 Talker 两端都换成 Hybrid MoE,256k 上下文吃 10 小时音频 / 400 秒 720P 视频;ARIA 用累计语音-文本比例约束把双通道生成并成单流,补上流式合成的稳定性与韵律;215 项音频与视听子任务 SOTA |
| 04.20 | Kimi K2.6 | Moonshot | 官方博客 | 架构沿用 K2.5;Agent Swarm 从 100 子 agent / 1500 步扩到 300 / 4000 |
| 04.22 | Qwen3.6-27B | Alibaba | 模型卡 | 27B dense,对标旗舰级编码能力 |
| 04.23 | Hy3 preview | Tencent | 模型卡 | 295B / 21B,256K;混元首个 agent 导向旗舰,腾讯混元社区协议 |
| 04.24 | deepseek-v4 | DeepSeek | arXiv:2606.19348 | Pro 1.6T/49B 加 Flash 284B/13B;CSA+HCA 混合注意力、mHC 残差、Muon。04.24 随 HF 上的 PDF 发布,arXiv 版 6 月才挂出 |
| 04.29 | Ling-2.6 | Ant Group | 模型卡 | 1T;完整报告要等到 06.13 才随 2.6 家族补上 |
5 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 05.09 | ERNIE 5.1 | Baidu | 官方博客 | 继承 5.0,总参压到约 1/3、激活约 1/2,预训练成本约为同规模模型的 6% |
| 05.09 | MegaScale-Omni | ByteDance Seed 与上海交大 | arXiv:2605.08962 | 同样不是模型报告而是训练栈报告:多模态训练里 encoder 与 LLM 的资源划分从空间改成时间复用,千卡生产集群 8M tokens/s。SOSP 收录 |
| 05.20 | Qwen3.7-Max | Alibaba | 官方博客 | 闭源 agent 旗舰。上下文口径不一致:官方 benchmark 用 256K,1M 只见于二手报道 |
| 05.26 | The MiniMax-M2 Series | MiniMax | arXiv:2605.26494 | 229.9B / 9.8B;Forge agent RL;M2.7 展示早期自演化 |
| 05.29 | Step-3.7-Flash | StepFun | 官方博客 | 198B / 11B,256K,Apache 2.0 性价比档 |
6 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 06.01 | minimax-m3 | MiniMax | 模型卡 · 官方博客 | 428B / 23B,1M 上下文,原生多模态;训练配方与数据未公开 |
| 06.04 | Nemotron 3 Ultra | NVIDIA | arXiv:2606.15007 · 官方 PDF | 550B / 55B Mamba-Attention MoE,1M 上下文;模型 06.04 发布,报告 06.09。20T token 全程 NVFP4 预训练里两次 loss 发散的复盘;MOPD 把十余个领域 teacher 蒸馏进一个 student;MTP Boosting 专治起草头的训推不匹配 |
| 06.11 | minimax-sparse-attention | MiniMax | arXiv:2606.13392 | M3 唯一的正式报告,只覆盖注意力本体,且在另一个 109B 模型上验证 |
| 06.13 | Ling and Ring 2.6 | Ant Group | arXiv:2606.15079 | 1T;不重训,在 Ling-2.0 的 checkpoint 上把 GQA 换成 Lightning Attention 加 MLA 7:1,靠 QK Norm 吸收和 Partial RoPE 适配把架构移植做成可恢复的;Ring 用 KPop 做 agent RL,二元 KL 替掉 IcePop 的固定比值 |
| 06.16 | glm-5-2 | Z.ai | 官方博客 | 753B,MIT 许可;上下文 200K→1M;落地 IndexCache(官方叫 IndexShare),每 4 层共享一个 indexer,1M 下 FLOPs 降 2.9 倍;MTP 也用上 IndexShare 加 KVShare,acceptance length +20%。06.13 先向 Coding Plan 用户推送 |
| 06.30 | LongCat-2.0 | Meituan | 官方博客 | 1.6T / 48B 动态激活;LongCat Sparse Attention;5 万卡国产 ASIC 全程训练。没出技术报告,博客是唯一官方材料 |
7 月
| 日期 | 报告 / 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 07.06 | Hy3 | Tencent | 模型卡 | 4 月 preview 之后重新后训练的正式版,改用 Apache 2.0 |
| 07.19 | Qwen3.8-Max-Preview | Alibaba | 阿里云产品文档 | 2.4T。没有模型卡、没有 benchmark、没有发布博客,这条产品文档是唯一能证明它存在的官方材料 |
| 07.27 | kimi-k3 | Moonshot | arXiv:2607.24653 | 2.8T / 104B;KDA 加 Attention Residuals 加 Stable LatentMoE,scaling 效率比 K2 提升约 2.5 倍 |
闭源前沿
只有 system card 或 model card,没有训练细节,所以不进上面的月度表。列在这里是因为它们是开源报告的对照基线——Kimi K3 的对比对象就是 Claude Fable 5 和 GPT-5.6 Sol。
| 日期 | 模型 | 机构 | 出处 | 说明 |
|---|---|---|---|---|
| 02.05 | Claude Opus 4.6 | Anthropic | System Card | 213 页 |
| 02.17 | Claude Sonnet 4.6 | Anthropic | System Card | 135 页 |
| 02.19 | Gemini 3.1 Pro | Model Card | ARC-AGI-2 77.1,SWE-Bench Verified 80.6 | |
| 03.05 | GPT-5.4 Thinking | OpenAI | System Card | 官方全名带 Thinking;03.17 补了 mini 附录,04.24 又改过一版 |
| 04.07 | Claude Mythos Preview | Anthropic | System Card | 245 页;Opus 4.7 与 4.8 的 system card 都拿它当能力上限的参照系 |
| 04.16 | Claude Opus 4.7 | Anthropic | System Card | 232 页 |
| 04.23 | GPT-5.5 | OpenAI | System Card | 1M 上下文(API 文档写 1,050,000)。参数量官方从未公开,流传的 9.7T 是第三方外推,区间 3.2T–28.7T |
| 05.19 | Gemini 3.5 Flash | Model Card | 06.24 起 computer use 从独立模型改为它的内置工具 | |
| 05.28 | Claude Opus 4.8 | Anthropic | System Card | 246 页 |
| 06.09 | Claude Fable 5 / Mythos 5 | Anthropic | System Card | 317 页,两个模型共用一份。06.12 因美国出口管制全球下架,06.30 宣布解禁,07.01 实际恢复 |
| 06.26 | GPT-5.6 Preview | OpenAI | System Card | 受政府要求,只对约 20 家审核过的合作方开放;与 GA 版是两份不同的 card |
| 06.30 | Claude Sonnet 5 | Anthropic | System Card | 146 页 |
| 07.08 | Grok 4.5 | SpaceXAI | Model Card | 23 页,card 署期 07.14。07.06 xAI 更名 SpaceXAI,x.ai 域名未迁移 |
| 07.09 | GPT-5.6 Sol / Terra / Luna | OpenAI | System Card | 三个变体共用一份。Sol 旗舰,Terra 半价对标 5.5,Luna 最快最省。这一代不再有 openai.com/index/ 下的 card 页 |
| 07.24 | Claude Opus 5 | Anthropic | System Card | 194 页 |
Author ByteDance
Publish July 25, 2026
LastMod September 4, 2026
License 本作品采用 CC BY-NC-ND 4.0 许可协议进行许可,转载时请注明原文链接
如果你在浏览博客的过程中发现了任何问题,欢迎在对应文章下评论。如果你有其他事情想要咨询,可以通过邮件联系我。
-
No backlinks found.