digest
2026-08-12
UltraEP:拿精确负载在热路径上做每层每 microbatch 的 EP 均衡
2026-08-12
Hybrid-EP:用最少的 SM 打满 MoE 的 EP 通信带宽
2026-08-11
veScale-FSDP:把切分粒度交回给用户的 FSDP
2026-08-11
MoE Parallel Folding:让 Attention 和 MoE 各用各的并行映射
2026-08-07
MegaScale-Omni:把多模态训练的资源划分从空间换成时间
2026-08-07
Seed1.5-VL:532M 视觉编码器加 20B 激活的多模态基座
2026-08-07
MegaScale-MoE:生产环境中大规模、通信高效的 MoE 训练
2026-08-03
Nemotron 3 Ultra:20T token NVFP4 预训练、MOPD 后训练与 NVFP4 推理
2026-08-01
DeepSeek-V2:强大、经济、高效的 MoE 语言模型
2026-07-31
DeepSeekMoE:细粒度专家切分与共享专家隔离
2026-07-30
Magistral:Mistral 从零搭一套纯 RL 推理训练栈
2026-07-30
Step3-VL-10B:10B 视觉语言模型与并行协同推理
2026-07-30
Mixtral of Experts:8x7B 稀疏专家混合模型
2026-07-30
大模型架构大对比:从 DeepSeek V3 到 Gemma 4
2026-07-30
Baichuan-M3:为可靠的医疗决策建模临床问诊
2026-07-30
Code Llama:开放的代码基座模型
2026-07-30
Qwen3.5-Omni:Thinker-Talker 双端 Hybrid MoE 与 ARIA 流式语音对齐
2026-07-30
Llama 2:开放基座模型与微调对话模型
2026-07-30
LongCat-Flash-Thinking-2601 技术报告
2026-07-30
Nemotron 3 Super:LatentMoE、NVFP4 预训练与 agentic 后训练
2026-07-30
Olmo 3 技术报告
2026-07-30
Ling 与 Ring 2.6:给训好的万亿模型换一套注意力
2026-07-30
LLaMA 论文全文:开放且高效的基础语言模型
2026-07-30
LongCat-Next:把模态词汇化成离散 token
2026-07-30
Megatron Core 的 MoE 训练:打破内存、通信与计算三堵墙
2026-07-30
ERNIE 5.0:从零训练的统一全模态自回归模型
2026-07-30
GLM-5:从 vibe coding 到 agentic engineering
2026-07-30
Kimi K2.5:视觉 agentic 智能
2026-07-30
Ministral 3:把 24B 父模型级联剪枝蒸馏成 3B/8B/14B
2026-07-30
GLM-5.2:为长程任务而生
2026-07-30
Frontier Labs 发布渠道
2026-07-30
MiniMax-M2 系列:小激活释放最大现实智能
2026-07-30
Step 3.5 Flash 技术报告全文
2026-07-30
DeepSeek-V3 技术报告全文
2026-07-30
MiMo-V2-Flash 技术报告全文
2026-07-30
MiniMax Sparse Attention 全文翻译
2026-07-29
DeepSeek-V4 技术报告全文
2026-07-29
Kimi K3 技术报告全文
2026-07-29
Harness 工程:模型之外那层系统如何自我改进
2026-07-23
推理努力度是怎么训出来的