moe
2026-07-30
Mixtral of Experts:8x7B 稀疏专家混合模型
2026-07-30
大模型架构大对比:从 DeepSeek V3 到 Gemma 4
2026-07-30
Qwen3.5-Omni:Thinker-Talker 双端 Hybrid MoE 与 ARIA 流式语音对齐
2026-07-30
LongCat-Flash-Thinking-2601 技术报告
2026-07-30
Nemotron 3 Super:LatentMoE、NVFP4 预训练与 agentic 后训练
2026-07-30
LongCat-Next:把模态词汇化成离散 token
2026-07-30
Megatron Core 的 MoE 训练:打破内存、通信与计算三堵墙
2026-07-30
ERNIE 5.0:从零训练的统一全模态自回归模型
2026-07-30
MiniMax-M2 系列:小激活释放最大现实智能
2026-07-30
Step 3.5 Flash 技术报告全文
2026-07-30
DeepSeek-V3 技术报告全文
2026-07-30
MiMo-V2-Flash 技术报告全文
2026-07-29
DeepSeek-V4 技术报告全文
2026-07-29
Kimi K3 技术报告全文