读完外部材料(论文 / 技术博客 / 代码仓库)之后,用自己的话重写一遍的产物。 不是摘要,是「我确认自己读懂了」的记录。

模型与算法

  • reasoning-effort —— 推理努力度是怎么训出来的:low/medium/high 这个旋钮在推理侧只是一句 system prompt,在训练侧是三条可叠加的路线;硬性 token 预算是另一件事

系统与 Infra

工程实践