home link menu path
Garden
Search

    veRL 强化学习课:PPO 到 GRPO

    Author Houmin Wei

    Publish January 1, 0001

    LastMod August 27, 2026

    License 本作品采用 CC BY-NC-ND 4.0 许可协议进行许可,转载时请注明原文链接

    如果你在浏览博客的过程中发现了任何问题,欢迎在对应文章下评论。如果你有其他事情想要咨询,可以通过邮件联系我。

    Linked Mentions
    • ERNIE 5.0:从零训练的统一全模态自回归模型
    • GLM-5:从 vibe coding 到 agentic engineering
    • Kimi K2.5:视觉 agentic 智能
    • Llama 2:开放基座模型与微调对话模型
    • LongCat-Flash-Thinking-2601 技术报告
    • Ministral 3:把 24B 父模型级联剪枝蒸馏成 3B/8B/14B
    • Olmo 3 技术报告
    • Seed1.5-VL:532M 视觉编码器加 20B 激活的多模态基座
    • Step3-VL-10B:10B 视觉语言模型与并行协同推理
    • veRL 强化学习课
    veRL 强化学习课:partial rollout veRL 强化学习课:从 Search-R1 看 Search Agent
    Table of Contents
    © 2022 – 2026 Powered by Hugo & Cosmos