
  <rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
      <title>HANS</title>
      <link>https://www.hansking.cn/blog</link>
      <description>A posts created with Next.js and Tailwind.css</description>
      <language>en-us</language>
      <managingEditor>admin@hansking.cn (HANS)</managingEditor>
      <webMaster>admin@hansking.cn (HANS)</webMaster>
      <lastBuildDate>Sun, 02 Mar 2025 10:00:00 GMT</lastBuildDate>
      <atom:link href="https://www.hansking.cn/tags/GRPO/feed.xml" rel="self" type="application/rss+xml"/>
      
  <item>
    <guid>https://www.hansking.cn/blog/2026/GRPO-ru-men-qun-ti-xiang-dui-ce-le-you-hua</guid>
    <title>GRPO 入门：群体相对策略优化</title>
    <link>https://www.hansking.cn/blog/2026/GRPO-ru-men-qun-ti-xiang-dui-ce-le-you-hua</link>
    <description>[{&quot;value&quot;:&quot;GRPO 入门：群体相对策略优化&quot;,&quot;url&quot;:&quot;#grpo-入门群体相对策略优化&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、先回顾 PPO 在做什么&quot;,&quot;url&quot;:&quot;#一先回顾-ppo-在做什么&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、GRPO 的核心直觉&quot;,&quot;url&quot;:&quot;#二grpo-的核心直觉&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、目标函数在优化什么&quot;,&quot;url&quot;:&quot;#三目标函数在优化什么&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、奖励函数决定模型究竟学会什么&quot;,&quot;url&quot;:&quot;#四奖励函数决定模型究竟学会什么&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、组怎么采样，比想象中更重要&quot;,&quot;url&quot;:&quot;#五组怎么采样比想象中更重要&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、长度偏差是一个隐蔽的坑&quot;,&quot;url&quot;:&quot;#六长度偏差是一个隐蔽的坑&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、一个简化训练流程&quot;,&quot;url&quot;:&quot;#七一个简化训练流程&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、训练中应该盯哪些指标&quot;,&quot;url&quot;:&quot;#八训练中应该盯哪些指标&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、GRPO 和 SFT、PPO 如何配合&quot;,&quot;url&quot;:&quot;#九grpo-和-sftppo-如何配合&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十、我的总结：比较可以替代一部分“绝对判断”&quot;,&quot;url&quot;:&quot;#十我的总结比较可以替代一部分绝对判断&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 02 Mar 2025 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>推理模型</category><category>GRPO</category><category>强化学习</category>
  </item>

    </channel>
  </rss>
