
  <rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
      <title>HANS</title>
      <link>https://www.hansking.cn/blog</link>
      <description>A posts created with Next.js and Tailwind.css</description>
      <language>en-us</language>
      <managingEditor>admin@hansking.cn (HANS)</managingEditor>
      <webMaster>admin@hansking.cn (HANS)</webMaster>
      <lastBuildDate>Sun, 16 Feb 2025 10:00:00 GMT</lastBuildDate>
      <atom:link href="https://www.hansking.cn/tags/强化学习/feed.xml" rel="self" type="application/rss+xml"/>
      
  <item>
    <guid>https://www.hansking.cn/blog/2026/DeepSeek-R1-de-xun-lian-si-lu-yu-kai-yuan-ying-xiang</guid>
    <title>DeepSeek-R1 的训练思路与开源影响</title>
    <link>https://www.hansking.cn/blog/2026/DeepSeek-R1-de-xun-lian-si-lu-yu-kai-yuan-ying-xiang</link>
    <description>[{&quot;value&quot;:&quot;DeepSeek-R1 的训练思路与开源影响&quot;,&quot;url&quot;:&quot;#deepseek-r1-的训练思路与开源影响&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、R1-Zero：先让模型在奖励里寻找能力&quot;,&quot;url&quot;:&quot;#一r1-zero先让模型在奖励里寻找能力&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、为什么冷启动数据仍然重要&quot;,&quot;url&quot;:&quot;#二为什么冷启动数据仍然重要&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、可验证奖励是整条路线的地基&quot;,&quot;url&quot;:&quot;#三可验证奖励是整条路线的地基&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、GRPO 为什么成为重要的配套方法&quot;,&quot;url&quot;:&quot;#四grpo-为什么成为重要的配套方法&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、推理时计算为什么重新成为能力变量&quot;,&quot;url&quot;:&quot;#五推理时计算为什么重新成为能力变量&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、蒸馏让成果进入更小的模型&quot;,&quot;url&quot;:&quot;#六蒸馏让成果进入更小的模型&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、开源影响不只是放出一个权重文件&quot;,&quot;url&quot;:&quot;#七开源影响不只是放出一个权重文件&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、如何避免把 R1 学成几个口号&quot;,&quot;url&quot;:&quot;#八如何避免把-r1-学成几个口号&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、我的总结：R1 改变的是问题的问法&quot;,&quot;url&quot;:&quot;#九我的总结r1-改变的是问题的问法&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 16 Feb 2025 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>DeepSeek</category><category>推理模型</category><category>强化学习</category>
  </item>

  <item>
    <guid>https://www.hansking.cn/blog/2026/GRPO-ru-men-qun-ti-xiang-dui-ce-le-you-hua</guid>
    <title>GRPO 入门：群体相对策略优化</title>
    <link>https://www.hansking.cn/blog/2026/GRPO-ru-men-qun-ti-xiang-dui-ce-le-you-hua</link>
    <description>[{&quot;value&quot;:&quot;GRPO 入门：群体相对策略优化&quot;,&quot;url&quot;:&quot;#grpo-入门群体相对策略优化&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、先回顾 PPO 在做什么&quot;,&quot;url&quot;:&quot;#一先回顾-ppo-在做什么&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、GRPO 的核心直觉&quot;,&quot;url&quot;:&quot;#二grpo-的核心直觉&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、目标函数在优化什么&quot;,&quot;url&quot;:&quot;#三目标函数在优化什么&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、奖励函数决定模型究竟学会什么&quot;,&quot;url&quot;:&quot;#四奖励函数决定模型究竟学会什么&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、组怎么采样，比想象中更重要&quot;,&quot;url&quot;:&quot;#五组怎么采样比想象中更重要&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、长度偏差是一个隐蔽的坑&quot;,&quot;url&quot;:&quot;#六长度偏差是一个隐蔽的坑&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、一个简化训练流程&quot;,&quot;url&quot;:&quot;#七一个简化训练流程&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、训练中应该盯哪些指标&quot;,&quot;url&quot;:&quot;#八训练中应该盯哪些指标&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、GRPO 和 SFT、PPO 如何配合&quot;,&quot;url&quot;:&quot;#九grpo-和-sftppo-如何配合&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十、我的总结：比较可以替代一部分“绝对判断”&quot;,&quot;url&quot;:&quot;#十我的总结比较可以替代一部分绝对判断&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 02 Mar 2025 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>推理模型</category><category>GRPO</category><category>强化学习</category>
  </item>

    </channel>
  </rss>
