
  <rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
      <title>HANS</title>
      <link>https://www.hansking.cn/blog</link>
      <description>A posts created with Next.js and Tailwind.css</description>
      <language>en-us</language>
      <managingEditor>admin@hansking.cn (HANS)</managingEditor>
      <webMaster>admin@hansking.cn (HANS)</webMaster>
      <lastBuildDate>Sun, 04 Aug 2024 10:00:00 GMT</lastBuildDate>
      <atom:link href="https://www.hansking.cn/tags/RLHF/feed.xml" rel="self" type="application/rss+xml"/>
      
  <item>
    <guid>https://www.hansking.cn/blog/2026pian-hao-you-hua-cong-RLHF-dao-DPO</guid>
    <title>偏好优化：从 RLHF 到 DPO</title>
    <link>https://www.hansking.cn/blog/2026pian-hao-you-hua-cong-RLHF-dao-DPO</link>
    <description>[{&quot;value&quot;:&quot;偏好优化：从 RLHF 到 DPO&quot;,&quot;url&quot;:&quot;#偏好优化从-rlhf-到-dpo&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、预训练和 SFT 解决了什么&quot;,&quot;url&quot;:&quot;#一预训练和-sft-解决了什么&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、偏好数据把绝对打分改成相对比较&quot;,&quot;url&quot;:&quot;#二偏好数据把绝对打分改成相对比较&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、奖励模型：把偏好变成一个分数&quot;,&quot;url&quot;:&quot;#三奖励模型把偏好变成一个分数&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、PPO 为什么被用于 RLHF&quot;,&quot;url&quot;:&quot;#四ppo-为什么被用于-rlhf&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、DPO 的直觉：直接让模型偏爱 chosen&quot;,&quot;url&quot;:&quot;#五dpo-的直觉直接让模型偏爱-chosen&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、三种路线放在一起看&quot;,&quot;url&quot;:&quot;#六三种路线放在一起看&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、为什么数据质量比算法名字更重要&quot;,&quot;url&quot;:&quot;#七为什么数据质量比算法名字更重要&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;偏好差异不清楚&quot;,&quot;url&quot;:&quot;#偏好差异不清楚&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;chosen 只是更长&quot;,&quot;url&quot;:&quot;#chosen-只是更长&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;rejected 过于糟糕&quot;,&quot;url&quot;:&quot;#rejected-过于糟糕&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;任务标准不一致&quot;,&quot;url&quot;:&quot;#任务标准不一致&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;八、偏好优化会带来哪些副作用&quot;,&quot;url&quot;:&quot;#八偏好优化会带来哪些副作用&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、KL 约束为什么重要&quot;,&quot;url&quot;:&quot;#九kl-约束为什么重要&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十、离线偏好和在线反馈如何结合&quot;,&quot;url&quot;:&quot;#十离线偏好和在线反馈如何结合&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十一、什么时候选 RLHF，什么时候选 DPO&quot;,&quot;url&quot;:&quot;#十一什么时候选-rlhf什么时候选-dpo&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十二、我的总结：对齐是持续校准，不是一次训练&quot;,&quot;url&quot;:&quot;#十二我的总结对齐是持续校准不是一次训练&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 04 Aug 2024 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>RLHF</category><category>DPO</category><category>对齐</category>
  </item>

    </channel>
  </rss>
