
  <rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
      <title>HANS</title>
      <link>https://www.hansking.cn/blog</link>
      <description>A posts created with Next.js and Tailwind.css</description>
      <language>en-us</language>
      <managingEditor>admin@hansking.cn (HANS)</managingEditor>
      <webMaster>admin@hansking.cn (HANS)</webMaster>
      <lastBuildDate>Sun, 18 Aug 2024 10:00:00 GMT</lastBuildDate>
      <atom:link href="https://www.hansking.cn/tags/DPO/feed.xml" rel="self" type="application/rss+xml"/>
      
  <item>
    <guid>https://www.hansking.cn/blog/2026/DPO-shi-zhan-xun-lian-yi-ge-geng-fu-he-ye-wu-pian-hao-de-mo-xing</guid>
    <title>DPO 实战：训练一个更符合业务偏好的模型</title>
    <link>https://www.hansking.cn/blog/2026/DPO-shi-zhan-xun-lian-yi-ge-geng-fu-he-ye-wu-pian-hao-de-mo-xing</link>
    <description>[{&quot;value&quot;:&quot;DPO 实战：训练一个更符合业务偏好的模型&quot;,&quot;url&quot;:&quot;#dpo-实战训练一个更符合业务偏好的模型&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、先回顾 SFT 和 RLHF 的位置&quot;,&quot;url&quot;:&quot;#一先回顾-sft-和-rlhf-的位置&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、偏好数据格式很简单，数据含义不简单&quot;,&quot;url&quot;:&quot;#二偏好数据格式很简单数据含义不简单&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、偏好标注最容易出现什么问题&quot;,&quot;url&quot;:&quot;#三偏好标注最容易出现什么问题&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;把长度当质量&quot;,&quot;url&quot;:&quot;#把长度当质量&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;把语气当事实&quot;,&quot;url&quot;:&quot;#把语气当事实&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;偏好标准互相冲突&quot;,&quot;url&quot;:&quot;#偏好标准互相冲突&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;负样本太差&quot;,&quot;url&quot;:&quot;#负样本太差&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;四、DPO 的损失直觉&quot;,&quot;url&quot;:&quot;#四dpo-的损失直觉&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、训练前先处理 Token 和截断&quot;,&quot;url&quot;:&quot;#五训练前先处理-token-和截断&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、一个简化的训练流程&quot;,&quot;url&quot;:&quot;#六一个简化的训练流程&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、LoRA 能降低成本，但不能降低评测要求&quot;,&quot;url&quot;:&quot;#七lora-能降低成本但不能降低评测要求&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;八、DPO 训练中要盯哪些信号&quot;,&quot;url&quot;:&quot;#八dpo-训练中要盯哪些信号&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、训练后评测必须包含“不可偏好的”样本&quot;,&quot;url&quot;:&quot;#九训练后评测必须包含不可偏好的样本&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十、如何处理矛盾偏好&quot;,&quot;url&quot;:&quot;#十如何处理矛盾偏好&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十一、什么时候 DPO 不适合&quot;,&quot;url&quot;:&quot;#十一什么时候-dpo-不适合&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十二、我的总结：偏好优化是在教模型“更像你的团队”&quot;,&quot;url&quot;:&quot;#十二我的总结偏好优化是在教模型更像你的团队&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 18 Aug 2024 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>DPO</category><category>微调</category><category>偏好优化</category>
  </item>

  <item>
    <guid>https://www.hansking.cn/blog/2026pian-hao-you-hua-cong-RLHF-dao-DPO</guid>
    <title>偏好优化：从 RLHF 到 DPO</title>
    <link>https://www.hansking.cn/blog/2026pian-hao-you-hua-cong-RLHF-dao-DPO</link>
    <description>[{&quot;value&quot;:&quot;偏好优化：从 RLHF 到 DPO&quot;,&quot;url&quot;:&quot;#偏好优化从-rlhf-到-dpo&quot;,&quot;depth&quot;:1},{&quot;value&quot;:&quot;一、预训练和 SFT 解决了什么&quot;,&quot;url&quot;:&quot;#一预训练和-sft-解决了什么&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;二、偏好数据把绝对打分改成相对比较&quot;,&quot;url&quot;:&quot;#二偏好数据把绝对打分改成相对比较&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;三、奖励模型：把偏好变成一个分数&quot;,&quot;url&quot;:&quot;#三奖励模型把偏好变成一个分数&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;四、PPO 为什么被用于 RLHF&quot;,&quot;url&quot;:&quot;#四ppo-为什么被用于-rlhf&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;五、DPO 的直觉：直接让模型偏爱 chosen&quot;,&quot;url&quot;:&quot;#五dpo-的直觉直接让模型偏爱-chosen&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;六、三种路线放在一起看&quot;,&quot;url&quot;:&quot;#六三种路线放在一起看&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;七、为什么数据质量比算法名字更重要&quot;,&quot;url&quot;:&quot;#七为什么数据质量比算法名字更重要&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;偏好差异不清楚&quot;,&quot;url&quot;:&quot;#偏好差异不清楚&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;chosen 只是更长&quot;,&quot;url&quot;:&quot;#chosen-只是更长&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;rejected 过于糟糕&quot;,&quot;url&quot;:&quot;#rejected-过于糟糕&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;任务标准不一致&quot;,&quot;url&quot;:&quot;#任务标准不一致&quot;,&quot;depth&quot;:3},{&quot;value&quot;:&quot;八、偏好优化会带来哪些副作用&quot;,&quot;url&quot;:&quot;#八偏好优化会带来哪些副作用&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;九、KL 约束为什么重要&quot;,&quot;url&quot;:&quot;#九kl-约束为什么重要&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十、离线偏好和在线反馈如何结合&quot;,&quot;url&quot;:&quot;#十离线偏好和在线反馈如何结合&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十一、什么时候选 RLHF，什么时候选 DPO&quot;,&quot;url&quot;:&quot;#十一什么时候选-rlhf什么时候选-dpo&quot;,&quot;depth&quot;:2},{&quot;value&quot;:&quot;十二、我的总结：对齐是持续校准，不是一次训练&quot;,&quot;url&quot;:&quot;#十二我的总结对齐是持续校准不是一次训练&quot;,&quot;depth&quot;:2}]</description>
    <pubDate>Sun, 04 Aug 2024 10:00:00 GMT</pubDate>
    <author>admin@hansking.cn (HANS)</author>
    <category>AI</category><category>LLM</category><category>RLHF</category><category>DPO</category><category>对齐</category>
  </item>

    </channel>
  </rss>
