logo
DPO
  1. DPO 实战:训练一个更符合业务偏好的模型

    AI
    LLM
    DPO
    微调
    偏好优化
  2. 偏好优化:从 RLHF 到 DPO

    AI
    LLM
    RLHF
    DPO
    对齐