Posts tagged with #RLHF

1 post found

DPO

DPO 是用来让模型和人类需要的偏好进行对齐的开发方法。在传统的 RLHF 中,我们需要用四个模型:Actor,Reference,Reward 与 Critic,这给显存带来和很大压力。而 DPO 跳过了“训练奖励模型”和“强化学习”这两个阶段,通过一个数学上的等价变换,直接**利用 Chosen(优) 和 Rejected(劣) 数据**对来更新模型。 首先先看最原始的...