Posts tagged with #finetune

2 posts found

DPO

DPO 是用来让模型和人类需要的偏好进行对齐的开发方法。在传统的 RLHF 中,我们需要用四个模型:Actor,Reference,Reward 与 Critic,这给显存带来和很大压力。而 DPO 跳过了“训练奖励模型”和“强化学习”这两个阶段,通过一个数学上的等价变换,直接**利用 Chosen(优) 和 Rejected(劣) 数据**对来更新模型。 首先先看最原始的...

ReFT

> 生成:Gemini-2. 5-pro, 整理:fyerfyer 传统的参数高效微调(PEFT)方法,如 LoRA,其核心思路是**修改模型的“大脑结构”**,即通过更新或添加少量权重参数来让模型适应新任务。 而表征微调(Representation Finetuning,...