DPO April 10, 2026 634 words • 4 min read DPO 是用来让模型和人类需要的偏好进行对齐的开发方法。在传统的 RLHF 中,我们需要用四个模型:Actor,Reference,Reward 与 Critic,这给显存带来和很大压力。而 DPO 跳过了“训练奖励模型”和“强化学习”这两个阶段,通过一个数学上的等价变换,直接**利用 Chosen(优) 和 Rejected(劣) 数据**对来更新模型。 首先先看最原始的... #LLM#finetune#RLHF
ReFT September 6, 2025 1793 words • 9 min read > 生成:Gemini-2. 5-pro, 整理:fyerfyer 传统的参数高效微调(PEFT)方法,如 LoRA,其核心思路是**修改模型的“大脑结构”**,即通过更新或添加少量权重参数来让模型适应新任务。 而表征微调(Representation Finetuning,... #NLP#finetune