如何通过梯度掩码与自适应权重调整解决ORPO梯度冲突? ORPO的训练目标是一步完成监督微调与偏好对齐,但两个子目标的梯度并不总在同一方向。正样本语言建模梯度会把token概率整体推高,而odds ratio偏好项为了拉开正负样本差距,可能在同一参数上产生相反更新。如果不加处理,冲突分量会被直接累加,导致收敛变慢、正样本概率波动,甚至... 栏目:AI大模型 时间:10-05 ORPO梯度冲突 梯度掩码 自适应权重调整