如何通过多模型投票与校准解决法官模型偏见? 一个LLM法官给同一份回答打了9分,换一个模型只给5分,这种分歧并不是随机噪声,而是系统性偏见在起作用。法官模型在评估生成内容时,会偏好某些表达风格、答案长度或特定立场,单靠一个模型很难得到稳定结论。多模型投票把多个异构大模型作为独立评审,通过多数表决或加权融合来抵... 栏目:AI智能体 时间:08-28 法官模型偏见 多模型投票 模型校准