解决Agent重复调用:历史去重与行动多样性约束 当智能体在多步任务中反复执行同一动作,进度就会停滞,计算资源也被白白消耗。造成重复调用的原因通常有两个:观测信息没有变化导致策略收敛到局部最优,或者动作空间缺乏多样性约束。本文从两个层面给出解决方案:历史去重直接拦截近期出现过的动作或状态,行动多样性约束则在策略... 栏目:AI大模型 时间:10-04 Agent重复调用 历史去重 行动多样性