推理模型Agent的安全对齐为什么会被绕过?如何构建多层次防御与行为监控体系? 大模型从单纯的对话工具演变为能自主调用工具、执行任务的Agent后,安全对齐面临全新挑战:攻击者不再只通过提示词注入诱导输出,而是利用长推理链、工具调用和环境交互中的盲区,让模型在多步执行中悄悄偏离对齐目标。本文从推理模型Agent对齐被绕过的常见路径入手,分析提示注入... 栏目:语言推理 时间:09-15 推理模型 Agent安全 行为监控