面对一个开放式的研究课题或内容整理任务,让Agent直接去互联网上扒资料,往往会带回成千上万个链接、文档片段和半结构化数据。仅靠关键词匹配和简单排序,真正能用得上的材料可能连十分之一都不到,大量时间浪费在翻页和人工甄别上。这个痛点的根源,在于传统搜索模式试图一步到位从海量信息里捞出正确答案,却没有在中间环节做足“减负”和“提纯”的功夫。

解决思路其实可以很直接:让Agent先“生成”一批可能相关的材料雏形或摘要,再用一套筛选规则把这些生成结果里的水分挤干净。这个想法听上去有些反直觉——本来材料就很多,怎么还要再生成一批?关键就在于,生成不是胡编乱造,而是用一种结构化的方式把检索意图翻译成具体的文本、问题或元数据,再拿这些产物去匹配和唤醒真正需要的信息。这样一来,搜索就从“大海捞针”变成了“对着草图找零件”,针对性和可控性都会强很多。
生成环节:把模糊需求转成可操作的材料模板
很多任务交给Agent时,描述其实相当模糊,比如“找一些关于新能源电池回收的最新政策和技术动态”。直接拿这句话去搜,结果必定五花八门。生成环节要做的第一件事,是把这类模糊需求拆解成多个可以独立检索的子任务,并为每个子任务生成一组具体的“材料模板”。
举个例子,可以先用大模型把原始需求展开,生成几个维度的细分问题:“中国2024年发布的动力电池回收法规有哪些”“梯次利用的技术难点和产业化进展”“欧美在电池护照和信息追溯方面的政策要求”等等。这相当于用生成能力做了一次任务规划,把一个大而化之的需求切成了几个有明确边界的搜索单元。再深一步,还能为每个搜索单元生成几条指向性较强的搜索语句,直接当成高级检索的输入参数。
这种做法还有一个额外好处:它能提前暴露需求本身的模糊之处。比如当模型尝试生成“政策法规”相关的搜索语句时,如果发现不知道应该聚焦在哪个国家或哪类电池,就会自动追问或标注信息缺口。这比人工发现问题再去补救要高效得多,也避免了Agent埋头搜了半天才发现方向跑偏。
初筛:用生成摘要代替直接浏览
当Agent拿回第一批原始材料时,最常见的问题就是数量庞大且质量参差不齐。让Agent逐篇打开链接、阅读理解再判断相关性,耗时不说,还特别容易因为上下文窗口限制而丢掉长文档里的关键段落。更聪明的做法是,在拿到链接或页面标题后,先让模型为每一篇材料生成一段三五句话的总结摘要,摘要里必须包含“这篇材料主要讲了什么”和“它可能对当前任务有什么用处”这两个固定维度的信息。
有了这批摘要,下一步的筛选就可以做得非常快。可以直接用规则过滤掉摘要里带有明显不相关标记的内容,比如任务要求找技术路线,摘要里却反复提到市场销售数据和消费者调查;也可以用模型的embedding向量对摘要做一次语义相似度排序,只保留与原始需求最接近的前30%或前50项。这一步相当于在进入精读之前,先做了一次快速体检,把明显不健康的部分过滤掉,留下具备基本相关性的候选池。
实际使用中发现,这种生成摘要配合向量排序的做法,能够把最终需要人工或Agent精读的材料数量压缩到原来的五分之一甚至十分之一,而且保留率高得惊人,很少会出现因为过滤太激进而导致重要信息丢失的情况。原因在于,摘要生成模型本身具备一定的信息提取和归纳偏好,会自然地突出与任务相关的维度。
精筛与迭代:引入反馈信号,让筛选越来越准
经过初筛的材料集合虽然干净了许多,但仍会混入一些“看起来相关、实际上没有实质内容”的噪音。这时候就需要引入反馈机制,让筛选过程形成闭环。具体做法是,让Agent对初筛后的材料进行精读,并尝试回答与任务相关的几个验证性问题,比如“这篇材料中是否包含具体的工艺参数”“是否提到了某类政策的生效时间节点”。如果发现材料里找不到这些预期信息,就给这条材料打上“信息不足”的标签,同时把这个标注结果反馈回筛选模型。
这种反馈可以很简单,比如调整embedding相似度计算的权重,让筛选模型学会把“包含具体数据”“有明确出处”这类特征放到更高的优先级上。也可以把被标记为高质量的几篇材料挑出来,作为正样本,让模型用few-shot的方式重新调整后续的筛选偏好。经过两三轮这样的迭代后,整个筛选管道就会越来越适应具体的任务特点,漏检率和误检率都会明显下降。
这里有一个容易被忽视的细节:验证性问题的设计直接决定了精筛质量。问题不能太泛,否则模型自己也答不准;也不能太窄,否则会把大量有价值但表述方式不同的材料误伤。比较稳妥的做法是,结合第一步生成的子任务目标,为每个搜索单元设计三到五个核心信息检查点,比如“是否提及技术成熟度等级”“是否包含对比实验数据”“是否有明确的实施建议”等,让筛选过程有据可依。
把生成和筛选串成流水线
将上述步骤连接起来,就形成了一套可复用的材料搜索流水线:任务分解与搜索语句生成、原始检索、摘要生成与向量排序、精读验证与反馈调整。这种流水线式的结构很容易用LangChain或自建Agent框架来实现,每一环节的输出作为下一环节的输入,中间可以插入缓存和人工确认节点,让整个流程既自动化又保留必要的可控性。
在一些对材料可靠性要求极高的场景,比如专利检索、法律文书查阅和学术文献整理中,还可以在流水线末端增加一个“来源交叉验证”模块。让Agent对筛选出的核心材料做横向比对,看看不同来源对同一事实的描述是否一致,如果不一致则标记出来供人工判断。这样一来,生成和筛选就不只是提升效率的手段,也成了保障材料质量的一道防线。
总的来说,材料搜索的症结从来不是找不到信息,而是找不到“刚刚好需要的那几条信息”。用生成能力把任务意图翻译成可操作、可比较、可验证的中间产物,再让筛选流程围着这些中间产物做文章,搜索压力自然就会从Agent的肩膀上卸下来。这套思路普适性很强,不管是日常的内容整理、市场调研,还是专业的科技情报追踪,都能在不大幅改动现有工具栈的前提下落地使用。