检索增强生成与微调结合时,一个常被忽视的问题是数据形态不匹配。普通微调数据只有问题与答案,而结合检索后输入中多了上下文文档,模型必须重新学习注意力分配。若直接用拼接文档的样本训练,模型会倾向于把所有检索内容当作可信信息,导致在检索结果包含噪声时产生错误回答。因此,解决结合策略难的关键在于构造专门的检索增强微调数据。

一、检索增强与微调结合的核心矛盾
检索增强生成的核心思想是给模型提供外部知识,让它不再只依赖参数记忆。但微调阶段的训练样本如果只是简单地把问题和检索文档拼在一起,模型会学到一种危险的捷径:只要输出中出现了某个文档片段,就倾向于复制该片段,而不进行独立判断。当检索系统返回了部分相关或完全不相关的文档时,这种机制会导致答案被无关信息带偏。
另一个矛盾来自数据分布偏移。预训练阶段模型很少见过由检索器拼接出来的长上下文格式,突然在微调时大量输入这种格式,模型需要重新适应位置编码和注意力范围。如果不能通过数据构造让格式变化平滑过渡,模型可能在微调初期就陷入局部最优,表现为训练损失下降但验证集效果没有提升。
解决这个矛盾不能只靠增加数据量,而要从样本设计上让模型理解检索结果的角色。也就是说,每条训练样本都需要明确告诉模型:哪些上下文是可信的,哪些是干扰,以及当上下文不足时应当如何拒绝回答。
二、检索增强微调数据的设计原则
第一条原则是正负样本混合。每个训练样本中除了包含与问题相关的文档,还必须掺入一定数量的无关文档。无关文档可以来自同一知识库的其他主题,也可以是从通用语料中随机抽取的句子。这样模型才能学会忽略不相关内容,而不是把所有检索到的文本都当成答案来源。实际构造时,可以用规则判断文档相关性,也可以借助已有的相似度分数设置阈值。
第二条原则是使用明确的上下文标记。在输入序列中用特殊标记把检索结果包裹起来,例如用<context>和</context>表示上下文边界,用<doc>和</doc>区分不同文档。这些标记在微调时被固定下来,推理阶段继续使用相同格式,可以减少模型对格式的困惑。注意这些标记不能与已有词表冲突,可以选择低频符号或新增特殊token。
第三条原则是保留无检索场景。训练数据中应当包含一部分完全没有上下文的普通问答样本,以及一部分上下文为空但模型仍需要依靠自身知识回答的样本。这样可以防止模型过度依赖检索结果,在检索系统不可用或返回空列表时依然保持可用的生成能力。
下面给出一个构造训练样本的Python脚本,它随机插入干扰文档并生成统一格式的提示。
import json
import random
def build_sample(question, answer, relevant_docs, irrelevant_docs, use_irrelevant=True):
context_parts = []
for doc in relevant_docs:
context_parts.append(f"<doc>{doc}</doc>")
if use_irrelevant and irrelevant_docs:
selected_irrelevant = random.sample(
irrelevant_docs,
min(len(irrelevant_docs), random.randint(1, 3))
)
for doc in selected_irrelevant:
context_parts.append(f"<doc>{doc}</doc>")
random.shuffle(context_parts)
context = "\n".join(context_parts)
prompt = (
"基于以下检索结果回答问题:\n"
f"<context>\n{context}\n</context>\n"
f"问题:{question}\n答案:"
)
return {"prompt": prompt, "completion": answer}
sample = build_sample(
"什么是反向传播?",
"反向传播是一种通过链式法则计算神经网络梯度的方法。",
relevant_docs=["反向传播算法利用链式法则逐层计算损失对权重的偏导数。"],
irrelevant_docs=["今天天气晴朗,适合户外活动。", "股市近期波动较大。", "苹果富含维生素。"],
use_irrelevant=True
)
print(json.dumps(sample, ensure_ascii=False, indent=2))
该脚本的核心在于将相关文档和随机数量的干扰文档混合后打乱顺序,再放入统一的上下文标记中。这样模型在训练时会看到不同位置、不同数量的干扰信息,从而学会动态筛选内容。
三、训练脚本与关键实现细节
训练时可以直接使用大模型的指令微调框架,例如HuggingFace的transformers配合LoRA进行参数高效微调。训练损失仍然使用标准的因果语言建模损失,但建议将输入部分和输出部分分开处理,只对答案部分计算损失,避免模型在上下文区域浪费学习容量。具体实现中可以通过设置labels的忽略索引来完成。
下面是一个基于LoRA的简化训练示例,假设已经准备好了包含prompt和completion字段的数据集。
from transformers import AutoTokenizer, AutoModelForCausalLM, TrainingArguments, Trainer
from peft import LoraConfig, get_peft_model
model_name = "Qwen/Qwen2.5-7B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name, device_map="auto")
lora_config = LoraConfig(
r=16,
lora_alpha=32,
target_modules=["q_proj", "v_proj", "k_proj", "o_proj"],
lora_dropout=0.05,
bias="none",
task_type="CAUSAL_LM",
)
model = get_peft_model(model, lora_config)
model.print_trainable_parameters()
training_args = TrainingArguments(
output_dir="./raft_lora",
per_device_train_batch_size=1,
gradient_accumulation_steps=8,
num_train_epochs=3,
logging_steps=10,
save_steps=200,
learning_rate=2e-4,
bf16=True,
remove_unused_columns=False,
)
trainer = Trainer(
model=model,
args=training_args,
train_dataset=dataset,
tokenizer=tokenizer,
)
trainer.train()
在实际训练中,上下文长度往往超过常规的2048个token,需要根据检索文档的长度调整模型的最大序列长度,并开启合适的注意力计算方式。同时要注意检索器的召回结果不能作为训练集的唯一来源,否则模型只会适应特定检索器的错误模式。
另一个关键细节是训练数据和推理数据使用完全相同的上下文标记和拼接方式。如果训练时用特殊标记包裹文档,推理时也必须保持同样格式,否则模型会把未知格式当作普通文本,检索增强的效果会大打折扣。
四、评估与落地建议
评估检索增强微调模型不能只看单一指标。除了常规的答案准确率,还需要单独评估引用正确率,即模型是否只在需要时引用检索文档,并且引用内容确实与答案相关。可以构造一组包含干扰文档的测试集,观察模型是否会被无关文档误导。如果模型在加入干扰文档后准确率大幅下降,说明数据构造中的负样本还不够充分。
落地时建议采用分阶段策略:先用少量高质量的正负样本微调一个基础模型,观察它在干扰文档测试集上的表现,再逐步扩大数据规模。数据规模不需要很大,一千到数千条精心构造的样本往往比数万条粗糙拼接的样本更有效。
最后要注意检索器与生成器的协同更新。如果条件允许,可以在微调生成器后,利用生成器的反馈调整检索器的排序参数,让检索器更倾向于返回与最终答案相关的文档。这种闭环优化能够进一步稳定检索增强效果,避免检索结果与生成能力脱节。