搜索模型不该只会重排,而要学会继续寻找|AI Engineer × Maximilian-David Rumpf

中文深度整理,非逐字翻译
原始标题
Where RL Will Take Search — Maximilian-David Rumpf, SID.ai
节目 / 来源
AI Engineer
嘉宾
Maximilian-David Rumpf
原始发布日期
2026-09-16
时长
约 9 分钟
内容类型
技术演讲 / 搜索与强化学习
原始内容
前往原始来源 ↗

先说结论

今天的检索系统有一个尴尬的分工:向量搜索很快但容易漏掉关键材料,重排器能判断候选好不好,却不能主动找出候选之外的答案;前沿模型做 Agent 搜索,质量可能明显更高,却要花几分钟、付出高得多的成本。Maximilian-David Rumpf 的方案是让搜索模型获得“看结果、发现不足、改变策略、再搜一次”的能力,并用强化学习训练这种可验证的循环。中文深度整理,非逐字翻译。

原始来源:Where RL Will Take Search。节目:AI Engineer。嘉宾:Maximilian-David Rumpf。原始日期:2026-09-16。时长:约 9 分钟。内容类型:技术演讲 / 搜索与强化学习。

这期内容在讨论什么

演讲从 Agent 搜索的成本问题开始。与传统检索相比,Agent 能理解更复杂的意图,也更可能找到正确文档,但它通常需要多轮思考和工具调用,成本高出几个数量级,延迟也从毫秒级变成分钟级。真正的目标不是把所有查询都交给大模型,而是保留更好的召回质量,同时把搜索过程压缩到生产系统可以承受的时间和价格内。

核心观点

第一,重排不是搜索的终点。重排器可以在已有候选中识别哪些文档更相关,却不能在候选集合之外创造新的搜索路径。如果第一轮查询方向错了,它最多把错误候选排得更好。一个能迭代的搜索模型,则可以把当前结果当作反馈,决定换关键词、增加约束、调整元数据过滤,或者从文档中的新线索继续追查。

第二,搜索比一般生成更适合强化学习。检索任务有相对明确的可验证结果:目标文档是否被找回、它排在什么位置、搜索用了多少步、延迟和成本是多少。模型可以通过这些信号学习“什么时候继续找、什么时候换方法、什么时候停止”,而不只是模仿一段看起来合理的搜索轨迹。

第三,专门的搜索模型可以保护主 Agent 的上下文。复杂搜索如果全部由主模型完成,会把大量中间查询、失败候选和检索噪声塞进上下文。一个受过训练的搜索子系统可以在自己的工作区里完成探索,只把最终证据和必要的理由交还给主 Agent。这样既减少上下文污染,也有机会使用更小、更便宜的模型。

推理链与关键例子

Rumpf 把搜索任务分成三个层次。向量检索提供快速的语义候选;重排器对候选进行更细的相关性判断;迭代式搜索模型则在发现证据不足时主动改变策略。第三层不是简单增加一次模型调用,而是改变搜索的控制流:模型要判断当前结果是否足够回答问题,并把失败本身变成下一轮查询的输入。

这类训练可以围绕文档答案构造奖励。找到正确文档、用更少的步骤完成任务、保持较低延迟,都可以成为可计算信号。演讲介绍的 SID-1 结果称,某些任务上并行搜索可以把平均时间从约两分钟压到约五秒,成本约为前沿模型的百分之一。这个数字依赖具体基准、模型配置和检索语料,不能直接外推到所有企业数据,但它说明“训练搜索策略”有可能比“让主模型一直想下去”更有效。

边界、保留意见与争议

强化学习首先要求可靠的奖励。如果答案文档本身不完整,或者一个问题需要组合多个来源,单一的“找到了哪个文档”就不足以评价搜索质量。模型可能学会投机地命中容易的线索,却没有真正覆盖需要的证据。

其次,速度和成本比较必须连同质量一起看。五秒的搜索如果漏掉关键法规,价值可能低于两分钟的高召回搜索;并行化降低了等待时间,却也会增加索引访问和并发容量压力。演讲的结果适合作为工程方向和基准设计的启发,而不是现成的 SLA 承诺。

整理后的观察

传统搜索系统往往把查询当成一次性的输入,把结果当成最终输出。Agent 搜索正在把它变成一个带有反馈的决策过程:先搜、读结果、判断缺口、再搜。这个变化的关键不在于让模型写更长的思考,而在于让它掌握何时应该继续探索、何时应该换路径、何时应该停止。

对企业知识库而言,最现实的落地方式可能是把这种能力封装成专门的检索子 Agent,而不是让所有业务 Agent 都自由调用前沿模型。把搜索预算、最大轮次、结果验证和停止条件写进系统,才能让高质量召回从一次演示变成可预测的基础能力。