Meta 提出无需额外训练的检索 Agent SIRA,将 LLM 的领域知识 + 轻量级语料统计(文档频率)注入 BM25,单次检索调用超越 dense retriever、SPLADE 和多轮 agentic 搜索。
作者: Zeyu Yang, Qi Ma, Jason Chen, Anshumali Shrivastava — Meta Superintelligence Labs / Rice University 论文: arXiv<2605>2605>.06647 代码: github.com/facebookresearch/sira(即将发布)
核心定义
SIRA 把「超级智能检索」定义为:将多轮试探性搜索压缩成一次语料区分性(corpus-discriminative)检索动作的能力。
多轮 RAG Agent 常从检索结果中提取词汇,再改写查询继续搜索(retrieval-context advantage)。SIRA 则利用 LLM 的领域知识,在首次搜索前预测能区分目标文档与干扰文档的词汇。
两阶段流水线
1. 离线端:语料侧扩充(Corpus-Side Enrichment)
- LLM 逐篇读文档,生成该文档「缺失的搜索词汇」:同义词、缩写、别名、领域术语
- 通过 DF 过滤器:
DF ≤ τ·|C|剔除过于常见的无用词 - 通过 n-gram 滑窗注入 BM25 倒排索引,提高文档被相关查询命中的机会
- Prompt 是任务感知的:事实核查强调实体别名,论据检索强调对立面词汇,重复检测强调意图保留的同义词
2. 在线端:查询侧扩充(Query-Side Enrichment)
- Expected-Response Sketch:LLM 先预判目标证据文档可能包含的概念、实体、区分性术语
- DF 验证:
DF > 0(确保词在索引中存在)+DF ≤ τ·|C|(防过于常见) - 编译检索程序:加权关键词 + 约束条件 → 单次 BM25 调用
最终检索得分为:
score(d) = BM25(q_orig, d) + w · BM25(q_exp, d)实验结果
BEIR 10 个 benchmark 平均结果
| 方法 | Recall@10 | NDCG@10 | 备注 |
|---|---|---|---|
| BM25 | 0.530 | 0.425 | 稀疏基线 |
| SPLADE | 0.625 | 0.522 | 学习稀疏 |
| E5 (dense) | 0.648 | 0.543 | 有监督 dense |
| Search-R1 (RL) | 0.616 | 0.522 | RL 训练多轮搜索 |
| GrepRAG | 0.280 | 0.209 | 同 LLM 骨干的 grep 式搜索 |
| SIRA | 0.691 | 0.572 | 无需额外训练、单次 BM25 |
- 在 10 个数据集中有 8 个领先(NQ 略逊 Search-R1 0.06pp,Quora 略逊 E5 0.4pp)
- 提升最大的是「查询-文档词汇差异大」的场景:SciDocs +36%、CQADupStack +23%、ArguAna +14%
下游 QA(NQ + HotpotQA)Answer Coverage
SIRA 纯检索的 answer coverage 超过 6 个 RL 训练的端到端 QA agent:
| 任务 | SIRA Top-10 | SIRA Top-5 | 最强基线 |
|---|---|---|---|
| NQ | 84.7% | 80.4% | HiPRAG 71.2% |
| HotpotQA | 77.6% | 73.1% | E-GRPO 69.0% |
注意:SIRA 是纯检索无 reader,而基线是完整 QA 流水线(含训练过的搜索策略 + 答案生成器),SIRA 仅在检索文本包含标准答案字符串时才算对。
SIRA 的收益来源
- BM25 透明可控 — 可加权关键词、加排除约束、结构化组合,不同于 dense embedding 的黑箱
- IDF 天然奖励稀有区分词 — 领域术语在 dense embedding 里被稀释,在 BM25+IDF 下却是强力信号
- DF 过滤是关键 — 过滤语料中不存在(DF=0)或过于常见的预测词
- 不依赖 retrieval-context advantage — SIRA 在首次检索前构造区分性词汇,减少对多轮结果反馈的依赖
局限性
- 假设 LLM 对目标语料领域有足够的预训练知识。如果语料分布远在 LLM 知识范围之外,可能需要先做语料适应或微调
- 未在 LLM 预训练分布外的领域验证
关键洞察
SIRA suggests a different path for retrieval-augmented agents. Rather than making agents search longer and accumulate more context, we can make the retrieval action itself more expert, corpus-aware, and interpretable.
SIRA 展示了另一种改进方向:结合领域知识与语料统计,提高单次检索的准确性,减少反复搜索。