856 字
4 分钟
SIRA: Superintelligent Retrieval Agent

Meta 提出无需额外训练的检索 Agent SIRA,将 LLM 的领域知识 + 轻量级语料统计(文档频率)注入 BM25,单次检索调用超越 dense retriever、SPLADE 和多轮 agentic 搜索。

作者: Zeyu Yang, Qi Ma, Jason Chen, Anshumali Shrivastava — Meta Superintelligence Labs / Rice University 论文: arXiv<2605>.06647 代码: github.com/facebookresearch/sira(即将发布)


核心定义#

SIRA 把「超级智能检索」定义为:将多轮试探性搜索压缩成一次语料区分性(corpus-discriminative)检索动作的能力。

多轮 RAG Agent 常从检索结果中提取词汇,再改写查询继续搜索(retrieval-context advantage)。SIRA 则利用 LLM 的领域知识,在首次搜索前预测能区分目标文档与干扰文档的词汇。


两阶段流水线#

1. 离线端:语料侧扩充(Corpus-Side Enrichment)#

  • LLM 逐篇读文档,生成该文档「缺失的搜索词汇」:同义词、缩写、别名、领域术语
  • 通过 DF 过滤器:DF ≤ τ·|C| 剔除过于常见的无用词
  • 通过 n-gram 滑窗注入 BM25 倒排索引,提高文档被相关查询命中的机会
  • Prompt 是任务感知的:事实核查强调实体别名,论据检索强调对立面词汇,重复检测强调意图保留的同义词

2. 在线端:查询侧扩充(Query-Side Enrichment)#

  1. Expected-Response Sketch:LLM 先预判目标证据文档可能包含的概念、实体、区分性术语
  2. DF 验证:DF > 0(确保词在索引中存在)+ DF ≤ τ·|C|(防过于常见)
  3. 编译检索程序:加权关键词 + 约束条件 → 单次 BM25 调用

最终检索得分为:

score(d) = BM25(q_orig, d) + w · BM25(q_exp, d)

实验结果#

BEIR 10 个 benchmark 平均结果#

方法Recall@10NDCG@10备注
BM250.5300.425稀疏基线
SPLADE0.6250.522学习稀疏
E5 (dense)0.6480.543有监督 dense
Search-R1 (RL)0.6160.522RL 训练多轮搜索
GrepRAG0.2800.209同 LLM 骨干的 grep 式搜索
SIRA0.6910.572无需额外训练、单次 BM25
  • 在 10 个数据集中有 8 个领先(NQ 略逊 Search-R1 0.06pp,Quora 略逊 E5 0.4pp)
  • 提升最大的是「查询-文档词汇差异大」的场景:SciDocs +36%、CQADupStack +23%、ArguAna +14%

下游 QA(NQ + HotpotQA)Answer Coverage#

SIRA 纯检索的 answer coverage 超过 6 个 RL 训练的端到端 QA agent:

任务SIRA Top-10SIRA Top-5最强基线
NQ84.7%80.4%HiPRAG 71.2%
HotpotQA77.6%73.1%E-GRPO 69.0%

注意:SIRA 是纯检索无 reader,而基线是完整 QA 流水线(含训练过的搜索策略 + 答案生成器),SIRA 仅在检索文本包含标准答案字符串时才算对。


SIRA 的收益来源#

  1. BM25 透明可控 — 可加权关键词、加排除约束、结构化组合,不同于 dense embedding 的黑箱
  2. IDF 天然奖励稀有区分词 — 领域术语在 dense embedding 里被稀释,在 BM25+IDF 下却是强力信号
  3. DF 过滤是关键 — 过滤语料中不存在(DF=0)或过于常见的预测词
  4. 不依赖 retrieval-context advantage — SIRA 在首次检索前构造区分性词汇,减少对多轮结果反馈的依赖

局限性#

  • 假设 LLM 对目标语料领域有足够的预训练知识。如果语料分布远在 LLM 知识范围之外,可能需要先做语料适应或微调
  • 未在 LLM 预训练分布外的领域验证

关键洞察#

SIRA suggests a different path for retrieval-augmented agents. Rather than making agents search longer and accumulate more context, we can make the retrieval action itself more expert, corpus-aware, and interpretable.

SIRA 展示了另一种改进方向:结合领域知识与语料统计,提高单次检索的准确性,减少反复搜索。

SIRA: Superintelligent Retrieval Agent
https://blog.lpkt.cn/posts/papers/sira-superintelligent-retrieval-agent/
作者
lollipopkit
发布于
2026-05-08
许可协议
CC BY-NC-SA 4.0