文档/项目

项目

论文与基准

SAG 原创架构、查询时动态超边与公开多跳检索结果。
更新于 2026-07-22适用于 SAG v1.2.2

SAG 的论文题为 SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges,由 Yuchao Wu、Junqin Li、XingCheng Liang、Yongjie Chen、Yinghao Liang、Linyuan Mo 与 Guanxian Li 完成。

SAG 论文首页SAG 论文首页

原创的第三种架构

传统稠密 RAG 主要按语义相似度召回 chunks。GraphRAG 需要离线抽取三元组、合并实体、归一关系并维护全局图;增量更新也可能触发额外图维护。

SAG 用 event-entity 索引和查询时动态超边替代两套系统的拼接:

  • 一个 chunk 对应一个语义完整 event;
  • 一个 chunk 可以包含多个索引 entities;
  • SQL 在当前查询周围连接共享实体的 events;
  • 只实例化局部需要的超边;
  • 最终输出仍映射回原始 chunks。

公开结果

在相同的 BGE-Large-EN-v1.5 Embedding 与 Qwen3.6-Flash LLM 配置下,SAG 在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 的 9 项 Recall@1/2/5 指标中取得 8 项最佳结果。

数据集方法Recall@1Recall@2Recall@5
HotpotQASAG47.80%91.55%96.50%
HotpotQAHippoRAG 244.40%78.35%94.35%
2WikiMultiHopQASAG43.53%82.30%88.00%
2WikiMultiHopQAHippoRAG 242.38%76.55%90.35%
MuSiQueSAG36.17%64.05%80.04%
MuSiQueHippoRAG 230.65%49.52%65.13%
平均SAG42.50%79.30%88.18%
平均HippoRAG 239.14%68.14%83.28%

如何理解指标

Recall@k 衡量前 k 个结果中是否召回目标证据。多跳问答通常需要在很小的候选集合里同时命中关键证据,因此 Recall@2 与 Recall@5 对 Agent 上下文成本尤其重要。

基准结果应结合论文设置与复现脚本阅读。模型、数据预处理、索引参数或评测实现变化都会影响数值,不应直接与不同设置下的结果横向拼接。

从论文到产品

公开 SAG 应用在研究架构之外增加了文档解析、后台任务、用户与 JWT、带引用生成、MCP、OpenAI 兼容接口、桌面客户端和多种生产存储后端。

论文解释检索方法,产品仓库展示如何把方法变成一套可运行、可核验的知识库。

发现内容问题?以当前公开仓库为准。查看 SAG 源码