做过 RAG 的人都懂那套流程有多累:PDF、Word、Excel 先解析,再切片、算 embedding,然后灌进向量库。索引建完半小时过去了,文件一改还得重跑。更麻烦的是,检索捞出来的经常是碎片——答不上来的时候,你都不知道到底是模型笨,还是上下文早被切没了。

Sirchmunk 干脆把这层直接撤了。它的判断是:切片等于把文章拦腰砍断,向量化等于把内容压成一串数字,而压缩就有损失;大模型本来就能读原文,何必先去看残骸?于是它靠关键词和文件路径一层层把范围收窄,先锁定是哪一段,再去读那一段。装完 pip、指向你的目录就能开口提问——比如「这鉴权在哪实现的」「去年那份合同付款条件怎么写的」。

配一个 OpenAI 兼容的接口即可使用。Deep 模式十几二十秒就能交出带原文出处的报告,Fast 模式两三秒就出结果。搜完的结果不会丢,会沉淀成一层层的知识树;同样的问题再问一遍,直接命中缓存,省下 Token。数据全程留在自己机器上,模型也可以换成本地的,Docker 四核 2G 就能跑,Apache 2.0 协议可商用。

做 AI 知识库和 RAG 的兄弟可以去试试,建议先拿你最头疼的那个老仓库,问它五个问题。