背景:经验别只躺在老员工脑子里
事务所值钱的是"见过什么坑"。但经验常散在老员工的 Excel、往年底稿、零散笔记里。把审计知识沉淀成可检索的系统,是"AI审计平台"常见的卖点。工程上,知识检索有三条主流路线:关键词倒排、向量库(Embedding 检索)、知识图谱。它们的取舍,决定了你问"收入确认该看哪些凭证"时,系统能不能答对。
三方案对比
| 维度 | 关键词倒排(Inverted Index) | 向量库(Vector/ embeddings) | 知识图谱(KG) |
|---|---|---|---|
| 匹配方式 | 字面命中 | 语义相似 | 关系跳转 |
| 问"收入确认要点" | 需含关键词"收入" | 能召回"营收/确认条件"相关 | 能沿"收入→准则→凭证类型"跳转 |
| 建库成本 | 极低 | 中(需切片+向量化) | 高(需抽取实体关系) |
| 更新成本 | 低 | 低(重算片段) | 高(改 schema) |
| 可解释 | 强(命中原文) | 弱(相似度黑盒) | 强(路径可查) |
| 适合内容 | 制度原文、模板 | 非结构化经验、案例 | 准则-科目-凭证的关联 |
关键词倒排:便宜但死板
Elasticsearch/Lucene 一类,按词建索引。问"函证控制"能精确返回含该词的段落。优点是可解释、零算力、即建即用;缺点是字面匹配——你写"询证函"它就搜不到"函证",同义词、缩写全抓瞎。适合放"制度原文、模板、底稿规范"这类术语稳定的内容。
向量库:语义检索的甜点区
把文档切片成 chunk,用 embedding 模型转向量,查询时算余弦相似。问"怎么防止函证被截留",即使原文写的是"函证回函应直接寄回事务所",也能语义召回。代价是"黑盒"——相似度高的段落未必真相关,且中文 embedding 对专业术语(如"其他收益"与"营业外收入")区分度有限,需要领域微调或混合检索(向量+关键词)兜底。
知识图谱:关系型问题的答案
图谱把"准则条款—会计科目—常见错报—对应凭证"连成节点边。问"收入截止性错报通常看哪些凭证",图谱能沿关系跳出具体清单。代价是构建贵:实体抽取、关系标注、消歧都要人工或模型参与,schema 一变全盘重来。中小所通常先用倒排+向量打底,图谱留到数据量足够、问题确实"关系密集"时再上。
落地建议
- 起步:制度/模板用倒排索引,立刻可用。
- 进阶:经验案例、往年底稿用向量库,配混合检索降误召。
- 谨慎上图谱:只有当"关系跳转"类问题频繁出现、且有专人维护时才投入。
- 无论哪种,都要让人能"看到原文出处"——审计结论要可溯源,黑盒检索只能当线索。
以审小匠为例,其审计知识能力多建立在"检索增强(RAG)+ 领域规则"之上:先召回相关上下文再让模型作答,既补了倒排的字面短板,又用原文锚定抑制幻觉。但这套能力同样依赖你喂进去的知识是否干净——垃圾进垃圾出。
小结
知识库不是"越大越好",而是"问得出答得准"。倒排管字面、向量管语义、图谱管关系,按内容类型分层建,比一把梭建大模型更务实。