大模型搜索中知识图谱与实体关系对企业可见度的影响
2026/7/22 14:10:46
Chunk策略决定了RAG系统能够检索到什么、丢失什么,以及大模型最终看到多少完整上下文。固定长度分块实现简单但容易切断条款;递归字符分块通用性强;语义分块边界自然但成本较高;结构分块最适合制度、合同和技术文档,却依赖可靠的文档解析。本文从边界质量、实现成本、检索效果、元数据和适用文档等维度对比四种策略,并给出企业项目的组合方案。
Chunk过小:
Chunk过大:
理想Chunk应该满足:
语义相对完整 +主题相对单一 +包含必要条件 +适合Embedding模型 +可追溯到原文按照字符或Token数量切分:
每500 Token切一块 重叠100 Token伪代码:
deffixed_chunks(tokens:list[str],chunk_size:int,overlap:int)->list[list[str]]:chunks=[]start=0whilestart<len(tokens):end=start+chunk_size chunks