分块直接影响检索精度:块太大,嵌入向量主题稀释、噪声多,且占用上下文;块太小,语义不完整、缺乏上下文。常见策略由浅入深:固定长度切分(按字符/token 数,加 10-20% 重叠避免边界截断语义);按结构递归切分(先按章节、段落、句子层级递归切,保持自然边界,是主流默认);语义切分(用嵌入相似度检测话题转换点);文档结构感知切分(Markdown 按标题层级、表格单独成块、代码不切散)。
块大小经验值:通用知识库 256-512 token 起步,配合查询类型调——事实型问答小块更精准,需要综合理解的大块更好。进阶做法是父子块:小块用于检索命中,返回时带上所属的更大父块喂给模型,兼顾精度与上下文完整。
易错点:忽视元数据(标题、来源、时间)与块一起嵌入和过滤的价值;表格和图文混排需要专门解析。追问方向:如何评估分块质量(检索命中率、端到端回答正确率)?