:文档处理与向量化——chunk 切分策略与 embedding 模型选型)
一、前言RAG 效果的上限,一大半在"建库"阶段就决定了:切分方式决定"能不能检索到",embedding 模型决定"检索得准不准"。本篇讲透 chunking 策略与向量化选型,给 014 的实战打地基。二、核心概念通俗拆解2.1 为什么要切分(chunking)三个原因:embedding 模型有输入长度上限;块太大 → 一整篇文档压成一个向量,语义被稀释,什么问题问它都"半相关";块太小 →上下文不完整,"满三年 10 天"里的主语和条件被切丢。块太大:10 块大块,每块都半相关 → 排序区分度差 块太小:50 块碎片,答案被切成两半 → 检索到了也答不全 理想:一块 = 一个完整语义单元(一条制度、一个段落)2.2 四种切分策略策略做法适用固定长度滑窗每 chunk_size 字切一刀,相邻块重叠 overlap简单通用,兜底方案按段落/条目