Embedding 文本切块时怎么避免把一个事实拆开
Embedding 切块最容易踩的坑,是按固定字符数一刀切:前半段留下“订单满 99 元”,后半段才出现“会员日除外”,向量检索命中了价格,却丢了限制条件。更稳妥的做法是先识别事实单元,把主体、条件、动作与结果、例外尽量放进同一个 chunk;只有单元超过模型输入限制时,才在句子或从句边界拆分,并用适量 overlap 衔接。
切分边界应由语义结构决定,固定长度只是容量约束。每个 chunk 还要保留标题路径、原文位置和事实类型,否则即使召回了正确片段,也很难恢复它适用的条件。
- 先保护“主体—条件—动作/结果—例外”这条事实链,再考虑字符数或 token 数。
- 标题、段落、列表、表格是优先边界;超长事实在句子边界拆分,并谨慎设置 overlap。
- chunk 文本、原文路径、事实类型和 embedding 向量一起入索引,用固定问题集验证召回。
先按语义单元确定切分边界
先把文档解析成标题、段落、列表项和表格行,再判断每个单元是否表达了一个可独立引用的事实。一个完整事实通常至少包含主体和结论;如果“只有在”“除非”“不适用于”等条件另起一段,条件也应被视为事实的一部分。
| 文本组成 | 切分判断 | 常见遗漏 |
|---|---|---|
| 主体与动作 | 尽量放在同一 chunk | 只留下“可退款”,丢掉适用对象 |
| 条件与例外 | 与结论相邻保留 | 命中主规则却误用到例外场景 |
| 标题与章节路径 | 复制到 chunk 元数据或前缀 | 召回后不知道事实属于哪个主题 |
| 列表与表格 | 按完整项或完整行处理 | 把字段名和字段值拆到不同片段 |
下面的伪代码展示一个最小判断思路。它不是通用分词器,重点是把“结构边界优先”落实成可检查的规则:
# 先按结构单元收集文本,避免把条件句单独切走
units = parse_markdown_sections(document)
chunks = []
for unit in units:
# 标题路径和事实正文一起保存,便于召回后解释来源
text = unit.heading_path + "\n" + unit.body
if token_count(text)

超长事实怎么拆才不会丢掉条件
固定长度切分有一个合理用途:控制 embedding 模型的输入上限和索引成本。但它不应直接切断句子。Microsoft 的 Azure AI Search 文档把固定长度、按句子或结构切分、语义切分列为不同策略,并建议用 overlap 保留相邻片段的连续性;具体比例仍要根据文档形态和查询集评估。
实践中可以先固定 embedding 模型和问题集,设置一组较小的 overlap 基线。如果一个事实由“定义—条件—例外”组成,先尝试让它整体进入 chunk;实在过长时,将定义与条件放在同一片段,并把例外的关键短语重复到下一片段。不要为了保险把整段背景复制到每个 chunk,否则重复文本会挤占召回后的上下文预算。
中文资料还要注意列表和表格:表头是字段语义,单独的数值行通常不可独立理解。与其把表格按字符截断,不如把“字段名 + 当前行 + 适用条件”组成一个记录,再为它附上章节路径。
让 chunk 在召回时仍能追溯事实来源
向量只是文本的检索表示,不是事实的完整档案。建议每条记录至少保存 chunk_text、document_id、heading_path、start_offset、fact_type 和 embedding。这样召回后可以回到原文核对条件,也能在重排时优先保留同一事实链的定义和例外。
例如查询“会员日能否退款”时,单独命中“支持退款”的 chunk 并不够;重排阶段还应把同章节的会员日限制纳入上下文。可用下面的清单判断切块是否完成:
- 命中片段是否包含事实主体,而不是只有代词或半句条件?
- 限制条件、例外和适用时间是否能通过路径或相邻 chunk 找回?
- 回答上下文是否保留原文位置,方便人工复核?

用固定问题集验证事实是否被拆散
不要只看 chunk 数量或向量相似度。准备三类问题:直接询问事实主体的问题、同时包含条件的问题、需要跨段拼接的问题。每次只改变切分策略,记录答案所需片段是否被召回、相邻候选的公共文本比例、上下文长度和原文可追溯性。
如果低 overlap 组丢失了条件,再增加一档;如果高 overlap 组只是返回更多相邻片段,却没有提高问题覆盖,就应回头修正文档结构或标题,而不是继续加重叠。切块参数应该服务于事实完整性和可验证的检索结果。
常见问题
chunk 越大,事实就越完整吗?
不一定。过大的 chunk 会混入多个主题,向量表示被稀释,召回后也更难定位答案。优先保持一个语义单元完整,再用问题集选择容量。
overlap 越大越安全吗?
不一定。它能减少边界丢句,却会增加重复文本、索引量和上下文长度。应比较新增事实覆盖,而不是只看重叠比例。
为什么一定要保存 heading_path?
因为同一句结论可能在不同章节有不同条件。标题路径能帮助重排、回答和人工复核恢复它的适用范围。
判断切块是否合格,可以记住一句话:先让事实完整,再让长度合适,最后让来源可追溯。这样调 embedding 和 RAG 参数时,问题才不会被错误地归因给模型本身。
Git partial staging 怎么只提交一个文件中的部分修改
- 上一篇
- Git partial staging 怎么只提交一个文件中的部分修改
- 下一篇
- Go strconv.AppendQuote 怎么低分配地拼接带引号字符串
-
- 科技周边 · 人工智能 | 2小时前 | 上下文 · ai agent · 记忆系统 · AI Agent 上下文工程 agent memory
- AI Agent 记忆为什么要区分短期上下文和长期存储
- 155浏览 收藏
-
- 科技周边 · 人工智能 | 8小时前 |
- Hugging Face Responses API 怎么同时发送文本和图片输入
- 392浏览 收藏
-
- 科技周边 · 人工智能 | 9小时前 |
- OpenAI Responses API 如何区分 output_text 和完整输出项
- 277浏览 收藏
-
- 科技周边 · 人工智能 | 10小时前 | openai · function calling · 结构化输出 · Responses API · OpenAI JSON Schema 工具调用 Responses API Structured Outputs
- OpenAI Responses API 如何让工具调用返回结构化结果
- 274浏览 收藏
-
- 科技周边 · 人工智能 | 13小时前 | 人工智能 · 模型路由 · 容错设计 · API降级 · 模型降级 Responses API GPT-6 Astra OpenAI API 限量开放
- GPT-6 Astra API 限量开放时如何设计模型降级路径
- 192浏览 收藏
-
- 科技周边 · 人工智能 | 16小时前 | 人工智能 · Hugging Face · LoRA · 大模型微调 · LoRa 微调数据集 对话格式 chat template messages
- LoRA 微调数据集里为什么要保留一致的对话格式
- 426浏览 收藏
-
- 科技周边 · 人工智能 | 17小时前 |
- AI 评测集怎么同时记录准确率和拒答质量
- 385浏览 收藏
-
- 科技周边 · 人工智能 | 19小时前 |
- Prompt 缓存命中率下降时怎么查前缀是否稳定
- 487浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 47次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 199次使用
-
- C-Eval
- 深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
- 134次使用
-
- AI Prompt Library
- 探索AI Prompt Library免费资源库,涵盖营销、写作及多场景AI提示词。兼容ChatGPT、Claude等工具,一键复制优化输出,提升工作效率。
- 67次使用
-
- Generrated
- Generrated汇集9300+张DALL·E生成图像及对应提示词,支持查看完整图集、对比DALL·E 2与3版本差异,是AI绘图新手学习Prompt设计与获取创作灵感的实用工具。
- 47次使用
-
- CodeGeeX for Jetbrains IDEs正式上线!
- 2023-01-17 284浏览
-
- 技术阿里云实现ocr批量图片和pdf文件表格图片转换excel文档/支持票据图片提取/普通图片文字提取处理
- 2023-01-18 387浏览
-
- 直播预告|FeatureStore Meetup V2
- 2023-01-10 328浏览
-
- 深入浅出特征工程 – 基于 OpenMLDB 的实践指南(上)
- 2023-02-25 426浏览
-
- 开源机器学习数据库OpenMLDB v0.4.0产品介绍
- 2023-01-10 147浏览
