RAG 召回结果为什么总被长文淹没:Go 用分桶候选集和 rerank 阶段控制上下文预算
知识库上线后,最先暴露的往往不是模型不会回答,而是召回列表被一篇超长手册占满:前 8 个 chunk 来自同一个文档,真正有用的故障记录反而没有进入上下文。一个稳妥的改法是先扩大候选集,再按来源分桶限制配额,最后才做 rerank 和 token 预算裁剪。
分桶解决“谁有资格进入候选集”,rerank 解决“候选里谁更相关”,上下文预算则决定“最终交给模型多少内容”;三层职责不要混在一个分数里。
要点速览
- 先取 24 个候选,再按 source 分桶,每桶最多保留 3 个。
- rerank 只处理去重后的候选,最终按 1600 token 预算组装上下文。
- 召回评估至少同时观察 Recall@k 和最终上下文中的来源分布。
- 候选集本身没有包含证据时,rerank 不能凭空补回缺失内容。
长文为什么会挤掉真正有用的证据
向量检索按相似度返回结果时,长手册里的多个相邻切片可能都与问题相似。若直接取 topK,结果会出现“相似度很高,但来源单一”的假繁荣。Qdrant 的检索资料把召回与精排拆成两阶段:先用便宜的检索方法扩大候选,再把较小的候选集交给 reranker;这也是本文的架构边界。
这里的分桶不是把分数抹平,而是给同一来源设置代表名额。假设一次检索返回 24 个候选,每个来源最多留下 3 个,8 个名额就不会被同一份手册吃光。
先把候选集变成可控的分桶结构
示例只保留真实会参与后续流程的几个节点:retrieveCandidates 取回候选,bucketBySource 按来源分组,rerank 重新排序,buildContext 按预算拼接文本。生产代码可以把检索器和模型客户端换成真实实现,结构不需要跟着改变。
type Candidate struct {
ID string
Source string
Text string
Score float64
}
func selectCandidates(ctx context.Context, query string) ([]Candidate, error) {
raw, err := retrieveCandidates(ctx, query, 24)
if err != nil { return nil, err }
buckets := bucketBySource(raw)
limited := make([]Candidate, 0, 8)
for _, items := range buckets {
sort.Slice(items, func(i, j int) bool { return items[i].Score > items[j].Score })
if len(items) > 3 { items = items[:3] }
limited = append(limited, items...)
}
return limited, nil
}
这个控制流的关键不是数字 24 和 3 本身,而是两个边界:检索失败直接返回,来源配额发生在 rerank 之前。图片中的 retrieveCandidates、bucketBySource 和 rerank 必须按这条真实调用链理解。

把 rerank 放在分桶之后
分桶后的候选数量更小,rerank 才不会把计算预算花在同一来源的重复切片上。rerank 分数只负责排序,不应成为“是否允许进入候选集”的唯一门槛;否则一个来源的高分段落仍可能重新垄断结果。
func answerContext(ctx context.Context, query string) (string, error) {
candidates, err := selectCandidates(ctx, query)
if err != nil { return "", err }
ranked, err := rerank(ctx, query, candidates)
if err != nil { return "", err }
return buildContext(ranked, 1600), nil
}
当 rerank 返回后,buildContext 还要再次检查 1600 tokens 预算。排序靠前不等于文本一定能放下,长段落需要截断或跳过,并记录被预算淘汰的候选,便于复查答案为什么缺少某个来源。

上线时看三类信号,而不是只看模型回答
第一类是召回信号:固定一组问题和标注证据,观察 Recall@k;第二类是多样性信号:统计最终上下文的 source 数量及单一来源占比;第三类是预算信号:记录被 buildContext 丢弃的候选数量。Qdrant 的评估文档也建议让指标的 k 与实际送入模型的 chunk 数一致。
- 来源分布仍然极端:先调低每桶配额,不要先换 rerank 模型。
- Recall@k 下降:检查候选总量是否太小,以及分桶是否误删了唯一证据。
- 预算淘汰很多:优先缩短 chunk 或提取摘要,不要盲目把上下文上限翻倍。
常见问题
分桶会不会损失最高相似度结果?
会有可能,所以应先用固定评测集比较 Recall@k,再决定每桶配额。分桶的目标是降低单一来源垄断,不是保证每个最高分片都保留。
为什么不能直接把 topK 调大?
扩大 topK 可能增加重复来源和 rerank 成本,最终还会在上下文预算处被裁掉。先控制来源分布,再增加候选量更容易解释。
rerank 能找回未召回的证据吗?
不能。rerank 只能重新排列已有候选;问题需要的证据没有进入候选集时,应检查切片、查询改写或召回路径。
Go 示例里的 context.Context 该传到哪里?
从 answerContext 传入 selectCandidates,再传到 retrieveCandidates 和 rerank,让上游超时或取消能沿调用链生效。
落地前的最小检查
先用 20 到 30 条真实问题建立小型 golden set,分别记录候选来源分布、Recall@k、rerank 错误和上下文淘汰数。只有当分桶后的证据覆盖没有明显下降,再把配额和预算放进线上配置;保留旧配置作为回滚点,避免把一次模型换代和召回策略改动混成一个难以定位的问题。
Go 如何用 channel 信号量限制批量推理并发:排队、取消与结果回收
- 上一篇
- Go 如何用 channel 信号量限制批量推理并发:排队、取消与结果回收
- 下一篇
- GitHub 如何复制单个文件的永久链接:文件页、行号范围与 Permalink 核对
-
- 科技周边 · 人工智能 | 8小时前 | 数据迁移 · 人工智能 · rag · embedding · 向量检索 · 向量数据库 向量维度 OpenAI Embeddings dimensions 索引迁移
- 向量检索为什么要统一维度:OpenAI Embeddings 的 dimensions 参数与索引迁移
- 105浏览 收藏
-
- 科技周边 · 人工智能 | 9小时前 | 人工智能 · 工程实践 · 模型评测 · LLM-as-a-Judge · 评测集 · 位置偏差 大模型评测 LLM-as-a-Judge 盲评 成对比较
- 大模型评测为什么偏爱更长答案:位置偏差、盲评与成对比较
- 329浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- ljg-skills
- ljg-skills 是李继刚开源的 AI 技能与提示词集合,面向大模型使用者整理了一批可复用的 prompt、角色设定和任务技能模板,适合用于学习提示词设计、搭建个人 AI 工作流和沉淀团队常用智能体能力。
- 5435次使用
-
- MELO音乐
- MELO音乐是一站式AI视频与音乐制作助手,对标suno, udio的高品质体验。提供伴奏生成、原创写词、无损导出、哼唱识曲、混音变声等全套音频与短视频编辑工具。无论是流行Kpop、电音说唱、民谣古风、摇滚儿歌还是商用轻音乐,MELO为你免费谱曲,轻松做同款!
- 4920次使用
-
- UniScribe
- UniScribe 是一款 AI 音视频转文字与内容整理工具,支持上传音频、视频文件或粘贴 YouTube 链接,自动生成转写文本、摘要、思维导图和关键问题,并支持多格式导出,适合会议记录、课程学习、访谈整理和内容创作复盘。
- 4842次使用
-
- 剧云
- 剧云是专业中文剧本创作平台,安全稳定运行十余年,集成AI编剧、剧本医生审核、人物小传、剧情关系图、大纲编写、多人协作、Word导入导出、版权管控功能,数据安全防护,轻松高效创作剧本。
- 5105次使用
-
- 万象有声
- 万象有声,一个专为有声创作者打造的新一代智能有声内容创作平台。平台提供专业的智能拆章、智能画本编辑、AI配音、AI生成音效、后期制作、智能对轨、智能审听等有声创作全流程工具,可以帮助创作者高效、低成本创作出引人入胜的有声作品。立即体验,让有声书制作更简单!
- 5060次使用
-
- Go map 并发写 panic 怎么办:从共享 map 到可控写入路径
- 2026-06-30 123浏览
-
- go语言中的defer关键字
- 2023-02-17 150浏览
-
- Golang中Interface接口的三个特性
- 2023-01-07 394浏览
-
- go语言中函数与方法介绍
- 2023-01-07 297浏览
-
- go语言数据类型之字符串string
- 2022-12-30 321浏览

