RAG 评测怎么分别统计召回率和答案正确率
RAG 评测里最容易混淆的两个数字,就是“检索找到了多少”和“模型答对了多少”。它们不是同一项指标:前者看参考信息有没有进入 retrieved_contexts,后者看 response 是否符合 reference_answer。因此,先固定一份问题集和检索配置,再把 Context Recall 与 Answer Correctness 分开统计,才知道问题出在检索、生成,还是评测数据。
实操上,保留每道题的参考上下文、检索上下文、模型答案和标准答案;先算检索覆盖率,再在同一批结果上算答案正确率。
- Context Recall 衡量参考事实在 top-k 检索结果中的覆盖情况。
- Answer Correctness 衡量最终回答与 reference_answer 的事实和结论一致性。
- 低召回低正确、低召回高正确、高召回低正确,分别指向不同的排查路径。
一、先把召回和答案拆成两套样本
评测集不要只保存问题和最终分数。每条记录至少要能还原一次实验,字段可以这样设计:
| 字段 | 回答的问题 | 统计用途 |
|---|---|---|
| question | 用户问了什么 | 按任务分组 |
| reference_contexts | 哪些片段包含参考事实 | 召回分母 |
| retrieved_contexts | 检索实际返回什么 | 计算 Context Recall |
| reference_answer | 可接受的结论是什么 | 答案对照 |
| response | 模型实际回答什么 | 计算 Answer Correctness |

这里的 reference_contexts 可以是包含关键事实的文档片段或事实集合,不一定要求与切片后的文本逐字相同。关键是提前写清“什么算命中”,例如一条政策题需要命中适用条件、时间和例外条款,而不是只出现一个关键词。
二、固定 top-k 和评测集,先统计检索召回
检索召回可以理解为:参考信息中,有多少比例在实际返回的 top-k 上下文里出现。按问题统计后再求平均,能避免长文档题因为参考片段多而压过短问题。示意数据如下:
{"question":"退款期限是多少?","reference_contexts":["退款期限为7天","超过7天的例外条件"],"retrieved_contexts":["退款期限为7天"],"reference_answer":"通常为7天,特殊情况另行判断"}
对这条样本,若命中1个参考事实、总计2个,样本召回率就是 1/2。整套数据可记录 recall@1、recall@3、recall@5 等结果,比较切分策略、向量检索和 reranker 时要保持问题集不变。NVIDIA 的评测说明也把 Context Recall 放在不同 top-k 截止点比较;提高 top-k 可能扩大覆盖,但会增加延迟和送入模型的上下文量。
注意不要把“上下文与问题相关”直接当召回。相关性高但漏掉关键条件,召回仍然不足;反过来,塞入很多相关但重复的片段,也不代表答案一定正确。
三、用同一批结果计算答案正确率
检索结果冻结后,再比较 response 与 reference_answer。封闭式数字、枚举和布尔结论可以用规则或精确匹配;开放式回答则要先拆出事实点,再按“正确、遗漏、错误扩写”制定评审标准。不要把引用存在与否当成答案正确,引用正确但结论算错仍应判错。
from dataclasses import dataclass
@dataclass
class EvalRow:
# 每行来自固定评测集,便于复现实验和定位失败样本
reference_facts: set[str]
retrieved_facts: set[str]
answer_facts: set[str]
def score_row(row: EvalRow) -> tuple[float, float]:
# 召回只看参考事实是否进入检索结果
recall = len(row.reference_facts & row.retrieved_facts) / max(len(row.reference_facts), 1)
# 答案正确率只看答案事实是否覆盖且没有明显错误;生产环境应替换为明确的评审器
answer = len(row.reference_facts & row.answer_facts) / max(len(row.reference_facts), 1)
return recall, answer
上面的函数只是把统计边界写清楚,不是通用语义评审器。真实开放问答要把判定规则、评审模型、温度、提示词版本和失败理由一起落盘,否则今天的“正确率”无法和下一次实验公平比较。

四、用指标组合定位 RAG 瓶颈
把两项指标放在一张表里,比追一个总分更有行动价值:
| Context Recall | Answer Correctness | 优先排查 |
|---|---|---|
| 低 | 低 | 文档切分、查询改写、召回 top-k、reranker 和评测集覆盖 |
| 低 | 高 | 检查是否题目过于简单,或参考答案没有覆盖长尾事实 |
| 高 | 低 | 检查提示词、事实整合、模型幻觉、遗漏和错误扩写 |
| 高 | 高 | 继续看困难样本、分组差异和回归变化,不代表系统没有盲区 |
每次实验只改变一个主要变量,例如只改 reranker_top_k 或只改生成提示词,并保存 JSONL、配置哈希和失败样本。这样才能把“召回变了”与“答案变了”分别归因。延迟、吞吐和 groundedness 很有价值,但它们是其他维度,不能混进这两个比例。
相关问题
召回率高,答案为什么还是错?
上下文进来了不等于模型正确使用了它。优先检查事实冲突、答案遗漏、提示词约束和评审规则。
只有一个标准答案能评测开放问答吗?
可以起步,但最好保存关键事实点和可接受变体,否则表达不同却正确的回答容易被误判。
top-k 越大,召回率就一定越好吗?
在同一检索器和评测集下通常更有机会覆盖参考片段,但噪声、延迟和上下文预算也会上升,最终要结合答案正确率判断。
Go HTTP handler panic 后如何区分恢复和连接中断
- 上一篇
- Go HTTP handler panic 后如何区分恢复和连接中断
- 下一篇
- Go exec.CommandContext 超时后怎么判断进程是否仍在运行
-
- 科技周边 · 人工智能 | 2小时前 | 人工智能 · ai agent · json schema · 工程实践 · 函数调用 · 参数校验 AI Agent JSON Schema 工具调用 tool use
- AI Agent 工具参数经常缺字段时怎么收紧 schema
- 316浏览 收藏
-
- 科技周边 · 人工智能 | 4小时前 | rag · embedding · 向量库 · embeddings
- 向量库维度不一致报错时怎么检查 embedding 配置
- 498浏览 收藏
-
- 科技周边 · 人工智能 | 6小时前 |
- RAG 混合检索结果重复时怎么做去重和排序
- 244浏览 收藏
-
- 科技周边 · 人工智能 | 7小时前 |
- RAG 只用向量检索找不到精确编号时怎么加混合检索
- 320浏览 收藏
-
- 科技周边 · 人工智能 | 10小时前 | 性能优化 · 人工智能 · rag · 向量检索 · 大模型 · RAG chunk overlap chunk size 召回上下文 回答延迟
- RAG 文档切片太大导致回答变慢怎么调整
- 277浏览 收藏
-
- 科技周边 · 人工智能 | 14小时前 |
- AI Agent 怎么限制工具参数避免越权访问文件
- 261浏览 收藏
-
- 科技周边 · 人工智能 | 15小时前 |
- OCR 结果进入 RAG 前怎么保留页码和版面坐标
- 233浏览 收藏
-
- 科技周边 · 人工智能 | 17小时前 | 人工智能 · embedding · 向量数据库 · RAG 向量检索 embeddings
- Embedding 模型切换后旧向量为什么不能直接混用
- 473浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 19次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 177次使用
-
- C-Eval
- 深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
- 111次使用
-
- AI Prompt Library
- 探索AI Prompt Library免费资源库,涵盖营销、写作及多场景AI提示词。兼容ChatGPT、Claude等工具,一键复制优化输出,提升工作效率。
- 38次使用
-
- Generrated
- Generrated汇集9300+张DALL·E生成图像及对应提示词,支持查看完整图集、对比DALL·E 2与3版本差异,是AI绘图新手学习Prompt设计与获取创作灵感的实用工具。
- 18次使用
-
- CodeGeeX for Jetbrains IDEs正式上线!
- 2023-01-17 284浏览
-
- 技术阿里云实现ocr批量图片和pdf文件表格图片转换excel文档/支持票据图片提取/普通图片文字提取处理
- 2023-01-18 387浏览
-
- 直播预告|FeatureStore Meetup V2
- 2023-01-10 328浏览
-
- 深入浅出特征工程 – 基于 OpenMLDB 的实践指南(上)
- 2023-02-25 426浏览
-
- 开源机器学习数据库OpenMLDB v0.4.0产品介绍
- 2023-01-10 147浏览

