当前位置:首页 > 文章列表 > 科技周边 > 人工智能 > RAG 评测怎么分别统计召回率和答案正确率

RAG 评测怎么分别统计召回率和答案正确率

来源:17golang原创 2026-09-08 07:29:09 0浏览 收藏

RAG 评测里最容易混淆的两个数字,就是“检索找到了多少”和“模型答对了多少”。它们不是同一项指标:前者看参考信息有没有进入 retrieved_contexts,后者看 response 是否符合 reference_answer。因此,先固定一份问题集和检索配置,再把 Context Recall 与 Answer Correctness 分开统计,才知道问题出在检索、生成,还是评测数据。

实操上,保留每道题的参考上下文、检索上下文、模型答案和标准答案;先算检索覆盖率,再在同一批结果上算答案正确率。
要点速览
  • Context Recall 衡量参考事实在 top-k 检索结果中的覆盖情况。
  • Answer Correctness 衡量最终回答与 reference_answer 的事实和结论一致性。
  • 低召回低正确、低召回高正确、高召回低正确,分别指向不同的排查路径。

一、先把召回和答案拆成两套样本

评测集不要只保存问题和最终分数。每条记录至少要能还原一次实验,字段可以这样设计:

字段回答的问题统计用途
question用户问了什么按任务分组
reference_contexts哪些片段包含参考事实召回分母
retrieved_contexts检索实际返回什么计算 Context Recall
reference_answer可接受的结论是什么答案对照
response模型实际回答什么计算 Answer Correctness
RAG 评测样本中 reference_contexts、retrieved_contexts、reference_answer 和 response 的静态字段关系图
图1:把参考信息、检索上下文和最终答案放进同一条可复现样本,避免用答案分数反推检索质量。

这里的 reference_contexts 可以是包含关键事实的文档片段或事实集合,不一定要求与切片后的文本逐字相同。关键是提前写清“什么算命中”,例如一条政策题需要命中适用条件、时间和例外条款,而不是只出现一个关键词。

二、固定 top-k 和评测集,先统计检索召回

检索召回可以理解为:参考信息中,有多少比例在实际返回的 top-k 上下文里出现。按问题统计后再求平均,能避免长文档题因为参考片段多而压过短问题。示意数据如下:

{"question":"退款期限是多少?","reference_contexts":["退款期限为7天","超过7天的例外条件"],"retrieved_contexts":["退款期限为7天"],"reference_answer":"通常为7天,特殊情况另行判断"}

对这条样本,若命中1个参考事实、总计2个,样本召回率就是 1/2。整套数据可记录 recall@1recall@3recall@5 等结果,比较切分策略、向量检索和 reranker 时要保持问题集不变。NVIDIA 的评测说明也把 Context Recall 放在不同 top-k 截止点比较;提高 top-k 可能扩大覆盖,但会增加延迟和送入模型的上下文量。

注意不要把“上下文与问题相关”直接当召回。相关性高但漏掉关键条件,召回仍然不足;反过来,塞入很多相关但重复的片段,也不代表答案一定正确。

三、用同一批结果计算答案正确率

检索结果冻结后,再比较 responsereference_answer。封闭式数字、枚举和布尔结论可以用规则或精确匹配;开放式回答则要先拆出事实点,再按“正确、遗漏、错误扩写”制定评审标准。不要把引用存在与否当成答案正确,引用正确但结论算错仍应判错。

from dataclasses import dataclass

@dataclass
class EvalRow:
    # 每行来自固定评测集,便于复现实验和定位失败样本
    reference_facts: set[str]
    retrieved_facts: set[str]
    answer_facts: set[str]

def score_row(row: EvalRow) -> tuple[float, float]:
    # 召回只看参考事实是否进入检索结果
    recall = len(row.reference_facts & row.retrieved_facts) / max(len(row.reference_facts), 1)
    # 答案正确率只看答案事实是否覆盖且没有明显错误;生产环境应替换为明确的评审器
    answer = len(row.reference_facts & row.answer_facts) / max(len(row.reference_facts), 1)
    return recall, answer

上面的函数只是把统计边界写清楚,不是通用语义评审器。真实开放问答要把判定规则、评审模型、温度、提示词版本和失败理由一起落盘,否则今天的“正确率”无法和下一次实验公平比较。

RAG 评测从固定样本分流到 Context Recall 与 Answer Correctness 两条指标支路的静态关系图
图2:同一份评测样本先经过检索覆盖率支路,再经过答案事实一致性支路,两个分数互不替代。

四、用指标组合定位 RAG 瓶颈

把两项指标放在一张表里,比追一个总分更有行动价值:

Context RecallAnswer Correctness优先排查
文档切分、查询改写、召回 top-k、reranker 和评测集覆盖
检查是否题目过于简单,或参考答案没有覆盖长尾事实
检查提示词、事实整合、模型幻觉、遗漏和错误扩写
继续看困难样本、分组差异和回归变化,不代表系统没有盲区

每次实验只改变一个主要变量,例如只改 reranker_top_k 或只改生成提示词,并保存 JSONL、配置哈希和失败样本。这样才能把“召回变了”与“答案变了”分别归因。延迟、吞吐和 groundedness 很有价值,但它们是其他维度,不能混进这两个比例。

相关问题

召回率高,答案为什么还是错?

上下文进来了不等于模型正确使用了它。优先检查事实冲突、答案遗漏、提示词约束和评审规则。

只有一个标准答案能评测开放问答吗?

可以起步,但最好保存关键事实点和可接受变体,否则表达不同却正确的回答容易被误判。

top-k 越大,召回率就一定越好吗?

在同一检索器和评测集下通常更有机会覆盖参考片段,但噪声、延迟和上下文预算也会上升,最终要结合答案正确率判断。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go HTTP handler panic 后如何区分恢复和连接中断Go HTTP handler panic 后如何区分恢复和连接中断
上一篇
Go HTTP handler panic 后如何区分恢复和连接中断
Go exec.CommandContext 超时后怎么判断进程是否仍在运行
下一篇
Go exec.CommandContext 超时后怎么判断进程是否仍在运行
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    19次使用
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    177次使用
  • C-Eval中文评测基准:大语言模型多学科能力评估指南
    C-Eval
    深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
    111次使用
  • AI Prompt Library:免费AI提示词库,助力ChatGPT高效创作与营销
    AI Prompt Library
    探索AI Prompt Library免费资源库,涵盖营销、写作及多场景AI提示词。兼容ChatGPT、Claude等工具,一键复制优化输出,提升工作效率。
    38次使用
  • Generrated:DALL·E 2/3 AI绘画提示词灵感库与图像对比平台
    Generrated
    Generrated汇集9300+张DALL·E生成图像及对应提示词,支持查看完整图集、对比DALL·E 2与3版本差异,是AI绘图新手学习Prompt设计与获取创作灵感的实用工具。
    18次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码