当前位置：首页 > 文章列表 > 科技周边 > 人工智能 > 检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

来源：机器之心 2024-09-21 13:21:18 0浏览收藏

IT行业相对于一般传统行业，发展更新速度更快，一旦停止了学习，很快就会被行业所淘汰。所以我们需要踏踏实实的不断学习，精进自己的技术，尤其是初学者。今天golang学习网给大家整理了《检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了》，聊聊，我们一起来看看吧！

这是 AI 智能体在大部分科学研究中超越人类的第一个案例，或许会彻底改变人类与科学文献互动的方式。

最近一段时间，有关 AI 科学家的研究越来越多。大语言模型（LLM）有望帮助科学家检索、综合和总结文献，提升人们的工作效率，但在研究工作中使用仍然有很多限制。

对于科研来说，事实性至关重要，而大模型会产生幻觉，有时会自信地陈述没有任何现有来源或证据的信息。另外，科学需要极其注重细节，而大模型在面对具有挑战性的推理问题时可能会忽略或误用细节。

最后，目前科学文献的检索和推理基准尚不完善。AI 无法参考整篇文献，而是局限于摘要、在固定语料库上检索，或者只是直接提供相关论文。这些基准不适合作为实际科学研究任务的性能代理，更重要的是，它们通常缺乏与人类表现的直接比较。因此，语言模型和智能体是否适合用于科学研究仍不清楚。

近日，来自 FutureHouse、罗切斯特大学等机构的研究者们尝试构建一个更为强大的科研智能体，并对 AI 系统和人类在三个现实任务上的表现进行严格比较。这三个任务有关搜索整个文献以回答问题；生成一篇有引用的、维基百科风格的科学主题文章；从论文中提取所有主张，并检查它们与所有文献之间的矛盾。

这可能是第一个在多个现实文献搜索任务上评估单个 AI 系统的强大程序。利用新开发的评估方法，研究者探索了多种设计，最终形成了 PaperQA2 系统，它在检索和总结任务上的表现超过了博士生和博士后。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

将 PaperQA2 应用于矛盾检测任务让我们能够大规模识别生物学论文中的矛盾。例如，ZNF804A rs1344706 等位基因对精神分裂症患者的大脑结构有积极影响的说法与后来发表的研究相矛盾，该研究发现 rs1344706 对大脑皮质厚度、表面积和皮质体积的影响会加剧患精神分裂症的风险。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

论文地址：https://storage.googleapis.com/fh-public/paperqa/Language_Agents_Science.pdf
GitHub 链接：https://github.com/Future-House/paper-qa

网友纷纷表示这项工作太棒了，并且是开源的。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

回答科学问题

为了评估 AI 系统对科学文献的检索能力，研究者首先生成了 LitQA2，这是一组共 248 个多项选择题，其答案需要从科学文献中检索。LitQA2 问题的设计目的是让答案出现在论文正文中，但不出现在摘要中，理想的情况下，在所有科学文献中只出现一次。这些约束使我们能够通过将系统引用的来源 DOI 与问题创建者最初分配的 DOI 进行匹配来评估回答的准确性（下图 A）。

为了执行这些标准，研究者生成了大量关于最近论文中模糊的中间发现的问题，然后排除了任何现有 AI 系统或人类注释者可以使用替代来源进行回答的问题。它们都是由专家生成的。

在回答 LitQA2 问题时，模型可以通过选择「信息不足，无法回答此问题」来拒绝回答。与先前的研究和实际的科学问题类似，有些问题本来就是无法回答的。研究者评估了两个指标：精确度（即在提供答案时正确回答的问题的比例）和准确度（即所有问题中正确答案的比例）。此外还考虑了召回率，即系统将其答案归因于 LitQA2 中表示的正确源 DOI 的问题的总百分比。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

在开发了 LitQA2 之后，研究者利用它来设计一个科学文献的 AI 系统。在 PaperQA 的启发下，PaperQA2 是一个 RAG 智能体，它将检索和响应生成视为一个多步骤智能体任务，而不是一个直接过程。PaperQA2 将 RAG 分解为工具，使其能够修改其搜索参数，并在生成最终答案之前生成和检查候选答案（下图 A）。

PaperQA2 可以访问「论文搜索」工具，其中智能体模型将用户请求转换为用于识别候选论文的关键字搜索。候选论文被解析为机器可读的文本，并分块以供智能体稍后使用。PaperQA2 使用最先进的文档解析算法（Grobid19），能可靠地解析论文中的章节、表格和引文。找到候选论文后，PaperQA2 可以使用「收集证据」工具，该工具首先使用 top-k 密集向量检索步骤对论文块进行排序，然后进行大模型重新排序和上下文摘要（RCS）步骤。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

在回答 LitQA2 问题时，PaperQA2 平均每道题解析并使用 14.5 ± 0.6（平均值 ± SD，n = 3）篇论文。在 LitQA2 上运行 PaperQA2 可获得 85.2% ± 1.1%（平均值 ± SD，n = 3）的精确度和 66.0% ± 1.2%（平均值 ± SD，n = 3）的准确度。另外，系统在 21.9% ± 0.9%（平均值 ± SD，n = 3）的答案中选择报告「信息不足」（下图 B）。

研究者发现 PaperQA2 在 LitQA2 基准测试中的精确度和准确度均优于其他 RAG 系统。我们还可以发现，除 Elicit 外所有测试的 RAG 系统在精确度和准确度方面均优于非 RAG 前沿模型。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

为了确保 PaperQA2 不会过拟合，从而无法在 LitQA2 上取得优异成绩，研究者在对 PaperQA2 进行大量工程改动后，生成了一组新的 101 个 LitQA2 问题。

PaperQA2 在原始 147 个问题上的准确率与后一组 101 个问题的准确率没有显著差异，这表明在第一阶段的优化已经很好地推广到了新的 LitQA2 问题（下表 2）。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

PaperQA2 性能分析

研究者尝试改变 PaperQA2 的参数，以了解哪些参数决定其准确性（下图 C）。他们创建了一个非智能体版本，其中包含一个硬编码操作序列（论文搜索、收集证据，然后生成答案）。非智能体系统的准确率明显较低（t (3.7)= 3.41，p= 0.015），验证了使用智能体的选择。

研究者将性能差异归因于智能体更好的记忆能力，因为它可以在观察到找到的相关论文数量后返回并更改关键字搜索（论文搜索工具调用）。

结果显示，LitQA2 运行准确度最高时为每个问题进行了 1.26 ± 0.07（平均值 ± SD）次搜索，每个问题进行了 0.46 ± 0.02（平均值 ±SD）次引用遍历，这表明智能体有时会返回进行额外搜索或遍历引用图以收集更多论文。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

为了改进相关块检索，研究者假设，找到的论文对于现有相关块的引用者或被引用者而言将是一种有效的分层索引形式。通过去除「引用遍历」工具验证了这一点，该工具显示准确率有所提高（t (2.55) = 2.14，p= 0.069），DOI 召回率显著提高（t (3) = 3.4，p = 0.022），并在 PaperQA2 流程的所有阶段都是如此。该工具的流程反映了科学家与文献互动的方式。

研究者曾假设解析质量会影响准确度，但 Grobid 解析和更大的块并没有显著提高 LitQA2 的精度、准确度或召回率（下图 6）。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

总结科学主题

为了评估 PaperQA2 的摘要功能，研究者设计了一个名为 WikiCrow 的系统。该系统通过结合多个 PaperQA2 调用来生成有关人类蛋白质编码基因的维基百科风格文章，而这些调用涉及基因的结构、功能、相互作用和临床意义等主题。

研究者使用 WikiCrow 生成了 240 篇有关基因的文章，这些文章已经有非存根维基百科文章进行匹配比较。WikiCrow 文章平均为 1219.0 ± 275.0 个字（平均值 ± SD，N = 240），比相应的维基百科文章（889.6 ± 715.3 个字）长。平均文章生成时间为 491.5 ± 324.0 秒，平均每篇文章成本为 4.48 ± 1.02 美元（包括搜索和 LLM API 的费用）。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

同时，「引用但不受支持」评估类别包括不准确的陈述（例如真实幻觉或推理错误）和准确但引用不当的声明。

为了进一步调查维基百科和 WikiCrow 中的错误性质，研究者手动检查了所有报告的错误，并尝试将问题分类为以下几类：

推理问题，即书面信息自相矛盾、过度推断或不受任何引用支持；
归因问题，即信息可能得到另一个包含的来源支持，但该声明在本地没有包含正确的引用或来源太宽泛（例如数据库门户链接）；
琐碎的声明，这些声明虽是真实的段落，但过于迂腐或没有必要。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

检测文献中的矛盾

由于 PaperQA2 可以比人类科学家探索吞吐量高得多的科学文献，因此研究者推测可以部署它来系统地、大规模地识别文献中矛盾和不一致的地方。矛盾检测是一个「一对多」问题，原则上涉及将一篇论文中的观点或声明与文献中所有其他观点或声明进行比较。在规模上，矛盾检测变成了「多对多」问题，对人类来说失去了可行性。

因此，研究者利用 PaperQA2 构建了一个名为 ContraCrow 的系统，可以自动检测文献中的矛盾（下图 A）。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

ContraCrow 首先使用一系列 LLM completion 调用从提供的论文中提取声明，然后将这些声明输入到 PaperQA2 中，并附带矛盾检测提示。该提示指示系统评估文献中是否存在与提供的声明相矛盾的内容，并提供答案和 11-point 李克特量表的选择。使用李克特量表可让系统在提供排名时给出更可靠、更易于解释的分数。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

接下来，研究者评估了 ContraCrow 检测 ContraDetect 中矛盾的能力。通过将李克特量表输出转换为整数，他们能够调整检测阈值并获得 AUC 为 0.842 的 ROC 曲线。将阈值设置为 8（矛盾），ContraCrow 实现了 73% 的准确率、88% 的精度和仅为 7% 的假阳性率（下图 C）。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

研究者将 ContraCrow 应用于从数据库中随机选择的 93 篇生物学相关论文，平均每篇论文识别出 35.16 ± 21.72（平均值 ± SD，N = 93）个声明。在对 93 篇论文分析出的 3180 个声明中，ContraCrow 认为 6.85% 与文献相矛盾，其中分别有 2.89%、3.77% 和 0.19% 的声明被打了 8 分、9 分和 10 分（下图 D）。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

此外，当将李克特量表阈值设定为 8，研究者发现平均每篇论文有 2.34 ± 1.99 个矛盾（平均值 ± SD）（下图 E）。

检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了

更多任务细节和测试结果请参阅原论文。

本篇关于《检索总结能力超博士后，首个大模型科研智能体PaperQA2开源了》的介绍就到此结束啦，但是学无止境，想要了解学习更多关于科技周边的相关知识，请关注golang学习网公众号！

产业 AI 智能体 PaperQA2

版本声明

本文转载于：机器之心如有侵犯，请联系study_golang@163.com删除

如何使用 Golang 函数自定义数据结构的迭代方式？

如何使用 Golang 函数自定义数据结构的迭代方式？

上一篇: 如何使用 Golang 函数自定义数据结构的迭代方式？

在 Golang 中，如何实现函数并发编程？

下一篇: 在 Golang 中，如何实现函数并发编程？

查看更多

最新文章

$Kimi如何查最新新闻\_Kimi精准搜索技巧手册$

科技周边 · 人工智能 | 3小时前 |

Kimi如何查最新新闻\_Kimi精准搜索技巧手册

482浏览收藏
科技周边 · 人工智能 | 3小时前 | DeepSeek

DeepSeekAI生成PPT免费入口官网链接

377浏览收藏
科技周边 · 人工智能 | 3小时前 |

TomeAI如何将故事转为交互图表

397浏览收藏
科技周边 · 人工智能 | 4小时前 |

龙虾机器人会画画吗？AI绘画教程详解

438浏览收藏
科技周边 · 人工智能 | 4小时前 |

Gemini文档分析方法：AIStudio支持多大文件上传

432浏览收藏
科技周边 · 人工智能 | 4小时前 |

lovemo官网入口与免费登录方法

165浏览收藏
科技周边 · 人工智能 | 4小时前 | AI工具 ai怎么裁剪图片

Krita AI裁剪图片教程及技巧

223浏览收藏
科技周边 · 人工智能 | 5小时前 |

猫箱官网入口在线玩猫箱网页版一键开启

102浏览收藏
科技周边 · 人工智能 | 5小时前 |

LumaDreamMachine免费次数领取方法汇总

469浏览收藏
科技周边 · 人工智能 | 5小时前 |

百度AI排序设置教程详解

261浏览收藏
科技周边 · 人工智能 | 5小时前 |

DeepSeek文案需优化，提升B端专业表达

475浏览收藏
科技周边 · 人工智能 | 6小时前 |

DeepSeek回复被截断？增加max_tokens并输入“继续”指令

226浏览收藏

资料下载

编程学习资料下载

精选编程（Golang、Python、Java、C++、JavaScript等）教程、电子书与示例源码，一键打包本地下载学习。

立即下载

查看更多

课程推荐

前端进阶之JavaScript设计模式

设计模式是开发人员在软件开发过程中面临一般问题时的解决方案，代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景，打造一站式知识长龙服务，适合有JS基础的同学学习。

543次学习
GO语言核心编程课程

本课程采用真实案例，全面具体可落地，从理论到实践，一步一步将GO核心编程技术、编程思想、底层实现融会贯通，使学习者贴近时代脉搏，做IT互联网时代的弄潮儿。

516次学习
简单聊聊mysql8与网络通信

如有问题加微信：Le-studyg；在课程中，我们将首先介绍MySQL8的新特性，包括性能优化、安全增强、新数据类型等，帮助学生快速熟悉MySQL8的最新功能。接着，我们将深入解析MySQL的网络通信机制，包括协议、连接管理、数据传输等，让

500次学习
JavaScript正则表达式基础与实战

在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。

487次学习
从零制作响应式网站—Grid布局

本系列教程将展示从零制作一个假想的网络科技公司官网，分为导航，轮播，关于我们，成功案例，服务流程，团队介绍，数据部分，公司动态，底部信息等内容区块。网站整体采用CSSGrid布局，支持响应式，有流畅过渡和展现动画。

485次学习

查看更多

AI推荐

ChatExcel酷表

ChatExcel酷表是由北京大学团队打造的Excel聊天机器人，用自然语言操控表格，简化数据处理，告别繁琐操作，提升工作效率！适用于学生、上班族及政府人员。

4121次使用
Any绘本

探索Any绘本（anypicturebook.com/zh），一款开源免费的AI绘本创作工具，基于Google Gemini与Flux AI模型，让您轻松创作个性化绘本。适用于家庭、教育、创作等多种场景，零门槛，高自由度，技术透明，本地可控。

4468次使用
可赞AI

可赞AI，AI驱动的办公可视化智能工具，助您轻松实现文本与可视化元素高效转化。无论是智能文档生成、多格式文本解析，还是一键生成专业图表、脑图、知识卡片，可赞AI都能让信息处理更清晰高效。覆盖数据汇报、会议纪要、内容营销等全场景，大幅提升办公效率，降低专业门槛，是您提升工作效率的得力助手。

4355次使用
星月写作

星月写作是国内首款聚焦中文网络小说创作的AI辅助工具，解决网文作者从构思到变现的全流程痛点。AI扫榜、专属模板、全链路适配，助力新人快速上手，资深作者效率倍增。

5855次使用
MagicLight

MagicLight.ai是全球首款叙事驱动型AI动画视频创作平台，专注于解决从故事想法到完整动画的全流程痛点。它通过自研AI模型，保障角色、风格、场景高度一致性，让零动画经验者也能高效产出专业级叙事内容。广泛适用于独立创作者、动画工作室、教育机构及企业营销，助您轻松实现创意落地与商业化。

4714次使用

查看更多

相关文章

GPT-4王者加冕！读图做题性能炸天，凭自己就能考上斯坦福

2023-04-25 501浏览
单块V100训练模型提速72倍！尤洋团队新成果获AAAI 2023杰出论文奖

2023-04-24 501浏览
ChatGPT 真的会接管世界吗？

2023-04-13 501浏览
VR的终极形态是「假眼」？Neuralink前联合创始人掏出新产品：科学之眼！

2023-04-30 501浏览
实现实时制造可视性优势有哪些？

2023-04-15 501浏览

Golang学习网：公益在线Go学习平台，帮助Go学习者快速成长！

技术交流群

Copyright 2023 http://www.17golang.com/ All Rights Reserved ｜苏ICP备2023003363号-1

关注公众号

Golang学习网

微信登录更方便

密码登录
注册账号

登录即同意用户协议和隐私政策

返回登录

重置密码