「字少信息量大」,Salesforce、MIT 研究者教 GPT-4「改稿」,数据集已开源
本篇文章向大家介绍《「字少信息量大」,Salesforce、MIT 研究者教 GPT-4「改稿」,数据集已开源》,主要包括,具有一定的参考价值,需要的朋友可以参考一下。
近年来,自动摘要技术取得了长足的进步,这主要归功于范式的转变——从在标注数据集上进行有监督微调转变为使用大语言模型(LLM)进行零样本提示,例如GPT-4。无需额外训练,精心设计的提示就能实现对摘要长度、主题、风格等方面特征的精细控制
但一个方面常常被忽视:摘要的信息密度。从理论上讲,作为对另一个文本的压缩,摘要应该比源文件更密集,也就是包含更多的信息。考虑到 LLM 解码的高延迟,用更少的字数涵盖更多的信息非常重要,尤其是对于实时应用而言。
然而,信息量密度是一个开放式的问题:如果摘要包含的细节不足,那么相当于没有信息量;如果包含的信息过多,又不增加总长度,就会变得难以理解。要在固定的词汇预算内传递更多信息,就需要将抽象、压缩、融合三者结合起来
在最近的一项研究中,来自 Salesforce、MIT 等机构的研究者试图通过征求人类对 GPT-4 生成的一组密度越来越高的摘要的偏好来确定这一限制。对于提升 GPT-4 等大语言模型的「表达能力」,这一方法提供了很多启发。
论文链接:https://arxiv.org/pdf/2309.04269.pdf
数据集地址:https://huggingface.co/datasets/griffin/chain_of_density
具体来说,他们的方法是将每个标记的平均实体数量作为密度的代表,生成一个初始的、实体稀少的摘要。然后,在不增加总长度(总长度为原摘要的5倍)的情况下,反复识别并融合前一个摘要中缺失的1-3个实体,使得每个摘要中实体与标记的比例都高于前一个摘要。通过人类偏好数据的分析,作者最终确定了一种几乎与人类编写的摘要一样密集的摘要形式,比普通 GPT-4 prompt 生成的摘要更加密集
该研究的总体贡献包括:
- 开发一种基于 prompt 的迭代方法 (CoD),使得摘要的实体密度越来越高;
- 对 CNN/《每日邮报》文章中越来越密集的摘要进行人工和自动评估,以更好地了解信息量(倾向于更多实体)和清晰度(倾向于更少的实体)之间的权衡;
- 开源了 GPT-4 摘要、注释和一组 5000 篇未注释的 CoD 摘要,用于评估或提炼。
什么是 CoD
作者设定了一个名为"CoD"(密度链)的提示,用于生成初始摘要并逐渐增加其实体密度。具体而言,在固定的交互次数内,源文本中的一组独特突出实体被识别出来,并在不增加长度的情况下融合到之前的摘要中
在图2中,展示了Prompt和输出示例。作者并没有明确规定实体的类型,而是将缺失的实体定义为:
- 相关:与主要故事相关;
- 具体:描述性的但简洁(5 个字或更少);
- 新颖:未出现在之前的摘要中;
- 忠实:存在于文章中;
- 任何地方:位于文章的任何地方。
作者从 CNN/DailyMail 摘要测试集中随机抽取了 100 篇文章,为其生成 CoD 摘要。为便于参考,他们将 CoD 摘要统计数据与人类撰写的要点式参考摘要以及 GPT-4 在普通 Prompt 下生成的摘要进行比较:「写一篇非常简短的文章摘要。请勿超过 70 个字。」
统计情况
在研究中,作者从直接统计数据和间接统计数据两方面进行了总结。直接统计数据(token、实体、实体密度)由 CoD 直接控制,而间接统计数据则是密集化的预期副产品。
重写后的内容如下:根据统计数据显示,通过删除冗长摘要中的不必要词语,第二步的平均长度减少了5个标记(从72个减少到67个)。初始实体密度为0.089,低于人类和Vanilla GPT-4(0.151和0.122),经过5个密集化步骤后,最终上升至0.167
间接统计。抽象度应该会随着每一步 CoD 的进行而增加,因为每增加一个实体,摘要就会被反复改写以腾出空间。作者用提取密度来衡量抽象性:提取片段的平均平方长度 (Grusky et al., 2018)。同样,随着实体被添加到固定长度的摘要中,概念融合度也应随之单调增加。作者用与每个摘要句子对齐的源句子的平均数量来表示融合度。在对齐上,作者使用相对 ROUGE 增益法 (Zhou et al., 2018),,该方法将源句与目标句对齐,直到额外句子的相对 ROUGE 增益不再为正。他们还预计内容分布(Content Distribution),也就是摘要内容所来源的文章中位置,会发生变化。
具体来说,作者预计《使命召唤》(CoD)摘要最初会表现出强烈的「引导偏向」,即在文章的开头部分会更多地引入实体。然而,随着文章的发展,这种引导偏向会逐渐减弱,开始从文章的中间和末尾引入实体。为了衡量这一点,研究者使用了融合中的对齐结果,并测量了所有对齐源句的平均句子等级
图 3 证实了这些假设:随着重写步骤的增加,抽象性也随之增加(左侧提取密度较低),融合率上升(中图),摘要开始纳入文章中间和末尾的内容(右图)。有趣的是,与人类撰写的摘要和基线摘要相比,所有 CoD 摘要都更具抽象性
结果
为了更好地理解CoD摘要的权衡,作者进行了一项基于偏好的人类研究,并利用GPT-4进行了基于评级的评估
人类偏好。具体来说,对于同样的 100 篇文章(5 个 step *100 = 总共 500 篇摘要),作者向论文的前四位作者随机展示了经过「重新创作」的 CoD 摘要以及文章。根据 Stiennon et al. (2020) 对「好摘要」的定义,每位注释者都给出了自己最喜欢的摘要。表 2 报告了各注释者在 CoD 阶段的第一名得票情况,以及各注释者的汇总情况。总的来说,61% 的第一名摘要(23.0+22.5+15.5)涉及≥3 个致密化步骤。首选 CoD 步数的中位数位于中间(3),预期步数为 3.06。
根据 Step 3 摘要的平均密度,可以大致推断出所有 CoD 候选者的首选实体密度为 ∼ 0.15。从表 1 中可以看出,这一密度与人类编写的摘要(0.151)相一致,但明显高于用普通 GPT-4 Prompt 编写的摘要(0.122)。
自动度量。作为人工评估的补充(如下),作者用 GPT-4 从 5 个维度对 CoD 摘要进行评分(1-5 分):信息量、质量、连贯性、可归属性和整体性。如表 3 所示,密集度与信息量相关,但有一个限度,在步骤 4(4.74)时得分达到顶峰。
从各维度的平均得分来看,CoD 的第一个和最后一个步骤得分最低,而中间三个步骤得分接近(分别为 4.78、4.77 和 4.76)。
定性分析。摘要的连贯性 / 可读性与信息量之间存在明显的权衡。图4展示了两个CoD步骤:一个步骤的摘要因为更多细节而改善,而另一个步骤的摘要则受到了损害。总体而言,中间的CoD摘要能够实现这种平衡,但这种权衡仍需要在今后的工作中进行精确定义和量化
更多论文细节,可参考原论文。
本篇关于《「字少信息量大」,Salesforce、MIT 研究者教 GPT-4「改稿」,数据集已开源》的介绍就到此结束啦,但是学无止境,想要了解学习更多关于科技周边的相关知识,请关注golang学习网公众号!

- 上一篇
- 微软提出预测铰接对象姿态技术,用于AR/VR身体姿态捕捉的专利

- 下一篇
- Unity的新政策引发游戏行业震荡,更新即将发布
-
- 科技周边 · 人工智能 | 8小时前 | 预防措施
- 豆包AI导出失败?常见错误代码解析及解决方案
- 285浏览 收藏
-
- 科技周边 · 人工智能 | 10小时前 |
- 东风猛士M817亮相上海车展最“华”越野车
- 292浏览 收藏
-
- 科技周边 · 人工智能 | 10小时前 |
- 岚图FREE+上海车展亮相,搭载华为ADS4.0,6月预售
- 501浏览 收藏
-
- 科技周边 · 人工智能 | 13小时前 |
- 用豆包A/表情包变现攻略及方法
- 196浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 542次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 508次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 497次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 484次学习
-
- 毕业宝AIGC检测
- 毕业宝AIGC检测是“毕业宝”平台的AI生成内容检测工具,专为学术场景设计,帮助用户初步判断文本的原创性和AI参与度。通过与知网、维普数据库联动,提供全面检测结果,适用于学生、研究者、教育工作者及内容创作者。
- 18次使用
-
- AI Make Song
- AI Make Song是一款革命性的AI音乐生成平台,提供文本和歌词转音乐的双模式输入,支持多语言及商业友好版权体系。无论你是音乐爱好者、内容创作者还是广告从业者,都能在这里实现“用文字创造音乐”的梦想。平台已生成超百万首原创音乐,覆盖全球20个国家,用户满意度高达95%。
- 29次使用
-
- SongGenerator
- 探索SongGenerator.io,零门槛、全免费的AI音乐生成器。无需注册,通过简单文本输入即可生成多风格音乐,适用于内容创作者、音乐爱好者和教育工作者。日均生成量超10万次,全球50国家用户信赖。
- 27次使用
-
- BeArt AI换脸
- 探索BeArt AI换脸工具,免费在线使用,无需下载软件,即可对照片、视频和GIF进行高质量换脸。体验快速、流畅、无水印的换脸效果,适用于娱乐创作、影视制作、广告营销等多种场景。
- 29次使用
-
- 协启动
- SEO摘要协启动(XieQiDong Chatbot)是由深圳协启动传媒有限公司运营的AI智能服务平台,提供多模型支持的对话服务、文档处理和图像生成工具,旨在提升用户内容创作与信息处理效率。平台支持订阅制付费,适合个人及企业用户,满足日常聊天、文案生成、学习辅助等需求。
- 31次使用
-
- GPT-4王者加冕!读图做题性能炸天,凭自己就能考上斯坦福
- 2023-04-25 501浏览
-
- 单块V100训练模型提速72倍!尤洋团队新成果获AAAI 2023杰出论文奖
- 2023-04-24 501浏览
-
- ChatGPT 真的会接管世界吗?
- 2023-04-13 501浏览
-
- VR的终极形态是「假眼」?Neuralink前联合创始人掏出新产品:科学之眼!
- 2023-04-30 501浏览
-
- 实现实时制造可视性优势有哪些?
- 2023-04-15 501浏览