当前位置：首页 > 文章列表 > 科技周边 > 人工智能 > 新增作品发布：Llama-2实现128k上下文扩展，10倍吞吐量需求仅占1/6内存

新增作品发布：Llama-2实现128k上下文扩展，10倍吞吐量需求仅占1/6内存

来源：51CTO.COM 2024-03-11 10:51:10 0浏览收藏

今日不肯埋头，明日何以抬头！每日一句努力自己的话哈哈~哈喽，今天我将给大家带来一篇《新增作品发布：Llama-2实现128k上下文扩展，10倍吞吐量需求仅占1/6内存》，主要内容是讲解等等，感兴趣的朋友可以收藏或者有更好的建议在评论提出，我都会认真看的！大家一起进步，一起学习！

陈丹琦团队刚刚发布了一种新的LLM上下文窗口扩展方法：

它仅用8k大小的token文档进行训练，就能将Llama-2窗口扩展至128k。

最重要的是，在这个过程中，只需要原来1/6的内存，模型就获得了10倍吞吐量。

陈丹琦团队新作：Llama-2上下文扩展至128k，10倍吞吐量仅需1/6内存

除此之外，它还能大大降低训练成本：

用该方法对7B大小的羊驼2进行改造，只需要一块A100就能搞定。

团队表示：

希望这个方法有用、好用，为未来的LLM们提供廉价又有效的长上下文能力。

目前，模型和代码都已在HuggingFace和GitHub上发布。

陈丹琦团队新作：Llama-2上下文扩展至128k，10倍吞吐量仅需1/6内存

只需添加两个组件

这个方法名叫CEPE，全称“并行编码上下文扩展（Context Expansion with Parallel Encoding）”。

作为轻量级框架，它可用于扩展任何预训练和指令微调模型的上下文窗口。

对于任何预训练的仅解码器语言模型，CEPE通过添加两个小组件来实现扩展：

一个是小型编码器，用于对长上下文进行块编码；

一个是交叉注意力模块，插入到解码器的每一层，用于关注编码器表示。

完整架构如下：

陈丹琦团队新作：Llama-2上下文扩展至128k，10倍吞吐量仅需1/6内存

在这个示意图中，编码器模型并行编码上下文的3个额外块，并与最终隐藏表示进行连接，然后作为解码器交叉注意力层的输入。

在此，交叉注意力层主要关注解码器模型中自注意力层和前馈层之间的编码器表示。

通过仔细选择无需标记的训练数据，CEPE就帮助模型具备了长上下文能力，并且也擅长文档检索。

作者介绍，这样的CEPE主要包含3大优势：

（1）长度可泛化

因为它不受位置编码的约束，相反，它的上下文是分段编码的，每一段都有自己的位置编码。

（2）效率高
使用小型编码器和并行编码来处理上下文可以降低计算成本。

同时，由于交叉注意力仅关注编码器最后一层的表示，而仅使用解码器的语言模型则需要缓存每个层每个token的键-值对，所以对比起来，CEPE需要的内存大大减少。
（3）降低训练成本

与完全微调方法不同，CEPE只调整编码器和交叉注意力，同时保持大型解码器模型冻结。

作者介绍，通过将7B解码器扩充为具有400M编码器和交叉注意力层的模型（总计14亿参数），用一块80GB的A100 GPU就可以完成。

困惑度持续降低

团队将CEPE应用于Llama-2，并在200亿 token的RedPajama过滤版本上进行训练（仅为Llama-2预训练预算的1%）。

首先，与LLAMA2-32K和YARN-64K这两种完全微调的模型相比，CEPE在所有数据集上都实现了更低或相当的困惑度，同时具有更低的内存使用率和更高的吞吐量。

陈丹琦团队新作：Llama-2上下文扩展至128k，10倍吞吐量仅需1/6内存

在将上下文提升到128k时（远超其8k训练长度），CEPE的困惑度更是持续保持降低，同时保持低内存状态。

相比之下，Llama-2-32K和YARN-64K不仅不能推广到其训练长度之外，还伴随着内存成本显著增加。

陈丹琦团队新作：Llama-2上下文扩展至128k，10倍吞吐量仅需1/6内存

其次，检索能力增强。

如下表所示：

通过使用检索到的上下文，CEPE可以有效改善模型困惑度，性能优于RePlug。

值得注意的是，即使让段落k=50 （训练是60），CEPE仍会继续改善困惑度。

这表明CEPE可以很好地转移到检索增强设置，而全上下文解码器模型在这个能力上却退化了。

陈丹琦团队新作：Llama-2上下文扩展至128k，10倍吞吐量仅需1/6内存

第三，开放域问答能力显著超越。

如下图所示，CEPE在所有数据集和段落k参数上都大幅优于其他模型，且不像别的模型那样，k值越来越大之后性能明显下降。

这也表明，CEPE对大量冗余或不相关的段落并不敏感。

陈丹琦团队新作：Llama-2上下文扩展至128k，10倍吞吐量仅需1/6内存

所以总结一下就是，与大多数其他解决办法相比，CEPE在上述所有任务上都能以低得多的内存和计算成本胜出。

最后，作者在这些基础上，提出了专门用于指令调优模型的CEPE-Distilled (CEPED)。

它仅使用未标记的数据来扩展模型的上下文窗口，通过辅助KL散度损失将原始指令调整模型的行为提炼为新架构，由此无需管理昂贵的长上下文指令跟踪数据。

最终，CEPED可以在保留指令理解能力的同时，扩展Llama-2的上下文窗口，提高模型长文本性能。

团队介绍

CEPE一共3位作者。

一作为颜和光（Howard Yen），普林斯顿大学计算机科学专业硕士生在读。

二作为高天宇，同校博士生在读，清华本科毕业。

他们都是通讯作者陈丹琦的学生。

陈丹琦团队新作：Llama-2上下文扩展至128k，10倍吞吐量仅需1/6内存

论文原文：https://arxiv.org/abs/2402.16617
参考链接：https://twitter.com/HowardYen1/status/1762474556101661158

好了，本文到此结束，带大家了解了《新增作品发布：Llama-2实现128k上下文扩展，10倍吞吐量需求仅占1/6内存》，希望本文对你有所帮助！关注golang学习网公众号，给大家分享更多科技周边知识！

AI 训练

版本声明

本文转载于：51CTO.COM 如有侵犯，请联系study_golang@163.com删除

使用 Goland IDE 和 Docker compose 进行 Golang 应用程序的 Docker 化调试

使用 Goland IDE 和 Docker compose 进行 Golang 应用程序的 Docker 化调试

上一篇: 使用 Goland IDE 和 Docker compose 进行 Golang 应用程序的 Docker 化调试

搭建PHP环境利器：OneinStack安装步骤

下一篇: 搭建PHP环境利器：OneinStack安装步骤

查看更多

最新文章

科技周边 · 人工智能 | 18小时前 | 人工智能 · mcp · ai agent · 工具接入 · 安全审计 · AI Agent MCP Model Context Protocol 工具清单资源上下文权限审计

MCP 服务接入工作流：从工具清单到权限审计的 AI Agent 落地路线

378浏览收藏
科技周边 · 人工智能 | 19小时前 | 人工智能 · ai agent · 工具调用 · 结构化输出 · 工程排查 · AI Agent Schema 结构化输出超时重试工具调用兜底回答

AI Agent 工具调用失败排查：从 Schema 到超时兜底的完整工作流

195浏览收藏
科技周边 · 人工智能 | 22小时前 | 人工智能 · rag · 知识库检索 · RAG 向量检索 AI知识库混合召回结果重排

AI 知识库检索不到答案排查：从分块到重排的 RAG 修复流程

453浏览收藏
科技周边 · 人工智能 | 1天前 | 人工智能 · AI工程 · 成本控制 · 人工智能成本控制 AI接口 token预算 Batch API

AI 批量调用成本控制：从请求日志到预算阈值的完整工作流

202浏览收藏
科技周边 · 人工智能 | 1天前 | 人工智能 · rag · 知识库 · AI工程实践 · 人工智能 RAG 知识库问答向量检索引用检查

AI 知识库回答跑偏怎么办：RAG 检索、重排和引用检查完整流程

419浏览收藏
科技周边 · 人工智能 | 2天前 | 人工智能 · ai agent · 工程实践 · AI Agent 上下文管理人工确认多智能体交接摘要

AI Agent 交接跑偏怎么办：从意图检查到交接摘要一步步排查

170浏览收藏
科技周边 · 人工智能 | 2天前 | 人工智能 · 质量检查 · AI应用 · 提示词工程 · 回归测试 · 大模型应用回归测试人工复核 AI提示词评分规则上线检查

AI 提示词回归测试实战：小样本集、评分规则和上线前对比

475浏览收藏
科技周边 · 人工智能 | 4天前 | 人工智能 · tracing · ai agent · 可观测性 · 工具调用 · 可观测性 AI Agent Tracing 工具调用 OpenAI Agents SDK

AI Agent Tracing 实战：工具调用、护栏和人工确认怎么追踪

292浏览收藏
科技周边 · 人工智能 | 4天前 | 人工智能 · ai agent · 工具调用 · 权限治理 · 人工智能审计日志 AI Agent 权限分级工具调用人工确认

AI Agent 工具权限分级实战：读、写、发布三类操作怎么管

379浏览收藏
科技周边 · 人工智能 | 5天前 | 人工智能 · AI应用 · 结构化输出 · 内容质检 · 提示词工程 · AI 提示词结构化输出 JSON Schema 质检流水线人工兜底

AI 输出质检流水线实战：规则检查、结构化结果和人工兜底

394浏览收藏
科技周边 · 人工智能 | 5天前 | 人工智能 · rag · 知识库 · 工程实践 · 向量检索 · 元数据 RAG embedding 向量检索 AI知识库文档分块

AI 知识库分块实战：按标题层级切文档，减少回答跑偏

101浏览收藏
科技周边 · 人工智能 | 5天前 | 人工智能 · AI应用 · 工程实践 · 工具调用 · 人工智能智能体参数校验 AI工具调用 JSON Schema

AI 工具调用落地实战：JSON Schema、参数校验和人工兜底

233浏览收藏

查看更多

课程推荐

前端进阶之JavaScript设计模式

设计模式是开发人员在软件开发过程中面临一般问题时的解决方案，代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景，打造一站式知识长龙服务，适合有JS基础的同学学习。

543次学习
GO语言核心编程课程

本课程采用真实案例，全面具体可落地，从理论到实践，一步一步将GO核心编程技术、编程思想、底层实现融会贯通，使学习者贴近时代脉搏，做IT互联网时代的弄潮儿。

516次学习
简单聊聊mysql8与网络通信

如有问题加微信：Le-studyg；在课程中，我们将首先介绍MySQL8的新特性，包括性能优化、安全增强、新数据类型等，帮助学生快速熟悉MySQL8的最新功能。接着，我们将深入解析MySQL的网络通信机制，包括协议、连接管理、数据传输等，让

500次学习
JavaScript正则表达式基础与实战

在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。

487次学习
从零制作响应式网站—Grid布局

本系列教程将展示从零制作一个假想的网络科技公司官网，分为导航，轮播，关于我们，成功案例，服务流程，团队介绍，数据部分，公司动态，底部信息等内容区块。网站整体采用CSSGrid布局，支持响应式，有流畅过渡和展现动画。

485次学习

查看更多

AI推荐

ljg-skills

ljg-skills 是李继刚开源的 AI 技能与提示词集合，面向大模型使用者整理了一批可复用的 prompt、角色设定和任务技能模板，适合用于学习提示词设计、搭建个人 AI 工作流和沉淀团队常用智能体能力。

548次使用
MELO音乐

MELO音乐是一站式AI视频与音乐制作助手，对标suno, udio的高品质体验。提供伴奏生成、原创写词、无损导出、哼唱识曲、混音变声等全套音频与短视频编辑工具。无论是流行Kpop、电音说唱、民谣古风、摇滚儿歌还是商用轻音乐，MELO为你免费谱曲，轻松做同款！

568次使用
UniScribe

UniScribe 是一款 AI 音视频转文字与内容整理工具，支持上传音频、视频文件或粘贴 YouTube 链接，自动生成转写文本、摘要、思维导图和关键问题，并支持多格式导出，适合会议记录、课程学习、访谈整理和内容创作复盘。

526次使用
剧云

剧云是专业中文剧本创作平台，安全稳定运行十余年，集成AI编剧、剧本医生审核、人物小传、剧情关系图、大纲编写、多人协作、Word导入导出、版权管控功能，数据安全防护，轻松高效创作剧本。

697次使用
万象有声

万象有声，一个专为有声创作者打造的新一代智能有声内容创作平台。平台提供专业的智能拆章、智能画本编辑、AI配音、AI生成音效、后期制作、智能对轨、智能审听等有声创作全流程工具，可以帮助创作者高效、低成本创作出引人入胜的有声作品。立即体验，让有声书制作更简单！

682次使用

查看更多

相关文章

GPT-4王者加冕！读图做题性能炸天，凭自己就能考上斯坦福

2023-04-25 501浏览
单块V100训练模型提速72倍！尤洋团队新成果获AAAI 2023杰出论文奖

2023-04-24 501浏览
ChatGPT 真的会接管世界吗？

2023-04-13 501浏览
VR的终极形态是「假眼」？Neuralink前联合创始人掏出新产品：科学之眼！

2023-04-30 501浏览
实现实时制造可视性优势有哪些？

2023-04-15 501浏览

Golang学习网：公益在线Go学习平台，帮助Go学习者快速成长！

技术交流群

Copyright 2023 http://www.17golang.com/ All Rights Reserved ｜苏ICP备2023003363号-1

关注公众号

Golang学习网

微信登录更方便

密码登录
注册账号

登录即同意用户协议和隐私政策

返回登录

重置密码