当前位置：首页 > 文章列表 > 科技周边 > 人工智能 > 模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

来源：51CTO.COM 2024-04-26 13:03:15 0浏览收藏

大家好，我们又见面了啊~本文《模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了》的内容中将会涉及到等等。如果你正在学习科技周边相关知识，欢迎关注我，以后会给大家带来更多科技周边相关文章，希望我们能一起进步！下面就开始本文的正式内容~

把Huggingface上的现成模型拿来“攒一攒”——

直接就能组合出新的强大模型？！

日本大模型公司sakana.ai脑洞大开（正是“Transformer八子”之一所创办的公司），想出了这么一个进化合并模型的妙招。

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

该方法不仅能自动生成新的基础模型，而且性能绝不赖：

他们利用一个包含70亿个参数的日语数学大型模型，在相关基准测试中取得了最先进的结果，超越了700亿参数的Llama-2等先前模型。

最重要的是，得出这样的模型不需要任何梯度训练，因此需要的计算资源大大减少。

英伟达科学家Jim Fan看完大赞：

这是我最近读过的最有想象力的论文之一。

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

合并进化，自动生成新基础模型

从开源大模型排行榜上表现最好的模型，大多不再是LLaMA或Mistral这种“原始”模型，而是一些微调或合并模型之后，我们就能看出：

一种新的趋势出现了。

Sakana.ai介绍，开源基础模型很容易在数百个不同的方向上进行扩展和微调，然后产生在新的领域表现出色的新模型。

而在这之中，模型合并显现出了巨大前景。

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

但，它可能是一种“黑魔法”，严重依赖直觉和专业知识。

因此，我们需要更为系统性的方法。

受自然界的自然选择启发，Sakana.ai盯上了进化算法，引入“进化模型合并”（Evolutionary Model Merge）的概念，提出一种可以发现最佳模型组合的通用方法。

该方法结合了两种不同的思路：

（1）合并数据流空间（层）中的模型，以及（2）合并参数空间（权重）中的模型。

具体而言，第一种数据流空间方法是通过进化来发现不同模型层的最佳组合，以此形成新模型。

在社区以往的做法中，都是靠直觉来确定如何以及模型哪些层可以与另一个模型的层结合。

但其实，Sakana.ai介绍，这个问题有一个组合数量巨大的搜索空间，最适合由优化算法如进化算法来搜索。

其操作示例如下：

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

至于第二个参数空间方法则混合多个模型权重来形成新模型。

这种方法其实很无数种实现，再加上混合的每一层原则上可以使用不同的混合比例，就更多了。

而这，利用进化方法就可以有效地找出更为新颖的混合策略。

以下是将两个不同模型的权重进行混合得到新模型的操作示例：

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

将以上这两种方法合并，就是这样的：

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

作者介绍，他们希望在相距较远的领域，例如数学和非英语语言、视觉和非英语语言，来组成之前大家不曾探索过的新兴组合。

结果，还真有点让人惊喜。

新模型轻松拿下SOTA

用以上进化合并方法，团队得到了3个基础模型：

大语言模型EvoLLM-JP

由日语大模型Shisa-Gamma和数学大模型WizardMath/Abel合并而成，擅长解决日语数学问题，进化了100-150代。

视觉语言模型EvoVLM-JP

日语大模型Shisa Gamma 7B v1+LLaVa-1.6-Mistral-7B，是具有日语能力的VLM。

图像生成模型EvoSDXL-JP

支持日语的SDXL扩散模型。

前两个已在Hugging Face和GitHub上发布，最后一个也即将推出。

具体来看。

1、EvoLLM-JP

它在GSM8K数据集的多语言版本——MGSM的日语评估集上取得成绩如下：

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

可以看到，EvoLLM-JP用日语解决数学问题的表现超过了它们的原始模型，也超过了Llama-2、GPT-3.5等高性能模型。

其中模型4是仅在参数空间进行了优化，模型6是使用模型4在数据流空间中进一步优化的结果。

在既评估数据能力也评估一般日语能力的日语lm-evaluation-harness基准上，EvoLLM-JP则在9个任务上的平均得分最高达到了70.5——只用70亿参数，它就打败了700亿的Llama-2等模型。

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

团队表示，EvoLLM-JP已经足够优秀，可以作为通用日语大模型，并解决一些有趣的例子：

比如需要特定日本文化知识的数学问题，或者用关西方言讲日本笑话。

2、EvoVLM-JP

在以下两个图像问答的基准数据集上，分数越高，代表模型用日语回答的描述越准确。

结果，它不仅比其所基于的英语VLM LLaVa-1.6-Mistral-7B更出色，也比现有的日语VLM更厉害。

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

如下图所示，在回答图中的信号灯为什么颜色之时，只有EvoVLM-JP答对：蓝色。

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

3、EvoSDXL-JP

这个支持日语的SDXL模型只需4个扩散模型即可执行推理，生成速度相当快。

具体跑分还没出来，但团队透露也是“相当有希望的”。

可以欣赏一些示例：

提示词包括：味噌ラーメン、最高品質の浮世絵、葛飾北斎、江戸時代。

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

对于以上3个新模型，团队指出：

原则上，我们可以采用基于梯度的反向传播来进一步提高以上这些模型的性能。

但我们不用，因为现在的目的就是表明，即使没有反向传播，我们仍然可以得到足够先进的基础模型，挑战当前的“昂贵范式”。

对此，网友们纷纷点赞。

Jim Fan也补充：

在基础模型领域，目前社区几乎完全专注于让模型去学习，而不太重视搜索，但后者在训练（也就是本文提出的进化算法）和推理阶段其实都有巨大的潜力。

△马斯克点赞

所以，如网友所说：

我们现在已经处于模型的寒武纪大爆发时代了吗？

模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了

论文地址：https://arxiv.org/abs/2403.13187

到这里，我们也就讲完了《模型合并就进化，直接拿下SOTA！Transformer作者创业新成果火了》的内容了。个人认为，基础知识的学习和巩固，是为了更好的将其运用到项目中，欢迎关注golang学习网公众号，带你了解更多关于数据,训练的知识点！

数据训练

版本声明

本文转载于：51CTO.COM 如有侵犯，请联系study_golang@163.com删除

WIN7系统电脑前的插孔没声音的解决方法

WIN7系统电脑前的插孔没声音的解决方法

上一篇: WIN7系统电脑前的插孔没声音的解决方法

在 Go 中生成构建时间戳

下一篇: 在 Go 中生成构建时间戳

查看更多

最新文章

科技周边 · 人工智能 | 10分钟前 |

MemoAI官网使用教程详解

431浏览收藏
科技周边 · 人工智能 | 18分钟前 |

Keras神经网络教程：快速建模入门指南

256浏览收藏
科技周边 · 人工智能 | 21分钟前 |

ChatGPT上传PDF方法与分析功能全解析

306浏览收藏
科技周边 · 人工智能 | 39分钟前 |

AI冥想工具搭配豆包使用教程

159浏览收藏
科技周边 · 人工智能 | 44分钟前 |

Deepseek满血版搭配Murf，打造自然语音内容

410浏览收藏
科技周边 · 人工智能 | 50分钟前 |

Gemini新闻采编自动化全解析

175浏览收藏
科技周边 · 人工智能 | 54分钟前 |

小米YU7五大主驾五大场景模式解析

131浏览收藏
科技周边 · 人工智能 | 59分钟前 |

AI+豆包，轻松规划完美旅游行程

312浏览收藏
科技周边 · 人工智能 | 59分钟前 | 性能长视频时间轴 Clipfly 视频分割

Clipfly长视频分割技巧全解析

207浏览收藏
科技周边 · 人工智能 | 1小时前 |

DeepSeek自动备份设置方法详解

444浏览收藏
科技周边 · 人工智能 | 1小时前 | 数据分析内容质量 360智图收益数据 eCPM

360智图收益查看与分析教程

363浏览收藏
科技周边 · 人工智能 | 1小时前 |

豆包AI发音工具，轻松练标准发音

343浏览收藏

查看更多

课程推荐

前端进阶之JavaScript设计模式

设计模式是开发人员在软件开发过程中面临一般问题时的解决方案，代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景，打造一站式知识长龙服务，适合有JS基础的同学学习。

542次学习
GO语言核心编程课程

本课程采用真实案例，全面具体可落地，从理论到实践，一步一步将GO核心编程技术、编程思想、底层实现融会贯通，使学习者贴近时代脉搏，做IT互联网时代的弄潮儿。

511次学习
简单聊聊mysql8与网络通信

如有问题加微信：Le-studyg；在课程中，我们将首先介绍MySQL8的新特性，包括性能优化、安全增强、新数据类型等，帮助学生快速熟悉MySQL8的最新功能。接着，我们将深入解析MySQL的网络通信机制，包括协议、连接管理、数据传输等，让

498次学习
JavaScript正则表达式基础与实战

在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。

487次学习
从零制作响应式网站—Grid布局

本系列教程将展示从零制作一个假想的网络科技公司官网，分为导航，轮播，关于我们，成功案例，服务流程，团队介绍，数据部分，公司动态，底部信息等内容区块。网站整体采用CSSGrid布局，支持响应式，有流畅过渡和展现动画。

484次学习

查看更多

AI推荐

千音漫语

千音漫语，北京熠声科技倾力打造的智能声音创作助手，提供AI配音、音视频翻译、语音识别、声音克隆等强大功能，助力有声书制作、视频创作、教育培训等领域，官网：https://qianyin123.com

113次使用
MiniWork

MiniWork是一款智能高效的AI工具平台，专为提升工作与学习效率而设计。整合文本处理、图像生成、营销策划及运营管理等多元AI工具，提供精准智能解决方案，让复杂工作简单高效。

109次使用
NoCode

NoCode (nocode.cn)是领先的无代码开发平台，通过拖放、AI对话等简单操作，助您快速创建各类应用、网站与管理系统。无需编程知识，轻松实现个人生活、商业经营、企业管理多场景需求，大幅降低开发门槛，高效低成本。

126次使用
达医智影

达医智影，阿里巴巴达摩院医疗AI创新力作。全球率先利用平扫CT实现“一扫多筛”，仅一次CT扫描即可高效识别多种癌症、急症及慢病，为疾病早期发现提供智能、精准的AI影像早筛解决方案。

118次使用
智慧芽Eureka

智慧芽Eureka，专为技术创新打造的AI Agent平台。深度理解专利、研发、生物医药、材料、科创等复杂场景，通过专家级AI Agent精准执行任务，智能化工作流解放70%生产力，让您专注核心创新。

122次使用

查看更多

相关文章

GPT-4王者加冕！读图做题性能炸天，凭自己就能考上斯坦福

2023-04-25 501浏览
单块V100训练模型提速72倍！尤洋团队新成果获AAAI 2023杰出论文奖

2023-04-24 501浏览
ChatGPT 真的会接管世界吗？

2023-04-13 501浏览
VR的终极形态是「假眼」？Neuralink前联合创始人掏出新产品：科学之眼！

2023-04-30 501浏览
实现实时制造可视性优势有哪些？

2023-04-15 501浏览

Golang学习网：公益在线Go学习平台，帮助Go学习者快速成长！

技术交流群

Copyright 2023 http://www.17golang.com/ All Rights Reserved ｜苏ICP备2023003363号-1

关注公众号

Golang学习网

微信登录更方便

密码登录
注册账号

登录即同意用户协议和隐私政策

返回登录

重置密码