太全了!苹果上新视觉模型4M-21,搞定21种模态
“纵有疾风来,人生不言弃”,这句话送给正在学习科技周边的朋友们,也希望在阅读本文《太全了!苹果上新视觉模型4M-21,搞定21种模态》后,能够真的帮助到大家。我也会在后续的文章中,陆续更新科技周边相关的技术文章,有好的建议欢迎大家在评论留言,非常感谢!
当前的多模态和多任务基础模型,如 **4M** 或 **UnifiedIO**,显示出有希望的结果。然而,它们接受不同输入和执行不同任务的开箱即用能力,受到它们接受训练的模态和任务的数量(通常很少)的限制。
,基于此,来自洛桑联邦理工学院(EPFL)和苹果的研究者联合开发了一个**先进的**任意到任意模态单一模型,该模型在数十种**广泛**多样化的模态上进行训练,并对大规模多模态数据集和文本语料库进行协同训练。
训练过程中一个关键步骤是对各种模态执行离散 **tokenization**,无论它们是类似图像的神经网络 **feature map**、向量、实例分割或人体姿态等结构化数据,还是可以表征为文本的数据。
论文地址:https://arxiv.org/pdf/2406.09406
论文主页 https://4m.epfl.ch/
论文标题:4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities
该研究展示了训练单一模型,也能完成现有模型至少**三倍**多的任务 / **模态**,并且不会损失性能。此外,该研究还实现了更细粒度和更可控的多**模态**生成能力。
该研究建立在多模态掩码预训练方案的基础上,并通过在数十种高度多样化的模态上进行训练来提升**模型**能力。通过使用特定于模态的离散分词器对其进行编码,该研究实现了在不同模态上训练单个统一**模型**。
简单来说,该研究在几个关键维度上扩展了现有模型的功能:
模态:从现有最佳任意到任意模型的 7 种模态增加到 21 种不同模态,从而实现跨模态检索、可控生成和强大的开箱即用性能。这是第一次单个视觉模型可以以任意到任意的方式解决数十个不同的任务,而不会损害性能,并且没有任何传统的多任务学习。
多样性:添加对更多结构化数据的支持,例如人体姿态、SAM 实例、元数据等等。
tokenization:使用特定于模态的方法研究不同模态的离散 tokenization,例如全局图像嵌入、人体姿态和语义实例。
扩展:将模型大小扩展至 3B 参数,将数据集扩展至 0.5B 样本。
协同训练:同时在视觉和语言上协同训练。
方法介绍
该研究采用 4M 预训练方案(该研究同样来自 EPFL 和苹果,在去年发布),其被证明是一种通用方法,可以有效扩展到多模态。
具体而言,本文保持架构和多模态掩码训练目标不变,通过扩大模型和数据集的规模、增加训练模型所涉及的模态类型和数量,并且在多个数据集上进行联合训练,可以提升模型的性能和适应性。
模态分为以下几大类别:RGB、几何、语义、边缘、特征图、元数据和文本,如下图所示。
Tokenization
Tokenization 主要包括将不同模态和任务转换为序列或离散 token,从而统一它们的表示空间。研究者使用不同的 tokenization 方法来离散具有不同特征的模态,如图 3 所示。总而言之,本文采用了三种 tokenizer,包括 ViT tokenizer、MLP tokenizer 以及文本 tokenizer。
在架构选择上,本文采用基于 Transformer 的 4M 编码器 - 解码器架构,并添加额外的模态嵌入以适应新模态。
实验结果
接下来,论文展示了 4M-21 多模态能力。
多模态生成
基于迭代解码 token ,4M-21 可以用来预测任意训练模态。如图 2 所示,本文可以从给定的输入模态以一致的方式生成所有模态。
此外,由于该研究可以有条件和无条件地从其他模态的任何子集生成任何训练模态,因此它支持几种方法来执行细粒度和多模态生成,如图 4 所示,例如执行多模态编辑。此外,4M-21 表现出改进的文本理解能力,无论是在 T5-XXL 嵌入上还是在常规字幕上,都可以实现几何和语义上合理的生成(图 4,右上)。
多模态检索
如图 5 所示,4M-21 解锁了原始 DINOv2 和 ImageBind 模型无法实现的检索功能,例如通过使用其他模态作为查询来检索 RGB 图像或其他模态。此外,4M-21 还可以组合多种模态来预测全局嵌入,从而更好地控制检索,如右图所示。
开箱即用
4M-21 能够开箱即用地执行一系列常见的视觉任务,如图 6 所示。
表 1 评估了 DIODE 表面法线和深度估计、COCO 语义和实例分割、3DPW 3D 人体姿态估计等。
迁移实验
此外,本文还训练了三种不同尺寸的模型:B、L 和 XL。然后,将其编码器迁移到下游任务,并在单模态 (RGB) 和多模态 (RGB + 深度) 设置上进行评估。所有迁移实验均丢弃解码器,而是训练特定任务的头部。结果如表 2 所示:
最后,本文在 NYUv2、Hypersim 语义分割和 ARKitScenes 上的 3D 对象检测上执行多模态传输。如表 3 所示,4M-21 充分利用了可选的深度输入,并显著改进了基线。
终于介绍完啦!小伙伴们,这篇关于《太全了!苹果上新视觉模型4M-21,搞定21种模态》的介绍应该让你收获多多了吧!欢迎大家收藏或分享给更多需要学习的朋友吧~golang学习网公众号也会发布科技周边相关知识,快来关注吧!

- 上一篇
- Win11 24H2将调整安全规则 NAS用户访问可能失败

- 下一篇
- 联合国发布《全球信息诚信原则》,呼吁遏制传播错误虚假信息和仇恨言论
-
- 科技周边 · 人工智能 | 40分钟前 |
- 豆包AI知识图谱配置与实体关系设置详解
- 498浏览 收藏
-
- 科技周边 · 人工智能 | 47分钟前 |
- DeepSeek手机版接入腾讯会议,实时转录功能详解
- 456浏览 收藏
-
- 科技周边 · 人工智能 | 51分钟前 | 台积电 董事长 TSMCArizona 退休 RickCassidy
- 台积电亚利桑那董事长将退休
- 477浏览 收藏
-
- 科技周边 · 人工智能 | 53分钟前 |
- Gemini心理测试能力深度解析
- 452浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 |
- 多模态AI趋势与未来发展方向
- 465浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 |
- 豆包AI编程教程:轻松写程序指南
- 419浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 |
- 新手必看!DeepSeekAI标题技巧,小红书爆款攻略!
- 390浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 |
- 豆包AI菜谱推荐如何玩转美食创作
- 319浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 |
- 豆包AI轻松处理Python字典教程
- 443浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 |
- 豆包AI能设计珠宝?3D建模工具解析
- 329浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 542次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 508次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 497次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 484次学习
-
- 边界AI平台
- 探索AI边界平台,领先的智能AI对话、写作与画图生成工具。高效便捷,满足多样化需求。立即体验!
- 14次使用
-
- 免费AI认证证书
- 科大讯飞AI大学堂推出免费大模型工程师认证,助力您掌握AI技能,提升职场竞争力。体系化学习,实战项目,权威认证,助您成为企业级大模型应用人才。
- 37次使用
-
- 茅茅虫AIGC检测
- 茅茅虫AIGC检测,湖南茅茅虫科技有限公司倾力打造,运用NLP技术精准识别AI生成文本,提供论文、专著等学术文本的AIGC检测服务。支持多种格式,生成可视化报告,保障您的学术诚信和内容质量。
- 163次使用
-
- 赛林匹克平台(Challympics)
- 探索赛林匹克平台Challympics,一个聚焦人工智能、算力算法、量子计算等前沿技术的赛事聚合平台。连接产学研用,助力科技创新与产业升级。
- 239次使用
-
- 笔格AIPPT
- SEO 笔格AIPPT是135编辑器推出的AI智能PPT制作平台,依托DeepSeek大模型,实现智能大纲生成、一键PPT生成、AI文字优化、图像生成等功能。免费试用,提升PPT制作效率,适用于商务演示、教育培训等多种场景。
- 183次使用
-
- GPT-4王者加冕!读图做题性能炸天,凭自己就能考上斯坦福
- 2023-04-25 501浏览
-
- 单块V100训练模型提速72倍!尤洋团队新成果获AAAI 2023杰出论文奖
- 2023-04-24 501浏览
-
- ChatGPT 真的会接管世界吗?
- 2023-04-13 501浏览
-
- VR的终极形态是「假眼」?Neuralink前联合创始人掏出新产品:科学之眼!
- 2023-04-30 501浏览
-
- 实现实时制造可视性优势有哪些?
- 2023-04-15 501浏览