当前位置:首页 > 文章列表 > 科技周边 > 人工智能 > 高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

来源:机器之心 2024-06-16 22:39:29 0浏览 收藏

积累知识,胜过积蓄金银!毕竟在科技周边开发的过程中,会遇到各种各样的问题,往往都是一些细节知识点还没有掌握好而导致的,因此基础知识点的积累是很重要的。下面本文《高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF》,就带大家讲解一下知识点,若是你对本文感兴趣,或者是想搞懂其中某个知识点,就请你继续往下看吧~

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

本网站AIxiv专栏是发布学术、技术内容的栏目。过去几年,本站AIxiv专栏接收报道逾2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com。


在三维生成建模的研究领域,现行的两大类 3D 表示方法要么基于拟合能力不足的隐式解码器,要么缺乏清晰定义的空间结构难以与主流的 3D 扩散技术融合。来自中科大、清华和微软亚洲研究院的研究人员提出了 GaussianCube,这是一种具有强大拟合能力的显式结构化三维表示,并且可以无缝应用于目前主流的 3D 扩散模型中。

GaussianCube 首先采用一种新颖的密度约束高斯拟合算法,该算法能够对 3D 资产进行高精度拟合,同时确保使用固定数量的自由高斯。随后,借助最优传输算法,这些高斯被重新排列到一个预定义的体素网格之中。得益于 GaussianCube 的结构化特性,研究者无需复杂的网络设计就能直接应用标准的 3D U-Net 作为扩散建模的主干网络。

更为关键的是,本文提出的新型拟合算法极大地增强了表示的紧凑性,在 3D 表示拟合质量相似的情况下所需的参数量仅是传统结构化表示所需参数量的十分之一或百分之一。这种紧凑性大幅降低了 3D 生成建模的复杂性。研究人员在无条件和条件性 3D 对象生成、数字化身创建以及文本到 3D 内容合成等多个方面开展了广泛的实验。

数值结果表明,GaussianCube 相较之前的基线算法实现了最高达 74% 的性能提升。如下所示,GaussianCube 不仅能够生成高质量的三维资产,而且还提供了极具吸引力的视觉效果,充分证明了其作为 3D 生成通用表示的巨大潜力。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                          图 1. 无条件生成的结果。本文的方法可以生成高质量、多样化的三维模型。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF                                    图 2. 基于输入肖像进行数字化身创建的结果。本文的方法可以极大程度上保留输入肖像的身份特征信息,并且提供细致的发型、服装建模。高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                       图 3. 基于输入文本创建三维资产的结果。本文的方法可以输出与文本信息一致的结果,并且可以建模复杂的几何结构和细节材质。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                                 图 4. 类别条件生成的结果。本文生成的三维资产语义明确,具有高质量的几何结构和材质。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

  • 论文名称:GaussianCube: A Structured and Explicit Radiance Representation for 3D Generative Modeling
  • 项目主页:https://gaussiancube.github.io/
  • 论文链接:https://arxiv.org/pdf/2403.19655
  • 代码开源:https://github.com/GaussianCube/GaussianCube
  • 演示视频:https://www.bilibili.com/video/BV1zy411h7wB/

都什么年代了
还在用传统 NeRF 进行三维生成建模?

大多数先前的 3D 生成建模工作都使用了 Neural Radiance Field (NeRF) 的变体作为其底层的 3D 表示,这些表示通常结合了一个显式的结构化特征表示和一个隐式的特征解码器。然而在三维生成建模中,所有三维物体不得不共享同一个隐式特征解码器,这种做法在很大程度上削弱了 NeRF 的拟合能力。此外,NeRF 所依赖的体渲染技术具有非常高的计算复杂性,这导致了渲染速度缓慢,更需要消耗极高的 GPU 内存。近期,另一种三维表示方法高斯溅射(3D Gaussian Splatting,简称 3DGS)备受瞩目。虽然 3DGS 拟合能力强大、计算性能高效,还具备完全显式的特性,在三维重建任务中得到了广泛应用。但是,3DGS 缺乏一个明确定义的空间结构,这使得其在无法直接应用于目前主流生成建模框架中。

因此,研究团队提出了 GaussianCube。这是一种创新的三维表示方法,它既结构化又完全显式,具备强大的拟合能力。本文介绍的方法首先确保通过固定数量的自由高斯实现高精度的拟合,然后将这些高斯有效地组织到一个结构化的体素网格中。这种显式且结构化的表示方法让研究者能够无缝地采用标准的 3D 网络架构,例如 U-Net,无需进行使用非结构化或隐式解码表示时所需的复杂和定制化的网络设计。

同时,通过最优传输算法进行的结构化组织最大程度地保持了相邻高斯核之间的空间结构关系,使得研究者仅使用经典的 3D 卷积网络就能高效地提取特征。更为关键的是,鉴于先前研究中的发现,扩散模型在处理高维数据分布时表现不佳,本文提出的 GaussianCube 在保持高质量重建的同时,显著减少了所需的参数量,极大地缓解了扩散模型在分布建模上的压力,为 3D 生成建模领域带来了显著的建模能力和效率提升。

方法 

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                           图 5. GaussianCube 框架总览

本文的框架包括两个主要阶段:表示构建和三维扩散。在表示构建阶段,给定三维资产的多视角渲染图,对其进行密度约束的高斯拟合,以获得具有固定数量的三维高斯。随后,通过最优化传输将三维高斯结构化为 GaussianCube。在三维扩散阶段,研究人员对三维扩散模型进行训练,以便从高斯噪声中生成 GaussianCube。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                                           图 6. 密度约束的高斯拟合算法示意图

在表示构建阶段,研究人员需要为每个三维资产创建适合生成建模的表示。考虑到生成领域往往需要建模的数据有统一的固定长度,而原始 3DGS 拟合算法中的自适应密度控制会导致拟合不同物体所使用的高斯核数量不同,这给生成建模带来了极大挑战。一种非常简单的解决方案是直接去除自适应密度控制,但研究人员发现这会严重降低拟合的精度。本文提出了一种新颖的密度约束拟合算法,保留原始自适应密度控制中的剪枝操作,但对其中的分裂和克隆操作进行了新的约束处理。

具体来说,假设当前迭代包括高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF个高斯,研究人员通过选择那些在视角空间位置梯度幅度超过预定义阈值 τ 的高斯来识别分裂或克隆操作的候选对象,这些候选对象的数量记为高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF。为了防止超出预定义的最大值高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF个高斯,从候选对象中选择高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF个具有最大视角空间位置梯度的高斯进行分裂或克隆。在完成拟合过程后,研究人员用 α=0 的高斯填充以达到目标计数图片而不影响渲染结果。得益于此策略,可以实现了与类似质量的现有工作相比参数量减少了几个量级的高质量表示,显著降低了扩散模型的建模难度。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                                               图 7. 密度约束的高斯拟合算法示意图

尽管如此,通过上述拟合算法得到的高斯仍然没有明确的空间排列结构,这使得后续的扩散模型无法高效地对数据进行建模。为此,研究人员提出将高斯映射到预定义的结构化体素网格中来使得高斯具有明确的空间结构。直观地说,这一步的目标是在尽可能保持高斯的空间相邻关系的同时,将每个高斯 “移动” 到一个体素中。

研究人员将其建模为一个最优传输问题,使用 Jonker-Volgenant 算法来得到对应的映射关系,进而根据最优传输的解来组织将高斯组织到对应的体素中得到 GaussianCube,并且用当前体素中心的偏移量替换了原始高斯的位置,以减少扩散模型的解空间。最终的 GaussianCube 表示不仅结构化,而且最大程度上保持了相邻高斯之间的结构关系,这为 3D 生成建模的高效特征提取提供了强有力的支持。

在三维扩散阶段,本文使用三维扩散模型来建模 GaussianCube 的分布。得益于 GaussianCube 在空间上的结构化组织关系,无需复杂的网络或训练设计,标准的 3D 卷积足以有效提取和聚合邻近高斯的特征。于是,研究者利用了标准的 U-Net 网络进行扩散,并直接地将原始的 2D 操作符(包括卷积、注意力、上采样和下采样)替换为它们的 3D 实现。

本文的三维扩散模型也支持多种条件信号来控制生成过程,包括类别标签条件生成、根据图像条件创建数字化身和根据文本生成三维数字资产。基于多模态条件的生成能力极大地扩展了模型的应用范围,并为未来的 3D 内容创造提供了强大的工具。

实验结果 

研究人员首先在 ShapeNet Car 数据集上验证了 GaussianCube 的拟合能力。实验结果表明,与基线方法相比,GaussianCube 可以以最快的速度和最少的参数量实现高精度的三维物体拟合。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

表 1. 在 ShapeNet Car 上不同的三维表示关于空间结构、拟合质量、相对拟合速度、使用参数量的数值比较。∗ 表示不同物体共享隐式特征解码器。所有方法均以 30K 次迭代进行评估。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                 图 8. 在 ShapeNet Car 上不同的三维表示拟合能力的视觉比较。∗ 表示不同物体共享隐式特征解码器。所有方法均以 30K 次迭代进行评估。

研究人员其次在大量数据集上验证了基于 GaussianCube 的扩散模型的生成能力,包括 ShapeNet、OmniObject3D、合成数字化身数据集和 Objaverse 数据集。实验结果表明,本文的模型在无条件和类别条件的对象生成、数字化身创建以及文本到 3D 合成从数值指标到视觉质量都取得了领先的结果。特别地,GaussianCube 相较之前的基线算法实现了最高达 74% 的性能提升。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                     表 2. 在 ShapeNet Car、Chair 上进行无条件生成和在 OmniObject3D 上进行类别条件生成的定量比较。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                       图 9. 在 ShapeNet Car、Chair 上进行无条件生成的定性比较。本文的方法可以生成精确几何和细节材质。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                     图 10. 在 OmniObject3D 上进行类别条件生成的定性比较。本文方法可以生成明确语义的复杂物体。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                     表 3. 基于输入肖像进行数字化身创建的定量比较。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                       图 11. 基于输入肖像进行数字化身创建的定性比较。本文的方法能够更准确地还原输入肖像的身份特征、表情、配饰和头发细节。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

表 4. 基于输入文本创建三维资产的定量比较。推理时间使用单张 A100 进行测试。Shap-E 和 LGM 与本文方法取得了相似的 CLIP Score,但它们分别使用了数百万的训练数据(本文仅使用十万三维数据训练),和二维文生图扩散模型先验。

高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF

                                    图 12. 基于输入文本创建三维资产的定性比较。本文的方法可以根据输入文本实现高质量三维资产生成。

以上就是《高质量3D生成最有希望的一集?GaussianCube在三维生成中全面超越NeRF》的详细内容,更多关于产业的资料请关注golang学习网公众号!

版本声明
本文转载于:机器之心 如有侵犯,请联系study_golang@163.com删除
让鲁迅说绕口令、赫本玩嘻哈,又一视频模型火了,斯坦福华人博士创立让鲁迅说绕口令、赫本玩嘻哈,又一视频模型火了,斯坦福华人博士创立
上一篇
让鲁迅说绕口令、赫本玩嘻哈,又一视频模型火了,斯坦福华人博士创立
英伟达开源最强通用模型Nemotron-4 340B
下一篇
英伟达开源最强通用模型Nemotron-4 340B
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    542次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    508次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    497次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    484次学习
查看更多
AI推荐
  • 可图AI图片生成:快手可灵AI2.0引领图像创作新时代
    可图AI图片生成
    探索快手旗下可灵AI2.0发布的可图AI2.0图像生成大模型,体验从文本生成图像、图像编辑到风格转绘的全链路创作。了解其技术突破、功能创新及在广告、影视、非遗等领域的应用,领先于Midjourney、DALL-E等竞品。
    22次使用
  • MeowTalk喵说:AI猫咪语言翻译,增进人猫情感交流
    MeowTalk喵说
    MeowTalk喵说是一款由Akvelon公司开发的AI应用,通过分析猫咪的叫声,帮助主人理解猫咪的需求和情感。支持iOS和Android平台,提供个性化翻译、情感互动、趣味对话等功能,增进人猫之间的情感联系。
    21次使用
  • SEO标题Traini:全球首创宠物AI技术,提升宠物健康与行为解读
    Traini
    SEO摘要Traini是一家专注于宠物健康教育的创新科技公司,利用先进的人工智能技术,提供宠物行为解读、个性化训练计划、在线课程、医疗辅助和个性化服务推荐等多功能服务。通过PEBI系统,Traini能够精准识别宠物狗的12种情绪状态,推动宠物与人类的智能互动,提升宠物生活质量。
    22次使用
  • 可图AI 2.0:快手旗下新一代图像生成大模型,专业创作者与普通用户的多模态创作引擎
    可图AI 2.0图片生成
    可图AI 2.0 是快手旗下的新一代图像生成大模型,支持文本生成图像、图像编辑、风格转绘等全链路创作需求。凭借DiT架构和MVL交互体系,提升了复杂语义理解和多模态交互能力,适用于广告、影视、非遗等领域,助力创作者高效创作。
    25次使用
  • 毕业宝AIGC检测:AI生成内容检测工具,助力学术诚信
    毕业宝AIGC检测
    毕业宝AIGC检测是“毕业宝”平台的AI生成内容检测工具,专为学术场景设计,帮助用户初步判断文本的原创性和AI参与度。通过与知网、维普数据库联动,提供全面检测结果,适用于学生、研究者、教育工作者及内容创作者。
    38次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码