当前位置:首页 > 文章列表 > 科技周边 > 人工智能 > 开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

来源:51CTO.COM 2024-04-12 13:48:10 0浏览 收藏

小伙伴们有没有觉得学习科技周边很有意思?有意思就对了!今天就给大家带来《开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!》,以下内容将会涉及到,若是在学习中对其中部分知识点有疑问,或许看了本文就能帮到你!

0. 这篇文章干了啥?

提出了DepthFM:一个多功能且快速的最先进的生成式单目深度估计模型。除了传统的深度估计任务外,DepthFM还展示了在深度修复等下游任务中的最先进能力。DepthFM效率高,可以在少数推理步骤内合成深度图。

下面一起来阅读一下这项工作~

1. 论文信息

标题:DepthFM: Fast Monocular Depth Estimation with Flow Matching

作者:Ming Gui, Johannes S. Fischer, Ulrich Prestel, Pingchuan Ma, Dmytro Kotovenko, Olga Grebenkova, Stefan Andreas Baumann, Vincent Tao Hu, Björn Ommer

机构:MCML

原文链接:https://arxiv.org/abs/2403.13788

代码链接:https://github.com/CompVis/depth-fm

官方主页:https://depthfm.github.io/

2. 摘要

针对许多下游观光任务和应用至关重要。目前针对此问题的判别式方法受到模糊伪影的限制,而最先进的生成方法由于其SDE性质导致训练样本速度缓慢。我们不是从噪声开始,而是寻求从输入图像到深度图像的直接映射。我们观察到这可通过流匹配来有效地构建,因为其在解空间中的直线轨迹提供了效率和高质量。我们的研究表明,预先训练的图像扩散模型可用于作为流匹配深度模型的充分先验知识。在复杂自然场景的基准测试中,尽管仅在少量合成数据上进行训练,我们的轻量级方法以有利的低计算成本表现出最先进的性能。

3. 效果展示

DepthFM是一种具有强零样本泛化能力的快速推理流匹配模型,可利用强大的先验知识,并且很容易地泛化到未知的真实图像中。在合成数据上进行训练后,模型可以很好地泛化到未知的真实图像中,并对深度图像进行精确匹配。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

与其他最先进的模型相比,DepthFM仅用一个函数评估就获得了明显更清晰的图像。Marigold的深度估计耗时是DepthFM的两倍,但无法生成相同粒度的深度图。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

4. 主要贡献

(1)提出了DepthFM,一种最先进的、多功能的、快速的单目深度估计模型。除了传统的深度估计任务外,DepthFM还展示了在深度修补和深度条件图像合成等下游任务中的最新能力。

(2)展示了将强大的图像先验从扩散模型成功转移到流匹配模型,几乎不依赖于训练数据,也不需要真实世界的图像。

(3)表明,流匹配模型高效,并能在单个推理步骤内合成深度图。

(4)尽管仅在合成数据上进行训练,但DepthFM在基准数据集和自然图像上表现出色。

(5)将表面法线损失作为辅助目标,以获得更准确的深度估计。

(6)除了深度估计,还可可靠地预测其预测的置信度。

5. 具体原理是啥?

训练Pipeline。 训练受到流匹配和表面法向损失的限制:对于流匹配,使用数据依赖的流匹配来回归地面真实深度与对应图像之间的向量场。此外,通过一个表面法向损失来实现几何真实感。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

数据相关的流匹配: DepthFM通过利用图像到深度对,回归出图像分布和深度分布之间的直线向量场。这种方法在不牺牲性能的情况下促进了高效的几步推理。

从扩散先验微调: 作者展示了成功将强大的图像先验从基础图像合成扩散模型(Stable Diffusion v2-1)转移到流匹配模型,几乎不依赖训练数据,并且不需要真实世界的图像。

辅助表面法线损失: 考虑到DepthFM只在合成数据上进行训练,大多数合成数据集提供了地面真实表面法线,将表面法线损失作为辅助目标,以增强DepthFM深度估计的准确性。

6. 实验结果

DepthFM通过仅在63k纯合成样本上进行训练展现出了显著的泛化能力,并且能够在室内外数据集上进行零-shot深度估计。表1定性地展示了DepthFM与最先进的对应模型的性能对比。虽然其他模型通常依赖于大量数据集进行训练,但DepthFM利用了基于扩散的基础模型中固有的丰富知识。这种方法不仅节省了计算资源,而且强调了模型的适应性和训练效率。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

对基于扩散的Marigold深度估计、流匹配(FM)基准和DepthFM模型进行比较。每种方法仅使用一个集合成员进行评估,并针对两个常见基准数据集进行不同数量的函数评估(NFE)。与FM基准相比,DepthFM集成了训练过程中的法线损失和数据相关的耦合。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

对于Marigold和的DepthFM模型在不同数量的功能评估中的定性结果。值得注意的是,通过一步推断,Marigold并没有给出任何有意义的结果,而DepthFM的结果已经显示了真实的深度图。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

在Hypersim上进行深度补全。左:给予部分深度。中:深度估计从给定的部分深度。右:真值深度。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

7. 总结

DepthFM,一种用于单目深度估计的流匹配方法。通过学习输入图像和深度之间的直接映射,而不是将正态分布去噪为深度图,该方法明显比当前基于扩散的解决方案更高效,同时仍提供细粒度的深度图,而不会出现判别式范式的常见伪影。DepthFM使用预先训练好的图像扩散模型作为先验,有效地转移到了深度流匹配模型中。因此,DepthFM只在合成数据上进行了训练,但在推断期间仍然能很好地推广到自然图像。此外,辅助表面法线损失已被证明能改善深度估计。DepthFM的轻量级方法具有竞争力,速度快,并提供可靠的置信度估计。

对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文

以上就是本文的全部内容了,是否有顺利帮助你解决问题?若是能给你带来学习上的帮助,请大家多多支持golang学习网!更多关于科技周边的相关知识,也可关注golang学习网公众号。

版本声明
本文转载于:51CTO.COM 如有侵犯,请联系study_golang@163.com删除
正则表达式开头、包含和结尾正则表达式开头、包含和结尾
上一篇
正则表达式开头、包含和结尾
哪里可以找到 PHP 函数的全面列表
下一篇
哪里可以找到 PHP 函数的全面列表
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    542次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    508次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    497次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    484次学习
查看更多
AI推荐
  • 茅茅虫AIGC检测:精准识别AI生成内容,保障学术诚信
    茅茅虫AIGC检测
    茅茅虫AIGC检测,湖南茅茅虫科技有限公司倾力打造,运用NLP技术精准识别AI生成文本,提供论文、专著等学术文本的AIGC检测服务。支持多种格式,生成可视化报告,保障您的学术诚信和内容质量。
    43次使用
  • 赛林匹克平台:科技赛事聚合,赋能AI、算力、量子计算创新
    赛林匹克平台(Challympics)
    探索赛林匹克平台Challympics,一个聚焦人工智能、算力算法、量子计算等前沿技术的赛事聚合平台。连接产学研用,助力科技创新与产业升级。
    63次使用
  • SEO  笔格AIPPT:AI智能PPT制作,免费生成,高效演示
    笔格AIPPT
    SEO 笔格AIPPT是135编辑器推出的AI智能PPT制作平台,依托DeepSeek大模型,实现智能大纲生成、一键PPT生成、AI文字优化、图像生成等功能。免费试用,提升PPT制作效率,适用于商务演示、教育培训等多种场景。
    73次使用
  • 稿定PPT:在线AI演示设计,高效PPT制作工具
    稿定PPT
    告别PPT制作难题!稿定PPT提供海量模板、AI智能生成、在线协作,助您轻松制作专业演示文稿。职场办公、教育学习、企业服务全覆盖,降本增效,释放创意!
    68次使用
  • Suno苏诺中文版:AI音乐创作平台,人人都是音乐家
    Suno苏诺中文版
    探索Suno苏诺中文版,一款颠覆传统音乐创作的AI平台。无需专业技能,轻松创作个性化音乐。智能词曲生成、风格迁移、海量音效,释放您的音乐灵感!
    71次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码