Sparse4D v3来了!推进端到端3D检测和跟踪
科技周边不知道大家是否熟悉?今天我将给大家介绍《Sparse4D v3来了!推进端到端3D检测和跟踪》,这篇文章主要会讲到等等知识点,如果你在看完本篇文章后,有更好的建议或者发现哪里有问题,希望大家都能积极评论指出,谢谢!希望我们能一起加油进步!
新标题:Sparse4D v3:推进端到端的3D检测和跟踪技术
论文链接:https://arxiv.org/pdf/2311.11722.pdf
需要重新写的内容是:代码链接:https://github.com/linxuewu/Sparse4D
重新写的内容:作者所属单位为地平线公司
论文思路:
在自动驾驶感知系统中,3D检测和跟踪是两项基本任务。本文基于 Sparse4D 框架更深入地研究了该领域。本文引入了两个辅助训练任务(时序实例去噪-Temporal Instance Denoising和质量估计-Quality Estimation),并提出解耦注意力(decoupled attention)来进行结构改进,从而显着提高检测性能。此外,本文使用一种简单的方法将检测器扩展到跟踪器,该方法在推理过程中分配实例 ID,进一步突出了 query-based 算法的优势。在 nuScenes 基准上进行的大量实验验证了所提出的改进的有效性。以ResNet50为骨干,mAP、NDS和AMOTA分别提高了3.0%、2.2%和7.6%,分别达到46.9%、56.1%和49.0%。本文最好的模型在 nuScenes 测试集上实现了 71.9% NDS 和 67.7% AMOTA
主要贡献:
Sparse4D-v3 是一个强大的 3D 感知框架,它提出了三种有效的策略:时序实例去噪、质量估计和解耦注意力
本文将 Sparse4D 扩展为端到端跟踪模型。
本文展示了 nuScenes 改进的有效性,在检测和跟踪任务中实现了最先进的性能。
网络设计:
首先,观察到与稠密算法相比,稀疏算法在收敛方面面临更大的挑战,从而影响了最终性能。这个问题已经在2D检测领域得到了充分研究[17,48,53],主要原因是稀疏算法使用了一对一的正样本匹配。这种匹配方式在训练初期不稳定,而且与一对多匹配相比,正样本数量有限,从而降低了解码器训练的效率。此外,Sparse4D使用稀疏特征采样而不是全局交叉注意力,由于正样本稀缺,这进一步阻碍了编码器的收敛。在Sparse4Dv2中,引入了密集深度监督来部分缓解图像编码器面临的这些收敛问题。本文的主要目标是通过关注解码器训练的稳定性来增强模型性能。本文将去噪任务作为辅助监督,并将去噪技术从2D单帧检测扩展到3D时序检测。这不仅保证了稳定的正样本匹配,而且显著增加了正样本的数量。此外,本文还引入了质量评估任务作为辅助监督。这使得输出的置信度分数更加合理,提高了检测结果排名的准确性,从而获得更高的评估指标。此外,本文改进了Sparse4D中实例自注意力和时序交叉注意力模块的结构,引入了一种解耦注意力机制,旨在减少注意力权重计算过程中的特征干扰。通过将锚点嵌入和实例特征作为注意力计算的输入,可以减少注意力权重中存在异常值的实例。这样可以更准确地反映目标特征之间的相互关联,从而实现正确的特征聚合。本文使用连接而不是注意力机制来显著减少这种错误。这种增强方法与条件DETR有相似之处,但关键区别在于本文强调查询之间的注意力,而条件DETR则专注于查询和图像特征之间的交叉注意力。此外,本文还涉及独特的编码方法
为了提高感知系统的端到端能力,本文研究了将3D多目标跟踪任务集成到Sparse4D框架中的方法,以直接输出目标的运动轨迹。与基于检测的跟踪方法不同,本文通过消除数据关联和过滤的需求,将所有跟踪功能整合到检测器中。此外,与现有的联合检测和跟踪方法不同,本文的跟踪器在训练过程中无需进行修改或调整损失函数。它不需要提供ground truth IDs,而是实现了预定义的实例到跟踪的回归。本文的跟踪实现充分融合了检测器和跟踪器,无需修改检测器的训练过程,也无需额外微调
这是一个关于Sparse4D框架概述的图1,输入是多视图视频,输出是所有帧的感知结果
图 2:不同算法的 nuScenes 验证数据集上的推理效率 (FPS) - 感知性能 (mAP)。
图 3:实例自注意力中的注意力权重的可视化:1)第一行显示了普通自注意力中的注意力权重,其中红色圆圈中的行人显示出与目标车辆(绿色框)的意外相关性。2)第二行显示了解耦注意力中的注意力权重,有效解决了该问题。
第四张图展示了时序实例去噪的示例。在训练阶段,实例包括两个部分:可学习的和噪声的。噪声实例由时间和非时间元素组成。本文采用预匹配方法来分配正样本和负样本,即将 anchors 与 ground truth 进行匹配,而可学习实例则与预测和 ground truth 进行匹配。在测试阶段,只保留绿色块。为防止特征在 groups 之间传播,采用了 Attention mask,灰色表示 queries 和 keys 之间没有注意力,绿色表示相反
请看图5:锚点编码器和注意力的架构。本文独立地对锚点的多个组件进行了高维特征编码,然后将它们连接起来。与原始的Sparse4D相比,这种方法可以减少计算和参数的开销。E和F分别表示锚点嵌入和实例特征
实验结果:
总结:
本文首先提出了增强 Sparse4D 检测性能的方法。这一增强主要包括三个方面:时序实例去噪、质量估计和解耦注意力。随后,本文说明了将 Sparse4D 扩展为端到端跟踪模型的过程。本文在 nuScenes 上的实验表明,这些增强功能显着提高了性能,使 Sparse4Dv3 处于该领域的前沿。
引用:
Lin, X., Pei, Z., Lin, T., Huang, L., & Su, Z. (2023). Sparse4D v3: Advancing End-to-End 3D Detection and Tracking. ArXiv. /abs/2311.11722
本篇关于《Sparse4D v3来了!推进端到端3D检测和跟踪》的介绍就到此结束啦,但是学无止境,想要了解学习更多关于科技周边的相关知识,请关注golang学习网公众号!

- 上一篇
- 科技昨夜今晨 1124:国务院:在北京取消信息服务业务等增值电信业务外资股比限制;特斯拉中国回应 FSD 国内落地;OPPO / 荣耀 / 红魔新机发布

- 下一篇
- “大疆商城”App 6.9.7 版上线:官方介绍无人机虚拟飞行功能等
-
- 科技周边 · 人工智能 | 7小时前 |
- 腾讯混元3Dv2.5新版3D模型震撼发布
- 307浏览 收藏
-
- 科技周边 · 人工智能 | 9小时前 |
- Llama4震撼发布,Meta开源多模态AI霸主
- 417浏览 收藏
-
- 科技周边 · 人工智能 | 17小时前 | 深蓝汽车
- 深蓝汽车4月销量2.01万辆,同比增58%
- 170浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 542次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 508次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 497次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 484次学习
-
- AI Make Song
- AI Make Song是一款革命性的AI音乐生成平台,提供文本和歌词转音乐的双模式输入,支持多语言及商业友好版权体系。无论你是音乐爱好者、内容创作者还是广告从业者,都能在这里实现“用文字创造音乐”的梦想。平台已生成超百万首原创音乐,覆盖全球20个国家,用户满意度高达95%。
- 16次使用
-
- SongGenerator
- 探索SongGenerator.io,零门槛、全免费的AI音乐生成器。无需注册,通过简单文本输入即可生成多风格音乐,适用于内容创作者、音乐爱好者和教育工作者。日均生成量超10万次,全球50国家用户信赖。
- 13次使用
-
- BeArt AI换脸
- 探索BeArt AI换脸工具,免费在线使用,无需下载软件,即可对照片、视频和GIF进行高质量换脸。体验快速、流畅、无水印的换脸效果,适用于娱乐创作、影视制作、广告营销等多种场景。
- 12次使用
-
- 协启动
- SEO摘要协启动(XieQiDong Chatbot)是由深圳协启动传媒有限公司运营的AI智能服务平台,提供多模型支持的对话服务、文档处理和图像生成工具,旨在提升用户内容创作与信息处理效率。平台支持订阅制付费,适合个人及企业用户,满足日常聊天、文案生成、学习辅助等需求。
- 16次使用
-
- Brev AI
- 探索Brev AI,一个无需注册即可免费使用的AI音乐创作平台,提供多功能工具如音乐生成、去人声、歌词创作等,适用于内容创作、商业配乐和个人创作,满足您的音乐需求。
- 17次使用
-
- GPT-4王者加冕!读图做题性能炸天,凭自己就能考上斯坦福
- 2023-04-25 501浏览
-
- 单块V100训练模型提速72倍!尤洋团队新成果获AAAI 2023杰出论文奖
- 2023-04-24 501浏览
-
- ChatGPT 真的会接管世界吗?
- 2023-04-13 501浏览
-
- VR的终极形态是「假眼」?Neuralink前联合创始人掏出新产品:科学之眼!
- 2023-04-30 501浏览
-
- 实现实时制造可视性优势有哪些?
- 2023-04-15 501浏览