在Sora引爆视频生成时,Meta开始用Agent自动剪视频了,华人作者主导
科技周边不知道大家是否熟悉?今天我将给大家介绍《在Sora引爆视频生成时,Meta开始用Agent自动剪视频了,华人作者主导》,这篇文章主要会讲到等等知识点,如果你在看完本篇文章后,有更好的建议或者发现哪里有问题,希望大家都能积极评论指出,谢谢!希望我们能一起加油进步!
近期,AI 视频技术领域备受关注,尤其是OpenAI推出的Sora视频生成大模型引起了广泛讨论。与此同时,在视频剪辑领域,Agent等大型AI模型也展现出强大的实力。
尽管自然语言被用于处理视频剪辑任务,用户可以直接表达意图而无需手动操作。然而,当前大多数视频剪辑工具仍然需要大量手动操作,并且缺乏个性化的上下文支持。这导致用户需要自行解决复杂的视频剪辑问题。
关键在于如何设计一个可以充当协作者、并在剪辑过程中不断协助用户的视频剪辑工具?在本文中,来自多伦多大学、 Meta(Reality Labs Research)、加州大学圣迭戈分校的研究者提出利用大语言模型(LLM)的多功能语言能力来进行视频剪辑,并探讨了未来的视频剪辑范式,从而减少与手动视频剪辑过程的阻碍。
- 论文标题:LAVE: LLM-Powered Agent Assistance and Language Augmentation for Video Editing
- 论文地址:https://arxiv.org/pdf/2402.10294.pdf
研究者开发了一款名为LAVE的视频剪辑工具,它集成了LLM提供的多项语言增强功能。LAVE引入了一个基于LLM的智能规划和执行系统,能够解释用户的自由格式语言指令,规划并执行相关操作,以达成用户的视频剪辑目标。这一智能系统能够提供概念化帮助,如创意头脑风暴和视频素材概览,并提供操作帮助,包括基于语义的视频检索、故事板和剪辑修剪等功能。
为了顺利进行这些智能体的操作,LAVE 使用了视觉语言模型(VLM)来自动生成视频视觉效果的语言描述。这些视觉叙述使得LLM能够理解视频内容,并利用他们的语言能力来协助用户完成剪辑。此外,LAVE 提供了两种交互视频剪辑模式,即智能体协助和直接操作。这种双重模式为用户提供了更大的灵活性,让他们可以根据需要改进智能体的操作。
至于 LAVE 的剪辑效果怎么样?研究者对包括剪辑新手和老手在内的 8 名参与者进行了用户研究,结果表明,参与者可以使用 LAVE 制作出令人满意的 AI 协作视频。
值得关注的是,这项研究的六位作者中有 5 位华人,包括一作、多伦多大学计算机科学博士生 Bryan Wang、Meta 研究科学家 Yuliang Li、Zhaoyang Lv 和 Yan Xu、加州大学圣迭戈分校助理教授 Haijun Xia。
LAVE 用户界面(UI)
我们首先来看 LAVE 的系统设计,具体如下图 1 所示。
LAVE 的用户界面包含三个主要组件,分别如下:
- 语言增强视频库,显示带有自动生成的语言描述的视频片段;
- 视频剪辑时间轴,包括用于剪辑的主时间轴;
- 视频剪辑智能体,使用户与一个会话智能体进行交互并获得帮助。
设计逻辑是这样的:当用户与智能体交互时,消息交换会在聊天 UI 中显示。当进行相关操作时,智能体对视频库和剪辑时间轴进行更改。此外,用户可以使用光标直接对视频库和时间轴进行操作,类似于传统的剪辑界面。
语言增强视频库
语言增强视频库的功能如下图 3 所示。
与传统工具一样,该功能允许剪辑播放,但会提供视觉叙述,即为每个视频自动生成文本描述,包括语义标题和摘要。这些标题可以帮助理解和索引剪辑,摘要则提供了每个剪辑的视觉内容的概述,帮助用户形成自身编辑项目的故事情节。每个视频下方都会显示标题和时长。
此外,LAVE 使用户可以利用语义语言查询来搜索视频,检索到的视频会在视频库中显示并按相关性排序。这一功能必须通过剪辑智能体来执行。
视频剪辑时间轴
从视频库中选定视频并将它添加到剪辑时间轴后,它们会显示在界面底部的视频剪辑时间轴上,如下图 2 所示。其中,时间轴上的每个剪辑都由一个框表示,并显示三个缩略图帧,分别是开始帧、中间帧和结束帧。
在 LAVE 系统中,每个缩略图帧代表剪辑中一秒钟的素材。与视频库一样,每个剪辑的标题和描述都会提供。LAVE 中的剪辑时间轴具有两个关键功能,即剪辑排序和修剪。
其中在时间轴上进行剪辑排序是视频剪辑中的一项常见任务,对于创建连贯的叙述非常重要。LAVE 支持两种排序方法,一是基于 LLM 的排序利用视频剪辑智能体的故事板功能进行操作,二是手动排序通过用户直接操作来排序,拖放每个视频框来设置剪辑出现的顺序。
修剪在视频剪辑中也很重要,可以突出显示关键片段并删除多余内容。在修剪时,用户双击时间轴中的剪辑,打开一个显示一秒帧的弹出窗口,如下图 4 所示。
视频剪辑智能体
LAVE 的视频剪辑智能体是一个基于聊天的组件,可促进用户和基于 LLM 的智能体之间的交互。与命令行工具不同,用户可以使用自由格式的语言与智能体进行交互。该智能体利用 LLM 的语言智能提供视频剪辑辅助,并提供具体的响应,以在整个编辑过程中指导和帮助用户。LAVE 的智能体协助功能是通过智能体操作提供的,每个智能体操作都涉及执行系统支持的编辑功能。
总的来说,LAVE 提供的功能涵盖了从构思和预先规划到实际编辑操作的整个工作流程,但该系统并没有强制规定严格的工作流程。用户可以灵活地利用与其编辑目标相符的功能子集。例如,具有清晰编辑愿景和明确故事情节的用户可能会绕过构思阶段并直接投入编辑。
后端系统
该研究采用 OpenAI 的 GPT-4 来阐述 LAVE 后端系统的设计,主要包括智能体设计、实现由 LLM 驱动的编辑功能两个方面。
智能体设计
该研究利用 LLM(即 GPT-4)的多种语言能力(包括推理、规划和讲故事)构建了 LAVE 智能体。
LAVE 智能体有两种状态:规划和执行。这种设置有两个主要好处:
- 允许用户设置包含多个操作的高级目标,从而无需像传统命令行工具那样详细说明每个单独的操作。
- 在执行之前,智能体会将规划呈现给用户,提供修改的机会并确保用户可以完全控制智能体的操作。研究团队设计了一个后端 pipeline 来完成规划和执行流程。
如下图 6 所示,该 pipeline 首先根据用户输入创建行动规划。然后,该规划从文本描述转换为函数调用,随后执行相应的函数。
实现 LLM 驱动的编辑功能
为了帮助用户完成视频编辑任务,LAVE 主要支持五种由 LLM 驱动的功能,包括:
- 素材概述
- 创意头脑风暴
- 视频检索
- 故事板
- 剪辑修剪
其中前四个可通过智能体来访问(图 5),而剪辑修剪功能可通过双击时间轴中的剪辑,打开一个显示一秒帧的弹出窗口(图 4)。
其中,基于语言的视频检索是通过向量存储数据库实现的,其余的则通过 LLM 提示工程(prompt engineering)来实现。所有功能都建立在自动生成的原始素材语言描述之上,包括视频库中每个剪辑的标题和摘要(图 3)。研究团队将这些视频的文字描述称为视觉叙述(visual narration)。
感兴趣的读者可以阅读论文原文,了解更多研究内容。
今天带大家了解了的相关知识,希望对你有所帮助;关于科技周边的技术知识我们会一点点深入介绍,欢迎大家关注golang学习网公众号,一起学习编程~

- 上一篇
- 小米应用商店出台新规:整治自动续费乱象,保障用户权益

- 下一篇
- WIN10蓝屏代码解释设置方法
-
- 科技周边 · 人工智能 | 9小时前 | 个性化定制 笔灵AI写作 免费功能 付费功能 bilings.ai
- 笔灵AI写作官网攻略:免费注册即用
- 208浏览 收藏
-
- 科技周边 · 人工智能 | 10小时前 | 算力需求 国产AI大模型 国家超算互联网平台 MiniMax-Text-01 注册用户
- 国家超算平台发布超长文本模型
- 278浏览 收藏
-
- 科技周边 · 人工智能 | 13小时前 |
- Llama4刷榜惹争议,20万显卡仅此成绩?
- 275浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 542次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 508次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 497次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 484次学习
-
- 笔灵AI生成答辩PPT
- 探索笔灵AI生成答辩PPT的强大功能,快速制作高质量答辩PPT。精准内容提取、多样模板匹配、数据可视化、配套自述稿生成,让您的学术和职场展示更加专业与高效。
- 15次使用
-
- 知网AIGC检测服务系统
- 知网AIGC检测服务系统,专注于检测学术文本中的疑似AI生成内容。依托知网海量高质量文献资源,结合先进的“知识增强AIGC检测技术”,系统能够从语言模式和语义逻辑两方面精准识别AI生成内容,适用于学术研究、教育和企业领域,确保文本的真实性和原创性。
- 24次使用
-
- AIGC检测-Aibiye
- AIbiye官网推出的AIGC检测服务,专注于检测ChatGPT、Gemini、Claude等AIGC工具生成的文本,帮助用户确保论文的原创性和学术规范。支持txt和doc(x)格式,检测范围为论文正文,提供高准确性和便捷的用户体验。
- 30次使用
-
- 易笔AI论文
- 易笔AI论文平台提供自动写作、格式校对、查重检测等功能,支持多种学术领域的论文生成。价格优惠,界面友好,操作简便,适用于学术研究者、学生及论文辅导机构。
- 40次使用
-
- 笔启AI论文写作平台
- 笔启AI论文写作平台提供多类型论文生成服务,支持多语言写作,满足学术研究者、学生和职场人士的需求。平台采用AI 4.0版本,确保论文质量和原创性,并提供查重保障和隐私保护。
- 35次使用
-
- GPT-4王者加冕!读图做题性能炸天,凭自己就能考上斯坦福
- 2023-04-25 501浏览
-
- 单块V100训练模型提速72倍!尤洋团队新成果获AAAI 2023杰出论文奖
- 2023-04-24 501浏览
-
- ChatGPT 真的会接管世界吗?
- 2023-04-13 501浏览
-
- VR的终极形态是「假眼」?Neuralink前联合创始人掏出新产品:科学之眼!
- 2023-04-30 501浏览
-
- 实现实时制造可视性优势有哪些?
- 2023-04-15 501浏览