AI视频又炸了!照片+声音变视频,阿里让Sora女主唱歌小李子说RAP
从现在开始,我们要努力学习啦!今天我给大家带来《AI视频又炸了!照片+声音变视频,阿里让Sora女主唱歌小李子说RAP》,感兴趣的朋友请继续看下去吧!下文中的内容我们主要会涉及到等等知识点,如果在阅读本文过程中有遇到不清楚的地方,欢迎留言呀!我们一起讨论,一起学习!
Sora之后,居然还有新的AI视频模型,能惊艳得大家狂转狂赞!
图片
有了它,《狂飙》大反派高启强化身罗翔,都能给大伙儿普法啦(狗头)。

这就是阿里最新推出的基于音频驱动的肖像视频生成框架,EMO(Emote Portrait Alive)。
有了它,输入单张参考图像,以及一段音频(说话、唱歌、RAP均可),就能生成表情生动的AI视频。视频最终长度,取决于输入音频的长度。
你可以让蒙娜丽莎——这位AI届效果体验的老选手,朗诵一段独白:

年轻俊美的小李子来段快节奏的RAP才艺秀,嘴形跟上完全没问题:

甚至粤语口型也能hold住,这就让哥哥张国荣来首陈奕迅的《无条件》:

总之,不管是让肖像唱歌(不同风格的肖像和歌曲)、让肖像开口说话(不同语种)、还是各种“张冠李戴”的跨演员表演,EMO的效果,都让咱看得一愣一愣的。
网友大感叹:“我们正在走进一个新的现实!”
2019版《小丑》说2008版《蝙蝠侠黑暗骑士》的台词
甚至已经有网友开始对EMO生成视频开始了拉片,逐帧分析效果究竟怎么样。
如下面这段视频,主角是Sora生成的AI女士,本次为大家演唱的曲目是《Don’t Start Now》。
推友分析道:
这段视频的一致性,比以往更上一层楼了!
一分多钟的视频里,Sora女士脸上的墨镜几乎没有乱动,耳朵、眉毛都有独立的运动。
最精彩的是Sora女士的喉咙好像真的有呼吸哎!她唱歌的过程中身体还有微颤和移动,我直接大震惊!
图片
话说回来,EMO是热门新技术嘛,免不了拿来与同类对比——
就在昨天,AI视频生成公司Pika也推出了为视频人物配音,同时“对口型”的唇形同步功能,撞车了。
具体效果怎么样呢,我们直接摆在这儿
评论区网友对比过后得出的结论是,被阿里吊打了。
图片
EMO公布论文,同时宣布开源。
但是!虽说开源,GitHub上仍然是空仓。
再但是!虽然是空仓,标星数已经超过了2.1k。
图片
惹得网友们真的是好着急,有吉吉国王那么急。

与Sora不同架构
EMO论文一出,圈内不少人松了口气。
它与Sora技术路线不同,说明复刻Sora不是唯一的路。
EMO并不是建立在类似DiT架构的基础上,也就是没有用Transformer去替代传统UNet,其骨干网络魔改自Stable Diffusion 1.5。
具体来说,EMO是一种富有表现力的音频驱动的肖像视频生成框架,可以根据输入视频的长度生成任何持续时间的视频。
图片
该框架主要由两个阶段构成:
- 帧编码阶段
部署一个称为ReferenceNet的UNet网络,负责从参考图像和视频的帧中提取特征。
- 扩散阶段
首先,预训练的音频编码器处理音频嵌入,人脸区域掩模与多帧噪声相结合来控制人脸图像的生成。
随后是骨干网络主导去噪操作。在骨干网络中应用了两种注意力,参考注意力和音频注意力,分别作用于保持角色的身份一致性和调节角色的运动。
此外,时间模块被用来操纵的时间维度,并调整运动的速度。
在训练数据方面,团队构建了一个包含超过250小时视频和超过1500万张图像的庞大且多样化的音视频数据集。
最终实现的具体特性如下:
- 可以根据输入音频生成任意持续时间的视频,同时保证角色身份一致性(演示中给出的最长单个视频为1分49秒)。
- 支持各种语言的交谈与唱歌(演示中包括普通话、广东话、英语、日语、韩语)
- 支持不同画风(照片、传统绘画、漫画、3D渲染、AI数字人)
图片
在定量比较上也比之前的方法有较大提升取得SOTA,只在衡量口型同步质量的SyncNet指标上稍逊一筹。
图片
与其他不依赖扩散模型的方法相比,EMO更耗时。
并且由于没有使用任何显式的控制信号,可能导致无意中生成手等其他身体部位,一个潜在解决方案是采用专门用于身体部位的控制信号。
EMO的团队
最后,来看看EMO背后的团队有那些人。
论文显示,EMO团队来自阿里巴巴智能计算研究院。
作者共四位,分别是Linrui Tian,Qi Wang,Bang Zhang和Liefeng Bo。
图片
其中,薄列峰(Liefeng Bo),是目前的阿里巴巴通义实验室XR实验室负责人。
薄列锋博士毕业于西安电子科技大学,先后在芝加哥大学丰田研究院和华盛顿大学从事博士后研究,研究方向主要是ML、CV和机器人。其谷歌学术被引数超过13000。
在加入阿里前,他先是在亚马逊西雅图总部任首席科学家,后又加入京东数字科技集团AI实验室任首席科学家。
2022年9月,薄列峰加入阿里。
图片
EMO已经不是第一次阿里在AIGC领域出圈的成果了。
图片
有AI一键换装的OutfitAnyone。
图片
还有让全世界小猫小狗都在跳洗澡舞的AnimateAnyone。
就是下面这个:
图片
如今推出EMO,不少网友在感叹,阿里是有些技术积累在身上的。
图片
如果现在把所有这些技术结合起来,那效果……
不敢想,但好期待。
图片
总之,我们离“发给AI一个剧本,输出整部电影”越来越近了。
图片
One More Thing
Sora,代表文本驱动的视频合成的断崖式突破。
EMO,也代表音频驱动的视频合成一个新高度。
两者尽管任务不同、具体架构不同,但还有一个重要的共性:
中间都没有加入显式的物理模型,却都在一定程度上模拟了物理规律。
因此有人认为,这与Lecun坚持的“通过生成像素来为动作建模世界是浪费且注定要失败的”观点相悖,更支持了Jim Fan的“数据驱动的世界模型”思想。
图片
过去种种方法失败了,而现在的成功,可能真就来自还是强化学习之父Sutton的《苦涩的教训》,大力出奇迹。
让AI能够像人们一样去发现,而不是包含人们发现的内容
突破性的进展最终通过扩大计算规模来实现
论文:https://arxiv.org/pdf/2402.17485.pdfGitHub:https://github.com/HumanAIGC/EMO
以上就是《AI视频又炸了!照片+声音变视频,阿里让Sora女主唱歌小李子说RAP》的详细内容,更多关于AI,照片,声音的资料请关注golang学习网公众号!
Golang模块问题--package xxx/xxxx不在GOROOT中
- 上一篇
- Golang模块问题--package xxx/xxxx不在GOROOT中
- 下一篇
- PHP获取和/或设置当前会话保存路径
-
- 科技周边 · 人工智能 | 16小时前 |
- 模型路由怎么做:按任务难度分配速度、成本与质量
- 147浏览 收藏
-
- 科技周边 · 人工智能 | 18小时前 |
- 多模态模型读图前,图片缩放与裁切会影响什么
- 247浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 | 人工智能 · 推理优化 ONNX Runtime 动态量化 nodes_to_exclude
- ONNX Runtime 动态量化怎么选择需要排除的节点
- 377浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 | 人工智能 · 向量检索 · Sentence Transformers truncate_dim 嵌入维度 Matryoshka 向量存储
- Sentence Transformers 怎么截断嵌入维度减少存储
- 165浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- PEFT 多个 adapter 怎么按权重组合推理
- 454浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- Accelerate 大模型推理怎么自动分配到多块设备
- 358浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 | 人工智能 · Tokenizers offset_mapping 原始文本
- Tokenizers offset mapping 怎么映射回原始文本位置
- 328浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 | python · 人工智能 · shuffle Hugging Face Datasets streaming IterableDataset buffer_size
- Datasets streaming 怎么在不下载全集时打乱样本
- 470浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 374次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 444次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 451次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 397次使用
-
- MMBench
- MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
- 223次使用
-
- 本地大模型反复输出同一句话怎么调整生成参数
- 2026-09-06 501浏览
-
- Python 调用大模型时如何用结构化输出校验 JSON:从解析失败到可重试
- 2026-08-29 501浏览
-
- AI写作工具免费版安装教程(含豆包Clawdbot)
- 2026-05-30 501浏览
-
- WPS AI能自动生成PPT吗?输入主题一键制作演示文稿
- 2026-05-27 501浏览
-
- Canva手机闪退解决方法及适配指南
- 2026-05-25 501浏览

