当前位置:首页 > 文章列表 > 科技周边 > 人工智能 > Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

2025-01-12 19:06:44 0浏览 收藏

哈喽!大家好,很高兴又见面了,我是golang学习网的一名作者,今天由我给大家带来一篇《Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率》,本文主要会讲到等等知识点,希望大家一起学习进步,也欢迎大家关注、点赞、收藏、转发! 下面就一起来看看吧!

最近,AI 科技评论发现,国产视频生成模型 Open-Sora 在开源社区悄悄更新了!

现在单镜头支持长达16秒的视频生成,分辨率最高可达720p,并且可以处理任何宽高比的文本到图像、文本到视频、图像到视频、视频到视频和无限长视频的生成需求。我们来试试效果。

生成个横屏圣诞雪景,发b站:

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

再生成个竖屏,发抖音:

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

还能生成单镜头16秒的长视频,这下人人都能过把编剧瘾了:

视频详见:https://mp.weixin.qq.com/s/Z88inagkuFn8svLu788TVQ

怎么玩?指路GitHub:https://github.com/hpcaitech/Open-Sora

更酷的是,Open-Sora 依旧全部开源,包含最新的模型架构、最新的模型权重、多时间/分辨率/长宽比/帧率的训练流程、数据收集和预处理的完整流程、所有的训练细节、demo示例 和 详尽的上手教程。


1、Open-Sora技术报告全面解读

最新功能概览

•支持长视频生成;

•视频生成分辨率最高可达720p;

•单模型支持任何宽高比,不同分辨率和时长的文本到图像、文本到视频、图像到视频、视频到视频和无限长视频的生成需求;

•提出了更稳定的模型架构设计,支持多时间/分辨率/长宽比/帧率训练;

•开源了最新的自动数据处理全流程。

时空扩散模型ST-DiT-2

多阶段训练

根据Open-Sora技术报告指出,Open-Sora采用了一种多阶段训练方法,每个阶段都会基于前一个阶段的权重继续训练。相较于单一阶段训练,这种多阶段训练通过分步骤引入数据,更高效地实现了高质量视频生成的目标。

初始阶段大部分视频采用144p分辨率,同时与图片和 240p,480p 的视频进行混训,训练持续约1周,总步长81k。第二阶段将大部分视频数据分辨率提升至240p和480p,训练时长为1天,步长达到22k。第三阶段进一步增强至480p和720p,训练时长为1天,完成了4k步长的训练。整个多阶段训练流程在约9天内完成,与Open-Sora1.0相比,在多个维度提升了视频生成的质量。

统一的图生视频/视频生视频框架

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

支持图像和视频条件化处理的掩码策略

此外,作者团队还贴心地为推理阶段提供了掩码策略配置的详细指南,五个数字的元组形式在定义掩码策略时提供了极大的灵活性和控制力。

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

掩码策略配置说明

支持多时间/分辨率/长宽比/帧率训练

OpenAI Sora的技术报告[3]指出,使用原始视频的分辨率、长宽比和长度进行训练可以增加采样灵活性,改善帧和构图。对此,作者团队提出了分桶的策略。

具体怎么实现呢?通过深入阅读作者发布的技术报告,我们了解到,所谓的桶,是(分辨率,帧数,长宽比)的三元组。团队为不同分辨率的视频预定义了一系列宽高比,以覆盖大多数常见的视频宽高比类型。在每个训练周期epoch开始之前,他们会对数据集进行重新洗牌,并将样本根据其特征分配到相应的桶中。具体来说,他们会将每个样本放入一个分辨率和帧长度均小于或等于该视频特性的桶中。

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

Open-Sora 分桶策略


数据收集和预处理流程

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

Open-Sora 数据处理流程


2、Open-Sora 性能全方位评测

视频生成效果展示

Open-Sora最令人瞩目的亮点在于,它能够将你脑中的景象,通过文字描述的方式,捕捉并转化为动人的动态视频。那些在思维中一闪而过的画面和想象,现在得以被永久地记录下来,并与他人分享。在这里,笔者尝试了几种不同的prompt,作为抛砖引玉。

比如,笔者尝试生成了一个在冬季森林里游览的视频。雪刚下不久,松树上挂满了皑皑白雪,暗色的松针和洁白的雪花错落有致,层次分明。


又或者,在一个静谧夜晚中,你身处像无数童话里描绘过黑暗的森林,幽深的湖水在漫天璀璨的星河的照耀下波光粼粼。

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

在空中俯瞰繁华岛屿的夜景则更是美丽,温暖的黄色灯光和丝带一样的蓝色海水让人一下子就被拉入度假的悠闲时光里。

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

城市里的车水马龙,深夜依然亮着灯的高楼大厦和街边小店,又有另一番风味。

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

除了风景之外,Open-Sora还能还原各种自然生物。无论是红艳艳的小花:

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

还是慢悠悠扭头的变色龙, Open-Sora都能生成较为真实的视频。

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

笔者还尝试了多种prompt测试,还提供了许多生成的视频供大家参考,包括不同内容,不同分辨率,不同长宽比,不同时长。

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

笔者还发现,仅需一个简洁的指令,Open-Sora便能生成多分辨率的视频短片,彻底打破创作限制。

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

分辨率:16*240p

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

分辨率:32*240p

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

分辨率:64*360p

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

分辨率:480*854p

我们还可以喂给Open-Sora一张静态图片让它生成短片

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

Open-Sora 还可以将两个静态图巧妙地连接起来,轻触下方视频,将带您体验从下午至黄昏的光影变幻,每一帧都是时间的诗篇。

视频详见:https://mp.weixin.qq.com/s/Z88inagkuFn8svLu788TVQ

再比如说我们要对原有视频进行编辑,仅需一个简单的指令,原本明媚的森林便迎来了一场鹅毛大雪。

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

我们也能让Open-Sora 生成高清的图片

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

值得注意的是,Open-Sora的模型权重已经完全免费公开在他们的开源社区上,不妨下载下来试一下。由于他们还支持视频拼接功能,这意味着你完全有机会免费创作出一段带有故事性的小短片,将你的创意带入现实。

权重下载地址:https://github.com/hpcaitech/Open-Sora

当前局限与未来计划

尽管在复现类Sora文生视频模型的工作方面取得了不错的进展,但作者团队也谦逊地指出,当前生成的视频在多个方面仍有待改进:包括生成过程中的噪声问题、时间一致性的缺失、人物生成质量不佳以及美学评分较低。对于这些挑战,作者团队表示,他们将在下一版本的开发中优先解决,以期望达到更高的视频生成标准,感兴趣的朋友不妨持续关注一下。我们期待Open-Sora社区带给我们的下一次惊喜。

开源地址:https://github.com/hpcaitech/Open-Sora

参考文献:

[1] https://github.com/hpcaitech/Open-Sora/blob/main/docs/report_02.md

[2] Tay, Yi, et al. "Ul2: Unifying language learning paradigms." arXiv preprint arXiv:2205.05131(2022).

[3] https://openai.com/research/video-generation-models-as-world-simulators


Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率

到这里,我们也就讲完了《Open-Sora 全面开源升级:支持单镜头 16s 视频生成和 720p 分辨率》的内容了。个人认为,基础知识的学习和巩固,是为了更好的将其运用到项目中,欢迎关注golang学习网公众号,带你了解更多关于的知识点!

美团将建立算法公开机制,2025 年底前逐步取消骑手超时扣款美团将建立算法公开机制,2025 年底前逐步取消骑手超时扣款
上一篇
美团将建立算法公开机制,2025 年底前逐步取消骑手超时扣款
笔记本电脑怎么重装系统Win10-重装笔记本系统的方法
下一篇
笔记本电脑怎么重装系统Win10-重装笔记本系统的方法
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    542次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    508次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    497次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    484次学习
查看更多
AI推荐
  • SEO标题协启动:AI驱动的智能对话与内容生成平台 - 提升创作效率
    协启动
    SEO摘要协启动(XieQiDong Chatbot)是由深圳协启动传媒有限公司运营的AI智能服务平台,提供多模型支持的对话服务、文档处理和图像生成工具,旨在提升用户内容创作与信息处理效率。平台支持订阅制付费,适合个人及企业用户,满足日常聊天、文案生成、学习辅助等需求。
    2次使用
  • Brev AI:零注册门槛的全功能免费AI音乐创作平台
    Brev AI
    探索Brev AI,一个无需注册即可免费使用的AI音乐创作平台,提供多功能工具如音乐生成、去人声、歌词创作等,适用于内容创作、商业配乐和个人创作,满足您的音乐需求。
    2次使用
  • AI音乐实验室:一站式AI音乐创作平台,助力音乐创作
    AI音乐实验室
    AI音乐实验室(https://www.aimusiclab.cn/)是一款专注于AI音乐创作的平台,提供从作曲到分轨的全流程工具,降低音乐创作门槛。免费与付费结合,适用于音乐爱好者、独立音乐人及内容创作者,助力提升创作效率。
    2次使用
  • SEO标题PixPro:AI驱动网页端图像处理平台,提升效率的终极解决方案
    PixPro
    SEO摘要PixPro是一款专注于网页端AI图像处理的平台,提供高效、多功能的图像处理解决方案。通过AI擦除、扩图、抠图、裁切和压缩等功能,PixPro帮助开发者和企业实现“上传即处理”的智能化升级,适用于电商、社交媒体等高频图像处理场景。了解更多PixPro的核心功能和应用案例,提升您的图像处理效率。
    2次使用
  • EasyMusic.ai:零门槛AI音乐生成平台,专业级输出助力全场景创作
    EasyMusic
    EasyMusic.ai是一款面向全场景音乐创作需求的AI音乐生成平台,提供“零门槛创作 专业级输出”的服务。无论你是内容创作者、音乐人、游戏开发者还是教育工作者,都能通过EasyMusic.ai快速生成高品质音乐,满足短视频、游戏、广告、教育等多元需求。平台支持一键生成与深度定制,积累了超10万创作者,生成超100万首音乐作品,用户满意度达99%。
    3次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码