一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

2024-01-25 阅读 35 收藏 0 评论 0 限时评论得现金

零小柒

粉丝 0 文章 6432 收藏 0

△“阳光明媚，帆船在湖中航行”

如此一致性和质量，再次点燃了网友们对AI视频生成的热情：谷歌加入战局，又有好戏可看了。

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

不止是文生视频，Lumiere把Pika的“一键换装”也复现了出来。

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

左谷歌右pika，同样是选中区域一句话完成视频编辑，你pick哪一边？

让图片中静止的火焰跃动起来，也同样一选就能完成：

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

还有图片转视频：

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

视频风格化：

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

总之就是主打一个质量又高又全能。

更多细节，我们论文扒起~

用于视频生成的时空扩散模型

Lumiere旨在解决以往视频生成中存在的几个关键问题：

真实性
多样化
运动的连贯性

在此前的方法中，常见的做法是，扩散模型先生成一些稀疏的关键帧，而后通过一系列时间超分辨率（TSR）模型来填补关键帧之间的空白，接着再用空间超分辨率模型获取高清视频结果。

可以想见，在全局连贯性上，这样的做法存在先天的缺陷。

Lumiere的创新点在于，提出了时空U-Net（STU-Net）架构：将视频在空间和时间两个维度同时进行下采样和上采样，在网络的中间层得到视频的压缩时空表示。

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

具体来说，基于这一架构，模型能够一次性生成视频中的所有帧——这也就提升了生成视频的连贯性。

同时，因为大部分计算发生在压缩后的表示上，STU-Net能有效减少计算量，降低对计算和内存的需求。

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

另外，为了提升视频的分辨率，研究人员使用多重扩散（MultiDiffusion）技术，通过线性加权空间超分辨率网络来处理重叠时间窗口带来的边界伪影等问题，从而能将生成画面融合为一个整体，得到连贯、高清的视频效果。

时长和分辨率方面，Lumiere能输出1024×1024、16fps下长5秒的视频。

研究人员提到：

5秒已经超过了大多数视频作品中的平均镜头长度。

值得一提的是，得益于时空U-Net架构端到端全帧率视频生成的能力和高效计算，Lumiere灵活可扩展，可以轻松应用到下游任务中，包括文生视频、图生视频、视频风格化、视频编辑修复等等。

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

△视频修复

实验结果

研究人员将Lumiere与其他文本-视频生成模型进行了实验对比。

首先来看人类用户的判断。

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

实验设计是这样的：志愿者会同时看到一对视频，一个来自Lumiere，另一个来自其他基线模型。志愿者被要求从中选出视觉质量、动态效果更好，更符合文本提示的视频。

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

研究人员收集了大约400份反馈，结果显示，在视频质量、文本匹配度方面，Lumiere超越了Pika、Gen2、Imagen Video、SVD等一众顶级视频生成模型。

同时，在UCF101数据集（动作识别数据集）上，与MagicVideo、Make-A-Video、SVD等模型相比，Lumiere取得了具有竞争力的FVD和IS指标。

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

网友：谷歌，模型呢？

效果很惊艳，网友很兴奋，但桥豆麻袋……

这次，谷歌依然只放出了论文，没有试玩，更没有开源。

这种似曾相识的操作，把人快整麻了：

视频很不错，但是谷歌，你又不打算发布任何代码、权重，也不提供API了，对吗？

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

还有人想起了Gemini发布时那个造假的小蓝鸭视频……

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

那么，这波你还会看好谷歌吗？

论文地址：

https://arxiv.org/abs/2401.12945

项目地址：

https://lumiere-video.github.io/#section_video_stylization

文章来自于微信公众号“量子位”（ID: QbitAI)，作者 “鱼羊”

汤晓鸥弟子带队：免调优长视频生成，可支持512帧！任何扩散模型都能用｜ICLR’24

关联网址

关联标签

#AI

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿

后，在评论区留言并审核通过后，即可获得现金奖励，奖励规则可见：查看奖励规则

暂无评论...

10 款教育 AI 工具用例

3662 用户在看

AI写作网站自动的生成文章可以用吗？

261 用户在看

2023年你必须知道的顶级国产AI工具有哪些？全面解析！

184 用户在看

清华孵出一家Chiplet黑马！连拿亿级融资，首款AI芯片已跑通，ZAKER对话创始人

155 用户在看

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

△“阳光明媚，帆船在湖中航行”

用于视频生成的时空扩散模型

△视频修复

实验结果

网友：谷歌，模型呢？

文章来自于微信公众号“量子位”（ID: QbitAI)，作者 “鱼羊”

汤晓鸥弟子带队：免调优长视频生成，可支持512帧！任何扩散模型都能用｜ICLR’24

AI到底给手机增加了哪些新东西？

关联网址

关联标签

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿

搜索

近期热门

10 款教育 AI 工具用例

3662 用户在看

AI写作网站自动的生成文章可以用吗？

261 用户在看

2023年你必须知道的顶级国产AI工具有哪些？全面解析！

184 用户在看

清华孵出一家Chiplet黑马！连拿亿级融资，首款AI芯片已跑通，ZAKER对话创始人

155 用户在看

一句话让小姐姐为我换了N套衣服，谷歌卷出视频生成新高度，网友：竞赛加码

△“阳光明媚，帆船在湖中航行”

用于视频生成的时空扩散模型

△视频修复

实验结果

网友：谷歌，模型呢？

文章来自于微信公众号“量子位”（ID: QbitAI)，作者 “鱼羊”

汤晓鸥弟子带队：免调优长视频生成，可支持512帧！任何扩散模型都能用｜ICLR’24

AI到底给手机增加了哪些新东西？

关联网址

关联标签

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿