谷歌发布“Vlogger”模型：单张图片生成10秒视频

2024-03-20 阅读 45 收藏 0 评论 0 限时评论得现金

零小柒

粉丝 0 文章 6432 收藏 0

用声音控制肖像生成视频

这个框架名叫VLOGGER。

它主要基于扩散模型，并包含两部分：

一个是随机的人体到3D运动（human-to-3d-motion）扩散模型。

另一个是用于增强文本到图像模型的新扩散架构。

谷歌发布“Vlogger”模型：单张图片生成10秒视频

其中，前者负责将音频波形作为输入，生成人物的身体控制动作，包括眼神、表情和手势、身体整体姿势等等。

后者则是一个时间维度的图像到图像模型，用于扩展大型图像扩散模型，使用刚刚预测的动作来生成相应的帧。

为了使结果符合特定的人物形象，VLOGGER还将参数图像的pose图作为输入。

VLOGGER的训练是在一个超大的数据集（名叫MENTOR）上完成的。

有多大？全长2200小时，共包含80万个人物视频。

其中，测试集的视频时长也有120小时长，共计4000个人物。

谷歌介绍，VLOGGER最突出的表现是具备多样性：

如下图所示，最后的像素图颜色越深（红）的部分，代表动作越丰富。

谷歌发布“Vlogger”模型：单张图片生成10秒视频

而和业内此前的同类方法相比，VLOGGER最大的优势则体现在不需要对每个人进行训练、也不依赖于面部检测和裁剪，并且生成的视频很完整（既包括面部和唇部，也包括肢体动作）等等。

谷歌发布“Vlogger”模型：单张图片生成10秒视频

具体来看，如下表所示：

Face Reenactment方法无法用音频和文本来控制此类视频生成。

Audio-to-motion倒是可以音频生成，方式也是将音频编码为3D人脸动作，不过它生成的效果不够逼真。

Lip sync可以处理不同主题的视频，但只能模拟嘴部动作。

对比起来，后面的两种方法SadTaker和Styletalk表现最接近谷歌VLOGGER，但也败在了不能进行身体控制上，并且也不能进一步编辑视频。

谷歌发布“Vlogger”模型：单张图片生成10秒视频

说到视频编辑，如下图所示，VLOGGER模型的应用之一就是这个，它可以一键让人物闭嘴、闭眼、只闭左眼或者全程睁眼：

谷歌发布“Vlogger”模型：单张图片生成10秒视频

另一个应用则是视频翻译：

例如将原视频的英语讲话改成口型一致的西班牙语。

谷歌发布“Vlogger”模型：单张图片生成10秒视频

网友吐槽

最后，“老规矩”，谷歌没有发布模型，现在能看的只有更多效果还有论文。

嗯，吐槽也是不少的：

画质模型、口型抽风对不上、看起来还是很机器人等等。

谷歌发布“Vlogger”模型：单张图片生成10秒视频

因此，有人毫不犹豫打上差评：

这就是谷歌的水准吗？

谷歌发布“Vlogger”模型：单张图片生成10秒视频

有点对不起“VLOGGER”这个名字了。

谷歌发布“Vlogger”模型：单张图片生成10秒视频

——和OpenAI的Sora对比，网友的说法确实也不是没有道理。。

大家觉得呢？

本文来源于公众号凹非寺，编辑丰色

AI足球教练上岗利物浦，射门机会提高13%！来自DeepMind，网友：这不公平

关联网址

关联标签

#AI

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿

后，在评论区留言并审核通过后，即可获得现金奖励，奖励规则可见：查看奖励规则

暂无评论...

10 款教育 AI 工具用例

3740 用户在看

AI写作网站自动的生成文章可以用吗？

308 用户在看

AI批改英语作文，质量和数量都完爆人类老师改卷

279 用户在看

科大讯飞AI会议记录，让你丢掉纸笔，开会再也不焦虑

255 用户在看

谷歌发布“Vlogger”模型：单张图片生成10秒视频

用声音控制肖像生成视频

网友吐槽

本文来源于公众号凹非寺，编辑丰色

AI足球教练上岗利物浦，射门机会提高13%！来自DeepMind，网友：这不公平

OpenAI大总管Brad Lightcap详谈如何拉客户，toC与toB的纠结，以及OpenAI的边界｜现场实录

关联网址

关联标签

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿

搜索

近期热门

10 款教育 AI 工具用例

3740 用户在看

AI写作网站自动的生成文章可以用吗？

308 用户在看

AI批改英语作文，质量和数量都完爆人类老师改卷

279 用户在看

科大讯飞AI会议记录，让你丢掉纸笔，开会再也不焦虑

255 用户在看

谷歌发布“Vlogger”模型：单张图片生成10秒视频

用声音控制肖像生成视频

网友吐槽

本文来源于公众号凹非寺，编辑丰色

AI足球教练上岗利物浦，射门机会提高13%！来自DeepMind，网友：这不公平

OpenAI大总管Brad Lightcap详谈如何拉客户，toC与toB的纠结，以及OpenAI的边界｜现场实录

关联网址

关联标签

文章目录

发评论，每天都得现金奖励！超多礼品等你来拿