微软亚洲研究院推出NUWA-XL超长视频生成模型

2023-04-20 10:53 · 稿源：站长之家

站长之家（ChinaZ.com）4月20日消息:你相信吗?只要输入16句简单描述，AI就能生成11分钟的动画了。

近日，微软亚洲研究院推出了NUWA-XL超长视频生成模型，采用创新的Diffusion over Diffusion架构，通过「从粗到细」的生成过程，可以并行生成高质量的超长视频，为多模态大模型提供了新的解题思路。

论文地址:https://arxiv.org/abs/2303.12346

NUWA-XL「从粗到细」的生成方法具有三个优势:

分层结构使模型能够直接在长视频上进行训练，从而消除了训练和推理之间的差距。
模型包含多个局部扩散模型，自然支持并行推理，可以显著提高生成长视频时的推理速度。例如在相同的硬件设置下，当生成1024帧时，NUWA-XL 使平均推理时间从7.55分钟减少到26秒，速度提升了94.26%。
由于视频的长度可以相对于深度 m 呈指数级扩展，因此模型可以很容易地扩展出更长的视频。

目前，长视频生成的多数方法是采用「Autoregressive over X」架构，这种方法存在训练-推理差距的问题，导致不真实的、扭曲的镜头变化。

NUWA-XL的推出填补了长视频生成领域的空白，为人工智能在视频生成方面的应用提供了新的可能性。

微软亚洲研究院首席研究员段楠表示，目前人工智能多模态大模型的研发仍停留在文字生成阶段。即使GPT-4已经在理解方面加入了视觉信息，但仅限于图片，输出依旧是文字或代码。因此，当前和未来的研究方向非常明确，就是将语言和视觉的理解和生成融入到一个基础大模型中，以增强图像、视频和音频的生成。他希望未来可以使用一套结构来融合支持语言和视觉的生成算法，使人工智能模型更加通用。

（举报）

相关推荐
大家在看

关键词：

【腾讯云】11.11云上盛惠！云服务器首年1.8折起，买1年送3个月！

11.11云上盛惠！海量产品 · 轻松上云！云服务器首年1.8折起，买1年送3个月！超值优惠，性能稳定，让您的云端之旅更加畅享。快来腾讯云选购吧！

Docker容器镜像
去看看

Docker容器镜像 60元/15天

爆款产品组合购
去看看

爆款产品组合购低至1元

腾讯云x NVIDIA加速计划
去看看

腾讯云x NVIDIA加速计划最高获赠10万元扶持基金

2核2G云服务器
去看看

2核2G云服务器 112元/1年

查看更多相关信息>>

腾讯云 12-20

广告
Pika Labs AI视频生成器现在可以嵌入文字和图像了

PikaLabs在Discord上部署的AI视频生成器增加了两项新功能。第一项名为“视频字母化”，可以将不同样式的字母和文字嵌入到短视频中。PikaLabs正不断丰富其AI视频生成器的功能，为用户提供更多定制化选择。

Pika AI头条
荐AI视频生成框架AnimateDiff 高速运动视频依然保持稳定

AnimateDiff是一款强大的工具，它允许您轻松地将文本转化为动画图像无需特定的调整。它为用户提供了无限的创意和探索空间，让您可以将文本描述转化为令人惊叹的动画场景。只需运行几个命令，就可以在本地主机上启动演示，通过用户友好的界面进行互动。

AnimateDiff
怪兽智能AI数字人软件：数字人制作、数字人短视频生成、数字人直播解决方案

怪兽智能AI数字人软件是一款领先的虚拟数字人创作工具，以其独特的功能和卓越的性能闻名于业界。从数字人制作到数字人短视频生成，再到数字人直播，这款软件系统提供了一站式解决方案，满足了广大用户在数字人创作和展示方面的需求。作为一家专注于数字人技术的公司，怪兽智能AI数字人软件不仅提供了先进的数字人制作工具，还能将真人形象克隆、声音克隆、实时�
卡萨帝入驻奥地利古典音乐研究院

近年来随着全球化战略的不断推进，卡萨帝正加速布局海外市场。2023年1月，卡萨帝于巴基斯坦召开品牌发布会，3月携光年、鉴赏家套系亮相新加坡中国机电产品品牌展览会，9月在曼谷吉姆汤普森艺术中心开展首届思享荟，并于同月登陆德国IFA展会。未来卡萨帝将继续创新，加速布局全球高端圈层，努力为更多用户带去更高端、更全面的智慧生活体验。
智源研究院开源中英双语大模型悟道·天鹰340亿Aquila2-34B

智源研究院发布了最强开源中英双语大模型——悟道・天鹰340亿。这个新模型在推理、泛化等方面表现出色，在智能体、代码生成、文献检索等场景方面取得了一系列成绩。智源研究院还发布了FlagScale高效并行训练框架和FlagAttention高性能Attention算子集，进一步推动大模型研究的发展。
易车研究院：解决“停车难”痛点，挖掘中国车市消费潜力

随着人们生活水平的不断提高，有车家庭正在不断增加，汽车作为单一价值量较大的可选消费，其承载的消费功能较为复杂，包括日常工作通勤需要，以及非工作的生活通勤需要等，随着家庭成员扮演的角色越来越多，单一车辆已经不能满足家庭所有成员的出行需求，多车家庭开始涌现。在这样的发展情形下，停车问题也开始涌现。随着国家新能源汽车战略的不断推进，车市�
智源研究院开源 AI 硬件评测引擎FlagPerf v1.0

智源研究院发布了FlagPerfv1.0，这是一个开源开放的AI硬件评测引擎。FlagPerf的评测指标体系包括功能正确性指标、性能指标、资源使用指标和生态适配指标。所有测试代码都已开源，测试过程和数据可复现。
英特尔研究院院长Rich Uhlig：坚持“3S”探索逻辑，全面出击前沿研究

英国著名科幻小说家阿瑟·克拉克有言：“任何先进的技术，初看都与魔法无异。”在英特尔这家巨大的半导体公司的内部，有一批人正在专注于此，即用新颖的方法，在广泛的前沿研究领域中探索如何帮助人类应对在计算、连接、从云到边缘的基础设施、AI、传感和感知等领域面临的重大技术挑战。英特尔研究院将始终致力于在各种前沿领域“全面出击”，从技术探索，到应用落地，不断探索多样化的可能性，为未来计算“插上翅膀”。
LayoutNUWA：一个基于大型语言模型的布局生成工具

在网上创建引人注目的设计对于吸引用户的兴趣和帮助他们理解信息非常重要。这种新方法，被称为LayoutNUWA，通过使用语言模型将编码指令转化为出色的布局，使这些设计更加智能。通过这些核心功能，LayoutNUWA为用户提供了一个强大的布局生成工具，可以应用于各种项目和领域，从提高布局生成的效率和质量。

LayoutNUWA
Wayve推出GAIA-1 9B，通过生成合成视频训练自动驾驶

英国初创公司Wayve在2023年6月发布了GAIA-1，这是一款为自动驾驶车辆培训数据设计的生成式模型。GAIA-1的最新版本，GAIA-19B，已经取得了令人瞩目的进展。这种基于文本的逻辑可以增加车辆的安全感，使人工智能的决策不再像一个“黑盒子”。

Wayve GAIA-19B 自动驾驶

今日大家都在搜的词：

热文

3 天
7天

微软亚洲研究院推出NUWA-XL超长视频生成模型

今日大家都在搜的词：

热文

站长商机