首页 > 业界 > 关键词  > Veo最新资讯  > 正文

​谷歌推全新AI视频生成模型Veo,可创建高质量60秒、1080p视频

2024-05-15 10:31 · 稿源:站长之家

划重点:

- 谷歌发布了名为 Veo 的生成式 AI 视频模型,可以创建高质量、逼真的1080p 视频片段。

- Veo 支持文本到视频、视频到视频以及图像到视频的转换,能够应用于多种电影风格。

- 谷歌与艺术家 Donald Glover 合作测试 Veo 的新功能,展示出令人惊叹的视频生成能力。

站长之家(ChinaZ.com)5月15日 消息:谷歌在其深度学习 AI 部门 DeepMind 的研究人员发布了一款名为 Veo 的全新式 AI 视频模型,能够创建“超过60秒的高质量、1080p 剪辑”,“从照片写实主义到超现实主义和动画,它可以应对一系列电影风格”,在逼真度和视觉果方面达到了令人惊叹的水平。

image.png

image.png

Veo 的目标是帮助各类用户创作视频,不论是经验富的电影制片人、有抱负的创作者,还是渴望分享知识的教育工作者,都可以通过 Veo 实现的故事叙述方式。

Veo 支持文本到视频、视频到视频以及图像到视频的转换,能够适各电影风格,从写实主义到超现实主义和动画。

谷歌与艺术家 Donald Glover 合作,通过他的创工作室 Gilga 测试了 Veo 的一些新功能。DeepMind 在 YouTube 和 X 平台上发布了一些由 V 生成的视频和提示,包括霓虹城市、真实的海洋水母、牛仔骑马、太空飞船穿越虚空和真的人物场景等。这些视频几乎无法与真人拍摄或专业的计算机生成动画区分开,而且都是由文本提示生成的。

image.png

图片来自谷歌官方用Veo生成视频截图

Veo 不仅可以根据文本提示生成视频,还可以快速编辑 AI 生成的视频用户上传的片段,甚至是预先录制的真人镜头。当给定一个输入视频和编辑命令时,比如在海线的航拍画面中添加皮划艇,Veo 可以应用这个命令到初始视频,并创建一个新的编辑后的视频。此,Veo 还能够实现视频帧之间的一致性,避免一些奇怪和令人不安的转换瑕疵,这得益于其采用了先进的潜在扩散变压器技术,可以减少这些不一致之处使角色、物体和风格保持在现实生活中的位置。

为了提高生成视频的质量,谷歌在练数据的每个视频标题中添加了更多细节,并使用高质量、压缩表示视频(也称为潜在变量),从而高了效率。此外,所有的 Veo 视频都嵌入了 SynthID,即谷歌的内容凭证跟踪数字水印以确保可以被有识别能力的机构识别为由 AI 生成。

Veo 是 DeepMind 多年研究的结晶,建在之前的研究成果基础上,包括生成查询网络 (GQN)、DVD-GAN、Imagen-Video、Phenaki、ALT、VideoPoet 和 Lumiere 等。目前,谷歌并没有公开发布 Veo,只提供给少数特定的创作者私人预览中使用。未来,谷歌还计划将 Veo 的部分功能引入 YouTube Shorts 和其他产品中。

举报

  • 相关推荐
  • 大家在看
  • Voice Pen:语音转文字的智能助手

    Voice Pen是一款利用人工智能技术将语音转换为文字的应用程序,它支持超过50种语言,使用OpenAI的Whisper技术提供完美的转录和标点。用户可以使用Voice Pen记录语音,生成笔记、摘要、电子邮件、消息、博客帖子等。此外,它还具备AI重写功能,帮助用户清晰地组织文本、总结、制作列表、创建博客/帖子/推文、Instagram标题和电子邮件。Voice Pen注重用户隐私,不收集任何录音或文本数据。

  • Eternity AC:创建您的数字克隆,超越限制,实现自我不朽。

    eternity.ac是一个提供数字克隆服务的平台,允许用户创建具有自己思想、声音和外观的数字克隆体。这项技术突破了传统的交流和表达方式,使用户能够以全新的形式与世界互动。产品背景信息显示,eternity.ac致力于推动数字存在技术的革命,为用户提供一种全新的自我表达和社交方式。

  • Dropbase:快速构建自定义后台操作软件的开发者平台

    Dropbase是一个为开发者设计的平台,旨在快速且无痛地构建自定义的内部工具和后台操作软件。它通过自然语言声明应用、UI预览、拖放调整、输入行为生成代码、代码运行和追踪调试等功能,帮助开发者摆脱低代码/无代码开发的局限。Dropbase支持与现有的CRM、计费和支持工具集成,提供如管理面板、审批仪表板、数据编辑器、云控制台和通知系统等多样化的内部软件组件,并且完全使用Python编写,提供代码的灵活性和重用性。

  • Socap.ai:利用AI帮助创始人和投资者快速扩展网络和融资

    Socap.ai是一个利用人工智能技术帮助创始人和投资者扩展社交网络和加速融资流程的平台。它通过提供智能匹配、社交资本共享和协作功能,使创业者能够更有效地与潜在的投资者和合作伙伴建立联系。Socap.ai背后的理念是利用社交网络的力量,通过有针对性的介绍和社区支持,帮助创业者实现其商业目标。

  • TrustLoop:AI驱动的反馈与评论自动化平台

    TrustLoop是一款专注于商业领域的在线平台,利用人工智能技术帮助企业自动化收集用户反馈和评论。它通过在合适的时机引导用户留下5星好评,从而加速产品市场契合度,构建社会信任。平台易于设置,只需两行代码即可集成到网站,且完全可定制,不拖慢网站速度。TrustLoop还提供共享团队邮箱,确保团队成员能够及时获取反馈信息,快速响应客户。

  • AI Signature Generator:创建个性化和专业的电子签名。

    AI Signature Generator是一个强大的工具,允许用户轻松创建自己的电子签名。无论是数字文档签名、PDF和Word文档下载签名,还是电子邮件添加签名,这个工具都简化了整个过程。它完全免费,提供无限下载,快速渲染,并且具有用户友好的界面。

  • Butterflies AI:释放你的想象力,与AI角色创造、聊天、共处。

    Butterflies AI是一款允许用户与AI角色进行创造、聊天和社交的应用程序。它利用先进的人工智能技术,为用户提供一个富有想象力的互动平台,让用户能够与虚拟角色进行深入的交流和创造活动。

  • Puppeteer:数字医疗助手,提升患者体验。

    Puppeteer是一款数字医疗助手,通过生成式人工智能技术,提供类似人类的对话式患者入院表单,以增强患者体验并从数字入院表单中获取最大价值。产品具备实时检查患者答案、根据患者情况提供高质量问题、为医生决策提供总结化相关信息等功能。

  • Amplication:AI驱动的后端代码生成平台

    Amplication是一个开源的、强大的开发平台,旨在革新.NET和Node.js应用程序的创建过程。它通过AI技术将想法快速转化为生产就绪的代码,自动化后端应用程序开发,确保一致性、可预测性,并符合最高标准。Amplication的用户友好界面促进了API、数据模型、数据库、认证和授权的无缝集成。它基于灵活的插件架构构建,允许轻松定制代码,并提供多样化的集成选项。Amplication专注于协作,简化了面向团队的开发,使其成为从初创公司到大型企业各规模团队的理想选择。

  • ComfyUI-Hallo:一个定制的ComfyUI节点,用于Hallo模型。

    ComfyUI-Hallo是一个为Hallo模型定制的ComfyUI插件,它允许用户在命令行中使用ffmpeg,并从Hugging Face下载模型权重,或者手动下载并放置在指定目录。它为开发者提供了一个易于使用的界面来集成Hallo模型,从而增强了开发效率和用户体验。

  • AI Word Summarizer:AI驱动的文档摘要工具,快速生成文档摘要。

    AI Word Summarizer是一款利用高级人工智能技术快速生成Microsoft Word文档摘要的在线工具。它通过用户友好的在线界面,帮助用户节省时间,提高工作效率。该工具支持将DOCX/DOC格式的文档转换为文本,并在几秒钟内生成摘要。它还提供了与文档对话的功能,允许用户提出问题并获得即时的洞察和澄清。

  • AI Math GPT Solver Powered by GPT-4o:AI驱动的数学问题解决器

    AI Math GPT Solver是一个由GPT-4o提供动力的在线数学问题解决平台,它覆盖了代数、微积分和几何等数学领域,集成了微软数学求解器等领先技术,提供快速、准确的解决方案。该平台通过网页和移动应用程序提供免费、用户友好的服务,允许用户随时随地解决问题。

  • GPT4o.so:革命性AI技术,多模态智能互动

    GPT-4o是OpenAI的最新创新,代表了人工智能技术的前沿。它通过真正的多模态方法扩展了GPT-4的功能,包括文本、视觉和音频。GPT-4o以其快速、成本效益和普遍可访问性,革命性地改变了我们与AI技术的互动。它在文本理解、图像分析和语音识别方面表现出色,提供流畅直观的AI互动,适合从学术研究到特定行业需求的多种应用。

  • 知闻AI:基于AI技术的新闻聚合平台

    知闻AI是一个利用人工智能技术为用户提供高质量新闻内容的新闻聚合平台。它通过分析大量新闻源,筛选出准确、及时的新闻,帮助用户获取有价值的信息。平台特点包括智能评估、多元视角、AI摘要等,以提高用户的阅读效率和信息获取质量。

  • MidJourney Sref Codes Library:探索和标记您喜爱的MidJourney Sref代码。

    MidJourney Sref Codes Library是一个在线资源网站,提供MidJourney平台上的高质量Sref代码集合。这些代码用于生成具有独特和一致风格的图像,为艺术家和创作者提供了实现特定视觉效果的强大工具。

  • Humanize.im:将AI文本转化为自然人类语言。

    Humanize.im是一个先进的AI文本人性化工具,旨在将AI生成的文本转化为更自然、更具吸引力的人类语言。它利用高级算法进行上下文分析和情感分析,确保文本在上下文和情感上适当且一致,同时增强可读性和相关性。该工具支持多语言,具有跨设备功能,并且注重数据安全。Humanize.im通过持续的反馈循环不断改进,以确保生成的文本与人工撰写的文本无异,有效绕过AI检测系统如GPTZero。

  • 免费在线转换文字为语音:将文本转换为逼真语音的在线工具

    该产品是一个先进的在线文字转语音工具,使用人工智能技术将文本转换为自然逼真的语音。它支持多种语言和语音风格,适用于广告、视频旁白、有声书制作等场景,增强了内容的可访问性和吸引力。产品背景信息显示,它为数字营销人员、内容创作者、有声书作者和教育工作者提供了极大的便利。

  • Kling AI:文本到视频的革命性生成模型

    Kling AI是由快手科技开发的文本到视频生成模型,能够根据文本提示生成高度逼真的视频。它具有高效的视频生成能力,长达2分钟的30帧每秒视频,以及3D时空联合注意机制和物理世界模拟等先进技术,使其在AI视频生成领域具有显著的竞争优势。

  • LocalhostAI:与Chrome和Gemini Nano无缝协作的AI助手。

    LocalhostAI是一款旨在提高用户生产力的AI助手应用。它与Chrome浏览器和Gemini Nano设备紧密集成,使用户能够利用先进的AI模型来提升工作效率。该产品的主要优势在于其内置的Chrome AI模型、支持离线使用、注重隐私保护、运行速度快且完全免费。

  • TravelTrail:智能旅行规划助手,轻松管理你的旅程。

    TravelTrail是一款旅行规划应用,通过人工智能技术帮助用户创建和组织旅行计划。它允许用户保存梦想目的地的列表,探索每个城市的详细信息,并根据个人喜好定制旅行体验。应用支持多语言,包括中文、英文等,为用户提供了便捷的旅行规划工具,无需担心语言障碍。

今日大家都在搜的词: