首页 > 传媒 > 关键词  > 人工智能最新资讯  > 正文

悦灵犀AI多模态重磅更新“视”不可挡

2024-06-11 17:34 · 稿源: 站长之家用户

北京2024年6月11日,悦享控股有限公司(纳斯达克:CHR),一家以技术驱动的新一代移动互联网基础设施与平台服务提供商今天宣布,悦灵犀AI发布2.0多模态重磅更新,采用了更加先进复杂的算法和模型,拥有更强大的应用能力,以及更全面的人工智能新交互功能。这标志着悦灵犀AI在底层技术层面取得重大突破,在应用层面实现了质的飞跃,为用户带来比较罕见的应用体验,以及更加丰富、多样和真实的生成效果。

在本次重磅更新中,悦灵犀AI推出了相当开拓性的“文生视频”工具,并对用户全面开放使用。悦灵犀AI文生视频技术已超越国内行业平均水平,其主要得益于以下几个方面的技术创新和应用:

1.DiT混合模型架构:悦灵犀平台的文生视频技术采用了当前最前沿的DiT (Diffusion Transformer)混合模型架构,该模型架构区别于目前AI视频领域广泛基于的UNet架构的扩散模型,悦灵犀融合了Diffusion和 Transformer两种模型的优点,可用于生成高质量的视频内容。其中,Diffusion模型通过扩散过程针对视频帧添加噪声,再通过逆向扩散过程逐步去噪,生成细节丰富、高质量的视频帧。而Transformer模型的自注意力机制可以捕捉和生成帧序列中的复杂依赖关系,确保生成的视频帧在时间上的一致性和连贯性。

2.深度模拟与可控性:悦灵犀文生视频技术不仅能够生成高质量的图像,还具备对真实物理世界的深度模拟能力。通过DRL深度强化学习,悦灵犀能够理解和模拟复杂的现实场景和物体动态,为用户提供更为真实和准确的视频内容。同时,该技术还具有高度的可控性,允许用户根据具体需求调整和优化生成的视频,实现个性化的创意表达。

3.独特的创造力:悦灵犀文生视频技术拥有独特的创造力,可以基于用户的文本描述指令,创造性地生成不同风格的视频内容。这种创造力的实现,得益于模型中的CGV算法,能够捕捉和理解用户的创意意图,并将其转化为可视化的视频内容。

4.语义理解与本地化优势:依托于悦享人工智能大模型北辰星悦的强大支持,悦灵犀在语义理解方面表现出色,特别是在中文语境下的理解能力。这使得用户在使用悦灵犀进行视频创作时,无论想表达复杂的情感还是细腻的文化元素,都能够得心应手。

悦灵犀AI文生视频技术的先进性不仅体现在其创新的模型架构和强大的处理能力上,还表现在其对用户需求的深刻理解和对本地文化的高度适应上。这些技术的融合与应用,使得悦灵犀能够为用户提供一个有效、准确且富有创造力的视频生成工具。

在本次悦灵犀AI2.0版本的迭代更新中,产品团队不仅对核心功能进行了深度优化,还新增了创新的AI扩图工具与AI头像制作工具,进一步拓宽了平台在商业化场景中的应用广度,为商业品牌提供了更为多样化的营销工具。

AI扩图工具利用先进的人工智能技术,能够智能识别并扩展图像内容,帮助用户轻松实现高质量图像的无损放大与创意扩展,无论是产品细节展示还是广告画面的高清呈现,都能满足商业需求的高标准。而AI头像制作工具则通过个性化的算法,让用户能够快速生成独具特色的虚拟形象,为社交媒体营销、虚拟助手或个性化服务提供了全新的互动方式。

此外,在本次2.0版本更新的同时,悦灵犀还特别增加了AI课程模块,精心录制了大量AI课程,旨在帮助普通用户快速理解和使用,为个人创作者提供了强有力的服务与技术支持。

随着悦灵犀AI多模态的持续迭代更新,以及能力的大幅提升,进一步说明悦灵犀 AI 不仅拥有雄厚的技术研发实力与产品创新能力,而且在庞大的AI应用市场具有强大的发展潜力。

关于悦享控股

作为国内领先的新一代移动互联网基础设施与平台服务提供商,专注打造"平台+应用+技术+产业"为一体的数字生态系统,全力打造融合AI技术在内的全新web3.0开放业务体系,以及基于区块链、云计算、扩展现实、数字孪生等打造的5G+VR+AR+AI悦享元宇宙空间平台。

公司拥有北辰星悦智能云、悦灵犀AI创作平台、悦享开放平台、悦享视频、悦享商城、悦境CheerReal、悦享车载互联CheerCar、悦聊CheerChat、悦享鲜配团购电商、数字创新研究院、悦享直播系列、网综网剧系列、悦系列节目集群、IP短视频矩阵等,向市场提供拥有"在线+离线"、"虚拟+现实"在内的多元应用场景空间。

悦享控股致力于以"悦享+"为核心的产业生态布局,巩固和强化核心竞争力,实现长期可持续的规模化发展。

推广

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。站长之家将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

  • 相关推荐
  • 多模态和Agent成为大厂AI的新赛 点

    这是《窄播Weekly》的第52期,本期我们关注的商业动态是:当大厂的AI竞争策略开始倾斜向应用场景,多模态能力和代理执行成为两个焦点。大模型落地C端场景的核心,就是让大模型的能力越来越接近人。沿着这个主旋律,可以划分出两个进化方向:一个是持续降低用户与大模型进行有效沟通的难度;另一个则是让大模型具备执行更复杂任务的能力。前者的实现,需要给到大模型多

  • 多模态和Agent成为大厂AI的新赛点

    本期《窄播Weekly》聚焦AI大厂竞争策略向应用场景倾斜的趋势,重点分析了多模态能力和代理执行两大发展方向。文章指出,大模型落地的核心在于让人机交互更自然,具体表现为:1)通过多模态技术降低用户使用门槛,如阿里夸克新推出的"拍照问夸克"功能;2)通过代理执行提升复杂任务处理能力,如字节、百度等推出的通用Agent产品。国内外厂商路径差异明显:国�

  • 可灵AI发布全新2.0模型:上线多模态视频编辑功能

    快科技4月16日消息,据报道,可灵AI在北京举行灵感成真”2.0模型发布会,正式发布可灵2.0视频生成模型及可图2.0图像生成模型。据介绍,可灵2.0模型在动态质量、语义响应、画面美学等维度保持领先;可图2.0模型在指令遵循、电影质感及艺术风格表现等方面显著提升。3月27日,全球AI基准测试机构Artificial Analysis发布了最新的全球视频生成大模型榜单,快手可灵1.6pro(高品质模

  • UniToken:多模态AI的“全能选手”,一次编码搞定图文理解与图像生成

    复旦大学与美团研究者提出UniToken框架,首次在统一模型中实现图文理解与生成任务的"双优表现"。该方案融合连续和离散视觉编码,有效解决了传统多模态建模中的"任务干扰"和"表示割裂"问题。通过三阶段训练策略(视觉语义对齐、多任务联合训练、指令强化微调),UniToken在多个基准测试中性能超越专用模型。其创新性体现在:1)统一的双边视觉编码

  • 业界唯一!百度网盘上线多模态AI笔记 效率提升10倍

    快科技5月2日消息,过往,用户在通过视频学习并记录笔记时,总免不了要不停切换平台软件,暂停、截屏、记录、插图、批注、切换返回视频过程繁琐而低效。为了应对这种情况,百度网盘和百度文库联合研发上线了AI笔记”,支持全自动学习、半自动学习、辅助学习三种模式。如今只要在网盘里面任意打开一个学习视频,在右侧就能看到AI笔记”功能,用户可以自主输入内容,也可以让其直接生成图文并茂、结构清晰的笔记。而且每个重要知识点旁会有时间戳,点击时间戳即可跳转到视频中对应位置,实现视频和笔记内容的顺滑关联。此外AI笔记”还可以帮

  • 紫东太初多模态RAG全新发布:端到端问答准确率提升33%

    在产业智能化进程中,如何高效融合企业专有知识资产,构建领域专属认知引擎,是企业迈向智能决策与高效运营的关键。然而,传统检索增强生成(RAG)技术受限于语言单模态处理能力,仅能实现文本知识库与文本查询之间的浅层理解,难以满足复杂业务场景的需求,在实际应用中暴露出两大缺陷:信息表征缺失:忽略知识库中多模态富文档的视觉语义信息,如版面结构、图表关�

  • 1000万上下文!新开源多模态大模型,单个GPU就能运行

    今年2月初,谷歌发布的Gemini2.0Pro支持200万上下文,震惊了整个大模型领域。仅过了2个月,Meta最新开源的Llama4Scout就将上下文扩展至1000万,整整提升了5倍开启千万级时代。根据实验数据显示,Llama4Behemoth在MMLUPro、GPQA、MATH-500等测试的数据比GPT-4.5、ClaudeSonnet3.7、Gemini2.0Pro更好。

  • 开源即支持!基于昇腾MindSpeed MM玩转InternVL3多模态理解最新模型

    多模态理解领域当前已成了各家AI大模型公司“军备竞赛”的关键点之一,国内外知名AI大模型公司都争相通过发布最先进的多模态大语言模型展现其在多模态理解领域的前沿能力。近期,上海AI实验室推出了其最新的多模态大语言模型InternVL3 系列,相比上一代InternVL2. 5 模型,该模型展现出卓越的多模态感知和推理能力,同时进一步扩展了其工具使用、GUI代理、工业图像分析等

  • 刚刚,商汤发布第六代大模型:6000亿参数多模态MoE,中长视频直接可推理

    现在的国产AI应用,一口气看好几分钟的视频,都可以直接做推理和解析了!瞧~只需“喂”上一段柯南片段,AI就摇身一变成“名侦探”做剖析:它会对整个视频的内容先做一个总结,再按照秒级,对视频片段做内容上的推演。商汤科技联合创始人杨帆认为:银河通用合伙人、大模型负责人张直政表示:除此之外,上海交通大学副教授闫维新对这个问题的看法是:总言之,商汤作为国�

  • AI日报:国内首个多模态AI程序员上岗;字节启动Top Seed计划招募AI人才;DeepSeek R1T Chimera上线OpenRouter

    【AI日报】今日AI领域重要动态:1.百度发布文心快码3.5及多模态AI程序员"文心快码Comate Zulu",提升开发效率;2.字节跳动启动"Top Seed"计划,招募30名AI博士人才;3.DeepSeek开源R1T Chimera模型上线OpenRouter平台;4.阿里AI工程师余亮获"全国劳动模范"称号;5.开源图像编辑工具Step1X-Edit登陆Hugging Face,性能媲美GPT-4o;6.谷歌被曝每月向三星支付巨额资金预装Gemini应用