首页 > 业界 > 关键词  > SadTalker模型最新资讯  > 正文

西交大开源SadTalker模型 图片+音频秒变视频!

2023-04-19 15:16 · 稿源:站长之家

站长之家(ChinaZ.com)4月19日 消息:最近,西安交通大学的研究人员提出了SadTalker模型,通过从音频中学习生成3D运动系数,使用全新的3D面部渲染器来生成头部运动,可以实现图片+音频就能生成高质量的视频。

image.png

为了实现音频驱动的真实头像视频生成,研究人员将3DMM的运动系数视为中间表征,并将任务分为两个主要部分(表情和姿势),旨在从音频中生成更真实的运动系数(如头部姿势、嘴唇运动和眼睛眨动),并单独学习每个运动以减少不确定性。最后通过一个受face-vid2vid启发设计的3D感知的面部渲染来驱动源图像。

image.png

论文链接:https://arxiv.org/pdf/2211.12194.pdf

项目主页:https://sadtalker.github.io/

研究人员使用SadTalker模型从音频中学习生成3D运动系数,使用全新的3D面部渲染器来生成头部运动。该技术可以控制眨眼频率,音频可以是英文、中文、歌曲。

这项技术在数字人创作、视频会议等多个领域都有应用,能够让静态照片动起来,但目前仍然是一项非常有挑战性的任务。SadTalker模型的出现解决了生成视频的质量不自然、面部表情扭曲等问题。该技术可以应用于数字人创作、视频会议等多个领域。

举报

  • 相关推荐
  • 自变量发布QUANXTA Zero系列无本体数采方案,从具身模型反向定义数采基建

    具身智能行业面临高质量数据稀缺难题,2026年被视为“数采元年”。自变量机器人推出QUANTAX Zero系列无本体数采方案,从模型训练需求反向设计,大幅提升采集质量与效率,数据入库有效率超85%。方案打通采集、清洗、标注到训练评测的全流程,支持移动全身数据采集与本体回放,并通过“无本体+真机”混合配方将数据成本降低约60%,助数采商抢占先机。

  • 苹果研发AI模型压缩技术:把270亿参数大模型装进iPhone

    苹果正与硅谷初创公司PrismML进行早期洽谈,后者宣称能将大型AI模型压缩至可在iPhone上本地运行。若技术验证成功,此举将强化苹果的隐私主张,并为其进展缓慢的Siri升级提供关键支撑。 PrismML首席执行官表示,苹果已开始评估其技术。洽谈尚处于早期阶段,前景虽不明朗,但进展顺利”。 消息发布正值苹果推出iOS 27公测版次日这是苹果大幅改版Siri后首次面向公众的广泛测�

  • 可灵AI估值千亿,快手“母凭子贵”:国产视频模型三强争霸

    ​AI正在重写每个行业、每家公司的估值逻辑。 7月2日晚间,快手发布公告,旗下独立运营主体北京可灵智能科技有限公司(以下简称“可灵AI”)敲定总额上限30亿美元的外部增资,目前已签约近28亿美元,创下全球视频大模型公司单轮最高融资纪录。可灵AI投后估值达180亿美元,约为当天母公司快手估值的80%。

  • Meta研发超级感知AI眼镜 支持持续录音自动抓拍

    科技企业Meta正在研发代号为 超级感知” 的全新AI智能眼镜原型设备,依托持续音视频感知能力,打造全天候陪伴式智能个人助理,相关功能后续有望通过软件更新落地到现有在售智能眼镜产品。 据知情人士介绍,这款全新原型眼镜搭载 超级感知” 核心功能,设备可持续收录环境音频,并每隔数秒自动拍摄实景图像,依托实时采集的画面与声音信息,用户可随时向内置 AI 询�

  • 超越Opus 4.7美国顶级大模型 Kimi K3即将发布:2.5万亿怪兽级AI

    这个月会有多款国产重量级大模型发布,除了DeepSeek V4正式版之外,最受关注的当属月之暗面Kimi K3,最新内测显示其超越了美国顶级大模型Opus 4.7。 Kimi官方昨晚实际上都预告了K3的发布,显示会从今天开始有充值优惠活动,但很快又把页面下架,即便如此K3的发布也就是这一两天的事了。 至于Kimi K3的性能水平,有提前测试的网友给出了一些对比结果,跑分结果超越了Opus 4.7、

  • AI日报:Claude Cowork登陆网页和手机端;美国放行GPT-5.6;Meta超级智能实验室首发图像生成模型

    AI日报要点:1. Meta发布免费图像模型Muse,登陆Instagram/WhatsApp并推视频计划;2. 美国解除GPT-5.6限制,OpenAI本周将推Sol等新模型;3. Claude Cowork转型全能办公搭子,支持跨设备非编程场景;4. 淘宝高管指行业缺乏AI交互,强调即时零售核心三要素;5. 微软在Excel/Outlook中引入自研AI模型,逐步替代OpenAI;6. 推出内置大模型的AI电子宠物Domi,主打环保与智能陪伴;7. OpenAI前研究员田永龙加入腾讯混元团队,主攻视觉语言模型;8. Steam调查显示43%玩家接受AI游戏,多数不将其作为购买决策关键。

  • 不用写代码!Meta上线新应用Pocket:AI一键做小游戏

    Meta近期低调推出AI应用Pocket,基于收购的Gizmo团队技术,进军轻量化小游戏赛道。该应用让用户通过文字提示即可零代码生成小型互动游戏,内置信息流可浏览全球作品,创作和消费门槛极低。此举是Meta继AI图像和视频生成之后,完善其AI创作生态的关键一步,填补了互动游戏创作的空白。Gizmo此前拥有63.5万装机量和98%的好评率,但Pocket目前仍处于早期试运营阶段。

  • 如何提升AI生成3D模型的可用性?企业为什么需要系统化布局

    AI 3D模型可用性的核心不是追求一次生成完美成品,而是建立标准化的闭环生产流程。关键是先明确定义模型最终用途(展示、动画或生产),再规范输入参考、按需选择生成路径,并尽早进行骨骼绑定与动作验证。流程必须包含重拓扑与导出终检,确保模型结构完整、可二次编辑、适配动画、兼容下游格式。对企业而言,系统化布局的意义在于统一资产标准、压缩返工成本、打通业务链路,使AI成果沉淀为可复用、可迭代的正式生产资产,而非一次性演示结果。

  • 做智驾十年,为何Momenta上市换锚?

    近日,Momenta转以“物理AI”的身份,终于要在港交所主板挂牌了。 本次上市,Momenta计划全球发售约1993.8万股,每股定价为295.6港元;基石投资者认购约996万股,占发行后总股本的4.23%,由此可推算,对应上市后的市值大约为695亿港元,86亿美元。 截至今日,地平线总市值为75.8亿美元,小马智行为30.17亿美元,均低于Momenta的定价。 这份定价背后,有多少“物理AI”的加持不得而

  • 换种方式过暑假:用三星Galaxy Tab S10+记录别样假期生活

    三星Galaxy Tab S10+平板是暑期培养创作兴趣的理想选择。它主打轻薄大屏与S Pen,解决绘画入门难题,0.7mm笔尖和4096级压感能精准还原真实笔触。借助AI涂鸦生图、笔记助手等功能可轻松美化手帐。多任务能力与强劲芯片方便剪辑假期Vlog,支持AI修图与音频降噪,并能无缝同步手机素材。其长续航与防水设计,让外出创作更安心。

今日大家都在搜的词: