首页 > 业界 > 关键词  > 视频最新资讯  > 正文

南大提出全新框架VividTalk 一张照片一段声音秒生超逼真视频

2023-12-13 14:23 · 稿源:站长之家

要点:

  • 南大等机构研究人员提出的通用框架,名为VividTalk,能通过一段音频和一张照片生成高质量、富有表现力的说话视频,实现口型和音频的无缝对齐。

  • 框架采用两阶段生成,第一阶段考虑面部运动和blendshape分布之间的映射,利用多分支Transformer网络建模音频上下文,第二阶段渲染内外表面的投影纹理,实现全面建模运动。

  • VividTalk在实验中展现出优越的生成质量和模型泛化性,支持多语言,能够生成具有丰富表情和自然头部姿势的口型同步头部说话视频。

站长之家(ChinaZ.com)12月13日 消息:近日,南大等机构的研究人员推出了一项引人注目的研究成果——VividTalk框架,其能够通过一段音频和一张照片实现令人惊叹的说话视频生成。这一通用框架采用了两阶段生成方法,首先通过考虑面部运动和blendshape分布之间的映射,利用多分支Transformer网络建模音频上下文,生成3D驱动的网格。

image.png

论文地址:https://arxiv.org/pdf/2312.01841.pdf

框架的第一阶段注重嘴唇运动和面部表情的生成,使用blendshape和顶点偏移作为中间表征,以提供全局粗略的面部表情运动和局部细粒度的嘴唇运动。为了更合理地学习刚性头部运动,研究人员巧妙地将问题转化为离散有限空间中的代码查询任务,并构建了可学习的头部姿势代码本。这一创新性的方法使得从音频到头部姿势的学习变得更加准确和高效。

image.png

第二阶段则在生成器中使用了双分支motionvae来建模2D密集运动,通过投影纹理表示在2D域中进行运动转换,提高了网络性能和生成视频的质量。VividTalk框架在实验中取得了显著的成果,能够生成具有表情丰富、自然头部姿势的口型同步视频。实验数据集的丰富性和优化的训练方法使得该框架在生成质量和模型泛化方面表现优越。

这一框架的推出代表了在语音合成领域的一次重要突破。VividTalk不仅支持多语言,而且在生成效果上也胜过了其他同类方法。这项研究成果将有望在虚拟人物、语音合成和视频制作等领域产生深远的影响。

举报

  • 相关推荐
  • 从向佐到papi酱、马宁,为何越来越多人愿意录视频播客?

    ​视频播客已经快成热搜常客了。 孙杨刚因参与录制易立竞的视频播客登上多平台热搜,papi酱和窦文涛两人又因为对原生家庭、流量焦虑、如何接纳自己等话题的交流,引发诸多网友的围观讨论。 有人和窦文涛共鸣了,说他拧巴又真诚,也有人欣赏papi酱的通透,觉得她简直是视频播客界的心理咨询师。这大概就是视频播客的魅力所在,即便是已经被大众熟知的公众人物,�

  • 视频播客的「3亿时代」,抖红B谁能先创造

    没有人能逃过原生家庭的痛,哪怕是被称为中国最会聊天的人之一的窦文涛。 当窦文涛在他的视频播客《自然光》聊起自己父亲时,papi酱点出他在无意识中给自己带来的枷锁,让窦文涛晃了神,也让他感叹这样的对话很治愈。 这期时长两个半小时的视频播客完整版虽首发于B站,视频播放量达330万,但真正的讨论场却聚焦在抖音和小红书。 不少网友将节目中的高光段落制成

  • 9条破亿视频,新号涨粉百万,过去半年谁在制造AI爆款?

    ​2026上半年,可谓是AI爆款的井喷期。 短短6个月内,不仅出现了全网曝光量2.3亿、被央视新闻、人民日报先后转发的现象级AIGC短片《纸手机》,以及《纸手机》过后批量涌现的AI爆款短片。

  • 从“管住屏幕”到“用好屏幕”,腾讯视频「少儿护航计划」暑期升级

    暑期来临,腾讯视频升级“少儿护航计划”,聚焦安全、营养、有趣。针对1.96亿未成年网民,推出覆盖多端的“三级管控模式”与“一键管控”,家长可一键设置时长与内容分级,简化管理。内容端上线绿标片单、电视“趣学”模式及移动端知识剧场,提供优质筛选。平板端新增AI助手“少儿伙伴”,实现安全互动陪伴。该模式半年来使用率增48%,推动从“管得住”到“选得好”,引导孩子健康用屏。

  • 可灵AI估值千亿,快手“母凭子贵”:国产视频模型三强争霸

    ​AI正在重写每个行业、每家公司的估值逻辑。 7月2日晚间,快手发布公告,旗下独立运营主体北京可灵智能科技有限公司(以下简称“可灵AI”)敲定总额上限30亿美元的外部增资,目前已签约近28亿美元,创下全球视频大模型公司单轮最高融资纪录。可灵AI投后估值达180亿美元,约为当天母公司快手估值的80%。

  • 四款APS-C画幅视频微单同台:轻便、画质、对焦、散热,谁更全面?

    2026年视频创作已入精细化时代,需兼顾便携、画质、对焦等六维能力。本文对比佳能R50V、索尼ZV-E10 II、尼康Z30和富士X-S20四款APS-C热门微单:佳能R50V极致轻便,视频规格全面,竖拍与色彩直出讨喜;索尼对焦及镜头群占优;尼康最亲民但缺Log与4K 60P;富士胶片模拟风格鲜明且防抖好。选择无绝对答案,应根据最常拍场景和核心需求理性取舍。

  • 《狂热运输3》最新视频展示全新载具与玩家期待功能

    《狂热运输3》发布深度解析视频,展示动态环境、产业与系统全面进化。本作将于2026年登陆PC及主机,收录超300款载具,加入准点送达、动态昼夜等新机制,并提供强化的线路管理器与首发跨平台模组支持,打造系列迄今最灵活、沉浸的运输大亨体验。

  • AI如何重构音视频行业?行业协会专家与itc保伦股份给出这些新思考

    广州电子音响协会与ITC保伦股份联合举办“AI时代音视频产业革新”座谈会。会前专家团参观了ITC智慧展厅等场景。ITC总经理张柏龙系统梳理了产业现状、痛点与战略路径。与会专家围绕AI重塑产品逻辑与商业模式、多领域智慧场景破局路径、校企协同三大议题深入探讨,达成四项共识:主动拥抱AI技术变革;依托广州硬件优势,补齐AI能力短板;聚焦细分场景打造增量市场;深化校、企、协协同育人,构建产学研一体化生态。

  • 一条视频50万奖金,西藏文旅把KOL变成代言人

    重庆博主“李要得”打出租进藏2229公里抵布达拉宫,视频点赞破千万。西藏文旅奖励50万元,博主捐出48万。事件折射文旅营销新玩法:地方从自己拍转向重奖KOL创作,以真实故事、情绪共鸣和官方接力引爆传播。关键在能否将短期流量转化为长期口碑与留客能力。

  • 豆包视频通话背后,火山引擎重构 Agent 时代多模态传输底座

    多模态交互正成为提升通用Agent用户体验的关键。过去AI多为文本或图片问答,如今用户期望AI能透过摄像头实时讲解、在任务中持续对话。这背后需要低延迟、稳定、可打断的传输系统。豆包从WebSocket、QUIC到WebRTC逐步演进,火山引擎更自研多模态传输系统,通过C/S架构、MoQ协议和网关智能处理,解决弱网、高并发、成本等问题。该系统已在豆包亿级DAU场景落地,使业务规模翻10倍。长远看,多模态传输正从通信管道成为AI原生基础设施,支撑高频率、全场景的人机交互。

今日大家都在搜的词: