首页 > 业界 > 关键词  > DiffPortrait3D最新资讯  > 正文

AI模型DiffPortrait3D:一张肖像图就能创造各种逼真表情3D表情

2023-12-28 14:29 · 稿源:站长之家

# 划重点

1. 🌐 DiffPortrait3D是字节跳动团队研发的一种条件扩散模型,可从一张野外拍摄的肖像中创建逼真的、3D一致的视图。

2. 📸 该模型通过零样本能力,能够从单一的肖像生成多样的面部视图,包括不定姿态、夸张表情和各种艺术风格,无需繁琐的优化或微调。

3. 🔬 DiffPortrait3D采用了2D扩散模型的生成先验,结合特殊的条件控制模块、交叉视图注意力模块和3D感知噪声生成机制,实现了在多视角和野外场景下的高质量、真实感的3D人像合成。

站长之家(ChinaZ.com)12月28日 消息:近期,大型语言模型(LLMs)在人工智能社区引起了轰动,归功于其出色的能力和性能。这些模型在几乎所有基于AI子领域的行业中展现出了非凡的应用,包括自然语言处理、自然语言生成和计算机视觉。尽管计算机视觉,尤其是扩散模型引起了极大关注,但仍然存在使用有限输入生成高保真、连贯新视角的挑战。

为了应对这一挑战,字节跳动的研究团队最近推出了DiffPortrait3D,这是一种独特的条件扩散模型,旨在从一张野外拍摄的肖像中创建逼真的、3D一致的视图。DiffPortrait3D可以将一张二维(2D)非受限制的肖像重建为人脸的三维(3D)表示。

image.png

简单来说,给定一张彩色照片作为输入,该项目的目标是合成具有保持身份和面部表情的合理但一致的面部细节,以新的相机视角呈现出来。与耗时的优化和微调不同,这种零样本方法能够很好地推广到具有不规定相机视角、极端面部表情和多样艺术描绘的任意人脸肖像。其核心思想是利用在大规模图像数据集上预训练的2D扩散模型作为渲染骨架,同时使用解耦的关注控制外观和相机姿势的去噪引导。

为了实现这一点,首先将参考图像的外观上下文注入到冻结的UNets的自注意层中。然后,使用一个新颖的条件控制模块来解释相机姿势,该模块通过观察来自相同视角的一个交叉主体的条件图像。此外,研究人员插入一个可训练的跨视图注意模块来增强视图一致性,这进一步通过推断期间的新颖3D感知噪声生成过程得以加强。

DiffPortrait3D使用特殊的条件控制模块来改变渲染视图。该模块分析从相同角度拍摄的主体的条件图像,以解释相机的态度。这使得模型能够从不同视角结合一致的面部特征。

为了进一步提高视觉一致性,还引入了一个可训练的交叉视图注意力模块。在面对严重的面部表情或不定姿态的相机视角可能导致困难的情况下,这个模块尤其有帮助。

为了确保推理过程的弹性,还包括了一种独特的3D感知噪声生成机制。这一阶段增加了合成图像的整体稳定性和逼真感。团队在严格的多视角和野外基准测试上评估了DiffPortrait3D的性能,展示了在各种艺术风格和环境设置下产生逼真高质量面部重建的最新成果。

该技术主要特点包括:

1. 引入了一种独特的零样本方法,通过扩展2D稳定扩散,从单一肖像创建3D一致的新视图。

2. 该方法在独特视图合成方面取得了令人印象深刻的成就,支持外观、表情、态度和风格各异的肖像,无需繁琐的微调。

3. 使用明确分离的外观和相机视图控制系统,实现了有效的相机操作,而不影响主体的表情或身份。

4. 该方法结合了交叉视图注意力模块和3D感知噪声生成技术,提供了3D视图的长程一致性。

项目网址体验:https://top.aibase.com/tool/diffportrait3d

论文网址:https://arxiv.org/abs/2312.13016

举报

  • 相关推荐
  • 重庆荣昌扯面大爷爆火后营业额翻3倍 此前因生无可恋表情走红

    假期期间,黄二鸡汤铺盖面店人气爆棚,每天都要卖出几千碗面。有拍摄者透露,近两日该店每天要扯五六千份铺盖面。如此巨大的客流量,让负责扯面的大爷忙得不可开交。3日,网友拍摄的一段扯面大爷的视频登上热搜,视频中大爷扯面时因太过忙碌而表

  • 日销破千元!AI生成的3D挂件,被我们卖爆了

    先说结论:我们花15天做的AI3D挂件,在线下卖爆了,单日营收破千元!故事的开始,是因为我们发现把AI3D打印手办做成一门小生意的可行性越来越高,这也激发了我们的“搞钱基因”。再加上前不久新榜在上海举办了「新榜内容节」,一拍即合,我们于是做了一批模型去大会现场摆摊试水!最后结果还不错,单日最高收入突破1000元,是我们“创业史”上的一个高光表现。欢迎大家

  • 10倍精度升级!腾讯混元3D模型v2.5版本发布

    腾讯混元3D模型升级至v2.5版本,建模精度和贴图真实度显著提升。新版本参数体量从1B增至10B,有效面片数增加超10倍,支持1024几何分辨率。纹理系统支持4K高清贴图和凹凸细节,率先支持多视图生成PBR模型。针对动画场景优化骨骼蒙皮系统,支持非标准姿态自动绑定。新增文生/图生3D减面模型、多视图建模模板等专业工作流。混元3D v2.5已全面更新至腾讯AI创作引擎,免费生成额度提升至每日20次,并正式上线腾讯云API面向企业开放。GitHub开源版本累计Star超1.2万。

  • 1/8成本比肩Claude 3.7,Mistral Medium 3来了

    欧洲AI公司Mistral发布多模态新模型Mistral Medium 3,主打编程和多模态理解能力,性能达Claude 3.7的90%但成本仅1/8(输入0.4美元/百万token)。该模型在编程和STEM任务表现突出,支持企业级定制部署,已上线多个云平台。同时推出企业聊天机器人服务Le Chat Enterprise,集成第三方工具。尽管因未开源权重引发争议,其高性价比仍获业界关注。公司透露正在开发更大规模模型。

  • AI日报:腾讯混元3D生成模型2.5版本发布;海螺推出像人物参考功能;百度上线移动端超级智能体心响App

    本文介绍了多款AI领域的新产品和技术进展:1)Kortix-AI推出开源通用AI智能体平台Suna;2)腾讯混元3D生成模型升级至2.5版本;3)海螺AI推出基于单张图像生成多角度角色图像功能;4)百度发布"心响"App整合多智能体协作;5)Nari Labs开源媲美真人的对话语音模型Dia;6)Grok新增视觉处理和多语言支持;7)Genspark推出AI幻灯片工具;8)Character.AI发布让静态图片"说话"的AvatarFX模型;9)pad.ws结合白板和代码编辑器;10)OpenBMB开源社区推出长文本生成模型"卷姬";11)腾讯推出AI阅读助手"企鹅读伴";12)OpenAI有意收购Chrome浏览器;13)字节跳动调整AI产品线布局。这些创新展现了AI技术在自动化、3D生成、语音交互、内容创作等领域的快速发展。

  • AI日报:Kimi全新音频基础模型Kimi-Audio;阶跃星辰开源像编辑模型Step1X-Edit;​夸克AI超级框上线 “拍照问夸克”

    本期AI日报聚焦多项AI技术突破与应用:1)Moonshot AI推出开源音频模型Kimi-Audio,基于13亿小时训练数据,支持语音识别等任务;2)阶跃星辰开源图像编辑模型Step1X-Edit,展现强大生成能力;3)夸克AI上线"拍照问夸克"功能,实现视觉问答;4)苹果iOS18.5将在中国推送,带来智能功能;5)谷歌发布601个生成式AI应用案例,覆盖多行业;6)微软推出深度整合Windows的UFO²自动化系统;7)OpenAI升级ChatGPT至GPT-4o版本,提升STEM领域能力;8)Ema公司推出高性价比语言模型EmaFusion;9)Liquid AI发布面向边缘设备的Hyena Edge模型;10)LemonAI推出实时音视频数字人产品Slice Live。此外,国内方面,智谱与生数科技达成战略合作推动大模型发展,宝马中国宣布新车将接入DeepSeek技术。

  • Trae国内版怎么用?Trae IDE 内置 MCP 市场配置使用指南

    字节跳动旗下Trae+IDE发布新版本,通过MCP协议实现AI智能体与外部工具的深度集成。MCP作为标准化桥梁,让开发者能灵活接入Supabase、FireCrawl等第三方服务,只需@符号即可调用智能体完成数据库操作、文档搜索等复杂任务。新版本内置MCP市场,支持Token快速配置,并演示了如何通过Figma+AI自动生成前端代码。该技术可应用于Blender建模、K8s管理等多元场景,显著提升开发效率。Trae+IDE将持续扩展工具生态,推动AI协作开发新时代。

  • 曝iPhone 18 Pro内测屏下3D人脸识别:苹果迈入单挖孔屏时代

    这意味着iPhone 18 Pro系列正式迈入单挖孔屏时代,向安卓主流屏幕形态看齐。需要注意的是,安卓阵营普遍采用单挖孔 屏幕指纹识别方案,而iPhone则是采用屏下3D人脸识别方案,不支持屏幕指纹。

  • ​上海毅速推出第三代模具3D打印专机E3系列,引领模具制造技术革新

    导读:近年来,金属3D打印技术在模具制造领域得到了广泛的应用,模具行业正在迎来一场前所未有的技术变革,随着应用的逐渐深入,模具专用的金属3D打印机应运而生。2025 年 4 月 15 日,上海毅速激光科技有限公司(以下简称“毅速”)正式发布了其第三代模具3D打印专机系列——E3- 420 和E3-520。这一新品的推出,标志着模具制造行业向增材制造迈出了重要一步。毅速E3- 420 �

  • 聚首华南,2025下半年增材制造、3D 打印的顶尖展览与活动推荐

    2025年全球3D打印行业将迎来系列盛会。4月西安论坛成功举办后,下半年将迎来深圳Formnext Asia(8月26-28日)、东京论坛(9月25-26日)和法兰克福Formnext展会(11月18-21日)三大国际活动。这些平台将汇聚全球顶尖企业,展示航空航天、医疗健康、汽车工业等领域的最新技术成果,特别关注中国企业的快速成长。法兰克福展会预计吸引超900家展商,中国展商数量有望再创新高。系列活动将搭建全球产业交流平台,推动3D打印技术创新与商业应用深度融合。