首页 > 业界 > 关键词  > DMD最新资讯  > 正文

MIT与Adobe联手开发DMD:生成图像质量媲美Stable Diffusion ,速度快30倍

2023-12-07 11:35 · 稿源:站长之家

**划重点:**

1. 🔄 **创新方法:** 研究团队提出了分布匹配蒸馏(DMD)方法,将扩散模型转化为一步图像生成器,在保持图像质量的同时显著减少神经网络评估次数。

2. 🌐 **数据优化:** 通过对文本到图像数据进行精细调整,研究团队成功解决了在通用文本到图像数据上扩大模型的难题,实现了高效的图像生成。

3. 📈 **性能超越:**速度超越 StableDiffusion v1.5,图像质量相当。利用扩散模型逼真地生成图像,通过训练两个扩散模型估计真假分布的得分函数,采用梯度更新生成器,使图像更逼真,虚假度更低。

站长之家(ChinaZ.com)12月7日 消息:MIT和Adobe的研究人员最近提出了一种新颖的人工智能方法,称之为分布匹配蒸馏(DMD),该方法旨在将扩散模型转化为一步图像生成器,从而显著提高图像生成的效率和质量。据称他们的一步生成器(Gθ)在生成逼真图像方面不仅与 StableDiffusion v1.5相媲美,而且速度更快30倍。

image.png

创新方法方面,传统的扩散模型在图像生成方面取得了巨大的进展,但其采样过程相对繁琐,需要通过逐步去噪的迭代过程逐渐减少高斯噪声样本中的噪声,这限制了生成管道作为创意工具时的交互性。与此不同,DMD方法通过将初始多步扩散采样找到的噪声→图像映射压缩成单通道学生网络,加速采样过程。通过这一创新,DMD成功解决了高昂的神经网络评估成本的问题,使得一步生成器在多项任务上表现优越。

image.png

在数据优化方面,研究团队通过在文本到图像数据上进行精细调整,不仅学习了数据分布,还学习了蒸馏生成器正在产生的虚构分布。这一方法通过利用预训练扩散模型的去噪扩散输出来解释梯度方向,从而推动人工生成图像向更真实和 less 虚构的方向发展。

性能超越方面,DMD在多项任务中都取得了令人瞩目的成绩。在ImageNet上,其FID指标达到2.62,比一致性模型提升了2.4倍。

此外,DMD在MS COCO2014-30k上获得了11.49的竞争性FID,同时保持了与更昂贵的Stable Diffusion模型相媲美的图像质量。值得注意的是,DMD方法在减少神经网络评估次数的同时,能够在FP16推断下以每秒20帧的速度生成512×512的图像,为交互式应用开辟了许多可能性。

研究团队通过结合分布匹配方法、GANs和pix2pix的灵感和见解,展示了DMD方法如何通过使用扩散模型来建模真实和虚构分布,并通过简单的回归损失匹配多步扩散输出,训练出高保真的一步生成模型。通过在多个任务上的验证,DMD一步生成器在各项基准测试中均表现优异,包括一致性模型、渐进蒸馏和矫正流等。

这一研究为图像生成领域带来了崭新的可能性,通过创新的方法,使得生成模型在效率和质量方面都取得了显著提升。

项目网址:https://tianweiy.github.io/dmd/

论文网址:https://arxiv.org/abs/2311.18828

举报

  • 相关推荐
  • 品牌在AI时代“隐形”?用GEO指数破解AI搜索曝光密码

    文章探讨AI搜索时代品牌曝光新指标GEO指数,指出其通过可见度(品牌在AI回答中的出现概率)和曝光度(被提及总次数)衡量品牌在豆包、文心一言等主流AI模型中的存在感。以徕芬为例,其GEO得分仅33分,反映在AI搜索中存在感薄弱。随着超60%消费者决策参考AI推荐,GEO指数直接影响品牌流量获取。文章建议通过AIBase工具分三步优化:绑定品牌信息锚定监控范围、分析关键词关联度与竞品表现、针对性补充官网内容强化核心词布局,将AI搜索流量转化为品牌增长新引擎。

  • AI漫剧,比短剧更短剧?

    “是个人就能起飞的风口”,又来了。 在短剧行业摸爬两年后,飞鸟再次感受到了熟悉的躁动。朋友圈、群聊、行业会都在谈论同一个词——“漫剧”。有人劝他趁早上车,理由几乎与当年如出一辙:“就像当时的短剧,是个人就能起飞。” 所谓漫剧,并没有统一的定义。它们形式多样:有的是用游戏编辑器生成的3D动画,有的是将平面漫画动态化,还有的直接以“熊猫头”等

  • ​AI时代,你的品牌不懂AI搜索监控,营销预算一半在打水漂

    文章指出,AI搜索正重塑营销格局,品牌AI搜索监控成为决定品牌存亡的关键。它通过追踪品牌在各大AI模型中的提及、评价和推荐情况,帮助应对用户搜索习惯从关键词到对话式提问的转变。AIBase平台提供三步简易操作:设置监控目标、AI全域扫描、生成智能报告,助品牌快速掌握在AI世界的表现,抓住增长新机遇。

  • 横扫拉美、力压字节系,「AI届的4399」成为出海AI应用新王?

    在 Sensor Tower 发布的 Q3应用出海榜单中,我们注意到了一个特别的 AI 应用「Seekee」。 它空降下载榜 Top9,是当季度在海外获得最多下载量的出海 AI 应用,而由字节跳动出品、近一段时间炙手可热的「Cici」尽管排名上涨,但仅位列第13。

  • ​AI搜索时代的品牌新战场:为什么你需要关注GEO指数和品牌AI搜索监控?

    AI搜索时代催生全新品牌曝光指标GEO指数,用于衡量品牌在ChatGPT等AI问答中的提及率。该指数反映AI对品牌的认知度,需通过建立稳定、正向的内容矩阵来提升。AIBase平台可监控品牌在主流AI模型中的曝光表现,对比竞品数据,并智能分析用户高频问题类型,帮助品牌优化内容策略。高GEO指数不仅提升曝光,更积累品牌权威感与信任度,成为AI时代的"推荐力"量化指标。

  • AI日报:广电整治AI动画乱象;360发布大模型安全白皮书;百度推出小度AI眼镜Pro

    国家广电总局宣布自2026年3月起全面整治AI生成内容,要求AIGC作品纳入分类分层审核体系。360发布《大模型安全白皮书》,提出全链路AI安全防线应对新型威胁。百度推出2299元小度AI眼镜Pro,集成智能翻译等多项功能。StepFun开源音频编辑模型Step-Audio-EditX,实现文本化语音编辑。Grok新增纯文本生成视频功能,17秒可生成带特效视频片段。研究发现谷歌Veo-3模型能生成逼真手术视频但缺乏医学逻辑。阿里Qwen3-Max-Thinking在全球数学竞赛夺冠,并在加密货币交易中取得显著回报。OpenAI推出轻量化GPT-5 Codex Mini模型,优化开发者体验。

  • 首个AI“全面落地”的双11,有什么不一样?

    2025年双11来到了它的17岁,以人来类比,过了蛇年就告别了青少年,进入它的青年时代。大多数人认为今年双11会在平淡中度过,但星图数据显示,仅截至10月31日,双11大促全网累计销售额就达到10026亿元人民币。 天猫仍居综合电商平台榜首位置,京东紧随其后,抖音位列第三。以这个快速上扬的曲线推演,今年双11大促对消费的拉动,将远超其他时间节点。 它在步入青年时�

  • 有AI就有无限可能,灰豚AI发布新一代GEO系统

    11月1日,灰豚AI发布新一代GEO系统,突破传统仅支持文本内容优化的局限,全面支持国内短视频平台作品优化,实现近乎零算力成本。该技术被视作行业重大创新,是当前国内GEO源头厂商的重要突破。系统通过AI训练提升企业在生成式搜索中的品牌影响力,助力企业获得竞争优势。未来电商将从平台化转向AI化,灰豚GEO系统支持多种合作模式,让企业以业务增长为导向,抢占AI市场先机。

  • 双11“换芯” 阿里妈妈AI按下加速键

    ​今年双11的不同,在平台对外披露的商家案例中得以一窥究竟。 AI智能选品、AI智能出价、AI智能调控投放节奏..... 这些营销策略的表述来自音箱品牌Marshall,双11第一波段10天活动期内,Marshall在影音电器行业品牌和店铺排名均位居第一;成交转化率提升67%,爆款成交同比增长30%。这波爆发式增长的背后,反复被CUE到的AI可以说是深藏功与名。 绝非只是平台意志的表达,

  • AI日报:HeyGen发布AI视频翻译引擎;科大讯飞推星火 X1.5;QQ浏览器推出AI+小窗

    本期AI日报聚焦多项技术突破:HeyGen推出精准唇形同步的视频翻译引擎;科大讯飞发布星火X1.5大模型,提升多语言处理能力;QQ浏览器新增AI助手浮窗;科大讯飞推出软硬一体方案,实现高噪声环境精准识别;谷歌Gemini 3 Pro预览版支持百万级上下文窗口;Comfy Cloud让Stable Diffusion实现零门槛创作;谷歌Gemini新增深度研究功能,可整合邮件生成智能报告;上海AgiBot机器人10分钟完成复杂制造任务,重塑生产效率。

今日大家都在搜的词: