首页 > 业界 > 关键词  > UFOGen最新资讯  > 正文

谷歌推扩散模型变种UFOGen 真正实现一步文生图

2023-11-20 14:35 · 稿源:站长之家

要点:

1. 谷歌研究团队提出了一种名为UFOGen的扩散模型变种,只需要一步就能生成高质量的图片。

2. UFOGen通过改变生成器的参数化方式和重构损失函数的计算方式,理论上可以实现一步生成。

3. UFOGen的生成器和判别器都是由Stable Diffusion模型初始化,这样可以最大限度地利用Stable Diffusion的内部信息。

站长之家(ChinaZ.com)11月20日 消息:近年来,扩散模型在视觉创作领域的应用不断增加,但是生成速度一直是一个问题。然而,随着技术的进步,UFOGen模型的出现解决了这个问题,它只需要一步就能生成高质量的图片。通过改变生成器的参数化方式和重构损失函数的计算方式,UFOGen实现了一步生成的目标。

image.png

论文地址:https://arxiv.org/pdf/2311.09257.pdf

之前对扩散模型生成速度的研究主要集中在两个方向,一方面是利用更少的离散步数求解扩散模型的采样ODE,另一方面是利用知识蒸馏的方法将采样路径压缩到更小的步数。然而,谷歌的研究团队在UFOGen模型中采用了一种全新的思路,通过改变生成器的参数化方式和重构损失函数的计算方式来实现一步生成的目标。

image.png

UFOGen模型是在扩散模型和GAN混合模型的基础上发展而来的。扩散模型假设降噪分布是一个简单的高斯分布,但这种假设只在降噪步长趋于0时成立,导致生成速度很慢。而UFOGen模型通过使用带条件的GAN来模拟降噪分布,取较大的降噪步长来减少步数,从而提高了生成速度。

举报

  • 相关推荐
  • 文生图大模型有哪些?探索AI绘画的核心引擎与选择利器

    本文探讨了当前主流的AI文生图技术及其应用场景。国际阵营中,OpenAI的DALL·E3擅长复杂语义理解,MidJourney以艺术风格见长,Stable Diffusion则以开源生态支持深度定制。中国力量方面,百度文心一格在中文语义和国风创作表现突出,阿里通义万相侧重商业化应用,昆仑万维天工支持长文本生成连贯图像。垂直领域工具如Adobe Firefly深度集成设计流程,Runway ML革新视频创作。文章建议通过聚合平台高效对比模型特性,并指出下一代技术将突破分辨率限制,实现跨模态生成。从精准语义到无限可能,AI文生图正在重塑视觉创作边界。

  • AI日报:美图发布影像AI Agent RoboNeo;1.8bit量化Kimi K2模型上线;亚马逊推AI代码编辑器 Kiro

    【AI日报】今日AI领域重要动态:1)美图推出RoboNeo,通过自然语言指令实现图片精修、品牌设计等全能影像处理;2)Unsloth AI将Kimi K2模型量化至1.8bit,体积缩减78%保持性能;3)谷歌Gemini嵌入模型登顶MTEB榜单,超越OpenAI;4)亚马逊发布免费AI代码编辑器Kiro,集成Claude模型;5)Claude新增应用工具目录功能提升工作效率;6)MiniMax完成近3亿美元融资,估值超40亿美元;7)UTCP新协议让AI代理直

  • 墨刀AI生成原型图,产品设计快人一步

    国内原型设计平台墨刀发布"AI生成原型图2.0"功能,30秒即可生成可编辑原型图,大幅提升产品设计效率。该功能通过AI技术解决传统原型设计周期长、效率低、修改繁琐等痛点,支持文字描述或图片上传自动生成高保真原型图,并可二次编辑优化。这一创新不仅标志着墨刀AI能力的全面升级,更代表产品设计方式的一次革新,显著加快产品迭代速度。未来,AI原型设计有望成为行业标配,助力企业更快响应市场需求,提升产品竞争力。

  • ZEGO AI Agent:支持一张图生成数字人

    即构科技推出AI Agent2.4,用户只需上传一张正面照即可生成1080P高清数字人,支持实时互动对话。该技术具备400ms超低延迟、2秒内完成自然交互响应,唇形同步准确,支持文本/音频/语音流驱动。适用于教育、客服等场景,提供API灵活定制,实现低成本批量生成。核心技术融合照片驱动与实时AI交互引擎,在生成效率、拟真度方面显著提升,带来低门槛、高沉浸的数字人互动体验。

  • AI日报:腾讯混元推3D生成大模型Hunyuan3D-PolyGen;钉钉AI表格重磅来袭;阿里推多模态大语言模型HumanOmniV2

    本文介绍了AI领域多项重要进展:1)腾讯推出首个美术3D生成大模型Hunyuan3D-PolyGen,显著提升建模效率;2)阿里发布多模态大模型HumanOmniV2,准确率达69.33%;3)钉钉AI表格实现1小时处理千项任务;4)百度PaddleOCR3.1版本在多语种识别和文档翻译方面升级;5)微软推出Deep Research智能体,自动化研究流程;6)香港理工与OPPO联合开源视频超清框架DLoRAL;7)谷歌开源MCP工具箱简化AI与数据库集成;8)Win11将推出AI动态壁纸功能。这些创新展示了AI在3D生成、多模态理解、办公效率、视觉处理等领域的突破性进展。

  • 专为企业打造的智能体中台来了!迈富时AI-Agentforce 2.0让Agent正式走向工作岗位

    Gartner预测到2028年,15%的日常工作决策将由自主智能代理完成。迈富时最新发布的AI-Agentforce2.0作为企业级智能体中台,采用"技术赋能+场景落地"双轴驱动模式,重新定义企业智能化转型路径。该平台通过"模型-应用-开发平台"三位一体架构,提供从底层能力到上层应用的完整闭环,包含五大技术模块:模型管理、知识引擎、工具生态、流程编排和企业级基座。相比传统开发方式,该平台将Agent开发周期从3-6个月缩短至2分钟-2周,并已在金融、零售、供应链等行业实现规模化落地,典型应用包括智能导购、财务审批等场景。

  • 荣耀IPO,重拾荣耀第一步

    风声传了多年的荣耀IPO,终于迈出真正意义上的第一步。 据中国证监会网站披露,荣耀终端股份有限公司获上市辅导备案,辅导券商为中信证券。而根据辅导工作安排,将于2026年1月至3月完成上市辅导。  

  • 微信:持续打击非法使用外挂行为 进一步强化外挂营销信息治理

    近日,微信平台对外挂软件展开了新一轮的严厉打击行动,旨在打造一个更加绿色、安全、健康的网络环境。微信方面明确表示,将坚决抵制任何利用微信实施恶意行为或损害他人合法权益的举动,特别是针对非法使用外挂软件的行为。 据微信团队介绍,外挂软件不仅破坏了微信平台的正常运营秩序,还对正常使用微信的用户造成了严重骚扰。这些外挂软件存在多重风险,包

  • 最强Agent?3分钟看懂Kimi K2真的好用吗?

    Moonshot AI于2025年7月11日发布开源大模型Kimi K2,主打代码编写、数学推理和Agent工具调用功能。该模型采用MoE架构(1T参数,激活32B),在SWE-Bench等测试中表现优异,数学推理得分达97.4。支持128k上下文、工具调用和API集成,定价为输入4元/百万tokens、输出16元/百万tokens。相比闭源模型,Kimi K2具有开源免费、成本低等优势,适合开发者和企业使用。同时推荐AIbase平台,可系统比较�

  • 小米YU7用骁龙8 Gen3、纸巾盒卖169元争议不断:到底啥是车规级!

    近段时间大家讨论最多的可能就是车规级这三个字,一个是小米YU7用骁龙8 Gen3(手机用的芯片),而另外一个是YU7磁吸纸巾盒卖169元(雷军称车规级成本巨高)。 所谓的 车规级” 简单来说,就是汽车上用到的可靠的零配件,但它们却并不简单。车规级” 零部件、材料或系统,必须符合汽车行业特定的严格质量、可靠性、安全性和环境适应性标准,能够满足汽车在恶劣、复杂