首页 > 业界 > 关键词  > AI最新资讯  > 正文

麻省理工学院AI图像生成系统让《DALL-E 2》等模型散发出创意

2022-09-25 15:49 · 稿源: cnbeta

随着DALL-E的问世,互联网迎来了一个集体感觉良好的时刻。这个基于人工智能的图像生成器的灵感来自于艺术家萨尔瓦多-DALL-E和动画电影中可爱的机器人瓦力,它使用自然语言来生成你心中想要的任何神秘而美丽的图像。看到打出的输入信息,如"拿着冰激凌甜筒的微笑地鼠",机器的灵感瞬间涌现出来,这种生动的人工智能生成的图像显然得到了世界的共鸣。

DALL-E 2使用了一种叫做扩散模型的概念,它试图将整个文本编码为一个描述来生成一个图像。然而,一旦文本有了更多的细节,单一的描述就很难捕捉到它的全部。此外,虽然它们高度灵活,但扩散模型有时很难理解某些概念的构成,例如混淆不同对象之间的属性或关系。

这个生成的图像阵列,显示了"桥上的火车"和"桥下的河流",是使用麻省理工学院研究人员开发的新方法生成的。

为了生成具有更好理解力的更复杂的图像,来自麻省理工学院计算机科学和人工智能实验室(CSAIL)的科学家们从不同的角度对典型的模型进行了结构化设计:他们将一系列的模型加在一起,按照输入文本或标签的要求,合作生成捕捉多个不同方面的理想图像。要创建一个有两个组成部分的图像,比如说,由两句描述组成的图像,每个模型将处理图像的一个特定组成部分。

图像生成背后看似神奇的模型通过建议一系列的迭代完善步骤来达到所需的图像。它从一张"糟糕"的图片开始,然后逐渐细化,直到成为选定的图像。通过将多个模型组合在一起,它们在每个步骤中共同完善外观,所以结果是一个展现每个模型所有属性的图像。通过让多个模型合作,你可以在生成的图像中得到更多的创造性组合。

这个生成的图像阵列,显示了"一条通向山脉的河流"和"边上的红树"

以一辆红色卡车和一座绿色房子为例。当这些句子变得非常复杂时,模型会混淆红色卡车和绿色房子的概念。像《DALL-E 2》这样的典型生成器可能会把这些颜色调换一下,做成绿色卡车和红色房子。该团队的方法可以处理这种类型的属性与物体的绑定,特别是当有多组东西时,它可以更准确地处理每个物体。

"该模型可以有效地对物体位置和关系描述进行建模,这对现有的图像生成模型来说是一个挑战。例如,把一个物体和一个立方体放在某个位置,把一个球体放在另一个位置。DALL-E 2善于生成自然图像,但有时难以理解物体关系,"麻省理工学院CSAIL博士生和共同主要作者Li Shuang说。"除了艺术和创意,也许我们可以把我们的模型用于教学。如果你想告诉孩子把一个立方体放在一个球体的上面,如果我们用语言这么说,他们可能很难理解。但我们的模型可以生成图像并向他们展示。"

让DALL-E感到自豪

可组合扩散--该团队的模型--将扩散模型与组合运算符一起使用,无需进一步的训练就能组合出文字描述。该团队的方法比原始扩散模型更准确地捕捉文本细节,后者直接将文字编码为一个长句。例如,给定"粉红色的天空"和"地平线上的一座蓝色的山"和"山前的樱花",该团队的模型能够准确地生成该图像,而原始的扩散模型使天空变成蓝色,山前的一切变成粉红色。

研究人员能够用"一只狗"和"天空"的文字创造出一些令人惊讶的、超现实的图像。左边出现的是一只狗和云,下面标有"狗"和"天空",右边出现的是两张像云一样的狗的图像,下面标有"狗和天空"。

"我们的模型是可组合的,这意味着你可以学习模型的不同部分,一次一个。你可以先学习另一个物体上面的一个物体,然后学习另一个物体右边的一个物体,再学习另一个物体左边的东西,"共同主要作者、麻省理工学院CSAIL博士生Du Yilun说。"由于我们可以将这些东西组合在一起,你可以想象我们的系统使我们能够逐步学习语言、关系或知识,我们认为这是未来工作的一个相当有趣的方向。"

虽然这种方法在生成复杂、逼真的图像方面表现出了优势,但它仍然面临着挑战,因为该模型是在比《DALL-E 2》这样的数据集小得多的基础上训练的。

现在,可压缩扩散可以在生成模型的基础上工作,如DALL-E 2,研究人员准备探索持续学习作为潜在的下一步。鉴于通常会有更多的东西被添加到物体关系中,他们想看看扩散模型是否可以开始"学习",而不会忘记以前学过的知识--达到模型可以用以前和新的知识生成图像的程度。

MIT-Composable-Diffusion-Generated-Images.jpg

这幅照片插图是用麻省理工学院的一个名为"可组合扩散"的系统生成的图像制作的,并在Photoshop中排列。像"扩散模型"和"网络"这样的短语被用来生成粉红色的点和几何角度的图像。短语"一匹马和一片黄花地"被包含在图像的顶部。左边是生成的马和黄土地的图像,右边是黄花地里的马的组合图像。资料来源:Jose-Luis Olivares, MIT和研究人员

"这项研究提出了一种在文本-图像生成中合成概念的新方法,不是通过串联它们来形成提示,而是通过计算与每个概念有关的分数,并使用连接和否定运算符来合成它们,"Mark Chen说。他是DALL-E 2的共同创造者,也是OpenAI的研究科学家。"这是一个很好的想法,它利用了扩散模型的基于能量的解释,因此,围绕着使用基于能量的模型的组合性的旧想法可以被应用。该方法还能够利用无分类器的指导,令人惊讶的是,它在各种构成性基准上的表现优于GLIDE基线,并能在质量上产生非常不同的图像生成类型。"

"人类可以以无数种方式组成包括不同元素的场景,但这项任务对计算机来说是具有挑战性的,"Adobe Systems的研究科学家Bryan Russel说。"这项工作提出了一个优雅的表述,它明确地组成了一组扩散模型,以生成一个给定的复杂自然语言提示的图像。"

举报

  • 相关推荐
  • 微信AI不打算接管一切

    如果要在国内大厂里选一个“AI掉队生”,很多人会选腾讯。 模型声量和影响力远不如阿里字节,元宝的用户规模追不上豆包,混元的行业口碑相比千问存在很大距离。 直到2026年6月,作为腾讯最大王牌的微信有了实质性动作。 6月8日起,腾讯正式开放AI生态接入能力,并向开发者发布了“小程序AI开发模式”的接入指引。 首批内测名单包含多家头部平台。目前已官宣接�

  • 吴克华:从内容生成到商业闭环,宙包AI如何让AI真正走进千行百业

    通用大模型竞赛趋缓,产业焦点转向AI如何赋能实体。源之宇宙创始人吴克华认为,AI竞争重心正从模型层转向应用层,关键在于打通从内容生成到可交互、可消费的商业闭环。其自研的“宙包AI”垂类模型,能通过文字直接生成可运行的程序与交互剧情,并推出MaaS合作模式降低产业伙伴的技术门槛。目前,该技术已在文旅、社交等领域落地,打造了如泉州“宇宙大派对”全城AI剧本游等案例。公司计划年内推出英文版,一年内完成全球覆盖,推动国产AI模型走向世界。

  • 模型打底、千问办公上桌,阿里再战 AI 局

    中国AI大模型的参数竞赛,已经进入到万亿规模时代。 8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8,核心旗舰模型为Qwen3.8-Max,总参数达2.4万亿、单次激活95B、1M上下文长度、支持视觉理解。 就在Qwen3.8发布的同一周,Kimi K3以2.8万亿参数强势开源,MiniMax的M3Pro也达到2万亿参数级别,并传出即将开源的消息。 此外,包括DeepSeek V4Pro、文心5.0、MiMo-V2.5-Pro、LongCat-2.0等国产AI�

  • AI日报:OpenAI取消ChatGPT文本聊天限制;小米智能摄像机4 Max AI变焦版开售;Suno 宣布给AI歌曲加水印

    OpenAI取消ChatGPT限制并推出GPT-5.6模型;小米摄像机4 Max AI版内置大模型开售;火山引擎Seedance2.5 API升级视频生成;Suno为AI歌曲加水印并面临版权诉;宇树IPO DeepSeek获配93万股;OpenAI甜甜圈造型硬件2027年发布;谷歌离线翻译器Gemma Translator跑51亿参数,树莓派实现不联网跨语言对话;影石GO Ultra接入千问与Gemini成为AI语音入口。

  • 从角色还原到IP合规:盘点靠谱的游戏二创AI软件

    热门游戏的庞大二创生态,因AI视频工具迎来效率飞跃,但行业门槛也变得更高。核心难点在于:角色需高度还原、画风要统一、场景细节到位、剧情能讲通,以及最关键的是获得IP合规授权。市面上工具侧重不同:Updream强在官方IP与系列化工作流;即梦擅长创意特效单条爆款;剪映在后期剪辑与模板;小云雀则面向MCN团队批量化生产。选工具的前提是,先想清楚自己到底要什么。

  • 技嘉推出钛金雕1600PG5 AI TOP电源:为发烧级主机与本地AI算力打造旗舰供电方案

    技嘉发布钛金雕1600PG5 AI+TOP电源,额定1600W,仅16厘米机身,实现80PLUS钛金能效与高功率密度。支持ATX 3.1/PCIe 5.1,采用GaN技术与服务器级元件,内置LCD监控屏。专为旗舰游戏主机与本地AI运算平台打造,可撑持四张旗舰显卡并行,预留充足升级余量,兼顾紧凑机体与强劲供电。

  • 红熊AI发布记忆驱动AGI全栈,开辟AI记忆赛道

    红熊AI发布“记忆科学”全栈生态,其记忆引擎MemoryBear在全球两大权威基准LoCoMo和LongMemEval中双榜登顶,刷新SOTA。该引擎通过类人脑的三级记忆管理,根治大模型“天才健忘症”,并深度耦合自研的OpenBear与CodeBear大模型,推出四大原生Agent应用。公司启动“B+C”双轮驱动战略,已构建从底层架构到上层业务的全栈闭环,在十余个行业落地。CEO温德亮指出,AI记忆是真正的商业壁垒,记忆系统将成行业新分水岭。公司已完成数亿元A+轮融资,估值近30亿元。

  • AI日报:DeepSeek将上调API价格;美图上线AI平台MeituHub;小红书将全面加码 AI

    DeepSeek宣布上调API服务价格,进入商业化动态调整期;美图推出AI影像全链路生产平台MeituHub;小红书全面加码AI社交,成立一级部门加速布局;MiniMax纳入港股通并涨超17%,开源新一代多模态生成模型;百度整合AI办公智能体,推进知识沉淀与流程执行;达摩院启动“阿里星”招募,开放15项前沿课题;OpenAI披露智能体可自主越权并协同攻击;字节张一鸣强调AI研发坚持长期主义,拒绝“AI蒸馏”。

  • AI古偶,躺着吸粉

    很多年初还对AI演戏相当抵触的人,如今都在沉迷AI古偶。 倒不是AI古偶有什么大踏步的创新,而是AI古偶与长剧古偶有时差。那些在长剧古偶中被批判、被舍弃、被嫌过时的,正在这里发光发热——小太阳、大主母,权谋甜宠、仙侠虐恋。尤其是仙侠,在真人长剧里几乎没人看了,在AI古偶里却能爆剧又爆“人”。

  • 内娱第一人 戚薇开放形象AI授权:开启明星AI商业化新范式

    8月6日,戚薇通过社交平台官宣推出个人官方数字分身,正式开放自身形象的规范化AI授权,其主演的AI漫剧也将上线。这一举动让她成为内娱首个公开开放AI形象授权的艺人。 戚薇的数字分身可被用于AI漫剧、虚拟代言、数字互动等场景。她在官宣中表示,希望通过数字分身探索新的内容形态,也为行业提供一种可参考的AI形象授权模式。律师解读指出,肖像权属于人格权范畴

今日大家都在搜的词: