Parrot提出新型多重奖励强化学习框架以改进文本生成图像

2024-01-15 17:41 · 稿源：站长之家

**划重点:**
- 🔄 **多奖励优化:** Parrot是一种用于文本生成图像的多重奖励强化学习（RL）框架，采用联合优化方法，有效解决了奖励过度优化和降级问题。
- 📊 **质量度量改进:** 与使用单一奖励模型相比，Parrot框架在美学、图像情感和人类喜好等多个质量指标上取得了显著改进。
- 🌐 **伦理关切:** 尽管Parrot在提高图像质量方面取得了成功，但其对现有度量的依赖存在一定限制，并引发了对其潜在生成不当内容的伦理关切。

站长之家（ChinaZ.com）1月15日消息:在使用强化学习（RL）进行文本生成图像(T2I)时，质量奖励成为一个紧迫问题。尽管观察到通过强化学习RL可能提高图像质量，但多个奖励的聚合可能导致在某些度量中过度优化而在其他度量中降级。手动确定最佳权重变得困难，因此需要一种在RL中联合优化多个奖励的有效策略。

已提出各种T2I生成模型，如使用LLMs的稳定扩散模型，利用潜在文本表示。在评估生成的图像质量时，考虑了多个质量度量，包括美学、人类偏好、图像文本对齐和图像情感。RL微调通过将去噪视为多步决策任务，在人类偏好学习方面表现出优越性。其中一个例子是Promptist，它使用对齐和美学分数作为奖励，对提示扩展模型进行微调。然而，它在联合微调T2I模型方面表现不足，限制了其适应图像生成任务的能力。

谷歌DeepMind和OpenAI的研究人员与Rutgers University和Korea University合作提出了Parrot，这是一种新颖的T2I生成的多重奖励RL框架，采用联合优化方法，用于T2I模型和提示扩展网络，以增强生成质量感知的文本提示。该方法在推断时引入了原始的以提示为中心的指导，以抵消对原始提示的潜在遗忘。

Parrot使用奖励特定标识符引入偏好信息，自动确定每个奖励目标的重要性。在Promptist数据集上进行了提示扩展网络的监督微调，用于RL训练。基于稳定扩散1.5的JAX版本的T2I模型使用LAION-5B数据集进行预训练。使用策略梯度算法实现对RL T2I扩散模型的微调，将去噪过程视为马尔可夫决策过程。

与使用单一奖励模型相比，该框架还改善了多个质量指标，如美学、图像情感和人类喜好。其原始的以提示为中心的引导有效解决了通过添加上下文而压倒主要内容的问题，从而生成了忠实于原始提示并包含视觉上令人愉悦的细节的图像。

尽管Parrot在有效性上表现出色，但对现有度量的依赖存在限制，强调了对进展的需求。Parrot对更广泛奖励的适应性提高了其在量化图像质量方面的适用性。但在Parrot潜在生成不当内容的能力方面引发了伦理关切，强调了在部署中进行审查和伦理考虑的必要性。

论文网址:https://arxiv.org/abs/2401.05675

（举报）

相关推荐
大家在看

关键词：

【腾讯云】11.11云上盛惠！云服务器首年1.8折起，买1年送3个月！

11.11云上盛惠！海量产品 · 轻松上云！云服务器首年1.8折起，买1年送3个月！超值优惠，性能稳定，让您的云端之旅更加畅享。快来腾讯云选购吧！

Docker容器镜像
去看看

Docker容器镜像 60元/15天

爆款产品组合购
去看看

爆款产品组合购低至1元

腾讯云x NVIDIA加速计划
去看看

腾讯云x NVIDIA加速计划最高获赠10万元扶持基金

2核2G云服务器
去看看

2核2G云服务器 112元/1年

查看更多相关信息>>

腾讯云 12-20

广告
InstantStyle: 文本生成图像格参考，用于SD保持风格一致

InstantStyle是一个通用框架，旨在在文本到图像生成过程中实现风格与内容的有效分离。该框架采用了两种简单但强大的技术，以实现对风格和内容的有效解耦。InstantStyle还将继续改进和扩展，为用户提供更多功能和选择，助力他们在图像生成领域取得更大的成功。

InstantStyle AI头条
商汤科技提出FouriScale 实现生成图像尺寸、分辨率自由

来自香港中文大学-商汤科技联合实验室等机构的研究者们提出了FouriScale，旨在通过一种全新方法实现生成图像的尺寸和分辨率自由。扩散模型因其卓越的性能，已逐渐超越GAN和自回归模型，成为生成式模型的主流选择。定量和定性的实验对比表明，FouriScale能够在不同预训练模型，不同分辨率下都能够保证更高的图像生成质量。

FouriScale AI头条
Meta 推出 ViewDiff 模型：文本生成多视角 3D 图像

Meta与德国慕尼黑工业大学研发出创新模型ViewDiff，旨在帮助用户通过文本、图像或二者结合使用，快速生成高质量多视角3D图像。该模型解决了传统文本生成多视角3D图像领域的三大难点:无法生成真实背景环境、图像质量和多样性不理想、缺乏多视角和一致性。该模型的推出不仅在技术层面上具有重大意义，也将为未来的3D图像生成领域带来更多创新可能。

ViewDiff AI头条
CameraCtrl：让文本生成视频实现镜头控制支持AnimateDiff控制镜头

随着人工智能技术的发展，视频生成领域取得了长足的进步。在现有的文本到视频生成模型中，对镜头姿势的精确控制往往被忽视镜头姿势在视频生成中扮演着表达更深层叙事细微差别的影视语言角色。这一技术的应用前景广阔，有望在视频生成领域发挥重要作用。

CameraCtrl AI头条
荐文本生成3分钟44.1 kHz 音乐，Stable Audio 2.0重磅发布！

4月4日，著名开源大模型平台Stability.ai在官网正式发布了，音频模型StableAudio2.0。StableAudio2.0支持用户通过文本或音频，一次性可生成3分钟44.1kHz的摇滚、爵士、电子、嘻哈、重金属、民谣、流行、乡村等20多种类型的高质量音乐。StableAudio2.0免费赠送20积分，生成的音乐可以商业化，这对于抖音、快手、B站的视频自媒体用户来说挺有帮助的。

StableAudio
Mixtral-8x22B官网体验入口语言模型文本生成工具使用指南

Mixtral-8x22B是一个预训练的生成式稀疏专家语言模型，由MistralAI团队开发。该模型拥有141B个参数，支持多种优化部署方式，旨在推进人工智能的开放发展。

Mixtral-8x22B
文本生成8K、360度全景世界！Model 3重磅发布

知名生成式AI平台BlockadeLabs在官网重磅发布了全新模型——Model3。与Model2相比，Model3的生成效果实现质的提升，原生支持超高清8192x4096分辨率，增强了文本提示器能更好的描述生成世界，并且大幅度减少了生成世界的灰度值，使建筑、风景、人物等看起来更加高清、细腻。经过一年多的技术创新与业务积累，Blockade的用户超过150万，生成的作品超过1000万，成为很多游戏开发工作室、3D建模等常用工具，尤其是与Unity开发引擎集成后，迎来了一波用户增长高峰。

Model3 AI头条 AI模型
Photoshop测试版推出AI图像生成功能：用户仅需提供简单文本

AdobePhotoshop的最新测试版现已引入一项革命性的功能，允许用户通过简单的文本提示，利用人工智能技术生成图像。该功能的核心在于Adobe新发布的生成式AI模型系列FireflyImage3。包括谷歌和微软在内的多家科技巨头都在AI领域取得了显著的进展和突破。
Meta推新框架OPT2I 提高SD图像生成一致性

Meta公司最近推出了一款名为OPT2I的新框架，该框架利用大型语言模型来提高SD图像从提示词到图像的生成过程中的一致性。OPT2I是一个优化框架，旨在提升T2I模型中的提示-图像一致性。OPT2I框架为提高T2I模型的提示-图像一致性提供了一种新的有效方法。

Meta AI头条
北大字节提出图像生成新范式VAR 超越Sora核心组件DiT

北大与字节跳动AILab联合提出了一种图像生成新范式——VAR，这一新方法的核心在于预测下一级分辨率非传统的预测下一个token。VAR的提出不仅在图像生成质量上超越了Sora的核心组件DiffusionTransformer在推理速度上也实现了20倍以上的提升。VAR的开源也体现了学术界与工业界合作的积极成果，有助于推动整个AI领域的发展和创新。

VAR AI头条

今日大家都在搜的词：

热文

3 天
7天

Parrot提出新型多重奖励强化学习框架以改进文本生成图像

今日大家都在搜的词：

热文

站长商机