ChatGPT中有这样一个核心训练方法,名叫“人类反馈强化学习(RLHF)”。
它可以让模型更安全、输出结果更遵循人类意图。
现在,来自谷歌Research和UC伯克利的研究人员发现,将该方法用在AI绘画上,“治疗”图像跟输入不完全匹配的情况,效果也奇好——
可以实现**高达47%**的改进。
△ 左为Stable Diffusion,右为改进后效果
这一刻,AIGC领域中两类大火的模型,似乎找到了某种“共鸣”。
如何将RLHF用于AI绘画?
RLHF,全称“Reinforcement Learning from Human Feedback”,是OpenAI和DeepMind于2017年合作开发的一种强化学习技术。
正如其名,RLHF就是用人类对模型输出结果的评价(即反馈)来直接优化模型,在LLM中,它可以使得“模型价值观”更符合人类价值观。
而在AI图像生成模型中,它可以让生成图像与文本提示得到充分对齐。
具体而言,首先,收集人类反馈数据。
在这里,研究人员一共生成了27000余个“文本图像对”,然后让一些人类来打分。
为了简单起见,文本提示只包括以下四种类别,分别关乎数量、颜色、背景和混合选项;人类的反馈则只分“好”、“坏”与“不知道(skip)”。
登录后可查看完整内容,参与讨论!
立即登录