#今日论文推荐#文本生成图像新“天花板”?谷歌研究人员研发图像生成器Imagen,评分超OpenAI同类模型

#今日论文推荐#文本生成图像新“天花板”?谷歌研究人员研发图像生成器Imagen,评分超OpenAI同类模型

当前,多模态学习成为 AI 的热门技术趋势之一,尤其是在文本生成图像的应用方面。前不久,OpenAI 开发了升级版的 DALL-E 2,不仅可以将文字转换成具有高分辨率与低延迟的真实图像,还能对所生成的图像进行二次的编辑。近日,谷歌研究(Google Research)推出了一个具有类似功能的图像生成器“Imagen”,其能够根据输入的文字描述生成油画、照片、绘制和 CGI 渲染图像。值得一提的是,相比 OpenAI 的 DALL-E 2,Imagen 所带来的图像真实感更强,对于语言理解的准确度也更高。

据了解,谷歌通过引入测试基准 DrawBench,对 Imagen、DALL-E 2、VQ-GAN+CLIP和 LDM(Latent Diffusion Models)几类模型进行了深入地评估与对比。结果得出,无论是在样本质量还是图文对齐方面,Imagen 的评分都位居第一。

例如,DALL-E 2 在面对一些同时出现两个颜色的文本时表现不佳,而 Imagen 可以很好地应对这些情况。此外,当文本中出现有位置和效果指向的具体字样时,Imagen 也比 DALL-E 2 的表现更好。

论文题目:Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
详细解读:https://www.aminer.cn/research_report/62957a157cb68b460fc66ffe?download=falseicon-default.png?t=M4ADhttps://www.aminer.cn/research_report/62957a157cb68b460fc66ffe?download=false
AMiner链接:https://www.aminer.cn/?f=cs

你可能感兴趣的:(深度学习,transformer,深度学习,计算机视觉)