NUWA-Infinity - PROMPT

NUWA-Infinity是微软推出的一个艺术作品生成平台，它能够创作西方油画、自然风景、抽象艺术等多种风格的艺术作品。该平台支持文本到图像、图像到视频、图像外扩等多种创作方法。

数据统计

相关导航

SLD (Self-correcting LLM-controlled Diffusion Models)

SLD是一个自纠正的LLM控制的扩散模型框架，它通过集成检测器增强生成模型，以实现精确的文本到图像对齐。SLD框架支持图像生成和精细编辑，并且与任何图像生成器兼容，如DALL-E 3，无需额外训练或数据。

去噪视觉变换器（Denoising Vision Transformers，DVT）是一种针对视觉变换器（ViTs）的新型噪声模型。通过解剖ViT输出并引入可学习的去噪器，DVT能够提取无噪声的特征，从而在离线应用和在线功能中显著改善基于Transformer的模型的性能。DVT不需要重新训练现有的预训练ViTs，可立即应用于任何基于Transformer的架构。通过在多个数据集上进行广泛评估，我们发现DVT在语义和几何任务中持续显著改善现有的最先进通用模型（例如，+3.84 mIoU）。我们希望我们的研究能够鼓励重新评估ViT设计，特别是关于位置嵌入的天真使用。

MobileDiffusion

MobileDiffusion是一个轻量级的潜在扩散模型,专为移动设备设计,可以在0.5秒内根据文本提示生成512x512高质量图像。相较于其他文本到图像模型,它更小巧(仅520M参数),非常适合在手机上部署使用。它的主要功能包括:1)基于文本生成图像;2)快速生成,0.5秒内完成;3)小巧的参数量,仅520M;4)生成高质量图像。主要使用场景包括内容创作、艺术创作、游戏和App开发等领域。示例使用包括:输入'盛开的玫瑰花'生成玫瑰花图片,输入'金色 retrievier 撒欢跑'生成小狗图片,输入'火星风景,外太空'生成火星图。相较于其他大模型,它更适合在移动设备上部署使用。