#139 · 主分类: 图像生成

rich-text-to-image

computer-vision diffusion-models pytorch rich-text text-to-image-generation

富文本到图像生成

项目最后更新:10/09/23

GitHub Stars

801

Forks数量

70

贡献者数量

3

许可证

MIT

收录理由

用过 Stable Diffusion 长提示词的人,多半都经历过这种拉扯:想让某个概念更突出,另一个弱化,只能反复改写整段提示词。这个项目提供了一种更直接的杠杆——把字体大小、颜色、样式和脚注这些排版信息本身变成生成的控制信号。你不再需要重写提示词,而是通过格式化文本来显式调整 token 权重、锁定精确颜色、控制局部风格,甚至细化区域合成。代码支持 Stable Diffusion v1-5 和 SD-XL,HuggingFace 上还有在线演示,另外配套的 A1111 WebUI 扩展也让非研究者能轻松上手。项目源自 UMD、Adobe 和 CMU 合作的 ICCV 2023 论文,对于已经在 Stable Diffusion 生态里做开发的团队来说,它展示了如何利用排版元数据来驱动扩散模型的条件控制,是一个很有参考价值的实现。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目