#139 · 主分类: 图像生成
rich-text-to-image
富文本到图像生成
项目最后更新:10/09/23
GitHub Stars
801
Forks数量
70
贡献者数量
3
许可证
MIT
收录理由
用过 Stable Diffusion 长提示词的人,多半都经历过这种拉扯:想让某个概念更突出,另一个弱化,只能反复改写整段提示词。这个项目提供了一种更直接的杠杆——把字体大小、颜色、样式和脚注这些排版信息本身变成生成的控制信号。你不再需要重写提示词,而是通过格式化文本来显式调整 token 权重、锁定精确颜色、控制局部风格,甚至细化区域合成。代码支持 Stable Diffusion v1-5 和 SD-XL,HuggingFace 上还有在线演示,另外配套的 A1111 WebUI 扩展也让非研究者能轻松上手。项目源自 UMD、Adobe 和 CMU 合作的 ICCV 2023 论文,对于已经在 Stable Diffusion 生态里做开发的团队来说,它展示了如何利用排版元数据来驱动扩散模型的条件控制,是一个很有参考价值的实现。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
stable-diffusion-webui
Stable Diffusion 网页界面
ComfyUI
最强大且模块化的扩散模型GUI、API和后端,具有图形/节点界面。
diffusers
🤗 Diffusers:PyTorch中最先进的扩散模型,用于图像、视频和音频生成。
upscayl
🆙 Upscayl - 适用于 Linux、MacOS 和 Windows 的 #1 免费开源 AI 图像放大工具。
InvokeAI
InvokeAI 是领先的开源创意引擎,专为 Stable Diffusion 设计,提供业界领先的 Web UI,用于生成和编辑视觉媒体。