#15 · 主分类: 图像生成

Sana

diffusion dit linear-transformer nvfp4 pytorch reinforcement-learning sana streaming-video system-algorithm-deisgn text-to-image-generation text-to-video transformers video-generation world-models

SANA:基于线性扩散Transformer的高效高分辨率图像合成

项目最后更新:08/27/26

GitHub Stars

8.9K

Forks数量

715

贡献者数量

23

许可证

Apache-2.0

收录理由

Sana 是 NVIDIA 开源的文生图项目,核心思路是用线性扩散 Transformer 架构在保证画质的同时,把显存和算力需求压到远低于常规扩散模型的水平。它的 0.6B 参数版本能在单张消费级显卡上跑出细节丰富的图像,4-bit 量化后显存占用不到 8GB,意味着小团队不需要租用 H100 集群就能自己训练和微调。仓库内容兼顾了训练与推理的完整流程,还附带可控生成、视频生成、流式生成以及强化学习对齐等配套模型。如果团队想在现有硬件上做接近生产级别的图像合成,这个项目提供了很实在的切入点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目