GitHub Stars
1.2K
Forks数量
64
贡献者数量
8
许可证
Apache-2.0
收录理由
Punica 面向那些在同一个基础模型上维护大量 LoRA 微调变体、又不想为每个变体单独支付显存和算力代价的团队。它只在 GPU 显存中保留一份预训练权重,并通过自定义的 CUDA 内核 SGMV 在单次前向传播中同时处理所有适配器的请求,让那些微调后的小矩阵几乎不产生额外开销。这样一来,某个微调变体的请求几乎不会拖慢其他变体,因为共享的主干网络依然能享受原有的批处理加速效果。论文中的微基准测试显示,相比用 Hugging Face Transformers 或 vLLM 这类常见框架分别部署每个适配器,Punica 的吞吐量有显著提升;仓库还附带了一个交互式演示,可以在同一个界面上同时运行多个 LoRA 模型。如果你正在单张 GPU 上运营许多专用的低秩适配器,建议仔细阅读论文,并根据自己的负载实测一下内核开销与吞吐之间的权衡是否合适。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。