#173 · 主分类: 推理与本地部署

punica

large-language-models llm lora

将多个LoRA微调的LLM整合为单一服务

项目最后更新:05/08/24

GitHub Stars

1.2K

Forks数量

64

贡献者数量

8

许可证

Apache-2.0

收录理由

Punica 面向那些在同一个基础模型上维护大量 LoRA 微调变体、又不想为每个变体单独支付显存和算力代价的团队。它只在 GPU 显存中保留一份预训练权重,并通过自定义的 CUDA 内核 SGMV 在单次前向传播中同时处理所有适配器的请求,让那些微调后的小矩阵几乎不产生额外开销。这样一来,某个微调变体的请求几乎不会拖慢其他变体,因为共享的主干网络依然能享受原有的批处理加速效果。论文中的微基准测试显示,相比用 Hugging Face Transformers 或 vLLM 这类常见框架分别部署每个适配器,Punica 的吞吐量有显著提升;仓库还附带了一个交互式演示,可以在同一个界面上同时运行多个 LoRA 模型。如果你正在单张 GPU 上运营许多专用的低秩适配器,建议仔细阅读论文,并根据自己的负载实测一下内核开销与吞吐之间的权衡是否合适。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目