#105 · 主分类: 推理与本地部署

lorax

fine-tuning gpt llama llm llm-inference llm-serving llmops lora model-serving pytorch transformers

多LoRA推理服务器,可扩展到数千个微调LLM

项目最后更新:05/28/26

GitHub Stars

3.8K

Forks数量

326

贡献者数量

67

许可证

Apache-2.0

收录理由

多数团队微调出多个模型变体后,往往得为每个版本单独部署一套服务,开销很快变得难以承受。LoRAX 换了一种思路:只运行一个基础模型,根据每个请求按需从 Hugging Face 或自己的存储加载 LoRA 适配器权重,这样上千个微调变体可以共用一块 GPU。它把不同适配器的请求合批处理,并动态地在显存与内存之间调度适配器,从而维持接近稳定的吞吐与延迟。同时支持量化基础模型和流式输出,兼容 OpenAI 的 API 也便于融入现有服务架构。如果你的场景是共享一个基础模型、对外提供大量微调版本,这个工具能在不牺牲速度的前提下切实降低账单。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目