#105 · 主分类: 推理与本地部署
lorax
fine-tuning
gpt
llama
llm
llm-inference
llm-serving
llmops
lora
model-serving
pytorch
transformers
多LoRA推理服务器,可扩展到数千个微调LLM
项目最后更新:05/28/26
GitHub Stars
3.8K
Forks数量
326
贡献者数量
67
许可证
Apache-2.0
收录理由
多数团队微调出多个模型变体后,往往得为每个版本单独部署一套服务,开销很快变得难以承受。LoRAX 换了一种思路:只运行一个基础模型,根据每个请求按需从 Hugging Face 或自己的存储加载 LoRA 适配器权重,这样上千个微调变体可以共用一块 GPU。它把不同适配器的请求合批处理,并动态地在显存与内存之间调度适配器,从而维持接近稳定的吞吐与延迟。同时支持量化基础模型和流式输出,兼容 OpenAI 的 API 也便于融入现有服务架构。如果你的场景是共享一个基础模型、对外提供大量微调版本,这个工具能在不牺牲速度的前提下切实降低账单。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。