#153 · 主分类: 推理与本地部署
Jlama
Jlama 是一个面向 Java 的现代 LLM 推理引擎
项目最后更新:10/12/25
GitHub Stars
1.3K
Forks数量
164
贡献者数量
21
许可证
Apache-2.0
收录理由
想要在Java环境中直接运行大模型推理的团队,可以把Jlama作为Maven依赖引入,获得一个纯Java实现的完整推理引擎。它支持从Hugging Face加载safetensors格式的模型,涵盖Llama、Mistral、Gemma、Qwen和BERT等系列,Q4/Q8量化让模型在普通硬件上也能流畅运行。除了文本生成,它还实现了分页注意力、专家混合路由、工具调用以及嵌入和分类推理,不只是一个演示项目。通过命令行工具和兼容OpenAI的REST API,你可以先在本地做原型验证,再把同一套引擎嵌入生产环境;当单机算力不足时,可选的分布式推理模式也能派上用场。对于已经使用LangChain4j的团队,它还提供了现成的集成。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。