#153 · 主分类: 推理与本地部署

Jlama

ai genai gpt huggingface java llama llm openai simd transformers

Jlama 是一个面向 Java 的现代 LLM 推理引擎

项目最后更新:10/12/25

GitHub Stars

1.3K

Forks数量

164

贡献者数量

21

许可证

Apache-2.0

收录理由

想要在Java环境中直接运行大模型推理的团队,可以把Jlama作为Maven依赖引入,获得一个纯Java实现的完整推理引擎。它支持从Hugging Face加载safetensors格式的模型,涵盖Llama、Mistral、Gemma、Qwen和BERT等系列,Q4/Q8量化让模型在普通硬件上也能流畅运行。除了文本生成,它还实现了分页注意力、专家混合路由、工具调用以及嵌入和分类推理,不只是一个演示项目。通过命令行工具和兼容OpenAI的REST API,你可以先在本地做原型验证,再把同一套引擎嵌入生产环境;当单机算力不足时,可选的分布式推理模式也能派上用场。对于已经使用LangChain4j的团队,它还提供了现成的集成。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目