#176 · 主分类: 推理与本地部署

llama2-webui

llama-2 llama2 llm llm-inference

在本地运行任意 Llama 2,通过 gradio UI 在 GPU 或 CPU 上,支持 Linux/Windows/Mac。使用 `llama2-wrapper` 作为你的本地 llama2 后端,用于生成式代理/应用。

项目最后更新:03/22/24

GitHub Stars

1.9K

Forks数量

199

贡献者数量

10

许可证

MIT

收录理由

llama2-webui 把 Gradio 聊天界面和兼容 OpenAI 的 API 直接绑在本地 Llama 2 后端上,装好就能拿到一个能用的服务端点,省去自己拼装模型加载、提示词处理和前端界面的功夫。它在 Linux、Windows、macOS 上都能跑,支持从 7B 到 70B 的 Llama 2 主要版本,涵盖 Hugging Face、GPTQ、GGML、GGUF 这些格式。用哪个后端(transformers、bitsandbytes 8-bit、AutoGPTQ 4-bit 或 llama.cpp)通过环境文件就能切换,换机器时不用改代码,从带强力 GPU 的台式机挪到只有 CPU 的笔记本也很方便。项目还附带一个 Code Llama 补全界面,想要代码填充而不是聊天的人可以直接用。另外,pip 包 llama2-wrapper 让应用或智能体对接同一个本地模型,API 接口模仿 OpenAI 的风格,以后要是想换用托管的模型服务,改动量很小。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目