#128 · 主分类: 推理与本地部署

wllama

llama llamacpp llm wasm webassembly

用于 llama.cpp 的 WebAssembly 绑定 - 在浏览器中实现 LLM 推理

项目最后更新:08/27/26

GitHub Stars

1.2K

Forks数量

119

贡献者数量

9

许可证

MIT

收录理由

wllama 将 llama.cpp 编译成 WebAssembly,让 GGUF 模型完全在用户浏览器里运行,无需搭建任何后端服务。它打包为 npm 包,内置类型完备的 OpenAI 兼容接口,团队若已在使用 chat completions 或 embeddings,迁移到浏览器端推理时几乎不用改动现有代码。当环境支持 WebGPU 时,计算层可以卸载到 GPU 加速,同时涵盖视觉输入与工具调用。推理在 worker 线程中执行,页面不会卡顿;大模型可拆分成多个小文件并行下载,绕开 2GB 的文件大小限制。唯一需要注意的是,多线程模式下必须配置 Cross-Origin-Embedder-Policy 和 Cross-Origin-Opener-Policy 响应头。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目