#159 · 主分类: 推理与本地部署
OpenArc
面向英特尔设备的推理引擎。通过OpenAI端点服务LLM、VLM、Whisper、Kokoro-TTS、Embedding和Rerank模型。
项目最后更新:08/22/26
GitHub Stars
512
Forks数量
45
贡献者数量
13
许可证
Apache-2.0
收录理由
对于在英特尔硬件上运行开源模型、又希望数据不落在云端 API 的团队,OpenArc 是一个相当实在的单一服务。它用 OpenVINO 在 CPU、GPU 和 NPU 上做加速,对外提供兼容 OpenAI 的接口,覆盖语言模型、视觉模型、语音识别、语音合成、嵌入和重排序等多种能力。你不需要把好几个独立服务拼接起来,直接把现有的 OpenAI 客户端指向这个异步服务即可,它支持同时加载多个模型,还实现了投机解码、多 GPU 流水线并行和 CPU 卸载。项目目前仍处于活跃开发中,不过功能清单很具体,附带的基准测试能帮你横向比较不同设备配置下的延迟和吞吐,这一点非常实用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。