#159 · 主分类: 推理与本地部署

OpenArc

agentic-ai fastapi inference-engine openvino-genai openvino-toolkit optimum-intel transformers

面向英特尔设备的推理引擎。通过OpenAI端点服务LLM、VLM、Whisper、Kokoro-TTS、Embedding和Rerank模型。

项目最后更新:08/22/26

GitHub Stars

512

Forks数量

45

贡献者数量

13

许可证

Apache-2.0

收录理由

对于在英特尔硬件上运行开源模型、又希望数据不落在云端 API 的团队,OpenArc 是一个相当实在的单一服务。它用 OpenVINO 在 CPU、GPU 和 NPU 上做加速,对外提供兼容 OpenAI 的接口,覆盖语言模型、视觉模型、语音识别、语音合成、嵌入和重排序等多种能力。你不需要把好几个独立服务拼接起来,直接把现有的 OpenAI 客户端指向这个异步服务即可,它支持同时加载多个模型,还实现了投机解码、多 GPU 流水线并行和 CPU 卸载。项目目前仍处于活跃开发中,不过功能清单很具体,附带的基准测试能帮你横向比较不同设备配置下的延迟和吞吐,这一点非常实用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目