#867 · 主分类: AI代理与自动化

OmAgent

agent chatbot gemini gpt gpt4 gradio language-agent large-language-models llama llava llm multimodal multimodal-agent openai python rag smart-hardware vision-and-language vlm workflow

[EMNLP-2024] 构建多模态语言代理,实现快速原型和生产部署

项目最后更新:03/19/25

GitHub Stars

2.7K

Forks数量

292

贡献者数量

26

许可证

Apache-2.0

收录理由

OmAgent 是一个面向团队的 Python 库,用来构建能处理图像、视频和音频的智能体,而不只是文本。它的设计把复杂的底层工作——比如工作器编排、任务队列、节点优化——都封装在简洁的接口后面,让你能快速定义并运行一个智能体,之后再考虑扩展问题。多模态能力是原生集成的,不是事后补丁:支持 VLM 后端、视频处理管线、实时 API 和移动设备连接,如果你不想依赖云端接口,还可以通过 Ollama 或 LocalAI 指向本地部署的模型。仓库里还附带 ReAct、CoT 等推理策略,方便你在同一任务上对比不同方案;Lite 模式则免去了中间件部署,适合快速原型验证。对于想从纯文本聊天机器人转向多模态助手的开发者,里面提供的示例是个不错的起点。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目