#661 · 主分类: AI代理与自动化
agent-vision-toolkit
面向纯文本LLM的视觉工具包和技能,支持图像问答、OCR、UI恢复和GUI自动化,并与Codex、Claude Code、Pi、Oh My Pi和OpenCode无缝集成。
项目最后更新:08/27/26
GitHub Stars
1.1K
Forks数量
38
贡献者数量
7
许可证
MIT
收录理由
许多团队在用 DeepSeek 这类纯文本模型跑编码代理时,一旦对话里出现图片就会卡住,因为模型本身没有视觉能力。这个项目把视觉能力从模型里挪到工具层,提供命令行工具和配套技能,让代理知道该调用哪个命令来处理图片问答、长截图 OCR、前端 UI 还原以及 GUI 自动化。它还附带一个小型本地代理和单文件原生插件,粘贴图片或使用内置图像工具时,能直接适配 Codex、Claude Code、Pi、Oh My Pi 和 OpenCode,无需额外提示。这样既能保留纯文本模型的低成本优势,代理依然能读取整页截图、把设计稿重建成可用的 HTML,或者一步步操作桌面界面。项目自带的 playbook 记录了真实的验证流程,代理会按照经过验证的操作顺序执行,而不是凭模糊描述临场发挥。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。