#661 · 主分类: AI代理与自动化

agent-vision-toolkit

agent agent-skills claude-code codex computer-use deepseek dsh-plugin glm harness-engineering multimodal opencode text-only-llm vision vision-language-model

面向纯文本LLM的视觉工具包和技能,支持图像问答、OCR、UI恢复和GUI自动化,并与Codex、Claude Code、Pi、Oh My Pi和OpenCode无缝集成。

项目最后更新:08/27/26

GitHub Stars

1.1K

Forks数量

38

贡献者数量

7

许可证

MIT

收录理由

许多团队在用 DeepSeek 这类纯文本模型跑编码代理时,一旦对话里出现图片就会卡住,因为模型本身没有视觉能力。这个项目把视觉能力从模型里挪到工具层,提供命令行工具和配套技能,让代理知道该调用哪个命令来处理图片问答、长截图 OCR、前端 UI 还原以及 GUI 自动化。它还附带一个小型本地代理和单文件原生插件,粘贴图片或使用内置图像工具时,能直接适配 Codex、Claude Code、Pi、Oh My Pi 和 OpenCode,无需额外提示。这样既能保留纯文本模型的低成本优势,代理依然能读取整页截图、把设计稿重建成可用的 HTML,或者一步步操作桌面界面。项目自带的 playbook 记录了真实的验证流程,代理会按照经过验证的操作顺序执行,而不是凭模糊描述临场发挥。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目