#177 · 主分类: 计算机视觉
dsh-vision-toolkit
[dsh]为纯文本模型设计更强大的视觉工具箱:一行安装使用、粘贴图片直接识别、多张图片问答、截图到前端UI还原等|DeepSeek Harness原生集成agent-vision-toolkit:图像问答、长截图OCR、UI还原、grounding、像素差异、Artifacts和Web UI。
项目最后更新:08/29/26
GitHub Stars
842
Forks数量
38
贡献者数量
6
许可证
MIT
收录理由
纯文本模型一旦遇到截图、扫描页或界面原型,就相当于失去了视觉能力。这个工具包为 DeepSeek Harness 的智能体补上了一套可调用的视觉技能:直接粘贴图片就能提问,对长截图做 OCR 识别,把截图还原成前端代码,还能用像素级差异对比界面状态。安装只需一条命令,既支持网页交互也支持无头模式,同一套配置既能用于人工操作,也能跑在自动化流程里。对于在纯文本模型上构建 GUI 自动化、视觉回归检查或文档处理智能体的团队来说,它提供了一条务实的路径,让模型在不更换底层的情况下获得“看”的能力。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。