#94 · 主分类: 计算机视觉

modlens

agent-skills claude-code claude-skills codex cordis deepseek dsh dsh-plugin glm harness harness-engineering hermes-agent image-to-text multimodal ocr openclaw pi-agent text-only-llm vision vision-transformer

全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。

项目最后更新:08/27/26

GitHub Stars

3.8K

Forks数量

110

贡献者数量

1

许可证

MIT

收录理由

DeepSeek 和 GLM 的旗舰聊天模型只认文字,自己读不了图。ModLens 给这类纯文本智能体装上眼睛:把图片直接粘进对话,它就会返回结构化的 JSON,包含完整转写、按阅读顺序排列的版面信息,以及实体和关系列表,让模型能引用它真正看到的内容,而不是靠猜。在 Claude Code、Codex、OpenCode 或 Pi 上,装一个技能文件夹就行;在 DeepSeek Harness 上,加一个插件即可,不需要维护钩子、包装器或代理守护进程。它还能复用你已有的视觉引擎,从免费的 Gemini 密钥到已登录的 Claude Code,自动故障转移地串联起来。如果你的智能体经常处理截图、图表或文档,这是把图像输入接进现有纯文本流程的一条实用路子。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目