#269 · 主分类: 计算机视觉

vlmrun-hub

ai computer-vision etl genai json multimodal pydantic pydantic-models vlm vlm-ocr

用于VLM的各种行业特定模式中心。

项目最后更新:12/15/25

GitHub Stars

555

Forks数量

25

贡献者数量

12

许可证

Apache-2.0

收录理由

做文档或图像信息抽取的团队,往往要自己手写Pydantic模型,再拿真实数据反复调试,费时费力。VLM Run Hub把这一步省掉了:它内置了一批现成的结构化模型,覆盖发票、收据、驾照、护照、银行对账单、医保卡,甚至体育比赛状态等常见场景。把图片丢给视觉语言模型,拿到的就是经过校验、类型明确的输出,而不是一段自由文本。这些模型与具体厂商无关,同一套定义既能用在OpenAI、Gemini,也能接其他支持结构化输出的服务,或者配合VLM Run SDK、Instructor这类客户端使用。如果你在做文档处理、会计自动化,或者其他视觉ETL流程,这些开箱即用的领域模型是个很实在的起点;而且目录格式清晰,后续需要新增什么类型,也方便自己贡献进去。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目