#198 · 主分类: 计算机视觉

AViD

用于在自定义数据集上微调视觉-语言定位模型的框架。

项目最后更新:08/30/26

GitHub Stars

606

Forks数量

94

贡献者数量

4

许可证

MIT

收录理由

通用开放词汇检测器往往认不出某个团队真正关心的目标,比如自家特有的产品线或某种冷门零件。AViD 把 Grounding DINO 包装成一套微调工作流,让你用自己的标签去适配模型,而无需重训全部参数。它直接从 CSV 读取边界框标注,用 LoRA 作用于检测器的注意力、投影等层,还支持 EMA 来稳定训练过程。仓库里备有面向检测的评估环节,能输出 mAP、精确率、召回率和各类别汇总,同时提供 YAML 驱动的训练、单图推理和 Gradio 演示。对于只有少量标注数据的工程师来说,这相当于一条现成的路径,能直接得到领域专属的接地模型,省去手工拼装各种组件的麻烦。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目