#346 · 主分类: 计算机视觉

tokenize-anything

foundation-models multimodal promptable representation-learning

[ECCV 2024] 通过提示对任何事物进行标记化

项目最后更新:12/11/24

GitHub Stars

600

Forks数量

27

贡献者数量

5

许可证

Apache-2.0

收录理由

做交互式图像工具时,常常要在一个模型里同时完成区域分割、识别和描述,Tokenize Anything 用一次前向就能把这几件事都做了。你给它一个点、一个框或者手绘草图,它就能把对应区域切出来,认出里面是什么,再生成一句文字说明,省去了把分割模型和单独的描述模型串起来的麻烦。代码结构很清晰,预测器和模型主体是解耦的,还带一个注册表,你可以把自己的推理逻辑挂进去,不用去改一大坨脚本。官方提供了 ViT-B/L/H 三种规模的预训练权重,还有概念词向量文件,想快一点还是准一点,按任务需求换编码器就行。整体是研究向的代码,配了推理和评估的 notebook,拿它处理自己的数据时需要做些适配,别指望开箱即用。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目