#346 · 主分类: 计算机视觉
tokenize-anything
[ECCV 2024] 通过提示对任何事物进行标记化
项目最后更新:12/11/24
GitHub Stars
600
Forks数量
27
贡献者数量
5
许可证
Apache-2.0
收录理由
做交互式图像工具时,常常要在一个模型里同时完成区域分割、识别和描述,Tokenize Anything 用一次前向就能把这几件事都做了。你给它一个点、一个框或者手绘草图,它就能把对应区域切出来,认出里面是什么,再生成一句文字说明,省去了把分割模型和单独的描述模型串起来的麻烦。代码结构很清晰,预测器和模型主体是解耦的,还带一个注册表,你可以把自己的推理逻辑挂进去,不用去改一大坨脚本。官方提供了 ViT-B/L/H 三种规模的预训练权重,还有概念词向量文件,想快一点还是准一点,按任务需求换编码器就行。整体是研究向的代码,配了推理和评估的 notebook,拿它处理自己的数据时需要做些适配,别指望开箱即用。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。