计算机视觉

检测、分割、OCR 与视觉流水线,面向生产的开源计算机视觉方案。

共 384 个项目

排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。

第 181–200 项,共 384 个

排名 项目 Stars Forks
181 AdvancedLiterateMachinery

针对高级识字机器的原创、创新思想和算法集合。该项目由阿里巴巴集团通义实验室语言技术实验室OCR团队维护。

1.8K 197
182 fashion-mnist

类似MNIST的时尚产品数据库。基准:👇

12.8K 3.1K
183 nanodet

NanoDet-Plus⚡超快且轻量的无锚框目标检测模型。🔥仅980 KB(int8) / 1.8MB (fp16),手机端跑97FPS🔥

6.3K 1.1K
184 PointLLM

[ECCV 2024 最佳论文候选 & TPAMI 2025] PointLLM:赋能大型语言模型理解点云

1.1K 58
185 ViTPose

[NeurIPS'22]《ViTPose:用于人体姿态估计的简单视觉Transformer基线》和[TPAMI'23]《ViTPose++:用于通用身体姿态估计的视觉Transformer》的官方仓库。

2.1K 268
186 unblink

使用VLM进行摄像头监控

1.5K 170
187 OC_SORT

[CVPR2023] OC-SORT官方仓库:基于观测中心的SORT,用于视频多目标跟踪。OC-SORT简单、在线,对遮挡/非线性运动鲁棒。

1.1K 154
188 OmDet

实时准确的开放词汇端到端目标检测

1.4K 118
189 mmocr

OpenMMLab 文本检测、识别和理解工具箱

4.8K 781
190 ScanNet

ScanNet是一个大规模RGB-D视频数据集,包含1500多次扫描中的250万视图,提供3D姿态、重建和实例级语义标注。

2.3K 374
191 EasyPR

(CGCSTCD'2017)一个简单、灵活、准确的车牌识别项目,适用于非受限环境下的中国车牌。

6.4K 2.5K
192 layout-parser

基于深度学习的文档图像分析统一工具包

5.8K 532
193 DDColor

[ICCV 2023] DDColor:通过双解码器实现照片级真实感的图像着色

1.5K 169
194 jepa

用于从视频中进行V-JEPA自监督学习的PyTorch代码和模型。

4.1K 419
195 CameraView

📸 一个文档完善的高层次 Android 接口,让拍摄照片和视频变得简单,解决所有常见问题和需求。实时滤镜、手势、水印、帧处理、RAW、任意尺寸输出。

5.1K 982
196 Video-Depth-Anything

[CVPR 2025 Highlight] Video Depth Anything:面向超长视频的一致性深度估计

2.1K 195
197 AnimeGANv2

[开源]。 AnimeGAN 的改进版本。将风景照片/视频转换为动漫风格。

5.4K 746
198 cleanvision

自动发现图像数据集中的问题,实践以数据为中心的计算机视觉。

1.2K 83
199 face.evoLVe

🔥🔥基于PaddlePaddle和PyTorch的高性能人脸识别库🔥🔥

3.6K 760
200 mmpretrain

OpenMMLab 预训练工具箱和基准

3.9K 1.1K
< 上一页
/ 20
下一页 >