计算机视觉
检测、分割、OCR 与视觉流水线,面向生产的开源计算机视觉方案。
共 384 个项目
排名逻辑见 方法论 ;同类排名基于 GitHub 公开指标。
| 排名 | 项目 | Stars | Forks | 更新 | 许可证 |
|---|---|---|---|---|---|
| 161 |
Chinese_license_plate_detection_recognition
yolov5 车牌检测 车牌识别 中文车牌识别 检测 支持12种中文车牌 支持双层车牌 |
1.9K | 298 | 06/05/26 | GPL-3.0 |
| 162 |
pysot
商汤科技研究平台,用于单目标跟踪,实现SiamRPN和SiamMask等算法。 |
4.6K | 1.1K | 06/22/25 | Apache-2.0 |
| 163 |
CityGaussian
[ECCV`24&ICLR`25] CityGaussian系列,用于高质量大规模场景重建的高斯方法 |
1.3K | 110 | 08/16/26 | Other |
| 164 |
claude-video-vision
让Claude具备观看和理解视频的能力——Claude Code插件,支持帧提取和多模态音频分析 |
1.3K | 152 | 08/07/26 | MIT |
| 165 |
text-extract-api
使用最先进的现代OCR + Ollama支持模型的文档(PDF、Word、PPTX等)提取和解析API。匿名化文档。移除PII。将任何文档或图片转换为结构化JSON或Markdown。 |
3.2K | 278 | 12/08/25 | MIT |
| 166 |
withoutbg-python
用于本地和云端背景移除的Python SDK(pip install withoutbg) |
1.3K | 62 | 07/23/26 | Other |
| 167 |
Objectron
一个包含15K个带标注的以物体为中心的视频片段的数据集,包括3D边界框、相机姿态和AR元数据,用于3D物体检测。 |
2.3K | 266 | 03/06/26 | Other |
| 168 |
byol-pytorch
Deepmind的'Bootstrap Your Own Latent'自监督学习的可用实现,基于Pytorch。 |
1.9K | 248 | 04/27/26 | MIT |
| 169 |
pigo
快速人脸检测、瞳孔/眼睛定位以及面部特征点检测库,纯Go实现。 |
4.7K | 325 | 05/03/25 | MIT |
| 170 |
ultralyticsPro
🔥🔥🔥 专注于YOLO11、YOLOv8、YOLOv12、YOLOv10、RT-DETR、YOLOv7、YOLOv5改进模型,支持改进backbone、neck、head、loss、IoU、NMS等模块🚀 |
3.0K | 458 | 12/15/25 | Other |
| 171 |
glue-factory
局部特征检测与匹配的训练库 |
1.1K | 157 | 07/20/26 | Apache-2.0 |
| 172 |
MambaVision
[CVPR 2025] 官方PyTorch实现:MambaVision:混合Mamba-Transformer视觉骨干网络 |
2.2K | 150 | 03/11/26 | Other |
| 173 |
opendatacam
一个量化世界的开源工具 |
1.7K | 300 | 04/23/26 | MIT |
| 174 |
BackgroundMattingV2
实时高分辨率背景抠图 |
7.2K | 960 | 06/19/24 | MIT |
| 175 |
zed-sdk
⚡️用于快速构建智能机器人和空间的空间感知框架 |
1.2K | 507 | 06/18/26 | MIT |
| 176 |
jeelizFaceFilter
🎭 轻量级WebGL与JavaScript库,用于实时多人脸检测、跟踪和增强现实面部滤镜。支持旋转、张嘴动作,并与Three.js、Babylon.js、Canvas2D和CSS3D集成。 |
2.9K | 546 | 11/14/25 | Apache-2.0 |
| 177 |
deepseek_ocr_app
一个快速随性编码的deepseek OCR应用 |
1.9K | 310 | 03/31/26 | MIT |
| 178 |
CVprojects
计算机视觉项目 | 计算机视觉相关好玩的AI项目(Python、C++、嵌入式系统) |
2.6K | 692 | 12/26/25 | Other |
| 179 |
donut
Donut(无需OCR的文档理解Transformer)和SynthDoG(合成文档生成器)的官方实现,ECCV 2022 |
6.9K | 565 | 07/11/24 | MIT |
| 180 |
VGGT-SLAM
VGGT-SLAM:在SL(4)流形上优化的稠密RGB SLAM |
1.1K | 119 | 06/29/26 | BSD-2-Clause |