#207 · 主分类: 计算机视觉

ComfyUI_VLM_nodes

comfyui custom-nodes florence-2 gguf grounding-dino image-captioning img2text joytag llama-cpp llava llm mllm moondream nodes object-detection qwen3-vl sam2 segmentation video-understanding vlm

ComfyUI节点,用于视觉语言模型:Qwen3-VL、Moondream 3、Florence-2、SmolVLM2、InternVL、Gemma 3、MiniCPM-V。还包括开放词汇检测、SAM2/SAM3分割、视频时间推理、通过llama.cpp的GGUF,以及托管的LLM/VLM API。

项目最后更新:08/08/26

GitHub Stars

589

Forks数量

62

贡献者数量

14

许可证

Apache-2.0

收录理由

如果你已经在用 ComfyUI,又不想为视觉语言功能额外搭一套运行环境,这套节点能直接把图像描述、开放词汇检测和分割接进现有工作流。它把 Qwen3-VL、SmolVLM2、InternVL、Gemma 3 等一批现代视觉语言模型收进统一的节点接口,生产用的模型选择刻意保持精简,同时保留一个兼容旧工作流的遗留层级,之前存好的流程不会失效。同一套安装里还包含 grounding 式检测、SAM2/SAM3 分割和视频时序理解,一个环境就能覆盖多种视觉任务,不必为每个任务单独找工具。维护者优先采用官方模型仓库和原生 Transformers 接口,而不是未经核验的社区量化版本,这对看重可复现性的用户是个实在的加分项。节点也遵循 ComfyUI 自身的设备和模型驻留机制,在 CUDA、ROCm、Apple Metal 或 CPU 上都能跑,不会强迫你切换运行时。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目