#207 · 主分类: 计算机视觉
ComfyUI_VLM_nodes
ComfyUI节点,用于视觉语言模型:Qwen3-VL、Moondream 3、Florence-2、SmolVLM2、InternVL、Gemma 3、MiniCPM-V。还包括开放词汇检测、SAM2/SAM3分割、视频时间推理、通过llama.cpp的GGUF,以及托管的LLM/VLM API。
项目最后更新:08/08/26
GitHub Stars
589
Forks数量
62
贡献者数量
14
许可证
Apache-2.0
收录理由
如果你已经在用 ComfyUI,又不想为视觉语言功能额外搭一套运行环境,这套节点能直接把图像描述、开放词汇检测和分割接进现有工作流。它把 Qwen3-VL、SmolVLM2、InternVL、Gemma 3 等一批现代视觉语言模型收进统一的节点接口,生产用的模型选择刻意保持精简,同时保留一个兼容旧工作流的遗留层级,之前存好的流程不会失效。同一套安装里还包含 grounding 式检测、SAM2/SAM3 分割和视频时序理解,一个环境就能覆盖多种视觉任务,不必为每个任务单独找工具。维护者优先采用官方模型仓库和原生 Transformers 接口,而不是未经核验的社区量化版本,这对看重可复现性的用户是个实在的加分项。节点也遵循 ComfyUI 自身的设备和模型驻留机制,在 CUDA、ROCm、Apple Metal 或 CPU 上都能跑,不会强迫你切换运行时。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。