GitHub Stars
5.6K
Forks数量
894
贡献者数量
1
许可证
Other
收录理由
这个演示项目把SmolVLM-500M接到llama.cpp服务器上,再通过一个极简的HTML页面把摄像头画面实时传给模型,检测结果几乎同步显示出来。500M的模型体积在普通笔记本上就能跑得动,省去了折腾云端API的麻烦。搭建过程很直接:启动服务器一条命令,再打开页面即可,没有复杂的依赖配置。最灵活的是提示词可以随意编辑,你既可以让它描述画面内容,也可以要求它输出JSON格式的结构化数据,不局限于简单的物体标签。对于想快速验证小尺寸视觉语言模型能否胜任实时检测或指令跟随任务的人来说,这是个省时的试金石;同时它也把llama.cpp的多模态调用方式浓缩成了一个可读性很高的参考案例,适合在探索本地离线推理时对照学习。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。