#165 · 主分类: 推理与本地部署

gpu_poor

ggml gpu huggingface language-model llama llama2 llamacpp llm pytorch quantization

计算任何LLM的token/s和GPU内存需求。支持llama.cpp/ggml/bnb/QLoRA量化。

项目最后更新:12/03/24

GitHub Stars

1.4K

Forks数量

88

贡献者数量

3

许可证

Other

收录理由

在下载大模型之前,最让人心里没底的往往是同一件事:我的显卡到底能不能跑起来,跑起来又能有多快?只看模型文件大小远远不够,因为 KV 缓存会悄悄吃掉大量显存——就拿 llama-2-7b 来说,上下文长度一千时,用 HuggingFace 的 LlamaForCausalLM 推理,额外占用就能超过 1GB。这个基于浏览器的估算工具把总显存需求拆成各个组成部分,让你看清每一块内存花在了哪里;同时它还会预估每秒 token 数和每轮微调的大致耗时,正好对应你在 GGML、bitsandbytes、QLoRA 之间做量化选型,或者纠结该用全量、LoRA 还是 QLoRA 训练时的实际需求。它的估算结果经过真实 GPU 校验,误差在半 GB 以内,能给你一个靠谱的规划区间,而不是靠猜。无论是配工作站、租云服务器还是搭推理机,有了它,你在真正下载之前就能省去大量反复试错的功夫。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目