#7 · 主分类: GPU 计算框架

uccl

ai allreduce amd broadcom collective cuda gpu hpc kvcache llm moe networking nvidia p2p rdma

UCCL是一个高效的GPU通信库,涵盖集合通信、P2P(如KV缓存传输、RL权重传输)和EP(如GPU驱动)等功能。

项目最后更新:08/29/26

GitHub Stars

1.5K

Forks数量

171

贡献者数量

62

许可证

Apache-2.0

收录理由

大规模LLM训练和推理的瓶颈常常卡在GPU之间的数据搬运上,想提升吞吐量的团队除了调优默认的NCCL栈,选择并不多。UCCL以开源方式重新实现了集合通信原语,同时保留了大家熟悉的NCCL/RCCL接口,现有应用无需改动代码即可运行,却能在许多场景下获得更快的allreduce和broadcast性能。它还覆盖了点对点传输,比如跨节点搬移KV缓存、在强化学习过程中传送权重,以及面向MoE模型的GPU驱动专家并行路由。其软件传输层设计能把流量分散到多条网络路径,并兼容NVIDIA、AMD、Broadcom等不同厂商的硬件,这与现实中许多多供应商集群的情况很契合。如果你在多节点上跑分布式训练或推理,想知道一个即插即用的库能否在延迟或带宽上胜过NCCL,那很值得拿它做一轮基准测试。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目