#7 · 主分类: GPU 计算框架
uccl
UCCL是一个高效的GPU通信库,涵盖集合通信、P2P(如KV缓存传输、RL权重传输)和EP(如GPU驱动)等功能。
项目最后更新:08/29/26
GitHub Stars
1.5K
Forks数量
171
贡献者数量
62
许可证
Apache-2.0
收录理由
大规模LLM训练和推理的瓶颈常常卡在GPU之间的数据搬运上,想提升吞吐量的团队除了调优默认的NCCL栈,选择并不多。UCCL以开源方式重新实现了集合通信原语,同时保留了大家熟悉的NCCL/RCCL接口,现有应用无需改动代码即可运行,却能在许多场景下获得更快的allreduce和broadcast性能。它还覆盖了点对点传输,比如跨节点搬移KV缓存、在强化学习过程中传送权重,以及面向MoE模型的GPU驱动专家并行路由。其软件传输层设计能把流量分散到多条网络路径,并兼容NVIDIA、AMD、Broadcom等不同厂商的硬件,这与现实中许多多供应商集群的情况很契合。如果你在多节点上跑分布式训练或推理,想知道一个即插即用的库能否在延迟或带宽上胜过NCCL,那很值得拿它做一轮基准测试。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
kompute
基于Vulkan的通用GPU计算框架,支持数千种跨厂商显卡(AMD、高通、NVIDIA等)。极速、支持移动端、异步,并针对高级GPU数据处理场景优化。由Linux基金会支持。
lupine
LUPINE 是一种基于 IP 的 GPU 桥接技术,可将远程 GPU 挂载到仅 CPU 的机器上。
dstack
供应商无关的编排,支持训练、推理和代理工作负载,适用于 NVIDIA、AMD、TPU、Tenstorrent,可在云、Kubernetes 和裸金属上运行。
MetalPetal
基于Metal构建的GPU加速图像和视频处理框架。
tt-metal
:metal: TT-NN 算子库,以及 TT-Metalium 低级内核编程模型。