#103 · 主分类: 深度学习框架

xlstm

deep-learning deep-learning-architecture llm machine-learning nlp rnn

xLSTM 官方仓库。

项目最后更新:08/27/26

GitHub Stars

2.2K

Forks数量

186

贡献者数量

9

许可证

Apache-2.0

收录理由

xLSTM 把经典 LSTM 重新设计成一种现代循环架构,用指数门控和矩阵记忆替代原有机制,使得模型能处理长距离上下文,而不依赖 Transformer 或状态空间模型。该仓库是官方 PyTorch 实现,既包含论文中的研究变体,也提供用于训练 7B 模型(2.3T tokens)的优化 Large 配置。快速 CUDA 和 Triton 内核承担计算重任,其他场景也有纯 PyTorch 回退实现。这种设计对两类用户都有吸引力:研究者可以查看发表结果背后的精确训练和内核代码;实践者则可将 xLSTM 模块嵌入自己的模型,或直接加载预训练的 7B 权重,在真实任务中对比循环骨干与 Transformer、线性注意力之间的表现。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目