#108 · 主分类: 基础模型
long_llama
LongLLaMA是一种能够处理长上下文的大型语言模型,基于OpenLLaMA并使用Focused Transformer (FoT)方法进行微调。
项目最后更新:11/07/23
GitHub Stars
1.5K
Forks数量
84
贡献者数量
3
许可证
Apache-2.0
收录理由
LongLLaMA 基于 OpenLLaMA 构建,采用 Focused Transformer 方法训练,能把可用的上下文长度大幅拓展,远远超出常见的几千 token 窗口。仓库提供了 3B 基础模型、3B 指令微调版本,以及面向代码的 7B 检查点,这些模型都已上传到 Hugging Face,可以直接加载使用;同时还附带了继续预训练和指令微调的代码,既能当作开箱即用的模型,也能作为复现上下文扩展技术的参考实现。如果你经常处理长文档、需要对大段文本做摘要或推理,或者代码涉及大型代码库的引用分析,这个项目会很有价值——自带的 Colab 笔记本和推理路径让你几乎不用额外配置就能快速上手。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。