#76 · 主分类: 写作与内容

LongWriter

fine-tuning llm long-context long-text

[ICLR 2025] LongWriter:从长上下文LLM中释放10,000+词的生成能力

项目最后更新:06/24/25

GitHub Stars

1.9K

Forks数量

182

贡献者数量

4

许可证

Apache-2.0

收录理由

LongWriter 面向那些见过大模型写长文时重复啰嗦、或者几千字后就草草收尾的开发者。它清楚展示了如何让 LLM 生成连贯的万字长文,并且给了能直接上手试用的完整资源:两个现成的开源权重(分别基于 GLM-4-9B 和 Llama-3.1-8B),以及一份既支持 transformers 也支持 vLLM 的推理脚本。仓库里还开放了整套训练流程,想复现成果而不只是调用模型的话,这部分很有价值——包括 AgentWrite 流水线(把长请求拆成子任务大纲,再据此构建训练数据)、微调代码,以及两个把输出长度与质量分开评估的基准。如果不想走监督训练这条路,较新的 LongWriter-Zero 变体采用纯强化学习,不依赖任何合成或标注数据,据报道在长文写作上甚至超过了更大的模型。对于用微调或本地模型来生成长篇报告、文档或小说的团队,这个项目能让人更清楚地认识到,让模型真正写完一篇长文需要做哪些事。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目