#76 · 主分类: 基础模型
large_concept_model
Large Concept Models: 在句子表示空间中的语言建模
项目最后更新:01/29/25
GitHub Stars
2.4K
Forks数量
213
贡献者数量
7
许可证
MIT
收录理由
对于正在探索下一代语言建模思路的研究者和工程师,这个仓库提供了一个真正不同的方向。它来自Meta FAIR,是Large Concept Model的官方实现,核心思路是把句子整体当作一个“概念”,在SONAR这种多语言嵌入空间里做自回归预测,文本侧最多支持200种语言,从而一次生成整个句子,而不是逐字逐句地往外蹦。仓库里不光有训练好的模型,还给出了可复现的预训练和微调方案,覆盖约1.3T token,模型规模为1.6B参数,包含MSE回归和双塔扩散两种变体。由于它操作在语言和模态无关的语义表示上,而不是单词片段,很适合拿来做长程生成、跨语言迁移,以及从语义而非表层token出发做文本生成的实验。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。