#723 · 主分类: 教育与研究

rome

gpt interpretability pytorch transformers

定位和编辑GPT中的事实关联(NeurIPS 2022)

项目最后更新:04/20/24

GitHub Stars

778

Forks数量

164

贡献者数量

2

许可证

MIT

收录理由

这个仓库是 NeurIPS 2022 一篇关于模型编辑论文的官方参考实现,核心思路是先定位事实关联在 Transformer 内部的具体位置,再通过一次秩一更新直接改写该事实。随附的因果追踪 notebook 可以逐层检查哪些层和注意力头真正承载了某条陈述,而编辑接口只需提供提示词、主体和目标改写内容即可操作。目前支持 GPT-2 XL 和 GPT-J 两种模型,并带有一套包含基线的评估工具,用于在 CounterFact 数据集上对比不同编辑方法。如果你想复现论文结论,或者自己动手做编辑实验,从这里入手最合适。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目