#7 · 主分类: MLOps与评测

heretic

abliteration llm transformer

全自动移除语言模型的审查

项目最后更新:08/17/26

GitHub Stars

28.7K

Forks数量

3.2K

贡献者数量

34

许可证

AGPL-3.0

收录理由

Heretic 是一款面向 Transformer 架构语言模型的全自动去审查工具,它通过方向性消融(即 abliteration)技术直接编辑模型内部激活,从而移除模型自带的“安全对齐”限制,整个过程无需昂贵的后训练。工具内置了基于 Optuna 的参数优化器,能够自动寻找最优消融参数,在减少拒绝回答的同时尽量保持与原模型的 KL 散度最小,因此去审查后的模型仍能保留大部分原有推理能力。用户只需在命令行中指定 Hugging Face 上的模型,Heretic 即可自动处理,支持大多数稠密模型、多模态模型、多种 MoE 架构以及部分混合模型(如 Qwen3.5)。对于自托管模型且内置护栏阻碍了实际所需回复的场景,这是一个实用的方案,可帮助获得无审查的本地模型,适用于角色扮演、创意写作或研究等用途。

相关文章

暂无针对该项目的文章。

如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。

同类热门项目