GitHub Stars
28.7K
Forks数量
3.2K
贡献者数量
34
许可证
AGPL-3.0
收录理由
Heretic 是一款面向 Transformer 架构语言模型的全自动去审查工具,它通过方向性消融(即 abliteration)技术直接编辑模型内部激活,从而移除模型自带的“安全对齐”限制,整个过程无需昂贵的后训练。工具内置了基于 Optuna 的参数优化器,能够自动寻找最优消融参数,在减少拒绝回答的同时尽量保持与原模型的 KL 散度最小,因此去审查后的模型仍能保留大部分原有推理能力。用户只需在命令行中指定 Hugging Face 上的模型,Heretic 即可自动处理,支持大多数稠密模型、多模态模型、多种 MoE 架构以及部分混合模型(如 Qwen3.5)。对于自托管模型且内置护栏阻碍了实际所需回复的场景,这是一个实用的方案,可帮助获得无审查的本地模型,适用于角色扮演、创意写作或研究等用途。
相关文章
暂无针对该项目的文章。
如需补充新闻资讯、使用教程、应用测评等内容,欢迎 联系我们推荐选题或投稿。
同类热门项目
unsloth
本地UI,用于运行和训练LLM及扩散模型。支持GGUF、MLX、Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、FLUX等。
LlamaFactory
统一高效微调100+大语言模型与视觉语言模型(ACL 2024)
airflow
Apache Airflow - 一个以编程方式编写、调度和监控工作流的平台
langfuse
🪢 开源AI工程平台:LLM评估、可观测性、指标、提示管理、游乐场、数据集。与OpenTelemetry、LangChain、OpenAI SDK、LiteLLM等集成。🍊YC W23
netron
神经网络、深度学习和机器学习模型的可视化工具