Heretic是一款开源的Python工具,可在无需后续训练的情况下自动消除基于Transformer的语言模型的安全对齐机制。自发布以来,该工具已在GitHub上获得2.05万个星标和2100次 fork,社区用户也以“heretic”为标签在Hugging Face上发布了超过3000个衍生模型。该工具由Philipp Emanuel Weidmann开发,采用AGPL-3.0许可协议发布。它结合了方向性消融技术的先进实现方式——这一技术源于Arditi等人在2024年的研究成果,即大语言模型的拒绝行为是由激活空间中某个特定的几何方向所决定的——同时还配备了基于Optuna框架、采用TPE算法的贝叶斯参数优化器。其核心优势在于完全自动化:Heretic通过同步最小化模型拒绝率与原始模型的KL散度来确定最优消融参数,从而在最大限度抑制拒绝行为的同时尽可能减少对模型智能水平的损害。在Gemma-3-12B-Instruct模型上的测试显示,针对一系列“有害”提示语,Heretic使模型的拒绝率降至3/100的水平,这一成绩与人工调优后的最佳消融效果相当;而其产生的KL散度仅为0.16,比目前主流的人工调优方案(KL散度为1.04)低约6.5倍。用户只需执行一条命令行指令即可使用该工具:pip install heretic-llm && heretic <model>,此外它还支持借助bitsandbytes实现量化处理,方便普通用户在自己的GPU上运行。
这款工具的实用价值主要体现在降低了相关技术的使用门槛。此前的各类消融工具均要求使用者至少具备一定的Transformer内部结构知识并手动调整各层权重,而Heretic的优化器则免除了这些要求。目前该工具兼容绝大多数密集式及混合专家型Transformer架构,包括Qwen、Gemma、Llama以及GPT-OSS系列模型,不过纯状态空间类模型暂不支持。另外还有一个可选的研究扩展模块,可生成各层残差向量的动态PaCMAP可视化图像,这让可解释性研究领域的学者无需编写定制化的可视化代码,就能直观观察不同Transformer层中“有害”与“无害”提示语对应的激活向量之间的几何关系。该项目的最新版本为2026年2月14日发布的v1.2.0。此类工具的广泛普及已成为当前AI安全领域争论的焦点之一:经过消融处理的模型如今能在Hugging Face上自由传播,且其在MMLU与GSM8K标准测试集上的表现与未处理的原版模型不相上下,这一事实表明实际场景中模型智能水平与安全对齐程度的可分离性,其实比许多安全研究人员原先预期的要高。