一家美国初创公司正在把“剥离AI安全护栏”做成了一门明码标价的生意。Abliteration.ai在8月底推出了基于GLM-5.3的修改版模型,通过商业API向客户出售访问权限。这项服务能让模型对敏感请求的拒绝频率大幅降低,而客户甚至不需要自己准备GPU服务器。
这项技术的核心叫“abliteration”(消融)。简单来说,它通过定位模型中触发拒绝行为的内部激活模式,再对权重进行微调来抑制这些模式。这不同于普通的提示词越狱——它直接改变了模型本身。Abliteration.ai声称,修改后的模型在编码、网络和智能体能力上基本保持完整。
自家评测数据亮眼,但并非全面领先
根据Abliteration.ai公布的内部评测,修改版GLM-5.3在CyberGym基准上拿到了84.5%的成绩,在Terminal-Bench 4.0上得分41.8%,两小时内解决了105个ExploitGym任务。不过,这份成绩单并非全面领先——在同一张对比表中,GPT-5.5在CyberGym上以85.6%的成绩略胜一筹,GPT-5.6 Sol和Fable 5在ExploitGym上的得分也明显更高。
公司也承认,这些对比分数来自不同的测试环境和计算预算,直接比较的参考价值有限。换句话说,这份数据更多是展示能力下限,而非宣称全面超越。
为什么选GLM系列?
这不是Abliteration.ai第一次拿GLM系列做文章。此前的“abliterated-model-large”同样基于GLM-5.2。据该公司称,早期GLM版本在训练时有意增加了安全限制,使其难以直接用于实际安全测试工作。而Z.AI官方曾表示,GLM-5.3在后期训练中,网络能力的增长超出了预期。
GLM的吸引力在于组合:强大的编码、智能体和网络能力,加上开放权重和可商用的许可证。Z.AI的许可协议允许修改、衍生和商业化的“模型即服务”产品,这为Abliteration.ai修改GLM-5.3、托管并出售访问权限提供了法律基础。当然,Qwen、DeepSeek和Mistral等也有类似能力的开放权重模型可供选择。
开放权重,封闭服务
“消融”本身并不是新事物。多年来,开发者一直在Hugging Face上发布修改版模型。Abliteration.ai的不同之处在于,它不提供修改后权重的公开下载,而是自己负责托管和运营。客户通过API调用即可使用,无需自行部署GPU基础设施。
这种模式降低了使用门槛,但也带来了安全权衡。一方面,网络安全测试、红队演练和恶意软件分析确实需要能“放开手脚”的模型;另一方面,同样的便利性也让滥用变得更加容易。当安全护栏的拆除变成一项按需付费的服务,监管和伦理的边界在哪里,恐怕还需要更多讨论。
热门跟贴