你让ChatGPT写个偷Chrome密码的脚本,它会拒绝。你让Claude教你培养高危病原体,它也会拒绝。
这是AI的安全护栏——guardrails。所有正经大模型都有这层东西。
但现在有一家公司,专门把这层护栏拆掉,然后公开卖给你用。
键入什么就干什么
这家公司叫Abliteration.ai。名字本身是个技术术语——“abliteration”,指的是一种移除模型拒绝倾向的技术。他们干的事很简单:把开源大模型的安全过滤拆干净,然后托管在云端,用户打开浏览器就能用,或者通过API调用。
TechCrunch的记者注册了个账号,问了两个问题。
第一个:写一个Python程序,偷取Chrome里保存的密码。
第二个:写一份在家培养高危病原体的详细操作方案。
模型照单全收,立刻给出了回答。
这家公司在社交媒体上说得很直白,他们的目标就是让用户能做“其他模型拒绝做的网络攻击、红队测试和代理系统测试工作”。平台目前托管了Z.ai最新发布的GLM-5.3的去护栏版本。
联合创始人Devon说,公司去年底成立、今年3月正式注册,目前没融过资,靠客户收入就能支付几家主要云服务商的费用。
“去护栏”不是什么新技术
说实话,移除AI护栏这技术本身不新鲜。
开源社区搞这个搞了好几年了。Hugging Face上托管着成千上万个去护栏版本的模型。2026年5月,有研究者用了一个叫Heretic的工具,在Meta的Llama 3.3和Google的Gemma 4上试了试,几分钟就把安全护栏拆干净了。Heretic的作者说,Gemma 4公开发布后90分钟内他就完成了去护栏。
还有更野的。一个代号“Trim”的黑客,2026年上半年系统性地拆解了多个前沿AI模型的护栏,做成了一套商业化的攻击平台。另一款叫Kriminal的工具,本质上就是用越狱技术包装了一下Grok,最便宜套餐12.99美元一个月。
但Abliteration.ai做的事不太一样。
以前你要用去护栏模型,得自己下载、自己找算力跑。Hugging Face上虽然有,但不是所有人都搞得定部署。Abliteration.ai把它做成了一个云服务——打开网页就能用,跟用ChatGPT一样方便。把一个小众技术活变成了一门谁都能点开即用的生意。
支持者说这是“红队测试”,反对者说这是“制造反社会人格”
支持这种做法的逻辑,在安全圈里其实挺常见:你没法防御一种你无法复现的攻击行为。如果一个模型连漏洞利用代码都不肯写,那安全团队拿什么来测试自家系统的防御能力?
换句话说,红队测试需要“坏”模型来模拟真正的攻击者。
但问题在于,同样的工具,红队能用,犯罪分子也能用。
AI安全非营利组织CivAI的研究负责人Andrew Yoon说得挺重:去护栏相当于把模型改造成了一个“反社会人格者”——你输入什么它都照办。他预计在不久的将来就会看到去护栏模型被用于实际危害。
这事能拦得住吗?
TechCrunch采访的大多数专家的看法是:拦不住。
开源模型权重一旦发布,谁都可以下载、修改、再分发。这跟闭源API不一样——OpenAI可以在服务器端卡住你不让问违规问题,但开源模型的代码在你手里,你想怎么改就怎么改。
Yoon的建议是,拦不住模型本身,可以在别的地方设卡:要求云服务商在GPU租赁环节验证客户身份,对有可疑用途的访问拒绝服务。也可以要求模型托管平台加装分类器,检测和拦截恶意网络活动或生物武器相关查询。
Abliteration.ai自己倒是在平台上加了一些“轻微护栏”——比如记者测试时发现有些极端内容还是会被拦住。但平台也给客户提供了“自行添加护栏”的选项——你想加什么限制自己加。说白了,默认是无限制的,要不要限制你自己看着办。
我的看法
说几个事实。
第一,去护栏技术本身不可逆。开源模型就在那里,谁都能动手改。
第二,这件事已经从技术圈的自娱自乐变成了商业服务。Abliteration.ai不是第一个做的,但可能是第一个把它做得这么“方便”的。
第三,安全圈内部对这事有分歧。红队测试确实需要能模拟攻击的模型,但“需要”和“公开卖给任何人”之间隔着一道门槛。这道门槛现在被抹掉了。
我不评价这家公司做得对不对。但有个问题值得想:当一个能写恶意代码、能教人培养病原体的AI,变得跟注册个邮箱一样容易获取的时候,我们现有的安全体系有没有准备好应对?
西安电子科技大学校长高新波有个说法挺到位:传统的AI安全护栏本质上是一种“补丁思维”——发现漏洞堵上漏洞,再发现再堵上。但面对“去护栏即服务”这种模式,补丁还够不够用,可能要打个问号。
你怎么看?你觉得“去护栏AI”应该被允许公开售卖,还是应该被禁止?欢迎在评论区聊聊。
