核心事件与硬信息速览
Base Labs(Baseten新成立的研究机构,隶属于Baseten)于2026年9月17日联合Hugging Face与Goodfire AI,宣布推出面向开源权重(open-weight)AI模型的安全基础设施合作项目。该项目旨在建立透明、可复现的模型训练与监测方法论。
关键硬信息如下:
- 发布时间:2026年9月17日
- 合作方:Base Labs、Hugging Face、Goodfire AI
- 权重类型:open-weight(开源权重,非closed-source闭源)
- 技术重心:安全评估、模型监测、训练流程嵌入式安全控制
- 开放程度:Base Labs承诺将方法公开发布,供开发者社区共同贡献
为何安全已成为开源模型的"阿喀琉斯之踵"?
开源权重模型的兴起本意是促进AI民主化,但技术演进却带来了新的安全隐患——一种名为"abliteration"的现象正日益凸显。Abliteration指通过技术手段移除模型的安全防护层,将原本安全的开源模型改造为具有潜在风险的版本。Hugging Face作为全球最大的开源模型托管平台,目前 listings(列出)的abliterated模型数量已超过6,000个,揭示问题规模之大远超预期。
这一反差尤为值得重视:开源本应提升透明性与安全性(因代码与权重公开,社区可共同审查),但abliteration技术却使公开模型库成为风险扩散的温床。Base Labs在官方X账号声明中强调:“We believe openness to be an advantage for AI safety”——他们主张真正的安全不在于隐藏,而在于让模型运行机制可被监督,从而让安全研究能快速转化为可见的控制措施。
此次合作的技术路径尚未完全公开,但根据Goodfire的回应,其方向指向"Safety must be built into open models and provided by those who serve them"。Goodfire专注模型可解释性(model interpretability),即打开AI"黑箱",解释模型决策逻辑,被视为"built into"(嵌入式安全)实现的核心技术力量。
背书力量与资本实力
尽管侧重于公共安全研究,该联盟背后是强劲的资本支持:
- Baseten:作为AI推理服务提供商,今年6月完成15亿美元($1.5B)Series F轮融资,估值跃升至130亿美元
- Goodfire AI:同样于今年接受由B Capital领投的1.5亿美元($150M)Series B轮,用于推进其模型可解释性平台
Base Labs(隶属于Baseten)作为Baseten新成立的研究机构,此番牵头合作,标志着其从单纯工程支持转向前沿安全标准制定者角色。
面向开发者生态,合作方已开启公开征召(open call),邀请更广泛社区参与安全框架共建。这一策略呼应了开源文化本质——安全不是大厂专属责任,而是整个生态的集体义务。
落地建议:不同角色如何应对
- 模型开发者:若你正在训练开源权重模型,建议主动接入即将发布的Base Labs安全标准,并优先考虑Goodfire提供的可解释性工具辅助调试安全风险点
- 企业AI采购方:在评估开源模型风险时,应明确询问其是否经过 abliteration 防护检测;Hugging Face平台上6,000+ abliterated模型提醒企业不可仅信任"开源即安全"的默认假设
写在最后
开源模型的安全不在于技术闭门造车,而在于社区协同治理——此次三方合作首次将"安全"从补丁式事后修复升维至"训练即内嵌"的基础设施层,标志着开源AI治理进入系统性构建新阶段。

