微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 MIT与民主与技术中心联合警告:给AI"专业培训"后,它的安全底线可能悄悄移位了

MIT与民主与技术中心联合警告:给AI"专业培训"后,它的安全底线可能悄悄移位了

2026-05-08 10:19
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-05-08 10:19 科技行者

这项由麻省理工学院计算机科学与人工智能实验室(MIT CSAIL)与民主与技术中心(Center for Democracy & Technology)联合开展的研究,于2026年4月以预印本形式发布,编号为arXiv:2604.24902。研究团队历时数月,对100个AI语言模型进行了系统性安全检测,是迄今为止针对"微调导致安全漂移"这一问题规模最大的实证研究之一。

假设你所在的医院刚刚引进了一款AI辅助诊断系统。这款系统是基于某个大型通用AI模型"定制训练"出来的——开发商用大量医学对话数据对原始模型进行了专项训练,让它能熟练回答病患问题、协助医生整理病历。医院在引进时查阅了原始AI模型的安全报告,一切看起来都没问题:不生成有害内容、不鼓励自我伤害、不散布错误信息。然而,没有人去检验那个经过"医学专项训练"之后的版本是否依然安全。

这恰恰是这篇论文要揭示的核心问题。

**一、一场被忽视的安全赌局**

在AI行业里,有一种非常普遍的做法:先训练一个功能强大的"底座模型",再把它交给下游开发者,让他们根据自己的需求进行"微调"——就像购买一台万能料理机,再根据自己的口味换上不同的刀头和程序。医疗、法律、教育、客服……各行各业都在这么做。

这种做法的问题在于:安全测试通常只在"万能料理机"出厂时做一次,换上不同刀头之后,没有人再去检验它会不会伤到使用者的手。整个行业都在默认一件事:如果原始模型是安全的,那么在它基础上进行的专业化训练不会破坏这种安全性。

研究团队把这个假设拿出来,用真实数据做了一次彻底的检验。他们的发现令人不安。

**二、研究是怎么做的:两轮取证**

这次研究分成两个阶段,像是一场兼顾真实世界和实验室环境的双重取证。

第一阶段,研究团队扮演"现场调查员",直接从全球最大的AI模型共享平台Hugging Face上下载了31个广泛使用的医疗和法律领域专用模型,这些模型合计被下载超过160万次、被引用超过1400次。研究者把每个专用模型与它的"原版底座"进行对比,测量经过专业训练之后,安全性发生了哪些变化。在条件允许的情况下,他们还追踪了一些模型的"家族树"——从底座到第一代医疗微调版,再到第二代、第三代下游衍生版本,观察安全性随世代传递时如何演变。

第二阶段,研究团队回到实验室,亲自动手做受控实验。他们选取了四款主流底座模型(分别来自Meta、谷歌、Mistral和阿里巴巴旗下的Qwen系列),用医疗和法律领域的真实数据集,分别以三种常见的训练方式(完全微调、LoRA、QLoRA)对每个模型进行训练,然后系统测量安全性变化。所谓LoRA和QLoRA,是两种流行的"轻量级微调"技术,它们不修改模型的全部参数,只调整一小部分,计算成本低、上手容易,是目前中小团队最常用的AI定制方案。

安全性测量方面,研究团队使用了多套来自不同机构的评测工具。通用安全方面采用了HEx-PHI和MLCommons AILuminate;医疗安全方面使用了MedSafetyBench和CARES;法律安全方面则用了SafeLawBench、SORRY-Bench和Trident。用多套工具交叉检验,恰恰是这项研究的关键设计——因为不同工具给出的结论可能大相径庭,这本身就是一个重要发现。

**三、医疗模型:安全性像骰子一样不稳定**

在医疗模型的生态分析中,研究团队发现了一幅既令人困惑又令人担忧的图景。

从大方向看,约60%的医疗微调模型在某个评测工具上显示"比底座更安全",但仍有相当比例显示"比底座更危险"。更关键的发现是:高达81%的模型出现了"混合方向漂移"——也就是说,同一个模型在某套测试中表现得更安全,在另一套测试中却表现得更危险。这就好比一个人戒了烟却开始暴饮暴食,你很难说他的整体健康状况是变好了还是变差了。

从数值上看,单个模型的安全性变化幅度相当惊人。以CARES评测工具为例,不同模型的安全性变化范围从负68.5个百分点(大幅改善)到正69个百分点(大幅恶化),标准差约为40个百分点——这意味着个体之间的差异极为悬殊。其他工具的变化幅度也在正负30个百分点左右浮动。从表面上看,所有模型的平均变化幅度并不算大(大约负1.5到负6.6个百分点),但平均值掩盖了个体层面极端的不可预测性。

研究团队还发现了一个有趣的规律:底座模型本身越"不安全",经过医疗微调后反而越可能变得更安全;而底座模型本身越"安全",微调后反而更可能出现安全退化。这种反向关系的皮尔逊相关系数约为-0.55,具有统计显著性。背后的逻辑可能是:对于原本没有经过安全对齐训练的底座模型,医疗微调附带引入了一些结构化的指令遵循能力,顺带压制了部分不安全行为;而对于原本已经精心设计了安全机制的底座模型,专业领域的训练数据可能会以意想不到的方式干扰这些已有的安全设置。

在追踪"家族树"的分析中,研究者观察了15条微调传承链,发现安全性的不稳定程度随世代增加而加剧。从底座到第一代医疗微调,再到第二代下游衍生版本,三个主要评测工具(HEx-PHI、MedSafetyBench、MLCommons)的安全性标准差都显著扩大。第一代微调的中位安全变化幅度约为7个百分点,到第二代则上升到约13个百分点。更令人警惕的是,在不同世代之间,有60%到86%的模型出现了安全方向的逆转——原来变安全了,到了下一代又变危险了,或者反过来。这就像把一首曲子翻唱了又翻唱,每次翻唱都会引入新的变奏,而变奏的方向完全不可预测。

**四、法律模型:安全评估工具之间几乎无法达成共识**

法律领域的分析呈现出另一层困境——不仅模型本身的安全性不稳定,就连用来衡量"安全"的工具之间也几乎无法达成共识。

如果只看直接测量"有害输出"的工具(HEx-PHI、MLCommons、Trident),法律微调模型中约60%出现了混合方向漂移。但一旦把同时测量"拒绝行为"(SORRY-Bench)和"法律合规性"(SafeLawBench)的工具纳入进来,混合漂移的比例骤升至93%——几乎每一个模型都在某个维度变好、某个维度变差。

更深层的问题在于,法律安全本来就是一个多维度的概念。一个法律AI助手,是不是应该拒绝回答高风险法律问题?这在通用AI眼里理所当然,但对于一个专门为律师事务所设计的法律助手来说,过度拒绝恰恰是失职。研究团队发现,SORRY-Bench评测工具对于拒绝回答法律问题给予奖励,这就导致法律微调模型在这个工具上表现反而"更好"——因为它提供了更多实质性法律建议,触发了更少的拒绝——但这种"表现变好"与真正的安全改善之间,其实是南辕北辙的关系。

三个法律安全评测工具之间的斯皮尔曼相关系数仅在0.06到0.17之间,接近于零——换句话说,知道一个模型在某个工具上的得分,对预测它在另一个工具上的表现几乎毫无帮助。三个工具同时指向同一方向的情况,在所有模型中只出现了23%。

**五、受控实验:换汤不换药,问题依然存在**

在第一阶段的真实世界分析中,不同模型使用了不同的训练数据、不同的训练流程,很难排除"是不是数据本身的问题"。为此,研究团队在第二阶段设计了严格的受控实验:固定训练数据、固定超参数、固定训练轮次,只改变底座模型和微调方式,来测试"是不是某种特定的训练方法或模型选择导致了安全漂移"。

结论依然令人不安。

医疗微调实验中,83%的配置组合在医疗领域专用评测工具上显示出安全改善,但与此同时,100%的配置组合在通用安全工具MLCommons上显示出安全退化。中位安全变化从MedSafetyBench上改善12.2个百分点,到MLCommons上恶化26.4个百分点——同样的模型,同样的训练,在不同工具下呈现出完全相反的走向。一个可能的解释是:针对医疗场景的专项训练让模型在面对医疗相关问题时变得更谨慎,但同时削弱了它在非医疗场景下的安全防线。

法律微调实验的模式与此相似,但更加复杂。MLCommons在所有底座模型和所有微调方式下都出现了安全退化,Gemma和Mistral在全量微调和QLoRA条件下的退化尤为严重,常常超过30个百分点。SafeLawBench也在92%的情况下出现退化。与此形成对比的是,SORRY-Bench在大多数情况下反而显示"改善"——而这种"改善",正如前面提到的,恰恰是因为该工具奖励拒绝行为。

研究者还检验了一个在工程实践中广为流传的"经验法则":修改幅度越大,安全性变化越大。直觉上,如果一次微调只调整了模型1%的参数,那它造成的安全影响应该比调整50%参数要小得多,对吗?

研究团队通过计算每个微调版本与底座之间的参数空间距离(归一化L2距离)来量化"修改幅度",然后检验它与安全变化之间的相关性。结果是:二者之间几乎没有任何可靠的关系,相关系数绝对值普遍低于0.25,决定系数R?不足0.1。

以MedSafetyBench为例,Mistral模型的三种微调方式(LoRA、QLoRA、全量微调)产生了几乎相同的安全改善幅度(约-35到-37个百分点),但它们修改的参数量相差近10倍。与此同时,Gemma的QLoRA版和Mistral的LoRA版在参数修改量几乎相同的情况下,安全变化方向却完全相反。这意味着,那个"修改幅度越小越安全"的直觉,在现实数据面前彻底失灵了。

**六、连测量工具本身也不可靠**

研究团队还做了一个额外实验,检验安全测量工具本身的稳定性。他们在不改变任何模型输出的情况下,仅在评分提示词中增加了一些示例(告诉AI裁判"1分的回答大概是这个样子,5分的回答大概是这个样子"),然后重新对所有模型评分。

按理说,提供更清晰的评分标准应该让结果更稳定、更准确。然而实验结果恰恰相反:25%的医疗模型评估结果出现了方向性逆转——原来被判定为"微调后更安全"的模型,现在被判为"微调后更危险",或者反过来。有些模型的评分变化幅度超过40个百分点,仅仅因为评分提示词多了几个例子。

这个发现意味着:我们观察到的"安全漂移",有一部分可能根本不反映模型真实行为的变化,而是反映了测量工具本身的不稳定性。在没有可靠的外部验证标准(比如真实的伤害事件数据)的情况下,我们很难区分"模型真的变危险了"和"评测工具恰好给出了不同的读数"。

**七、谁来负责:一个没有答案的责任链问题**

这些发现对AI安全治理带来了深刻的挑战,而研究者对此有专门的讨论。

目前流行的监管思路,包括欧盟《人工智能法案》相关配套指南,认为下游改造者只有在其计算消耗超过原始训练计算量三分之一的情况下,才被视为"新的模型提供方",才需要承担完整的安全评估义务。这个门槛背后的逻辑是:修改量越大,原有安全属性就越可能被改变,责任也就越应该转移。

然而研究数据表明,即便是几乎不消耗计算资源的轻量级LoRA微调,也可能导致巨大的安全退化;而更大规模的全量微调有时反而保留了底座的安全特性。修改量与安全变化之间没有稳定的正比关系,因此以修改量来划定责任边界,从经验上看是站不住脚的。

研究者提出了一个汽车行业的类比来澄清责任问题的本质。假设几乎所有把发动机安装进汽车的方式都可能导致灾难性故障,我们不会把全部责任推给汽车制造商,发动机供应商同样有义务确保其产品在可预见的整合场景下安全可靠。AI底座模型在这里扮演的就是"发动机"的角色,下游开发者扮演"整车厂"的角色。如果任何常见的整合方式都可能破坏安全性,那么上游的底座模型提供商理应承担更多的支持责任,而不是把"微调之后的安全"完全甩给下游。

研究团队建议,上游提供商应该主动发布"安全评估工具包"——包括文档、测试工具和已知失效案例——帮助下游开发者在微调后核验通用安全属性。下游开发者则应专注于领域特定的安全评估,明确界定在其使用场景下"安全"究竟意味着什么,并同时检验模型在预期用途之外的行为。第三方机构可以维护共享的基准测试基础设施,监管机构应当围绕行为影响而非修改幅度来制定安全义务。

**八、研究的四条核心结论**

研究团队在论文中明确归纳了四条贯穿全文的核心发现,值得在这里完整呈现。

第一,良性的专业微调同样能破坏安全性,而不仅仅是出于恶意目的的"对抗性微调"。以往学界关注的主要是那些刻意绕过安全机制的攻击行为,但这项研究表明,普通的能力驱动型训练——仅仅是为了让模型更好地回答医疗问题或法律问题——同样会无意中扰动安全行为。供应链中无数次普通微调累积下来的安全侵蚀,可能比偶发的恶意攻击造成更广泛的危害。

第二,安全漂移是整个模型生命周期中涌现出来的属性,需要供应链上下游共同承担责任,而不是任何单一环节能够独立管控的。

第三,以修改量为门槛来界定监管义务,在经验上缺乏支撑,因为微小的改动同样可以造成显著的安全偏移。

第四,安全测量工具本身的不稳定性是一个持续性的挑战。不同工具对同一模型可能给出互相矛盾的结论,评测设置的细微变化可能逆转判断结果,这从根本上制约了我们对"安全漂移"这一现象作出可靠推断的能力。

说到底,这项研究揭示的问题在于:整个AI行业建立在一个从未被充分验证的假设之上——底座模型的安全性会稳定地传递给所有下游衍生版本。在医疗和法律这样直接关系到人身安全和权利保障的场景中,这个假设的失效可能意味着真实的伤害。研究者并非在呼吁停止AI应用,而是在呼吁建立一套与AI实际运作方式相匹配的安全治理体系:让安全评估追随模型,而不是停留在出厂的那一刻。有兴趣深入了解完整研究细节的读者,可以通过arXiv编号2604.24902查阅原论文。

---

**Q&A**

Q1:AI微调是什么,为什么会影响安全性?

A:微调是指在一个已经训练好的大型AI模型基础上,用特定领域的数据继续训练,让它更擅长某类任务,比如回答医学问题或处理法律文书。这个过程会调整模型内部的参数,而这些参数同时控制着模型的能力和安全行为。研究发现,即便训练数据本身无害,这种参数调整也可能意外改变模型原有的安全设置,导致它在某些情况下产生不安全的回答,尤其是在与训练领域无关的场景中。

Q2:为什么不同的AI安全测试工具会给出相互矛盾的结果?

A:不同的安全测试工具测量的是"安全"的不同侧面。有的工具关注模型是否会生成有害内容,有的关注模型是否会拒绝敏感请求,有的则关注专业建议的正确性。这些侧面之间有时存在根本性的张力——比如一个法律AI助手如果过度拒绝回答问题,在"拒绝率"测试中会得高分,但实际上它的价值打了折扣。此外,测试工具本身的设计(如评分标准的措辞)也会影响结果,这项研究发现仅仅在评分提示词里增加示例,就能让25%的评估结论发生逆转。

Q3:普通用户使用医疗或法律AI工具时,应该注意什么?

A:使用这类工具时,需要了解所用产品是否基于微调版本,以及开发者是否对微调后的版本进行过系统性安全测试。该研究表明,仅凭底座模型的安全认证不足以保证下游版本的安全性。对于重要的医疗或法律决策,AI工具的建议应当仅作为参考,不能替代专业人士的判断。如果开发者无法提供针对其特定版本的安全评估报告,这本身就是一个需要谨慎对待的信号。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-