# 美国 AI 安全审查拟扩至开源模型:前沿定义对标 GPT-5.6,自愿框架面临收紧压力
近日,美国商务部下属的国家标准与技术研究院(NIST)及白宫科技政策办公室(OSTP)传出消息,正在酝酿将开源人工智能模型纳入联邦安全审查的适用范围。这一动向标志着美国 AI 监管框架从“闭源主导”向“全谱系覆盖”的重大转折,也意味着此前以企业自愿承诺为核心的监管模式正面临实质性收紧压力。
## 一、开源模型入局:安全审查从“黑箱”走向“白箱”
当前,美国联邦层面的 AI 安全审查主要依据 2023 年 10 月发布的《关于安全、可靠和可信地开发与使用人工智能的行政令》,但该行政令仅要求开发“前沿模型”的企业向政府报告安全测试结果,且主要针对闭源大模型(如 GPT-4、Claude 3)。新规草案拟将参数规模大、能力强的开源模型(如 Meta 的 Llama 系列、Mistral 等)也纳入审查范围。核心逻辑在于:开源模型虽开放权重,但一旦被恶意微调或部署,其潜在危害不亚于闭源模型,且更难溯源。
## 二、“前沿定义”对标 GPT-5.6:划定能力红线
新规中最具争议的条款是“前沿模型”的定义调整。据知情人士透露,NIST 计划以“综合能力超过 GPT-4 两倍”作为基准线,等效于业界预期的 GPT-5.6 水平。这一标准将覆盖当前绝大多数开源大模型,例如 Llama 3 405B 参数版本在多项基准测试中已接近 GPT-4 性能,一旦达到或超过阈值,其开发者将面临与 OpenAI 同等的报告义务。此举旨在防止厂商通过“开源+能力升级”绕开监管,但也引发了对创新抑制的担忧——开源社区可能因合规成本过高而推迟模型发布。
## 三、自愿框架的“软约束”走向“硬杠杠”
此前,美国主要 AI 企业(如 OpenAI、Google、Meta)已签署自愿安全承诺,包括开展红队测试、报告漏洞等。然而,新规拟将部分自愿义务转化为强制要求,例如:要求开源模型发布前必须进行第三方审计,并提交“能力影响评估”报告。这意味着,一旦通过行政令或国会立法正式落地,此前“自愿自律”的宽松环境将彻底终结。对于 Meta 这类开源投入最大的企业而言,压力尤为突出——其 Llama 系列若被认定为“前沿模型”,将面临与闭源巨头同等的合规成本,甚至可能被迫延迟发布或限制模型权重。
## 四、影响与展望
此举反映了美国政府在 AI 安全上从“信任企业”到“怀疑企业”的范式转变。短期看,开源模型的红线划定将加剧全球 AI 研发的“审查套利”——部分开发者可能将模型训练移至海外,或转向参数更小、能力略低于阈值的“避风港模型”。长期看,若强制审查落地,美国可能形成“闭源+开源双轨监管”格局,对全球 AI 开源生态的治理模式产生示范效应。业界需密切关注后续立法进程,尤其是《AI 安全法案》草案中关于“能力阈值”的最终表述。