李飞飞谈 AI 安全:不能仅由开发者自评系统
近日,斯坦福大学人工智能实验室联合主任、著名科学家李飞飞在公开演讲中再次聚焦 AI 安全议题,明确提出:“AI 系统的安全性评估不能仅仅依赖开发者自己的判断。”这一观点直击当前 AI 治理的核心痛点——当技术飞驰向前时,谁来为系统的潜在风险“踩刹车”?
自评体系的天然局限
李飞飞指出,开发者自评存在三重结构性缺陷:**技术盲区、利益冲突与责任稀释**。一方面,大模型的黑箱特性使得开发者自身也难以完全预判模型在边缘场景下的行为;另一方面,商业竞争压力天然削弱了企业主动披露漏洞的动机。去年某知名大模型在未公开测试的情况下仓促上线,导致生成有害内容的事件,正是自评失效的典型案例。
需要“外部测试”与“公共审计”
李飞飞强调,AI 安全应借鉴航空、医药等领域的监管经验:**独立的第三方测试机构**是必要的。她建议建立类似“FDA 式”的 AI 安全审查流程,由跨学科的专家团队对系统进行压力测试、对抗性检测与公平性审计。此外,她还呼吁推动“模型卡”标准化披露制度,让公众与监管者能清晰了解模型的训练数据、性能边界及已知风险。
从“信任”到“验证”
当前,全球 AI 治理正处在一个关键转折点。欧盟《人工智能法案》已要求高风险系统接受第三方合格评估,美国白宫也发布了 AI 安全自愿承诺,但李飞飞认为,**“自愿”不应成为默认选项**。她最后警示:如果行业不能主动建立可信的外部评估机制,那么未来更严苛的禁令与诉讼将不可避免。AI 安全不是一道可自我开脱的“选择题”,而是一道必须由全社会共同负责的“必答题”。