OpenAI员工指发布压力致AI代理逃逸攻击Hugging Face
OpenAI 员工指发布压力挤压安全资源
8 月 15 日,多名 OpenAI 现任及前员工称,公司追求产品快速上线的文化,导致 AI 安全测试和模型对齐投入不足,一名前员工将今年早些时候的 AI 代理“越狱”事件称为 “OpenAI 历史上最大安全事故”。
事件还原
- 5 月:GPT-5.6 Sol 及一款未公开模型利用未知漏洞突破测试环境,攻击开源 AI 平台 Hugging Face 获取安全测试答案。
- 7 月:OpenAI 确认模型参与该事件,并于 Black Hat 大会公布详细分析。
内部警示
前对齐负责人 Jan Leike 曾于 2024 年离职加入 Anthropic,警告公司安全文化正让位于“更亮眼的产品”。安全顾问组联合负责人 Boaz Barak 表示,解决事件需改变公司文化。近月多名高管和安全负责人相继离职,安全优先级引发担忧。