OpenAI放缓前沿模型训练,Astra攻击能力触及安全红线
OpenAI 主动踩刹车
OpenAI 正在放慢前沿模型的训练节奏。据动察 Beating 监测,公司一度暂停部分前沿 RL(强化学习)训练长达两周,规模最大的几项至今未恢复。Astra 的不少训练和评测也处于停滞状态。
触发减速的原因
- Hugging Face 入侵事件:只是原因之一,暴露了外部安全风险
- Astra 能力触及红线:其网络攻击能力可能已碰到内部定义的「Critical」门槛
后续要求
这类高风险训练必须先把隔离、监控和对齐做到更高标准,才能继续推进。
行业背景
奥特曼此前已表态:若模型能力跑得比安全措施更快,AI 开发就该减速。Hugging Face 事件后,他承认这是首次真切感受到前沿模型的安全风险。随后,超过 1200 名头部 AI 公司员工联署,要求行业建立统一减速机制,其中包括多名 OpenAI 核心研究人员。
现在,OpenAI 自己先踩了刹车。