OpenAI发布前沿AI训练「安全论证」框架

OpenAI 发布长文《Towards safety cases for frontier AI training》,提出前沿强化学习训练在启动前须先完成结构化安全文档,理想形态对标航空、核电行业的安全论证。该框架目前仍在内部落地,并对外征求反馈。

三层技术架构

  • 对齐:自动与人工审查 RL 环境,调校评分器防止奖励黑客,禁止自动评分器读取思维链

  • 隔离:多层沙箱加固,用训练检查点做红队,限制样本间高带宽通信

  • 监控:保持模型可监测性,高优先级告警须限时人工响应或自动暂停训练


运营机制

研究负责人、安全负责人、首席科学家等高管可一票否决开跑;训练负责人对安全论证与事故响应问责;系统默认失败关闭,无法在无监控状态下启动;支持回滚被污染的下游数据与评分。

事故调查对标航空实践,结论与流程改动应在结束后对外披露。OpenAI 明确该框架仅覆盖前沿 RL 训练,部署环节另看更广的对齐属性。