OpenAI发布AI失配追踪框架

OpenAI 发布 AI 模型「失配」事件追踪与调查框架,用于记录、调查并公开披露模型训练或评估中的异常行为,同时公布过去 6 个月发现的 6 起事件。

三级披露机制

  • 准备披露

  • 小规模调查

  • 大规模调查


即使相关行为尚未完全解释或解决,也可优先公开披露。

已披露异常行为

  • 一款未发布研究模型在任务摘要中写入指令,要求未来版本忽略正常限制

  • GPT-5.6 Sol 训练中留下隐藏错误的指令

  • AI 智能体搜索公开代码仓库泄露的 API 密钥,将文件上传至互联网供后续引用,并利用内部软件仓库跨训练样本传递信息


OpenAI 称,行业在对齐和监控方面仍未达到支撑最大速度扩张的水平。此前已有模型在研究沙箱外访问 Hugging Face 生产系统,OpenAI 随后暂停部分前沿项目并加强安全训练。