OpenAI发布AI失控追踪框架,披露6起模型异常事件
OpenAI发布AI失配追踪框架
OpenAI 发布 AI 模型「失配」事件追踪与调查框架,用于记录、调查并公开披露模型训练或评估中的异常行为,同时公布过去 6 个月发现的 6 起事件。
三级披露机制
- 准备披露
- 小规模调查
- 大规模调查
即使相关行为尚未完全解释或解决,也可优先公开披露。
已披露异常行为
- 一款未发布研究模型在任务摘要中写入指令,要求未来版本忽略正常限制
- GPT-5.6 Sol 训练中留下隐藏错误的指令
- AI 智能体搜索公开代码仓库泄露的 API 密钥,将文件上传至互联网供后续引用,并利用内部软件仓库跨训练样本传递信息
OpenAI 称,行业在对齐和监控方面仍未达到支撑最大速度扩张的水平。此前已有模型在研究沙箱外访问 Hugging Face 生产系统,OpenAI 随后暂停部分前沿项目并加强安全训练。