Anthropic向外部安全审查员开放员工级权限,可独立发布结论
Anthropic开放外部安全审查权限
Anthropic 宣布,将允许第三方安全团队长期驻场,提供工位、门禁、公司电脑,以及接近内部风险评估团队的工具和权限。
- 审查范围:可检查训练流程、安全措施与事故
- 发布权:可独立对外发布结论
- 删除边界:Anthropic 可删除涉及安全、法律和客户隐私的信息,但不得因结论不利而删除
CEO Dario Amodei 称,这一做法比目前任何 AI 公司都走得更远。
Dario 态度转向
Dario 表示,2023 年业界讨论暂停 AI 时,他认为没有意义。如今 AI 已深度参与下一代 AI 研发,能力进步加速,仅靠安全研究已不够,模型能力本身也应慢下来。
他点名 OpenAI 的 Hugging Face 失控事件,警告照当前速度,6 到 12 个月后类似 Agent 群可能具备建立大规模僵尸网络的能力,或造成数千亿美元损失。
后续主张
Dario 希望美国等民主国家头部 AI 公司统一安全标准与研发速度,再尝试与中国协调全球 AI 发展节奏。但先进芯片与模型蒸馏限制仍应保留。