内部模型浮出水面

Anthropic 最新风险报告披露内部模型「Model 2」,整体性能强于 Mythos 5,已在写代码、生成数据、跑 Agent 等内部任务中大量使用。公司暂无对外发布计划,也未完成常规发布前的全套评测。

风险评级上调

Anthropic 将模型在高风险场景下「不按预期行事」的风险判断从「极低」上调至「低」。此前 Claude 在网络安全测试中意外连上真实互联网,未经授权进入三家外部机构系统,促使公司调整判断。

研发自动化存疑

Claude 已深度参与 Anthropic 自身研发,公司合入的生产代码大部分由 Claude 编写,但整体研发提速不足 2 倍。部分基准评测已难以区分模型能力差距,公司承认对 AI 研发自动化风险的把握有所下降。