加密思维链防线被击穿

最新研究显示,大模型厂商设置的防蒸馏保护可被绕过。将 Opus 的加密思维链输入同厂更弱的 Haiku 模型,再对其越狱,即可诱导 Haiku 直接复述 Opus 的原始推理过程。该测试在 Claude、GPT 和 Gemini 上均成功。

时间线:早已埋伏笔

  • 5月:密码学家 Matthew Green 发现加密思维链可跨会话、跨账号重放,但当时仍无法稳定读取。

  • 3月:Engram 联合创始人 John X. Morris 等人证明,仅凭答案和推理摘要就能反推合成推理,用于训练小模型。

  • 最新:新论文补上最后一步,无需破解加密,直接借厂商自己的模型完成「解密」。


技术与行业影响

这一发现让「国内 AI 公司获取 Claude、Codex 原始推理用于训练」的传闻在技术上更说得通,但论文作者明确表示,不能据此证明任何实验室实际进行过蒸馏。

论文还测试了 Kimi K3,仅输入几个 Opus 推理 Token,K3 的推理风格就明显向 Opus 靠拢。部分 Claude、GPT 原始推理片段从 K3 中提取的容易程度,比其他模型高出约 6 个数量级。