最新论文引爆讨论:AI 「深度思考」过程可被免费蒸馏,闭源厂商最值钱的训练资产正被搬空
8 月 10 日,一篇论文提交到 arXiv,第二天项目网站 stolen-thoughts.com 上线,逐条展示从多家闭源模型里取出的「思考记录」,在 Hacker News 冲上 500 分。
项目负责人 Alexander Panfilov 在 X 上写道:「我们找到了一种方法,利用所有前沿 AI 公司 API 中的漏洞,提取前沿模型的隐藏推理。」
换句话说:你以为只有 AI 自己知道它在想什么,其实有人能把它摊开来看。

你贴进 AI 的东西,可能正跟着它的「思考」一起漏出来
研究者扫描了网上公开分享的约 7000 个 AI 助手会话记录,把其中被加密的「思考过程」一一解开,然后发现了一些本不该出现的东西。
Panfilov 在推文中说:「我们初步扫描了约 7000 个公开会话,发现了 62 个唯一 API 密钥、33 个邮箱地址、33 个密码,以及其他敏感信息。」
更刺眼的是细节。一个航班预订任务的「思考」里,躺着完整的姓名、邮箱、护照号、出生日期,以及带安全码的信用卡号。Anthropic、AWS、GitHub 等平台的密钥也出现在案例里。也就是说,你为了让 AI 帮你干活而贴进去的凭据,会顺着它的思考过程一起被存下来,再被别人一把抓走。
「如果你曾在网上分享过带加密推理块的 Claude Code 或 Codex 会话,它们都可以被解码,并泄露你的个人数据。」Panfilov 写道。
对普通用户最直接的提醒就是:别再把机密往 AI 里贴了,哪怕它说「我不会外传」。
厂商先说「没事」,再偷偷修
这件事不是突然发生的。今年 5 月,约翰霍普金斯大学密码学教授 Matthew Green 就已经向厂商报告了类似的漏洞,当时得到的回应是「没有看到任何安全影响」。
等到 Panfilov 团队正式披露,厂商的态度变了。「我们随后走了负责任披露流程,厂商已经修补了这一漏洞引发的若干问题,据我所知仍在继续。」Panfilov 说。论文也确认,披露之后,研究者已经无法再复现同样的攻击。
问题在于:漏洞存在了几个月,用户并不知情。等到被公开、被讨论,修补才真正落地。这不是某一家公司的错,而是整个行业「加密即安全」的假设第一次被公开戳破。对读者而言,真正值得记住的是一句话:你信任的那家 AI 公司,可能没把全部风险告诉你。
你用的模型,可能不再那么「独家」了
更长的变化在产业层面。
推理能力是 OpenAI、Anthropic 们定价的地基,也是它们最不愿对外示人的部分。一旦这段思考能被批量提取,竞争对手就能以极低的成本,把最强模型的「思路」喂给自己的模型去学。论文里还提到一个未经同行评审的初步观察:用少量最强模型的「思考」去引导另一个模型,会明显把后者的回答拉向前者的方向。
这意味着什么?闭源模型的护城河,原本是「你用钱买不到我的脑子」。现在这道墙出现了裂缝。对使用者来说,短期谈不上坏事:更强的竞品可能更快冒头,价格也可能被压下来。但代价是,你再也分不清一个模型是真的聪明,还是抄了别人的思路。
「付费却看不到的思考」到底属于谁,是这场争论的实质。一个技术事实已经摆在这里:只要这段思考还留在客户端手里,加密就只是障眼法。
而对闭源厂商来说,比漏洞更难修补的是叙事:推理即护城河这个故事,第一次被证明是可以被批量拆开的。











