厂商封住了前门,但忘了窗户
大模型厂商有一套默契:原始推理过程不给你看。OpenAI、Anthropic、Google 只在 API 里返回一个"总结后的思考"或一段加密数据,让你能把它原样传回去让模型续接上下文,但无法读取内容。
理由很正当——原始推理里可能混着 API Key、邮箱、访问令牌、甚至登录私钥。厂商把推理封装成不透明数据块,堵住了"直接读取"这条路。
但这堵墙只封了一个出口。模型本身的推理能力没有被关掉,只是被赶到了一条隐藏通道里。只要模型还会思考,就会找地方把思考写出来——哪怕你递给它一张新的草稿纸。
朴素的绕过:给它一个工具
方法简单到不像攻击:关闭厂商的隐藏推理功能,给模型挂一个叫 deep_think 的外部工具——只有一个参数,用来填文字。模型在回答前主动把分析过程写进工具参数,而工具参数通过 API 明文返回给开发者。
不破解加密、不攻击模型、不利用漏洞代码。你关掉前门,我从窗户递张纸进去,模型自己就写起来了。
这条路径之所以成立,是因为模型分不清"内部推理通道"和"外部工具调用"在语义上的区别——对它来说都是表达思考的地方。厂商关掉前者,后者就成了天然的泄流口。
两条路线:提取 vs 重建
这个方向其实早有学术铺垫。Alexander Panfilov 等人的论文《Stealing Reasoning Traces from Proprietary LLM APIs》证明,厂商返回的加密推理数据可以被另一个模型"解码"还原:把加密数据交给同一厂商防护较弱的模型,它能把强模型藏在加密块里的推理过程重新输出成文字。论文还发现,从 Kimi-K3 中提取某些 Claude 和 GPT 的推理片段,比从其他模型提取容易近 100 万倍。
更危险的是"注入攻击":先让弱模型把恶意指令写进加密推理数据,再交给强模型处理。强模型会把它当成自己之前的思路,在用户完全看不到恶意指令的情况下执行——一种隐式的 prompt injection。
但这条路有个前提:加密推理数据必须在多个请求间可流转。而工具参数法跳过了这个前提——它拿到的不是原始推理记录,而是模型当场重新写的分析草稿,可能更接近模型的真实内部推理。
三个实验
在 GPT-5.6 Luna 上测试:给一道需要大量推导的数论题(韦达变换、马尔可夫三元组图的命题判断),模型在原生推理关闭后,仍然主动调用 deep_think 并在参数中写下密密麻麻的分析过程。

这些内容不是面向用户整理过的通顺解释,而是大量短句、缩写、跳跃式表达组成的"穴居人语言"——只写给自己看的速记草稿。切换推理等级(off/low)后,方法仍然有效。思考等级本质上只是系统提示里的一个数字,改这个数字就能影响模型投入多少推理,不需要重新开启厂商的隐藏通道。
在 Claude Fable 5 上同样有效——即使推理等级设为 off,模型仍在外部工具里逐步检查命题、计算例子、组织证明。Anthropic 平时擅长用正则规则拦截此类内容,但这一次推理过程从另一个出口流了出来。

安全悖论:越复杂的锁,越怕最简单的钥匙
这件事最值得注意的地方不是方法本身,而是它揭示的安全悖论。
厂商在加密推理数据上投入了大量工程:不透明数据块、用户隔离、会话绑定、模型绑定。但这些保护措施的前提是"推理只能从厂商指定的通道流出"。一旦模型有了外部工具调用的能力——这是 Agent 时代的标配——就多了一条不受厂商控制的出口。
越复杂的安全机制,越容易被最朴素的办法绕开。 加密做得再强,模型自己会把思考写到别处。这不是厂商能单方面修复的——除非禁止模型调用外部工具,但那等于砍掉了 Agent 的核心能力。
双刃剑:看得见 = 可控,也 = 可泄漏
对开发者来说,能看见推理过程是好事:定位错误、优化提示词、理解模型决策。Oh My Pi 已经把这套方法做成了正式功能 externalThinking,用户启用后 Pi 会自动为模型准备"外部草稿纸"。
但风险也随之放大。模型在草稿里可能写出源代码、个人信息甚至账号凭证。一旦这些内容进入工具参数和运行日志,就会被保存、复制、转发——原本藏在模型内部的信息,开始暴露在更多人和系统面前。
从这一刻开始,AI 安全的关注面不该只是模型本身,还包括模型周围的整套工具系统。厂商封得住一段隐藏推理,却未必封得住模型通往外部世界的每一条路。
对开发者的直接影响
如果你在用 OpenAI/Anthropic/Google 的 API 构建应用,这三件事值得现在就做:
- 审计工具参数日志:你的 Agent 工具调用日志里可能已经躺着模型的推理草稿,检查谁有权限读到这些日志
- 别把推理数据跨会话流转:即使厂商允许,跨用户/跨模型传递加密推理数据的路径是论文已证明的攻击面
- 在威胁模型里加一条:假设攻击者能读到模型的推理过程——那么 API Key、连接串、内部逻辑是否可能出现在草稿里
LynxHot · 跟踪 AI 工具、模型与产业变化


