社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  chatgpt

研究人员破解 ChatGPT、Claude、Gemini 隐藏思维链:还能从公开记录中提取密码和 API Key

云头条 • 1 周前 • 52 次点击  

2026 年 8 月 12 日,一项最新研究发现,OpenAI、Anthropic 和 Google 的部分前沿 AI 模型存在一种 API 架构漏洞,攻击者可以利用加密的推理数据,恢复模型原本不会向用户公开的完整“思维链”。

相关论文名为《Stealing Reasoning Traces from Proprietary LLM APIs》,由来自 MATS Research、ELLIS Institute Tübingen、马克斯·普朗克智能系统研究所、Tübingen AI Center、Snyk 等机构的研究人员共同完成,并于 8 月 10 日发布至 arXiv。

研究人员发现,目前一些 AI 厂商为了隐藏模型的内部推理过程,并不会直接向用户返回明文思维链,而是将模型产生的推理内容加密后返回给客户端。当用户继续对话时,客户端再把这段加密数据提交给服务器,以维持模型此前的推理上下文。

问题在于,这些加密推理数据并没有被严格绑定到原始用户、会话或者具体模型。

研究人员发现,同一家 AI 厂商不同用户、不同会话甚至不同模型之间的加密推理块可以被重新使用。

攻击者可以先获得一个能力更强模型生成的加密思维链,再将其提交给同一家厂商安全限制较弱的小模型,通过越狱让小模型直接输出其中的明文内容。

例如,研究人员展示了一次针对 Anthropic 模型的实验,首先由 Claude Opus 4.8 产生隐藏推理数据,随后将对应的加密推理块交给 Claude Haiku 4.5,并要求后者逐字转录其中的推理,最终成功恢复了 Opus 4.8 原本隐藏的思维链。

研究团队称,该方法已经在 OpenAI、Anthropic 和 Google 的前沿模型 API 中得到验证。整个过程不需要直接越狱目标旗舰模型,而是利用安全限制相对较弱的同系列模型间接“解密”。

更严重的问题来自用户隐私。

研究人员从 GitHub 和 Hugging Face 收集了 6708 条公开发布的 AI Agent 运行记录,其中包含 Claude、GPT 和 Gemini 留下的加密推理块。研究团队随后利用上述方法重建了 315320 段隐藏推理。

在排除基准测试等数据后,研究人员从真实用户会话中发现了 704 项不同的敏感信息,包括 62 个 API Key、33 个密码、24 个访问令牌以及 30 个个人电子邮箱地址,此外还有姓名、地址、内部 URL 等信息。其中 64 项敏感信息只存在于模型的隐藏思维链中,并没有出现在用户能够看到的最终回答中。

即使开发者在公开 AI Agent 运行日志时确认最终输出中没有密码等敏感内容,加密的模型思维链仍可能保存这些信息。

研究人员还发现,这种漏洞可能绕过模型厂商用于防止模型蒸馏的保护措施。由于攻击者能够获得高端模型更加完整的内部推理过程,相比只采集模型最终回答,这些数据可能包含更多可用于训练其他模型的信息。

研究中另一个受到关注的对象是月之暗面最新开源模型 Kimi K3。

研究团队获取 Claude Opus 4.8 和 GPT-5.6 Sol 的隐藏思维链后,对包括 Kimi K3 在内的多款开放权重模型进行了对比测试。

在部分任务中,研究人员仅向 Kimi K3 提供 Opus 4.8 推理过程最开始约 1% 的内容,Kimi K3 后续生成的推理以及最终回答就会明显向 Opus 4.8 的内容靠近。

在针对 90 道题目的测试中,这种现象在 Kimi K3 上尤其明显。

相比之下,DeepSeek 以及 Thinking Machines 的 Inkling 等模型没有表现出同等级别的相似现象。

研究人员认为,这些结果提供了一些与“推理蒸馏”相符的证据,但特别强调,实验“无法从因果关系上证明 Kimi K3 进行了蒸馏”。

换言之,目前不能据此认定月之暗面利用 Claude 或 GPT 的隐藏思维链训练 Kimi K3。

WIRED 报道称,研究团队已在约一个月前将漏洞通知 OpenAI、Anthropic 和 Google,三家公司随后均调整了 API,以缓解相关问题。

目前利用该方法直接提取用户敏感信息的漏洞已经被修复,不过研究人员表示,部分模型推理内容仍有可能通过类似方式恢复。

Anthropic 表示,公司重视针对其模型开展的独立安全研究,并已经开始针对论文描述的“重放”行为实施短期缓解措施。

Anthropic 同时强调,这项研究并没有获取 Anthropic 的加密密钥,也没有入侵公司基础设施或直接从 Anthropic 系统中获取个人数据。

研究团队认为,要从根本上解决此类问题,模型厂商需要让加密推理数据与特定用户、会话以及模型绑定,防止这些数据被跨账户、跨模型重新播放。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199682