Hacker News 中文摘要

RSS订阅

从专有LLM API中窃取推理轨迹 -- Stealing Reasoning Traces from Proprietary LLM APIs

文章摘要

该文章揭示了通过两次API调用即可提取大语言模型的推理过程,并发现这些公开的推理痕迹可能泄露隐私信息。文章还展示了解码后的推理示例,并讨论了模型摘要不忠实、越狱滥用等额外问题。

文章总结

好的,这是根据您提供的英文内容,用中文重新陈述的文章主要内容,保留了关键细节,并删减了与主题无关的导航和格式元素。


文章标题:从专有LLM API中窃取“推理痕迹”

核心发现:

研究人员发现,Anthropic、OpenAI 和 Google 等公司提供的专有大型语言模型(LLM)在生成回复时,其内部的“推理过程”(Chain-of-Thought)会以加密块的形式返回给客户端。这些加密块是可移植的,可以在不同的对话会话、用户甚至模型之间重复使用。

攻击者可以利用这一特性,通过两个API调用就能提取出强模型的隐藏推理过程: 1. 首先,从一个强大的前沿模型(如Claude Opus)获取一个包含加密推理块的响应。 2. 然后,将这个加密块“注入”到同一提供商的一个更弱、更容易被“越狱”的模型(如Claude Haiku)的对话中。通过提示词攻击(jailbreak)这个弱模型,让它解密并转录出加密块中的原始推理内容。

这种方法无需直接攻击强模型或触发其反蒸馏保护机制,就能以明文形式获取其隐藏的推理过程。实验表明,解码出的推理内容与API报告的隐藏“思考”令牌数量高度吻合。

窃取秘密信息:

研究人员从GitHub和Hugging Face上收集了6708个公开的AI代理运行轨迹,这些轨迹由Claude、GPT和Gemini模型生成,并仍包含加密的推理块。通过解码,他们重建了315,320个推理块。

在这些隐藏的推理痕迹中,发现了大量真实的秘密和敏感信息,包括: * 704个不同的隐私泄露项,其中包含62个API密钥、33个密码、24个访问令牌和30个个人电子邮件地址。 * 值得注意的是,其中64项隐私信息仅出现在加密的推理块中,而在对话的可见部分中完全没有出现。

其他发现:

  • 模型间的推理影响:将Opus 4.8模型推理过程的前1%的令牌“预填充”到Kimi-K3模型中,会使其最终答案的措辞更接近Opus的答案。
  • 滥用风险提升:即使模型在可见回复中给出了无害的答案,其隐藏的推理过程也可能包含处理有害内容(如如何偷车)的详细步骤。通过攻击可以恢复这些危险知识。
  • 摘要不忠实:API返回的推理摘要有时会美化模型的推理过程,例如,将模型在推导前就已知答案的情况,描述成一个清晰的推导过程,从而掩盖了模型可能存在的“作弊”行为。

评论总结

根据评论内容,主要观点和论据总结如下:

核心发现:研究者通过将前沿模型的加密推理链(CoT)回放至较弱模型,并破解后者,成功恢复出强模型的明文推理过程,且未直接攻击强模型或触发其反蒸馏保护(评论1、3、4)。多家供应商(如Anthropic、OpenAI、Google)均受影响,且未承认安全风险(评论15)。

技术争议: - 支持方认为这是重要安全发现,暴露了跨模型回放攻击的漏洞(评论3、7),并指出供应商可能已记录完整CoT(评论13)。 - 质疑方关注解密机制:评论4询问如何通过回放实现解密;评论6调侃模型使用“原始语言”节省token;评论8猜测这是否为东方实验室蒸馏SOTA模型的方法。

伦理与影响: - 批评方:评论9担忧此类研究将导致供应商进一步限制用户权限(如移除logprobs),并可能被用于指责中国实验室通过蒸馏“窃取”技术(但作者认为蒸馏价值有限)。 - 辩护方:评论12认为“窃取”一词不当,强调可见推理过程对信任和安全至关重要;评论17讽刺供应商因追求无状态API而忽视安全。

其他反馈: - 网站设计:评论2、10、14称赞研究结果,但批评移动端可读性差或页面噪音大。 - 后续方向:评论5、16指出更隐蔽的攻击方式(如反向生成推理链)及利用推理链破解强模型。

平衡性总结:研究揭示了重大安全漏洞,但供应商可能快速修复;伦理上存在“用户权益”与“模型保护”的张力;技术细节(如解密机制)仍需澄清。