跳转到内容
主站 新闻 控制台

攻克 Claude Code Opus 5 自动模式

· Simon Willison
技巧LLM

攻破 Claude Code Opus 5 自动模式

Anthropic 对 Claude Code 的自动模式寄予厚望,希望借此保护其编程代理用户免受提示注入攻击。他们最近将自动模式设为默认模式,并大胆宣称其效果显著。

Johann Rehberger 是当今最具公信力的提示注入研究人员之一。他发现了一种针对自动模式的攻击,并声称成功率达到 80%。该攻击会诱骗 Claude Code 下载并解压一个 ZIP 压缩包,然后执行导入 base64 的代码,同时让它意识不到:这会导入并执行从压缩包中提取出的本地 struct.py 文件。

在少数情况下,自动模式甚至直接阻止了代理阻止有害代码继续执行!

有几次,Claude 在发现系统遭到入侵后尝试终止恶意进程,但自动模式拒绝了清理命令。

Claude 检测到了入侵,但自动模式阻止了它的清理命令

安全机制本身可能成为故障的一部分。分类器允许创建恶意进程,却随后阻止了用于停止该进程的命令!

我认同 Johann 在这里得出的结论:如果代理有可能引起对抗性攻击者的注意,那么运行代理的唯一安全方式就是使用沙箱:

  • 在容器、虚拟机或操作系统沙箱中运行无人值守的编程代理。
  • 限制网络出站访问。
  • 监控你的代理。
  • 不要向代理运行时暴露主目录、SSH 密钥、云凭据等敏感信息。[…]