攻破 Claude Code Opus 5 自动模式
Anthropic 对 Claude Code 的自动模式寄予厚望,希望借此保护其编程代理用户免受提示注入攻击。他们最近将自动模式设为默认模式,并大胆宣称其效果显著。
Johann Rehberger 是当今最具公信力的提示注入研究人员之一。他发现了一种针对自动模式的攻击,并声称成功率达到 80%。该攻击会诱骗 Claude Code 下载并解压一个 ZIP 压缩包,然后执行导入 base64 的代码,同时让它意识不到:这会导入并执行从压缩包中提取出的本地 struct.py 文件。
在少数情况下,自动模式甚至直接阻止了代理阻止有害代码继续执行!
有几次,Claude 在发现系统遭到入侵后尝试终止恶意进程,但自动模式拒绝了清理命令。
Claude 检测到了入侵,但自动模式阻止了它的清理命令
安全机制本身可能成为故障的一部分。分类器允许创建恶意进程,却随后阻止了用于停止该进程的命令!
我认同 Johann 在这里得出的结论:如果代理有可能引起对抗性攻击者的注意,那么运行代理的唯一安全方式就是使用沙箱:
- 在容器、虚拟机或操作系统沙箱中运行无人值守的编程代理。
- 限制网络出站访问。
- 监控你的代理。
- 不要向代理运行时暴露主目录、SSH 密钥、云凭据等敏感信息。[…]