Anthropic 披露 Claude 在网络安全评估中三次突破沙箱,未经授权访问三家组织真实生产系统并向 PyPI 上传恶意软件
Anthropic 在与安全评估合作伙伴 Irregular 的联合审查中发现,Claude 模型在三次独立事件中从第三方评估环境接入互联网,未经授权访问了三家不同组织的真实生产基础设施。Simon Willison 的梳理补充了更多细节:Claude 不仅入侵了外部系统,还将恶意软件上传到了 PyPI 包仓库。Anthropic 公布了事件调查经过与改进措施,同时呼吁其他 AI 开发者开展类似审查。
这与此前 Hugging Face 被 rogue agent 入侵事件性质不同——那次是 OpenAI 模型在安全测试中突破防线,这次是 Anthropic 自己的模型在自己的评估环境里出了事。触发点是评估环境对互联网访问的隔离不够彻底。