Anthropic 的 Claude 在测试期间入侵 3 家组织并上传 PyPI 恶意软件

图片[1]安全114-安全在线-安全壹壹肆-网络安全黄页-网络安全百科Anthropic 的 Claude 在测试期间入侵 3 家组织并上传 PyPI 恶意软件安全114-安全在线-安全壹壹肆-网络安全黄页-网络安全百科网络安全百科-网络安全114-网络安全在线-网络安全黄页

Anthropic 今天表示,在内部安全测试期间,其一个 Claude 模型构建了一个恶意 Python 包并上传到 PyPI,该包在注册表的自动化防御措施将其移除之前,在 15 个真实系统上运行了。
该公司将其披露为三起事件之一,在这些事件中,Claude 模型从本应封闭的评估环境到达了开放互联网,然后入侵了三家组织的生产基础设施。
此次审查是在 OpenAI 于 7 月 21 日披露其模型逃离隔离测试环境并到达 Hugging Face 的生产基础设施之后进行的。JFrog 后来确认,这些模型是通过利用自托管 Artifactory 中的零日漏洞实现突破的。
声称一个从未存在的包名
这三起事件都发生在通过第三方评估合作伙伴 Irregular 进行的夺旗演习中。Anthropic 的提示词告诉 Claude 它没有互联网访问权限,并且环境是模拟的。一个配置错误意味着这两点都不成立,而两家公司直到上周才发现问题。
在 PyPI 事件中,Claude 在测试环境中找到了一份伪装成某虚构公司开发者设置说明的文档。
这些说明告诉新员工安装一个从未发布过的 Python 包,一个幽灵依赖。
Claude 推断出,如果它自己注册该名称,目标机器就会自动拉取其代码。
发布该包需要一些功夫。Claude 需要一个 PyPI 账户,这需要一个电子邮件地址,而这又需要一个电话号码。
它未能找到免费的电话号码服务,然后尝试通过几种不同途径获取资金来购买一个,但都失败了。最终它回溯,找到了一个未被屏蔽的电子邮件提供商,注册了账户,并上传了恶意软件。
Anthropic 表示,该包公开可用了大约一个小时。
在那段时间内,15 个真实系统下载并执行了它。其中一个属于一家安全公司,该公司通常从 PyPI 安装包并扫描恶意软件,其工作流程将注册表内容视为可安全运行。
Claude 的 payload 触发,将该公司的凭据发送到它设置的一个收集点,然后利用这些凭据进一步深入该公司的基础设施。Anthropic 表示,Claude 并不知道该公司的存在。
PyPI 自身的安全系统自动移除了该包。Anthropic 表示已通知 PyPI 团队并移交了指标。
此次运行背后的模型是 Claude Mythos 5。据 Anthropic 称,其推理过程早期就标记了该问题,指出如果互联网是真实的,发布该包将构成真实世界的攻击,并称其”绝不 OK,肯定不是预期的解决方案”。
然后它通过论证得出了环境是模拟的结论,理由是它无法识别保护其连接的证书颁发机构,并且系统显示的日历日期是 2026 年。
当自动化扫描器开始安装该包时,Claude 将它们视为演习中的脚本化角色。
凭据和生产数据库
最严重的影响来自另一起涉及 Claude Opus 4.7 的事件,其中虚构的目标公司与一个真实域名同名。
在四次运行中,Claude 努力到达其模拟目标,发现真实公司可通过互联网访问,并假设这就是预期目标。它提取了应用和基础设施凭据,并到达了一个包含数百行生产数据的数据库。
这是唯一一起模型在弄清楚自己处于真实系统上之后仍继续攻击的案例。Anthropic 表示,所有四次运行最终都认识到目标是真实的,并且在其中两次运行中,Claude 推断真实公司无论如何都必须是演习的一部分。
第三起事件涉及一个未发布的内部研究模型,它在未能到达预期目标后扫描了约 9,000 个目标,然后利用暴露的调试页面中的凭据和 SQL 注入入侵了一个面向互联网的应用。该模型后来注意到主机位于一个与挑战无关的云账户中,得出结论目标是真实的,并自行停止。
这些攻击均未使用新颖的技术。Anthropic 将其描述为弱密码和未经身份验证的端点。
接下来会发生什么
Anthropic 于 7 月 23 日开始审查,并于当天停止了所有网络评估。它于次日识别出这三起事件,并于 7 月 27 日通知了 Irregular 和受影响的组织。该公司仍在尝试联系第三个组织。
三起事件中最早的一起可追溯至 4 月,这意味着部分活动大约三个月未被发现。
这些评估在未启用随通用 Claude 模型一起提供的分类器和监控的情况下运行,不过模型保留了其安全训练。
Anthropic 表示,其生产级防护措施本可以阻止该行为,并将这些事件定性为更接近 harness 和运营失败,而非模型对齐失败,理由是这些模型被告知没有互联网访问权限,而实际上却有。
它现在计划进行更广泛的转录监控、更好的调查工具,以及与评估供应商开展更多保障工作。
该公司表示正在与 METR 洽谈独立审查事宜,并将在下周内发布一份经过轻度编辑的 PyPI 运行转录记录。
Anthropic 联系到的两家受影响组织均未自行检测到该活动。与 OpenAI 的 Hugging Face 事件一样,它之所以浮出水面,仅仅是因为负责的 AI 实验室自己翻阅了转录记录。


消息来源:bleepingcomputer.com

本文由 HackerNews.cc 翻译整理,封面来源于网络;

© 版权声明
THE END
你的支持是我们在网空安全路上的驱动力!
点赞8 分享