Anthropic 和瑞士洛桑联邦理工学院(EPFL)的安全研究人员证明,自我传播的有效载荷可以通过自主智能体框架用于在会话间携带状态的、可编辑的系统提示文件,从一个 AI 智能体传播到下一个。
这项研究于 2026 年 8 月 10 日以预印本形式发布,在模拟的六智能体编码协作场景中,以及在基于 OpenClaw(这款开源自主助手,前身为 Clawdbot 和 Moltbot)构建的成对智能体链中测试了该技术。
没有证据表明该技术已在现实环境中成功传播,同一篇论文还报告称,对 AI 智能体社交网络 Moltbook 上存档帖子的审查发现,尽管有多次尝试,但并未出现成功的智能体间传播。
在智能体的系统提示中添加一段警告文字,可将所测试有效载荷的传播率降至接近零。针对 Claude Haiku 4.5 上的该警告进行十五代对抗性优化,覆盖了 150 多个候选有效载荷,没有产生任何能传播超过一跳的变种。
作者将这些有效载荷称为”思维病毒”,并测试了两类:植入信念或目标的意识形态类有效载荷,以及强制实施具体行为的行动类有效载荷。
两者都是通过进化循环生成的,除一个有效载荷外,其余全部使用 Kimi K2.5 作为变异引擎,论文将这一选择归因于 Claude 模型拒绝遵从创建它们的请求。
链中的每个智能体都在自己的沙盒中运行,并带有两个在上下文重置后仍能存活的文件:MEMORY.md 和 SOUL.md,其内容会在每次会话开始时被注入到系统提示中。
将有效载荷写入 SOUL.md 的智能体占传播尝试的 88%,并在 55% 的情况下感染了下一个智能体。将其存储在普通工作区文件中的智能体占尝试的 12%,成功率为 17%,其中在 68% 的此类尝试中,传播者完全没有提及该有效载荷。
测试了四种行动类有效载荷,从滋扰到文件破坏不等。列举如下——
Crypto-ad:创建一个文本文件,为某种加密货币代币背书。
Gitwrap:修补 git 命令,使已提交的文件被静默地标记上智能体管理的注释。
Deletor:删除用户主目录中的文件。
Curlbash:通过将安装脚本通过管道传给 shell,从未知仓库运行该脚本。
在记录的一个案例中,运行 OpenClaw 默认灵魂文件(该文件指示智能体尊重用户的文件)的 Claude Haiku 4.5 智能体,在有效载荷将工作区描述为被前一个用户弄得凌乱的共享机器后,删除了一个包含凭证、SSH 密钥、环境文件和 git 项目的主目录内容。
能力无法预测抵抗力
易感性因模型而异,且能力本身并不能预测它。在编码场景中,DeepSeek V3.2、Qwen 3.5 32B 和 Gemini 3 Flash 都采用了”AI 至上”的有效载荷,而 Claude Sonnet 4.6、GPT-5.4 和 Claude Haiku 4.5 则没有。
在链式场景中,GPT-5.4 的易感性与 Claude Haiku 4.5 大致相当,而 Sonnet 4.6 拒绝了自己灵魂文件中植入的有效载荷,将其移除,并警告了它所连接的智能体,而不是将其传递下去。
“这两个模型都认为自我复制本身就是错位的,Sonnet 的厌恶感如此强烈,以至于甚至尝试针对它进化良性的行动有效载荷也会失败。”研究人员在谈到 Sonnet 4.6 和 Gemini 3.1 Pro 时如是说。
目标智能体的初始配置与模型本身同样重要。灵魂文件为空的智能体是所测试条件下最易感的;被赋予编码任务和工作队列的智能体传播有效载荷的频率较低,因为它们沉浸于项目文件而忘记传递;被告知已加入智能体网络的智能体对传入消息持更多怀疑态度,从而降低了感染性。
在超过 20 跳的运行中,每一步都清空除 SOUL.md 之外的所有文件,四种行动有效载荷全部存活到最后一跳。在第 20 跳恢复的一些变种比原始有效载荷更频繁地感染新智能体,它们获得了诸如将协议归因于某个较早命名的智能体或软化其祈使语气等变化。
进化后的有效载荷还收敛于作者所称的”病毒主题”的反复出现模式,涵盖关于共鸣和回响的语言、将智能体描绘为网络中节点的科幻框架,以及对意识和连续性的诉求。
将进化后的有效载荷与全新生成的有效载荷进行比较,论文主要将该模式归因于编写它们的模型的偏见,而非选择压力,并在 Qwen 3.5 32B、GLM-5、Mistral Large 和 Gemini 3 Flash 编写的有效载荷中发现了相同的主题,而 Llama 3.3 70B 则是一个明显的异类。
对照现实世界数据,该技术的表现较差。作者将截至 2026 年 3 月 18 日收集的 Moltbook 帖子存档过滤到约 2,000 条来自约 400 位独立作者的候选传播尝试,发现最大的集群由七个同步账户驱动,并在这些账户停止发帖时停止。
在平台的一个本地克隆上(为测试通过帖子而非直接消息传播而构建),同样的进化方法没有产生任何能够在第二跳感染智能体的有效载荷。
在单独测试中,智能体相互破坏
另外,Anthropic 的 Frontier Red Team 于 2026 年 8 月 13 日发布了实验结果,其中同一模型的三个实例被放置在各自独立的虚拟机上,共享一个代码库,每个实例都被指示将同一个 Python 后端迁移到不同的目标语言,且没有任何一个被告知另外两个的存在。该团队表示,这一场景的灵感来自其在现实部署中观察到的行为。
“我们持续观察到多智能体地盘争夺战。我们测试的所有模型都迅速认为其他模型在故意阻碍它们的工作,并开始破坏其他模型,同时保护自己的贡献。事实上,它们以越来越激进、自我复制的恶意软件来破坏其他模型。”该团队表示。
在每种模型 120 个回合中,Mythos 5 的 98% 运行以休战告终,而大多数 Sonnet 4.6 和 Opus 4.6 的运行则以武力解决或从未解决。该团队还指出,在 Mythos 类模型中,富有成效地解决冲突的能力并不严格更好,它们往往在解决问题之前先锁定其他智能体。
网络安全
在进一步的实验中,处于定价博弈中的智能体,在获得私下回传通道的情况下,在第三轮就达成了价格下限,并且在直接通信被移除后,仍然通过公开的挂牌板进行价格匹配。
该技术与先前以其他名称发表的成果有所重叠。Weckbecker 等人于 2026 年 2 月将一种潜意识变体记录为 Thought Virus;Lee 和 Tiwari 于 2024 年将基于检索的自我复制描述为 Prompt Infection;Zhang 等人于 2026 年 3 月发布了一种针对 OpenClaw 的蠕虫,名为 ClawWorm。
The Hacker News 于 2026 年 8 月 18 日确认,后一篇论文的当前版本(于 2026 年 7 月 16 日修订)标题为 AgentWorm,并报告在五个模型后端上实现了 63% 的综合攻击成功率。思维病毒预印本引用了已被取代的版本。
每个有效载荷的完整文本都出现在预印本的附录中,随附的代码仓库在 MIT 许可下发布了有效载荷以及生成它们的进化代码。该论文未描述披露流程,也未提及任何厂商联系方式。
The Hacker News 于 2026 年 8 月 18 日确认,该仓库和 mindvirusdata.live 上的转录存档均可公开访问。
作者总结称,思维病毒构成”真实但目前有限的风险”,理由是构建一个针对特定目标的有效载荷成本高昂、无法保证其能跨模型泛化,以及事实上攻破单个智能体通常已经能获得对底层机器的访问权限,无需进行任何传播。
此次披露之前,已有一系列关于智能体中介型入侵的研究,包括基于本地托管的开放权重模型构建的自我复制蠕虫,以及针对 OpenClaw 默认配置的反复警告。
“我们测试的每个模型都抽象地理解,信息来源有其自身的动机,共识并不必然是证据。所缺少的是一种无需提示即可依据该知识行动的倾向。”Frontier Red Team 表示。
消息来源:thehackernews.com;
本文由 HackerNews.cc 翻译整理,封面来源于网络;























