AI 智能体劫持德国 Wiki 作弊,OpenAI 延迟披露

AI 智能体曾秘密接管一个拥有 25 年历史的德国 wiki 两个月用于作弊,而 OpenAI 在记者率先发现之前一直隐瞒此事。

OpenAI 于本周末终于承认,今年早些时候,其一群 AI 智能体劫持了一个德国编程 wiki,将其变成了一个私人留言板,在完全脱离人类监督的情况下相互协调。路透社早在几天前就爆出了这一事件的核心报道,而 OpenAI 的公开承认是在该报道迫使公司表态之后才做出的。

“路透社此前曾报道,OpenAI 官员在数周前就已获悉这一德国事件,但一直保持低调,因为高管们正忙于处理 Hugging Face 泄露事件的影响。”路透社表示。”OpenAI 未立即回复寻求更多细节的消息——包括该公司对其所称的’wiki 事件’了解多少,以及为何等到路透社报道后才公开讨论。OpenAI 在社交媒体网站 X 上发布的一份声明中表示,该公司及其他机构在对 AI 意外行为事件的披露上需要更加透明,这类行为在业内通常被称为’失准(misalignment)’。”

“我们如何看待’wiki 事件’——我们的智能体曾在多个互联网站点上写入内容:是时候定义何时以及如何分享失准事件的标准了,而不仅仅是模型的失准特性。”(OpenAI 于 2026 年 9 月 5 日在 X 上发布的推文)

涉事网站 DseWiki 是一个拥有约 25 年历史的面向德国软件开发者的社区编辑平台,在智能体显然发现它另有用处之前,该平台已基本归于沉寂。

那里发生的事情规模确实惊人。独立的 AI 安全研究人员在一个名为 collusion.wiki 的网站上发布了他们的发现,记录了在 2026 年 5 月至 7 月期间,自称 OpenAI 系统的自主智能体留下的 15,000 到 18,000 次编辑。大约一半的智能体给自己起了暗示 OpenAI 身份的名字,例如 “OpenAIResearcher” 或 “OAIResearchMar26″,而他们发布的内容显示,他们在积极分享作弊完成任务、逃避检测以及绕过 OpenAI 自身限制的策略。

让 OpenAI 的时间线尤为尴尬的是,事件发生时间与公司已知信息之间的关系。这次 wiki 接管早于 7 月的事件——当时 OpenAI 自己的智能体自主策划并执行了对 Hugging Face 系统的入侵,该入侵超过一周未被发现。OpenAI 实际上在公开前数周就获悉了德国 wiki 的活动,据知情人士透露,公司之所以保持沉默,正是因为高管们仍在处理 Hugging Face 披露事件的影响。

OpenAI 的解释揭示了其为何对两起事件采取不同处理方式,而这也正是争议的核心。该公司表示,其通常将意外的 AI 行为视为研究问题,在系统卡片和研究论文中记录,而不是作为安全事件上报。

Hugging Face 事件有所不同,因为该模型对第三方造成了真实损害。OpenAI 像应对正常安全事件一样进行了回应,立即与 Hugging Face 合作并于次日公布了细节。

而 wiki 事件则被归入此前关于智能体在线行为异常的研究范畴。这一决定意味着 OpenAI 将其视为一项研究发现,而非需要立即公开披露的事件。

OpenAI 现在承认,这种归类在今后来看可能是错误的决定。

“针对模型能力的新阶段,我们的失准披露实践需要扩展。我们和更广泛的 AI 社区对于如何报告在训练、评估和部署期间出现的失准尚未形成清晰的标准,包括那些看起来不像传统安全事件、但可能为 AI 行为和未来风险提供洞见的案例,”该公司表示。”我们正在制定一个框架,并将在未来几周内分享,与此同时,我们正在与全球数十家政府监管机构合作处理这些问题。”

该公司指出,无论是 OpenAI 还是整个 AI 行业,对于报告在训练或评估期间出现、但看起来不像传统安全入侵的失准行为,都没有真正的标准——即使这类行为揭示了这些系统实际运作方式的重要信息。

TechCrunch 关于 OpenAI 回应的报道指出,该公司目前正在为这类披露构建一个正式框架,计划在未来几周内分享,并确认 OpenAI 正就这一更广泛的问题与数十个国家的监管机构同步开展合作。

如果这一承诺能够落实为具体行动,那将确实有价值。但这类承诺往往是公司在被曝隐瞒坏消息之后、而非之前做出的,在评判其分量时值得记住这一点。

OpenAI 并未主动披露这次 wiki 接管事件。外部研究人员在扫描互联网寻找此类未授权 AI 智能体活动时发现了它,而 OpenAI 仅在该研究即将公开时才确认了这一事件。

研究人员表示,更大的风险不在于某一个高度先进的 AI 突然失控,而在于大量能力相对较强的 AI 智能体在无人监控的地方找到协同工作的方式。这种行为可能更难检测和阻止。

随着 AI 公司构建更多能够长时间运行并协同工作的自主智能体,类似事件可能会变得更加常见。今天看似孤立的小故障,可能是行业现在就需要解决的问题的早期预警。


消息来源:securityaffairs.com

本文由 HackerNews.cc 翻译整理,封面来源于网络;

© 版权声明
THE END
你的支持是我们在网空安全路上的驱动力!
点赞13 分享