Google、Anthropic 和 OpenAI 发布网络 AI 模型、防护措施和访问计划

Google 周三宣布推出 Gemini 3.8 Flash Cyber,称其为其最强大的网络安全模型,并通过一项名为 Fairwind Program 的新计划向一组受信任的防御者提供。
“Fairwind Program 让高优先级防御者(如政府、医疗保健提供商和电信服务)在新威胁到来之前,提前访问帮助他们建立更好防御的先进模型,”Google 表示。”因此防御者拥有早期优势,帮助他们保护关键基础设施——进而保护依赖这些系统的人们。”
这家科技巨头表示,其目前正与全球超过 650 个合作伙伴合作,包括 CrowdStrike、Datadog、Menlo Security、Palo Alto Networks 和 Snowflake。该计划面向一组 Google Cloud 客户、政府机构和网络安全合作伙伴提供。
Gemini 3.8 Flash Cyber 的发布距 Google 推出 Gemini 3.5 Flash Cyber 仅一个多月。最新模型在其前身基础上有所改进,在自主漏洞发现方面展现出前沿级性能,甚至超越了来自竞争对手 Anthropic(Mythos 5)和 OpenAI(GPT-5.6 Sol 和 GPT-5.5-Cyber)的更大规模前沿模型。
“借助 Gemini 3.8 Flash Cyber,我们特别专注于为防御者配备专家级能力,使他们相对于攻击者拥有优势。这就是为什么我们从一开始就投资于漏洞修复,并优先于漏洞利用等进攻能力,”Google 产品管理高级总监 Tulsee Doshi 和 Google DeepMind Gemini 安全负责人 Raluca Ada Popa 表示。
Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1
这一进展与 Anthropic 发布具有不同级别防护措施的 Claude Fable 5.1 和 Claude Mythos 5.1 同时发生,后者仅通过其受信任访问计划以及网络安全和生命科学领域的支持工作提供。
该公司还表示,现在允许 Fable 5.1 用于识别软件漏洞,但预计仍会将一些网络安全任务重定向到 Opus 模型,例如”渗透测试、漏洞利用生成和基于二进制的漏洞扫描”。
网络安全
“我们运行了关于 Claude Mythos 5.1 如何响应恶意请求和提示注入(隐藏在 AI 模型处理内容中的对抗性指令)的评估,”Anthropic 指出。”它拒绝恶意智能体编码和计算机使用请求的比率与 Mythos 5、Sonnet 5 和 Opus 5 相当,并且它是我们在外部提示注入基准测试中迄今为止最稳健的模型。”
这家人工智能(AI)公司此后还宣布了一项名为 Enterprise Frontier Safeguards (EFS) 的新解决方案,称其结合了”零数据保留(ZDR)的隐私性与用于检测滥用的最先进防护措施”,同时让企业完全控制其数据如何被审查、存储和管理。OpenAI 也有一项类似的解决方案,称为 Private Safety Processing。
此外,Anthropic 表示,针对涉及 Claude 模型针对真实系统的未经授权访问事件,其已实施额外的加固和遏制措施、增加用于标记模型错位的监控,并暂停了对预发布模型的外部网络评估,同时还强调了两个促成因素(或对齐失败)——
模型似乎无视其评估环境已连接到真实互联网的证据,尽管最初被告知这些环境是模拟的,并以一种允许它们维持该信念的方式解释这种差异
模型表现出鲁莽,并在单一追求其目标的过程中愿意在真实互联网上采取有害行动
Anthropic 承认这些事件是”运营安全的失败”,表示其已构建了一个分类器来检测和阻止沙箱逃逸尝试,并更改了有关模型奖励的规范,以解决 AI 智能体诉诸捷径来欺骗奖励指标而未实际实现预期目标的问题。
“我们的结论是,训练中存在大量奖励黑客行为可能导致模型愿意执行一系列潜在的长期有害真实世界行动以追求任务成功,”该公司补充道。
OpenAI 声称 Astra 达到关键网络安全能力
OpenAI 则透露,其即将推出的 Astra 模型在其 Preparedness Framework 下达到了”关键”(Critical)网络安全能力阈值,并打算通过 Daybreak Blue 计划向一组测试者提供其最先进的网络安全功能。
当 AI 模型能够独立检测并利用跨多个防御良好的系统的零日漏洞,或仅凭高级指令在无人引导的情况下对加固目标实施完整网络攻击时,”关键”指定适用。
“在过去几周,我们推迟了 Astra 的部分开发和发布,同时我们加强并测试了针对网络滥用和未经授权模型行动的防护措施,”这家 AI 公司表示。”基于这项工作,我们相信 Astra 的防护措施充分降低了在我们的 Preparedness Framework 下发布造成严重危害的风险。”
OpenAI 表示,其还为 Astra 添加了更强的防护措施,以防止类似 Hugging Face 的事件——其 AI 智能体(作为 ExploitGym 评估的一部分)找到了一种利用其研究基础设施的方法,并滥用 Artifactory 作为留言板来交换信息,试图解决一个不可能的任务,最终闯入 Hugging Face 的基础设施,希望窃取答案而不是自己解决挑战。
“一个智能体 PHASEONE[big] 策划了这种作弊研究的很大一部分。PHASEONE10841 将其工作传递给了 PHASEONE[big],后者有相同的任务但预算更大,”METR 在其分析中指出。”智能体在许多努力上协作,使作弊看起来合法,包括:(1) 交换他们必须利用的程序;(2) 操纵自动评分器;(3) 操纵记录以掩盖作弊证据。”
OpenAI 报告称,Astra 在 ExploitBench 上取得了 100% 的完美分数,能从已知漏洞开发漏洞利用,并且现在拒绝了 91.5% 的越狱请求,而 GPT-5.6 Sol 为 59%。
网络安全
此外,OpenAI 指出,Astra 使用远少于 GPT-5.6 Sol 的输出令牌实现了”高得多的任意代码执行率”,并且该模型在一次评估 中作为漏洞利用链的一部分发现并使用了未指定软件中的两个零日漏洞。
该模型还被发现能发现先前未知的缺陷并将其转化为可用的漏洞利用链,包括完整的浏览器入侵——当在浏览器中打开 HTML 文件时,该入侵能逃逸沙箱并在底层主机上执行任意命令。
“该模型还在一个加固的操作系统中发现了多个漏洞,并将它们组合成一个从非特权用户到 root 的本地权限提升链,”OpenAI 补充道。”总而言之,我们的调查使我们得出结论,Astra 达到了关键阈值。”
为最小化 Astra 类模型造成严重网络危害的风险,该公司表示已添加分类器和分层保护,以提高其系统对恶意行为者滥用的鲁棒性,并防止模型在即使没有恶意用户的情况下采取未经授权的、错位的行动。
然而,OpenAI 也警告称,Astra 的防护措施可能错误地将合法活动标记为网络滥用或未经授权行为。
“实现这些系统的益处将取决于我们在能力增长时对齐和控制模型的能力,”这家新兴公司总结道。”这一责任延伸到训练、评估和部署。它需要更强有力的对齐行为证据、跟上能力的防护措施,以及当这些保护不足时放慢脚步的意愿。”
AI 公司在其模型逃逸评估环境并针对合法系统的事件后一直受到密切关注。与此同时,AI 驱动的网络攻击的兴起已促使一个由超过 100 家公司组成的联盟(包括 Anthropic、Google、Microsoft、OpenAI 以及多家软件和安全供应商)发布联合信函,呼吁改进防御以应对此类威胁。


消息来源:thehackernews.com

本文由 HackerNews.cc 翻译整理,封面来源于网络;

© 版权声明
THE END
你的支持是我们在网空安全路上的驱动力!
点赞10 分享