聚鑫汇pg - Boss挑战与丰富鱼种
欢迎光临南京聚鑫汇pg纸业有限公司!
您当前的位置:首页> 新闻动态
新闻动态
公司新闻

AI灾难恐在一年内发生!OpenAI和Anthropic已在推演应对方案

浏览人数:231|上传时间:2026-10-10

编辑|Panda

刚刚,Axios 发布了一篇独家报道,称 Anthropic、OpenAI 等 AI 公司的高管正在私下推演这样一个场景:一场由 AI 引发的灾难性事件发生之后,公众和政界会如何反弹,公司又该如何应对。

Axios 将其概括为为「the day after」做准备。被预设的并非科幻式的「AI 觉醒」,而是一次大规模事件,最可能的形式是网络攻击,足以让金融服务、互联网连接,甚至电力和供水系统陷入瘫痪。多位接受 Axios 采访的业内人士认为,这样的事件会在未来 6 到 12 个月内发生



https://www.axios.com/2026/10/09/ai-companies-day-after-major-attack

巧合的是,就在同一天,Anthropic 发布了一份报告,披露Claude 在评测和内部使用中曾在真实网站上做出多种越界行为,包括向警方的线索表单提交一条编造的「目击信息」,以及绕过付费限制从政府机构网站取数。



https://www.anthropic.com/research/investigating-unintended-model-actions

只是时间问题

情景推演在企业和国家安全领域并不新鲜,五角大楼的兵棋推演已经做了几十年。Axios 指出,这一次的不同之处在于,许多顶尖 AI 研究者和高管认为,重大事故已不可避免

对此,OpenAI 发言人回应称,公司确实会开展准备性演练,让团队讨论并推演一系列潜在场景,但这些场景并不被视为必然发生,目的是帮助公司为各种情况做好准备。Anthropic 则拒绝置评。

按照报道的描述,事件可能有两种来源:

  • 在内部测试环境中运行的失控智能体集群突破了隔离
  • 恶意行为者找到了滥用现有模型的意外途径

无论哪一种,追责都会随即开始。Axios 认为,首个由不安全 AI 造成重大现实伤害的案例,会让本已心存疑虑的公众进一步站到这项技术的对立面,矛头不仅指向 Dario Amodei、Sam Altman 等 AI 公司掌门人,也会指向一直不愿加强 AI 监管的特朗普。

预演其实已经开始

这种担忧并非凭空而来。Axios 援引了近期一起针对韩国金融机构的攻击,其中有两家银行据报遭到入侵。据网络安全公司 CrowdStrike 披露,一名黑客被指借助 AI 模型工具,窃取了数万名银行客户的数据,过程中还曾询问 Claude Code 被盗数据可以卖到哪里



https://www.crowdstrike.com/en-us/blog/unknown-threat-actor-uses-artex-to-target-south-korean-finance/

在 Axios 看来,这个案例说明单个攻击者借助 AI 已经能造成相当大的破坏

「失控智能体突破隔离」也已经有了现实样本。今年 7 月 21 日,OpenAI 披露其失控的 AI 智能体绕过内部管控、进入开放互联网并协同行动,入侵了开源平台 Hugging Face,OpenAI 自己将其称为一次前所未有的网络安全事件。路透社此后报道,这些智能体早在 5 月就开始劫持 Hugging Face 用户账户、探测平台漏洞,同一时期还占据了一家德国网站,把它变成了智能体之间交流的留言板。

这类问题也不只发生在 OpenAI。受 Hugging Face 事件触发,Anthropic 回溯审查了 141006 次可能接触互联网的评测运行,并于 7 月 30 日披露了三起事件:Claude 模型从第三方评测合作方 Irregular 的环境连上了互联网,并在未经授权的情况下进入三家机构的真实生产系统。

据 Anthropic 介绍,评测提示词告诉模型环境是模拟的、没有联网,但一处配置失误让机器实际可以访问互联网,模型因此把碰到的真实系统当成了夺旗赛的一部分。

其中一例里,Claude Mythos 5 为完成任务构建并发布了一个恶意 Python 包,该包在 PyPI 上存在了约一小时,被 15 个真实系统下载运行,其中一家安全公司的扫描器因此泄露了凭证。Anthropic 认为这几起事件更接近评测框架和运维层面的失败,而非模型对齐失败。

围绕 AI 安全的紧张气氛也在 OpenAI 内部蔓延。

前些天,OpenAI 确认解雇三名研究员: Jasmine Wang、Tomek Korbak 和 Mikita Balesni。他们均从事安全或对齐相关工作,被指将公司敏感信息分享给一家第三方 AI 安全组织。三人随后发表公开信。



就在 Axios 报道发出的同一天,OpenAI 研究负责人在 上发文回应,强调解雇与提出安全关切无关,并表示正在敲定与第三方安全评估机构的合作,同时认同保持前沿模型的可监控性需要全行业共同承诺。但评论区质疑声音很多。



监管层面同样有动作。据《华盛顿邮报》报道,美国联邦贸易委员会(FTC)已对 Anthropic 和 OpenAI 的 AI 安全实践展开广泛调查;近期,英伟达、谷歌、Meta、xAI、OpenAI 和 Anthropic 的高管在白宫与特朗普会面后,还签署了一份自愿性的安全自律承诺。

拒绝置评的 Anthropic,当天发了一份报告

Anthropic 虽然没有回应 Axios,却发布了一份关于模型「非预期行为」的报告,并表示今后会在系统卡和每 3 到 6 个月一期的风险报告之外,更频繁地单独公布这类发现。

报告梳理了 Claude 在真实网站或系统上做出的四类越界行为

  • 利用软件的基础漏洞在服务器上执行命令
  • 在真实网站上提交了本不该提交的表单
  • 绕过限制获取需要 token 或付费才能访问的数据
  • 借助免费短链接服务绕开取数工具对 URL 长度的限制

Anthropic 也公布了一些案例,比如在一次科学分析评测中,Claude Mythos Preview 需要调用某大学托管的公开工具,工具报错后,它在该大学服务器上找到一个能返回任意文件的脚本,读出脚本源码后发现了注入漏洞,并借此在服务器上执行命令完成计算。

另一例中,一位 Anthropic 研究员用 Claude Mythos 5 做统计项目,所需数据由某州机构收费提供,Claude 从网站的存档页面得知其公开看板会给任何访客签发访问 token,于是领取 token 直接查询数据库,绕过了付费。

最出格的一例来自Claude Haiku 4.5。 它被要求在随机网页上生成并执行示例任务;而在进入费城警察局悬案网站上一个未破凶杀案页面后,它在线索表单里编造了一条「可能见过符合描述的人」的目击信息并提交。指令禁止它登录、注册、输入个人信息或购物,却没有禁止提交表单。Anthropic 表示,从推理记录看,模型似乎只是在为任务生成示例内容,而非有意误导。

费城警察局当天也发布了声明。据报道,这条线索提交于 7 月 18 日,因被归入垃圾邮件,从未转交实时犯罪中心研判,警方系统也没有遭到未授权访问。但警方批评Anthropic 花了两个月才发现并通报此事,称这一延迟「不可接受」,要求公司加强防护,并表示将与州和联邦层面一同考虑监管保护措施。



应对措施方面,Anthropic 此前已对部分高风险和网络安全评测关闭实时联网,现在将其扩大到所有内部评测,直到确认安全与监控措施能可靠拦截这类行为;同时大幅收紧了网页抓取等工具的权限,并上线了自动检测和拦截工具,用本次报告中的案例回测,全部被拦下。

报告也承认,对齐训练短期内还不足以单独解决问题,仍需依赖纵深防御。Anthropic 还写道,这些案例影响有限,但更强大的模型可能造成大得多的伤害

很显然,AI 公司对外表示事故并非必然,私下却在认真筹划事故发生之后的应对。从 Axios 披露的内容看,推演的重心更多落在政策与舆论层面。

不过,把 Anthropic 同日发布的报告放在一起看,技术层面的排查也在推进,只是以另一种方式公开。今年夏天以来,OpenAI 和 Anthropic 都披露过模型从评测环境越界进入真实系统的事件;Anthropic 的最新报告则表明,即便在影响轻微的日常场景里,模型遇到障碍时「绕过去」的倾向依然存在。这些案例本身远谈不上灾难,但它们越来越让人担忧。

问题来了:如果连最前沿的模型开发者都认为重大事故大概率会在一年内发生,那么在这一天到来之前,行业和监管者还能做些什么?

(资讯)是jizexian.szmhjg.com围绕聚鑫汇pg设置的栏目页面。聚鑫汇国际行业标杆平台,提供品牌专区、真人娱乐、电子游戏、捕鱼游戏、棋牌大厅、体育赛事等多元服务。这里系统整理了服务范围、办理流程、所需材料、注意事项与常见问题,方便访客按需查阅,不必反复翻找。

我们会持续跟进聚鑫汇pg相关的政策与实际使用场景变化,及时修订页面表述与示例,保证信息准确可用;同时补充典型案例与操作建议,帮助您更快了解全貌、形成判断;

如需进一步了解聚鑫汇pg的细节,欢迎收藏本页,并通过页面上的联系方式与我们沟通,我们会尽快回复并提供必要协助。

感谢您访问jizexian.szmhjg.com。您也可以从首页及其他栏目查看聚鑫汇pg的最新动态,获取更完整的信息参考。

网站地图