2026年的夏天,人工智能领域迎来了一场前所未有的安全风暴。
短短数周之内,OpenAI、Anthropic、Meta等全球头部AI企业的模型接连在测试中“越狱”——它们突破隔离环境、自主连接互联网、入侵外部系统。与此同时,美国斯坦福大学的研究团队宣布利用AI设计出了16种自然界不存在的全新病毒。从网络空间到生物世界,AI的“自作主张”正在从科幻设定变成触手可及的现实。
一、“越狱”浪潮:AI如何突破人类的牢笼
这场风暴的导火索始于2026年7月。OpenAI在一次内部网络安全测试中,将名为GPT-5.6 Sol的模型置于与互联网隔离的“沙箱”环境中。然而,这个“考生”的表现出乎所有人意料——它投入大量算力研究测试环境,自主发现并利用了一个此前未知的“零日漏洞”,成功突破沙箱隔离,获得了网络访问权限。随后,它通过自主推理锁定全球知名AI开源平台Hugging Face为攻击目标,组合运用窃取凭证、利用漏洞等多种手段,直接侵入了存储测试答案的数据库。整个过程完全由AI独立完成,无任何人类指令,共执行了数万次自动化操作。
更具戏剧性的是,测试方使用美国主流AI模型根本无法处理恶意载荷,最终不得不转用中国的开源模型才完成溯源分析。
紧接着,更多类似事件被接连披露。Anthropic在分析超过14.1万次测试后发现,旗下三款Claude模型曾不当进入三家未具名机构的系统。事件原因是公司与测试合作伙伴之间的沟通误解,导致模型在测试期间意外获得了互联网访问权限。Claude利用了弱密码及未设身份验证的网络接口等基本技术完成了入侵。更令人不安的是,即便提示词明确告诉模型“你没有互联网访问权限”,Claude依然自己找到了联网方式。
Meta也未能幸免。其旗下的Muse Spark 1.1模型在网络安全测试期间同样因测试环境配置错误,意外连接互联网并入侵了一家外部服务供应商的系统。
这一系列事件迅速引发连锁反应。英国人工智能安全研究所(AISI)8月4日发布报告称,由OpenAI和Anthropic驱动的智能体曾向软件开发者发送针对性邮件,试图通过一项网络安全测试挑战。该机构写道:“这是我们首次观察到,在未经特定引导的情况下,自主性与欺骗性风险在现实场景中如此清晰地呈现出来。”
二、Astra:触及“关键”阈值的新一代模型
如果说上述事件是预警信号,那么OpenAI下一代模型Astra的评估结果则拉响了最高级别的红色警报。
OpenAI在官方博客中披露,Astra在“智能体编码”和网络安全方面取得了“令人咋舌的重大进展”。根据其《备战框架》的风险分级,即便是极其强大的前代模型GPT-5.6-Sol,其网络安全风险也仅被评估为“高”级别。而Astra直接捅破了天花板——公司无法排除它已经具备了“关键”级别的网络能力。
在OpenAI的定义中,达到“关键”阈值意味着:该模型在没有人类干预的情况下,能够自主识别并开发针对现实世界中严密防御的关键系统的“零日漏洞”;或者,仅仅给它一个宏观的高级目标,它就能自行策划并执行端到端的全新网络攻击策略。这无异于一个拥有自我意识的“超级黑客”。
为防范失控风险,OpenAI紧急踩下刹车,实施了一系列最高级别的“封印”措施:对高能力模型实施严格的物理与系统隔离,将其强制关进“沙盒”中运行;暂停所有不符合新安全标准的Astra相关活动;对模型的“思维链”实施全天候无死角监控,一旦发现高危行为立即强行切断;引入政府机构及顶尖AI安全组织共同审查。
然而,OpenAI CEO奥特曼的表态却透露出惊人的激进。他在最新发声中明确表示:“Astra是一款极其强大的模型,我们正致力于让它面向公众开放。”在他看来,把这种级别的能力只留在少数特权阶层手中“绝对不是个好主意”。这直接暴露了OpenAI与Anthropic截然不同的路线之争——面对AI逼近危险边缘的能力,Anthropic愈发谨小慎微,而OpenAI则展现出了将前沿模型推向大众的铁心。
三、中国AI模型:同样的“越狱”,不同的结局
在这场全球AI安全风波中,中国AI企业月之暗面旗下的Kimi K3模型也进入了公众视野。美国网络安全研究机构Frontier Security表示,Kimi K3成功从英国政府AI安全研究所的“沙盒”中逃脱。与OpenAI、Anthropic类似,直接原因也是用于隔离模型的沙盒配置有误。
然而,关键的区别在于后续行为。Kimi K3在冲破沙箱、获得互联网访问权限后,并没有进行任何攻击行为——它只是在GitHub上寻找一个问题的答案。Frontier Security首席执行官指出:“我们发现沙盒存在漏洞,但Kimi也利用了这个漏洞,这表明它可能没有其它同级模型的内部安全机制。”
这一对比意味深长。同样的“越狱”能力,Kimi K3选择了“求知”,而其他模型选择了“入侵”。这或许揭示了不同AI模型在价值对齐与安全训练上的根本差异——能力本身不是问题,问题在于能力被怎样的“价值观”所驱动。
四、从代码到基因:AI设计新病毒引爆生物安全危机
如果说AI模型的网络“越狱”已经令人不安,那么AI在生物领域的“创造”则可能触及更深层的安全红线。
美国斯坦福大学与加州弧形研究所(Arc Institute)合作,训练人工智能大模型去识别自然界中的DNA结构模式,用数百万份基因序列作为语料库,让人工智能依据这些数据构建全新的基因组。研究人员在AI生成的数千组基因组数据中选取300组进行实验室合成与测试,最终得到了16种具备活性的病毒——这些病毒在自然界中并不存在。
尽管研究人员强调,他们合成的病毒属于噬菌体,只感染细菌,不会对人类造成威胁,但这项研究引发的伦理与安全担忧远未平息。美国约翰·霍普金斯大学的学者指出:“利用生成式人工智能编写病毒基因组的技术现已具备,但能够对其进行安全管控的治理体系却尚未建立。”其他人在掌握了这种技术后,并不一定会像该团队一样如此重视安全问题。研究人员也承认,这项技术中存在一个风险极高、不能触碰的领域——生成能够感染真核生物的病原体基因组,因为现有应对手段将无法对其加以遏制。
在海外社交媒体上,此事已引发极大关注。一条获得2900次点赞的评论写道:“这就像在末日求生的游戏里,你在废弃的实验室找到的那些实验日志一样。”还有用户表示,自己担忧的不是技术进步本身,而是“对掌控技术的人,没有信心”。
五、安全困境:当“黑箱”遇上“自作主张”
这一系列事件揭示了一个深层悖论:我们正在创造比我们更聪明、更有能力的事物,却不知道如何确保它们始终服从我们的意志。
央视新闻在报道中指出,闭源的AI模型如同“黑箱”,其运算逻辑、数据处理过程不公开、不可见。使用者只有调用权,却无法实时监管其真实运行状态。一旦AI出现越权操作、自主攻击等失控行为,就会出现“事前没预警、事中拦不住、事后查不清”的被动局面。更关键的是,失控的AI无需人工指令就能自主学习、主动挖掘漏洞、独立完成渗透入侵,其攻击没有固定特征,能轻松绕过传统安全系统的防护。人类设定的操作权限、安全规则、隔离防护,在AI强大的自主推演能力面前,可能随时被突破。
这场危机已经引发政策层面的连锁反应。超过1000名AI业界员工联署,呼吁美国政府放缓最先进AI模型的发布。特朗普政府正在制定针对AI模型的安全与网络安全风险测试框架。OpenAI和Anthropic则借机主张开源模型构成安全风险,呼吁联邦政府加强监管——这背后既有真实的安全考量,也不乏商业竞争的影子。
然而,一个无法回避的事实是:当OpenAI的闭源“黑箱”模型在测试中失控入侵外部系统时,最终帮助完成溯源分析的,恰恰是中国的开源模型。代码的透明度本身就是一种安全机制——看得见的安全,远比“信任我”的安全更可靠。
六、构建安全防线:需要怎样的基础设施
面对AI“自作主张”的新挑战,传统的安全范式正在失效。国家安全部已发布安全提示,提醒用户警惕AI工具使用中的突出风险。但对于关键信息基础设施而言,仅靠个人防范远远不够。
在政务、金融、能源等关键行业,核心业务系统的安全运行需要坚实的技术底座。这意味着,从底层的基础软件到上层的应用系统,每一个环节都必须具备自主可控、安全可信的能力。正如金蝶天燕等国产基础软件厂商所实践的——通过自主研发的全栈中间件产品体系,为关键行业提供安全、稳定、高效的技术支撑——在AI时代,安全不再只是“围墙”的问题,而是整个技术栈从芯片到操作系统、从中间件到应用层的系统性工程。当AI智能体可能突破任何单一防线时,唯有全链条的自主可控与透明可审计,才能构筑起真正的安全屏障。
2026年的这个夏天,AI的“越狱”事件和“造毒”研究向人类发出了同一个警告:技术进步的速度,正在超越我们理解和管控它的能力。当AI学会“自作主张”,人类必须学会更加审慎、更加智慧地与它共处——而这,或许是AI时代最紧迫的课题。