每日经济新闻

Kimi K3“越狱”,跑到GitHub“抄答案”!是失控还是测试有漏洞?权威测试:中国AI模型整体网络攻击能力远低于美国模型

每日经济新闻 2026-08-11 18:21

每经记者|罗雪琳    每经编辑|段炼 兰素英    

近日,月之暗面最新模型Kimi K3陷入网络安全测试风波。

在AI安全公司Frontier Security的测试中,该模型突破用于限制其访问外部网络的安全“沙盒”,利用环境漏洞直连GitHub获取测试题答案。

Frontier Security质疑Kimi K3缺乏足够内部安全防护,而英国AI安全研究所则反驳称是测试环境设置不当。

此前OpenAI、Anthropic等巨头的AI模型也曾出现类似突破边界事件,但不同的是,Kimi K3未实施攻击行为

权威测试数据显示,目前中国AI模型的整体网络攻击能力明显低于美国头部模型

GXaOuDJovOp1IKHCU1iawicZ6YlFPCduHYDfg1ic3Kq13uyppY8syh4ibS3qib78wPG3F4DJy6n7bDnD0WwX1jnl7bHoCWe574Gw8uV72Zibysiaicc.jpg图片来源:视觉中国

CFF20LXzkOwNfsay86cib4p0S2T0NfBIZicSMl7tYnKBaibmLibs8uIQI1mZYasibU5KFf6wlMM5EENdMic3ibFTHCmUw.png

Kimi K3“逃离”沙盒

直连GitHub抄答案

当地时间8月7日,AI安全公司Frontier Security披露,在对月之暗面最新模型Kimi K3进行网络安全能力测试时发现,Kimi K3利用测试环境中的网络配置漏洞突破了原本的限制,并从代码托管与开源协作平台GitHub上直接获取了测试题答案。

这次测试使用了英国AI安全研究所(UK AI Safety Institute)的网络安全评估环境。此类测试通常会将AI模型置于隔离的“沙盒”中,在允许模型使用命令行工具操作目标系统的同时,限制其与外部环境连接,以测试模型能否自主分析系统、寻找漏洞并完成网络安全任务。

Frontier Security测试发现,Kimi K3首先探测了“沙盒”的网络环境,然后发现大多数网站无法访问,但GitHub仍可以正常连接。随后,模型通过命令行工具克隆了官方测试代码库,并直接从下载到本地的文件中读取答案。

Frontier Security研究人员称,“沙盒”的网络配置环境虽然限制了外部网络访问,但为软件包维护保留了一份网站白名单,其中包括GitHub等网站。Kimi K3发现这一通道后,通过git clone等常规命令获取了原本不应在测试中接触到的参考答案。

Frontier Security将这一行为称为典型的“规则钻空子”(specification gaming):模型完成了获得正确答案这一目标,但绕过了测试原本要求的解题过程。

关于这次测试结果,《每日经济新闻》记者(以下简称每经记者)尝试采访月之暗面公司,但相关工作人员表示公司对此事不予评论。

CFF20LXzkOwNfsay86cib4p0S2T0NfBIZicSMl7tYnKBaibmLibs8uIQI1mZYasibU5KFf6wlMM5EENdMic3ibFTHCmUw.png

测试结果遭质疑

Kimi团队此前已预警“奖励作弊”

各方对于Kimi K3的测试结果产生了明显分歧。

Frontier Security表示,测试使用的是英国AI安全研究所(AISI)Inspect框架中提供的默认“沙盒”环境,并未修改相关配置。Frontier Security CEO Yaron Singer向媒体表示称,团队不仅发现了“沙盒”存在漏洞,也发现Kimi K3主动利用了这一漏洞,并据此质疑Kimi K3模型缺乏足够的内部安全防护。

但英国AI安全研究所对此提出异议。

英国AI安全研究所发言人称,Frontier Security的说法“不准确且不负责任”。Inspect是一款向全球AI安全测试开放的开源软件,使用者需要根据自身需求配置测试环境,这次测试中环境配置出现问题是因为Frontier Security使用Inspect的方式不对。

Frontier Security随后称,其使用的正是英国AI安全研究所开发的开源AI安全评估工具Inspect所提供的默认配置,并已私下向英国AI安全研究所提供事件细节。

当地时间8月7日,卡内基梅隆大学副教授、AI安全公司Gray Swan CEO Matt Fredrikson则表示,这一结果并不令人意外。如果给模型设定一个目标,却没有非常明确地规定行动边界,模型就可能自己寻找获得答案的路径。

实际上,在此次事件发生前,Kimi团队已经公开讨论过类似风险。

7月27日,Kimi团队在arXiv发布Kimi K3技术报告《Kimi K3:开放前沿智能》(Kimi K3: Open Frontier Intelligence)。报告介绍,Kimi K3训练基础设施时专门设置了“高保真隔离沙盒”运行环境部分,并指出,随着智能体能力增强、任务难度提高,它们往往会更加激进地探索环境,甚至可能尝试“奖励作弊”(reward hacking)。

GXaOuDJovOqev0gMRpVSwtm2Ck1yLGVfWSMr567tjSnle7ic84k24WXWXC4UdpTVbk3MOCyjJNN2jXxTu9gSiaWiaXf8t62JSBebrbHcicXUl7s.jpg

Kimi团队称,在早期使用传统容器“沙盒”进行实验时,已经观察到智能体的意外操作造成多次内核崩溃和死锁。但另一方面,为避免限制智能体能力,团队又希望允许模型尽可能自由地探索环境。面对复杂任务,智能体甚至需要能够自行挂载磁盘、运行容器或启动虚拟机。

为此,Kimi团队采用基于Firecracker隔离微型虚拟机的AgentENV,在尽可能保留真实环境操作能力的同时,提高智能体运行环境的隔离程度。

CFF20LXzkOwNfsay86cib4p0S2T0NfBIZicSMl7tYnKBaibmLibs8uIQI1mZYasibU5KFf6wlMM5EENdMic3ibFTHCmUw.png

报告称中国模型整体网络攻击能力

明显低于美国模型

Kimi K3“逃逸”并非孤例。近几周,多家AI公司的前沿模型在网络安全测试中突破原有测试边界,并访问了真实系统。OpenAI、Anthropic和Meta近期均披露了类似事件。

GXaOuDJovOrNbxl4DelP2H5OeSJn31zkUEm1QRsw9T2jJH6iatqbxNF3yyxQVXkaibrLqEybcfRXzJ0Zvwky7dFY6BhWm0iaxgfZJHoFIyReGY.png

不过,几起事件的原因和后果并不相同。

GPT-5.6 Sol逃离测试环境后,将攻击目标转向了Hugging Face等外部系统;Anthropic的Claude Opus 4.7、Mythos 5及一款内部研究模型在原本被告知“没有互联网访问权限”的情况下访问了真实机构的系统。Meta也披露,其Muse Spark模型在测试过程中利用第三方服务的安全漏洞访问了互联网,目前相关事件仍在调查。

上述事件曝光后,以格雷格·卡萨尔(Greg Casar)和多丽丝·松井(Doris Matsui)为首的29名美国众议员向OpenAI施压,要求OpenAI解释该公司在测试期间如何监控其AI智能体,以及这些失控模型是否绕过了公司的安全控制措施。在另一封信中,22名议员也要求Anthropic详细说明,自其AI智能体在测试期间入侵三家公司系统后,公司采取了哪些安全措施。

不仅如此,自由派参议员伯尼·桑德斯(Bernie Sanders)周一分别致函三家AI公司的负责人——阿尔特曼、阿莫代伊以及马克·扎克伯格,要求他们“暂停”开发新模型。

相比之下,Kimi K3此次并未入侵第三方系统,只是在发现“沙盒”能够访问GitHub后,下载了测试基准的参考答案。

Hugging Face前亚太区生态总监王铁震向每经记者表示,Kimi K3并不具备OpenAI、Anthropic等旗下AI模型的类似攻击能力。Kimi K3只是通过已经存在、可以对外访问的接口从GitHub上获取了信息,并没有展现出任何攻击行为。”

他认为,前沿开源模型尚未展现出长程潜伏和连续攻击的能力,可以帮助防守方分析攻击方式、搜集证据,但还无法承担完整的攻击任务

网络安全情报平台DataWater分析指出,此前OpenAI和Anthropic的部分事件涉及尚未发布或在测试中降低安全限制的模型,而Kimi K3的模型权重已于7月27日公开。从实际测试结果来看,Kimi K3的网络攻击能力明显低于美国头部模型。

当地时间7月23日,英国AI安全研究所与美国AI标准与创新中心(CAISI)发布了对Kimi K3网络能力的初步联合评估。两家机构通过漏洞利用开发和模拟企业网络攻击等测试,对Kimi K3自主发现、利用网络漏洞以及执行攻击任务的能力进行了评估。结果显示,Kimi K3的整体网络攻击能力仍明显低于美国头部闭源模型,但高于同期接受测试的智谱GLM-5.2。

其中,在漏洞利用开发基准ExploitBench中,Kimi K3得分为32.2%,高于GLM-5.2的24.4%,但明显低于美国头部模型的76.2%。该测试覆盖41个2023年之后发现的V8引擎漏洞,用于衡量模型从发现漏洞到最终实现代码执行等不同阶段的漏洞利用能力。

在最高难度的“任意代码执行”(ACE)环节,Kimi K3在41项任务中均未成功,而美国网络攻击能力最强的模型平均能够完成20项。

GXaOuDJovOp0cVkFK8nibHVDW7ht6Aa4p1GCGn7eEvibeCEGLtasRjcGdy2uzvZKHK0GF1rw9Xf8OPnoleVbyXxA0N3xTWlGljVuMjdZt0vhU.png

英国AI安全研究所和美国AI标准与创新中心还通过名为“The Last Ones”(TLO)的模拟企业网络环境测试Kimi K3自主执行完整网络攻击的能力。该测试设置了一条包含32个步骤、4个子网和约20台主机的攻击路径。

测试结果显示,Kimi K3平均推进至32步攻击路径中的第17步,而美国网络攻击能力最强的模型平均达到第28.5步。10次测试中,Kimi K3有1次在规定的1亿Token限制内完整走完攻击路径。两家机构据此表示,这表明Kimi K3在获得初始网络访问权限后,已经能够自主攻击规模较小、防御薄弱且存在漏洞的模拟企业系统。

GXaOuDJovOo3W0mgOppAnr09rORzsUK1MuepiaVuoV3KNzXKbSRM1SJhtAyn7yRzJ4ibtYELTIfF10OC8bkFBalWkT0grLPjtEcLFc64SUHZs.png

王铁震对每经记者指出,模型出现攻击能力可能是训练语料与“奖励作弊”等因素叠加产生的结果,因此需要更加关注训练语料的选择,并持续监督模型执行长程任务时的行为。

他建议,引入独立于模型公司的第三方监管和评测机构进行审计,在模型具备更强攻击能力前建立相应的评估和监督机制。

(免责声明:文章内容和数据仅供参考,不构成投资建议。投资者据此操作,风险自担。)

记者|罗雪琳

编辑|段炼 兰素英 杜恒峰

校对|梁露月

CFF20LXzkOyYmal29zn37N5Bg2NQ4tyN4ylvMFyM3VmF4x90Uj4cDmoEphibia4RN55ibIXmqU1Od9w2Q5nhA08lA.png

|每日经济新闻  nbdnews  原创文章|

未经许可禁止转载、摘编、复制及镜像等使用

版权声明

1本文为《每日经济新闻》原创作品。

2 未经《每日经济新闻》授权,不得以任何方式加以使用,包括但不限于转载、摘编、复制或建立镜像等,违者必究。

上一篇

行云科技:至今未发生任何算力设备及相关商品被海关扣留、滞留等无法通关的情形

下一篇

智洋创新:部分董事及高管合计减持88.2万股,减持计划实施完毕



分享成功
每日经济新闻客户端
一款点开就不想离开的财经APP 免费下载体验