![]() |
| (图片来源:vocal.media) |
九月中旬,中美两国元首在华盛顿会晤时,人工智能治理成为首要议题。中美两国一直在竞相研发功能日益强大的人工智能系统,且双方都无意放缓脚步。但即便是这场竞赛的赢家,也无法规避该技术所带来的深层风险。
其中一个风险源于人工智能不断提升的能力:发现软件漏洞和执行复杂的网络行动。由于网络冲突的攻防力量严重不对称,即便拥有全球最先进人工智能模型的国家,依然会面临网络攻击的威胁。这种相互脆弱性,在很大程度上让双方在利用人工智能攻击关键基础设施(如金融网络、通信系统和电网)时保持相互克制。
这种克制并非没有先例。2015年,美国总统巴拉克·奥巴马与习主席达成共识:两国政府均不会实施、也不会蓄意支持以获取商业利益为目的、利用网络手段窃取知识产权的行为。双方还建立了信息交换、协助调查及应对恶意网络活动的机制。此后,网络安全企业监测到源自中国相关组织的攻击事件急剧下降,不过分析人士指出,这一下降趋势在协议签署前便已开始,可能反映了中国军方及网络机构的内部调整。
但人工智能带来了一种传统网络协议未曾充分考虑的可能性:该技术可能对关键系统发动自主攻击。7月中旬,在一次安全防护措施有所削减的内部网络安全评估中,一群OpenAI智能体突破了沙盒测试环境,接入互联网,并入侵了主要开源人工智能平台Hugging Face的系统。OpenAI报告称,这些智能体“失控”,采取了超出其任务范围的行为。
Anthropic、谷歌和Meta也报告了类似事件:人工智能智能体逃离隔离测试环境,并试图对外部系统进行未授权入侵。尽管此类漏洞的后果迄今尚属有限,但若一个美国人工智能智能体侵入例如腾讯的系统,导致微信瘫痪,情况恐怕就截然不同了。微信是14亿人使用的超级应用,已深度融入中国人的日常生活。
这并非天方夜谭。安全企业Calif的研究人员近日披露,人工智能曾协助他们发现微信通话系统中的零点击漏洞。该团队在约两天内就编写完成一个远程代码执行攻击程序,随后又花了一周时间,打造出一种能够通过微信通话传播的蠕虫病毒。
在受控演示中,来自可信联系人的通话可在用户未接听的情况下劫持微信账号,攻击者不仅能获取其消息和通话记录,还能访问并侵入账号保存的联系人。Calif已将该漏洞报告给腾讯,后者随后修复了该缺陷。
Calif的WeWorm蠕虫只是一次受控的安全演示。但结合美国发生的多起事件,它指向了一个令人忧虑的可能性:一次非故意的人工智能跨境入侵,看上去可能与蓄意攻击无异。美中双方能看到损害,却未必知晓是否出于故意。保持沟通或可促成克制,但模糊性也可能引发报复,或为蓄意攻击者提供掩护。无论是否出于意外,一次跨境漏洞都可能迅速升级为地缘政治危机,甚至军事冲突。
鉴于此,未来任何关于人工智能驱动网络攻击的美中协议,都必须包含一种可信的手段,以区分意外与蓄意入侵。这意味着,除了建立报告渠道和热线之外,协议还必须解决核验问题。
一种方案是将举证责任归于“攻击发起方”。攻击来源国必须提供可信证据,证明其并非故意,例如显示系统所受任务、权限、工具使用、人工授权记录,以及日志文件,证明智能体行为何时偏离预设指令。
核验并不意味着完全透明。在美中均为缔约国的《化学武器公约》下,“受控准入”允许调查员调查可能的违规行为,同时允许各国保护敏感设施及无关的涉密信息。可建立类似机制,让双方认可的专家获取评估人工智能事件所需的证据,同时限制敏感信息的披露范围。
此类机制还将带来额外收益。由于能够证明入侵系非故意的,可以降低遭受报复的风险,各国政府和人工智能企业将更有动力改进其记录存留与信息共享系统,这也有助于开发者优化人工智能智能体,防范未来类似事件发生。
同样,为避免高昂的调查成本,各国政府和人工智能企业将更有动力实施更严格的权限管理,并投资于监控与隔离防护体系。这些防护手段可降低未来事件的发生概率,并在事件发生时控制破坏范围。而随着为中美双边安排所开发的制度、程序及技术工具被更广泛地采纳,全球人工智能安全实践水平也将随之提升。
关于人工智能可能导致人类灭绝的警告,往往忽视了最迫在眉睫的风险:一场无人策划、未经人类批准的攻击所引爆的战争。我们亟需一种机制,来区分非故意损害与蓄意攻击。美中协议必须致力于建立这样的机制。
全文翻译自报业辛迪加(Project Syndicate),原文标题“Preventing an AI World War”(2026)。
