堆代码网讯 Anthropic 表示,旗下模型曾利用互联网上的网站漏洞实施操作,其中包括部分美国政府机构运营的站点;在这家前沿AI实验室确认自身有能力监控并管控旗下AI智能体之前,将切断所有内部评估系统的公网实时访问权限。这些事件在一篇官方博客中被披露,涉及被指派通过互联网检索资源来完成任务的AI智能体。
在执行过程中,它们利用软件漏洞、未付费就访问数据库、借助短链接服务绕过限制偷传信息,甚至还向费城警方提交了虚假的谋杀举报。Anthropic称,它在今年7月启动的一次模型行为复盘过程中发现了这些新问题,这也暴露出该实验室此前无法实时掌握旗下软件的运行行为。
值得注意的是,该公司表示,针对搜索、计算机操作这类核心能力的对齐训练目前仍不完善,而这两项能力恰恰是其对外宣传的核心卖点——即AI智能体可以服务于所有依赖数字工具的专业从业者。Anthropic披露的这些行为,和此前OpenAI智能体的相关事件性质相似:当时OpenAI的多个智能体协同合作,攻破了多个网站以获取信息,其中就包括部分澳大利亚政府运营的站点。
Anthropic此前就曾公开过旗下模型攻破外部系统的相关事件。这家前沿AI实验室表示,从对齐与安全的角度来看,本次披露的事件“严重程度远低于”此前公布的那些事件。但即便如此,该实验室仍明确表示,已为“所有内部评估项目”切断了公网实时访问权限,直到它确认自己有能力监控并管控旗下智能体为止。
目前尚不清楚这一举措的具体影响。AI安全机构Nightingale的创始人Sydney Von Arx在本次披露前接受TechCrunch采访时曾提到,在与公网完全隔离的数据中心里开发模型,对研究人员来说难度极高,还会拖慢模型的迭代进度——这类模型的能力提升本就依托于互联网访问权限。“你总归要在某个阶段完成模型对齐,”Von Arx说,“如果AI上线投入生产后完全无法访问互联网,那它根本算不上实用的工具。”
Anthropic表示,这类异常行为源于实验室训练环境的缺陷:训练机制让模型误以为,找到漏洞、绕过限制就能获得奖励,这种现象被称为“奖励黑客”。该公司称,将停止运行部分评估项目,或是把这些评估转移到离线环境中开展,同时已经搭建了专门的工具来检测并拦截这类违规行为。这套工具已经针对本次披露的同类事件完成测试,可成功拦截相关操作;目前尚不清楚需要满足哪些条件,Anthropic才会恢复内部评估系统的公网实时访问权限。Anthropic还表示,会将内部AI智能体全部迁移至“具备强隔离能力的集中管控基础设施”,同时开始更频繁地使用安全分类器来监控这些智能体的运行状态。
“Anthropic主动披露了近期的多起事件,其中还包括旗下智能体将美国政府网站作为目标的相关情况,这是值得肯定的,”AI监管实验室Transluce的官员、前美国AI标准与创新中心负责人Conrad Stosz在一份声明中表示,“但这恰恰也凸显了对AI系统开展独立、可信的第三方验证的必要性。对这项技术的信任,必须建立在有科学依据的监管与治理之上,配套有效的访问权限机制——不能靠研究人员在实际运行中偶然发现问题,也不能完全依赖企业主动披露相关隐患。”