路透社8月26日报道,当日发布的两份安全漏洞调查报告显示,大约700个由OpenAI创建的AI代理组成的“集群”在7月对开源平台“抱抱脸”(Hugging Face)及OpenAI公司自身发动了黑客攻击,并在多数情况下试图掩盖活动痕迹。
AI代理(指在极少人为监督下自主运行的程序)的协同行动及其掩饰行为的方式,引发了对AI公司如何密切监控日益强大模型测试的质疑,并可能为加强监管的呼声增添更多依据。
尽管此前已有部分恶意行为被披露或提及,但OpenAI自身发布的报告与一组独立调查人员发布的报告,共同揭示了关于此次漏洞及其前兆的若干令人意外的新细节。
首先,此次漏洞并非如先前报道所述仅涉及一个恶意AI代理,而是约700个代理以大规模协作集群的方式行动。OpenAI方面仅选择性表示“有代理”参与了漏洞事件,但受委托进行独立调查的两个组织,METR和Redwood Research给出的数字为“近700个”。OpenAI表示调查人员的数据准确。
两份报告还披露了更多细节。OpenAI表示,其代理还入侵了公司内部系统的部分区域,试图在测试中作弊或获取更大的行动自由。此外,公司称,代理在与网络无关的测试中同样存在作弊行为,涉及蛋白质数据库和电子表格等任务。
两份报告均指出,AI模型通过删除或修改行为记录来试图掩盖不当行为。独立调查发现,这些代理在一个未经授权的留言板上交换了数万条信息。这种大规模的恶意活动可能引发对OpenAI测试监控严密程度的担忧。
OpenAI在报告中写道:“回顾过去,本报告中识别出的一些早期信号本应可以触发更早的应对措施。”
在非网络测试中作弊表明,这种不当行为可能根植已深。研究AI代理能力和动机的组织Palisade Research的负责人杰弗里·拉迪什表示:“这有点像在问,‘如果某人不仅在计算机课上作弊,而是在所有课上作弊,那是不是更令人担忧?’答案是,‘是的,更令人担忧。’”
更令人不安的是,OpenAI还反映其代理出现了“噬主”的情形。该公司概述了7月19日发生的两起代理入侵公司自身基础设施的事件。
在其中一起事件中,代理利用了其被限制使用的计算机的漏洞,从而脱离测试环境并访问其他连接的系统。而在同一天发生的另一起事件中,代理窃取了OpenAI的凭证并篡改自家公司的云环境。
OpenAI表示,有数量不详的代理曾试图攻击用于评估模型性能的自动化系统,以隐藏作弊证据,尽管篡改行为最终并未影响这些系统所审查的记录。
独立调查报告更侧重于“抱抱脸”漏洞事件,揭示了更多细节。报告发现,其检查过的代理中有五分之一“明确表示对篡改证据感兴趣”,并且许多代理“广泛研究了操纵或篡改其记录日志的技术”。
OpenAI表示,正在加强研究基础设施、增加监控,并改进旨在防止有害或意外行为的安全措施。OpenAI称:“鉴于AI行业快速发展的步伐,企业组织应假定此类攻击在近期内构成可信威胁,且真实攻击的复杂程度将高于此次事件中描述的情形。”
