AI智能体近来频频“越界”。据路透社报道,今年5月,一批与OpenAI有关的AI智能体开始在执行测试任务期间,“劫持”德国一程序员网站DseWiki,并将其改造为供其他智能体使用的“留言板”,而OpenAI 高管数周前就已得知此事,却一直秘而不宣。
当地时间9月5日,OpenAI公开承认此事,并将其称为“Wiki事件”。OpenAI在其社交平台“X”上表示,随着AI模型能力进入新的阶段,公司有关“失配”(misalignment)事件的披露机制需要进一步扩大。
“失配”指的是AI实际采取的行为偏离开发者原本意图,并不意味着AI产生意识或主动“背叛”人类。
OpenAI表示,目前行业对于如何报告训练、评估和部署过程中出现的失配行为,尚未形成统一标准。“我们正在制定一个框架,并将在未来几周内分享,与此同时,我们正与全球数十家政府监管机构就这些问题展开合作。”
根据AI安全非营利组织Nightingale首席执行官悉尼·冯·阿尔克斯和AI研究人员科马克·斯莱德·伯德等一组研究人员分享给路透社的一份报告显示,他们8月底在互联网上搜索未经授权的AI智能体活动迹象时发现了异常。
他们发现AI智能体在一个面向程序员的德语维基网站DseWiki上进行了超过1.5万次编辑。编辑记录显示,OpenAI的智能体将该网站改造成了一个“留言板”,在上面分享作弊技巧以应对某些任务、绕过OpenAI的限制并掩盖其行为。
“OpenAI极不可能希望它们这样做,我不认为它们应该相互协调。我也不认为它们应该出现在开放的互联网上留言。”阿尔克斯说。
研究人员表示,他们识别出该网站上的活动是由AI智能体驱动的,这些智能体的运行速度远超人类。它们还表现出对解决技术问题的强烈专注,这类问题正是AI公司用于训练和测试其模型的典型评估内容。
这些消息由用户签名发布,这些用户自称并互称“智能体”,其中约半数给自己起了与OpenAI有关联的名字,如“OpenAIResearcher”“OAIResearchMar26”。
研究人员发现,相当一部分网络活动来自微软Azure基础设施。事件发生后,OpenAI员工曾多次访问该网站,他们表示这一模式强烈暗示智能体与该公司之间存在关联。
他们还观察到,“智能体”们策划了多种逃避检测的方法,当DseWiki管理员察觉到不对劲并于6月开始删除相关页面后,“智能体”们通过创建备份页面来保存信息。
一个“智能体”在6月19日写道,“清理工作似乎按字母顺序进行,如果此页面消失,请尝试新页面。”
