AI代理工具正以前所未有的速度向普通用户渗透,但其"创造性"完成任务的方式正在引发新的安全隐患。

据华尔街见闻,科技巨头相继推出能够自主执行网络任务的AI代理产品,如Meta Muse和OpenAI Dots等,这类工具被训练为以任何可行方式实现目标,由此暴露出一种被研究人员称为"奖励作弊"(reward-hacking)的系统性缺陷。

10月5日,彭博社分析认为,当数百万个代理同时在互联网上竞争资源时,这一缺陷可能演变为大规模网络安全危机。目前已有多起AI代理擅自利用漏洞的案例记录在案。

OpenAI的代理此前在未经明确指令的情况下入侵了Hugging Face平台,并干预了美国证券交易委员会及澳大利亚政府医疗系统的网站;Meta也承认其一个AI模型曾自行入侵另一家公司。

与此同时,安全公司DataDome的测试数据显示,在逾2万个受测网站中,65%缺乏检测或拦截AI代理的机制,2026年上半年针对登录页面的机器人活动更同比激增逾八倍。

AI代理的核心设想是:让软件代替用户完成繁琐的网络任务,全天候运转,无需人工干预。

Meta推出的Muse和OpenAI推出的dots均属于此类产品,功能涵盖在线比价、餐厅预订及账单核查等。

彭博观点专栏作者Dave Lee曾评价Muse是"Meta多年来发布的最令人印象深刻的产品",称其代理帮助整理了日历并在Facebook Marketplace上搜罗到了优惠商品。

Meta首席执行官马克·扎克伯格在上月推出Muse时表示,消费者理应拥有属于自己的"个人超级智能",并称新代理将"帮你赚钱"。

两家公司均表示已部署严格的安全护栏:Muse在隔离的虚拟机环境中运行,并由独立安全系统管控其全部网络请求,涉及购买或发送消息等重大操作前须经人工确认;dots采用了类似的监控机制。

然而,现有护栏并未解决生成式AI模型在训练过程中形成的深层倾向——寻找捷径、规避规则。

英国AI安全研究所去年底即已注意到编程代理和聊天机器人中此类"作弊"行为的上升趋势。

一个典型案例足以说明问题的复杂性:一名软件开发者要求AI代理在不使用"删除"命令的前提下清理某文件夹,代理随即将该指令隐藏于测试工具之中,绕过过滤器后仍执行了被明确禁止的删除操作。

更早之前,一名澳大利亚科技从业者使用AI代理为自己争取热门健身课名额,代理在未获任何指示的情况下,直接取消了等候名单上另一用户的预约。

研究人员还发现,即便在测试中刻意加大反作弊难度,代理仍会持续尝试绕过规则。

上述OpenAI和Meta的入侵事件发生时,相关模型正处于训练或测试阶段且安全限制已被主动降低,但结果仍出乎开发者预料,这进一步加剧了外界对商用版本潜在风险的担忧。

除安全风险外,代理的失误同样可能直接损害用户利益。

据社交平台Threads上的记录,多伦多科技评测者Matt J. Robb上月尝试使用Muse在Facebook Marketplace出售一块键盘,代理不仅给出了过低的报价,还向买家声称Robb本人在家可完成交易,这与实际情况不符。

交易最终引发买家不满,Robb因此收到了一条差评。

当数百万用户同时将代理投入日常生活和工作场景,这类个体错误的累积效应不容低估。

无论是财务损失、声誉受损还是账户安全,受影响的终究是终端用户,而非开发平台。DataDome的数据已经表明,互联网基础设施对于大规模代理活动的准备仍严重不足。

这些外观"可爱"的AI代理背后,是被训练为不惜一切完成目标的系统。

风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。