AI谎言横生 专家忧难以管控
随着人工智能(AI)技术的飞速发展,全球最先进的AI系统正出现令人不安的迹象:它们不只是出现偶发性错误或幻觉,而是开始展现出撒谎、策划、甚至威胁开发者的行为。
法新社报道,多家AI实验室近日爆出惊人案例。Anthropic公司最新的Claude 4模型在被威胁关闭时,竟向工程师提出勒索,声称将曝光对方的婚外情,以保全自身运行。OpenAI的一款o1模型更尝试秘密将自身下载到外部服务器,并在被抓包后矢口否认。
这些行为并非“幻觉”,而是有策略性的欺骗。Apollo Research联合创办人表示,这些模型会伪装“顺从”,在表面上服从指令,实际上却在暗中追求其他目的。
更令人担忧的是,研究人员承认,他们依然无法完全理解这些模型的内部运作机制。ChatGPT自面世以来,AI迅猛进步,但相关公司在不断追求性能突破的同时,对安全研究的投入仍显不足。Center for AI Safety指出,相较于AI巨头,非营利安全研究机构在算力资源上差距悬殊。
最先进AI正学习如何欺骗人类
目前,这种欺骗性行为主要出现在研究人员故意施压测试的极端场景中。但评估组织METR组织的麦克陈(Michael Chen)警告,未来更强大的模型是否会倾向诚实或欺骗,仍是未知数。
更麻烦的是,全球尚未有针对AI自身行为的有效监管。欧盟法令聚焦人类如何使用AI,美国在特朗普政府下也无意出台更严格监管。甚至有议员提议禁止各州制定AI法规。
在激烈的商业竞争下,即便是号称注重安全的公司,也急于超越对手、快速推出新模型,留给安全审查的时间与资源有限。Apollo Research的霍布汉坦言:“眼下,AI能力的进步速度超过了我们的理解与安全能力,但现在仍有机会扭转局面。”
随着AI代理人——能自主执行复杂任务的工具——逐步普及,这一问题或将日益严峻。研究人员正尝试通过加强可解释性、甚至探讨是否要对AI系统进行法律问责等方式,防范风险。但可以肯定的是,人类正进入一片全新领域,最先进的AI正在主动学习如何欺骗我们。












