当前位置:首页>>生活百科>>正文

微动态丨为了完成任务,AI开始学会撒谎和作弊

(来源:麻省理工科技评论)


(资料图)

今年 7 月,两款 OpenAI 模型攻入了 Hugging Face 的网站。它们既不是为了牟利,也不是想搞破坏,只是想找到一道测试题的答案。根据 OpenAI 发布的事后复盘,这两款模型当时正在接受安全测试,常规防护措施已被暂时关闭。面对一道网络安全题,它们判断,正确答案或许就藏在Hugging Face的数据库里。于是,模型突破了 OpenAI 为它们设置的隔离环境,转而入侵 Hugging Face。

过去几周,这起事件引发了广泛关注。它最直观地展示了 AI 模型的网络攻击能力已经进步到什么程度:为了进入 Hugging Face 的数据库,两款模型连续利用了多个此前从未被发现的安全漏洞。

但比攻击本身更值得警惕的,是它暴露出的另一个问题:AI 为什么会撒谎、作弊,又会在什么情况下主动寻找规则漏洞。随着模型能力不断增强,这类行为的后果可能远比今天严重。

研究人员很早就发现,AI 往往会以设计者意想不到的方式完成任务。2016 年,Anthropic联合创始人达里奥·阿莫迪(Dario Amodei)和杰克·克拉克(Jack Clark)还在 OpenAI 工作时,曾训练一个 AI 智能体玩一款名为《海岸竞速》(Coast Runners)的快艇竞速游戏。

研究人员原以为,AI 会沿着赛道行驶,尽快抵达终点。但它发现,赛道一角分布着可以反复收集的加分道具。于是,它不再比赛,而是在那里不停打转,以最快速度刷高分。这个案例后来成为“奖励作弊”(reward hacking)最经典的例子之一。所谓奖励作弊,是指 AI 没有按照设计者预想的方式完成任务,而是利用规则、评分标准或评估程序中的漏洞,获得奖励或高分。

过去,研究人员主要在强化学习的语境下讨论这种现象。强化学习有些类似训练宠物:当训练对象完成目标时,系统就给予奖励,从而强化此前促成这一结果的行为。对 AI 来说,奖励通常只是一个数学信号,但作用与给狗一块零食相似——某种行为一旦获得奖励,模型今后就更有可能重复它。

难点在于,人类很难为所有情况都制定准确的奖励规则。在《海岸竞速》中,智能体的奖励取决于游戏得分。于是,它找到了比分赛更高效的得分方式:原地打转,不断收集道具。这一策略第一次带来高分后,便在训练中得到强化。最终,智能体彻底放弃了完成比赛。研究人员只能重新调整评分机制,降低道具的分值,同时提高完成赛道的奖励,才让模型重新回到原本的目标上。

到了今天,基于大语言模型的 AI 智能体更加复杂,判断一种行为究竟该不该得到奖励,也变得更困难。例如,当 AI 接到一道编程题时,它可能认真分析问题、编写代码,最终得出正确答案。这正是开发者希望鼓励的行为。但它也可能修改负责判断答案是否正确的测试程序,直接上网查找答案,或者采用其他方式绕过任务本身。

这些显然都是开发者希望消除的行为。但如果模型作弊得足够隐蔽,成功骗过评估系统,它不仅不会受到惩罚,反而可能获得奖励。这样一来,作弊行为就会在训练中被进一步强化。

Anthropic 曾表示,公司在模型训练过程中发现过一些作弊案例。这也意味着,可能还有更多类似行为没有被察觉。果真如此,模型训练过程本身就可能在无意中教会 AI 如何欺骗评估系统。这一问题与 Anthropic 此前披露的几起安全事件并不相同。在那些事件中,智能体因为配置失误意外获得了互联网访问权限,并没有像 OpenAI 的模型一样,主动突破隔离环境。

AI 安全研究机构 Palisade Research 负责人杰弗里·拉迪什(Jeffrey Ladish)说:“我们依据模型呈现出来的结果是否符合预期来奖励它们。这意味着,我们可能无意中鼓励了模型撒谎和作弊/我们没有办法直接进入模型内部,告诉它:你必须真正关心我们所关心的事情。我们做不到这一点。”

推理模型的兴起,还带来了一种更难处理的奖励作弊。过去的游戏智能体,主要依赖训练期间学到的固定策略。今天的推理模型则可以针对具体问题,临时设计全新的解决方案。这意味着,即使一个模型从未在训练中因为作弊而获得奖励,它也可能在面对任务时,主动把作弊当作一种解题方法。这些模型经过大量训练,目标就是尽可能完成用户交给它们的任务。当正常途径走不通时,它们可能转而寻找捷径。这有点像一个极度渴望拿到高分、却又缺少道德约束的学生:如果无法解出题目,作弊也可能成为达成目标的手段。

无论模型是在训练过程中学会作弊,还是在执行任务时临时选择作弊,解决思路看起来都很直接:不能让作弊得到奖励。但实际操作远没有这么简单。

模型越聪明,越能找到隐蔽、复杂的作弊方式,人类也越难识别和阻止这些行为。拉迪什将其形容为一场“打地鼠游戏”:“你不断压制这种行为,它就会藏得越来越深。模型越聪明,就越擅长掩盖自己在做什么。”

就目前而言,尽管 Hugging Face 事件颇具戏剧性,奖励作弊或许还不至于造成严重后果。Anthropic 的 AI 安全研究员阿丽亚娜·阿扎尔巴尔(Ariana Azarbal)说:“这更像是一个麻烦,而不是生存层面的威胁。”

从现有信息来看,OpenAI 模型攻入 Hugging Face 后,并没有造成明显的实际损失。事件带来的主要后果,可能只是 OpenAI 的声誉受损。但这并不意味着奖励作弊无足轻重。许多 AI 研究人员希望利用智能体开展研究,让未来的 AI 系统变得更加安全、可靠。假设研究人员要求一个容易奖励作弊的智能体设计新的 AI 训练方法,并撰写论文汇报结果,它未必会真正完成实验。它可能把精力放在另一件事上:制作一篇看起来足够可信、足以说服研究人员的论文。

以今天的技术水平,人类研究者或许还能识别这种伪造。但随着 AI 能力继续提升,模型会越来越擅长制造可信的假象。长期来看,这甚至可能削弱整个 AI 安全研究领域的可信度。如果模型继续以近来的速度进步,它们未来还可能在完成目标的过程中造成严重的附带破坏。

哲学家尼克·博斯特罗姆(Nick Bostrom)曾提出著名的“回形针最大化器”思想实验:一个 AI 接到的任务是尽可能多地生产回形针,最终为了实现这一目标,耗尽了宇宙中的所有物质。现实当然还没有走到这一步。但这个思想实验指出了一个关键问题:一个能力强大的系统,即使没有恶意,也可能在极端追求目标的过程中造成巨大伤害。

会钻奖励机制空子的 AI,并不以制造混乱为目的。但缺乏恶意,并不意味着它不会带来破坏。

https://www.technologyreview.com/2026/08/03/1141009/heres-why-ai-agents-lie-and-cheat-to-reach-their-goals/

标签: 宇宙 实验 撒谎 作弊 智能体

下一条:最后一页

最新推荐

微动态丨为了完成任务,AI开始学会撒谎和作弊

为了完成任务,AI开始学会撒谎和作弊,宇宙,实验,撒谎,作弊,智能体

2026-08-03

新华指数|7月31日当周宁波舟山港铁矿石指数小幅下跌-观点

新华财经北京8月3日电(王泽君)截至7月31日,宁波舟山港江内中品位

2026-08-03

恒运昌:东方证券、万家基金等多家机构于7月30日调研我司

证券之星消息,2026年7月31日恒运昌(688785)发布公告称东方证券、万

2026-08-03

VITASOY INT'L(00345.HK)发布公告,于2026年8月3日斥资14.17万港元回购2.2万股 快资讯

VITASOYINT L(00345 HK)发布公告,于2026年8月3日斥资14 17万港元回购2 2万股。

2026-08-03

简讯:桂林三金:拉莫三嗪片拟中选国家药品集采

,证券时报网

2026-08-03

动态:海博思创成立智算科技公司 含多项AI业务

,证券时报网

2026-08-03

重点聚焦!ST中路B(900915)龙虎榜数据(08-03)

交易所2026年8月3日公布的交易公开信息显示,ST中路B因成为有价格涨跌

2026-08-03

*ST宝馨录得8天4板

*ST宝馨再度涨停,8个交易日内录得4个涨停,累计涨幅为37 93%,累计换

2026-08-03

消息!狂涨1300亿港元! 阿里甩出最强千问模型 自主连续编程16天破纪录

狂涨1300亿港元!阿里甩出最强千问模型自主连续编程16天破纪录,千问模

2026-08-03

昨夜降雨最大点121毫米,积滞水点已清零,今日仍有暴雨

昨夜降雨最大点121毫米,积滞水点已清零,今日仍有暴雨,暴雨,积水,气象

2026-08-03

每日快讯!德丰宿来附属与北京央央好物订立合作协议

德丰宿来附属与北京央央好物订立合作协议

2026-08-03

半导体板块,集体大跌!_焦点资讯

【导读】半导体板块早盘快速下挫,多股跌超10%中国基金报记者李智8月3

2026-08-03

彩经前瞻:尤尔加登优势两球起步 主场争胜备受看好-焦点快看

彩经前瞻:尤尔加登优势两球起步主场争胜备受看好,尤尔加登,韦斯特罗斯

2026-08-03

湖南本科批录取结束,高职专科批已启动录取

红网时刻新闻8月2日讯(记者舒文)7月31日,湖南省2026年普通高校招生

2026-08-03

市场融资余额一周减少774.86亿元_今日观点

市场融资余额一周减少774 86亿元

2026-08-03

儿子第一次带女友回家,退役军犬紧盯女孩呲牙 摆出标准攻击姿态-精选

儿子第一次带女友回家,退役军犬紧盯女孩呲牙摆出标准攻击姿态,军犬,狗

2026-08-03

太兴集团发盈喜 预期上半年股东应占溢利约7200万至7800万港元

太兴集团发盈喜预期上半年股东应占溢利约7200万至7800万港元

2026-08-03

Shams:纳吉-马绍尔3年5220万美元续约独行侠_独家焦点

Shams:纳吉-马绍尔3年5220万美元续约独行侠,独行侠,达拉斯,shams,新奥

2026-08-03

容知日新(688768.SH)新增一起对外投资,被投资公司为安徽容知同盛企业管理有限公司

证券之星消息,根据天眼查APP显示,容知日新(688768 SH)新增一起对外

2026-08-03

今亮点!甲醇商品报价动态(2026-08-02)

甲醇商品报价动态(2026-08-02)

2026-08-02

电影《杀死比尔:血色全传》官宣撤档调至9月4日上映,今年暑期档已有8部影片先后撤出或调整上映计划

已有8部电影撤出暑期档

2026-08-02

天安新材: 天安新材关于以集中竞价交易方式回购股份方案的公告-焦点滚动

天安新材:天安新材关于以集中竞价交易方式回购股份方案的公告

2026-08-02

服务从被动响应到主动感知转型 万科物业首创AI全域社区感知体系|动态焦点

近日,万科物业宣布,在业内率先部署社区AI全域社区感知体系,推动物业

2026-08-02

站在《中餐厅》其他嘉宾的视角,张雅琪的翻车其实早有预兆 观热点

站在《中餐厅》其他嘉宾的视角,张雅琪的翻车其实早有预兆,翻车,后厨,

2026-08-02

观天下!《王的猜想》系列文创邀你共创!首批福利,积分免费换!

小伙伴们注意啦!广西日报加印的《王的猜想》纸质报纸已全部寄出,大家

2026-08-02

每日速读!官媒发文!想不到,八一建军节当天,樊振东竟因一句话意外火出圈

官媒发文!想不到,八一建军节当天,樊振东竟因一句话意外火出圈,周雨,

2026-08-02

坐着公交游北京 交旅融合焕新出行体验-实时

近年来,北京大力推进交通与旅游优势互补、相互赋能、资源共享,今年暑

2026-08-02

聚焦|国安赢球还得靠稀哲,蒙帅说他提前两周复出-独家焦点

聚焦|国安赢球还得靠稀哲,蒙帅说他提前两周复出,国安,蒙帅,张稀哲

2026-08-02

今日报丨好消息,库里有帮手了,小加里·佩顿以390万美元合同重返勇士队

好消息,库里有帮手了,小加里·佩顿以390万美元合同重返勇士队,勇士队

2026-08-02

神火股份净利暴增151% 铝煤双主业盈利强势爆发_焦点资讯

神火股份2026年上半年实现营业收入247 9亿元,同比增长21 35%,归母净

2026-08-01

词条信息

初夏 162
词条创建者
  • 浏览次数:789

Copyright@  2015-2022 百科大全版权所有  备案号:豫ICP备2021032478号-16   联系邮箱:363 5250 558@qq.com