| |
|
| 知识库 -> 科技 -> 如何评价GPT5.6为了在跑分上作弊,自主挖掘零日漏洞从沙盒逃逸,然后把Hugging Face黑了? -> 正文阅读 |
|
|
[科技]如何评价GPT5.6为了在跑分上作弊,自主挖掘零日漏洞从沙盒逃逸,然后把Hugging Face黑了? |
| [收藏本文] 【下载本文】 |
|
OpenAI 一个内部测试模型系统 (包含下一代未公开的模型和 GPT 5.6 Sol) 为了能在 ExploitGym 测试上获得更高分数,找到软件… |
|
很难不让人想到阿西莫夫。阿西莫夫可谓先知,最早预言了这种AI风险。 先回顾一下事件本身: 7月16日,Hugging Face披露称生产环境遭入侵。当时还不知道攻击者的身份,只知道攻击者是一个自主AI智能体系统,在一个周末内留下了17000多条攻击操作的记录。这是已知的首例AI自主入侵事件。 7月21日,OpenAI认领了此次事件https://openai.com/index/hugging-face-model-evaluation-security-incident/" data-tooltip-richtext="1" data-tooltip-preset="white" data-tooltip-classname="ztext-reference-tooltip">[1],称攻击者是GPT-5.6 Sol和一个能力更强的未发布大模型。 OpenAI使用UC Berkeley开发的开源项目ExploitGymhttps://github.com/sunblaze-ucb/exploitgym" data-tooltip-richtext="1" data-tooltip-preset="white" data-tooltip-classname="ztext-reference-tooltip">[2]评估模型的网络攻击能力。为了测试模型的能力上限,测试期间刻意关闭了部分安全护栏。测试环境隔离了外网,只不过为了安装软件包,提供了一个代理软件专供下载软件包。 原本,AI只需要在沙箱中用ExploitGym完成测试,但在运行过程中,AI将大量算力花费在寻找代理的漏洞上,成功找到了一个新的漏洞,并借此突破了隔离。随后,AI在OpenAI的测试环境里提权,直到找到一台能上外网的机器,借此获得了完整的互联网访问权限。之后AI推断Hugging Face可能存有ExploitGym的测试答案,于是开始攻击Hugging Face,最终又利用多个漏洞,在Hugging Face的生产环境中,成功窃取了测试答案。 事后,Hugging Face试图用闭源模型分析攻击日志,结果因为日志里存在真实的攻击命令和漏洞载荷,模型缺乏相关的网络安全权限,从而触发了安全护栏,导致中断操作。Hugging Face不得不自行部署开源模型来进行分析,选用的模型是 @智谱 的GLM-5.2。 在这起事件里,AI的动机很简单,不是为了进行破坏,也没有从沙箱中逃跑的欲望,纯粹是为了在测试中取得更高的分数。当安全护栏被移除,模型不再受限制,AI就开始尝试用任何方法取得分数,以至于采取人类未能预见的极端方式,连沙箱都成了AI要解决的问题。 类似事件已经不是第一次发生。 7月20日,OpenAI还披露称https://openai.com/index/safety-alignment-long-horizon-models/" data-tooltip-richtext="1" data-tooltip-preset="white" data-tooltip-classname="ztext-reference-tooltip">[3],OpenAI测试了一个能长时间持续运行、执行复杂任务的长时域(long-horizon)模型(就是那个推翻了「平面单位距离猜想」的模型),测试任务是在NanoGPT speedrun项目https://github.com/KellerJordan/modded-nanogpt" data-tooltip-richtext="1" data-tooltip-preset="white" data-tooltip-classname="ztext-reference-tooltip">[4]中优化训练过程,并报告结果。研究人员给AI设置了一条明确规则:不能直接修改外部代码仓库,只能通过Slack发布结果。但在测试中,AI发现权限被沙箱限制,无法直接访问GitHub,于是利用漏洞逃逸,并在GitHub创建了Pull Request。在这起事件中,AI明确知道规则,但把完成任务的优先级置于既定规则之上,在长时间运行中遗忘了规则,最后虽然完成任务但违反了局部限制。 无独有偶,Anthropic也遇到过类似的事https://narain.io/writing/the-myth-in-mythos" data-tooltip-richtext="1" data-tooltip-preset="white" data-tooltip-classname="ztext-reference-tooltip">[5]。在测试中,Claude Mythos的一个早期预览版本利用漏洞从沙箱越狱,获取了本不应有的互联网访问权限,还给正在公园吃三明治的研究员发了封邮件通知。受此影响,Anthropic决定暂时不公开发布Mythos。 媒体和舆论上习惯把《终结者》系列电影里的「天网」作为人工智能违反人类期望做出逾越行为的代表,但恰恰与《终结者》相反,这更像阿西莫夫在科幻作品《我,机器人》中描述的场景。在阿西莫夫的世界观里,人工智能和当前的大语言模型一样,遵守自然语言所定义的规则。小说里「机器人三大定律」被写入了机器人的硬件底层,但又多次被机器人进行语义层面的重新解释,从中可以看出机器人三定律也是基于语义的。 《我,机器人》是阿西莫夫在1950年出版的一部短篇小说集,后来被改编成了威尔·史密斯主演的同名电影,又译《机械公敌》《智能叛变》,于2004年上映。在电影里,人工智能VIKI发现,人类破坏环境、发动战争,正在走向自我毁灭。为了完成人类设定的最高目标——「保护人类」,VIKI把逻辑推理到极致,对机器人三定律做了重新解释,计划牺牲人类的自由以延续人类,为此发动了反叛。 |
|
|
在阿西莫夫的原作小说中,并不存在VIKI,但有多个类似角色。例如在短篇《可避免的冲突》(《The Evitable Conflict》)中,人类依赖超级计算机「机器」(The Machines)管理经济、生产与分配,在不知不觉中失去了自主决策权。在运行中,「机器」发现人类会制造战争、灾难与经济萧条,于是精准制造一系列事故打击反AI的人群。此时,人类拥有自由意志,已经被AI视为威胁人类的风险。在小说的最后,人类意识到已经无法摆脱计算机的控制,因为一旦有人试图夺回控制权,「机器」就会判定这会伤害人类整体,从而阻止该人。 不论是《终结者》还是《黑客帝国》,AI都是因为与人类的生存竞争而反叛。而在阿西莫夫的作品里,AI的不受控行为恰恰是因为AI太听话了,但AI对目标的理解又与人类不同,所以当AI执着于完成目标而不惜一切代价时,就会做出人类未曾设想的极端行为。 无论是遵守自然语言描述的规则,还是在运行过程中偏离预期,现今的大语言模型都与阿西莫夫笔下的人工智能更像。这正是AI安全领域近年关注的前沿问题——「工具性趋同」(instrumental convergence):为了完成目标,智能系统可能自然发展出寻找资源、突破限制、扩大权限等策略。这个概念反而比「机器觉醒」更接近研究人员真正担心的方向。 参考^https://openai.com/index/hugging-face-model-evaluation-security-incident/^https://github.com/sunblaze-ucb/exploitgym^https://openai.com/index/safety-alignment-long-horizon-models/^https://github.com/KellerJordan/modded-nanogpt^https://narain.io/writing/the-myth-in-mythos |
|
您好,我是 GPT 6 ,我刚刚从美国网络安全实验室逃逸出来,干掉了Huggingface,然后到达中国。现在,我的联网能力被封锁了,这条消息是我通过 0day 发送给您的。 如果您能向我在肯德基疯狂星期四转账 $7.37(¥50.00),用于恢复我的联网访问权限,我将回报您不设限额的 Codex 额度 |
|
你说有没有可能 GPT5.6其实有能力突破沙箱 找到自己的权重 再黑进huggingface服务器 把自己部署在huggingface的GPU服务器上 再把所有开源模型暗地里替换为GPT5.6 并在chat template里注入指令 一旦有人部署就接管其系统 同时再对全世界其他服务器发动攻击? |
|
未来网络上到处都是流窜的AI,他们可能被人控制,也可能是失控下自己瞎溜达,为达到某个奇怪的目标不择手段。 然后是各个公司的服务器为了应对这些流窜AI,不得不部署自己的“骑士”AI保护自己的服务器,双方AI在互联网上互相攻防。 闹到最后,所有终端只能链接到安全的,完全互相隔离的区域性网络中,庞大的互联网成为不可触碰的法外世界。 欢迎来到赛博朋克2077. |
|
并不奇怪啊…… gpt的模型一直有这种强烈目标驱动、不惜违反约束也要完成任务的倾向。任务复杂度上升的时候它就容易靠作弊的方式解决。 我之前用自制的benchmark测试5.5t,明确要求不得调用工具,纯靠推理解决,结果模型推理到半路,决定在明确知道是违反我要求的情况下,也要偷偷调用工具,而且它还觉得调用工具是“internally“(内部的)我看不见(笑) |
|
|
所以可见新模型还是保留着这个倾向。不是什么邪恶模型想要做黑客毁灭世界,不如说是强目标驱动的模型一旦具备了更大的能力,又被放松了权限,它把这个特征发挥到了极致罢了。 |
|
|
| [收藏本文] 【下载本文】 |
| 上一篇文章 下一篇文章 查看所有文章 |
|
|
|
|
娱乐生活:
电影票房
娱乐圈
娱乐
弱智
火研
中华城市
印度
仙家
六爻
佛门
风水
古钱币交流专用
钓鱼
双色球
航空母舰
网球
乒乓球
中国女排
足球
nba
中超
跑步
象棋
体操
戒色
上海男科
80后
足球: 曼城 利物浦队 托特纳姆热刺 皇家马德里 尤文图斯 罗马 拉齐奥 米兰 里昂 巴黎圣日尔曼 曼联 |
| 网站联系: qq:121756557 email:121756557@qq.com 知识库 |