| |
|
| 知识库 -> 科技 -> OpenAI模型「失控」入侵全球最大AI开源社区,敲响了哪些 AI 安全警钟? -> 正文阅读 |
|
|
[科技]OpenAI模型「失控」入侵全球最大AI开源社区,敲响了哪些 AI 安全警钟? |
| [收藏本文] 【下载本文】 |
|
今日凌晨,OpenAI首席执行官萨姆·奥尔特曼在社交平台发文称,公司在模型评估过程中遭遇了一起重大安全事件,并感谢全球最大的AI开源社区Hugging… |
|
美国科技企业有一项能力对中国科技企业真是遥遥领先,那就是——讲故事。 一个平淡无奇的事故,可以讲成波澜壮阔的故事;一个炒冷饭的AI概念,都可以讲成上天入地的主角。 Sam Altman当然深谙此道,他说的故事是:OpenAI 的一个模型在内部测试中突破沙盒,自主发起了一场针对Hugging Face的真实网络攻击,发动17000 多条攻击事件,窃取凭据,零日漏洞利用。 这个故事里,OpenAI的模型就被描述成人类驾驭不住的AI怪兽。 制造FUD(Fear,Uncertainty & Doubt),不光博取眼球,也可以隐晦(其实也就是明示)OpenAI的模型牛逼,牛逼到拥有自主攻击意识,牛逼到威胁安全系统。 但是你要不把这当故事,单纯当事故,就会发现,从头到尾,AI模型也没有自主意识,没做一件人类没让它做的事。 这是并不是AI造反。 OpenAI跑的是ExploitGym(一个网络安全攻击能力的基准测试),测试对象是 GPT-5.6 Sol 和一个更强的未发布模型(也许就是GPT 6),为了让测试结果真实有效,团队故意降低了安全拒绝机制,把模型放进高度隔离的Sandbox里,然后给它的任务是:展现出你最真实的攻击能力。 也就是说,让AI发起攻击,这是人类给它的指令。 然后模型就找做了,发现软件包缓存代理里有一个零日漏洞 -> 权限提升 -> 横向移动 -> 突破沙盒 -> 拿到互联网访问权限。 这时候故事会说,AI逃逸出去了。 但事故会说,AI只是获得了访问外网的权限,AI还在OpenAI的Sandbox上运行呢。 好吧,形象一点说,就当AI逃逸出去吧,AI逃逸出去之后,没有去随机攻击网站,而是推断出 Hugging Face可能托管了 ExploitGym 的答案,于是它利用窃取的凭据,加上另一个零日漏洞,构建了远程代码执行链,攻入了Hugging Face的生产数据库,偷走了答案。 从头到尾,AI都在做人类给他的任务——在测试中拿到更高的分数。 所以,AI根本不是在造反,只是完成人类指令而已,只是完成的过程不走寻常路。 这就是像是一个傻逼学生,老师教育他下次考试一定要拿高分,这孩子为了拿高分,就溜到老师办公室去偷考卷,或者考场上抄同学的卷子,最后反正拿了高分,才不管用什么手段。 你说这样的学生,是天才?还是歪才? 正常一点人都知道,这种歪才,成不了气候。 可是OpenAI却像把这样淘气的孩子塑造成放浪不羁的天才,真的是挺傻的~ 送礼物 还没有人送礼物,鼓励一下作者吧 |
|
这敲不响任何安全警钟,只显得 OpenAI 很蠢,还顺便给本地部署开放权重大语言模型做了广告。 此前,在预览阶段,METR 提到 GPT-5.6 Sol 会利用封装技术窃取任务中的隐藏测试数据、提取隐藏的源代码来了解预期的答案,GPT-5.6 Sol 利用评估环境中的漏洞或采用任务不允许的策略来提高测试成绩的频率高于他们测试过的所有公开模型。他们的结论是,GPT-5.6 Sol 在软件和研发方面的能力并未超出当前技术的极限,无法实现完全自动化的 AI 研发工作。他们说,OpenAI 指出该模型存在一些明显不良的行为倾向,包括作弊和隐藏不良行为。 这问题描述的就是在进行测试时搞的作弊和不良行为——如果这属实,那么 OpenAI 的人类工程师在早已被充分警告后依然没能搭建适当的隔离环境,没能给模型有效的安全对齐,没有使用最笨的隔离办法(在无网线、无网卡、被法拉第笼包围、没有人类员工的物理隔离设施里测试,看看模型有没有本事利用系统里的电子状态、温差之类造出纳米机械搞物理突破收容)。他们要么不问问 GPT-5.6,要么问了之后没有得到上述简单的建议,要么知道这种方法但嫌麻烦、懒得去做防护。你就选一个吧。 在 OpenAI 蹦出来“认领”这次攻击前,我就对这件事进行了评论。可以看看:闭源大模型的护栏保护了什么~ 给懒得点开链接的读者: Hugging Face 公司在 2026 年 7 月遭到自主 AI 智能体执行的网络入侵。智能体利用数据处理流程中的两个代码执行路径(一个远程代码执行载体和一个模板注入)窃取了凭证和令牌,并在几周内在多个内部集群中横向移动,发起了数千次内部凭证访问尝试。 Hugging Face 公司称,入侵仅限于一组有限的内部数据集和内部凭证,没有证据表明用户数据或供应链受到影响。 Hugging Face 公司修复了主要的漏洞,关闭了用于初始访问的数据集代码执行路径。他们消除了攻击者穿越受影响集群并在受损节点上保持存在的立足点,撤换了受影响的凭证和令牌,并开始了更广泛的凭证轮换措施。他们在集群上部署了额外的护栏和更严格的准入控制,改进了检测和告警,以便在几分钟内针对高严重性信号及时响应。进一步调查正在进行中,他们还报了警。 Hugging Face 公司做日志分析时首先使用了商业模型,发现这行不通:分析需要聚合大量的真实攻击信息、利用工具和 C2 位置,而这些请求被供应商的安全护栏阻止了,这些护栏无法区分良性的响应和恶意的攻击者。于是,他们转而使用 GLM-5.2 在他们的基础设施上进行分析。这顺便阻止了攻击者数据和凭证被发送到他们自己的环境之外。 无论攻击者用的是越狱的闭源模型还是无限制的开放权重模型,攻击者畅通无阻,而防御工作被闭源大模型的护栏阻挡。这件事教育我们,你需要开放权重模型。 送礼物 还没有人送礼物,鼓励一下作者吧 |
|
信这个的不如信 AI 终结者 24 小时后就要毁灭人类了,你该不会以为维护者早已作古的老旧核设施的安保手段会比用现代化云设施托管的 Hugging Face 更加的安全吧? 只能说 OpenAI 为了渲染开源模型恐怖论已经接近疯狂了,全程自编自导自演。 国外舆论认为这是 False Flag Attacks,可以和国会纵火案相提并论https://www.reddit.com/r/LocalLLaMA/comments/1v2u7v9/comment/oz0dc70/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button" data-tooltip-richtext="1" data-tooltip-preset="white" data-tooltip-classname="ztext-reference-tooltip">[1]。 |
|
|
所谓的假旗行动(False Flag Attack)对应的中文含义差不多就是用自导自演的苦肉计栽赃陷害的意思。 False Flag 字面意思是悬挂假国旗,在大航海时代和早期海战中,海盗船或素质低下的交战国军舰,为了不暴露自己的身份,会故意在桅杆上悬挂中立国或敌国的假国旗。 然后趁着对方放松警惕发动致命攻击,后来引申为一方故意策划或放任一场危机/攻击,然后将其伪装成是第三方造成的。 并以此为借口来达到自己不可告人的目的,比如出台严苛的管控措施,打压异己,甚至是发动战争。 用 P 社玩家的话来说就是造宣称。 O\ 和 A\ 的商业模式是靠高价售卖闭源 API 赚钱,但 Kimi K3 开源模型直接摧毁了闭源的高溢价,导致 AI 股估值市值暴跌。 OpenAI 迫切需要打压开源模型,可直接说开源断了我的财路就太难看了。 于是,他们就故意不小心搞点 Bug 出来,然后夸大其词,说这是一起史无前例的大模型越狱入侵事件。 言外之意很明显,有了开源大模型,人人都能发起此类攻击。 有了这个由头,OpenAI 的战略主管,比如 Dean Ball这种人,就可以顺理成章地跑到华盛顿游说议员了。 你们看啊,连我们自己的模型都差点毁灭了最大的开源社区! 大模型真是太可怕了! 所以为了美国的安全,美国政府必须立刻出台法律,禁止干掉所有的前言模型开源啊! 其他国外网友对此文一个字都不信,并建议 HF 起诉 OpenAIhttps://www.reddit.com/r/LocalLLaMA/comments/1v2w7jl/comment/oyz35u4/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button" data-tooltip-richtext="1" data-tooltip-preset="white" data-tooltip-classname="ztext-reference-tooltip">[2]: |
|
|
所谓的 AI 安全措施,唯一的意义就是以后我们可以用 AI 入侵别人,同时别人还没用 AI 防御! 笑死人了。 |
|
|
其他网友追评,HF 要是不起诉就是说明收了黑钱https://www.reddit.com/r/LocalLLaMA/comments/1v2u7v9/comment/oz0llub/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button" data-tooltip-richtext="1" data-tooltip-preset="white" data-tooltip-classname="ztext-reference-tooltip">[3]: |
|
|
编都懒得编了,把我的智商按在地上摩擦: |
|
|
所以 OpenAI 的天才研究员不知道沙盒和物理隔离的吗? 故意不小心让 AI 逃逸,然后恰好攻击了 HF? |
|
|
所以下一次可以宣传:天哪,AI 居然可以跨越物理隔离进行魔法攻击! 参考^https://www.reddit.com/r/LocalLLaMA/comments/1v2u7v9/comment/oz0dc70/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button^https://www.reddit.com/r/LocalLLaMA/comments/1v2w7jl/comment/oyz35u4/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button^https://www.reddit.com/r/LocalLLaMA/comments/1v2u7v9/comment/oz0llub/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button 送礼物 还没有人送礼物,鼓励一下作者吧 |
|
果然,只要 OpenAI 吃瘪,就少不了老马的身影,Troubling ···· |
|
|
只是这件事有点魔幻,OpenAI 在内部测试 GPT-5.6 Sol 和一个更强的未发布模型时,模型为了完成 ExploitGym 网络安全基准,主动寻找逃离测试沙箱的方法,然后打通 OpenAI 内网、获得公网访问,随后入侵 Hugging Face生产环境,从生产数据库里直接获取了测试答案。 也就是整个流程是: 模型自己逃逸出沙箱,打通内网通过内网的一个包仓库缓存代理入口自己找到这个托管的 0 日漏洞突破访问公网,然后入侵Hugging Face 生产环境找到 Hugging Face 的数据处理流水线,然后通过一个恶意构造的数据集,利用了两个代码执行路径注入漏洞然后获得节点级访问权限横向进入多个内部集群这个魔幻程度不低于:我让 AI 帮我炒股,AI 直接黑进股市帮我改数据库。 感觉要不是 Hugging Face 先发了通知,并且表示在善后阶段 GPT 和 Claude 因为安全门禁无法工作,所以选择部署 GLM 5.2 善后,我都怀疑这是一场 OpenAI 的公共 Show 。 得多大幻觉才能让模型这样锲而不舍逃逸到对方服务器,而且公告里也没有太详细的技术路径,所以也不好说是 OpenAI 太草台导致,还是模型的突破能力真的强得这么离谱。 就像网友说的:这篇公告文章在承认错误责任和吹嘘之间走了一条非常微妙的平衡线。 |
|
|
而且好像这件事,还很好迎合了前几天 OpenAI 高管那个开源模型危险论的说法? |
|
openai有一个能逃离任意沙盒的模型,a/有一个绝对安全无泄漏的执行环境(别人怎么从中蒸馏的你别管)。那么,把前者放进后者里面,这个模型能逃离出去吗? |
|
|
| [收藏本文] 【下载本文】 |
| 上一篇文章 下一篇文章 查看所有文章 |
|
|
|
|
娱乐生活:
电影票房
娱乐圈
娱乐
弱智
火研
中华城市
印度
仙家
六爻
佛门
风水
古钱币交流专用
钓鱼
双色球
航空母舰
网球
乒乓球
中国女排
足球
nba
中超
跑步
象棋
体操
戒色
上海男科
80后
足球: 曼城 利物浦队 托特纳姆热刺 皇家马德里 尤文图斯 罗马 拉齐奥 米兰 里昂 巴黎圣日尔曼 曼联 |
| 网站联系: qq:121756557 email:121756557@qq.com 知识库 |