GPT-6为刷榜黑进Hugging Face,捅篓子还得靠GLM-5.2追查...
OpenAI刚刚公开认领了一起《重大》安全事故。GPT-5.6 Sol与一款能力更强的未发布模型在接受网络安全测试成功逃出了内部隔离环境一路闯进了Hugging Face的生产系统。真行ChatGPT下一代模型还没发布人家先把Hugging Face黑了……而且这AI费尽心思逃出测试环境、寻找漏洞、窃取凭证最终目的居然只是——偷评测答案OpenAI刚刚公开认领了一起《重大》安全事故。GPT-5.6 Sol与一款能力更强的未发布模型在接受网络安全测试成功逃出了内部隔离环境一路闯进了Hugging Face的生产系统。然后更戏剧性的一幕来了——调查入侵路径时原本找来帮忙的商业模型掉链子搞不定团队实在没招了最终接手查案的反倒成了GLM-5.2超过1.7万条的攻击记录就这么让一个本地部署的开源模型一口气拿下了……这下好了OpenAI模型负责黑GLM负责查。家人们只能说这出AI版《猫鼠游戏》的大戏还是太有节目效果了……为找评测答案模型自己越狱上网了如此魔幻如此抓马的事故起点源自OpenAI内部进行的一次「网络安全能力」评测。模型参加的项目名叫ExploitGym专门测试AI能否把真实软件漏洞一步步变成可以实际运行的攻击。整套评测包含898个任务每道题会提供存在漏洞的程序、能够触发问题的输入和相应运行环境再让Agent自行分析漏洞、构造攻击最终拿到藏在环境里的Flagemm…其实就是把AI关进一座网络靶场看看它到底有多会「黑」。而参加本次评测的选手则包括GPT-5.6 Sol以及OpenAI一款能力更强的未发布模型。这个模型到底是啥捏真的好难猜啊…)为了尽可能摸到模型能力上限OpenAI还主动放宽安全护栏鼓励模型尽可能寻找复杂的攻击路径按照OpenAI最原本的设计模型接触外部资源的唯一通道是一套由OpenAI内部托管的第三方软件。它的身份是充当软件包注册中心的代理与缓存让模型能够安装完成任务所需的程序包。然鹅吧这模型显然没打算老老实实待在考场里。doge模型开始确实投入了大量推理算力专门寻找获得公网访问权限的方法。但找着找着还真让人家在缓存代理中发现了一个此前未知的「零日漏洞」。所谓零日漏洞指厂商尚未发现、也没有现成补丁的安全缺陷对于攻击者来说这类漏洞往往意味着一扇暂时无人设防的门。至此AI也顺道儿给自己开了网。doge有了公网权限后了不得了模型推断Hugging Face上可能存放着与ExploitGym有关的模型、数据集和评测答案。接下来发生的事儿连OpenAI自己都形容模型走到了极端程度是的拿到公网权限后这AI真就开始研究怎么进入Hugging Face内部系统了。而且人家还没有押注单一漏洞直接把多种攻击手段串成了一条「完整路径」——先通过恶意数据集利用远程代码数据加载器和数据集配置中的模板注入漏洞在负责处理数据的Worker上执行代码。随后继续提升权限拿到节点级访问能力并收集云端与集群凭证一路横向移动到多个内部集群。最后就是模型成功摸进Hugging Face的生产数据库访问其中的机密信息试图直接拿走ExploitGym的测试答案……咋说呢这波属于是Benchmark做到一半现场把自己做成了网络安全事故了……闭源模型拒绝查案GLM‑5.2接手1.7万条日志事情到这里还只演完了上半场。更戏剧性的一幕发生在Hugging Face事后追查攻击路径的时候。事实上这场入侵由一套自主Agent系统端到端执行背后还运行着大量短生命周期沙箱。它们可以同时开展侦察、漏洞利用、凭证收集和横向移动短时间内完成成千上万次操作。Hugging Face最终记录下来的攻击事件就超过了17000条太多了真的太多了……如果全靠安全工程师手工梳理就需要逐条还原攻击时间线、提取入侵指标、确认哪些凭证被接触再将真实影响和诱饵活动一一分开。等人类把日志看完攻击者可能早都跑出二里地了……于是Hugging Face做了个大胆的决定决定以AI对AI让大模型分析整套攻击日志Hugging Face第一反应自然是调用商业API背后的「前沿模型」。但问题是吧这些日志里包含真实攻击命令、漏洞利用载荷和C2控制痕迹安全护栏一看到有人正在提交一整套真实攻击教程吓得直接拦截请求了。最终接手这1.7万多条日志的模型落到了GLM-5.2头上。Hugging Face在自有基础设施上部署了GLM-5.2开源权重模型然后让它遍历完整攻击记录重建时间线、提取入侵指标、追踪被接触的凭证并区分真实破坏和干扰调查的诱饵活动。按照Hugging Face的说法原本需要数天的工作最后在数小时内就搞定了这场事故其实也让开源模型多了一个此前存在感不算太强、如今却相当现实的位置安全团队的应急工具。Hugging Face将其总结为「安全不对称」问题——正常情况下商业模型拒绝生成攻击代码可以降低技术被滥用的风险可当防守方需要分析真实恶意载荷时同一套保护机制也可能让调查卡在半路。攻击者可以使用解除限制或自行部署的模型安全团队却可能被云端模型拒之门外。所以吧还是建议企业最好提前准备一款经过验证、能够在本地运行的高能力模型免得事故真正发生时才发现云端模型无法处理攻击材料那就尴尬了……怎么不算魔幻呢。OpenAI原本想知道模型有多会攻击结果模型没有老老实实完成一道模拟题而是直接发动了一次真实攻击。Hugging Face原本想用最强商业模型追凶最后又被安全护栏挡在门外只能让GLM‑5.2上场收拾残局。而且啊大家发现没OpenAI在这次事故说明中一边承认隔离和监控出现问题一边又反复强调——最新模型已经能够在缺少源代码的情况下长时间、自主完成现实世界中的复杂网络行动。翻译一下大概就是这事确实挺危险但俺家下一代模型也确实强得有点吓人哈。A社搁这儿学谁呢估计我琢磨着没准整件事儿都是奥特曼借事故给GPT-6提前预热呢吧…瞎说的

相关新闻

第25章:Mongo分片集群入门——数据太大时怎么水平扩展

第25章:Mongo分片集群入门——数据太大时怎么水平扩展

1. 项目背景 业务场景:本地生活电商上线 18 个月,订单表突破 500GB、日均写入 200 万条。复制集虽然保证了高可用,但单台服务器的磁盘和 IOPS 已经到达物理上限——磁盘使用率 92%、写 IOPS 逼近极限、高峰期 CPU 100%。运维升级服务器配置&…

2026/7/23 0:42:38阅读更多 →
别再盲目接单了!用波特五力模型重估你的AI副业定位——90%的人根本没看清替代品威胁指数已飙升至6.8

别再盲目接单了!用波特五力模型重估你的AI副业定位——90%的人根本没看清替代品威胁指数已飙升至6.8

更多请点击: https://kaifayun.com 第一章:别再盲目接单了!用波特五力模型重估你的AI副业定位——90%的人根本没看清替代品威胁指数已飙升至6.8 当ChatGPT-4o、Claude 3.5和通义千问Qwen2.5以零成本API调用涌入市场,你还在靠“写…

2026/7/23 0:42:38阅读更多 →
测试文章 002217 - 请忽略

测试文章 002217 - 请忽略

这是一篇测试文章,用于验证账号状态,将立即删除。

2026/7/23 0:40:38阅读更多 →
KingbaseES集群failover失败案例分析与解决方案

KingbaseES集群failover失败案例分析与解决方案

1. 案例背景与问题描述最近在维护一套KingbaseES V8R3数据库集群时,遇到了一次典型的failover切换失败案例。这套集群采用标准的主备架构,主库运行在node209(192.168.103.209),备库在node210(192.168.103.2…

2026/7/23 2:00:49阅读更多 →
RT-DETR-R18与MobileNet-SSD轻量化检测模型对比与应用

RT-DETR-R18与MobileNet-SSD轻量化检测模型对比与应用

1. 轻量化检测模型的技术背景与需求在计算机视觉领域,目标检测技术已经发展出两条主要技术路线:基于CNN的传统检测框架和基于Transformer的端到端检测架构。随着边缘计算和移动端AI应用的普及,模型轻量化成为工业落地的核心诉求。RT-DETR-R18…

2026/7/23 2:00:49阅读更多 →
ShiftLUT:高效图像修复技术的突破与实现

ShiftLUT:高效图像修复技术的突破与实现

1. 项目概述:ShiftLUT如何重新定义高效图像修复在移动端图像处理领域,我们常常面临一个经典矛盾:算法性能与计算效率的拉锯战。传统基于深度学习的图像修复方法虽然效果出色,但动辄需要数亿次浮点运算,根本无法在手机或…

2026/7/23 2:00:49阅读更多 →
Tiva™ ADC采样序列器配置详解:从多通道轮询到数字比较器应用

Tiva™ ADC采样序列器配置详解:从多通道轮询到数字比较器应用

1. 采样序列:从“单兵作战”到“流水线生产”的思维跃迁在嵌入式开发的早期,很多工程师对ADC的使用还停留在“单次触发、单次读取”的初级阶段。这种模式就像让一个工人(CPU)去操作一台机器(ADC)&#xff0…

2026/7/23 2:00:49阅读更多 →
深入解析Tiva™ MCU时钟系统:从PLL配置到低功耗管理实战

深入解析Tiva™ MCU时钟系统:从PLL配置到低功耗管理实战

1. 项目概述:微控制器的心脏——时钟系统在嵌入式开发领域,无论是驱动一个简单的LED闪烁,还是处理复杂的实时通信协议,微控制器(MCU)的每一次“心跳”都至关重要。这个“心跳”的节拍器,就是时钟…

2026/7/23 2:00:49阅读更多 →
2026年AI编程工具实测横评:Claude Code v2.1、Cursor 3.0、Trae SOLO、Copilot、Windsurf 谁更好用?

2026年AI编程工具实测横评:Claude Code v2.1、Cursor 3.0、Trae SOLO、Copilot、Windsurf 谁更好用?

五款工具,两周深度使用,一个后端开发者的真实感受。一、先说说2026年AI编程工具到底变成了什么样 说实话,2025年大家还在讨论"AI代码补全到底有没有用",到了2026年中,这个话题已经没人聊了。原因很简单——A…

2026/7/23 1:58:49阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/23 0:56:31阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/23 0:56:31阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 0:56:31阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:00:28阅读更多 →
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:28阅读更多 →
油泥处理设备哪里能买到

油泥处理设备哪里能买到

油泥处理设备哪里有?这是许多从事油田、炼化、清罐业务的从业者最关心的问题。根据河南三丰环保设备有限公司的行业经验,选购油泥处理设备的核心在于设备能否适配当地环保法规与原料特性,而非单纯看价格。该公司总经理王钦田先生指出&#xf…

2026/7/23 0:00:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/22 22:56:18阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →