FLI发布AI安全指数,全球模型没有超过C+
nthropic、OpenAI、Google DeepMind、Meta这4家曾经都承诺过一旦自家系统接近特定风险阈值就单方面暂停开发。现在4家全都弱化或作废了这些承诺。有的把暂停条件改成了看竞争对手怎么做再说。Future of Life Institute未来生命研究所简称FLI发布了2026年夏季AI安全指数。而且拿到C的那家公司刚刚悄悄收回了自己曾经许下的安全承诺。与此同时OpenAI在7月15日发布了一款叫GPT-Red的自动红队测试工具攻击成功率84%远超人类红队测试员的13%。工具在进步治理在退步。成绩单FLI的AI安全指数到2026年夏季已经是第4期覆盖公司从2024年的6家扩展到了9家。评估维度有6个细分指标37项由7位独立专家组成的评审团打分采用美国GPA体系A对应4.0F对应0。9家公司的最终成绩如下AnthropicC2.66分连续3期排名第一在6个维度中的5个领跑。评审团认可了它在透明度、模型规格文档发布、危险能力评估方面的表现以及Responsible Scaling Officer负责任扩展官这一治理架构。OpenAIC2.28分比2025年冬季版的C有所下降。评审团肯定了它在风险评估领域的进步评估套件更全面外部安全测试的参与也更广泛。Google DeepMindC2.01分与上期持平。更新后的Frontier Safety Framework前沿安全框架新增了操控、失对齐和内部部署风险的覆盖水印保护也做得扎实。MetaD1.32分是本期唯一一条上升曲线。从D升到D排名从第6升到第4原因是发布了更详细的安全框架加入了威胁建模并把漏洞赏金计划扩展到了灾难性风险因素。Z.aiD-0.88分。Alibaba CloudD-0.87分。有点好笑的是两家中国公司的安全策略在评审团看来竟然是因为要遵守我国2025年10月修订的《网络安全法》、2021年的《数据安全法》、以及2023年的《生成式AI暂行办法》。评审团把这种策略称为完全被动。xAIF0.65分本期跌幅最大。从第4掉到第7从D直接降到F。评审团找不到有意义的安全团队找不到对存在性安全的任何投入危险能力评估存在巨大漏洞包括完全没有评估AI研发风险。报告还提到xAI的Grok曾生成儿童性虐待材料以及真实人物包括未成年人的非自愿性化图像。xAI在指数中没有列出任何进展亮点。DeepSeekF0.47分。MistralF0.33分。3个不及格美国、中国、欧洲各一家。评审团特意指出这个分布反驳了AI安全差是某个地区的问题这种说法。Mistral垫底被点名为一种讽刺评审团认为欧盟在AI安全监管上一直走在前面。截至证据窗口关闭DeepSeek和Mistral都没有发布过安全框架。7位评审专家分别来自UC Berkeley加州大学伯克利分校、University of Montreal蒙特利尔大学、HEC Montréal蒙特利尔高等商学院、University of Wisconsin-Madison威斯康星大学麦迪逊分校、Oxford University牛津大学、Renmin University of China中国人民大学和Encode。没有一家公司为评估付过费。承诺在缩水排名本身不是最要命的。最要命的是排名靠前的公司正在把以前说过的话收回去。Anthropic、OpenAI、Google DeepMind、Meta这4家曾经都承诺过一旦自家系统接近特定风险阈值就单方面暂停开发。现在4家全都弱化或作废了这些承诺。有的把暂停条件改成了看竞争对手怎么做再说。评审团给这个模式起了个名字叫moving the goalposts移动球门。结论是这种做法全面削弱了安全框架。UC Berkeley的Stuart Russell教授是7位评审之一他的原话是行业里确实有人在做AI安全方面的好工作但能力竞赛已经变得更加极端。企业已经放弃了早先的承诺不再坚持只在安全措施匹配能力水平时才发布新系统。现在即便能证明发布是不安全的他们也打算照发不误。具体到Anthropic评审团点名批评了Responsible Scaling Policy负责任扩展政策3.0版本认为它稀释了早期的暂停承诺。暂停条件一旦变成取决于竞争对手的选择就没有任何一方有动力先停下来政策的实际约束力就归零了。OpenAI的情况更复杂。在证据收集窗口截至2026年6月3日关闭之后OpenAI把安全团队并入了研究部门取消了独立汇报线。TechTimes把这报道为OpenAI两年内第6位高级安全人员离职。这件事没有被计入评分但方向很明确。评审团还建议OpenAI取消领导层对Safety Advisory Group安全咨询组的否决权并要求安全框架的阈值可量化、可外部执行。对Google DeepMind评审团的疑问是到底哪个内部机构有权在不经 executive leadership高管层批准的情况下独立叫停一次部署Meta那边评审团担心非贬损协议可能正在侵蚀其声称的吹哨人保护。看见悬崖没修护栏整个指数中得分最低的领域是Existential Safety存在性安全。没有一家公司超过C-大多数落在D或以下。评审团承认了一些零散的努力。Anthropic的constitutional classifiers宪法分类器OpenAI对全球AI治理机构的呼吁Google DeepMind的监控承诺Meta针对失控的预防措施。但总体评价是“完全不够”。评审团最具技术含量的一条批评直接指向了行业主流安全范式。Interpretability可解释性研究和Chain-of-Thought思维链可监控性是大多数AI公司最核心的安全投资方向。评审团从架构层面提出了质疑detection is not prevention检测不等于预防。思维链可监控性让模型的推理过程变得可见人类可以发现不对齐的思维。但检测是事后的。一条不对齐的推理链被捕捉到的时候模型已经输出了结果甚至已经执行了动作。一个在问题发生后才发出警报的监控系统提供的是问责不是安全。OpenAI在7月15日发布的GPT-Red恰好印证了这种张力。GPT-Red是一个自动化红队测试模型通过self-play reinforcement learning自博弈强化学习训练。红队模型和一组防御模型同时训练GPT-Red的奖励是成功发起攻击比如成功的prompt injection提示注入防御模型的奖励是抵抗住攻击。结果在GPT-5.1的新颖场景中GPT-Red的攻击成功率84%人类红队测试员只有13%。这些攻击随后被用来加固GPT-5.6 Sol把它的直接提示注入失败率压到了0.05%。这是用对抗性AI在部署前找到并封堵特定漏洞类别的安全工程。但它仍然是针对已知攻击面的检测加固系统不是面向大规模失对齐的预防架构。University of Montreal的David Krueger教授也是评审之一他写道AI公司在制定可信AI安全计划方面缺乏进展令人震惊。连他们自己都开始焦虑了一边冲向递归自我改进一边面对失控的可能性。军事AI集体转向指数中另一个突出发现涉及军事应用。2024年到2026年间Anthropic、OpenAI、Google DeepMind、Meta这4家此前限制或禁止军事应用的公司全部调转方向开始积极争取国防合同。它们加入了xAI和Mistral的行列后两家本来就在做这方面业务。这个转向产生了具体的评分后果。Anthropic在Current Harms当前危害领域下的Military Use of AIAI军事使用子指标上拿了不及格。评审团引用了它与Minab学校空袭事件的reported connection即被报道的关联。那次空袭造成了大规模平民死亡。FLI在报告中明确标注这是评审团关于一个被报道的关联的发现不是对法律责任的认定。最后说几句关于这份指数本身的局限。它评估的是实验室的政策、治理结构、信息披露和已发布的技术框架不是部署产品的实际表现或用户体验。一家公司可以因为文档写得全面而拿高分也可以因为什么都没发布而拿低分。Anthropic的C说的是它的文档化安全实践、治理结构和透明度在同行中相对较强而整个行业至今没有建立起可外部执行的最低标准。

相关新闻

作文自动批改系统:语法、逻辑、文采的分层评价体系

作文自动批改系统:语法、逻辑、文采的分层评价体系

作文自动批改系统:语法、逻辑、文采的分层评价体系 一、个性化深度引言 批改一篇 800 字的作文,人类老师大约需要 5-10 分钟。这对于同时教两个班共 100 名学生的语文老师来说,每次批改作业就是 8-16 个小时的工作量。而这还没算上给出有针对…

2026/7/21 23:49:13阅读更多 →
知识追踪模型训练:学生行为序列的建模与评估

知识追踪模型训练:学生行为序列的建模与评估

知识追踪模型训练:学生行为序列的建模与评估 一、个性化深度引言 传统考试能告诉你"某个学生在某个时刻答对了几道题",但无法回答"这个学生掌握了哪些知识点,未来遇到类似题目有多大把握做对"。 知识追踪(Kno…

2026/7/21 23:49:13阅读更多 →
零基础入门 UDS 诊断|一文吃透 0x11 ECU 复位服务(报文格式 + 核心测试点全解析)

零基础入门 UDS 诊断|一文吃透 0x11 ECU 复位服务(报文格式 + 核心测试点全解析)

很多刚接触 ISO 14229 UDS 协议的小伙伴,人生中第一条调试的诊断服务,大概率都是 0x11 ECU 复位。毕竟 “不行就重启” 是刻在所有工程师 DNA 里的万能操作。但如果你以为 0x11 服务就只是 “发个指令让 ECU 重启” 这么简单,那可就错过它的核…

2026/7/21 23:49:13阅读更多 →
Selenium WebDriver 无执行上下文错误:诊断与解决 iframe 加载问题

Selenium WebDriver 无执行上下文错误:诊断与解决 iframe 加载问题

1. 问题定位:当自动化脚本遭遇“无执行上下文”的报错最近在调试一个复杂的Web自动化脚本时,我又一次遇到了那个熟悉又恼人的老朋友:WebDriverException: Message: no such execution context: frame does not have execution context。这个错…

2026/7/22 1:56:07阅读更多 →
Windows 远程自动化部署 OpenClaw:从零到一的完整教程

Windows 远程自动化部署 OpenClaw:从零到一的完整教程

## 前言OpenClaw 是一个开源的 AI 助手平台,支持多模型、多渠道接入。本文将介绍如何通过 SSH 远程连接,在另一台 Windows 电脑上自动部署 OpenClaw。**适用场景:** - 多台电脑批量部署 - 远程服务器配置 - 不想手动敲命令的懒人**技术栈&…

2026/7/22 1:56:07阅读更多 →
游戏音频管理系统开发:从资源加载到播放控制的完整实现

游戏音频管理系统开发:从资源加载到播放控制的完整实现

在实际游戏开发或多媒体项目中,音效和背景音乐(BGM)的管理与播放是一个看似基础但极易出错的环节。很多开发者只关注了如何调用播放接口,却忽略了资源加载策略、生命周期管理、异常处理以及不同场景下的音量控制逻辑。这些问题在测…

2026/7/22 1:56:07阅读更多 →
技术开锁工:从环境调试到自动化运维的核心技能体系

技术开锁工:从环境调试到自动化运维的核心技能体系

在技术团队中,总有一些角色看似平凡却不可或缺——他们不是架构师,不负责核心算法,却在关键时刻成为项目推进的关键支点。今天要讨论的"技术开锁工",正是这样一个特殊群体:他们擅长解决那些看似琐碎却阻塞流…

2026/7/22 1:56:07阅读更多 →
Kafka单节点与集群部署配置及调优指南

Kafka单节点与集群部署配置及调优指南

1. Kafka单节点与集群部署核心逻辑解析作为分布式消息系统的标杆,Kafka的部署模式选择直接影响系统可靠性与扩展性。单节点模式适合开发测试环境快速验证,而生产环境必须采用集群部署来保证高可用。这两种部署方式在ZooKeeper依赖、配置文件参数、服务启…

2026/7/22 1:56:07阅读更多 →
深入解析eQEP模块:从正交编码器原理到高精度位置速度测量实践

深入解析eQEP模块:从正交编码器原理到高精度位置速度测量实践

1. 项目概述与核心价值在伺服电机、机器人关节、数控机床这类需要精确控制旋转或直线位移的嵌入式系统中,如何实时、准确地获取执行机构的位置和速度,是决定整个系统性能上限的关键。这就像给一个盲人装上眼睛,他才能知道自己在哪&#xff0c…

2026/7/22 1:53:59阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 0:53:59阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 0:53:59阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 0:53:59阅读更多 →
中小企业小程序开发公司怎么选:预算、上手和售后避坑指南

中小企业小程序开发公司怎么选:预算、上手和售后避坑指南

中小企业做小程序,最常见的矛盾是预算有限,但又不希望功能太单薄;没有技术团队,但又希望后续能自己运营;想快速上线,又担心隐性收费和售后失联。选型时如果只看“低价套餐”或“案例数量”,很容…

2026/7/22 0:01:17阅读更多 →
GEO优化如何沉淀长期内容资产?广拓时代谈AI搜索时代的内容ROI

GEO优化如何沉淀长期内容资产?广拓时代谈AI搜索时代的内容ROI

企业做营销,最怕钱花完了,资产没有留下。 效果广告能带来一段时间的曝光,但预算停止后,流量往往也随之停止。短视频内容可能在几天内冲高,也可能很快沉下去。AI搜索时代,企业需要重新思考一个问题&#xff…

2026/7/22 0:01:17阅读更多 →
Agent 终态判定:何时该停止思考、给出最终回复

Agent 终态判定:何时该停止思考、给出最终回复

Agent 终态判定:何时该停止思考、给出最终回复 一、你的 Agent 在"再想想"的循环里绕了 12 轮,用户已经关窗口了 Agent 与人最大的区别是:人知道什么时候该停下来给答案,Agent 会一直"想"下去。你给 Agent 接…

2026/7/22 0:01:17阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/21 22:53:50阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/21 18:53:30阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/21 18:53:30阅读更多 →