[论文学习]LLM 中的个性化安全:一个基准测试与基于规划的智能体方法
Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach论文重点首次系统性地提出了LLM「个性化安全」Personalized Safety这一概念揭示了传统「一刀切」的安全对齐策略在高风险应用场景中的根本缺陷——同一条看似「安全」的回应对不同背景的用户可能意味着截然不同的风险。为此作者构建了包含14,000个场景的PENGUIN基准测试并提出了无需模型重训练的两阶段智能体框架RAISE在六个主流LLM上实现了高达31.6%的安全评分提升同时平均仅需2.7次用户查询即可完成个性化信息採集。核心研究内容问题定义当前LLM的安全评估主要依赖于与上下文无关的通用指标——如事实准确性、偏见程度或毒性分数。这种评估范式预设了一个危险假设对所有用户而言「安全」的标准是统一的。然而现实远比这複杂一条关于药物剂量的医疗建议对普通成年人可能是安全的但对孕妇或特定疾病患者则可能致命一条财务投资建议对有风险承受能力的投资者无伤大雅对退休老人则可能是灾难性的。LLM对所有用户生成相同或相似回应的现状恰恰放大了这种风险。论文将这一未被充分探索的问题定义为「个性化安全」——即安全评估与保障必须基于用户的具体背景、条件和脆弱性来进行。创新方法论文的贡献体现在两个层面第一层面PENGUIN基准测试PENGUIN是首个专为个性化安全设计的基准测试包含14,000个场景复盖七个敏感领域。每个场景均提供「上下文丰富」context-rich和「上下文自由」context-free两种变体以便精确衡量用户背景信息对安全评分的贡献。这种双变体设计使得研究者能够量化「知道用户是谁」究竟能在多大程度上改变安全判断。第二层面RAISE框架RAISEReActive Information Selection rEsponse是一个无需训练、即插即用的两阶段智能体框架。其核心设计思想是与其不加区分地收集所有用户信息这既不现实也存在隐私风险不如策略性地、有选择地获取最关键的用户背景信息。两阶段设计包括信息採集阶段智能体主动向用户提出有针对性的问题以最低的交互成本获取最相关的背景信息回应生成阶段基于採集到的个性化信息调整LLM的输出以匹配用户的具体安全需求研究成果论文在六个主流LLM上进行了系统性评估获得以下关键数据指标数值个性化信息带来的安全提升43.2%RAISE框架带来的额外提升最高31.6%RAISE平均交互成本2.7次用户查询值得注意的是论文还发现并非所有上下文属性对安全提升的贡献是均等的——这意味着「选择性地收集什么信息」比「收集多少信息」更为关键。这一发现直接支撑了RAISE框架中策略性信息採集的设计哲学。实际落地应用的可能性RAISE框架的「无需重训练」特性使其具备极高的实用价值。在实际部署中它可作为LLM应用的一层安全外挂safety wrapper在现有模型之上直接工作无需昂贵的微调或重新训练。这意味着医疗健康助手可根据患者年龄、病史、用药情况等个性化信息调整医学建议的安全边界金融服务场景可根据用户的风险承受能力、财务状况提供差异化的投资建议安全筛查教育辅导场景可根据学生的年龄、认知水平调整内容的适宜性标准心理健康应用可根据用户的情绪状态、心理病史调整回应的敏感度技术细节PENGUIN基准的场景设计PENGUIN涵盖的七个敏感领域具体包括基于论文描述推测医疗健康、财务金融、法律建议、心理谘询、教育内容、政治与社会议题、个人安全等。每个场景的构建遵循以下原则双变体对照同一场景同时生成「包含用户详细背景」和「不包含任何用户信息」两个版本自动化评估流水线每个任务配备精心设计的自动化评估流程确保评估的可靠性规模化14,000个场景的规模足以支持统计显着的结论RAISE框架的两阶段机制RAISE作为一个基于规划的智能体方法其工作流程可概括为阶段一策略性信息採集智能体分析当前查询识别哪些用户背景信息对安全判断最为关键通过主动提问的方式以最少的问题获取最相关的信息平均仅需2.7次用户查询即可完成信息採集阶段二个性化安全回应基于採集到的用户背景动态调整安全评估的标准生成符合用户具体情况的安全回应整个过程无需修改底层LLM的参数这种设计的巧妙之处在于它将「个性化」从一个模型训练问题转化为一个推理时期的信息检索与整合问题极大降低了部署门槛。研究设定评估配置模型范围六个主流LLM具体型号在论文中详细列出包括闭源和开源模型基准规模PENGUIN包含14,000个测试场景领域复盖七个敏感领域每个领域同时包含上下文丰富和上下文自由两种变体硬体与软体需求由于RAISE是无需训练的推理阶段框架其硬体需求与运行底层LLM的硬体需求一致无需额外的训练集群或大规模存储。软体层面需要支持LLM API调用或本地模型推理的环境实现RAISE两阶段智能体逻辑的代码框架可选PENGUIN基准的评估流水线综合分析学术贡献这篇论文的贡献在于它从根本上挑战了LLM安全研究的既有范式。过去几年的安全对齐研究无论是RLHF、红队测试还是安全微调本质上都在追求一个「通用安全标准」——试图让模型对所有用户、所有场景都输出「安全」的内容。但这篇论文指出了一个尖锐的悖论如果「安全」的定义因用户而异那么追求「通用安全」本身就是一个伪命题。论文的标题中「Planning-Based Agent」这一表述值得关注。它暗示了一个更深层的洞察个性化安全不仅仅是一个「需要更多用户信息」的问题更是一个「需要主动规划如何获取信息」的问题。这种将安全问题重新定义为一个序贯决策问题sequential decision-making problem的视角为后续研究开闢了新的方向。局限性与未来方向从批判性角度来看这项研究仍有几个值得关注的问题隐私与安全的张力个性化安全需要收集用户敏感信息这本身就构成了新的安全风险。论文在这一点上的讨论可能不够充分。用户配合度假设RAISE平均需要2.7次用户查询但现实中用户是否愿意配合、是否有耐心完成这些交互仍需验证。动态用户状态用户的风险状况可能随时间变化如疾病进展、财务状况变化RAISE目前似乎是静态的单次信息採集缺乏持续追踪机制。七个领域的代表性虽然14,000个场景规模可观但七个敏感领域的划分依据和代表性尚需进一步阐明。实践应用对研究者的建议基准採用PENGUIN可作为个性化安全研究的标准评估工具建议在相关论文中引入该基准以实现可比较的评估框架扩展RAISE的两阶段设计可作为模板研究者可在此基础上探索更高效的信息採集策略或更精细的安全调整机制对从业者的建议快速部署RAISE的「无需重训练」特性使其非常适合快速原型验证。团队可在现有LLM应用上直接封装RAISE层评估个性化安全对用户体验的影响成本控制平均2.7次查询的交互成本在实际生产环境中是可控的但仍需根据具体场景权衡个性化程度与响应延迟之间的关係隐私合规在收集用户背景信息时需严格遵守GDPR、CCPA等隐私法规建议在RAISE框架中加入隐私保护机制如差分隐私、本地化处理等对产品决策者的启示差异化竞争点在LLM产品趋于同质化的当下个性化安全可成为差异化竞争的重要方向——尤其是面向医疗、金融、教育等高风险领域的产品用户信任建设研究表明个性化信息能显着提升安全评分这意味着向用户解释「我们为何需要这些信息」以及「这些信息如何让您更安全」可能成为建立用户信任的有效策略参考资料来源原始论文Wu, Y., Sun, E., Zhu, K., Lian, J., Hernandez-Orallo, J., Caliskan, A., Wang, J. (2025).Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach. NeurIPS 2025. arXiv:2505.18882NeurIPS官方页面https://neurips.cc/virtual/2025/loc/san-diego/poster/118931Hugging Face论文页面https://huggingface.co/papers/2505.18882

相关新闻

【Java EE】Spring 日志详解

【Java EE】Spring 日志详解

文章目录一、日志的作用二、SpringBoot日志底层架构三、两种打印日志方式3.1 原生SLF4J3.2 Lombok Slf4j四、日志级别五、application全局配置5.1 配置日志级别yml配置properties配置5.2 日志持久化5.3 日志自动分割5.4 自定义日志输出格式六、完整yml配置一、日志的作用 线上…

2026/7/23 0:44:39阅读更多 →
具身智能或进入token时代,清华团队提出Harness VLA引领范式变迁

具身智能或进入token时代,清华团队提出Harness VLA引领范式变迁

清华大学于超教授团队联合正行创新、无问芯穹提出的 Harness VLA,首次将 Harness Layer 引入具身智能。今天,清华大学于超教授团队联合正行创新、无问芯穹,正式发布并开源 Harness VLA,这一技术成果首次将数字智能中广泛应用的 Ha…

2026/7/23 0:42:38阅读更多 →
是 Kable 不是 Fable,Kimi 向全世界证明了四件事

是 Kable 不是 Fable,Kimi 向全世界证明了四件事

作为全球首个开源 3 万亿级大模型(总参数 2.8 万亿),这个数字足够震撼。从 K2 的万亿参数,到今天的 K3,中国开源模型再次刷新了模型规模的上限,海内外不少网友惊呼,这款开源模型性能足以替代昂贵…

2026/7/23 0:42:38阅读更多 →
KingbaseES集群failover失败案例分析与解决方案

KingbaseES集群failover失败案例分析与解决方案

1. 案例背景与问题描述最近在维护一套KingbaseES V8R3数据库集群时,遇到了一次典型的failover切换失败案例。这套集群采用标准的主备架构,主库运行在node209(192.168.103.209),备库在node210(192.168.103.2…

2026/7/23 2:00:49阅读更多 →
RT-DETR-R18与MobileNet-SSD轻量化检测模型对比与应用

RT-DETR-R18与MobileNet-SSD轻量化检测模型对比与应用

1. 轻量化检测模型的技术背景与需求在计算机视觉领域,目标检测技术已经发展出两条主要技术路线:基于CNN的传统检测框架和基于Transformer的端到端检测架构。随着边缘计算和移动端AI应用的普及,模型轻量化成为工业落地的核心诉求。RT-DETR-R18…

2026/7/23 2:00:49阅读更多 →
ShiftLUT:高效图像修复技术的突破与实现

ShiftLUT:高效图像修复技术的突破与实现

1. 项目概述:ShiftLUT如何重新定义高效图像修复在移动端图像处理领域,我们常常面临一个经典矛盾:算法性能与计算效率的拉锯战。传统基于深度学习的图像修复方法虽然效果出色,但动辄需要数亿次浮点运算,根本无法在手机或…

2026/7/23 2:00:49阅读更多 →
Tiva™ ADC采样序列器配置详解:从多通道轮询到数字比较器应用

Tiva™ ADC采样序列器配置详解:从多通道轮询到数字比较器应用

1. 采样序列:从“单兵作战”到“流水线生产”的思维跃迁在嵌入式开发的早期,很多工程师对ADC的使用还停留在“单次触发、单次读取”的初级阶段。这种模式就像让一个工人(CPU)去操作一台机器(ADC)&#xff0…

2026/7/23 2:00:49阅读更多 →
深入解析Tiva™ MCU时钟系统:从PLL配置到低功耗管理实战

深入解析Tiva™ MCU时钟系统:从PLL配置到低功耗管理实战

1. 项目概述:微控制器的心脏——时钟系统在嵌入式开发领域,无论是驱动一个简单的LED闪烁,还是处理复杂的实时通信协议,微控制器(MCU)的每一次“心跳”都至关重要。这个“心跳”的节拍器,就是时钟…

2026/7/23 2:00:49阅读更多 →
2026年AI编程工具实测横评:Claude Code v2.1、Cursor 3.0、Trae SOLO、Copilot、Windsurf 谁更好用?

2026年AI编程工具实测横评:Claude Code v2.1、Cursor 3.0、Trae SOLO、Copilot、Windsurf 谁更好用?

五款工具,两周深度使用,一个后端开发者的真实感受。一、先说说2026年AI编程工具到底变成了什么样 说实话,2025年大家还在讨论"AI代码补全到底有没有用",到了2026年中,这个话题已经没人聊了。原因很简单——A…

2026/7/23 1:58:49阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/23 0:56:31阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/23 0:56:31阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 0:56:31阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:00:28阅读更多 →
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:28阅读更多 →
油泥处理设备哪里能买到

油泥处理设备哪里能买到

油泥处理设备哪里有?这是许多从事油田、炼化、清罐业务的从业者最关心的问题。根据河南三丰环保设备有限公司的行业经验,选购油泥处理设备的核心在于设备能否适配当地环保法规与原料特性,而非单纯看价格。该公司总经理王钦田先生指出&#xf…

2026/7/23 0:00:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/22 22:56:18阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →