【大模型LLM学习】RLPR——模型的答案置信度作为Reward
1 常用的Reward类型1.1 基于人类/模型偏好的奖励代表方法Bradley-Terry Model, DPO/IPD 隐式奖励工作原理收集(yw,yl)(y_w, y_l)(yw​,yl​)偏好对ywy_wyw​为优选回复yly_lyl​为劣选回复训练一个 Reward Model 来拟合人类的偏好。在 PPO 等算法中该 RM 的输出即为奖励信号。优点捕捉复杂、难以形式化的人类价值观如幽默感、同理心。避免了绝对分数标注的困难排序比打分容易。缺点Reward Hacking 重灾区模型容易学会迎合 Reward Model 的偏见而非真实意图如冗长偏差、格式讨好。分布外泛化差RM 在训练数据之外的区域可能给出荒谬的高分。成本高昂需要持续的人工标注或高质量 Judge Model。1.2 Rubric-based Rewards(LLM-as-Judge)工作原理预先定义包含多个维度如准确性、完整性、安全性、语气的评分细则每个维度有明确的等级描述如1-5分及对应标准。Judge Model 根据 Rubric 逐条打分并给出理由最终加权汇总为奖励信号。相比纯偏好奖励的优势可解释性强模型知道“为什么得分/扣分”而非仅得到一个标量分数。细粒度控制可针对特定维度如“减少废话”单独优化避免全局偏好模型的耦合问题。局限性LLM-as-Judge 本身就是 Hacking 来源Judge Model 可能被策略性输出欺骗给出符合量规字面意思但实质错误的高分。高方差奖励信号可能被高方差淹没。设计成本高高质量 Rubric 需要领域专家反复迭代验证。1.3 可验证奖励 (Verifiable Rewards / RLVR)适用场景数学、代码、逻辑推理、事实核查等有明确 Ground Truth 的任务用规则而非LLM来判断结果对不对。工作原理数学任务最终答案精确匹配或符号验证。代码任务运行代码测试根据结果Pass1, Fail0。相比 Rubric/RM 的核心优势真正抗 Reward Hacking编译器/验证器不会被输出欺骗奖励信号与任务真实目标完全一致。无噪声验证结果确定训练更稳定收敛更快。局限性需要准确设计verifier仅适用于可验证任务无法覆盖开放式任务对于不同任务需要设计不同的verifier2 RLPR: Extrapolating RLVR to General Domains without VerifiersRLPR是从另一个角度出发设计的把模型对答案输出打分的prob作为reward信号这样无需每个任务单独设计verifier也不需要LLM-as-judge的方式尤其适合例如deep search这种场景答案形式可能存在多个的情况例如某个问题的答案既可以是马斯克也可以是埃隆马斯克它们指向是一样的使用RLPR的方式是正确答案的情况下prob的概率高错误答案时prob的概率低无需做穷举2.1 基本思想基于一个核心观察LLM 生成正确答案的原生概率可以直接反映模型内部对推理质量的评判。在RLPR 中使用标准答案的逐 token decoding probability 作为 reward signal。现有很多 RLVR 方法依赖领域专用搭建这类验证器需要大量人工启发式规则与工程成本而 RLPR 的 reward 计算仅依赖 policy model 自身设问题QQQ对应的一条输出响应o(o0,⋯ ,oN)o (o_0, \cdots, o_N)o(o0​,⋯,oN​)oio_ioi​代表响应内单个 token。执行概率提取流程从完整序列ooo中拆分出模型生成答案yyy剩余文本为推理过程zzz构造改造序列o′(o0′,⋯ ,oN′′)o (o_0, \cdots, o_{N})o′(o0′​,⋯,oN′′​)把模型生成答案yyy替换成训练集标准参考答案y∗y^*y∗将o′oo′输入 policy model得到序列概率(p0,⋯ ,pN′)(p_0, \cdots, p_{N})(p0​,⋯,pN′​)序列 reward 计算公式rfseq({pi∣oi′∈y∗})(2) r f_{\text{seq}}(\{p_i | o_i \in y^*\}) \tag{2}rfseq​({pi​∣oi′​∈y∗})(2)fseqf_{\text{seq}}fseq​的作用是把多个逐 token probability 聚合为单个标量 reward。如果选用序列似然归一化概率乘积fseq∏pnf_{\text{seq}}\sqrt[n]{\prod p}fseq​n∏p​虽然能够表征参考答案整体生成概率但存在方差过高、对同义词、微小token波动极度敏感的缺陷。举例token概率序列(0.01,0.7,0.9)(0.01, 0.7, 0.9)(0.01,0.7,0.9)和(0.05,0.7,0.9)(0.05, 0.7, 0.9)(0.05,0.7,0.9)仅首token存在小幅差异乘积形式下得分差距巨大。为此 RLPR 改用token均值fseq1∣y∗∣∑pi f_{\text{seq}} \frac{1}{|y^*|}\sum p_ifseq​∣y∗∣1​∑pi​均值聚合得到更鲁棒的 reward signal与答案质量相关性更强。该概率奖励具备直观特性当模型输出答案yyy和参考答案语义接近时获得高 reward反之 reward 偏低。2.2 Reward Debiasing虽然基于概率的 reward 和响应质量具备强相关性但结果会被多种隐变量干扰。将概率奖励rrr的来源记作UrU_rUr​做隐因子分解UrUzUothers(3) U_r U_z U_{\text{others}} \tag{3}Ur​Uz​Uothers​(3)UzU_zUz​推理内容zzz带来的影响UothersU_{\text{others}}Uothers​问题、参考答案等其余外部因素带来的干扰。直接使用原始rrr作为 reward会引入UothersU_{\text{others}}Uothers​带来的偏差损害奖励有效性。RLPR 的去偏方案不经过中间推理zzz直接让模型解码参考答案y∗y^*y∗算出基准分数r′rr′。可以认为Uz≈Ur−r′U_z \approx U_r - rUz​≈Ur​−r′最终去偏概率奖励r^clip(0,1, r−r′)(4) \hat{r} \text{\(\text{clip}\)}(0, 1,\ r - r) \tag{4}r^clip(0,1,r−r′)(4)clip\text{\(\text{clip}\)}clip限制 reward 落在0,1区间。该形式剔除了问题UQU_QUQ​、参考答案Uy∗U_{y^*}Uy∗​的固有偏差。2.3 Standard Deviation Filtering传统 RLVR在Rollout时会过滤掉过难、过简单的样本只保留中等难度样本稳定训练做法是剔除全部正确/全部错误的样本例如DAPO和DUPO中。但 RLPR 的 reward 是连续值无法直接套用基于二元对错的过滤方式很难设定通用阈值区分样本好坏。通过分析精度过滤机制RLPR 提出替代方案过滤 reward 标准差过低的prompt。PR reward 被约束在 (0,1)如果一个样本所有Rollout输出全部高分 / 全部低分分数对应的标准差会很小对应样本就是极度简单/极度困难样本丢弃 reward 标准差β\betaβ的样本基于每一步训练样本的平均标准差动态更新阈值β\betaβ。2.4 RLPR的优点与E-GRPO《Repurposing Synthetic Data for Fine-grained Search Agent Supervision》类似在E-GRPO中在输出答案和标准答案不一样时会看推理过程里面提及的实体和推理标准答案所需实体的交集打一个软分数而不是直接赋0分把全错和部分错区分出来。RLPR也能够灵活的处理这种假阴性的情况文中把模型的输出人工进行了标注人工判断回答对/错作为金标准对比不同的verifierRLVR的方式AUC是很低的(容易错误把正确答案判断为错误的)RLPR的AUC非常高即使在数学等完全标准答案的数据集上RLPR未必会输给RLVR对于Deep Search、Deep Research、知识问答等任务RLPR可能是一个更好的选择

相关新闻

Unity Addressables在微信小游戏加载性能优化实战

Unity Addressables在微信小游戏加载性能优化实战

1. 项目概述:当Unity Addressables遇上微信小游戏 如果你正在用Unity开发微信小游戏,并且已经引入了Addressables资源管理系统来应对包体大小和热更新的挑战,那么“加载慢”这个问题,大概率已经成为了你项目中的“阿喀琉斯之踵”。…

2026/8/3 11:13:27阅读更多 →
终极指南:如何在Nintendo Switch上轻松安装大气层系统

终极指南:如何在Nintendo Switch上轻松安装大气层系统

终极指南:如何在Nintendo Switch上轻松安装大气层系统 【免费下载链接】Atmosphere-stable 大气层整合包系统稳定版 项目地址: https://gitcode.com/gh_mirrors/at/Atmosphere-stable 想要解锁你的Nintendo Switch全部潜能,体验海量自制软件和游戏…

2026/8/3 11:11:27阅读更多 →
终极指南:如何使用REFramework为所有RE引擎游戏打造完美MOD体验

终极指南:如何使用REFramework为所有RE引擎游戏打造完美MOD体验

终极指南:如何使用REFramework为所有RE引擎游戏打造完美MOD体验 【免费下载链接】REFramework Mod loader, scripting platform, and VR support for all RE Engine games 项目地址: https://gitcode.com/GitHub_Trending/re/REFramework REFramework是一款强…

2026/8/3 11:11:27阅读更多 →
本地跑大模型:Ollama 入门完全指南(支持 Llama3/Qwen/DeepSeek)

本地跑大模型:Ollama 入门完全指南(支持 Llama3/Qwen/DeepSeek)

本文是一篇写给新手的上手教程。不需要你买云服务器,不需要懂复杂的推理框架,只要有一台普通电脑,跟着步骤一步步做,就能在本地把开源大模型跑起来,并用它写代码、问答、搭知识库。一、Ollama 是什么?为什么…

2026/8/3 12:37:58阅读更多 →
5分钟搞定!用UWPHook统一管理Windows商店游戏的终极指南

5分钟搞定!用UWPHook统一管理Windows商店游戏的终极指南

5分钟搞定!用UWPHook统一管理Windows商店游戏的终极指南 【免费下载链接】UWPHook 🔗 Add your Windows Store or UWP games to Steam 项目地址: https://gitcode.com/gh_mirrors/uw/UWPHook 你是否厌倦了在Steam、Windows商店和Xbox Game Pass之…

2026/8/3 12:37:58阅读更多 →
CSDN博客下载器:3种模式轻松保存技术文章,打造个人离线知识库

CSDN博客下载器:3种模式轻松保存技术文章,打造个人离线知识库

CSDN博客下载器:3种模式轻松保存技术文章,打造个人离线知识库 【免费下载链接】CSDNBlogDownloader 项目地址: https://gitcode.com/gh_mirrors/cs/CSDNBlogDownloader 在技术学习的道路上,我们经常在CSDN上发现宝贵的教程和解决方案…

2026/8/3 12:37:58阅读更多 →
深度探索AMD Ryzen SDT调试工具:5个关键技巧解锁处理器隐藏性能

深度探索AMD Ryzen SDT调试工具:5个关键技巧解锁处理器隐藏性能

深度探索AMD Ryzen SDT调试工具:5个关键技巧解锁处理器隐藏性能 【免费下载链接】SMUDebugTool A dedicated tool to help write/read various parameters of Ryzen-based systems, such as manual overclock, SMU, PCI, CPUID, MSR and Power Table. 项目地址: h…

2026/8/3 12:37:58阅读更多 →
5步精通Universal-Updater:从入门到精通的完整3DS自制软件管理指南

5步精通Universal-Updater:从入门到精通的完整3DS自制软件管理指南

5步精通Universal-Updater:从入门到精通的完整3DS自制软件管理指南 【免费下载链接】Universal-Updater An easy to use app for installing and updating 3DS homebrew 项目地址: https://gitcode.com/gh_mirrors/un/Universal-Updater 你是否曾经为了在Nin…

2026/8/3 12:37:58阅读更多 →
【2026年昆山市网约车租赁,支持长短租门店汇总

【2026年昆山市网约车租赁,支持长短租门店汇总

2026年昆山市网约车租赁,支持长短租门店汇总 随着2026年网约车行业全面迈入合规化与精细化运营的新阶段,昆山、太仓等环沪核心区域的网约车租赁市场也迎来了深度洗牌。当前,需求方在选型时已从单纯看重“低租金”转向考量“合规保障、增收赋能…

2026/8/3 12:35:57阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/3 0:29:53阅读更多 →
限时公开!某头部SaaS公司内部AI模板工厂架构文档(含5类行业模板源码+性能压测报告)

限时公开!某头部SaaS公司内部AI模板工厂架构文档(含5类行业模板源码+性能压测报告)

更多请点击: https://intelliparadigm.com 第一章:AI模板批量生成的核心价值与落地全景 AI模板批量生成正从实验性工具演进为现代软件工程的关键基础设施。它通过语义理解、上下文感知与结构化约束,将重复性高、模式明确的代码/文档/配置生成…

2026/8/3 0:33:53阅读更多 →
如何快速找回消失的网页:Web Archives浏览器扩展终极指南

如何快速找回消失的网页:Web Archives浏览器扩展终极指南

如何快速找回消失的网页:Web Archives浏览器扩展终极指南 【免费下载链接】web-archives Browser extension for viewing archived and cached versions of web pages, available for Chrome, Edge and Safari 项目地址: https://gitcode.com/gh_mirrors/we/web-a…

2026/8/3 0:20:37阅读更多 →
3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。…

2026/8/3 0:00:32阅读更多 →
[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

PC服务器具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构一、前言:具身智能需要“混合算力闭环系统”传统人工智能依赖云端静态数据集训练,不具备物理交互能力,无法适应真实世界的不确定性。具身智能(Embodied…

2026/8/3 0:00:32阅读更多 →
[具身智能-181]:大分布式通信模型对比:看懂为什么 DDS 是 ROS2 底层通信最优解

[具身智能-181]:大分布式通信模型对比:看懂为什么 DDS 是 ROS2 底层通信最优解

前言构建机器人、具身智能这类分布式实时系统,通信底座直接决定整套系统的实时性、容错性、组网能力。分布式领域长期存在 4 类经典通信架构:点对点模式、Broker 中间代理模式、广播模式、以数据为中心(DDS)模式。很多开发者疑惑&…

2026/8/3 0:00:32阅读更多 →
无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理 【免费下载链接】lossless-cut The swiss army knife of lossless video/audio editing 项目地址: https://gitcode.com/gh_mirrors/lo/lossless-cut 在数字媒体创作领域,视频编辑处理的质量损…

2026/8/3 2:32:59阅读更多 →
AI辅助本科论文写作:8大工具评测与高效使用指南

AI辅助本科论文写作:8大工具评测与高效使用指南

1. 本科生论文写作的AI辅助现状本科毕业论文是每个大学生必须跨越的一道坎。记得我当年写论文时,光是文献检索就花了整整两周时间,打印的参考文献堆满了半个书桌。如今AI技术的发展为学术写作带来了革命性变化,合理使用这些工具可以节省80%以…

2026/8/3 2:33:01阅读更多 →
如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手 【免费下载链接】ticket-purchase 大麦自动抢票,支持人员、城市、日期场次、价格选择 项目地址: https://gitcode.com/GitHub_Trending/ti/ticket-purchase 还在为抢不到热门演唱会门票…

2026/8/3 2:33:04阅读更多 →