【NLP】POMDP 与马尔可夫基础
POMDP 与马尔可夫基础用于理解 Agent、world model、强化学习与部分可观测决策问题。一句话总览马尔可夫性完整当前状态已经包含预测未来所需的历史。 MDPAgent 能看见完整状态因此可依据当前状态选动作。 POMDPAgent 看不见完整状态只能用观察、动作和历史推断真实状态。1. 什么是马尔可夫性马尔可夫性最核心的说法是在知道当前完整状态的前提下未来不再依赖更早的历史。设StS_tSt​表示时刻ttt的状态马尔可夫性质写作P(St1∣St,St−1,…,S0)P(St1∣St) P(S_{t1}\mid S_t,S_{t-1},\ldots,S_0)P(S_{t1}\mid S_t)P(St1​∣St​,St−1​,…,S0​)P(St1​∣St​)它不是说历史不重要而是说有用历史已经被压缩进StS_tSt​。例子走格子当前位置第 5 格 动作向右走一步若规则固定下一位置只取决于当前位置和动作不取决于五分钟前从哪里走来。因为“当前位置”已概括了影响下一步的信息。2. 马尔可夫链、MDP 与 POMDP模型有状态有动作Agent 是否看见完整状态马尔可夫链是否不涉及决策 AgentMDP是是是POMDP是是否只看见部分观察2.1 马尔可夫链马尔可夫链描述系统自行演化今天的天气 → 明天的天气例如在一个简化模型中明天天气只依赖今天天气而不依赖更早天气。它有状态转移但没有主动选择动作的 Agent。2.2 MDP加入动作与奖励MDPMarkov Decision Process是在马尔可夫链上加入决策M(S,A,P,R,γ) \mathcal{M}(\mathcal{S},\mathcal{A},P,R,\gamma)M(S,A,P,R,γ)记号含义S\mathcal{S}S所有可能的世界状态A\mathcal{A}A所有可能的动作P(s′∣s,a)P(s\mid s,a)P(s′∣s,a)在状态sss执行动作aaa后到达s′ss′的概率R(s,a)R(s,a)R(s,a)该动作的奖励γ\gammaγ折扣因子衡量未来奖励的重要性MDP 的转移假设是P(St1∣St,At,历史)P(St1∣St,At)P(S_{t1}\mid S_t,A_t,\text{历史})P(S_{t1}\mid S_t,A_t)P(St1​∣St​,At​,历史)P(St1​∣St​,At​)直观上完整当前状态加当前动作就足以决定下一状态的分布。2.3 POMDPAgent 看不全世界POMDPPartially Observable Markov Decision Process比 MDP 多了观察P(S,A,P,R,O,Z,γ) \mathcal{P}(\mathcal{S},\mathcal{A},P,R,\mathcal{O},Z,\gamma)P(S,A,P,R,O,Z,γ)新增记号含义O\mathcal{O}O观察空间即 Agent 可能看到的信息Z(o∣s,a)Z(o\mid s,a)Z(o∣s,a)观察模型真实状态为sss、执行动作后Agent 看到ooo的概率这里要区分真实状态 st世界实际是什么样 观察 otAgent 当前能看见或读到什么真实环境仍可以满足马尔可夫性但 Agent 看不到完整sts_tst​因此只靠当前观察oto_tot​无法可靠预测未来。3. 状态设计决定“是否马尔可夫”马尔可夫性依赖状态是否包含关键变量。例如只写机器人在厨房抽屉关闭。对动作open drawer结果不确定情形 A抽屉中有钥匙 → 打开后看到钥匙。 情形 B钥匙已被拿走 → 打开后抽屉为空。原因是状态遗漏了“钥匙在哪里”。因此它不是充分状态。若扩充为机器人位置抽屉开闭状态钥匙位置门锁状态Agent 是否持钥匙。那么“完整状态 当前动作”就更接近足以预测未来问题重新近似满足马尔可夫性。状态信息足够完整 → 未来只依赖当前状态和动作 → 马尔可夫 状态遗漏关键变量 → 未来仍依赖遗漏的历史 → 对 Agent 而言不马尔可夫4. 一阶、二阶马尔可夫通常所说的马尔可夫是“一阶”未来只依赖当前状态。P(St1∣St,St−1,…)P(St1∣St) P(S_{t1}\mid S_t,S_{t-1},\ldots)P(S_{t1}\mid S_t)P(St1​∣St​,St−1​,…)P(St1​∣St​)二阶马尔可夫则要求当前和前一状态P(St1∣St,St−1,…)P(St1∣St,St−1) P(S_{t1}\mid S_t,S_{t-1},\ldots)P(S_{t1}\mid S_t,S_{t-1})P(St1​∣St​,St−1​,…)P(St1​∣St​,St−1​)在实际建模中更常见的处理方式不是不断增加“几阶”而是把必要历史加入状态。例如只记录位置不够时把“位置 速度”作为状态此时又可用一阶 MDP 表示。5. belief state对隐藏状态的概率判断POMDP 中 Agent 看不见真实状态需要维护 belief statebt(s)P(sts∣o1:t,a1:t−1) b_t(s)P(s_ts\mid o_{1:t},a_{1:t-1})bt​(s)P(st​s∣o1:t​,a1:t−1​)含义是在看到至今全部观察、并知道自己此前做过的动作后当前真实状态是sss的概率。例如70%钥匙在抽屉中 20%钥匙在其他位置 10%钥匙已被拿走belief 更新可理解为两步预测旧 belief 当前动作 → 推测可能的新状态 校正新观察到来 → 降低与观察不一致的状态概率形式上bt1(s′)∝Z(ot1∣s′,at)∑sP(s′∣s,at)bt(s) b_{t1}(s) \propto Z(o_{t1}\mid s,a_t) \sum_s P(s\mid s,a_t)b_t(s)bt1​(s′)∝Z(ot1​∣s′,at​)s∑​P(s′∣s,at​)bt​(s)不必死记公式。它表达的就是旧的世界猜测 刚做的动作 新收到的观察 → 更新后的世界猜测若 belief state 足够完整那么它本身可被当作一个新的“状态”。于是 POMDP 可以转写为 belief-MDP当前 belief 当前动作 → 下一个 belief6. POMDP 与本文的 LLM world model在From Word to World中Agent 接收的StS_tSt​是文本观察而不是完整的真实环境状态。观察房间里有一个关闭的抽屉。 隐藏信息抽屉中有什么钥匙是否已被拿走门是否锁着因此论文中的文本环境天然是 POMDP。论文的 world model 学习(S0,A1,S1,…,At)→St1 (S_0,A_1,S_1,\ldots,A_t)\rightarrow S_{t1}(S0​,A1​,S1​,…,At​)→St1​即根据历史观察、历史动作和当前动作预测下一观察。它没有显式维护传统 POMDP 方法中的概率分布btb_tbt​而是把类似的状态估计隐式编码在长上下文中的历史 模型参数中的环境规律传统 POMDP 方法论文中的 LLM world model显式维护 belief 概率分布隐式编码在上下文与网络表征中通常有明确状态变量状态主要是自由文本belief 更新规则可写出由模型生成行为近似更新不确定性可较直接分析不确定性更不透明、更难校准这也解释了 rollout drift若模型在早期错误判断隐藏状态后续会把错误预测当作事实继续生成使动作和状态逐步偏离真实环境。7. 对 Agent 工程的启示POMDP 视角下很多 Agent 失败不一定是不会推理而是对当前世界状态判断错了。较实用的系统设计包括保留足够的行动历史和关键状态。将重要事实写入外部 memory而非只依赖上下文窗口。在不确定性高时主动调用工具获取新观察。对不可逆动作使用预执行验证和规则约束。通过真实反馈定期校正内部状态避免长 rollout 漂移。可以概括为world model用于内部推演、比较候选动作 真实观察用于校正隐藏状态与限制模拟漂移最简复习马尔可夫性当前完整状态已携带有用历史。 MDPAgent 看得到完整状态。 POMDPAgent 看不全状态只能利用历史推断。 belief stateAgent 对隐藏真实状态的概率判断。 LLM world model以自然语言历史和模型表征隐式近似状态估计与状态转移。

相关新闻

AI辅助4K视频制作全流程:从Higgsfield提示词到侏罗纪主题成品

AI辅助4K视频制作全流程:从Higgsfield提示词到侏罗纪主题成品

在数字内容创作领域,4K分辨率视频已经成为主流标准,而AI技术的融入正以前所未有的方式降低高质量视频制作的门槛。Higgsfield Seedance2.0作为一款结合AI生成能力的视频制作工具,特别适合想要创作如“穿越侏罗纪”这类高视觉冲击力主题的创作…

2026/7/22 6:49:11阅读更多 →
AABB与OBB碰撞检测:从原理到ROS可视化实战

AABB与OBB碰撞检测:从原理到ROS可视化实战

1. 项目概述:碰撞检测的“火眼金睛” 在机器人、游戏开发、自动驾驶乃至工业仿真这些领域,有一个问题几乎无处不在:两个物体撞上了吗?这就是碰撞检测。它就像系统的“火眼金睛”,负责判断虚拟世界或物理世界中的物体是…

2026/7/22 6:49:11阅读更多 →
079、Zephyr RTOS驱动开发基础:驱动数据传递

079、Zephyr RTOS驱动开发基础:驱动数据传递

Zephyr RTOS驱动开发基础:驱动数据传递 从一次诡异的GPIO中断丢失说起 去年做一款工业传感器网关,用Zephyr驱动一个外挂的ADC芯片。调试时发现一个诡异现象:GPIO中断偶尔会丢失,概率大约千分之三。用逻辑分析仪抓波形,中断引脚确实有脉冲,但CPU就是没响应。折腾了两天,…

2026/7/22 6:49:11阅读更多 →
神经语言模型中语法正确性的线性表示机制研究与应用

神经语言模型中语法正确性的线性表示机制研究与应用

最近在自然语言处理领域,一个看似简单的发现正在引发深度思考:神经语言模型(NLMs)内部可能存在着对语法正确性的线性表示。这意味着什么?简单来说,这些复杂的模型可能用一种比我们想象中更简单的方式来&quo…

2026/7/22 7:55:18阅读更多 →
深入解析McBSP寄存器配置:从基础原理到多通道与低功耗实战

深入解析McBSP寄存器配置:从基础原理到多通道与低功耗实战

1. McBSP寄存器概览与核心设计思路 在嵌入式系统和DSP开发中,与外部音频编解码器、数据转换器或其他串行设备通信是家常便饭。德州仪器的多通道缓冲串行端口(McBSP)因其高度的灵活性和强大的多通道支持,成为了许多音频、电信和工业…

2026/7/22 7:55:18阅读更多 →
AI时代GEO投放选型指南:避开三大误区

AI时代GEO投放选型指南:避开三大误区

标题 AI时代GEO投放选型指南:避开三大误区 引言 简要介绍GEO(地理定位)投放的概念及其在AI时代的重要性 提出当前企业在GEO投放中常见的三大误区 误区一:忽视数据质量与实时性 问题描述:依赖过时或低质量的地理数据导致…

2026/7/22 7:55:18阅读更多 →
Kimi K3 API集成指南:长文本处理与成本优化实战

Kimi K3 API集成指南:长文本处理与成本优化实战

最近在AI工具选型时,不少团队都在关注国内外大模型服务的性价比对比。特别是当业务需要处理长文本、代码生成或复杂逻辑推理时,Kimi这类国产模型与海外方案的成本差异成为关键决策因素。本文基于实际技术调研,详细拆解Kimi K3的API接入、功能…

2026/7/22 7:55:18阅读更多 →
Unity热更新工作流:HybridCLR与Addressable协同实践指南

Unity热更新工作流:HybridCLR与Addressable协同实践指南

1. 项目概述:为什么我们需要一个高效的热更新工作流? 在Unity项目开发,尤其是移动端和长线运营项目的后期,我们总会遇到一个绕不开的痛点:内容更新。想象一下,你的游戏上线后,发现了一个致命的数…

2026/7/22 7:55:18阅读更多 →
线下商业活动全流程项目管控拆解|基于长三角 3 场案例,苏州独石传媒标准化活动 SOP 体系解析

线下商业活动全流程项目管控拆解|基于长三角 3 场案例,苏州独石传媒标准化活动 SOP 体系解析

线下企业活动属于多节点、多资源协同的复杂项目,涵盖策划创意、场地搭建、人员接待、媒体传播四大模块,项目管控缺失将直接导致活动投入产出比下降。本文依托近期长三角杭州、无锡、苏州三场标准化商业活动样本,从项目管理维度拆解各环节风险…

2026/7/22 7:53:17阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 0:53:59阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 0:53:59阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 0:53:59阅读更多 →
中小企业小程序开发公司怎么选:预算、上手和售后避坑指南

中小企业小程序开发公司怎么选:预算、上手和售后避坑指南

中小企业做小程序,最常见的矛盾是预算有限,但又不希望功能太单薄;没有技术团队,但又希望后续能自己运营;想快速上线,又担心隐性收费和售后失联。选型时如果只看“低价套餐”或“案例数量”,很容…

2026/7/22 0:01:17阅读更多 →
GEO优化如何沉淀长期内容资产?广拓时代谈AI搜索时代的内容ROI

GEO优化如何沉淀长期内容资产?广拓时代谈AI搜索时代的内容ROI

企业做营销,最怕钱花完了,资产没有留下。 效果广告能带来一段时间的曝光,但预算停止后,流量往往也随之停止。短视频内容可能在几天内冲高,也可能很快沉下去。AI搜索时代,企业需要重新思考一个问题&#xff…

2026/7/22 0:01:17阅读更多 →
Agent 终态判定:何时该停止思考、给出最终回复

Agent 终态判定:何时该停止思考、给出最终回复

Agent 终态判定:何时该停止思考、给出最终回复 一、你的 Agent 在"再想想"的循环里绕了 12 轮,用户已经关窗口了 Agent 与人最大的区别是:人知道什么时候该停下来给答案,Agent 会一直"想"下去。你给 Agent 接…

2026/7/22 0:01:17阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/21 22:53:50阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/21 18:53:30阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/21 18:53:30阅读更多 →