LatentMOE解析:将hiddensize降维投影到潜在空间
2026年1月英伟达提出了 LatentMoE 架构并在 Nemotron-3 模型中应用论文链接https://arxiv.org/pdf/2601.180897月月之暗面发布了2.8T参数的kimi k3同样使用了 LatentMOE 架构。简单来说LatentMOE 在传统的 MOE 架构的开始和末尾分别增加了对 hiddensize 维度的降维投影和还原降低计算和通信负载在基本相同的推理成本下可以计算更大的总专家数和激活专家数从而提高模型精度。在同样的精度要求下推理成本更低。架构原理h i d d e n s i z e hidden sizehiddensize隐藏层维度也常写作h i d d e n d i m e n s i o n hidden dimensionhiddendimension是 Transformer 大语言模型最核心的基础参数之一指每一个 token 在网络层间传递时的特征向量的长度可以直观理解为每个 token 用多长的向量来承载它的语义信息。如图所示在 LatentMoE 中每个 token 先通过可学习的下投影矩阵W ↓ ​ W_{↓​}W↓​​从模型隐藏维度空间R d R^{d}Rd投影到更低维度的隐空间R ℓ R^{ℓ}Rℓ中h i d d e n s i z e hidden sizehiddensize从d dd下降到ℓ再进行专家计算每个专家E i ​ ( ⋅ ; ℓ ) E_i​(⋅;ℓ)Ei​​(⋅;ℓ)完全在隐空间内运算其参数为权重W F C 1 ( i ) W_{FC1}^{(i)}WFC1(i)​​、W g a t e ( i ) ​ ∈ R m × ℓ W_{gate}^{(i)​}∈R^m×ℓWgate(i)​​∈Rm×ℓ与W F C 2 ( i ) ​ ∈ R ℓ × m W_{FC2}^{(i)}​∈R^ℓ×mWFC2(i)​​∈Rℓ×m。LatentMoE 的流程为先通过原始维度选出 top-k 专家 → 再对 token 做 down-proj 降维 → 再分发到隐空间的专家中计算。需要注意的是降维只作用于专家计算 all-to-all 通信环节不包含路由决策。共享专家全程工作在原始 d 维空间不经过隐空间投影。E i ( x ℓ ) W F C 2 ( i ) ⋅ ( σ ( W g a t e ( i ) ⋅ x ℓ ) ⏟ 门控掩码 ⊙ ( W F C 1 ( i ) ⋅ x ℓ ) ⏟ 特征内容 ) E_i(x_\ell) W_{FC2}^{(i)} \cdot \left( \underbrace{\sigma\left(W_{gate}^{(i)} \cdot x_\ell\right)}_{\text{门控掩码}} \odot \underbrace{\left(W_{FC1}^{(i)} \cdot x_\ell\right)}_{\text{特征内容}} \right)Ei​(xℓ​)WFC2(i)​⋅​门控掩码σ(Wgate(i)​⋅xℓ​)​​⊙特征内容(WFC1(i)​⋅xℓ​)​​​专家计算完成后对输出结果聚合再通过可学习的上投影矩阵W ↑ ​ ∈ R d × ℓ W_{↑​} ∈R^{d}×ℓW↑​​∈Rd×ℓ映射回原始输入维度。经过下投影W ↓ ​ W_{↓​}W↓​​后token 的分发与聚合都在隐空间R ℓ R^{ℓ}Rℓ中进行这使得通信量相比标准 MoE 降低了α αα倍。同理由于专家权重位于隐空间维度为m × ℓ m×ℓm×ℓ与ℓ × m ℓ×mℓ×m权重加载的内存带宽成本也降低了α αα倍。通信、带宽与计算成本的降低为规模的扩展提供了基础。研究利用这部分效率增益将总专家数N NN与每个 token 激活的 top-k 专家数K KK同步扩大α d / ℓ αd/ℓαd/ℓ倍在整体推理成本基本不变的前提下提升模型精度可指数级提升专家多样性进而增强模型质量。由于K KK扩大了α d / ℓ αd/ℓαd/ℓ倍通信成本与内存带宽需求和标准 MoE 保持一致。但专家多样性的提升与每个 token 非线性单元预算的增加使其在同等推理成本下实现了更优的模型精度将模型的帕累托前沿推向新高度。实验评估为了方便对照研究设计了两种配置ℓ-MoE_eff只放大总专家数N不放大激活专家数K → 推理成本显著下降精度和基线持平对应 “用压缩换效率”ℓ-MoE_accN和K同步放大α倍 → 推理成本和基线完全持平精度显著提升对应 “成本不变结构改善精度”压缩比例对模型质量的影响研究假设存在内在有效特征秩r e f f r_{eff}reff​​当隐维度ℓ ≥ r e f f ℓ≥r_{eff}ℓ≥reff​​时压缩带来的信息损失可忽略图中结果表明在 ℓ-MoE_eff 配置下当压缩比例α ≤ 4 α≤4α≤4时模型质量得以保留。专家数量对模型质量的影响图中红色曲线为仅压缩4倍不扩大专家数量精度明显下降绿色曲线为压缩4倍并且专家数量扩大4倍不改变top-k激活专家数量也就是 ℓ-MoE_eff 配置验证损失与基线基本对齐压缩带来的精度损失被有效抵消。两种配置与基线对比上图对比了两种配置与基线的验证损失实验基于 160 亿总参、20 亿激活参模型隐维度 ℓ512α4。与预期一致ℓ-MoE_eff​ 的精度与基线持平而 ℓ-MoE_acc​ 的验证损失明显更低。因此研究推荐使用 ℓ-MoE_acc​以实现精度与推理成本的帕累托最优。在更大参数量的模型训练中依旧可以得出同样的结论。推理性能实测推理性能表 5 是 LatentMoE 与标准 MoE 的实测推理吞吐对比验证 ℓ-MoE_acc论文推荐配置在真实部署中的推理效率。实测结果表明在高并发场景下单 GPU 吞吐的降幅最高仅为 6%。测试对象Hybrid-73BT-8BA 混合 Mamba - 注意力 MoE 模型硬件2 张 NVIDIA H100 GPU框架与精度vLLM 推理框架、FP8 逐张量量化LatentMoE 带来的精度提升幅度远大于 6% 的速度损失。并且通过进一步的软件优化甚至可以消弭 LatentMoE 与标准 MoE 之间这一微小的吞吐差距。万亿参数规模性能预估研究以公开的 Kimi-K2-1T 架构为理论基底构造了一个假想的 LatentMoE 变体理论预估等精度下推理的性能收益。LatentMoE 的核心优势是同成本下精度更高如果直接对比 “1T 参数标准 MoE vs 1T 参数 LatentMoE” 的速度是不公平的 —— 因为后者精度明显更高。因此论文采用了等精度基线法基于 Qwen-3 稠密模型的缩放定律计算模型精度对应的 “等效稠密参数量”。测算得到1T 参数的 Kimi-K2-1T-LatentMoE精度等价于1.35T 参数的标准 MoE 模型EPM≈1.35。构造一个标准 MoE 模型 Kimi-K2-1.35T把原生 1T 模型的层数从 61 层增加到 80 层让它的精度和 1T LatentMoE 完全对齐作为对比基准。图7说明1T LatentMoE 和 1T 原生标准 MoE 相比因为 LatentMoE 多了 down-proj/up-proj 两层投影引入了少量额外计算因此速度最多慢约 9%投影开销非常小。1T LatentMoE 和 1.35T 标准 MoE 相比精度完全对齐1T LatentMoE推理性能显著提升在解码为主的场景和预填充为主的场景下LatentMoE 始终处于更优的帕累托前沿。

相关新闻

深入TM4C129x以太网DMA:寄存器级配置实现高性能嵌入式网络

深入TM4C129x以太网DMA:寄存器级配置实现高性能嵌入式网络

1. 项目概述与核心价值 在嵌入式系统开发,尤其是工业控制、汽车电子或物联网网关这类对网络实时性和吞吐量有严苛要求的领域,以太网通信的稳定与高效是基石。很多工程师在驱动一个以太网控制器时,往往满足于调用厂商提供的库函数让链路“通起…

2026/7/22 11:03:48阅读更多 →
TM4C1299微控制器EEPROM、Flash保护与μDMA实战配置指南

TM4C1299微控制器EEPROM、Flash保护与μDMA实战配置指南

1. 项目概述与核心价值在嵌入式开发,尤其是基于ARM Cortex-M内核的项目中,我们常常面临两个核心挑战:如何安全、高效地管理芯片内部的非易失性存储资源,以及如何在不增加CPU负担的前提下,实现高速、稳定的数据流传输。…

2026/7/22 11:03:48阅读更多 →
Claude Code多代理协作中的paneMode配置与优化

Claude Code多代理协作中的paneMode配置与优化

1. 理解paneMode的核心作用在Claude Code的多代理协作环境中,paneMode参数决定了团队成员的工作界面布局方式。这个看似简单的配置项实际上直接影响着开发者的监控效率和团队协作流畅度。根据实际项目经验,选择不当的显示模式可能导致:关键信…

2026/7/22 11:03:48阅读更多 →
HarmonyOS应用开发实战:萌宠日记 - TextInput 与 TextArea 输入组件详解

HarmonyOS应用开发实战:萌宠日记 - TextInput 与 TextArea 输入组件详解

HarmonyOS应用开发实战:萌宠日记 - TextInput 与 TextArea 输入组件详解 前言 TextInput 和 TextArea 是 ArkUI 中两个最基础的文字输入组件。在 萌宠日记 的日记编辑器中,TextInput 用于 日记标题 输入,TextArea 用于 正文内容 输入。两者配…

2026/7/22 11:49:53阅读更多 →
HarmonyOS应用开发实战:萌宠日记 - 宠物信息数据结构设计

HarmonyOS应用开发实战:萌宠日记 - 宠物信息数据结构设计

HarmonyOS应用开发实战:萌宠日记 - 宠物信息数据结构设计 前言 数据结构设计 是应用开发的基础,它决定了 数据如何组织、存储、传递和展示。在 萌宠日记 中,我们设计了多个 interface 接口 来定义宠物信息、健康提醒、日记条目等数据模型。这…

2026/7/22 11:49:53阅读更多 →
能科科技AI+工业场景化应用【第二期】:PLM AI智能助手

能科科技AI+工业场景化应用【第二期】:PLM AI智能助手

当前,PLM(例如Teamcenter)作为一款专业的产品生命周期管理系统,广泛应用于制造企业,帮助企业实现产品数据的统一管理与协同共享。但是在实际应用中存在两大难题:一是隐性人力成本高,新员工培训耗…

2026/7/22 11:49:53阅读更多 →
OpenCode开源AI编程代理:安装配置与核心功能解析

OpenCode开源AI编程代理:安装配置与核心功能解析

1. OpenCode是什么?一个开源AI编程代理的全面解析 OpenCode是当前开发者社区热议的一款开源AI编程代理工具,它能在你的终端、IDE或桌面环境中直接嵌入智能编程助手功能。与市面上常见的商业AI编程工具不同,OpenCode的核心优势在于其开源属性和…

2026/7/22 11:49:53阅读更多 →
古籍文献修复库房通风 易互德无尘稳温布风管延缓纸张酸化老化

古籍文献修复库房通风 易互德无尘稳温布风管延缓纸张酸化老化

市级古籍保护中心修复库房存放线装古籍、拓片、善本,纸质文物材质脆弱,温湿度波动、粉尘、强气流都会加速纸张酸化、纤维脆化,造成不可逆破损。传统铁皮风管高速送风搅动空气中粉尘、酸性颗粒物,附着古籍表面腐蚀纸页;…

2026/7/22 11:49:53阅读更多 →
2026年专科论文AI写作工具怎么选?这4个标准帮你避开90%的坑

2026年专科论文AI写作工具怎么选?这4个标准帮你避开90%的坑

大三下学期,专科生要同时面对实习、专升本备考和毕业论文三座大山。论文要求不算顶格——通常5000到8000字、查重率30%以内——但对白天在实习单位搬砖、晚上才有空打开文档的你来说,依然是沉重的负担。于是你开始搜"专科论文ai写作工具"&…

2026/7/22 11:47:52阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 0:53:59阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 0:53:59阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 0:53:59阅读更多 →
中小企业小程序开发公司怎么选:预算、上手和售后避坑指南

中小企业小程序开发公司怎么选:预算、上手和售后避坑指南

中小企业做小程序,最常见的矛盾是预算有限,但又不希望功能太单薄;没有技术团队,但又希望后续能自己运营;想快速上线,又担心隐性收费和售后失联。选型时如果只看“低价套餐”或“案例数量”,很容…

2026/7/22 0:01:17阅读更多 →
GEO优化如何沉淀长期内容资产?广拓时代谈AI搜索时代的内容ROI

GEO优化如何沉淀长期内容资产?广拓时代谈AI搜索时代的内容ROI

企业做营销,最怕钱花完了,资产没有留下。 效果广告能带来一段时间的曝光,但预算停止后,流量往往也随之停止。短视频内容可能在几天内冲高,也可能很快沉下去。AI搜索时代,企业需要重新思考一个问题&#xff…

2026/7/22 0:01:17阅读更多 →
Agent 终态判定:何时该停止思考、给出最终回复

Agent 终态判定:何时该停止思考、给出最终回复

Agent 终态判定:何时该停止思考、给出最终回复 一、你的 Agent 在"再想想"的循环里绕了 12 轮,用户已经关窗口了 Agent 与人最大的区别是:人知道什么时候该停下来给答案,Agent 会一直"想"下去。你给 Agent 接…

2026/7/22 0:01:17阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/21 22:53:50阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/21 18:53:30阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/21 18:53:30阅读更多 →