ARTICLE DETAIL

资讯详情

深耕网站SEO优化与搜索引擎排名提升的一线实战洞察。

传统Attention VS deepseek MLA

传统Attention VS deepseek MLA 普通 AttentionMHA/GQA与 MLAMulti-head Latent Attention的核心差异在于KV Cache 的存储与表达形态。标准 Attention 选择按头显式平铺存储K/VK/VK/V向量而 MLA 通过“低秩联合压缩 RoPE 解耦”将 KV Cache 压缩为无关头数的隐变量大幅破除了长上下文推理的显存带宽瓶颈。对比维度普通 Attention (MHA / GQA)MLA (Multi-head Latent Attention)KV 存储结构按头 (HkvH_{kv}Hkv​) 独立保存KKK与VVV向量联合压缩为无头的低秩隐变量ctKVc_t^{KV}ctKV​ 专用 RoPE 向量ktRk_t^RktR​KV Cache 公式B×L×T×Hkv×(DqkDv)B \times L \times T \times \mathbf{H_{kv}} \times (D_{qk} D_v)B×L×T×Hkv​×(Dqk​Dv​)B×L×T×(RkvDrope)B \times L \times T \times (R_{kv} D_{rope})B×L×T×(Rkv​Drope​)显存乘数依赖强依赖KV 头数 (HkvH_{kv}Hkv​)完全剔除HkvH_{kv}Hkv​乘数KV Cache 占用降低 70%~80%RoPE 位置编码直接融合在多头KKK向量中解耦独立存储因为旋转矩阵无法被低秩投影吸收推理计算开销标准矩阵乘法依靠矩阵吸收Matrix AbsorptionDecode 时不增加额外计算核心适用场景适合短文本、小 Batch 推理专为超长上下文、大并发 Batch 推理设计如 DeepSeek-V3/R1核心技术点解析剔除头数乘积 (HkvH_{kv}Hkv​)传统 GQA 虽减少了 KV 头数但仍有HkvH_{kv}Hkv​乘法项。MLA 直接将所有头的K/VK/VK/V压缩为一个统一的潜隐向量RkvR_{kv}Rkv​使单个 Token 占据的显存与模型设定的注意力头数量彻底解耦。矩阵吸收 (Matrix Absorption)MLA 表面上看起来每次计算都要将低秩隐向量重新“还原”成多头但在 Decode 阶段生成K/VK/VK/V的升维矩阵可以提前在数学上融进 Query 的投影矩阵WQW_QWQ​和 Output 矩阵WOW_OWO​中因此解码时完全无需显式展开多头完全不增加额外计算量。RoPE 的解耦设计旋转位置编码RoPE打破了线性变换的吸附特性无法直接被投影矩阵吸收。MLA 专门解耦出一条独立的DropeD_{rope}Drope​维度来专门存储带位置信息的 Key既保留了长上下文位置感知又确保了低秩压缩算子的代数优雅。
返回列表