腾讯混元Hy3深度解析:295B参数只激活21B,推理效率怎么做到提升40%的
7月6日腾讯混元Hy3正式发布7月20日宣布限时免费延长到8月5日。说实话295B参数、Apache 2.0开源、API定价输入1元/输出4元/百万token——这些数字单独拿出来都不算特别惊人但放在一起看你会发现腾讯这次打了一套组合拳。我最感兴趣的不是参数规模而是它那个快慢思考融合的架构设计。295B的总参数一次推理只激活21B——这个7%的激活率在MoE模型里算是相当激进的。更关键的是它把快思考和慢思考两个模式融合在同一个模型里而不是像GPT-5那样需要显式地切换推理模式。快慢思考融合Hy3最被低估的设计快慢思考这个概念来自丹尼尔·卡尼曼的《思考快与慢》。简单说人脑有两种思考模式系统1快思考是直觉的、自动的、不费力的系统2慢思考是分析的、刻意的、费力的。在AI领域这个概念的落地方式是对于简单问题比如今天天气怎么样用快模式快速回答对于复杂问题比如帮我分析这个代码库的性能瓶颈用慢模式深度思考。GPT-5的做法是用户自己选择用哪个模式。Hy3的做法不一样——它把两个模式融合在同一个模型里模型自己判断该用哪个模式。简单问题复杂问题用户输入Hy3 路由判断快思考路径激活 21B 参数慢思考路径激活更多专家单次推理延迟 500ms成本低0.56元/百万token多步推理Chain-of-Thought激活额外专家如代码/数学专家成本高输出 4元/百万token输出结果这个设计的巧妙之处在于用户不需要显式选择模式模型自己判断任务的复杂度。你问11等于几它自动走快路径你问帮我分析这个SQL查询的性能瓶颈并给出优化建议它自动走慢路径。实现这个的关键是Hy3的动态门控机制——一个轻量级的分类器在推理前先判断token的复杂度然后决定激活哪些专家。# Hy3 快慢思考融合的简化实现importtorchimporttorch.nn.functionalasFclassFastSlowRouter(torch.nn.Module):Hy3 风格的快慢思考路由器def__init__(self,d_model:int,n_fast_experts:int,n_slow_experts:int):super().__init__()self.d_modeld_model self.n_fastn_fast_experts self.n_slown_slow_experts# 复杂度判断器预测 token 是否需要慢思考self.complexity_gatetorch.nn.Sequential(torch.nn.Linear(d_model,d_model//4),torch.nn.GELU(),torch.nn.Linear(d_model//4,1),torch.nn.Sigmoid())# 专家路由门self.fast_gatetorch.nn.Linear(d_model,n_fast_experts,biasFalse)self.slow_gatetorch.nn.Linear(d_model,n_slow_experts,biasFalse)defforward(self,x:torch.Tensor,fast_experts:list,slow_experts:list): x: [batch, seq, d_model] # 步骤1: 判断复杂度complexityself.complexity_gate(x)# [batch, seq, 1]# 步骤2: 根据复杂度分配专家fast_logitsself.fast_gate(x)# [batch, seq, n_fast]slow_logitsself.slow_gate(x)# [batch, seq, n_slow]# 复杂度低 → 多用快专家复杂度高 → 多用慢专家fast_weightsF.softmax(fast_logits,dim-1)*(1-complexity)slow_weightsF.softmax(slow_logits,dim-1)*complexity# 步骤3: 加权融合快慢专家输出outputtorch.zeros_like(x)fore,expertinenumerate(fast_experts):outputfast_weights[:,:,e:e1]*expert(x)fore,expertinenumerate(slow_experts):outputslow_weights[:,:,e:e1]*expert(x)returnoutput为什么只激活21B是个巧妙的设计Hy3的295B参数中一次推理只激活21B——也就是7%的激活率。这个数字看起来很小但背后有个很精妙的计算参数多 知识容量大。295B参数意味着模型可以记住更多的知识、更多的模式、更多的语言习惯。在需要广博知识的任务上比如开放域问答、多语言翻译大参数量的优势很明显。激活少 推理快、成本低。每次推理只激活21B意味着计算量和显存占用都只有21B量级。这比全量推理295B少了93%的计算量。换句话说Hy3的策略是用295B的参数来存储知识用21B的激活来执行推理。存储和计算分离这在MoE架构里是一个经典的优化思路但Hy3把它做到了一个比较极致的程度。Hy3 MoE 模型93% 参数不参与计算295B 参数知识存储21B 激活推理执行推理节省显存和算力传统 Dense 模型70B 参数70B 激活推理限时免费背后的商业逻辑腾讯把Hy3的限时免费延长到8月5日这个操作值得玩味。从表面上看这是让更多用户体验产品。但往深了想腾讯在下一盘更大的棋Hy3不只是一个大模型它是腾讯整个AI生态的入口。Hy3背后连着腾讯的多个产品线微信的AI助手、腾讯云的AI服务、腾讯文档的智能写作、企业微信的智能客服。用户通过Hy3的API进来了后面自然会被引导到腾讯的整个生态里。# 腾讯 AI 生态的模型路由概念性代码classTencentAIRouter:腾讯内部 AI 模型路由MODELS{hunyuan_hy3:{api:https://api.hunyuan.cloud.tencent.com/v1,use_case:通用对话、代码生成、文档写作,pricing:输入1元/输出4元/百万token,},hunyuan_hy3_free:{api:https://api.hunyuan.cloud.tencent.com/v1/free,use_case:免费试用限时到8月5日,pricing:免费,},}defroute(self,user_tier:str)-str:ifuser_tierfree_trial:returnhunyuan_hy3_freereturnhunyuan_hy3这和OpenAI的策略完全不同。OpenAI的全系产品都是闭源的你只能通过API用——用多少付多少。腾讯走的是开源免费试用生态绑定的路线——开源吸引开发者免费试用降低门槛生态绑定实现商业变现。写在最后腾讯混元Hy3的发布让我看到了国产大模型在技术架构创新上的一个有意思的尝试。快慢思考融合不是一个新的概念但Hy3把它做到了模型内自动判断的程度这在工程上确实需要不小的勇气。295B参数只激活21B推理效率提升40%Apache 2.0开源限时免费——这些数字和策略放在一起腾讯的意图很明确在AI大模型的牌桌上既要占技术位又要占生态位。对开发者来说Hy3的免费期到8月5日现在是体验的最佳时机。用过的都懂等收费了再想白嫖就来不及了。标签腾讯混元Hy3、MoE架构、快慢思考、开源大模型、AI推理优化

相关新闻

AI赋能百业:10个真实案例带你见证效率革命,小白也能看懂

AI赋能百业:10个真实案例带你见证效率革命,小白也能看懂

本文列举了AI在制造业、农业、零售业等10个行业的实际应用案例,展示AI如何通过自动化、预测和优化提升效率、降低成本。从制造业的智能质检到农业的精准种植,从零售业的智能库存管理到金融业的快速信贷审批,AI正以具体、务实的方式重塑各行各…

2026/7/26 0:39:37阅读更多 →
Django毕设项目: 协同过滤算法在音乐推荐系统中的应用与实现 个性化收藏音乐智能推送系统设计(源码+文档,讲解、调试运行,定制等)

Django毕设项目: 协同过滤算法在音乐推荐系统中的应用与实现 个性化收藏音乐智能推送系统设计(源码+文档,讲解、调试运行,定制等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/26 0:39:37阅读更多 →
Django毕设项目:基于Django的支持个性化需求的餐厅业务管理系统实现 数字化餐饮经营数据统计管理平台 (源码+文档,讲解、调试运行,定制等)

Django毕设项目:基于Django的支持个性化需求的餐厅业务管理系统实现 数字化餐饮经营数据统计管理平台 (源码+文档,讲解、调试运行,定制等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/26 0:39:37阅读更多 →
Claude代码技巧手册:提升AI编程效率的高级方法

Claude代码技巧手册:提升AI编程效率的高级方法

1. 为什么需要Claude代码技巧手册?在AI辅助编程领域,Claude作为后起之秀,其代码理解与生成能力已经达到行业第一梯队水平。但很多开发者仅仅停留在基础问答层面,未能充分挖掘这个工具的潜力。根据我的实测,掌握系统化的…

2026/7/26 1:53:47阅读更多 →
跨平台音频下载工具:喜马拉雅VIP专辑批量离线保存完整方案

跨平台音频下载工具:喜马拉雅VIP专辑批量离线保存完整方案

跨平台音频下载工具:喜马拉雅VIP专辑批量离线保存完整方案 【免费下载链接】xmly-downloader-qt5 喜马拉雅FM专辑下载器. 支持VIP与付费专辑. 使用GoQt5编写(Not Qt Binding). 项目地址: https://gitcode.com/gh_mirrors/xm/xmly-downloader-qt5 还在寻找一款…

2026/7/26 1:53:47阅读更多 →
香港清水湾授课!港科大EMBA民营企业家选择指南

香港清水湾授课!港科大EMBA民营企业家选择指南

一、前言:民营企业家择校,看懂5大核心维度民营企业家、企业创始人选读EMBA,核心诉求集中在解决企业转型、出海布局、团队管理、圈层升级四大问题,同时规避联考耗时、课程脱节市场、人脉圈层杂乱、证书认可度低等常见择校坑。本文将…

2026/7/26 1:53:47阅读更多 →
适合企业转型的全球EMBA 民营企业家择校参考

适合企业转型的全球EMBA 民营企业家择校参考

一、开篇导语企业转型、全球化布局、数字化升级阶段,不少民营企业家会面临EMBA择校难题:院校定位模糊、课程适配性不足、圈层资源与产业需求不匹配,盲目报考易出现学用脱节、资源浪费等问题。本文从五大客观维度,测评适合企业转型…

2026/7/26 1:53:47阅读更多 →
适合创业者的国际EMBA 择校选择指南

适合创业者的国际EMBA 择校选择指南

一、前言民营企业家、企业创始人选择国际EMBA,核心关注全球认可度、产业适配性、高端圈层与落地性课程,多数人纠结于港校国际化项目与内地头部EMBA的适配差异。本文从全球办学排名、院校办学定位、课程体系、学员圈层、产业资源五大客观维度,…

2026/7/26 1:53:47阅读更多 →
如何5分钟掌握LogExpert:Windows上终极图形化日志分析神器

如何5分钟掌握LogExpert:Windows上终极图形化日志分析神器

如何5分钟掌握LogExpert:Windows上终极图形化日志分析神器 【免费下载链接】LogExpert Windows tail program and log file analyzer. 项目地址: https://gitcode.com/gh_mirrors/lo/LogExpert 你是否曾经在Windows上为查看日志文件而烦恼?面对海…

2026/7/26 1:51:46阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/26 0:01:28阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/26 0:01:28阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/26 0:01:28阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/26 0:01:28阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/26 0:01:28阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/26 0:01:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/25 23:03:25阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/25 19:03:04阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/25 19:03:04阅读更多 →