GLM-4.5-Air:1060亿参数的高效智能体模型突破,如何在推理、编码与智能体任务中实现性能飞跃
GLM-4.5-Air1060亿参数的高效智能体模型突破如何在推理、编码与智能体任务中实现性能飞跃【免费下载链接】GLM-4.5-AirGLM-4.5 系列模型是专为智能体设计的基础模型。GLM-4.5拥有 3550 亿总参数量其中 320 亿活跃参数GLM-4.5-Air采用更紧凑的设计拥有 1060 亿总参数量其中 120 亿活跃参数。GLM-4.5模型统一了推理、编码和智能体能力以满足智能体应用的复杂需求项目地址: https://ai.gitcode.com/zai-org/GLM-4.5-AirGLM-4.5-Air是智谱AI推出的新一代高效混合专家MoE架构大语言模型专为智能体应用而设计。这款拥有1060亿总参数、120亿活跃参数的紧凑型模型在推理、编码和智能体能力方面实现了突破性进展为开发者和研究人员提供了参数效率与性能的最佳平衡。 项目亮点与核心价值高效智能体模型的创新突破GLM-4.5-Air代表了当前大语言模型领域的重要技术创新其核心价值体现在三个关键方面参数效率的革命性提升相比传统的密集模型GLM-4.5-Air采用混合专家架构仅激活12%的参数即可完成复杂任务大幅降低了计算成本和推理延迟。这种设计使得1060亿参数的模型在实际应用中表现出接近更大模型的性能。统一的多任务能力模型专门针对智能体应用进行了优化统一了推理、编码和智能体能力。这意味着单个模型可以处理从复杂数学推理到代码生成再到多步任务规划的多样化需求无需在不同任务间切换专用模型。开源与商业友好采用MIT开源许可证发布支持商业使用和二次开发为企业和研究机构提供了强大的基础模型支持。模型提供了基础版本、混合推理版本和FP8量化版本满足不同部署场景的需求。 技术架构解析混合专家架构的深度优化GLM-4.5-Air的技术架构体现了现代大语言模型设计的前沿理念混合专家架构设计模型包含128个路由专家和1个共享专家每层激活8个专家。这种loss-free balance routing机制确保了专家负载均衡避免了传统MoE架构中常见的负载不均问题。注意力机制创新采用96个注意力头的多头注意力机制结合Grouped-Query Attention技术在保持模型性能的同时显著降低了KV缓存的内存占用。头维度设置为128隐藏层维度为4096中间层维度为10944这些精心设计的维度平衡了模型容量与计算效率。长上下文支持支持长达131,072个token的上下文长度这对于需要处理长文档、多轮对话或复杂代码库的智能体应用至关重要。模型采用旋转位置编码RoPEtheta参数设置为1,000,000确保了长距离依赖的有效建模。多模态与工具调用能力tokenizer配置中包含了丰富的特殊标记支持图像、视频、音频和转录内容的处理。模型原生支持工具调用功能通过tool_call、tool_response等标记实现了结构化工具调用接口。 性能表现与基准测试数据驱动的卓越表现在12个行业标准基准测试中GLM-4.5-Air展现出了令人印象深刻的性能综合性能评分GLM-4.5-Air在综合评估中获得了59.8分在开源和专有模型中表现出色。虽然参数规模仅为1060亿但其性能接近更大规模的模型体现了极高的参数效率。推理能力突出在数学和科学推理任务中模型在AIME 24测试中达到91.0%的准确率在MATH 500中达到79.1%。这些成绩表明模型在复杂逻辑推理方面具有强大能力。编码能力卓越在SWE-bench Verified基准测试中GLM-4.5-Air取得了64.2%的分数在Terminal-Bench中达到37.5%。这对于需要代码理解和生成的智能体应用至关重要。智能体基准领先在TAU-Bench智能体基准测试中达到70.1%在BFCL v3中达到77.8%BrowseComp中达到26.4%。这些成绩证明了模型在多步任务规划和工具使用方面的优势。安全性与可靠性在SafetyBench评估中模型平均得分89.9分其中伦理与道德子项达到94.3分确保了在实际应用中的安全可靠。 应用场景与实践指南从理论到实践的完整路径GLM-4.5-Air的多样化能力使其适用于广泛的智能体应用场景复杂任务自动化模型支持两种推理模式——思考模式用于复杂推理和工具使用非思考模式用于即时响应。这使得它能够处理从简单的问答到复杂的多步任务规划。代码生成与调试通过|code_prefix|、|code_middle|、|code_suffix|等特殊标记模型可以理解代码的上下文结构生成高质量的代码片段或进行代码调试。多模态智能体开发支持图像、视频、音频等多种模态输入为构建多媒体内容理解和生成的智能体提供了基础。企业级部署建议硬件要求推荐使用具有足够VRAM的GPUFP8量化版本可以进一步降低内存需求推理优化建议使用vLLM或SGLang等优化推理框架充分利用模型的稀疏激活特性微调策略针对特定领域任务可以使用LoRA等参数高效微调方法进行适配安全部署结合模型的安全过滤机制确保生成内容符合企业规范快速启动示例# 克隆仓库 git clone https://gitcode.com/zai-org/GLM-4.5-Air # 安装依赖 pip install transformers torch # 加载模型示例代码 from transformers import AutoModelForCausalLM, AutoTokenizer model AutoModelForCausalLM.from_pretrained(zai-org/GLM-4.5-Air) tokenizer AutoTokenizer.from_pretrained(zai-org/GLM-4.5-Air) 未来展望与社区贡献推动智能体生态发展GLM-4.5-Air的发布标志着智能体基础模型发展的重要里程碑为社区带来了新的可能性技术发展方向未来模型将继续优化专家路由机制提升稀疏激活的效率。同时将探索更高效的多模态融合技术增强模型对复杂环境的理解能力。社区生态建设开源社区可以基于GLM-4.5-Air构建各种垂直领域的智能体应用从代码助手到数据分析工具从教育辅导到创意写作。研究合作机会研究人员可以利用模型的开放架构探索新的训练策略、微调方法或应用场景。模型的透明性为学术研究提供了宝贵的实验平台。企业应用前景随着模型部署工具的完善和生态系统的成熟GLM-4.5-Air有望成为企业构建AI智能体的首选基础模型推动各行各业的智能化转型。GLM-4.5-Air不仅是一个技术产品更是智能体技术民主化的重要一步。通过提供高性能、高效率的开源基础模型它为开发者和研究者提供了构建下一代AI应用的强大工具共同推动人工智能技术的普及和发展。【免费下载链接】GLM-4.5-AirGLM-4.5 系列模型是专为智能体设计的基础模型。GLM-4.5拥有 3550 亿总参数量其中 320 亿活跃参数GLM-4.5-Air采用更紧凑的设计拥有 1060 亿总参数量其中 120 亿活跃参数。GLM-4.5模型统一了推理、编码和智能体能力以满足智能体应用的复杂需求项目地址: https://ai.gitcode.com/zai-org/GLM-4.5-Air创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Chinese-Annotator:企业级中文文本智能标注平台架构设计与性能优化实践

Chinese-Annotator:企业级中文文本智能标注平台架构设计与性能优化实践

Chinese-Annotator:企业级中文文本智能标注平台架构设计与性能优化实践 【免费下载链接】Chinese-Annotator Annotator for Chinese Text Corpus (UNDER DEVELOPMENT) 中文文本标注工具 项目地址: https://gitcode.com/gh_mirrors/ch/Chinese-Annotator 在人…

2026/7/21 15:17:25阅读更多 →
Django毕业设计实战:从选题到部署的完整指南与网络安全系统开发

Django毕业设计实战:从选题到部署的完整指南与网络安全系统开发

1. 先搞清楚这个“万套合集”到底能帮你解决什么毕业设计难题如果你正在为计算机专业的毕业设计发愁,特别是选题、技术选型、代码实现和论文查重这几个环节卡壳,那这个所谓的“万套合集”项目,本质上是一个打包好的资源库。它瞄准的就是毕业设…

2026/7/21 15:17:25阅读更多 →
Qwen3终极指南:如何免费快速部署高性能MoE大语言模型

Qwen3终极指南:如何免费快速部署高性能MoE大语言模型

Qwen3终极指南:如何免费快速部署高性能MoE大语言模型 【免费下载链接】Qwen1.5 Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud. 项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5 你是否正在寻找既能保持顶级性…

2026/7/21 15:17:25阅读更多 →
零基础玩转bWAPP靶场(十一):LDAP 注入——搜索型

零基础玩转bWAPP靶场(十一):LDAP 注入——搜索型

摘要:本文是 bWAPP 靶场系列的第十一篇,聚焦于 LDAP Injection (Search)(LDAP 搜索注入)漏洞。文章从零基础角度出发,首先讲清楚 LDAP 搜索注入与连接设置的本质区别,然后讲解 LDAP 的基本概念、树状数据结…

2026/7/21 21:01:20阅读更多 →
仅限本周开放:2024 Q2多模态模型能力矩阵白皮书(含17个模型×23项细粒度指标×5类硬件适配评分)——最后237份免费领取通道即将关闭

仅限本周开放:2024 Q2多模态模型能力矩阵白皮书(含17个模型×23项细粒度指标×5类硬件适配评分)——最后237份免费领取通道即将关闭

更多请点击: https://kaifayun.com 第一章:AI模型多模态能力对比总览 多模态AI模型正从单一模态理解迈向跨模态协同推理,其核心差异体现在输入模态支持、对齐机制、联合表征深度及下游任务泛化性上。当前主流模型在文本-图像、文本-音频、文…

2026/7/21 21:01:20阅读更多 →
央企引入AI智能体,合规与安全要先解决什么?

央企引入AI智能体,合规与安全要先解决什么?

人工智能正在进入央国企的核心业务场景。过去,企业更多关注大模型能否写材料、做问答、生成报告;现在,越来越多单位开始讨论AI智能体能否进入财务、人资、法务、采购、客服、运维、风控等流程,帮助员工完成跨系统查询、资料核验、…

2026/7/21 21:01:20阅读更多 →
Python+Selenium+Chrome自动化测试框架:从POM模式到CI/CD集成的工程实践

Python+Selenium+Chrome自动化测试框架:从POM模式到CI/CD集成的工程实践

1. 项目概述:为什么我们需要一个PythonSeleniumChrome的自动化测试框架?如果你是一名测试工程师,或者正在向这个方向转型,那你一定对“重复劳动”深恶痛绝。想象一下,每次版本迭代,你都需要手动打开浏览器&…

2026/7/21 21:01:20阅读更多 →
OpenLumSharp:.NET平台的轻量级AI Agent开发框架

OpenLumSharp:.NET平台的轻量级AI Agent开发框架

1. OpenLumSharp 项目概览OpenLumSharp 是一个基于 .NET 平台构建的轻量级 AI Agent 运行时环境,采用 C# 语言实现。这个项目源自对 OpenClaw 架构的重新思考与本地化改造,旨在为 .NET 开发者提供一个高度集成的 AI 助手开发框架。与常见的云端 AI 服务不…

2026/7/21 21:01:20阅读更多 →
PLC/Java/电气工程师如何转型上位机开发

PLC/Java/电气工程师如何转型上位机开发

1. 从PLC/Java/电气转向上位机开发的路径解析作为一名在工业自动化领域摸爬滚打多年的工程师,经常被问到"PLC/Java/电气背景转上位机哪个更容易"这个问题。要回答这个问题,我们需要先明确几个关键概念:上位机开发本质上是工业控制系…

2026/7/21 20:59:19阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 0:51:49阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 0:51:49阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 0:51:49阅读更多 →
Windows+macOS 通用 OpenClaw 部署流程,内置依赖一键启动智能桌面助手

Windows+macOS 通用 OpenClaw 部署流程,内置依赖一键启动智能桌面助手

📌教程适配:OpenClaw v2.7.9 | 兼容 Windows10/11、macOS 双系统 📖前言 当下各类本地 AI 工具层出不穷,多数产品仅能完成文字问答交互,很难直接操控电脑执行实际操作。OpenClaw,业内常称小龙虾 AI&#…

2026/7/21 0:01:46阅读更多 →
Codex 接入后 Bug 反增?复盘从个人演示到团队协作的“流程陷阱”

Codex 接入后 Bug 反增?复盘从个人演示到团队协作的“流程陷阱”

聊《一次Codex项目复盘,问题最后出在流程而不是模型》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。摘要先把这篇文章的目标说清楚:看完之后,你应该能判断这件事值不值得做&…

2026/7/21 0:01:46阅读更多 →
手把手搓一个五子棋游戏,零代码也能当“游戏开发者”

手把手搓一个五子棋游戏,零代码也能当“游戏开发者”

大家好,还是我。前几期带大家做了心情日记本和可视化大屏,后台有朋友留言:“能不能教点好玩的?我想做游戏,但一行代码都不会。”行,这期就安排。今天的目标:从零做一个五子棋游戏。 带AI对战、三…

2026/7/21 0:03:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/20 22:51:39阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/21 18:53:30阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/21 18:53:30阅读更多 →