1931_日常应用的主力模型切换成 Qwen 27B
在过去的两个星期里面我手头使用的主力本地大模型是千问的 35B-A3B。从使用的体验来说这个 A3B 的模型的确是足够惊艳的能够满足我大部分的一个使用场景。比较重要的一点是它的输出效率非常高执行的速度非常快每秒的 token 数非常多。那么为什么我还要切换 27B 的模型呢主要是在高频次使用 A3B 的这个模型的时候偶尔会发现这个模型的发挥不是那么稳定输出的一致性也不是特别好。通过网络上的一些信息检索对比发现 27B 这方面可能会更优秀一些。我尝试部署的 27B 模型是一个 IQ3 的量化版本。因为选择这个版本的话基本上能够刚好把我的 RTX 5080 Laptop 的显卡用起来也不会有太多的 CPU RAM 相关的限制。在选择这个模型的时候我也做了一些基础的测试。从网络上找了一些别人测试其他模型时候用的一些输入比如说让它做一个小游戏之类的。发现 27B 的模型在实现这部分功能的时候表现的比较好。经过了一系列的调优27B 的模型在我现在电脑上的配置如果是开启了 MTP 模式之后最高的速度可能能达到 45 token 每秒。但是在这样的配置之下上下文就压缩的特别可怜只能 16K。如果配合 Agent 使用的时候16K 的上下文可能就是一个很大的短板。于是尝试做了一些其他的修改保证这个模型首先能用。我尝试的几个修改点主要有上下文的量化压缩同时取消 MTP 的加速。这样的话基本上能保证 48K 的上下文。在 48K 上下文的配置之下显存的占用大概是 14.6G内存的占用包括系统本身的一些服务占用一共是占用了大概 22G运行过程中最高占到 28.5G 左右。最终 GPU 还有 1G 多的空闲这样的话可能不至于在系统偶尔使用的时候导致整个大模型的崩溃。在这样的配置之下每秒的 token 数大概是 25 左右。不是特别快但是基本上能够满足一些代码推理编写的基本需求。进行了一个复杂模块的软件编写中间没有出现爆显存之类的问题。在这个过程中GPU 的压力还是很大的而且温度也是比较高的。我看温度最后到了 86 度。后续的话在这个基础上继续使用一段时间中间也可以去尝试一下其他参数的优化看看能不能有更高的输出速度。有一点值得注意的是我发现相比于 A3B 的模型这个 27B 的单词模型在解决同一个问题的时候消耗的 Token 数会少很多。虽然总体的执行时间还是比 3B 要长一些但是在复杂问题的解决上这个时间也不是一个很大的劣势体验差距不是很大。下面附加我的启动脚本。echo offsetlocalset LLAMA_CPP_DIRC:\llama.cppset MODEL_PATH%LLAMA_CPP_DIR%\models\Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-IQ3_M.gguf:: 【致命修复1】将上下文削减到 48000set CONTEXT_SIZE48000:: 【致命修复2】保持全层 GPU但配合下方压缩set GPU_LAYERS99:: 线程数保持物理大核数量如 8-12set THREADS10set PORT8080set HOST0.0.0.0echo Starting Safe Mode Qwen3.6-27B Server...echo Model: %MODEL_PATH%echo Context: %CONTEXT_SIZE%, Layers: %GPU_LAYERS%, Threads: %THREADS%%LLAMA_CPP_DIR%\llama-server.exe ^-m %MODEL_PATH% --alias Qwen3.6-27B ^-c %CONTEXT_SIZE% ^-ngl %GPU_LAYERS% ^-t %THREADS% ^-b 512 ^-ub 512 ^--port %PORT% ^--host %HOST% ^--threads-batch %THREADS% ^--chat-template chatml ^--parallel 1 ^-ctk q4_0 ^-ctv q4_0 ^-fa on ^--split-mode layer ^--mlockpause

相关新闻

动态规划核心原理与C++实战:从最优子结构到蓝桥杯竞赛优化

动态规划核心原理与C++实战:从最优子结构到蓝桥杯竞赛优化

1. 项目概述:从“最全”到“最精”的动态规划备战指南最近在整理资料,看到不少同学在找“2024年C/C最全动态规划(蓝桥杯 C 题目 代码 注解)”这类资源。这个标题背后,其实反映了一个非常普遍且急迫的需求:面…

2026/7/29 6:17:41阅读更多 →
2026小程序商城软件哪个好:功能与易用性测评参考

2026小程序商城软件哪个好:功能与易用性测评参考

小程序商城软件的功能表通常都很长,商家真正用起来时,操作流程、版本限制和维护方式更容易拉开差距。选型时应关注商品、订单、会员、营销和售后能否连成完整经营链路,店员能不能在日常工作中顺畅使用。功能齐全并不代表模块越多越合适。单店…

2026/7/29 6:17:41阅读更多 →
蓝桥杯Java省赛备赛指南:从算法核心到实战技巧

蓝桥杯Java省赛备赛指南:从算法核心到实战技巧

1. 项目概述:从“蓝桥杯Java省赛”说起如果你是一名计算机相关专业的学生,或者是一位正在准备技术面试的初级开发者,那么“蓝桥杯”这个名字你一定不陌生。它不仅仅是一个竞赛,更像是一个检验你编程基本功、算法思维和临场解决问题…

2026/7/29 6:17:41阅读更多 →
行业避坑总结:AI+UI 在生产环境中最容易翻车的 5 类场景

行业避坑总结:AI+UI 在生产环境中最容易翻车的 5 类场景

行业避坑总结:AIUI 在生产环境中最容易翻车的 5 类场景 一、引子:翻车总是发生在你"觉得没问题"的地方 回顾这一个月在各行业 AIUI 实践中的踩坑经历,发现翻车集中在 5 类场景。这些场景有一个共同特征:它们在 Demo 阶段…

2026/7/29 10:05:25阅读更多 →
从舵机原理到猜拳机器人:硬件入门与智能交互实践

从舵机原理到猜拳机器人:硬件入门与智能交互实践

1. 从“玩转”到“创造”:猜拳机器人的魅力与挑战 “玩转舵机”这个说法,听起来就带着一股子动手的乐趣和探索的劲儿。而“猜拳机器人”,则是一个将这种乐趣具象化、并赋予其智能交互色彩的绝佳项目。它远不止是让几个舵机动起来那么简单&…

2026/7/29 10:05:25阅读更多 →
IEEE33节点配电网重构的最优流法实现与优化

IEEE33节点配电网重构的最优流法实现与优化

1. IEEE33节点配电网重构的背景与挑战配电网重构是电力系统运行优化的重要手段,其核心目标是通过改变网络拓扑结构来降低网损、平衡负载或提高供电可靠性。IEEE33节点系统作为国际通用的标准测试网络,包含了33个节点和37条支路(其中5条为联络…

2026/7/29 10:05:25阅读更多 →
白皮书|从RTL适配到硅前验证:如何构建有价值的FPGA原型平台

白皮书|从RTL适配到硅前验证:如何构建有价值的FPGA原型平台

目录 摘要 从 “RTL 适配”到有效的“硅前验证 ”先定原型目标,再选架构方案哪些因素影响原型验证效率RTL 就绪才是第一道关卡 ASIC 到 FPGA:绝非简单的代码移植高杠杆场景:存储器映射与时钟架构分割不是起点,而是结果容量规划…

2026/7/29 10:05:25阅读更多 →
DS4Windows完整指南:5步让PS4手柄在Windows上完美运行

DS4Windows完整指南:5步让PS4手柄在Windows上完美运行

DS4Windows完整指南:5步让PS4手柄在Windows上完美运行 【免费下载链接】DS4Windows Like those other ds4tools, but sexier 项目地址: https://gitcode.com/gh_mirrors/ds/DS4Windows 想在Windows电脑上使用PS4手柄玩游戏,却发现按键错乱、连接不…

2026/7/29 10:05:25阅读更多 →
久久派开发板环境配置与内核优化实战

久久派开发板环境配置与内核优化实战

1. 久久派开发环境深度配置指南 作为龙芯生态中重要的开发板平台,久久派凭借其出色的性价比和完整的工具链支持,已成为国产处理器开发者的首选之一。在实际项目开发中,我发现很多开发者卡在环境配置这一基础环节,特别是交叉编译工…

2026/7/29 10:03:25阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/29 9:47:45阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/29 7:00:19阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/29 7:58:51阅读更多 →
28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“! 在构建复杂的 Agent 系统时,我们经常会遇到这样的场景:Agent 正在执行一个多步骤的任务,比如“下单购买商品”,但执行到一半时,我们…

2026/7/29 0:01:46阅读更多 →
自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

近日,国际专注开放式技术研发的声学品牌Nank南卡,正式官宣实力艺人曾舜晞担任品牌代言人。消息一经发出便轰动全网。为什么耳机品牌不选择流量明星、老牌歌手?而且是选择曾舜晞?让我们一起来探索一下!比起短期的流量&a…

2026/7/29 0:01:46阅读更多 →
【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:01:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/29 4:31:51阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/28 2:35:58阅读更多 →