
Qwen3-VL-32B INT8 ConvRot 量化实战【免费下载链接】Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot项目地址: https://ai.gitcode.com/hf_mirrors/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot这篇文章讲一件具体的事把 Qwen3-VL-32B Ultra Heretic 的 H3 conditioning encoder 从 BF16 转成 INT8 ConvRot文件从 47.97 GiB 压到 24.55 GiB同时视觉塔和所有 norm 保持与源文件逐字节一致。适合你平时会用 Linux 命令行、装过 Python 依赖、正在 ComfyUI 上跑这个模型但显存或内存不够用的情况。47.97 GiB 的 encoder 是怎么压到 24.55 GiB 的先说清楚这个文件装了什么。H3 conditioning encoder 是一个半程包包含 Qwen3-VL 嵌入、语言层 0–49、完整视觉塔而刻意不包含 50–63 层、最终语言 norm 和 LM head——H3 取的是第 49 层之后的未归一化隐状态后面的层由可选的生成尾部按需补上。量化之后文件内部构成变了张量数从 902 涨到 1604多出来的是 scale 和描述符项目BF16 源INT8 ConvRot 版文件qwen3vl_32b_h3_ultra_uncensored_heretic_bf16.safetensorsqwen3vl_32b_h3_ultra_uncensored_heretic_int8_convrot.safetensors体积51,506,295,440 字节47.97 GiB26,363,476,151 字节24.55 GiB张量总数902全部 BF161604语言矩阵BF16350 个 row-wise INT8 ConvRot组大小 256令牌嵌入BF161 个 tensorwise INT8视觉塔与 normBF16551 个张量保留 BF16附加内容无351 个 FP32 权重 scale 351 个 ComfyUI 量化描述符体积砍半的贡献主要来自那 350 个语言矩阵其余 551 张量原样保留这也是后面验证环节要逐字节核对的部分。动手前先把三件事定下来转换工具是silveroxides/convert_to_quant1.3.1可执行入口ctq参数不少但对这个模型真正需要拍板的只有三点量什么——只量语言层的矩阵视觉塔怎么办——不碰用^visual\.整段排除令牌嵌入怎么办——ComfyUI 的 embedding 查表要求简单布局所以它特殊处理仍是 INT8但用 tensorwise 简单量化而不是 ConvRot。这三条决策会直接对应到下一条命令里的--exclude-layers、--custom-layers和--custom-scaling-mode tensor。一条命令完成 INT8 量化准备工作convert_to_quant已装进.deps用 pip 装到.deps再让PYTHONPATH指向它即可BF16 源文件在工作目录里。然后执行env PYTHONPATH.deps python .deps/bin/ctq \ -i qwen3vl_32b_h3_ultra_uncensored_heretic_bf16.safetensors \ -o qwen3vl_32b_h3_ultra_uncensored_heretic_int8_convrot.safetensors \ --int8 \ --scaling_mode row \ --convrot \ --convrot-group-size 256 \ --comfy_quant \ --save-quant-metadata \ --custom-layers ^model\.embed_tokens\.weight$ \ --custom-type int8 \ --custom-scaling-mode tensor \ --custom-simple \ --exclude-layers ^visual\. \ --low-memory \ --device cuda \ --manual-seed 42 \ --num-iter 4000 \ --optimizer adamw \ --verbose NORMAL逐项说明-i/-o— 输入 BF16 源、输出 INT8 ConvRot 文件--int8— 目标精度定为 INT8--scaling_mode row— 按行缩放矩阵每一行有自己的 scale--convrot— 启用 ConvRot先学习一个旋转再量化让权重分布更贴合量化网格--convrot-group-size 256— 每 256 维一组做旋转--comfy_quant— 按 ComfyUI 的量化布局输出含描述符--save-quant-metadata— 把全局量化元数据一并写进文件--custom-layers ^model\.embed_tokens\.weight$— 用正则精确圈出令牌嵌入这一层--custom-type int8/--custom-scaling-mode tensor/--custom-simple— 让该层走简单的 tensorwise INT8满足 embedding 查表的布局要求--exclude-layers ^visual\.— 视觉塔整段排除保留 BF16--low-memory— 压低转换过程的峰值内存--device cuda— 在 GPU 上做量化--manual-seed 42— 固定随机种子结果可复现--num-iter 4000— AdaRound 的迭代预算--optimizer adamw— 用 AdamW 学习舍入决策成功构建用的是带 plateau 早停的 AdaRound不是简单四舍五入--verbose NORMAL— 普通日志级别。生成尾部要单独量化尾部50–63 层 最终 norm LM head不复用嵌入和视觉塔所以单独打包、单独转。参数组合也随之变化去掉--custom-*和--exclude-layers改用层配置文件精确指定范围。env PYTHONPATH.deps .deps/bin/ctq \ -i qwen3vl_32b_h3_generation_tail_50_63_bf16.safetensors \ -o qwen3vl_32b_h3_generation_tail_50_63_int8_convrot.safetensors \ --int8 \ --scaling_mode row \ --convrot \ --convrot-group-size 256 \ --comfy_quant \ --save-quant-metadata \ --low-memory \ --device cuda \ --manual-seed 42 \ --num-iter 4000 \ --optimizer adamw \ --verbose NORMAL \ --layer-config tools/qwen3vl32b_generation_tail_quant.json \ --fullmatch量出来的尾部共 354 个张量98 个 row-wise INT8 ConvRot 语言矩阵加一个简单 row-wise ConvRot 的 LM head——节点会按小块分块计算它 151,936 行输出避免数 GB 的临时反量化峰值另有 57 个张量保留 BF16。文件体积 7,609,128,707 字节7.09 GiB。文件出来后怎么确认它可靠验证分两层✅ 结构验证——每个张量的 dtype、shape、scale、每层描述符以及全局量化元数据条目逐项核对✅ 字节对比——全部 551 个受保护的 BF16 张量含完整视觉塔与原始 BF16 源逐字节一致。 尾部的验证同规格57 个 BF16 张量304,128 字节与源文件逐字节相同99 个 INT8 权重、scale、描述符全部符合声明布局把基座拓扑902 张量与尾部拓扑156 张量拼合能还原完整模型的全部 1,058 个张量且无 key 冲突。装进 ComfyUI 并接线把选好的 encoder 和可选的尾部放进ComfyUI/models/text_encoders/H3/在CLIPLoader里选 H3 兼容的文本编码器类型ComfyUI 用当前 checkout且comfy-kitchen依赖保持其钉住的版本。提示增强的接线共四步用标准CLIPLoader加载 0–49 的 encoder把该 CLIP 连到H3 Prompt Enhancer (optional CLIP tail)节点在节点的clip_tail下拉框里选 50–63 的尾部把enhanced_prompt和返回的、未被改动的clip送进常规 H3 guide 节点。⚠️ 如果连进来的 CLIP 本身已是完整生成模型clip_tail保持[none — connected CLIP is already complete]enhancer 会直接走普通generate()路径不加载尾部文件。注意这些是 ComfyUI 检查点不是完整的 Transformers 生成仓库。参考资料量化工具silveroxides/convert_to_quant源模型llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic模型文件qwen3vl_32b_h3_ultra_uncensored_heretic_bf16.safetensors、qwen3vl_32b_h3_ultra_uncensored_heretic_int8_convrot.safetensors及各 generation tail【免费下载链接】Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot项目地址: https://ai.gitcode.com/hf_mirrors/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考