
如何构建 Q2 与 Q4 路由专家 GGUFDwarfStar 量化器完整流程指南【免费下载链接】ds4DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm项目地址: https://gitcode.com/GitHub_Trending/ds4/ds4DwarfStards4是专为 DeepSeek V4 Flash 与 PRO 打造的本地推理引擎支持 Metal、CUDA 和 ROCm。它的配套量化器deepseek4-quantize可以把 Hugging Face 原始权重离线转换成 Q2 与 Q4 路由专家 GGUF 模型文件。本文将带你走通完整流程构建工具、收集 imatrix 校准数据、生成 Q2/Q4 模型并用官方输出做质量对比。为什么路由专家量化这么重要DeepSeek V4 是 MoE混合专家架构Flash43 层每层 256 个路由专家Pro61 层每层 384 个路由专家每层有 3 类路由专家张量ffn_gate_exps、ffn_up_exps、ffn_down_exps。专家参数占模型体积的大头把它们从 FP 压缩到 2~4 bit是让 900 GB 级权重落到消费级硬件的关键——Q2 输出约 80~90 GBQ4 约 150~170 GB。DwarfStar 的量化配方官方发布格式张量类别Q2 配方Q4 配方路由 gate/up 专家IQ2_XXSQ4_K路由 down 专家Q2_KQ4_K注意力投影 / 共享专家 / 输出Q8_0Q8_0量化格式实现见 gguf-tools/quants.h工具总入口文档在 gguf-tools/README.md。准备工作构建量化器工具链量化器是纯 C 实现不依赖 GGML编译只需一行make -C gguf-tools产物gguf-tools/deepseek4-quantize即本文主角。它内置 GGUF 元数据处理、safetensors 加载、FP4/FP8 反量化逻辑规则见 gguf-tools/Makefile。你需要准备两份输入HF 原始权重目录含model.safetensors.index.json的 safetensors 分片目录模板 GGUF提供元数据、分词器、张量顺序与逻辑形状张量字节会从 safetensors 重新生成第一步生成 imatrix 校准数据集量化器在压缩专家权重时需要知道哪些输入列更重要。DwarfStar 用imatrix重要性矩阵来记录真实激活统计。先运行数据集构建脚本生成带DS4_IMATRIX_PROMPT分隔标记的校准提示词文件python3 gguf-tools/imatrix/dataset/build_ds4_imatrix_dataset.py产物gguf-tools/imatrix/dataset/rendered_prompts.txt包含 4682 条渲染好的聊天提示词约 290 万 token覆盖代码审查、长上下文、工具调用、多语言改写以及 GPQA/AIME 等基准题——数据集详情见 gguf-tools/imatrix/dataset/manifest.json。第二步用 ds4 收集激活统计关键点用 ds4 推理引擎本身收集路由 MoE 的激活统计这样统计量和真实推理图完全一致./ds4 \ -m 模板模型.gguf \ --imatrix-dataset gguf-tools/imatrix/dataset/rendered_prompts.txt \ --imatrix-out 输出-routed-moe-ds4.dat \ --ctx 32768收集器挂在 prefill 计算图上对每个路由专家累计sum(x[column]^2)gate/up 张量记录 FFN 归一化输入激活的平方down 张量记录路由加权后的 SwiGLU 行平方。输出是 llama.cpp 风格的二进制.dat文件把每层 256Flash或 384Pro个专家的向量打包成一条记录。 完整参数含--imatrix-max-prompts、--imatrix-max-tokens冒烟测试限制见 gguf-tools/imatrix/README.md。本地生成 imatrix 会比较慢要跑完整校准语料的 prefill 并从 GPU 读回统计追求效率可直接使用官方发布的 imatrix 文件。第三步生成 Q2 路由专家 GGUF先做安全检查推荐--dry-run打印输出计划--compare-tensor只重算单个张量并与模板逐字节比对gguf-tools/deepseek4-quantize --hf HF权重目录 --template 模板.gguf --dry-run gguf-tools/deepseek4-quantize --hf HF权重目录 --template 模板.gguf --compare-tensor blk.0.attn_q_a.weight确认无误后正式生成 Q2IQ2_XXS 路由专家 imatrixgguf-tools/deepseek4-quantize \ --hf HF权重目录 \ --template DeepSeek-V4-Flash-IQ2XXS-w2Q2K-chat.gguf \ --out DeepSeek-V4-Flash-IQ2XXS-w2Q2K-imatrix.gguf \ --imatrix routed-moe-ds4.datPro 大模型的实际运行手册含 OOM 防护、分片校验、日志留存等完整流程值得精读misc/DS4PRO_AUG2026_CONVERSION.md。第四步生成 Q4 路由专家 GGUFQ4 配方只需换模板和参数路由专家类型保持Q4_Kgguf-tools/deepseek4-quantize \ --hf HF权重目录 \ --template DeepSeek-V4-Flash-Q4KExperts-chat.gguf \ --out DeepSeek-V4-Flash-Q4KExperts-imatrix.gguf \ --imatrix routed-moe-ds4.dat两种配方共享同一个 imatrix 文件。想更高质量加--experts q8_K --threads 8可以生成真 Q8_K 路由专家版。没有 imatrix 会怎样权重能量回退机制iq2_xxs类型必须有重要性向量。如果没给--imatrix量化器会启用合成回退策略直接对反量化权重按列计算importance[column] sum(row[column]^2)权重能量启发式实现见 gguf-tools/deepseek4-quantize.c。它不如真实激活统计精确但足以让量化器获得稳定的列权重——项目最初可用的 2-bit GGUF 就是这么产出的。想严格保证每个张量都吃到 imatrix可加--imatrix-strict。质量验证用官方输出对比评分构建完成后用官方 API 输出作为标准答案给本地 GGUF 打分python3 gguf-tools/quality-testing/collect_official.py # 采集官方续写含 top-20 logprobs make -C gguf-tools quality-score # 构建评分器 gguf-tools/quality-testing/score_official 新模型.gguf data/manifest.tsv 结果.tsv 4096 python3 gguf-tools/quality-testing/compare_scores.py 旧.tsv 新.tsv真实效果参考来自项目实测记录Q2 Proimatrix 版相比无 imatrix 的临时版平均 NLL 降低8.8%API top-1 一致率从 88.75% 升到89.67%平均贪心前缀长度从 5.14 提升到7.76 tokenQ4 Flashimatrix 版 NLL 降低 1.95%100 例官方对比中 54 胜 46 负质量数据集与工具说明见 gguf-tools/quality-testing/README.md 和 gguf-tools/quality-testing/compare_scores.py。常用参数速查表 参数作用--experts TYPE设置路由 gate/up/down 专家类型如iq2_xxs、q8_K--routed-w2 TYPE单独覆盖 down 专家类型Q2 配方中为q2_k--attention-proj / --shared / --output TYPE覆盖注意力投影 / 共享专家 / 输出头类型--imatrix FILE传入ds4 --imatrix-out生成的.dat文件--imatrix-strict任一量化张量缺少 imatrix 向量即报错--compare-tensor NAME只重算一个张量并做字节比对写全盘前必用--threads N路由专家并行工作线程数默认 8--dry-run/--overwrite打印计划不写盘 / 允许覆盖已有输出小结整个流程可以概括为四步构建工具 → 生成校准集 → 用 ds4 收集 imatrix → 双配方出 Q2/Q4 GGUF。相比通用量化器DwarfStar 的优势在于imatrix 直接来自真实推理图、按专家切片应用重要性向量、并且有配套的质量评分闭环让每一步压缩都有据可依。动手前建议通读 gguf-tools/README.md并预留约 200 GB 的临时磁盘空间——大模型量化是一场需要耐心的离线长跑。【免费下载链接】ds4DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm项目地址: https://gitcode.com/GitHub_Trending/ds4/ds4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考