ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

4GB 显存跑通 Qwen1.5-4B:llama.cpp 本地部署实测笔记

4GB 显存跑通 Qwen1.5-4B:llama.cpp 本地部署实测笔记 4GB 显存跑通 Qwen1.5-4Bllama.cpp 本地部署实测笔记【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5想在 4GB 显存的笔记本上跑 Qwen1.5-4B一启动就报显存溢出关键就在量化档位和 CPU-GPU 分层这两处。这篇实测笔记记录了在 4GB 显存机器上把 Qwen1.5-4B 本地推理真正跑起来的全过程参数都可直接复制。先看运行效果4GB 显存下的对话与代码生成下图是 Qwen1.5-4B 在优化后环境里的真实演示界面用户问生命的意义是什么用代码解释模型直接给出逻辑清晰的 Python 代码。也就是说量化后日常对话和代码场景的响应质量并没有明显缩水。这个效果不是硬件碰运气而是一套固定配置调出来的。先把内存账算明白后面的每一步才有的放矢。先算内存账4B 模型为什么要量化4B 参数的模型bf16 精度下光权重就要约 8GB4GB 显卡连加载的余地都没有。量化把权重压成更低的位宽其中 Q4_K_M 是 llama.cpp 的混合量化预设大部分层压到 4-bit敏感层保留更高精度所以质量损失很小。实测参考如下量化档位权重文件估算显存占用4GB 卡可用性BF16约 8GB超 8GB装不下Q8_0约 4.4GB约 5GB溢出Q5_K_M约 3.1GB约 4GB勉强Q4_K_M约 2.6GB约 3.2GB舒适注意显存占用 权重 KV 缓存而上下文长度-c直接决定缓存大小。所以 4GB 卡选 Q4_K_M 配 2048 上下文是最舒服的组合想硬塞 Q5_K_M就得把上下文压到 1024。量化背景可以看官方文档里的llama.cpp 量化指南。编译 llama.cpp 并转换模型为 Q4_K_M这一步做两件事拿到 llama.cpp 程序把原始模型变成量化后的 GGUF。先编译程序在 llama.cpp 源码目录内执行需要 gcc 和 cmakecmake -B build cmake --build build --config Release -j 4编译完成后build/bin/下会出现llama-cli、llama-server、llama-quantize等可执行文件。接着下载 Qwen1.5-4B-Chat 原始权重转成 GGUF 再量化一次。官方仓库的 docs/source/run_locally/llama.cpp.md 里有完整的本地运行教程遇到卡点可以对照查huggingface-cli download Qwen/Qwen1.5-4B-Chat --local-dir ./models python convert-hf-to-gguf.py ./models/Qwen1.5-4B-Chat \ --outtype f16 --outfile qwen1.5-4b-f16.gguf ./build/bin/llama-quantize qwen1.5-4b-f16.gguf qwen1.5-4b-q4_k_m.gguf Q4_K_M最终产物qwen1.5-4b-q4_k_m.gguf约 2.6GB嫌麻烦的话Qwen 官方组织已提供现成的量化 GGUF直接下载即可。选对 llama-cli 启动参数-ngl 与上下文长度4GB 卡上别把所有层都压给 GPU。-ngl控制多少层放显存剩下的走 CPU建议从 24 层起步./build/bin/llama-cli -m qwen1.5-4b-q4_k_m.gguf \ -c 2048 -ngl 24 -t 4 \ --temp 0.7 --top-p 0.9 --color -i启动后进入交互对话模式CtrlC可随时停止生成或退出。遇到卡点就照这张表调 都是实测有效的改法现象调整参数效果启动即 OOM-ngl 16显存降约 30%生成太慢-t 8CPU 部分提速约 40%输出重复啰嗦--presence-penalty 1.0输出更稳定-t跟 CPU 核心数挂钩笔记本给 4、台式机给 8纯 CPU 推理时这个线程数基本就是速度上限。用 llama-server 把模型暴露到浏览器团队共用时直接起 Web 服务命令和上面只差几处./build/bin/llama-server -m qwen1.5-4b-q4_k_m.gguf \ -c 2048 -ngl 24 --host 0.0.0.0 --port 8080浏览器打开http://localhost:8080就是对话页面/v1/路径下还有 OpenAI 兼容 API能直接接进现有应用。优化后 4GB 环境的典型表现首次加载 3-5 秒生成速度 5-8 tokens/秒混合推理下连续对话无需重复加载后续轮次更快。这套配置适合三类人想在笔记本本地试 LLM 的开发者用有限显存做推理调参实验的学生需要模型常驻的边缘设备场景。你现在就能做的最小动作把上面llama-cli那段命令原样跑起来一分钟后就有自己的 Qwen1.5-4B。硬件门槛降一寸真正跑得起模型的人就多一片这就是量化这件事的价值。【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表