ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

llmfit bench 实测指南:4 条提示词、3 轮推理,测出硬件真实 tok/s

llmfit bench 实测指南:4 条提示词、3 轮推理,测出硬件真实 tok/s llmfit bench 实测指南4 条提示词、3 轮推理测出硬件真实 tok/s【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfitllmfit 是一款用一条命令把数百个本地大模型和你的硬件对号的开源工具。它的 bench 子命令会对正在运行的推理服务做基准测试输出真实的 tok/s、首 token 延迟与总延迟。读完全文你能直接抄走一套可复现的实测命令。先讲清楚它测什么 ⚡bench的输出围绕三个指标tok/sTPS每秒生成的 token 数衡量解码速度。llmfit 发送4 条不同长度与类型的真实提示词跑3 轮正式推理外加1 次不计分的热身Say hello.汇总时给出平均/最小/最大三档TTFT首 token 延迟。Ollama 直接读取响应里的eval_duration精度到毫秒vLLM、MLX 走 OpenAI 兼容端点、用非流式请求目前只能给出总延迟TTFT 显示 n/a总延迟整条请求的墙钟耗时。完整的提示词选择与统计逻辑在 llmfit-core/src/bench.rs 里想核对细节可以直接看源码。环境与后端安装 llmfit任选其一macOS / Linux# 官方安装脚本 curl -fsSL https://llmfit.axjns.dev/install.sh | sh # 或用 uv uv tool install -U llmfit起一个活的推理服务bench 测的是真实请求所以必须先有服务在跑。以 llama.cpp 为例llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99终端出现model loaded/listening on http://127.0.0.1:8080即就绪。回到 llmfit 会自动发现该后端和它加载的模型无需任何配置。各后端默认地址如下环境变量可覆盖见 docs/providers.md后端默认地址识别方式Ollamalocalhost:11434Ollama 原生 APIvLLMlocalhost:8000OpenAI 兼容端点靠/v1/models的owned_by区分llama-serverlocalhost:8080通过/props端点精确识别MLXlocalhost:8080OpenAI 兼容端点执行与参数三种常见跑法各一条命令# 单模型自动发现后端和模型跑 3 轮实测 llmfit bench # 批量把发现的所有模型全部测一遍 llmfit bench --all # 预览只打印要提交的 JSON不触网、不建 PR llmfit bench --all --share --dry-run单模型跑完会直接打印汇总 Benchmark Results Model: Qwen3.5-0.8B-Q8_0.gguf Provider: llamacpp TPS: 31.5 avg (30.1 min / 33.0 max) TTFT: 95 ms avg Latency: 2050 ms avgTUI 用户有更快的路径在终端界面里选中一个已安装模型按b会先弹出Benchmark this model提示按Enter开始实测按Esc可转后台。全部参数说明见 docs/cli.md。结果去哪了 本地先行。每次 bench 结束都会先写入本地存档Linux 在~/.local/share/llmfit/benchmarks/pending/可用LLMFIT_BENCH_STORE改位置不分享数据也不会丢。本地结果立刻产生两个效果TUI 排行榜顶部出现you (local)行该模型的tok/s 实测值替换掉理论估算可信度达标的实测≥ 1B 参数、dense 模型会反向校准同硬件上其他模型的估算公式——测一个准一片。社区回流。加--share后llmfit 自动 fork 仓库、提交结果文件并开 PR不需要ghCLI认证走 GitHub 设备码流程浏览器里批准一次token 缓存到~/.config/llmfit/也可以直接设GITHUB_TOKEN跳过交互。之前没上传的本地积压单独跑llmfit bench --share即可批量补交。被合并的数据打进下一版二进制同硬件用户开箱就能看到带✓的校准值。完整四步流程下载→部署→实测→分享见 docs/benchmarking.md。避坑清单报 No inference provider foundbench 需要活的服务。先确认 Ollama / vLLM / MLX / llama-server 有一个在运行且模型已加载再重试。vLLM、MLX 的 TTFT 显示 n/a这是已知限制不是故障——非流式请求测不到首 token 时刻看总延迟即可要精确 TTFT 用 Ollama 或 llama.cpp。换过硬件后旧数据不准不用担心记录在不同 CPU/GPU 配置上的历史运行会被自动忽略不会混入当前估算。--share卡在认证token 缺失或过期会在开测前就快速失败这是有意设计避免测完几分钟才发现没权限CI 场景直接注入GITHUB_TOKEN/GH_TOKEN。端口冲突llama-server 和 MLX 默认都占 8080vLLM 占 8000。多后端共存时用LLAMA_SERVER_HOST、MLX_LM_HOST、VLLM_HOST显式指向各自地址。三句话带走估算回答能不能跑llmfit bench回答跑多快——4 条提示词、3 轮推理、1 次热身数据可复现。四大后端自动探测、模型自动发现一条llmfit bench就能出数。结果先落本地反哺估算校准--share再把真实 tok/s 贡献给社区。【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表