
NeoHorse-1-4B 长上下文实战262K 原生、可扩展 1M 的推理参数配置避坑指南【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4BNeoHorse-1-4B 是 TokenRhythm 基于 Qwen3.5-4B 后训练的 4B 参数长上下文推理模型原生支持 262,144约 262Ktoken 上下文窗口官方标注最长可扩展至约 1,010,000 token。它采用混合线性注意力架构与 BF16 权重格式专为智能体任务、工具调用和长文本推理设计。本文将从部署参数出发带你一次配齐长上下文推理并附上高频踩坑清单。NeoHorse-1-4B 是什么为什么它能装下262K 上下文NeoHorse-1-4B 不是普通的 4B 小模型而是一个Agent-Native 因果语言模型它由 TokenRhythm 通过路由引导的智能体后训练routing-guided agentic post-training改造而来在十个基准上的宏平均得分 64.87比基座 Qwen3.5-4B 的 58.94 高出5.93详见 README.md 中的评测表。长上下文能力的底气来自 config.json 里的两处设计关键配置取值作用max_position_embeddings262144原生上下文上限即 262K tokenlayer_types32 层中每 4 层一组linear_attention×3 full_attention×1混合线性注意力绝大多数层用低成本线性注意力KV 缓存占用大幅降低rope_theta10000000超大旋转位置编码基频为向 1M token 扩展预留外推空间num_key_value_heads4注意力头 16GQA 分组查询注意力进一步压缩长序列显存dtypebfloat16BF16 权重约 8GB 即可载入 4B 权重简单说全注意力层稀疏化 大 rope 基频 GQA让它在 4B 规模上就能扛住 262K 原生上下文并具备向 1M 扩展的架构条件。⚠️ 注意本次发布为纯文本模型语言模型权重重新打包不包含视觉权重。发送图片请求会导致模板报错chat_template.jinja 中明确抛出异常请只走文本输入输出。SGLang 启动 NeoHorse-1-4B长上下文参数一次配齐技术报告使用 SGLang v0.5.17推荐启动命令如下pip install sglang0.5.17 MODEL_PATH/path/to/NeoHorse-1-4B python3 -m sglang.launch_server \ --model-path $MODEL_PATH \ --served-model-name neohorse-1-4b \ --host 0.0.0.0 \ --port 30000 \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder三个参数的含义缺一不可--context-length 262144与 config.json 的max_position_embeddings严格对齐。这是长上下文推理的第一参数设小了会被静默截断设得远超原生值则未经官方验证。--reasoning-parser qwen3模型开启思考模式enable_thinking需要推理解析器把think.../think内容从正式回复中拆出来否则前端会拿到混在一起的输出。--tool-call-parser qwen3_coder配合智能体后训练让工具调用以结构化格式返回而不是纯文本。服务启动后通过 OpenAI 兼容接口发请求即可注意model字段填--served-model-name指定的neohorse-1-4b不是文件路径curl http://localhost:30000/v1/chat/completions \ -H Content-Type: application/json \ -d {model:neohorse-1-4b,messages:[{role:user,content:你好请介绍你的上下文长度}],max_tokens:512}vLLM 部署 NeoHorse-1-4B--max-model-len写法如果你更习惯 vLLM参数对应关系如下pip install -U vllm MODEL_PATH/path/to/NeoHorse-1-4B vllm serve $MODEL_PATH \ --served-model-name neohorse-1-4b \ --host 0.0.0.0 \ --port 8000 \ --max-model-len 262144 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder要点--max-model-len 262144对应 SGLang 的--context-lengthvLLM 用户最常漏的就是这个参数——不显式设置时可能回落到框架默认值往往只有 32K8K长文档直接报错或截断。工具调用需要成对配置--enable-auto-tool-choice--tool-call-parser qwen3_coder只配一半会导致工具调用不生效。默认端口 8000与 SGLang 的 30000 区分开避免多框架共存时请求串端口。长上下文 6 大高频踩坑清单坑现象正确做法上下文参数没对齐长文档被截断、报prompt 超长显式设置--context-length/--max-model-len为262144直接拉满 1M显存暴涨甚至 OOM且超出官方验证范围1M 为可扩展上限先按 262K 运行再按实际显存逐步上调并自行验证效果输入 输出超限生成中途被硬停预留余量输入 token max_tokens ≤ context-length忘配推理解析器思考内容混进正式回答加--reasoning-parser qwen3忘配工具解析器工具调用变成纯文本加--tool-call-parser qwen3_codervLLM 再配--enable-auto-tool-choice请求模型名写错404 / model not foundmodel填neohorse-1-4b即--served-model-name不是路径官方采样参数一键复现报告协议想要复现 README.md 中的评测成绩SGLang v0.5.17、思考模式开启采样参数照抄即可temperature1.0, top_p0.95, top_k20, min_p0.0, presence_penalty1.5, repetition_penalty1.0, enable_thinkingtrue, force_nonempty_contenttrue注意presence_penalty1.5这个偏高的取值——长上下文推理中它能有效抑制长回复里的重复循环是复现成绩时容易被忽略的一项。模型文件清单与许可文件说明config.json模型结构与长上下文核心配置model-00001-of-00002.safetensors、model-00002-of-00002.safetensorsBF16 权重分片model.safetensors.index.json权重索引tokenizer.json、vocab.json、merges.txt分词器词表 248,320chat_template.jinja对话模板内置思考与工具调用格式LICENSEApache-2.0 许可小结NeoHorse-1-4B 用混合线性注意力 大 rope 基频 GQA实现 4B 规模的 262K 原生上下文架构上预留至 1M 的扩展空间。部署时三件套上下文长度对齐 262144、推理解析器qwen3、工具解析器qwen3_coder。长上下文 长记忆 长工具链把它接入智能体框架时记得为max_tokens预留输出余量。配置一次到位长上下文推理从此不踩坑 【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考