ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

NeoHorse-1-9B技术报告解读:Routing Harness三步构建递归自我改进闭环

NeoHorse-1-9B技术报告解读:Routing Harness三步构建递归自我改进闭环 NeoHorse-1-9B技术报告解读Routing Harness三步构建递归自我改进闭环【免费下载链接】NeoHorse-1-9B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9BNeoHorse-1-9B 是 TokenRhythm 开源的 9B 智能体语言模型也是通往递归自我改进RSI的初始原型。它基于 Qwen3.5-9B 后训练通过路由框架Routing Harness将任务分派给异构模型池把工具交互与执行轨迹转化为训练信号形成评估—选择—更新的自改进闭环在十项基准上取得 69.04 的宏观均分。一、NeoHorse-1-9B 是什么面向智能体后训练的 9B 模型NeoHorse-1-9B 可以理解为为智能体Agent而生的聊天模型。与传统只擅长对话的模型不同它面向文本智能体框架Agent Harness、工具调用Tool Use、编程Coding和指令遵循做了专门的后训练强化。核心属性说明参数规模约 9B基座模型Qwen3.5-9Bfinetune 关系后训练方式路由引导的智能体后训练上下文长度原生 262,144 tokens可外推至约 1,010,000 tokens架构Qwen3_5ForCausalLM32 层线性注意力 全注意力混合权重格式Safetensors / BF16仅语言模型权重重打包为纯文本推理几个值得注意的技术点详见 config.json混合注意力结构32 层中按3 层线性注意力 1 层全注意力的节律排布full_attention_interval: 4在长上下文场景下兼顾效率与效果。长上下文基因max_position_embeddings为 262,144配合 RoPE 外推能力支撑智能体场景中的超长轨迹记忆。纯文本重打包本次发布仅包含语言模型权重视觉权重未打包配置与张量键名有调整但微调张量数值不变见 config.json 的modification_notice。它最重要的身份标签不是9B而是 README.md 中强调的第一条 Highlight——通往递归自我改进RSI的路径原型。这也是理解整份技术报告的主线。二、Routing Harness 工作机制路由、记录、估算、塑形Routing Harness路由框架是 NeoHorse 技术报告的核心概念。把它想象成一个任务分发调度中心 数据工厂任务分派Routing把进入系统的任务分配给一个异构模型池能力各异的多个模型而不是让单一模型硬扛所有任务。轨迹记录Recording框架完整记录每个任务的工具交互与执行结果即模型做了什么、工具返回了什么、任务成败如何。能力需求估算Demand Estimation根据任务分布与执行表现估算当前系统对各类能力的需求强度例如工具调用多、推理链长。反馈塑形Mixture Shaping用能力层面的反馈来塑造下一轮的训练数据配比——哪类能力薄弱、哪类任务高频就针对性地增加该类训练样本。配合两条研究路线执行轨迹被直接转化为训练信号见 README.md路由引导的课程式 SFT按能力需求逐步安排训练课程先补短板再拔高。路由引导的在策略蒸馏on-policy distillation蒸馏过程中保留每条响应周围的执行与框架上下文让模型学到的不只是答案而是在智能体执行现场如何做决策。三、评估—选择—更新递归自我改进闭环如何运转这是整份技术报告最有想象力的部分也是递归自我改进五字的落点。闭环包含三个环节评估Evaluation→ 选择Selection→ 更新Update→ 回到评估 …评估更新后的模型回到 Routing Harness 中接受真实任务池的检验框架产出能力层面的表现数据选择根据评估结果从模型池中选择最优候选或决定训练数据该往哪个方向倾斜更新用能力级反馈塑造新的训练配比产出新一代模型权重递归新模型回到框架中再跑一轮循环往复。NeoHorse-1-9B 是目前已发布的闭环原型单轮循环已经跑通——模型更新后可以回到框架重新参与评估与选择。官方明确指出把这个循环扩展到连续多次迭代才是下一步通往 RSI 的目标。换言之这次发布相当于交出了闭环第一圈的完整工程验证。四、数据工程六维语义评估与场景级标注后训练的天花板由数据质量决定。NeoHorse 的数据管线在 README.md 中给出了四层工序层层过滤数据工序作用精确/近重复去重消除重复样本避免训练信号被冗余数据稀释评估去污decontamination剔除与基准测试集重合的数据保证分数真实可信结构化校验保证智能体轨迹在格式上合法可用六维语义评估从六个语义维度对样本质量打分筛选此外还引入了子场景级的 Scene/Goal/Outcome场景/目标/结果标注每条数据不再只是一问一答而是被拆解到子场景粒度标注清楚处于什么场景、目标是什么、结果如何。这种细粒度标注正是 Routing Harness 做能力级反馈的数据基础——只有知道每条轨迹属于哪类能力场景才能精确地塑形下一轮训练配比。五、基准成绩速览十项平均 69.04较基座 3.449B 档位对比了五个代表性开源模型Granite-4.2-8B、Qwen3.5-9B、Ornith-1.5-9B、Gemma-4-12B-it、Muse-Glimmer-30B覆盖智能体、编程、指令遵循三大能力组完整表格见 README.md。基准能力组NeoHorse-1-9BQwen3.5-9BΔQwenClawBenchAgentic48.73第 144.044.69WorkBuddy BenchAgentic40.15第 239.600.55PinchBenchAgentic82.25第 174.557.70VitaBenchAgentic42.25第 231.2511.00BFCL v4Agentic67.43第 164.882.55tau2-BenchAgentic90.82第 188.042.78HumanEvalCoding98.17并列第 292.685.49LiveCodeBench v6Coding65.1465.140.00IFBench指令遵循66.3366.330.00IFEval指令遵循89.0989.46-0.37十项平均69.04第 165.603.44几个可以读出来的结论智能体能力是最大增量来源六个 Agentic 基准中有四个拿下第 1VitaBench 单项提升高达 11.00说明路由引导后训练把执行现场决策这一核心能力显著拉了起来编程能力稳中有升HumanEval 上从 92.68 追至 98.175.49指令遵循基本持平IFEval 微降 0.37属于合理的能力再分配——后训练把更多容量投向了智能体执行能力。评测协议保证数字可复现见 README.mdSGLang v0.5.17temperature1.0、top_p0.95、top_k20、presence_penalty1.5开启思考模式enable_thinkingtrueQwenClawBench、WorkBuddy Bench、tau2-Bench 各跑三遍取均值。六、本地部署步骤SGLang 或 vLLM 一键起服务NeoHorse-1-9B 提供 OpenAI 兼容接口两种主流推理引擎都支持。本地部署时把MODEL_PATH指向包含 config.json、分词器文件与模型权重的目录即可。SGLang 方式与技术报告保持一致的版本pip install sglang0.5.17 python3 -m sglang.launch_server \ --model-path $MODEL_PATH \ --served-model-name neohorse-1-9b \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_codervLLM 方式vllm serve $MODEL_PATH \ --served-model-name neohorse-1-9b \ --max-model-len 262144 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder服务启动后向/v1/chat/completions发送标准请求即可调用。两个细节别漏--reasoning-parser qwen3用于解析模型开启的思考内容--tool-call-parser qwen3_coder用于解析工具调用这是智能体场景的刚需完整示例见 README.md。 实际可用的上下文长度取决于 GPU 显存与推理配置显存不足时调低--context-length即可。如需完整拉取仓库进行本地验证git clone https://gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9B七、仓库文件导览文件说明config.json模型架构配置混合注意力、262,144 上下文、修改声明chat_template.jinja对话模板含思考块与工具调用格式tokenizer.json / vocab.json / merges.txt分词器词表与合并规则model-00001-of-00004.safetensors 等 4 个分片BF16 语言模型权重约 9B 参数model.safetensors.index.json张量索引与修改声明9B_head_fig.jpg评估结果主图LICENSEApache License 2.0保留上游 Qwen3.5-9B 版权声明结语为什么这个 9B 模型值得追NeoHorse-1-9B 的意义远超一次普通的模型微调它用 Routing Harness 把模型执行任务 → 框架收集证据 → 反馈决定下一轮训练做成了可运转的工程闭环并跑通了第一圈递归。十项基准 69.04 的宏观均分3.44证明这条数据路径切实有效而更新后的模型回到框架继续循环才是真正指向递归自我改进的部分。对关注智能体后训练与 RSI 方向的读者这个项目值得持续跟踪。引用信息arXiv: 2609.08183完整格式见 README.mdmisc{neohorse2026, title {NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness}, author {NeoHorse Team}, year {2026}, eprint {2609.08183}, archivePrefix {arXiv}, primaryClass {cs.CL} }【免费下载链接】NeoHorse-1-9B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表