ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

什么是递归自我改进(RSI)?NeoHorse-1-4B 如何搭建「自我进化」Agent 原型

什么是递归自我改进(RSI)?NeoHorse-1-4B 如何搭建「自我进化」Agent 原型 什么是递归自我改进RSINeoHorse-1-4B 如何搭建「自我进化」Agent 原型【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4BNeoHorse-1-4B 是一个约 4B 参数的因果语言模型由 TokenRhythm 基于 Qwen3.5-4B 后训练而来定位为迈向**递归自我改进Recursive Self-ImprovementRSI**的初始原型。它专为文本 Agent 框架Agent harness、工具调用、编码和指令遵循而优化通过「路由框架 能力级反馈」的闭环让模型评测结果直接驱动下一轮训练数据配比。一、先用大白话理解什么是递归自我改进RSI递归自我改进RSI指的是一个智能系统把自己的运行记录、评测反馈转化回自己的训练信号从而越用越强的机制。与传统训练人工标注数据 → 训练 → 结束不同RSI 追求的是一个闭环执行任务 → 记录轨迹与结果 → 评估能力短板 → 调整训练数据 → 更新模型 → 再次回到执行可以把它想象成模型自己给自己出卷、判卷、补课环节传统流程RSI 思路数据来源人工准备、固定来自模型自身执行轨迹评估方式一次性打分持续反馈驱动数据配比迭代方式人工介入模型更新后自动回到框架NeoHorse-1-4B 目前是一个原型它已经打通了评测 → 选择 → 更新的单轮闭环下一步目标是把闭环扩展到连续多轮迭代。二、NeoHorse-1-4B 是什么一句话概括NeoHorse-1-4B 是为Agent 场景工具调用 长上下文执行做后训练的小模型用 4B 的体量验证自我进化路线。核心参数一览详见 config.json属性说明模型类型Agent 原生因果语言模型纯文本输入/输出参数量约 4B基座模型Qwen3.5-4B后训练自该基座上下文长度原生 262,144 tokens可扩展至约 101 万 tokens权重格式Safetensors / BF16注意力结构线性注意力与全注意力混合32 层每 4 层一组值得注意的细节config.json 中layer_types显示它采用 3:1 的「线性注意力 : 全注意力」混合层设计——线性注意力让长上下文推理更省资源这正好服务 Agent 场景下的超长轨迹处理。三、它如何搭建「自我进化」闭环NeoHorse 的 RSI 原型由三块拼图组成3.1 路由框架Routing Harness给任务分诊路由框架像一位调度员维护一个异构模型池分派任务把不同难度的 Agent 任务路由给模型池中合适的成员记录轨迹完整记录工具交互过程与最终结果评估需求估算当前任务分布对各项能力的需求驱动训练用能力级反馈决定下一轮训练混合数据的配比。3.2 训练信号来自执行轨迹而不是凭空生成配套研究探索了两种后训练方法路由引导的课表式 SFTrouting-guided curriculum SFT按能力需求排课程先补短板路由引导的在线策略蒸馏on-policy distillation让模型在自己的执行轨迹上学习同时保留每条回复周围的执行上下文与框架上下文——这是 Agent 能力的关键。3.3 数据质量是闭环可信的前提 再自我的训练也建立在干净数据之上。项目对训练数据做了精确与近重复样本去重评测集去污染结构化校验 六维语义评估子场景级Scene / Goal / Outcome三级标注。闭环效果更新后的模型可以重新进入路由框架执行任务形成「评测 → 选择 → 更新」原型回路把这个回路在多轮次间滚动就是通往完整 RSI 的下一步。四、成绩单10 项基准平均分 64.87提升 5.93 NeoHorse-1-4B 与五款开源模型横向对比摘自 README.md 评测表Δ为相对 Qwen3.5-4B 的提升能力维度基准Qwen3.5-4BNeoHorse-1-4BΔ AgenticQwenClawBench38.4744.686.21 AgenticWorkBuddy Bench24.6234.419.79 AgenticPinchBench71.1977.336.14 AgenticVitaBench21.5032.0010.50 Agentictau2-Bench84.2988.464.17 CodingHumanEval87.2096.959.75 CodingLiveCodeBench v653.7159.435.72 指令遵循IFBench60.3365.335.00 指令遵循IFEval87.0688.351.29 总分十基准宏平均58.9464.875.93可以看到提升最集中的正是Agentic 与 Coding维度——与为 Agent 而生的定位完全一致。评测协议采用 SGLang v0.5.17开启思考模式enable_thinkingtrue部分基准取三次运行结果保证数据稳健。五、本地部署指南两步跑起来 NeoHorse-1-4B 5.1 获取模型权重git clone https://gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B5.2 用 SGLang 启动官方推荐pip install sglang0.5.17 python3 -m sglang.launch_server \ --model-path /path/to/NeoHorse-1-4B \ --served-model-name neohorse-1-4b \ --host 0.0.0.0 \ --port 30000 \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder启动后通过 OpenAI 兼容接口调用即可curl http://localhost:30000/v1/chat/completions \ -H Content-Type: application/json \ -d {model:neohorse-1-4b,messages:[{role:user,content:你好介绍一下你自己}],max_tokens:512} 小提示若显存紧张调小--context-lengthvLLM 用户可改用vllm serve并开启--enable-auto-tool-choice --tool-call-parser qwen3_coder参数细节见 README.md。六、仓库文件速览下载后都能用上什么文件作用README.md模型卡亮点、评测、部署指南都在这里config.json模型结构配置层数、注意力类型、上下文长度等chat_template.jinja对话模板定义系统/用户消息与思考块的拼装方式tokenizer.json / vocab.json / merges.txt分词器三件套词表 248,320model.safetensors.index.json权重分片索引model-00001-of-00002.safetensors / model-00002-of-00002.safetensors模型权重BF16两个分片LICENSEApache 2.0 许可证含上游 Qwen 版权声明七、写在最后为什么值得关注✨NeoHorse-1-4B 的价值不在于4B 模型又多了一个而在于它给出了一个可复现的 RSI 原型路由框架记录执行轨迹、能力级反馈决定训练配比、更新模型回到框架继续执行——闭环的每一环都是工程上可落地的。对于想理解「自我进化 Agent」如何从概念走向实践的新手来说这个项目提供了一份从数据质量、后训练方法到评测协议的完整参照。下一步把「评测 → 选择 → 更新」的闭环滚动到连续多轮迭代才是递归自我改进真正的考验。关注该项目见证 RSI 路线的持续演进。【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表