
ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search作者Jiyan He, Guang Liang, Hao Liu, Haoxiang Guan, Jinbo Sun, Junyi Guo, Wenjun Feng, Yantai Xie, Yifei Shen, Bin Shao, Chuyang Wei, Kai Chen, Kexin Zhou, Minghang Zhu, Shuxin Zheng, Tie-Yan Liu, Taine Zhao, Wenhui Zhu, Xueyin Xu, Xiaoqing Zhang, Yatao Li, Yuxuan Ren核心发表机构Zhongguancun Academy、Zhongguancun Institute of Artificial Intelligence论文链接arXiv:2609.13356v2发布于arXiv 预印本cs.AI|————————| Minimal processing | $\approx$2.08M | 72.64 | 74.12 | 58.49 | 72.63 | 73.78 | 55.03 | 67.78 || Broader filtering | $\approx$1.833M | 71.20 | 77.63 | 65.08 | 70.60 | 65.00 | 58.36 | 67.98 || Quality-focused filtering | $\approx$1.145M | 71.94 | 75.43 | 68.59 | 71.50 | 67.56 | 57.94 |68.83|三种处理分别是Minimal processing 仅做格式归一化与基本结构检查无 model-based quality filteringBroader filtering 移除分配为 review 或 deletion 的样本但保留广泛能力覆盖Quality-focused filtering 仅保留通过最严格质量、风格、能力检查的样本。质量优先版本比 minimal 少 44.9% 样本、比 broader 少 37.5% 样本但六基准均值从 67.78 / 67.98 提升到 68.83收益集中在推理BBH 10.10。这构成Finding 4Data Quality Trumps Volume in Posttraining。论文也诚实指出单个任务并非全部同向变化激进分层过滤的收益并不均匀——例如 MMLU 与 HumanEval 在质量优先配置下都低于 minimal只是总体均值更高。Thinking-to-Direct 迁移。这是一个观察性 checkpoint 比较论文明确说明它不是受控数据消融混合数据运行可能在 total training tokens、data composition、checkpoint history、optimization schedule 上不同baseline checkpoint 用 direct-response data 训练随后用 direct-response examples explicit reasoning trajectories 的混合数据重训两个 checkpoint 都在 no-think 模式下评估。BenchmarkBefore mixed SFTAfter mixed SFTChangeAIME 202510.0043.3333.33AIME 20246.6733.3326.66MBPP55.0375.9320.90BBH58.4969.4810.99LiveCodeBench v328.0034.316.31IFEval72.6478.005.36MMLU72.6370.03-2.60HumanEval73.7866.46-7.32最大增益出现在数学推理与代码生成AIME 2025 从 3/30 到 13/30AIME 2024 从 2/30 到 10/30说明 reasoning supervision 能把有用的问题解决行为迁移到 direct-response inference即使中间推理不可见但迁移是 task-dependent 而非普遍MMLU 与 HumanEval 出现下降。这构成Finding 7 的支撑证据之一中期训练建立的长上下文基础使仅用中等长度 SFT 数据就能在 256K 规模可靠地引出稳健推理与 agentic 行为从而有效绕过 post-training 期间昂贵的 256K 长推理轨迹需求。其他消融。256K 路线的 direct vs staged 对比30B 256K 得 loss 1.19 与 203 TFLOP/s/GPU10B 64K 20B 256K 得 loss 1.16 与 204 TFLOP/s/GPU显示分阶段路线最终 loss 略低且吞吐可比。系统层面的修复案例也值得记录恢复训练 job 后连续吞吐监控显示在约 80 步的匹配窗口内逐渐从 585 降至 554 model TFLOP/s/GPU释放 overlap buffers 减少了下降但未完全消除添加周期性 CUDA allocator cache clearing 与 garbage collection每 100 iterations 一次后恢复稳定吞吐到 585该修复已部署到生产训练循环。4.4 AI4AI 自主性评估 / AI4AI Autonomy Assessment论文用一组结构化评分回答“AI agents 能承担多少责任”这一问题。AI4AIAI for AI指使用 AI 系统构建、评估、改进其他 AI 系统。九位核心贡献者各自对 11 个任务类别按五级评分表评分共得到 99 个评分。评分表是序数均值小差异无意义L4/L5 的边界是自主目标形成——L4 是在人类定义目标内独立执行L5 还识别研究目标并跨阶段协调工作。LevelNameDefining criterionL1Basic AssistanceHumans direct and execute the workflow; AI assists with individual steps.L2Partial AutomationAI executes predefined workflows; humans specify procedures and handle exceptions.L3Conditional AutonomyAI adapts and manages routine workflows; consequential decisions require human approval.L4High AutonomyAI independently plans, executes, and iterates within human-defined objectives and constraints.L5Full AutonomyAI also identifies research objectives and coordinates sustained improvement across RD stages without routine human direction.上图给出逐任务的评分分布。团队按共识分配的任务级别是实验与监控、部署工程达到L4模型架构设计与学习算法设计处于L2且没有任何评分高于 L3其余七个任务为 L3。99 个评分中仅出现一个 L5没有任何任务被分配高于 L4。这些结果构成Finding 8AI Autonomy Is Task-Dependent——共享上下文、可复用技能和集成工具让 agents 能在有限人类干预下迭代但自主性在不同任务间并不均衡操作类任务比设计类任务有更大的自主执行空间。因此自主性更适合按任务描述而非作为整个工作流的单一成熟度指标。图注特别提示误差棒描述的是贡献者间变异而非置信区间垂直偏移仅为分离重合点、无定量意义0 是绘图基线而非评分类别。五、相关工作 / Related Work在开放性上本文与以 open-weight 形式发布的主流模型形成对比论文强调 fully open-source 不仅包含权重还包括上游过滤配方、mid-training 课程、长上下文调度、多轮 agent 轨迹、WB 日志与评测 harness。在架构上本文复用 Gemma 3 在生产规模上采用的5 : 1 5{:}15:1local-to-global 比例但额外引入局部输出的门控、QK RMSNorm 与 rotary fraction 0.33 的 Partial RoPE。论文用同一 10B-token / 4K 设定实测了三类替代方案MLA 吞吐 7,645 tokens/s/GPU 且无对应 loss 收益因此未采用线性注意力基线 GDN 3:1 在参数量级相近7.47B的前提下 256K KV cache 为 7.0 GiB大于本文 hybrid 的 5.0 GiB。在数据混合搜索上本文遵循 RegMix、OLMo 3 的代理模型实践但代理规模更小0.3B 参数、约 30B tokens在数学数据处理上参照 SmolLM2 的配方并采用 Proof-Pile-2 式的保公式归一化在课程预训练上本文区别于一般“按难度排序”的做法指出词汇复杂度只适用于通用语言对代码与数学无效并给出 7B 探针的 BPB 数字支撑。在上下文扩展上本文采用与 Qwen2.5-1M 相同的多阶段扩展思路区别于那些在最后一个预训练阶段一次性扩展上下文的开放技术报告在中期训练的 agentic 数据组织上本文遵循 agentic continual pre-training 的思路但把一般交互轨迹重构为 MDP-style state-conditioned next-action prediction。后训练方面SFT 数据包含 Tulu- 与 FLAN-derived 数据并混合内部蒸馏数据采用 GLM-5.1 structured-tool format 与 assistant-only lossRL 基于 GRPO 并叠加 reference-policy KL regularization、mild length penalty 与 dynamic sampling。Agentic 评测上WebDancer 作为 specialized research-agent baseline其余 web baseline 取自公开技术报告WebDancer 与 Binary Function Search baselines 在共享 harness 下评估。最重要的一条差异是对“规模假设”的挑战本文不以参数规模取胜而是主张紧凑模型通过“内部审慎推理 外部主动工具使用”克服参数容量上界并在数学推理与 agentic search 套件上与 Qwen3-235B-A22B、GLM-5.1、Claude 4 Sonnet、Kimi-K2 等数量级更大的系统保持竞争力。六、局限性与展望 / Limitations Future Work论文自陈的局限性有四条值得逐条认真对待。第一参数知识边界。审慎思考与外部搜索可以补偿许多事实遗漏但静态记忆容量根本上受限于 7.39B dense 规模。在纯闭卷、召回密集且无检索支持的任务上ZGCM-1 自然落后大规模前沿系统。这也解释了为什么论文对通用 benchmark 的定位始终是 “competitive” 而非领先。第二指令遵循与推理冗长的张力。ACE 与数据混合消融都揭示重度推理监督可导致冗长并轻微损害严格的非推理指令遵循如 IFEval 与复杂表面级约束若未持续校准。这与 Finding 5 相互印证——long CoT 监督的效用是非单调的。第三通用软件与终端 agency 尚处早期。模型在结构化 agentic 环境web 深度研究、二进制分析中表现出色但在更广泛的长时程仓库级工程如 SWE-bench Verified与非结构化 Linux 终端导航Terminal-Bench 2.0上仍面临陡峭挑战完成率适中。第四环境与协议脆弱性。Agentic 执行严重依赖严格 schema 对齐与稳定环境反馈极端观察噪声、工具调用格式偏差、外部搜索 API 延迟都可能破坏多步 rollout 轨迹。论文在 SFT 部分也明确指出 schema mismatch 会显著降低下游 agent 性能这与本局限互为呼应。此外论文在方法层面主动标注了若干解读限定读者在引用这些数字时应特别留意coding 课程收益“指示方向而非匹配的效应量”Pre-LN 的1.1 × 1.1\times1.1×是来自探索性 7B 证据的估计值而非受控实验4.2 × 4.2\times4.2×是四项因子相乘的粗略估计论文用的表述是 “roughly indicates”并非端到端实测课程排序使通用 benchmark 的 BPB 上升 0.03–0.09即通用能力确实付出了代价short-SFT probe 的最终 checkpoint 用了 3 个 SFT epochs 而之前用 2 个因此不是严格匹配的因果消融Thinking-to-Direct 是 observational checkpoint comparison 而非受控数据消融Web deep-research 的结果解释依赖 search date and availability、provider behavior、page extraction、summarization、judge settings、retry policy 等一系列外部条件架构选型实验仅在 10B tokens / seq 4096 / 8×H100 的小预算下完成且 4K–256K 的对比只报告了吞吐而未报告长上下文下的质量差异。同样需要指出的是本文并未给出损失函数的解析式只有 GatedSWA 的模块公式预训练与中期训练的损失表述均为“全序列因果语言建模目标”。未来方向有四个。扩展到稀疏 MoE 架构把 hybrid SWA、Muon 优化与 MDP 中期训练配方迁移到稀疏 Mixture-of-Experts 骨干允许扩大参数容量和领域特化同时保持低推理 FLOPs。端到端交互式 Agentic RL从 token-level SFT 与 outcome-based reasoning rewards 转向多轮、交互式强化学习直接在真实执行沙箱终端、web、编译器环境中进行。自主动态知识检索进一步统一预训练表示与即时自主检索使模型在检测到参数不确定性时动态触发搜索子程序。自演化 AI4AI RD 生态把 AI 原生 agent harness 从集群遥测、数据管理、原子评估扩展到自主假设形成、自动内核优化与闭环合成环境设计。七、总结 / ConclusionZGCM-1 是一个 7.39B 稠密、完全开源、从零训练的基础模型优化复杂数学推理与 agentic search支持 256K 上下文。它的核心论点是紧凑模型无法被动记忆开放网络但可以通过耦合审慎内部推理与主动外部工具使用来克服固有的参数容量限制——这一论点挑战了“前沿推理严格需要数百亿至千亿参数”的假设。为在可及的学术算力上实现这一愿景论文开发了一套端到端高效的开源配方包含三条主线。系统与架构协同设计门控滑窗注意力与全局注意力按5 : 1 5{:}15:1交错256K 下获得3.94 × 3.94\times3.94×吞吐加速与6.4 × 6.4\times6.4×KV-cache 缩减配合 FP8 精度、Muon 优化器与 TWEO 离群抑制管线相对标准 BF16/AdamW 基线实现约4.2 × 4.2\times4.2×预训练 time-to-loss 加速。渐进课程与 MDP 中期训练跨 600B tokens 逐步把上下文从 16K 扩展到 64K 再到 256K并用 MDP 状态-动作建模向原始预训练注入密集的逐步决策监督。校准后训练与 AI 原生研发以严格分层数据剪枝与统一 think/no-think 协同训练从中等长度 SFT 数据引出稳健推理与直接响应效率辅以混合 RL 阶段在数学与代码等单域任务上取得增益自主 AI 原生多 agent 工作流大幅压缩迭代周期。评测层面ZGCM-1-7B 在 sub-10B 模型中达到有竞争力乃至 SOTA 的水平AIME 2026 为 75.0%、WebWalkerQA 为 63.1%、Binary Function Search 为 62.0%并在这些挑战性套件上与数量级更大的模型并驾齐驱。配套的开源范围覆盖预训练、中期训练、后训练三阶段的模型权重、中间训练检查点、数据配方、遥测日志与评估套件。论文最后重申其目标是为算力受限的研究者提供一条可复现、可审计、可继续推进的紧凑模型训练路径——而八条经验发现课程排序的边界、TWEO 使 FP8 可行、效率提升的因子分解、SFT 质量胜于数量、long CoT 的非单调性、通用数据对 agent 训练的必要性、长中期训练替代超长 SFT、AI 自主性的任务依赖性既是这条路径的产品也是它面向社区的主要交付物。原文摘要:In this work, we present ZGCM-1, a fully open 7B dense foundation model trained from scratch with extreme data, system, and algorithmic efficiency. ZGCM-1 is founded on a core premise: compact models cannot passively memorize the open web, but can overcome parametric capacity limits by coupling deliberate internal thinking with active external tool use. To support this paradigm across a 256K context, we develop an end-to-end, high-efficiency open training recipe: Architecture System Co-design: interleaved gated sliding-window and full attention, and a stable FP8 Muon optimizer; Progressive Curriculum MDP Mid-Training: context scaling across 16K, 64K, and 256K, and the reformulation of interaction traces into Markov Decision Processes. Furthermore, we establish an AI-native RD workflow where agent swarms autonomously manage cluster operations, data curation, and rapid diagnostic evaluation. Extensive evaluations show that ZGCM-1-7B is competitive across 7B model family on general benchmarks. On several challenging mathematical reasoning and agentic search suites, it remains competitive with frontier models orders of magnitude larger, such as Qwen3-235B-A22B and GLM-5.1. We also show that our pre-training design offers a ~4.2x efficiency improvement in 16K pre-training time-to-loss. Across the full development lifecycle, we distill eight actionable empirical findings-spanning architectural scaling, SFT quality pruning, long-context generalization, and agentic co-training dynamics. To facilitate community research, we open-source model weights from the pre-training, mid-training, and post-training stages, intermediate checkpoints, training code, per-stage data and data recipes, and WB logs.PDF链接:https://arxiv.org/pdf/2609.13356v2部分平台可能图片显示异常请以我的博客内容为准