ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Xing4.0-29B-A4B国产算力训练全解:Ascend NPU与MindSpore深度优化

Xing4.0-29B-A4B国产算力训练全解:Ascend NPU与MindSpore深度优化 Xing4.0-29B-A4B国产算力训练全解Ascend NPU与MindSpore深度优化【免费下载链接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列原 TeleChat新一代模型。模型总参数量 29B激活参数仅 4B原生支持 256K 上下文可扩展至 512K是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。项目地址: https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列原 TeleChat新一代模型总参数 29B、每 token 仅激活 4B原生支持 256K 上下文可扩展至 512K。它是国内首个基于国产算力与国产框架完成训练的百亿参数大模型——全程运行在 Ascend 910C 集群上使用 MindSpore/MindFormers 框架训练并通过多层面深度优化将训练吞吐提升了约96%。本文带你看懂它的架构由什么组成、国产算力上做了哪些关键优化、性能到底有多强、以及拿到模型后如何快速用起来。规格速览29B总参数为什么只激活4BXing4.0-29B-A4B 采用 MoE混合专家结构每个 token 只激活 64 个路由专家中的 4 个外加 1 个共享专家因此总参数 29B、激活参数 4B——容量大、推理省。配置项数值总参数 / 激活参数29B / 4B层数40前 2 层为 Dense其余为 MoE隐藏维度3584路由专家 / 每 token 激活64 / 4注意力类型MLA多头潜在注意力上下文长度256K可扩展至 512K词表大小131072权重精度bfloat16具体数值可在 config.json 中逐一核对例如n_routed_experts: 64、num_experts_per_tok: 4、max_position_embeddings: 262144。mHC MLA MTP面向 Agent 的架构三件套这个模型为复杂工程任务深度优化核心是三项架构设计实现见 modeling_xing4_0.pymHC超连接残差每层维护 4 条并行信息流hc_mult4用 Sinkhorn 迭代20 次构造双随机组合矩阵让残差连接可学习、可组合长上下文中信息保持更稳定。对应实现 Xing4_0HyperConnection也是国产算力上开发融合算子的重点对象。MLA多头潜在注意力把 KV 压缩到低秩隐空间kv_lora_rank512显著降低长上下文的 KV 缓存显存是 256K 长文可用的关键。见 Xing4_0Attention。MTP多 Token 预测额外 1 个 next-n 预测层训练时多预测下一个 token加速推理并提升训练信号密度configuration_xing4_0.py 中num_nextn_predict_layers1。三者配合支撑多步规划、工具调用与长链条推理——这也是它被定位为Agent-Oriented面向智能体架构的原因。国产算力深度优化96%训练吞吐是怎么来的Xing4.0-29B-A4B 在 Ascend 910C 集群上用 MindSpore/MindFormers 训练并非直接跑通而是做了多级协同优化整体训练吞吐相比开箱即用的表现提升约 96%⚡MoE 细粒度通信优化MoE 训练最大的开销之一是专家间的 All-to-All 通信。模型对专家路由与专家计算做了细粒度切分与通信调度优化配置中ep_size支持专家并行切分让通信与计算充分重叠减少 910C 集群内片间等待。选择性重计算 DVM 自动图算子融合选择性重计算只对重算成本低于存储成本的算子启用激活重计算在显存与算力之间取得最优平衡DVM 自动图算子融合MindSpore 的 DVM 引擎自动把相邻小算子融合为大算子减少片上搬运与启动开销让 Ascend NPU 的执行图更密实。Ascend C 手写 mHC 融合算子框架自带的算子无法覆盖 mHC 这类新结构团队使用Ascend C 编程语言手写实现了 mHC 特征适配与融合算子把多流归一化、Sinkhorn 组合矩阵、加权求和合并为单次片上执行——这是 96% 吞吐提升中贡献最大的一环。基准实测复杂工程任务表现突出基准Xing4.0-29B-A4BGemma4-26B-A4BQwen3.6-35B-A3BSWE-bench Verified75.0053.0076.00Terminal-Bench 2.157.5030.0051.50DeepresearchBII60.8039.3059.70Claw-Eval76.5571.4974.54AIME202690.0088.3092.70SWE-bench Multilingual66.0051.0067.20可以看到它的优势集中在SWE-bench、Terminal-Bench、DeepresearchBII这类真实工程场景修 GitHub Issue、操作终端、深度检索——正是复杂工程任务优化目标的直接体现。快速上手推理部署与领域微调推理部署模型以 Hugging Face Transformers 格式发布41 个权重分片权重索引见 model.safetensors.index.json兼容 vLLM、SGLang、KTransformers 等主流推理框架并提供 OpenAI 兼容 API。推荐采样参数场景temperaturetop_prepetition_penalty复杂推理 / 通用任务1.00.951.05编码 / Agent 任务0.80.951.05领域微调支持 LLaMA-Factory 与 MindFormers 两条路径适合在意图分类、表格理解、合同审核、知识问答等垂直场景做轻量定制同时已针对 OpenCode、Claude Code、OpenClaw、Hermes 等 Agent 框架做了对话格式对齐对话模板见 chat_template.jinja默认参数见 generation_config.json。仓库关键文件指引README.md — 模型亮点、基准与快速上手config.json — 模型结构超参数configuration_xing4_0.py — 配置类定义含张量/流水线/专家并行切分计划modeling_xing4_0.py — 完整模型实现mHC、MLA、MoE 路由tokenization_xing4_0.py tokenizer.model — 分词器131072 词表chat_template.jinja — 支持思考模式与工具调用的对话模板小结Xing4.0-29B-A4B 的意义不只是又一个 MoE 大模型它证明了在 Ascend NPU MindSpore 的纯国产技术栈上完全可以训练出 256K 长上下文、对标国际同级模型的工程级大模型。从 MoE 通信优化、选择性重计算、DVM 图算子融合到 Ascend C 手写融合算子这套框架-算子-架构协同优化经验对国内 AI 基础设施落地具有直接的参考价值。如果你正在评估国产算力上的大模型训练或部署方案值得重点关注。【免费下载链接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列原 TeleChat新一代模型。模型总参数量 29B激活参数仅 4B原生支持 256K 上下文可扩展至 512K是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。项目地址: https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表