华为昇腾训练星辰Xing4.0大模型发布
华为中国官方宣布,基于昇腾Atlas 900 A3 SuperPoD液冷超节点与昇思MindSpore框架训练的星辰轻量级代码智能体大模型Xing4.0-29B-A4B正式发布。该模型由中电信人工智能科技有限公司推出,总参数29B,激活参数4B,是国内首个基于昇腾超节点完成训练的百亿参数大模型。
驱动中国9月20日消息,华为中国官方宣布,基于昇腾Atlas 900 A3 SuperPoD液冷超节点与昇思MindSpore框架训练的星辰轻量级代码智能体大模型Xing4.0-29B-A4B正式发布。该模型由中电信人工智能科技有限公司于9月17日推出,总参数为29B,激活参数为4B,是国内首个基于昇腾超节点完成训练的百亿参数大模型。
据华为中国官方介绍,Xing4.0-29B-A4B面向复杂工程任务进行了深度优化,聚焦复杂任务理解、任务规划、工具调用和自主执行等能力,支持长上下文处理,可应用于代码开发、数据分析、办公自动化及生活服务等场景。该模型采用新一代架构设计,进一步提升长程任务处理和多步骤执行能力,能够根据用户提出的目标自主规划任务路径、调用工具并完成复杂任务。
华为中国官方表示,模型的中高阶代码生成与智能体执行,是对长程上下文理解、复杂推理规划、工具调用协同的综合考验。华为团队与中电信团队紧密协同,从数据体系、模型架构、训练工程到强化学习,进行了系统性攻坚。
在数据基座方面,围绕预训练与后训练全生命周期,建设涵盖数十万亿词元的数据体系。预训练阶段完成PB级多源异构数据清洗,引入海量智能体行为轨迹与结构化知识图谱。后训练阶段搭建高并发沙箱容器,构建端到端长程任务合成数据,并建立自动化校验机制保障数据正确性。
在架构设计方面,专为长程Agent任务设计,采用MLA多头潜变量注意力压缩KV缓存;MT多Token预测增强生成连贯性;mHC流形约束超连接解决训练数值不稳定的问题;Muon与QK-Clip优化器保障训练稳定。训练采用分阶段递进策略,从4K逐步扩展至32K/128K/256K序列长度,系统性构建长程能力。
在工程优化方面,Xing4.0-29B-A4B在昇腾超节点集群上通过多层次软硬件协同优化实现训练性能提升96%。基于MindSpore全栈适配mHC多残差连接与DSA长序列机制,针对细粒度MoE(64路由/Top4激活),通过专家负载均衡、Grouped GEMM、通信计算重叠及DVM图算融合,吞吐提升32%;层级与算子级选择性重计算再提升19%;自研Ascend C mHC融合算子解决Sinkhorn碎片化,计算效率提升30%,整网吞吐再提升25%。
在多专家强化学习方面,基于昇腾生态完成Slime强化学习框架适配,面向Agent、Coding、Reasoning开展多专家强化学习训练,通过MOPD技术实现多专家能力高效融合,进一步提升复杂推理与智能体任务表现。
华为中国官方称,目前,昇腾已支持40+个业界头部模型完成原生训练,也是国内唯一支持商用大规模预训练,并训练落地SOTA大模型的厂商。