全新架构的昇腾AI计算集群发布,支持超万亿参数大模型训练
9月20日消息,在今日举行的华为全联接大会2023期间,华为常务董事、ICT基础设施业务管理委员会主任、企业BG总裁汪涛正式发布全新架构的昇腾AI计算集群——Atlas900SuperCluster,可支持超万亿参数的大模型训练。
据介绍,新集群采用了全新的华为星河AI智算交换机CloudEngineXH16800,借助其高密的800GE端口能力,两层交换网络即可实现2250节点(等效于18000张卡)超大规模无收敛集群组网。
新集群同时使用了创新的超节点架构,大大提升了大模型训练能力。此外,发挥华为在计算、网络、存储、能源等领域的综合优势,从器件级、节点级、集群级和业务级全面提升系统可靠性,将大模型训练稳定性从天级提升到月级。
此外,华为发布了更开放、更易用的CANN7.0异构计算架构,不仅全面兼容业界的AI框架、加速库和主流大模型,还深度开放底层能力,让AI框架和加速库可以更直接地调用和管理计算资源,使能开发者自定义高性能算子,让大模型具备差异化的竞争力。
华为还升级了AscendC编程语言,以更高效的编程方式,简化算子实现逻辑,大幅缩短融合算子的开发周期,为AI模型与应用的快速开发赋能。
面向全球企业和开发者,华为云官网今日正式上线昇腾AI云服务“百模千态”专区,专区收录了业界主流开源大模型,并全面基于昇腾AI云服务进行适配和优化;提供应用开发的工具链,开发工具已经全部实现了云化,免去繁琐的配置流程,实现一键接入,即开即用。
▲昇腾AI云服务百模千态专区
IT之家查询获悉,截至今年7月,昇腾AI集群已支撑全国25个城市的人工智能计算中心建设,其中7个城市公共算力平台入选首批国家“新一代人工智能公共算力开放创新平台”。
同时,昇腾AI已发展30多家硬件伙伴、1200多家ISV,联合推出了2500多个行业AI解决方案,规模服务于运营商、互联网、金融等行业。