阿里云今日对外发布全新全栈智算调度平台,该平台深度融合CPU、GPU与NPU异构算力资源,内置自适应通信拓扑优化引擎。在实际测试中,面对千亿参数级语言模型训练任务,平台可将千卡集群的有效算力利用率提升至百分之九十以上,整体训练效率较传统方案提高百分之四十。此外,针对长周期训练中常见的硬件故障,平台实现了秒级断点续训与自动路由切换,极大增强了大规模分布式训练的鲁棒性,为企业节省了可观的时间与算力成本。
关键要点
- 融合异构算力资源自适应拓扑优化引擎
- 千卡集群训练效率提升百分之四十
- 秒级断点续训增强大规模分布式训练鲁棒性