华为AI训练集群华为未来一年的战略计划(3)

时间:2019-09-18 14:40       来源: 未知
胡厚崑还分享了一个由华为联合上海天文台与SKA共同打造的天文探索案例。天文研究高度依赖于海量的数据分析和计算,离不开超强的算力支持。在这张南半球的星空图上有20万颗星星,用人眼是看不见这么多星星的,这些画面来自于SKA射电望远镜的数据。

Atlas 900 AI训练集群采用业界单芯片算力最强的昇腾910 AI处理器,每颗昇腾910 AI处理器内置32个达芬奇AI Core,单芯片提供比业界高一倍的算力。Atlas 900 AI训练集群将数千颗昇腾910 AI处理器互联,打造业界第一的算力集群。

  昇腾910 AI处理器采用SoC设计,集成“AI算华为AI训练集群华为未来一年的战略计划力、通用算力、高速大带宽I/O”,大幅度卸载Host CPU的数据预处理任务,充分提升训练效率。

  最佳集群网络

  Atlas 900 AI训练集群采用“HCCS、 PCIe 4.0、100G以太”三类高速互联方式,百TB全互联无阻塞专属参数同步网络,降低网络时延,梯度同步时延缩短10~70%。

  在AI服务器内部,昇腾910 AI处理器之间通过HCCS高速总线互联;昇腾910 AI处理器和CPU之间以最新的PCIe 4.0(速率16Gb/s)技术互联,其速率是业界主流采用的PCIe 3.0(8.0Gb/s)技术的两倍,使得数据传输更加快速和高效。在集群层面,采用面向数据中心的CloudEngine 8800系列交换机,提供单端口100Gbps的交换速率,将集群内的所有AI服务器接入高速交换网络。

  华为认为,智能世界有三个特征,就是万物华为AI训练集群华为未来一年的战略计划感知、万物互联、万物智能,要支撑这样一个智能世界,有两个关键的技术需要持续创新和投资:联接和计算。

另外,在空间节省方面,与8kW风冷机柜相比,节省机房空间79%。极致的液冷散热技术满足了高功率、高密设备部署、低PUE的需求,极大地降低了客户的TCO。

华为在2019年全联结大会上发布AI训练集群Atlas900,并称之为全球最快的AI训练集群。现场演示中,在一张超过20万颗星体的南半球星图上,识别和定位具有一定特征的星体,运用Atlas900只用了10.02秒。而目前的方式是依赖‌经验的科学家,需要169天来完成该任务。华为轮值董事长胡厚崑说,目前Atlas900已部署在华为云上。华为AI训练集群华为未来一年的战略计划