毕业于北京航空航天大学计算机学院,主要研发方向是云原生及AI算力基础设施,曾负责多云管理平台、云原生监控、容器网络、容器安全等多个项目的研发工作。目前就职于天翼云科技有限公司,负责AI智算平台研发工作,重点关注大规模智算集群的性能诊断和调优,以及国产算力生态适配,拥有丰富的客户实战经验。
随着大模型风潮来袭,各大厂商都在打造千卡万卡的超大规模智算集群,它与传统云原生大规模场景有着不同维度的管理复杂度和难度,本演讲旨在从建设、管理和运维大规模集群的实践出发,如何通过智算平台解决运维难、管理难、排障难,以提供高性能算力,服务大模型时代的训练需求。
演讲提纲:
听众受益点:



