阿里云机器学习平台资深技术专家,长期从事分布式机器学习系统研发,DeepRec 深度学习引擎发起人,长期关注大规模分布式训练、高性能推理引擎和异构集群调度等领域,OSDI、VLDB、Sigmod 等顶会有多篇论文收录。

阿里云机器学习平台资深技术专家,长期从事分布式机器学习系统研发,DeepRec 深度学习引擎发起人,长期关注大规模分布式训练、高性能推理引擎和异构集群调度等领域,OSDI、VLDB、Sigmod 等顶会有多篇论文收录。
主要分享超大规模LLM模型从数据链路到训练优化的整个链路的最佳实践。本次演讲将分享超大规模模型在训练链路上的最佳实践,包括数据清晰、调度、通信优化、训练、稳定性、RLHF等方面的内容。
听众受益点:了解大语言模型的从零到一的训练过程,知道大语言模型的训练原理和最佳实践。



