拥有12年机器学习、分布式计算、并行计算加速等相关领域经验,负责研发了腾讯AngelPTM大模型训练框架,支持6D并行和ZeROCache优化策略,支持以更少资源以更快的速度训练更大的模型,目前AngelPTM支持了腾讯混元大模型的训练以及内部业务应用的精调和强化训练。

拥有12年机器学习、分布式计算、并行计算加速等相关领域经验,负责研发了腾讯AngelPTM大模型训练框架,支持6D并行和ZeROCache优化策略,支持以更少资源以更快的速度训练更大的模型,目前AngelPTM支持了腾讯混元大模型的训练以及内部业务应用的精调和强化训练。
在大模型蓬勃快速发展的今天,不仅要支持文生文、多模态、文生图、文生视频等的大模型训练,还要支持 Dense 和 MoE 模型的训练,不仅要支持小模型的训练,还要支持万亿参数模型的训练,不仅要支持单任务单卡大模型的训练,还要支持单任务万卡规模大模型的训练,不仅要支持同构 GPU 的训练,还要支持异构GPU的加速训练,如何满足大模型训练的多种加速需求,成为大模型 AI Infra 的必须解决的挑战。
解决方案:基于对存储、网络、计算的深度融合优化,我们研发了 AngelPTM 大模型训练框架,其通过6D并行策略提高模型的训练并行度、通过 ZeROCache 解决大模型训练显存压力大的问题,通过 MOE 加速组件解决超大规模参数模型高效训练的问题,通过与星脉高速网络的协同优化,与算力、服务器、存储等团队的通力配合来解决单任务万卡训练的问题。
实施后效果:AngelPTM 支持文生文、多模态、文生图/视频等大模型的高速训练,单任务万卡训练可实现长时间的稳定高性能训练。
演讲提纲:
听众受益点:



