随着AIGC大模型的飞速发展,模型的参数量越来越大,大模型训练、推理的吞吐性能、... 展开 >






陶阳宇,腾讯TEG 机器学习平台部总监,15年机器学习、大数据、云计算相关领域经验,现任腾讯-太极机器学习平台研发负责人,研发了腾讯Angel系列AI框架,支持海量数据、万卡规模GPU集群的模型训练、推理部署,服务了腾讯混元大模型、广告/内容推荐、金融风控等业务场景。
随着AIGC大模型的飞速发展,模型的参数量越来越大,大模型训练、推理的吞吐性能、算力成本,对于模型研发和落地应用都至关重要。本专题将深入探讨行业中大模型训练和推理的基础架构和关键技术,包括训练加速、多维并行、万卡集群、高性能算力等技术焦点,关注训练性能优化、推理部署策略等重要领域,助力人工智能领域进一步发展。
问题背景:在 ScalingLaw 的驱动下,万卡甚至十万卡集群训练成为大模型训练的标配,超大规模集群如何做到高可靠、高性能、易运维成为 AI Infra 面临的最大挑战。
解决方案:通过算力、通信融合优化,亲和性并行切分策略等手段实现高性能。通过故障预测、算网协同等实现高可靠。通过AI框架、多种调优工具和手段实现超大规模集群的优化运维。
实施后效果:超大规模集群实现性能提升,稳定性提升等。
演讲提纲:
听众受益点:
深度学习平台在推动深度学习技术的创新和应用方面发挥着重要作用,被视为智能时代的操作系统。大模型的发展离不开深度学习平台提供有力支撑。作为中国首个自主研发、功能丰富、开源开放的产业级深度学习平台,飞桨的大模型相关技术持续创新突破。
在本次演讲中,将详细介绍飞桨在支持大模型开发、训练、压缩、推理和部署方面所取得的技术创新成果。这些创新将有助于开发者以更低的成本进行开发,并更高效地训练大模型,从而加速大模型技术的创新与应用。
演讲提纲:
听众受益点:
主要分享超大规模LLM模型从数据链路到训练优化的整个链路的最佳实践。本次演讲将分享超大规模模型在训练链路上的最佳实践,包括数据清晰、调度、通信优化、训练、稳定性、RLHF等方面的内容。
听众受益点:了解大语言模型的从零到一的训练过程,知道大语言模型的训练原理和最佳实践。
在大模型蓬勃快速发展的今天,不仅要支持文生文、多模态、文生图、文生视频等的大模型训练,还要支持 Dense 和 MoE 模型的训练,不仅要支持小模型的训练,还要支持万亿参数模型的训练,不仅要支持单任务单卡大模型的训练,还要支持单任务万卡规模大模型的训练,不仅要支持同构 GPU 的训练,还要支持异构GPU的加速训练,如何满足大模型训练的多种加速需求,成为大模型 AI Infra 的必须解决的挑战。
解决方案:基于对存储、网络、计算的深度融合优化,我们研发了 AngelPTM 大模型训练框架,其通过6D并行策略提高模型的训练并行度、通过 ZeROCache 解决大模型训练显存压力大的问题,通过 MOE 加速组件解决超大规模参数模型高效训练的问题,通过与星脉高速网络的协同优化,与算力、服务器、存储等团队的通力配合来解决单任务万卡训练的问题。
实施后效果:AngelPTM 支持文生文、多模态、文生图/视频等大模型的高速训练,单任务万卡训练可实现长时间的稳定高性能训练。
演讲提纲:
听众受益点:
ChatGPT诞生后AI辅助编码同时也火了起来,而在后者的方案上大多参考Github Copilot来实现,而我们要做的不是AI来辅助编码,而是人来辅助AI编码,让AI成为主角,人做助手。
本次演讲将介绍提高研发效能的需要关注的地方以及遇到的挑战,并告诉你如何构建私有化信息的RAG来提供编程Agent服务,以编写出Multi-Agent解决自动化问题,最后介绍Agent出现问题后如何人机交互,最终得到完整的方案以提升研发效能。
演讲提纲:
听众受益点:



