大模型基础框架

会议室:会议室1(三楼)
出品人:陶阳宇 博士

随着AIGC大模型的飞速发展,模型的参数量越来越大,大模型训练、推理的吞吐性能、... 展开 >

专题出品人:陶阳宇 博士

腾讯TEG 机器学习平台部总监

陶阳宇,腾讯TEG 机器学习平台部总监,15年机器学习、大数据、云计算相关领域经验,现任腾讯-太极机器学习平台研发负责人,研发了腾讯Angel系列AI框架,支持海量数据、万卡规模GPU集群的模型训练、推理部署,服务了腾讯混元大模型、广告/内容推荐、金融风控等业务场景。 

地点:会议室1(三楼)

专题:大模型基础框架

随着AIGC大模型的飞速发展,模型的参数量越来越大,大模型训练、推理的吞吐性能、算力成本,对于模型研发和落地应用都至关重要。本专题将深入探讨行业中大模型训练和推理的基础架构和关键技术,包括训练加速、多维并行、万卡集群、高性能算力等技术焦点,关注训练性能优化、推理部署策略等重要领域,助力人工智能领域进一步发展。

by 赵英俊

华为
昇腾产品线 AI框架规划专家

问题背景:在 ScalingLaw 的驱动下,万卡甚至十万卡集群训练成为大模型训练的标配,超大规模集群如何做到高可靠、高性能、易运维成为 AI Infra 面临的最大挑战。

解决方案:通过算力、通信融合优化,亲和性并行切分策略等手段实现高性能。通过故障预测、算网协同等实现高可靠。通过AI框架、多种调优工具和手段实现超大规模集群的优化运维。

实施后效果:超大规模集群实现性能提升,稳定性提升等。

演讲提纲:

  1. AI Infra 发展趋势和面临的挑战
  2. 超大规模集群需要解决的核心问题
  3. 超大规模集群优化方案与实践

听众受益点:

  • 如何快速组建万卡以上超大规模集群,技术架构、网络、基础设施等
  • 超大规模集群优化点与提升方案,如何有效的应用到当前的 AI Infra 工作中
  • 为未来建设更大算力集群以及优化提供参考路径

by 胡晓光

百度
深度学习技术平台部杰出架构师

深度学习平台在推动深度学习技术的创新和应用方面发挥着重要作用,被视为智能时代的操作系统。大模型的发展离不开深度学习平台提供有力支撑。作为中国首个自主研发、功能丰富、开源开放的产业级深度学习平台,飞桨的大模型相关技术持续创新突破。

在本次演讲中,将详细介绍飞桨在支持大模型开发、训练、压缩、推理和部署方面所取得的技术创新成果。这些创新将有助于开发者以更低的成本进行开发,并更高效地训练大模型,从而加速大模型技术的创新与应用。

演讲提纲:

  1. 大模型与深度学习平台的技术趋势
  2. 飞桨深度学习平台技术创新
    • 动静统一的开发框架
    • 超大规模分布式训练
    • 多端多平台推理引擎

听众受益点:

  • 了解大模型开发、训练、推理的技术挑战
  • 明白深度学习平台的原理
  • 掌握飞桨进行大模型开发方法

by 李永

阿里云
资深技术专家

主要分享超大规模LLM模型从数据链路到训练优化的整个链路的最佳实践。本次演讲将分享超大规模模型在训练链路上的最佳实践,包括数据清晰、调度、通信优化、训练、稳定性、RLHF等方面的内容。

听众受益点:了解大语言模型的从零到一的训练过程,知道大语言模型的训练原理和最佳实践。

by 薛金宝

腾讯
机器学习平台部大模型训练框架研发技术专家

在大模型蓬勃快速发展的今天,不仅要支持文生文、多模态、文生图、文生视频等的大模型训练,还要支持 Dense 和 MoE 模型的训练,不仅要支持小模型的训练,还要支持万亿参数模型的训练,不仅要支持单任务单卡大模型的训练,还要支持单任务万卡规模大模型的训练,不仅要支持同构 GPU 的训练,还要支持异构GPU的加速训练,如何满足大模型训练的多种加速需求,成为大模型 AI Infra 的必须解决的挑战。

解决方案:基于对存储、网络、计算的深度融合优化,我们研发了 AngelPTM 大模型训练框架,其通过6D并行策略提高模型的训练并行度、通过 ZeROCache 解决大模型训练显存压力大的问题,通过 MOE 加速组件解决超大规模参数模型高效训练的问题,通过与星脉高速网络的协同优化,与算力、服务器、存储等团队的通力配合来解决单任务万卡训练的问题。

实施后效果:AngelPTM 支持文生文、多模态、文生图/视频等大模型的高速训练,单任务万卡训练可实现长时间的稳定高性能训练。

演讲提纲:

  1. 大模型训练发展趋势和面临的挑战
    • 万物生文、万物生图、万物生视频等大模型发展趋势。
    • 大模型训练通信挑战
    • 大模型训练显存挑战
    • 大规模训练计算挑战
  2. 大模型训练框架 AngelPTM
    • AngelPTM 6D 并行加速
    • AngelPTM ZeroCache 存储优化技术
    • AngelPTM MOE 加速优化
    • AngelPTM 大窗口优化
  3. 大模型超大规模集群训练优化和实践。
    • 超大规模训练线性扩展性优化
    • 超大规模训练稳定性优化

听众受益点:

  • 大模型训练针对各种模态模型优化手段(各种模态支持)
  • 针对超大规模训练以及业务落地训练的优化手段(万卡训练和单卡训练)
  • 针对 MOE 大模型的训练优化手段
  • 万卡以上超大规模训练如何实现性能的线性扩展以及训练稳定性保障

by 黄叶飞

微众银行
基础科技产品部室高级经理

ChatGPT诞生后AI辅助编码同时也火了起来,而在后者的方案上大多参考Github Copilot来实现,而我们要做的不是AI来辅助编码,而是人来辅助AI编码,让AI成为主角,人做助手。

本次演讲将介绍提高研发效能的需要关注的地方以及遇到的挑战,并告诉你如何构建私有化信息的RAG来提供编程Agent服务,以编写出Multi-Agent解决自动化问题,最后介绍Agent出现问题后如何人机交互,最终得到完整的方案以提升研发效能。

演讲提纲:

  1. 大模型在研发效能上的实践方式有哪些
  2. 微众在实践过程中遇到的困难
  3. Agent离不开的RAG(如何构建更有用的RAG信息实现Agent自动化)
  4. Multi-Agent如何实现微众的研发全流程提效
  5. 让AI成为主角的人机交互方式

听众受益点:

  • 了解大模型助效编程的实现方案
  • 如何构建复杂的编程Agent

交通指南

深圳博林天瑞喜来登酒店

Sheraton Shenzhen Nanshan
地址:广东省深圳市南山区留仙大道4088号
如您在购票过程中遇到问题,请扫码咨询票务小助手