智算平台建设与应用实践

会议室:会议室2(三楼)
出品人:刘超

随着 AIGC 的爆火,大模型的训练对于底层的算力基础设施提出了更高的要求,例如... 展开 >

专题出品人:刘超

天翼云资深研发专家

超过15年云计算工作经验,目前在天翼云从事混合云研发相关工作。极客时间专栏《趣谈网络协议》《趣谈Linux操作系统》作者,曾经就职于EMC,HP,华为,网易,腾讯等,长期致力于云计算开源技术的分享,布道和落地工作。

地点:会议室2(三楼)

专题:智算平台建设与应用实践

随着 AIGC 的爆火,大模型的训练对于底层的算力基础设施提出了更高的要求,例如更大的带宽和低时延的网络,并行计算加速及开发框架,分布式算力与大内存等。与传统的云计算平台不同,智能计算平台有独有的网络架构(如 IB,RoCE 等),独特的虚拟化方式(基于虚拟机/容器的GPU 虚拟化),独特的算力调度平台,海量的并行存储系统等。

本专题会邀请智算平台的研发运维专家,来分享构建智算平台的技术要点,以及在实践和落地过程中所作的优化和踩过的坑。

by 肖松

百度
混合云部资深技术专家

大模型时代的到来,为智算平台建设带来了新的挑战,也由此衍生出一系列工程实践问题。如算力规模的急遽增长带来的集群纳管和运维难度增加问题;训练时长增长,则出错概率变高问题;面向用户的推理时效性问题;以及在人工智能领域知识逐渐深入的背景下,如何同时服务好运维人员和算法工程师的问题。

基于百度多年来在 AI 领域的工程积累,百度百舸团队专为大规模深度学习场景,打造出一套高性能云原生 AI 计算平台,为模型算法专家和运维专家提供全面的集群运维支持和任务全生命周期管理,同时具备训练/推理加速、故障容错、智能故障诊断等高级功能,大幅提升算力使用效率。

演讲提纲:

  1. 云原生场景下大模型工程实践痛点
    • 提升资源利用率需求
    • 运维易用性需求
  2. 百度百舸平台解决方案
    • 训练与推理加速原理
    • 自动容错机制
    • 存储加速实践
    • 通信库加速实践
    • 资源虚拟化与调度
  3. 对于智算平台发展的一些思考
    • 智算平台易用性
    • 智算平台发展展望

听众受益点:

  • 了解大模型场景下的工程实践痛点
  • 从多角度了解如何提升异构资源利用率
  • 了解智算平台的建设与优化实践

by 黄坚

天翼云
云网产品事业部研发专家

随着大模型风潮来袭,各大厂商都在打造千卡万卡的超大规模智算集群,它与传统云原生大规模场景有着不同维度的管理复杂度和难度,本演讲旨在从建设、管理和运维大规模集群的实践出发,如何通过智算平台解决运维难、管理难、排障难,以提供高性能算力,服务大模型时代的训练需求。

演讲提纲:

  1. 大规模智算集群的痛点问题
  2. 运维及管理实战思路和方案
  3. 云骁智算平台能力及落地实践
  4. 智算平台未来展望

听众受益点:

  • 了解大规模智算集群的运维、管理痛点和解决思路
  • 了解从硬件建设、软件配置如何提高智算集群效率
  • 云骁智算平台的落地实践

by 乐金明

火山引擎
火山引擎容器服务技术总监

以 ChatGPT 为代表的 AIGC 浪潮正在重塑数字内容的生产方式和消费模式,相应的,各行业高算力业务场景对 AI 算力的需求也水涨船高。在有限算力的情况下,通过 GPU 算力上云,驱动云原生 + AI 实现算力资源的快速弹性和高效使用,已经成为 AI 技术落地的新基石。

基于字节跳动内部内核虚拟化隔离 GPU 的技术实践,火山引擎云原生团队结合 Kubernetes 原生 Scheduling Framework,推出自研容器共享 GPU 调度方案 mGPU。提供性能和故障隔离,同时也兼容多种底层 GPU 虚拟化实现以及整卡分配。通过多 Pod 灵活细粒度地共享 GPU,提升算力利用率的同时,节约成本。

演讲提纲:

  • AI 算力瓶颈挑战
  • GPU 共享业务场景诉求
  • mGPU 架构介绍
  • mGPU 共享调度策略
  • 案例分享

你将获得:

  • 了解不同 AI 场景对算力的需求
  • 了解全新 GPU 容器虚拟化方案 mGPU
  • 了解 AI 趋势下该技术的行业价值和未来演进

by 肖然

Thoughtworks
全球数字化转型专家

在AI 2.0时代,我们面临着从未有过的挑战和机遇。数据量的爆炸性增长、算法和模型的复杂性以及业务需求的快速变化,都对企业的AI实践提出了更高的要求。在这个背景下,AI能力工程化变得至关重要。它不仅是实现算法驱动组织的关键路径,更是应对各种挑战的有效途径。通过2-3个组织级AI能力工程化的尝试,启发各个组织开启AI能力升级之旅。

演讲提纲:

  1. AI 2.0时代的背景和特点,不确定性的挑战和机遇
  2. 大模型时代对AI能力工程化的挑战和需求
  3. AI能力工程化的挑战与解决方案
  4. 组织能力的打造和相关人才的培养
  5. 知行合一的持续探索之旅

听众受益点:

  • AI 2.0时代的组织能力升级
  • AI能力工程化的思考框架
  • 工程化的路径和设计

by 于相洋

vivo 互联网
高级工程师

随着 GPU 的算力不断提升以及海量小文件训练场景普遍化,传统的存储系统性能很难满足 GPU 的 IO 需求,导致 GPU 的使用率低下,用户的任务训练效率不高。

在业界,深度学习训练对存储的高性能需求一直是 AI 计算平台需要解决的一大难点,vivo AI 计算平台在建设初期也存在如上的存储性能问题。

vivo 互联网提供的轩辕文件存储,是一款云原生,高性能的分布式文件存储,在与 AI 计算平台深入沟通和测试后,AI 计算平台最终将数据存储切换至了轩辕文件存储。

随后,由最初在模型训练阶段的使用轩辕文件存储,我们将其逐渐推广到计算平台的数据全链路中,最终统一了整个计算平台的数据存储。在降低用户数据存储成本同时,大大提升提高 AI 研发的工作效率。

在整个推广使用过程中,针对一些用户性能痛点,我们进行了相关的研发优化,并得到了用户的好评。

演讲提纲:

  1. 计算平台引入轩辕文件存储的背景
  2. 计算平台全链路统一存储方案
  3. 模型训练和在线推理阶段的性能优化
  4. 挑战与规划

听众受益点:

  • 了解模型训练的全链路环节
  • 了解如何使用缓存技术提高数据读写性能

交通指南

深圳博林天瑞喜来登酒店

Sheraton Shenzhen Nanshan
地址:广东省深圳市南山区留仙大道4088号
如您在购票过程中遇到问题,请扫码咨询票务小助手