随着 AIGC 的爆火,大模型的训练对于底层的算力基础设施提出了更高的要求,例如... 展开 >






超过15年云计算工作经验,目前在天翼云从事混合云研发相关工作。极客时间专栏《趣谈网络协议》《趣谈Linux操作系统》作者,曾经就职于EMC,HP,华为,网易,腾讯等,长期致力于云计算开源技术的分享,布道和落地工作。
随着 AIGC 的爆火,大模型的训练对于底层的算力基础设施提出了更高的要求,例如更大的带宽和低时延的网络,并行计算加速及开发框架,分布式算力与大内存等。与传统的云计算平台不同,智能计算平台有独有的网络架构(如 IB,RoCE 等),独特的虚拟化方式(基于虚拟机/容器的GPU 虚拟化),独特的算力调度平台,海量的并行存储系统等。
本专题会邀请智算平台的研发运维专家,来分享构建智算平台的技术要点,以及在实践和落地过程中所作的优化和踩过的坑。
大模型时代的到来,为智算平台建设带来了新的挑战,也由此衍生出一系列工程实践问题。如算力规模的急遽增长带来的集群纳管和运维难度增加问题;训练时长增长,则出错概率变高问题;面向用户的推理时效性问题;以及在人工智能领域知识逐渐深入的背景下,如何同时服务好运维人员和算法工程师的问题。
基于百度多年来在 AI 领域的工程积累,百度百舸团队专为大规模深度学习场景,打造出一套高性能云原生 AI 计算平台,为模型算法专家和运维专家提供全面的集群运维支持和任务全生命周期管理,同时具备训练/推理加速、故障容错、智能故障诊断等高级功能,大幅提升算力使用效率。
演讲提纲:
听众受益点:
随着大模型风潮来袭,各大厂商都在打造千卡万卡的超大规模智算集群,它与传统云原生大规模场景有着不同维度的管理复杂度和难度,本演讲旨在从建设、管理和运维大规模集群的实践出发,如何通过智算平台解决运维难、管理难、排障难,以提供高性能算力,服务大模型时代的训练需求。
演讲提纲:
听众受益点:
以 ChatGPT 为代表的 AIGC 浪潮正在重塑数字内容的生产方式和消费模式,相应的,各行业高算力业务场景对 AI 算力的需求也水涨船高。在有限算力的情况下,通过 GPU 算力上云,驱动云原生 + AI 实现算力资源的快速弹性和高效使用,已经成为 AI 技术落地的新基石。
基于字节跳动内部内核虚拟化隔离 GPU 的技术实践,火山引擎云原生团队结合 Kubernetes 原生 Scheduling Framework,推出自研容器共享 GPU 调度方案 mGPU。提供性能和故障隔离,同时也兼容多种底层 GPU 虚拟化实现以及整卡分配。通过多 Pod 灵活细粒度地共享 GPU,提升算力利用率的同时,节约成本。
演讲提纲:
你将获得:
在AI 2.0时代,我们面临着从未有过的挑战和机遇。数据量的爆炸性增长、算法和模型的复杂性以及业务需求的快速变化,都对企业的AI实践提出了更高的要求。在这个背景下,AI能力工程化变得至关重要。它不仅是实现算法驱动组织的关键路径,更是应对各种挑战的有效途径。通过2-3个组织级AI能力工程化的尝试,启发各个组织开启AI能力升级之旅。
演讲提纲:
听众受益点:
随着 GPU 的算力不断提升以及海量小文件训练场景普遍化,传统的存储系统性能很难满足 GPU 的 IO 需求,导致 GPU 的使用率低下,用户的任务训练效率不高。
在业界,深度学习训练对存储的高性能需求一直是 AI 计算平台需要解决的一大难点,vivo AI 计算平台在建设初期也存在如上的存储性能问题。
vivo 互联网提供的轩辕文件存储,是一款云原生,高性能的分布式文件存储,在与 AI 计算平台深入沟通和测试后,AI 计算平台最终将数据存储切换至了轩辕文件存储。
随后,由最初在模型训练阶段的使用轩辕文件存储,我们将其逐渐推广到计算平台的数据全链路中,最终统一了整个计算平台的数据存储。在降低用户数据存储成本同时,大大提升提高 AI 研发的工作效率。
在整个推广使用过程中,针对一些用户性能痛点,我们进行了相关的研发优化,并得到了用户的好评。
演讲提纲:
听众受益点:



