轩辕文件存储在AI计算平台的实践

所属专题:智算平台建设与应用实践

嘉宾 : 于相洋 | vivo 互联网高级工程师

会议室 : 会议室2(三楼)

讲师介绍

专题演讲嘉宾:于相洋

vivo 互联网高级工程师

现任职于vivo互联网,负责公司内分布式文件存储的开发和运营。10年存储老兵,GlusterFS,Ceph开源社区贡献者。

议题介绍

演讲:轩辕文件存储在AI计算平台的实践

随着 GPU 的算力不断提升以及海量小文件训练场景普遍化,传统的存储系统性能很难满足 GPU 的 IO 需求,导致 GPU 的使用率低下,用户的任务训练效率不高。

在业界,深度学习训练对存储的高性能需求一直是 AI 计算平台需要解决的一大难点,vivo AI 计算平台在建设初期也存在如上的存储性能问题。

vivo 互联网提供的轩辕文件存储,是一款云原生,高性能的分布式文件存储,在与 AI 计算平台深入沟通和测试后,AI 计算平台最终将数据存储切换至了轩辕文件存储。

随后,由最初在模型训练阶段的使用轩辕文件存储,我们将其逐渐推广到计算平台的数据全链路中,最终统一了整个计算平台的数据存储。在降低用户数据存储成本同时,大大提升提高 AI 研发的工作效率。

在整个推广使用过程中,针对一些用户性能痛点,我们进行了相关的研发优化,并得到了用户的好评。

演讲提纲:

  1. 计算平台引入轩辕文件存储的背景
  2. 计算平台全链路统一存储方案
  3. 模型训练和在线推理阶段的性能优化
  4. 挑战与规划

听众受益点:

  • 了解模型训练的全链路环节
  • 了解如何使用缓存技术提高数据读写性能

交通指南

深圳博林天瑞喜来登酒店

Sheraton Shenzhen Nanshan
地址:广东省深圳市南山区留仙大道4088号
如您在购票过程中遇到问题,请扫码咨询票务小助手