现任职于vivo互联网,负责公司内分布式文件存储的开发和运营。10年存储老兵,GlusterFS,Ceph开源社区贡献者。

现任职于vivo互联网,负责公司内分布式文件存储的开发和运营。10年存储老兵,GlusterFS,Ceph开源社区贡献者。
随着 GPU 的算力不断提升以及海量小文件训练场景普遍化,传统的存储系统性能很难满足 GPU 的 IO 需求,导致 GPU 的使用率低下,用户的任务训练效率不高。
在业界,深度学习训练对存储的高性能需求一直是 AI 计算平台需要解决的一大难点,vivo AI 计算平台在建设初期也存在如上的存储性能问题。
vivo 互联网提供的轩辕文件存储,是一款云原生,高性能的分布式文件存储,在与 AI 计算平台深入沟通和测试后,AI 计算平台最终将数据存储切换至了轩辕文件存储。
随后,由最初在模型训练阶段的使用轩辕文件存储,我们将其逐渐推广到计算平台的数据全链路中,最终统一了整个计算平台的数据存储。在降低用户数据存储成本同时,大大提升提高 AI 研发的工作效率。
在整个推广使用过程中,针对一些用户性能痛点,我们进行了相关的研发优化,并得到了用户的好评。
演讲提纲:
听众受益点:



