存算分离架构下的数据湖架构

所属专题:大数据和AI结合的系统架构

嘉宾 : 程力 | 腾讯云高级工程师

会议室 : 宴会厅2

讲师介绍

专题演讲嘉宾:程力

腾讯云高级工程师

程力,腾讯云存储高级工程师,先后任职于 AWS S3,华为云和腾讯云等多家云厂商,聚焦存储和大数据场景,现为 Apache Hadoop Committer 和 Apache Ozone PMC,参加过KubeCon 2019,Hadoop Meetup 2020等多场技术论坛和技术峰会。

议题介绍

演讲:存算分离架构下的数据湖架构

随着存储计算分离的系统架构的出现,对象存储的弹性伸缩和低成本的优势使其在大数据和AI场景下逐渐成为更广泛的数据存储方案,数据湖的概念也应运而生。腾讯的数据湖方案中针对存算分离架构带来的性能问题和数据本地性的减弱,设计构建了新一代分布式计算端缓存层。该缓存不仅兼容 Hadoop 和对象语义,同时具备了结构化元数据管理的特性。利用表级别 MetaStore 等结构化元数据实现计算端按表粒度提供缓存,大幅优化了数据湖承载的大数据和 AI 应用的表级读写性能。该架构实现了数据湖的整体入湖和操作打通,针对大数据和 AI 场景提供了一体化的使用对象存储的方案。

演讲提纲:

  1. 存算分离架构的发展现状
  2. 如何解决计算数据本地性问题:三层加速的设计
  3. 在统一大数据和AI的数据湖生态下的规划和发展
  4. 对象存储如何在存算分离架构下结合 Iceberg 等结构化数据服务数据湖场景
  5. 对象存储在私有化场景下的架构探索

你将获得:

  1. 计算端缓存和统一语义在数据湖方案中的意义
  2. 缓存层如何结合 MetaStore 实现表粒度控制
  3. 腾讯数据湖如何向下一代存储数据结构 Iceberg 演进,承载 Iceberg+对象存储的存算分离方案

交通指南

上海·宝华万豪酒店

Shanghai Marriott Hotel Parkview
地址:上海市广中西路333号
  • 微信咨询

  • 电话咨询

    联系电话:+86-18514549229

微信联系我们

小姐姐