业界数据湖与数据仓库的争论由来已久,数据湖的灵活性与数仓的管理能力成为大数据架构... 展开 >





字节跳动数据引擎团队负责人。团队负责以 SparkSQL、Presto 为代表的大数据引擎深度优化,并研发了基于 HUDI 的字节内容数据湖方案 ByteLake。同时团队负责火山引擎湖仓一体分析服务(LakeHouse Analytics Service)的相关技术。

拥有十余年大数据建设与应用相关经验,于 2019 年加入快手,带领团队全面落地了数据生产、治理、分析、应用等数据中台产品,建设了快手全业务数据内容与服务体系。目前专注于使用元数据驱动数据生产、服务、治理的方向应用与探索。
业界数据湖与数据仓库的争论由来已久,数据湖的灵活性与数仓的管理能力成为大数据架构设计的“鱼”和“熊掌”,想要二者兼得是否可行?随着“湖仓一体”概念的提出,二者融合演进的新方向让业界耳目一新。本专题将邀请业界专家分享“湖仓一体”在业界的技术演进与应用实践。
业务发展加快了数据膨胀的速度,也带来了数据不一致等问题对数据治理提出了挑战。数据治理不仅需要完善的保障机制,还需要理解具体的治理内容,比如数据如何规范,元数据如何管理,需要哪些系统或者工具来进行配合?这些问题都是数据治理过程中最实际的问题,也是最复杂的问题,本专题将邀请业界公司的专家,从数据治理的各个核心领域来探讨解决这些问题的办法和经验。
在美团,大数据成本是整个网站运维成本的绝对大头,并且还在不断增长,数据平台中心作为统一的大数据服务提供方,同时肩负着降本、提效两个职责,通过长期的摸索和迭代,美团形成了一整套成本治理体系,主要包含以下几个方面:
目前这套体系已经在美团运行多年,取得了不错的效果,在预算阶段发现和杜绝不合理预算上亿元,在治理阶段日均清理 10+PB 数据,冷备达 100PB,累计发现和治理计算资源 20+万 CU。
演讲提纲:
你将获得:
随着大数据应用的时效性要求越来越高,传统的离线数仓已经无法满足业务的需求,新引入的各种异构存储的实时数仓虽然暂时满足了需求,但是实时、离线分开建模、开发、存储的结果却又带来了数据质量不高、成本浪费、运维困难等诸多问题。而流批一体、湖仓一体现阶段看来是解决以上问题的不错思路。
网易结合自身在 Flink/Spark 计算引擎多年的开发实践经验,融合 Iceberg 的数据湖管理能力,打造了一套流批一体的实时数据湖方案。新的方案采用一套元数据管理流与批的数据,采用相同的编程接口进行开发,在提升数据时效性的基础上简化了开发过程,提升了数据质量,降低了运维成本。
目前新的流批一体方案已经在网易内外多个项目中落地,共计活跃流批一体表200+张,使用流批一体表的实时计算任务500+个,使用流批一体表的离线计算任务1000+,其中实时计算任务最大 QPS 超过一百万,单张表存储体量超过100TB。
演讲提纲:
你将获得:
随着 5G、IoT 的兴起,数据持续保持着高速的增长,那么如何通过有效的数据治理,最大化地发挥数据价值显得至关重要。
数据治理通常会涵盖质量、效率、成本、安全、价值等方向,本次分享重点关注在质量方向的探索以及实战。快手在构建数据中台过程中,面临着数据规范不统一、指标口径不统一等问题,我们通过完善的指标体系建设,解决了快手数据中台在质量方向上面临的问题,目前这套指标体系已经全面应用到快手电商、商业化与直播等业务。
演讲提纲:
你将获得:
数据湖的出现,为企业提供了一种更为灵活,更低成本的数据存储方式,同时也进一步普惠数据价值。数据湖能容纳各类型的海量数据,降低了数据收集成本,消除了数据孤岛。然而,在企业数据湖的实践中,最主要的挑战不是构建数据湖,而是能从数据湖的数据中获益。
湖仓一体概念的提出,将用户熟悉的数仓方案,与数据湖进行融合,在保留数据灵活性的同时,也纳入了更强的数据的管理能力,安全管控能力,让数据湖和数据仓库的边界变得模糊。
火山引擎的湖仓一体分析服务 LAS 融合了数据湖和数仓的优势,对外提供开放的数据格式,强大的事务能力,批流统一的 SQL 与存储,湖仓统一的元数据管理,内置的 Spark 和 Presto 引擎性能远超开源版本。
本次演讲,我会为大家揭秘 LAS 如何帮助用户用好数据湖,以及 LAS 在字节内外的实践案例,和 LAS 的未来规划。
演讲大纲:
听众收益:



