过去的20年里,大数据 & AI 系统的技术架构演进由三方面推动:海量数... 展开 >





关涛,分布式系统和大数据平台领域专家。曾任阿里云计算平台事业部研究员,阿里巴巴通用计算平台负责人,负责阿里巴巴主线大数据平台。前阿里巴巴和蚂蚁集团技术委员会计算平台领域组长、阿里云架构组大数据组组长。回国加入阿里云之前,在微软云计算和企业事业部工作 9 年,主持和参与开发了包括 Azure Datalake,Cosmos/Scope,Kirin Store,SearchRepository 在内的多套超大规模分布式存储和计算平台。并著有多篇国内外会议论文和专利。
过去的20年里,大数据 & AI 系统的技术架构演进由三方面推动:海量数据分析需求、开放开源的技术进步、以云为代表的软硬件基础设施升级。
本专题试从“云原生”的视角,与各位同行探讨新一代数据平台的架构迭代方向。包括但不限于统一数据存储(HDFS、OSS 等技术演进)、Caching 层(Alluxio/JindoFS 为代表)、统一资源管理的挑战(K8s 支持大数据计算的不足、混部技术)、统一元数据中心的技术演进、存算分离以及分布式内存池等等。
同时,尽管数据湖概念不强绑定在云,但云原生切实推动数据湖的普及化。数据湖的灵活性与数仓的管理能力成为大数据架构设计的“鱼”和“熊掌”,如何可兼得成为大厂架构体系演进的关键问题。2020年,AWS、Databricks、阿里云同时提出“湖仓一体”概念,尽管有相同的目标,演进路径“一中各表”。“湖仓一体”能否真正落地?路径是怎样的?本专题也将特邀相关团队一线专家共同探讨。
The Snowflake Data Cloud is a new type of cloud dedicated to data analytics, built on top of the infrastructure provided by the three major cloud providers, namely Amazon, Microsoft, and Google. In this talk, I will give an overview of the Snowflake cloud data platform, highlighting how we leverage the cloud to make Snowflake infinitely scalable, elastic, global, collaborative, and extremely simple to use. In particular, we will show that this is made possible by our multi-cluster shared-data architecture. This novel architecture, specifically designed for the cloud, allows unlimited and independent scaling of both compute and storage, with instant elasticity along both dimensions. The Snowflake cloud data platform is globally distributed, making it one single multi-tenant platform for the world. This enables collaboration between tenants, for example allowing one tenant, a provider, to share a secure view of a database with one or more tenants, referred to as consumers. Our multi-cluster shared-data architecture enables live data sharing without the need to share any compute resources, resulting in full isolation between providers and consumers.
在过去的十年中,我们习惯性地将主流数据分析的基础架构分为数据湖和数据仓库两大类,他们各有利弊,无法充分解决当今数据分析和人工智能的不同需求。基于如上背景,Databricks 从统一、简化和开放的核心理念出发,提出 Lakehouse 架构。Lakehouse 将以全新的数据存储、管理和使用模式,致力于构建一个统一的数据分析和人工智能平台。
作为一种新架构,Lakehouse 将在扩展性、事务性以及灵活度上体现出其独到的优势。伴随着 Lakehouse 在用户实践中的逐步深入,我们也在持续解决如下来自用户场景的更高要求:
本次演讲将以如上 Lakehouse 的重要组件作为脉络,和大家分享 Databricks 在 Lakehouse 上的最新工作进展。
湖仓一体是近年来大数据领域最炙手可热的概念。湖仓一体的出现进一步模糊了数据湖系统和数据仓库系统之间的边界。例如对事务支持、数据治理、BI 支持,可以使得一个原本的数据湖系统相当程度上具备了数仓的能力;而强调存算分离、开放格式、以及多工作负载等,又可以使得一个原本数据仓库的系统具备了数据湖的能力。但是对于企业来说,根据所处阶段的不同,已有历史选型的不同,其大数据系统建设所面临的痛点,以及湖仓一体所能带来的价值点也不尽相同。本次演讲将通过对阿里云湖仓一体落地的典型客户案例的分析,向大家分享阿里云对于湖仓一体的思考以及最新的工作进展。
演讲提纲:
1. 阿里云湖仓一体架构介绍
2. 典型案例落地分析
3. 阿里云湖仓一体下一步展望
你将获得:
数据架构的演进包含了多个不同维度的目标:数据运转的效率,时效,系统的整体成本,性能,系统的可扩展性与可维护性,数据的安全等等。 由于业务形态的差别,不同的公司对数据体系的要求是很不一样的,这就要求数据团队在做架构选型时,要根据业务形态对数据的要求,选取合理的技术方案。同时,业务本身也在成长和变迁,因此在设计数据架构的时候,不仅要解决眼前的痛点,也要解决未来的问题。 基于上面的考量,网易在考虑数据架构的演进时,主要关注的是:1. 数据体系运转的效率;2. 系统的整体成本; 3. 系统的可扩展性与可维护性。本次演讲将会分享网易严选数据团队基于这些目标,持续在做的工作:包括 AutoETL、湖仓一体实践的融合等等内容。
演讲提纲:
1. 网易严选数据架构介绍
2. 更快的数据运转效率
3. 系统的整体成本/可扩展性
你将获得:



微信咨询

电话咨询
微信联系我们

