高可用高性能业务架构是一个经典话题,一直伴随一个个快速迭代的改善人类生活的互联网... 展开 >







腾讯专家工程师、微信架构部架构总监,负责微信后台基础业务架构,包括分布式存储平台和后台服务框架等。近两年专注于后台服务质量提升和高性能架构,构建了分布式数据库 PaxosStore 系统,支持过亿 TPS 的跨数据中心事务,应用于微信多个产品包括基础消息与朋友圈、公众平台与微信支付等。
高可用高性能业务架构是一个经典话题,一直伴随一个个快速迭代的改善人类生活的互联网产品被持续讨论着。来到 2021 年,我们挑选了业务云原生架构、推荐系统以及线上生活等热点话题来探讨技术的发展方向,希望能沉淀一些最佳实践和大家一起进步。本专题将邀请一线专家分享在不同团队、不同业务场景、不同技术栈下,如何实现业务的快速开发并保证其架构具备良好的扩展性和容错能力,如何分析关乎用户体验的系统瓶颈和构建高性能系统。
关注方向 1:业务上云给大家提供了无限的想象空间,痛苦的机房裁撤、漫长的机器申请等等似乎都成为过去,然而上云也伴随着架构的适应阵痛、配套的重新学习,希望邀请一线大厂大业务分享上云经历。
关注方向 2:部分大厂业务上云节奏比较快,会更关注上云的程度和质量,云原生才是上云的最终态,希望邀请上云成熟度高的业务团队分享云原生改造过程。
关注方向 3:推荐系统和传统业务架构有较大的区别,特征工程、训练与推理、数据实时反馈等等并没有通用的标准,但实时推荐是一个热门的方向(如推荐系统参考你刚读过的文章、刚看过的视频实时调整接下来推荐的内容),希望邀请在推荐实时性有经验的团队分享。
关注方向 4:直播、远程办公等相关团队,过去一年业务飞速发展过程中的架构实践。
微信早在 2015 年,参考 Google borg 论文及其他资源猫管理系统,开始了 Yard(Yet Another Resource Dispatcher) 系统研发,并于 2016 年逐步接入了微信大部分后台服务,解决了微信在线服务合并部署、资源管理、实时调度及扩缩容等问题。随着 K8s 技术的推广与成熟,K8s 逐渐成为了业界资源管理系统的事实标准,同时,自研 Yard 系统在长期的运营改造中,架构重构的方向越来越与 K8s 趋同,如容器化支持、灵活的调度策略、HPA、GPU 等 K8s 社区已相对成熟方向。在此大背景下,微信于 2020 年开始把在线资源管理系统由自研 Yard 切向 K8s,开始了微信后台云原生之路。
本主题阐述了微信当前的系统架构及容灾设计,分享微信后台在高可用的要求下进行容器化改造及平滑迁移 K8s 系统面临的各种问题及挑战。
演讲提纲:
1. 微信后台架构及容灾设计
2. 微信后台容器化改造的挑战
3. 支持Yard与K8s的“混合云”系统设计及实现
4. 成果展示
在 K8s 高可用领域有一个问题被大家所熟知,那就是 K8s 单集群规模带来的 SLO 问题。如果 ASI 单集群规模支撑超过社区的 5000 台,如何持续保障?这是个非常有意思且具备极大挑战的事情。这对需要进行 K8s 生产化的同学,甚至具备 K8s 生产化经验的同学来说,一定会是个感兴趣的话题。而 ASI 在单集群的规模从最初的 POC 100 台,到 4000 台,增长到 6000 台、8000 台,一直最终增长到 10000 台,每一次集群规模的增长,伴随着业务的增长和多样化,压力也在逐步发生着质变,给我们带来的挑战每一次都是不一样的,每一次都要比前一次挑战更大。 另外在我们的场景中还有一个问题,就是 K8s 集群成千上万,还牵涉到数百人以上的研发运维人员,功能发布频繁的迭代开发模式以及业务种类繁多带来的运行时的复杂多变,实现“4个9”(1-5-10目标),其难度不言而喻。 本次分享将为大家介绍阿里巴巴使用 K8s 开源项目如何从抗住,到建设出高可用体系的经验。
演讲提纲:
1. 背景:大规模 K8s 集群面临的问题与挑战
2. 高可用体系的设计
3. 高可用基础能力的关键部分
4. 高可用应急体系的关键部分
你将获得:
面对国内疫情的积极向好趋势下,出行需求开始快速恢复。在今年的清明小长假、五一长假下,同程旅行迎来了历史流量的新高峰,主落地页流量较日常翻三倍。而去年做完降本增效的同程私有云平台,通过弹性计算完成了不新增资源、业务无感、无损单的预定技术目标。今天和大家聊下峰值流量应对、故障自愈、降本增效的核心技术——弹性计算体系的设计思考与在同程旅行的落地经验。其中包括如何自动化地确定扩缩容指标、峰值流量应对、离在线混合部署、线上故障自愈等,希望能为大家提供新的思路或者启发。
演讲提纲:
1. 出行需求快速上涨提出的挑战
2. 同程私有云平台弹性计算架构及整体解决方案
3. 自动化的计算服务的扩缩容指标
4. 在峰值流量下利用弹性扩缩容保障稳定性
5. 利用弹性计算完成降本增效
6. 解决稳定性的最后一公里-自动漂移解决单机稳定性
7. 一些展望和总结
听众受益:
数据和算法会对推荐系统的效果产生重要的影响,但系统的实时性也是重要的一环。实时可以给用户更精准的推荐,让新发表的好内容更快的成为热点,整个生态形成正循环。实时推荐系统需要全链路都是实时的,不能出现短板。因此,我们分析了推荐的全链路,对其中的“非实时”部分,做了针对性的极致优化,主要包括特征服务、模型上线、检索召回三大部分,最终使得这些流程都达到了毫秒级或秒级的实时性。用户当前的行为为几秒后就会对推荐结果产生影响,助力各业务实现了秒级的实时推荐系统。
演讲提纲:
1. 推荐系统中实时性的意义和挑战
2. 实时的特征服务
3. 实时的模型上线
听众收益:
东南亚因语种多样、语料库缺失、GIS 地理信息薄弱等多种原因,其末端物流发展还处于依靠人工的初级阶段,导致效率低下、准确受限、拓展速度受限。本分享将介绍 Shopee 如何基于大数据、人工智能等技术,在东南亚各个国家实现末端物流分拣的自动化、智能化,从而支撑 Shopee 快速发展的最佳实践。
演讲提纲:
1. 东南亚末端物流之痛
2. Shopee 末端物流解决方案
3. 未来展望
随着外卖广告业务的不断迭代,目前已拥有5大业务方向,20+ 条业务场景,在迭代过程中,逐渐出现了业务逻辑复用度低、PM、RD 信息获取难等问题,直接影响着迭代效率。因此我们启动了平台化项目,意在从产研迭代的全流程进行升级改造,提升整体迭代效率。我们结合业务现状问题,提出了整体打法:标准化,平台框架,产研新流程 3 个核心点,其中在标准化过程中,我们聚焦在功能、数据协议、流程 3 个维度。在平台框架层面,在 3 高层面(高性能,高可用,高扩展),我们进行了大量思考。在产研新流程层面,在产研的 3 端也进行了一系列的改造,保证平台化整体推进落地。基于上述方案,平台化在广告业务场景落地后,取得较好的收益。
演讲提纲:
1. 背景
2. 架构解读
3. 成果展示
4. 总结
你将获得:
Metrics 监控是字节跳动重度依赖的可观测性手段,目前字节国内机房 Metrics 打点量已经达到 10+ 亿每秒。字节自研时序数据库,正是 Metrics 数据的载体。它以高可用、高性能为设计目标,同时具备亿级写入吞吐、秒级查询时延的能力。本次分享主要包含该时序数据库的整体架构、内核探究、周边生态等。
演讲提纲:
1. 字节自研时序数据库概述
2. 字节自研时序数据库内核探究
3. 业务支撑案例
4. 总结和展望



微信咨询

电话咨询
微信联系我们

