随着产品用户规模越来越大,技术上也带来了复杂性与高可用高并发的“网络... 展开 >




历任 Google 主任工程师,研发经理,顺丰速运业务CTO。主导的项目包括 Google Web Search 索引算法仿真工具研发、网页刷新率估计、Google+ 和 YouTube 的产品集成、YouTube 留言系统索引升级、顺丰速运的中转系统换代、新一代时效管控系统建设等。
随着产品用户规模越来越大,技术上也带来了复杂性与高可用高并发的“网络效应”,只要产品持续迭代,系统就不可能不出问题,而我们要做的是持续进行演进治理,发现问题并将之快速解决,然后沉淀出可以借鉴的方法论。在意识上,安全生产十大法则让我们保持敬畏,如履薄冰。
在高并发上,我们可以通过建设离用户更近的数据中心、AKF 扩展立方体、多级缓存、数据异构、系统性能优化等来提升并发能力;在高可用上,我们可以进行面向失败和韧性系统架构建设保障系统具备自我保护和自愈能力,也需要建设 1510 能力(1 分钟发现 / 5 分钟定位 / 10分钟恢复),在出现问题时快速发现定位并进行快速恢复,并通过自动化巡检、常态化全链路压测、预案演练、混沌工程、容灾逃逸等手段将可用性白盒化、确定性,加强我们对系统的信心。
本专场将邀请不同流量模型和技术视角的业内专家,为大家分享一些可以借鉴学习的解决思路。
阿里云神龙计算平台全链路诊断平台作为整个弹性计算产品的稳定性基石,服务了上百万的弹性计算客户。
本次分享将介绍阿里云弹性计算全链路诊断服务发展的前世今生。在阿里云弹性计算规模日益增长的今天,我们结合阿里巴巴已有的一些底层服务,构建了这套全链路诊断服务,覆盖了线上99.99% 以上的故障&异常处置场景,成为各类大促,客户重保的稳定性利器。本次分享会着重介绍诊断服务在方案设计和落地过程中遇到的痛点和难点,希望与大家一起探讨。
演讲提纲:
你将获得:
第四范式基于100多个实际落地场景,开发了针对机器学习高效供给正确数据的高可用高并发数据库 OpenMLDB。在机器学习工程化落地中,数据供给主要包含特征计算和特征存取两方面功能。
面向离线模型开发和面向在线推理的特征计算,在保证性能需求的前提下,需要产出一致性结果。基于这个线上线下数据一致性的新挑战,第四范式自研了面向机器学习的数据库。其中,如何保障线上推理服务数据供给的高可用、高并发和低延迟,是设计此数据库的最大技术难点之一。
演讲中,我会重点介绍 OpenMLDB 的线上数据供给架构,通过高性能的内存索引数据结构,多副本机制,以及基于现代化异构内存的快速恢复能力,展示 OpenMLDB 的线上服务高可用、高并发架构。
演讲提纲:
你将获得:
直播作为新兴行业,已成为一种现象级的产品,基于直播产生的打赏、电商、PK、游戏等业务,带来千万级别的同时看播人数和亿级并发流量。如何承载常态化亿级并发流量、满足高时效性要求、保障服务的高可用、支持各类重大直播活动,将是我们面临的巨大挑战。
本次分享会重点分析直播场景下遇到的这些难点和挑战,并分享如何解决这些问题,希望和大家一起探讨。
演讲提纲:
你将获得:



