随着系统的复杂性不断提升,系统的性能分析、优化方式也要不断改进。一起关注最新的系... 展开 >




拥有十余年高性能分布式系统,微服务高可用架构工作经验,先后在 Facebook,Pinterest 参与和主导大规模分布式图数据库,NoSQL 存储系统,机器学习推理平台等项目的设计和研发。目前在小红书负责公司的云原生架构,高可用的服务架构,数据库,缓存和 NoSQL 存储系统。
随着系统的复杂性不断提升,系统的性能分析、优化方式也要不断改进。一起关注最新的系统性能分析与优化技术,包括系统架构稳定性设计,云原生结合的架构性能优化。
随着数字化产业的不断发展,数字化运营、实时大屏、监控告警、交互式报表等逐渐成为日常业务刚需,业务对时效性和灵活性的需求正变得越来越强烈,实时数据分析系统正逐步成为驱动业务发展的核心引擎。与自建 OLAP 相比,在云上提供云原生的数据分析服务,在成本、资源弹性和运维管理等方面具有很大优势,但同时,在规模和稳定性上却面临诸多挑战。
我们基于 Presto 提供 PB 级日志分析服务,不仅面向阿里巴巴集团和蚂蚁集团数千个研发团队,更广泛服务于云上百万用户,随着业务发展,系统规模不断扩大,目前系统每天处理8亿次查询,千万亿级数据行,PB 级数据大小,同时要满足海量用户的高并发、低延迟查询。用户对服务的可用性、并发度、稳定性、资源的弹性扩展和调度等方面都提出了更高的挑战和要求。
本次分享主要介绍我们在应对这些挑战过程中的系统架构演进和优化实践。
演讲提纲:
你将获得:
Kubernetes 在设计之初,并没有考虑多集群场景,其管理能力一直停留在单集群级别。随着企业容器规模越来越大,运营和管理几十个 Kubernetes 集群已经成为一种心智负担,此外随着企业实施多云多活战略,对应用的容灾和自动迁移提出了更高的要求。因而建设一个多集群管理系统,成为了一个强需求。本次分享主要介绍小红书关于多集群 Kubernetes 架构的思考和实践,以及多个团队在实践过程中协作层面上的经验。
演讲提纲:
你将获得:
抖音商业化营销业务做为字节商业化的重要组成部分,有着业务场景复杂、稳定性要求高(客户多为品牌商广告主,投放效果不稳定将直接损伤客情、影响复投)等特点。并且部分核心场景和抖音主站场景耦合,为此我们先进行了系统架构层面的解耦,然后进行了多次系统架构升级与优化。系统架构升级和优化具体思路包括强弱依赖分级治理、容灾降级、容量规划等,同时进行常态化线上演练保障稳定性。
最终,我们的系统架构顺利经过抖音多个业务场景百万 QPS 考验,业务投放效果稳定,双十一、国庆等重要营销节点做到了零投诉零资损,同时所负责的项目多次斩获国内广告大奖。
演讲提纲:
你将获得:



