阿里搜索引擎调度系统的核心架构和研发,容器化和混部 Owner;阿里调度系统 Sigma 核心架构和研发,负责混部核心架构;阿里 Kubernetes 化的负责人以及高可用体系建设负责人。

阿里搜索引擎调度系统的核心架构和研发,容器化和混部 Owner;阿里调度系统 Sigma 核心架构和研发,负责混部核心架构;阿里 Kubernetes 化的负责人以及高可用体系建设负责人。
在 K8s 高可用领域有一个问题被大家所熟知,那就是 K8s 单集群规模带来的 SLO 问题。如果 ASI 单集群规模支撑超过社区的 5000 台,如何持续保障?这是个非常有意思且具备极大挑战的事情。这对需要进行 K8s 生产化的同学,甚至具备 K8s 生产化经验的同学来说,一定会是个感兴趣的话题。而 ASI 在单集群的规模从最初的 POC 100 台,到 4000 台,增长到 6000 台、8000 台,一直最终增长到 10000 台,每一次集群规模的增长,伴随着业务的增长和多样化,压力也在逐步发生着质变,给我们带来的挑战每一次都是不一样的,每一次都要比前一次挑战更大。 另外在我们的场景中还有一个问题,就是 K8s 集群成千上万,还牵涉到数百人以上的研发运维人员,功能发布频繁的迭代开发模式以及业务种类繁多带来的运行时的复杂多变,实现“4个9”(1-5-10目标),其难度不言而喻。 本次分享将为大家介绍阿里巴巴使用 K8s 开源项目如何从抗住,到建设出高可用体系的经验。
演讲提纲:
1. 背景:大规模 K8s 集群面临的问题与挑战
2. 高可用体系的设计
3. 高可用基础能力的关键部分
4. 高可用应急体系的关键部分
你将获得:



微信咨询

电话咨询
微信联系我们

