专题演讲嘉宾:许辰

字节跳动高级工程师

本科和硕士毕业于北京大学,目前在字节跳动负责 Kubernetes 中心管控系统的性能优化与可扩展性构建。

by 许辰

字节跳动
高级工程师

在字节使用 Kubernetes 的过程中,随着集群规模增大到 1w 节点左右,etcd 成为制约集群可扩展性的瓶颈,经常出现读写延迟增高、OOM 等问题。

针对以上问题,字节自研了 KubeBrain 代替 etcd 作为 Kubernetes 的元数据存储系统,旨在提高 Kube-APIServer 存储的读写性能,增强集群稳定性。

KubeBrain 构建在分布式的 multi raft group 的强制一致性 KV 之上,并支持事务写、快照读、Watch 等需求,同时针对 Kubernetes 场景做了深度的性能优化。

经过性能测试,KubeBrain 的读写性能大幅超过 etcd,在压测场景中,我们的 Kubernetes 集群到达了 5w 节点,200w Pod 的规模。线上集群规模到达了 2k Node,持续逐步上量。

演讲提纲:

  1. 在大规模 Kubernetes 集群实践中,遇到的 etcd 相关瓶颈与相关分析
  2. KubeBrain 的设计思路与实现介绍
  3. KubeBrain 字节内部的落地情况与效果
  4. KubeBrain 的未来规划

你将获得:

  1. etcd 瓶颈分析
  2. Kubernetes 元数据存储系统的需求、特点
  3. 高性能 Kubernetes 元数据存储的设计思路与架构
票务小姐姐