腾讯大规模云原生平台稳定性实践

所属专题:下一代云原生技术体系

嘉宾 : 唐聪 | 腾讯云TKE稳定性负责人

会议室 : 宴会厅3

讲师介绍

专题演讲嘉宾:唐聪

腾讯云TKE稳定性负责人

唐聪,腾讯云 TKE 稳定性负责人,腾讯云技术专家,极客时间专栏《etcd实战课》作者,etcd 活跃贡献者,主要负责腾讯云大规模 K8s/etcd 平台、有状态服务容器化、在离线混部等产品研发设计工作。

议题介绍

演讲:腾讯大规模云原生平台稳定性实践

随着云原生技术的逐步推广,越来越多业务开始使用云原生容器化的方式去构建自己的应用。Kubernetes 作为云原生容器调度平台,成为大家的一致选择,并基于 Kubernetes 衍生出了Serverless、边缘计算、Mesh 平台等一系列云原生平台解决方案。 本次分享将为你介绍腾讯在构建大规模云原生平台过程中,提升稳定性的实践经验。首先将为大家分享 Kubernetes 典型故障案例,了解搞崩 Kubernetes 集群的若干种方式,并详细介绍相应的解决方案。其次将分享如何通过大规模 etcd 平台的建设、使用 Kubernetes 集群来高效治理 master 组件等机制,实现自动化的数据迁移、弹性扩缩容、巡检、故障自愈等,最终显著提升云原生平台的稳定性。以上方案作为腾讯的云原生平台的底座,成功支撑 Kubernetes、Serverless、边缘计算、Mesh 等一系列云原生基础平台。  

演讲提纲:

1. Kubernetes 典型故障案例分析与最佳实践

  •  apiserver 故障典型案例分析
  •  etcd 故障典型案例分析
  •  kcm 等其他组件典型故障案例分析

2. 大规模 etcd 平台

  • 基于 Kubernetes 的扩展机制构建的 etcd 平台
  • K8s 数据平滑迁移
  • 跨地数据同步及容灾方案

3. Kubernetes 其他 master 组件治理

  • 基于 Kubernetes 的扩展机制管理 master 组件
  • 资源画像、弹性伸缩
  • 自动化巡检、自愈机制等运维能力建设
  • 混沌工程、故障演习机制

4. 未来规划与总结

你将获得:

  • 掌握 Kubernetes 的常见故障的解决方案和最佳实践
  • 大规模云原生平台 Kubernetes 组件的高效治理解决方案
  • 腾讯大规模云原生平台落地实践与思考  

交通指南

深圳 · 大中华喜来登酒店

Sheraton Shenzhen Futian Hotel
地址:中国广东省深圳市福田区福华路福华路大中华国际交易广场
  • 微信咨询

  • 电话咨询

    联系电话:17310043226

微信联系我们

票务小姐姐