架构稳定性保障

会议室:宴会厅2
出品人:郝豪

互联网发展过程中,业务快速迭代是一个显性需求,产线问题发现、定位、改进优化、长期... 展开 >

专题出品人:郝豪

得物App稳定生产负责人

在互联网领域拥有10+年移动互联网、中间件研发、架构设计、稳定性建设及团队管理经验。All in无线时期加入阿里,参与手淘若干无线中间件建设;参与Voyager平台(阿里国际化)建设,Owner Lazada 数次S级大促(Bday/D11/D12)稳定性和 Cloud hosting事项。2021年加入得物App负责稳定生产运营体系建设,主导构建小得物灰度环境、全栈可观测平台、P0链路混沌工程演练、NOC-SLA(应急保障体系)、故障管理和技术支持体系。

地点:宴会厅2

专题:架构稳定性保障

互联网发展过程中,业务快速迭代是一个显性需求,产线问题发现、定位、改进优化、长期治理又是一个隐形需求。稳定性保障SLA如何定义,组织层面如何构建/运营稳定性团队,互联网领域资损治理方面经验,端到端可观测体系建立。本主题重点关注这个隐形需求交付和长期发展。

by 李波

顺丰科技
AI产品技术总监

作为相对传统的物流行业,随着“互联网+物联网”的快速发展,在业务的过程中沉淀了大量的数据,如何将“数据”转化为“数据资产”,推动物流行业数字化转型与数据价值实现是未来的发展方向。“感知设备+物联网+边缘计算+云原生+AI大数据”成为整个物流行业进行数字化降本增效、提高物流企业竞争力的新技术路径。

在顺丰持续提升核心竞争力的战略背景下,经过多年的行业深耕与洞察,自主研发建立了AIoT视觉感知应用平台:“慧眼神瞳”。本次分享主要围绕“慧眼神瞳”在智能设备、边缘计算、云端、大数据等技术如何应用落地、SaaS 产品化如何改造以及如何通过技术手段满足客户对系统稳定性要求。

演讲提纲:

  1. 神瞳产品介绍&挑战
  2. 系统架构优化&演进
  3. 系统全链路平滑升级方案
  4. 预先感知故障方案

你将获得:

  • 了解架构演进过程面对挑战与应对措施
  • 了解内部系统如何转变成SaaS平台
  • 端到端全链路平滑升级与故障定位的实战经验

by Chuan Chen

Google Cloud
应用现代化架构师

在这个快节奏的数字化时代,随着企业应用程序数量的不断增加,对于如何保证应用程序的可用性和稳定性提出了更高的要求。为此,打造一个混沌稳定的 Kubernetes 集群,成为了保障应用程序高可用性和稳定性的关键。通过持续校验、弱点分析等混沌实验来测试系统的韧性和容错性,从而增强系统的抵御混沌的能力。

在保证系统稳定性的同时,Kubernetes 集群还能够快速地适应不同的环境和场景,灵活扩展,提供高效、可靠的容器编排服务,帮助企业更好地管理云计算业务,提高业务效率和安全性。

演讲提纲:

  1. Kubernetes 集群的应用场景
  2. 混沌工程实践与开源工具
  3. 打造混沌稳定的 Kubernetes 集群的实践
  4. 实践中遇到的挑战和解决方案
  5. 混沌工程和 Kubernetes 集群的未来发展趋势

你将获得:

  • 深入了解 Kubernetes 集群的基础知识和应用场景,了解 Kubernetes 集群的重要性和部署管理方法。
  • 了解混沌工程的概念和意义,学习混沌工程的实践方法和开源工具的使用。
  • 了解如何使用开源工具来优化 Kubernetes 集群的性能和稳定性,并避免常见的故障和问题。
  • 学习最佳实践和成功案例分享,了解实践中的挑战和解决方案,并获得实践经验和收获。
  • 了解混沌工程和 Kubernetes 集群的未来发展趋势,掌握最新的技术趋势和发展动态。

by 朱剑峰

网易数帆
资深架构师

在企业数字化转型的背景下,经过近几年微服务、容器技术的引入后,传统企业尤其是金融企业逐渐形成围绕云原生化的业务系统。

本议题将主要分享:为了大规模云原生化推广应用,如何建成云原生PaaS技术平台提供一站式云原生能力供给模式,重点介绍在传统企业大规模转型进入深水区所亟需的可视化运营,风险预见、根因分析及稳定性保障体系的演进与实践。在异常发生后进行快速止损,实现风险免疫闭环的体系建设与实践。

演讲提纲:

  1. 云原生PaaS技术底座建设与推广所面临的挑战
  2. 云原生架构下风险预见与根因分析的演进与实践
  3. 未来视野,云原生稳定性风险免疫体系在金融科技的展望

你将获得:

云原生稳定性保障体系主题较大,横跨业务设计、中间件、云原生平台、质量评估、运维运营体系,垂直领域有创新性,需要规划合理流程,逐步建设,横向对齐目标。

by 戴明智

微盟
基础架构/技术专家

随着近几年微盟业务范围的快速拓展,商家用户不断增多对微盟业务研发团队提出更高的版本迭代速度与质量要求:1. 研发团队需要进行多版本并行测试;2. 在快速迭代上线的过程中,需要降低对生产环境稳定性的影响,做到又快又稳。

基于此,全链路灰度平台应运而生。借助平台,研发可以根据迭代诉求快速隔离一套测试环境,各个环境之间互不影响。除此之外,平台提供了逐步放流、动态扩容、秒级回滚、灰度平滑转正等一系列能力降低发布风险,保证生产安全。

得益于灰度平台,目前我们研发团队基本可以做到:零故障上线、发布零流量损失,极大的保障了微盟的生产环境稳定性。

演讲提纲:

  1. 全链路灰度需要解决哪些问题
  2. 针对这些问题有哪些解决方案
  3. 微盟已落地的全链路灰度平台介绍

你将获得:

  • 了解全链路灰度的落地过程,以及落地过程中需要解决的问题
  • 了解全链路灰度发布的过程,一次完整的灰度发布应当包含哪些阶段
  • 灰度发布如何从灰度状态平滑过渡到正式版本

by 李尊

得物App
监控平台/架构师

近年来,随着微服务和云原生架构的兴起,可观测的边界与分工被重新定义。可观测本质上是对各类观测数据进行采集、存储和分析。其中对数据的分析能力决定了上层问题发现、故障定位的及时性和准确度。使用多套系统的组合方案,无论是从使用便捷性、数据关联互通、跨数据源分析还是维护代价等方面,都存在极大的挑战。

2018年,可观测性被引入IT领域,逐渐取代传统的系统监控技术,促使从被动监控系统数据转向主动观测应用关联的各类数据,成为云原生领域最热门技术之一。

在这种背景下,我们开发了一套全栈的可观测数据平台,它基于 OpenTelemetry 可观测数据的统一存储和融合分析,打破了观测数据孤岛,大大提升了对可观测数据的价值挖掘能力。

演讲提纲

  1. 问题背景
    • 得物可观测性平台的演进
    • 云原生可观测性面临的痛点和挑战
  2. 得物可观测性平台的落地实践
    • 分布式链路基于 OTEL 的在得物的大规模落地
    • 分布式链路降本增效之冷热存储
    • 分布式链路降本增效之对象存储
    • 得物可观测平台产品介绍
  3. 下一步规划
    • 元数据打造以应用为中心的 CMDB
    • 性能剖析之“主动剖析”

你将获得:

  • 云原生分布式链路追踪在得物的落地实践
  • 降本增效环境下得物是如何实现分布式链路数据“零成本”存储
  • 大规模分布式链路分析在得物的落地实践
  • 可观测数据联动在得物的落地实践

交通指南

上海·明捷万丽酒店

Shanghai Marriott Hotel Parkview
地址:上海市普陀区铜川路50号近岚皋路5号口20米
小姐姐