关注数据中心、分布式系统、容器等基础设施技术,也可以从存储 + 计算 + 研发体... 展开 >




清华大学计算机系教授,国家自然科学基金杰出青年基金获得者。中国机算机学会杰出会员和杰出讲者,副秘书长,CCF Fellow。ACM 中国理事会副主席,ACM SIGOPS 亚太地区操作系统会议 APSys 指导委员会主席。长期研究高性能计算编程模型和编译系统,近几年在以图计算系统为代表的新一代大数据处理系统方面有较为深入的研究。
关注数据中心、分布式系统、容器等基础设施技术,也可以从存储 + 计算 + 研发体系这三个角度来分享话题,分享架构与业务的融合。
随着小红书业务体量迅速上涨,缓存系统(Redis)规模也在不断扩张,目前整体 QPS 高达 2 亿 +,内存 300TB+。 如何保证大规模缓存系统的高性能、高可靠、低成本是一件非常有挑战的事情。目前我们在 Redis 的中间件、内核、服务编排等多方面进行优化,探索出一条缓存服务多云部署之路,从而显著提升系统可靠性和降低成本。
本次议题我将为你分享小红书缓存服务多云建设之路,希望对你有所启发。
演讲提纲:
你将获得:
随着字节 Kubernetes 集群规模的不断增大,业务种类的不断丰富,Kubernetes 原生调度器的性能已经是一个越来越明显的瓶颈。我们先是在 Kubernetes 原有框架基础上,结合字节业务特点,优化调度器实现,吞吐提升几十倍(约 1K+ Pods/s)。但是随着在离线融合工作的开展,优化后的调度器也无法在功能和性能上满足要求,所以我们又自研了一套分布式调度系统来解决这些问题,可以同时支持在离线的任务调度,吞吐已经可以达到 8K+ Pods/s,而且还在不断提升中。
演讲提纲:
你将获得:
随着阿里云云服务器 ECS(Elastic Compute Service)的规模逐渐扩大,如何对其进行高效稳定地自动化运维是一件很有有挑战的事情,对此,我们建立了一套完整的自动化运维平台,包括:监控数据采集、全链路诊断分析、自动化运维、故障快恢、客户侧事件等,本次分享将着重介绍阿里云超大规模弹性计算节点自动化运维系统如何落地实施以及稳定性实践。
演讲提纲:
你将获得:



