岗位职责:
1.负责公司超大规模超算集群的SRE体系建立,包括但不限于如下方面:变更管控、运维规范、稳定性机制、风险管控、故障应急&复盘等;
2.负责运维规范、SLI制定,SOP手册编写,并将其工具化、平台化,确保运维安全,提升运维效率;
3.围绕超算业务持续可用目标,持续提升稳定性与 MTTR ,构建智能监控、根因定位、容量监控、故障自愈、降级、限流、智能运维能力,协同&推动全局架构演进,进行前瞻性的设计与规划,为业务持续稳定运行负责
任职要求:
1.熟悉数据中心基础设施层面或应用系统层面的SRE相关的技术架构、有相关的系统体系化建设经验
2.熟悉一种或多种编程语言,如 Python/Go/Java/Shell/,有大型分布式、高性能、高可用系统的设计开发经验;熟悉常用数据库、中间件的技术原理、高可用方案、稳定性保障机制
3.有稳定性保障经验,喜欢做系统连续性、稳定性相关工作,乐于解决技术难题,愿意在技术风险领域长期发展;
4.对 SRE、运维系统、DevOps 拥有深刻理解并且有实践经验者优先;
5.有深度学习、大模型训练或云计算平台运维开发的经验者优先;
6.良好的沟通、协作能力,责任心、自驱力优秀,有良好的问题分析能力。