工作职责
1. 主导蚂蚁集团核心BU的稳定性治理体系建设,覆盖风险识别、方案设计与落地全流程,构建金融级系统的风险防控屏障。
2. 设计并落地高可用架构方案,通过故障演练(Chaos Engineering)与应急预案建设,提升系统在极端场景下的韧性。
3. 建立稳定性度量体系,推动SLA/SLO的定义与持续优化,保障核心业务的服务质量。
4. 负责双11、618等大型活动的全链路技术保障,主导容量评估、压测验证及限流降级策略设计与演练。
5. 面向蚂蚁核心BU设计端到端上云/迁移方案,推动架构向标准化信创云演进,平衡稳定性与长期维护成本。
6. 支撑IDC选址、服务器选型、云产品开服等全链路资源交付,结合业务特性完成资源需求评估与供给节奏规划。
任职要求
1. 具备扎实的计算机基础,精通Linux、虚拟化、容器及K8s技术,熟悉操作系统、网络与数据库底层原理。
2. 熟悉云计算核心产品(ECS、ACK、OSS、RDS、SLB等),了解云原生与Serverless技术体系。
3. 掌握稳定性治理方法论,具备故障演练、高可用架构设计、容量管理及应急响应的实战经验。
4. 满足以下项目经历之一:主导大型客户上云/迁移项目、参与大型互联网/金融系统稳定性治理、主导双11/618级大促技术保障。
5. 具备端到端方案设计与跨团队项目推动能力,能将技术方案转化为业务价值,具备前线技术赋能经验。
6. 能在高压环境下主动承担责任,具备极强的应急处置能力与问题解决能力。