岗位职责
1、负责甲方客户公司应用系统全生命周期运维管理,包括但不限于系统配置、中间件及应用程序的安装、部署、调试,以及日常运行监控、故障定位、分析与快速处理,保障系统高可用、稳定运行。
2、负责AI引擎相关运维工作,承担算力卡依赖包部署、环境配置、运行监控,以及AI引擎运行过程中的故障排查、问题处理,配合AI团队完成引擎优化迭代。
3、负责docker、k8s集群的架构设计、规划与落地实施,包括集群基础架构搭建、部署配置、应用发布、扩容缩容及日常运维,保障容器集群稳定高效运行。
4、负责系统变更全周期管理,统筹推进系统升级、版本变更、平台迁移等重大变更工作,制定变更方案、风险预案,组织变更实施及事后复盘,确保变更安全可控。
5、负责服务器、数据库、中间件的部署、参数优化及安全加固工作,定期开展安全巡检、漏洞扫描,防范安全风险,保障系统数据安全与运行安全。
6、负责维护系统管理文档、技术知识库,及时更新运维流程、操作手册、故障处理案例等内容,提升团队运维效率与知识沉淀。
7、负责国产化硬件、算力设备、操作系统及数据库的部署、调试与日常运维,积累国产化环境运维经验,配合完成国产化替代相关工作。
8、协助完成网络设备(交换机、防火墙等)的基础配置、调试,参与服务器机柜上架、布线等机房基础运维工作,配合网络团队保障机房网络通畅。
任职要求
1、本科及以上学历,计算机相关专业(计算机科学与技术、软件工程、网络工程等),3年及以上运维相关工作经验,有AI运维、容器运维经验者优先。
2、熟悉应用系统部署与运维流程,具备中间件(Tomcat、Nginx、kafka等)、数据库(MySQL、Oracle等)的安装、配置、优化及故障处理能力。
3、具备AI引擎运维相关经验,熟悉算力卡依赖包部署、AI环境配置,能独立完成AI引擎常见故障定位与处理。
4、精通docker容器技术,熟练掌握k8s集群的部署、管理、应用发布及故障排查,能独立完成集群架构设计与优化。
5、具备系统变更管理意识,有重大系统升级、迁移等变更项目全周期管理经验,能制定合理的变更方案与风险预案。
6、有国产化硬件、算力设备、操作系统(如麒麟、统信)、数据库(如Kingbase、vastbase)实际部署与运维经验者优先。
7、了解网络基础原理,熟悉交换机、防火墙等网络设备的基础配置,具备服务器机柜上架、布线等机房运维基础能力。
8、具备较强的问题分析与解决能力、责任心强,工作严谨细致,能承受一定的工作压力及短期出差,具备良好的沟通协调能力与团队协作精神。
9、熟悉Linux系统操作,具备Shell脚本编写能力者优先;有相关运维认证(如CKA、RHCE)者优先。