方向:AI 平台、MLOps/LLMOps 与模型基础设施
-设计并建设支持模型全生命周期的 AI 开发平台,包括数据准备、实验、训练、评估、部署、推理、监控和持续迭代。
-建设标准化的 MLOps 和 LLMOps Pipeline、工具及工作流,支持模型开发、全生命周期管理和生产交付。
-提供可复用的平台能力,支持实验追踪、数据集与模型版本管理、模型评估、模型注册、发布管理和结果复现。
-建设适用于本地、云端、Kubernetes、GPU 集群及混合环境的可扩展训练、微调、评估和推理工作流。
-开发标准化的模型部署与服务能力,包括模型封装、发布、请求路由、负载均衡、弹性扩缩、监控和故障恢复。
-集成并运行主流模型训练和服务框架,例如 PyTorch、DeepSpeed、FSDP、vLLM、SGLang、TensorRT-LLM、Triton Inference Server 或同类技术。
-围绕性能、可扩展性、GPU 利用率、显存效率、可靠性和成本,优化模型训练与推理系统。
-通过标准化开发环境、SDK、API、模板、CI/CD Pipeline 和自助式平台能力,提升 AI 开发者体验。
- 建设 AI 工作负载的可观测性、资源调度、容量管理、成本监控、安全及治理能力。
-与研发、数据及应用团队协作,将模型开发需求转化为可复用的平台与基础设施能力。
任职要求:
-硕士及以上学历,计算机科学、软件工程、云计算、大数据、系统工程、数学、人工智能等相关专业
-具备扎实的编程和软件工程能力,熟悉 Python、Java、Go、Scala、C++、Rust 或其他相关编程语言。
-熟悉至少一个专业方向的相关技术,例如数据工程、工作流编排系统、云平台、Docker、Kubernetes、GPU 集群、分布式训练框架、模型服务系统或 Agent 框架。
-能够将研究、算法、数据或业务需求转化为可复用的工程平台、基础设施、工具和工作流。
-具备较强的系统设计、问题解决、故障排查和性能分析能力。
-具备良好的沟通和跨团队协作能力,能够与研究、算法、数据、产品及应用团队高效合作。