岗位名称:大模型测试工程师
岗位概述:
你将负责基于大语言模型(LLM)相关系统的全流程测试工作,包含智能体(Agent)系统测试、大模型微调结果及大模型推理性能测试、RAG系统的准确度和相关性测试。搭建AI专属测试体系与自动化测试平台。本岗位要求深入理解大模型及智能体的核心原理与工程实现逻辑,具备扎实的测试工程能力,通过精准的测试设计、高效的自动化测试落地,保障AI系统在复杂业务场景下的稳定性、准确性、安全性与性能达标,助力AI能力可靠落地。
核心职责(包括但不限于):
AI测试体系搭建:负责设计大模型、智能体(Agent)及RAG系统的测试策略、测试标准与测试流程,覆盖功能、性能、准确性、安全性、鲁棒性等全维度测试场景,解决AI测试中的“不确定性”“幻觉”等核心痛点。
测试用例设计与执行:针对智能体的规划(Planning)、记忆(Memory)、工具调用(Tool Use)能力,大模型微调效果,RAG系统的检索准确性、重排序效果,设计针对性测试用例,执行手动测试与自动化测试,精准定位问题并跟踪闭环。
自动化测试开发:基于Python开发AI测试自动化脚本与工具,集成主流测试框架与大模型生态工具(如LangChain、HuggingFace),实现测试用例自动化执行、测试结果自动分析、异常自动告警,提升测试效率。
性能与稳定性测试:针对大模型推理服务(基于vLLM、TGI、TensorRT-LLM等框架),设计并发测试、压力测试、延迟测试方案,评估系统性能瓶颈,输出性能优化建议;监控线上AI系统运行状态,开展回归测试与异常排查。
测试质量管控:负责AI测试过程中的质量把控,输出测试报告,跟踪缺陷修复进度,推动研发、算法团队优化产品;沉淀测试经验与测试用例库,持续迭代测试方法,适配大模型领域技术迭代速度。
协同与支撑:配合AI应用工程师、算法工程师,理解业务需求与技术实现,提供测试层面的专业建议;参与AI系统需求评审、架构评审,提前规避潜在测试风险。
任职要求(包括但不限于):
计算机、软件工程、人工智能、测试工程或相关专业本科及以上学历。
扎实的软件测试理论基础,熟悉黑盒测试、白盒测试、自动化测试流程与方法,了解深度学习、大模型基本原理者优先。
熟练掌握Python编程语言,熟悉常用测试框架(如Pytest、Unittest),具备一定的脚本开发与调试能力,熟悉Linux服务器操作环境。
了解主流大模型生态工具(如LangChain、LlamaIndex、HuggingFace),或向量数据库(如Milvus、Faiss)、大模型推理框架(如vLLM、TGI)者优先。
具备出色的逻辑分析能力、问题定位能力与学习能力,能够快速跟进大模型、智能体领域的*新技术,适配AI测试的特殊性需求。
具备良好的沟通协作能力与文档撰写能力,能够清晰输出测试报告、缺陷详情与测试方案。
有经验者优先(满足以下一项或多项):
有大模型(LLM)、智能体(Agent)或RAG系统相关测试经验,熟悉AI测试痛点与解决方案者优先。
有自动化测试平台、测试工具开发经验,或熟悉接口测试、性能测试工具(如JMeter、Locust)者优先。
了解大模型微调(SFT)、偏好对齐流程,或具备提示词工程(Prompt Engineering)、大模型评估相关实践经验者优先。
熟悉向量数据库的使用与调优,或有高并发系统测试、服务器端测试经验者优先。
有AI产品安全性测试、鲁棒性测试(如对抗性测试)经验,或参与过AI相关项目测试全流程者优先。