岗位职责:
1、研发与落地前沿语音算法:负责智能硬件设备上端到端语音交互系统的研发,包括语音识别、同声传译及语音对话系统。核心工作是利用SpeechLLM、语音Tokenizer、多模态等前沿技术,在资源受限的硬件上实现低延迟、高精度的语音对话和工具调用。
2、攻克复杂场景下的体验难题:通过研发多说话人分离识别、跨语言实时语音问答、低音质声学环境语音交互、语音指令跟随等关键技术,持续提升音频内容在真实复杂场景下的识别率、理解深度、设备环境交互,直接驱动产品用户体验的提升。
3、技术前瞻与跨团队驱动:紧密跟踪语音与多模态大模型(如moshi、Qwen3-omni)交叉领域的前沿进展;主导技术方案选型与攻关,并协同产品与嵌入式团队,将算法高效转化为稳定的产品特性,保持技术领先性。
岗位要求:
1、经验与基础:计算机、电子信息等相关专业本科及以上学历,具备3年以上语音算法研发经验,扎实的语音信号处理与机器学习基础。有端到端语音系统(从数据、训练、部署全链路)的成功落地经验者优先。
2、核心技能:精通语音识别/声纹识别/语音翻译中至少一个领域,有基于深度学习框架(PyTorch/TensorFlow)的模型优化经验。必须具备在Python环境中进行模型训练、嵌入式平台C++部署优化的完整项目经验。
3、工程能力:优秀的编码与调试能力,熟悉模型压缩、量化(如INT8)、推理加速工具(ONNX Runtime, OpenVINO, TensorRT),能够解决实际项目算法交付的性能与效率瓶颈。
4、工具与框架:熟练使用PyTorch及至少一种主流语音工具链(如WeNet, Icefall, ESPnet, Kaldi)。
加分项:
1、专项技术深度:在多说话人处理、同声传译、语音大模型(SpeechLLM)或多模态语音交互方面有深入研究或项目成果。
2、业界影响力:在ICASSP、Interspeech、ASRU等顶级会议发表过论文,或深度参与过知名开源语音项目(如Icefall、WeNet、FunASR、Nemo等)的核心贡献者。