岗位职责
感知与生成引擎部门,打造下一代AI研发范式和AI应用原生架构的基础设施,包括模型训推、Agent引擎、多模态交互、多媒体技术等。
- 主导前沿语音信号处理算法的研究与开发,包括但不限于语音增强、降噪、分离及信号重构等核心技术创新;
- 深入研发新一代端到端语音识别(ASR)、语音合成(TTS)算法,突破现有架构性能瓶颈;
- 构建面向多语种/低资源场景的自适应语音处理系统,解决跨语言/跨场景的泛化性问题;
- 探索语音处理与大语言模型(LLM)的深度融合,开发创新性语音交互系统;
- 主导从理论创新到工业级落地的完整技术闭环,确保算法在真实场景中的高可靠性。
职位要求
学术要求:
- 博士学位,专业方向为语音信号处理、计算声学、人工智能或相关领域;
- 在语音处理顶级会议(ICASSP/Interspeech)或期刊(IEEE TASLP)以第一作者发表2篇以上高质量论文;
- 具有系统性科研经历,深度参与过国家级重点语音相关课题研究者优先。 技术要求:
- 精通语音信号处理全技术栈(从传统信号处理到时序深度学习);
- 对端到端语音模型(Conformer/Transformer架构)有深刻理论理解与实践经验;
- 熟悉语音处理前沿方向(如神经声码器、语音分离、语音抗噪等);
- 至少主导过一项完整的语音系统研发全流程。 工程能力:
- 精通Python/C++及主流深度学习框架的底层优化;
- 具备大规模语音数据训练与模型压缩的实际经验;
- 具有构建工业级语音系统的完整工程实现能力。 附加要求:
- 获得过重要学术奖项(如IEEE最佳论文奖)者优先;
- 具有国际顶级语音实验室(如Microsoft Research、Google Brain)研究经历者优先;
- 具备跨学科创新思维,在相关领域有专利成果者优先。