岗位职责
- 负责声学前端、声学模型、语言模型、后处理、解码器等主要模块的迭代和改进;
- 负责优化双工交互系统,提高系统的鲁棒性和性能;
- 负责优化语音识别大模型、流式语音识别、音频理解大模型、语音端到端大模型等;
- 追踪业界前沿的语音技术,探索语音大模型在业务场景下的应用。
职位要求
- 计算机科学、电子工程、数学或相关领域的硕士及以上学位;
- 深入理解语音识别相关领域的基本概念,包括但不限于语音信号处理、自然语言处理、机器学习和深度学习等;
- 熟练掌握C++/C/Python/Shell等编程能力,并有实际的项目开发经验;
- 精通深度学习框架(如TensorFlow、PyTorch等);
- 具有较强的学习能力,能够快速掌握和应用新技术;
- 具备良好的团队合作精神和沟通能力;
- 有在顶级会议或期刊发表论文者优先;
- 有语音大模型研发经验,熟悉QwenAudio、KimiAudio、FireRedASR等优先。