岗位职责
- 负责全双工语音交互系统的核心算法研发,包括但不限于3A算法、流式语音端点检测(VAD)、说话人分离(Diarization)、话语权决策/轮次检测(Turn-taking)等模块的设计与优化;
- 探索并落地统一的音频理解前端,实现复杂场景下的多人对话理解与交互,解决复杂场景下的端到端语音识别与对话理解问题;
- 跟踪业界前沿的语音/音频技术发展(如最新深度学习架构在音频领域的应用),持续提升现有算法系统的性能与鲁棒性,解决实际业务中的长尾问题
职位要求
- 计算机、电子信息、自动化、声学或相关专业,统招本科及以上学历(硕士/博士优先);
- 具备扎实的音频信号处理或机器学习基础,有智能硬件/IoT设备等场景的音频算法落地与性能优化经验;
- 深入理解语音识别或音频理解系统,对基于大语言模型(LLM)的端到端语音识别与理解有深入研究和实践优化经验;
- 编程功底扎实,精通 Python 和 C/C++,熟练使用 PyTorch/TensorFlow 等至少一种主流深度学习框架; 【加分项】
- 在国内外知名语音/音频挑战赛(如 CHiME、DNS Challenge、Kaggle等)中获得过国际领先名次者优先;
- 在 ICASSP、Interspeech 等语音/音频领域顶级会议或期刊发表过高质量论文者优先。