岗位职责
以实时语音通话、全双工对话 AI、云端协同渲染为代表的应用场景对音频链路提出了三大核心诉求:极低延迟(端到端延迟 < 100ms)、高保真音质(宽带/超宽带音频质量)、高鲁棒性(复杂声学环境与弱网条件下的稳定表现)。然而,现有技术在以下方面存在显著瓶颈:
- 极低延迟音频 3A 处理的技术瓶颈: 传统自动增益控制(AGC)、自动噪声抑制(ANS)、自动回声消除(AEC)算法在追求信号质量的同时引入了不可忽视的处理延迟(通常 20-60ms),且各模块独立优化导致累积延迟和级联失真。在端到端延迟敏感的全双工交互场景中,传统 3A 管线已成为制约交互流畅性的关键因素。
- 弱网与噪声环境下的语音完整性: 网络丢包、抖动、带宽受限等弱网条件,叠加远场拾音、背景噪声、多人说话等复杂声学场景,导致接收端音频出现断帧、失真、语义缺失等问题,严重影响用户体验和后端语音识别/理解的准确率。
- 音频传输效率与音质的矛盾: 传统音频编解码器(如 Opus、AAC)在低码率(≤16kbps)下音质急剧下降,而高保真编解码又带来带宽压力。在大规模并发通信和移动端受限网络条件下,如何在低码率下维持高保真音质,是亟待解决的核心问题。 面对上述挑战,亟需探索极低延迟 3A 处理、生成式实时语音修复、低码率高保真音视频编解码三位一体的创新技术体系,通过信号处理与深度学习的深度融合,突破传统音频通信的技术边界,全面提升实时语音交互的体验与效率。
职位要求
- 计算机科学、人工智能、电子工程、自动化或相关专业研究生在读。
- 掌握 主流开源工具和框架(如TensorFlow、PyTorch)。具备出色的编程能力,熟练掌握Python或其他相关编程语言,具有良好的代码编写习惯和程序开发经验。
- 在顶级会议(ICASSP/InterSpeech等)或期刊上发表过相关领域的论文,或者有知名开源项目经验。
- 具备独立科研能力、严谨的工程实现习惯及良好的团队协作意识。