岗位职责
结合最新大模型技术进展,聚焦以下两类核心技术问题:
- 语义感知的端到端语音增强联合优化 传统增强算法仅追求频谱失真最小化(PESQ),常导致语音语义扭曲。我们将探索基于大模型先验的语义感知增强范式: a.音频增强 Token 与后端模型联合建模:研究将神经编解码器的音频增强 Token 直接作为大模型输入,探索增强模块与 LLM 等后端任务的端到端联合训练,利用 LLM 的语义预测能力修复弱网或强噪下的语音缺失。 b.语义一致性优化准则:建立兼顾听感质量(PESQ/STOI)与语义完整性(WER)的多目标优化函数,确保增强后的语音在保留高保真听感的同时,最大化后端任务模型的理解准确率。
- 复杂声学场景下的多模态鲁棒感知 针对远场、多说话人及非平稳噪声场景,研究多模态融合的语音增强技术: a.多通道语音交互:研究基于深度学习的非线性 AEC 算法,探索回声消除与感知交互大模型的端到端建模,提升复杂场景理解力,降低链路耗时和效果损耗,保障弱网环境下的音频完整性与交互连续性。 b.听觉注意力空间信息建模:结合麦克风阵列拾音、多音源通道及多模态的空间信息,探索跨模态注意力机制,模拟人类“鸡尾酒会效应”,动态聚焦目标声源,推进生成式目标说话人抽取、音源分离等任务的技术边界,提升嘈杂环境下的交互鲁棒性。
职位要求
- 计算机科学、人工智能、电子工程、自动化或相关专业研究生在读。
- 掌握 主流开源工具和框架(如TensorFlow、PyTorch)。具备出色的编程能力,熟练掌握Python或其他相关编程语言,具有良好的代码编写习惯和程序开发经验。
- 在顶级会议(ICASSP/InterSpeech等)或期刊上发表过相关领域的论文,或者有知名开源项目经验。
- 具备独立科研能力、严谨的工程实现习惯及良好的团队协作意识。