岗位职责
- 设计并研发高性能的音频Encoder架构,提取高质量的音频时频特征或语义表征,支持下游任务(如语音识别、音频生成、音乐信息检索等)。
- 构建并优化基于VAE的音频生成/重建模型,研究隐空间(Latent Space)的结构化设计,提升生成音频的质量、多样性与可控性。
- 前沿技术追踪:跟进前沿音频生成与表征学习技术,进行复现、改进与工程化落地。
- 数据与评估:参与音频数据集的构建与清洗,设计并优化客观与主观评估体系。
职位要求
- 计算机、电子工程、信号处理、数学或相关专业本科及以上学历,硕士/博士优先。
- 精通Python,熟练使用PyTorch或JAX进行深度学习模型开发,具备良好的工程代码规范与Git协作习惯。
- 熟悉主流音频Encoder架构。
- 有音频表征学习相关项目经验,有顶会论文(ICASSP, Interspeech, NeurIPS, ICLR等)或开源项目贡献者优先。