岗位职责
- 参与音频与多模态知识产权安全算法的设计与建设,覆盖歌曲识别、旋律检索、歌手身份验证、声音克隆与 AI 翻唱检测等方向。
- 参与歌声分离、音频指纹、音频表征学习、旋律建模、speaker/singer embedding、合成音频检测等模型的复现、训练和优化。
- 参与音频—文本—图像—视频联合建模,探索跨模态检索、音视频一致性、人物与声音一致性及内容溯源能力。
- 建设高质量训练与评测数据,设计变速、变调、翻唱、重编曲、压缩、噪声、多人声和 AIGC 生成等对抗/增强样本。
- 建立离线评测、阈值校准和误例分析体系,将模型指标转化为可解释、可落地的业务工作点。
- 跟踪音频生成、音乐信息检索、语音深度伪造、多模态理解和内容安全方向的前沿研究,推动论文方法在真实场景中的验证。
职位要求
- 硕士及以上学历在读,计算机、人工智能、电子信息、信号处理、声学、音乐信息检索等相关专业优先;特别优秀的本科生亦可。
- 具备扎实的深度学习基础,熟悉 PyTorch,能够独立完成论文阅读、代码复现、训练调试和实验分析。
- 熟悉数字信号处理、时频分析、STFT/Mel 频谱、音频特征、采样率和常见音频编码中的至少一部分。
- 熟悉以下一个或多个方向:音频分类与检索、音乐信息检索、源分离、ASR、speaker verification、singing voice、audio deepfake、音频生成、多模态大模型。
- 熟练使用 Python,具有良好的工程实现、数据处理和代码规范意识。
- 具备较强的问题拆解、实验设计和数据敏感度,对 AIGC、音频知识产权保护和内容安全有浓厚兴趣,能够持续、独立推进课题。 加分项:
- 在 ICASSP、INTERSPEECH、ISMIR、ACM MM、NeurIPS、ICML、ICLR、AAAI 等会议或期刊发表过相关论文。
- 有音乐源分离、旋律提取、音频指纹、歌手识别、音频生成/检测或跨模态检索项目经验。
- 熟悉 BS-RoFormer、WavLM、AudioMAE 等模型或相关开源生态。
- 具备音乐理论、乐器演奏、编曲或音频制作经验,能够理解调性、节拍、和声、旋律和音色等概念。
- 有大规模向量检索、难负样本挖掘、模型部署或评测平台开发经验。
- 实习时间至少3个月,每周至少到岗 4 天优先。