岗位职责
- 参与公司音乐业务音频智能监控与评估体系建设,面向抖音、汽水音乐等产品,研发基于大模型的音频理解与音质分析算法,构建规模化、自动化的音质大盘监控能力;研究音质指标建模、异常检测、质量趋势分析与问题聚类算法,实现音质问题的自动发现、定位和归因,为业务音质优化提供数据与算法支撑;
- 研发面向音乐内容的音频理解大模型,利用Audio Foundation Model、多模态大模型(MLLM)及大语言模型(LLM)等技术,实现音质问题识别、音频缺陷检测、质量评分与自然语言描述,包括但不限于噪声、失真、爆音、削波、带宽受损、编解码损伤、响度异常等问题;
- 探索大模型在Audio Quality Assessment(AQA)领域的应用,研究基于音频大模型的MOS预测、感知质量建模、Audio Reasoning、Audio Captioning及音质问题解释能力,推动音质评估从“单一分数”向“问题理解与可解释分析”演进;
- 研究音频大模型的训练与后训练技术,包括音频表征学习、Audio-Text Alignment、SFT、Preference Learning、RL等,持续提升模型在音乐音质理解、复杂问题识别及专业音频分析场景中的能力;
- 跟踪Audio Foundation Model、Audio LLM、多模态大模型及音频理解领域的国际前沿研究成果,持续推动算法创新与业务落地。
职位要求
- 本科及以上学历,计算机科学、电子工程、通信工程、声学、信号处理、人工智能等相关专业;
- 熟悉深度学习及大模型基础理论,掌握Transformer、Attention等核心技术,熟练使用PyTorch、TensorFlow等至少一种深度学习框架;
- 具备良好的音频与数字信号处理基础,理解时频分析、频谱、响度、动态范围、音频编解码及常见音质问题;
- 熟悉Python,并掌握C/C++、MATLAB等至少一种编程语言,具备良好的算法实现与工程能力;
- 对音频大模型、多模态大模型、音乐理解或Audio AI有浓厚兴趣,具有良好的学习能力、问题分析能力和团队合作精神。 加分项:
- 有Audio Foundation Model、Audio LLM、多模态大模型或音频理解相关科研、竞赛或项目经验;
- 有Audio Quality Assessment(AQA)、MOS Prediction、PESQ、POLQA、ViSQOL、DNSMOS、NISQA等音质评估相关经验;
- 熟悉Audio-Text Alignment、Audio Captioning、Audio Reasoning、SFT、RLHF、Preference Learning等大模型训练与后训练技术,并有实际项目经验;
- 有海量音频数据分析、音质监控、异常检测、数据挖掘或大规模自动化评测系统建设经验;
- 熟悉音频编解码(Codec)、Neural Codec、音频增强、音频生成等技术,能够理解不同音频处理链路对最终音质的影响;
- 在ICASSP、Interspeech、NeurIPS、ICLR、ACL、EMNLP、IEEE TASLP等会议或期刊发表论文,或在音频、多模态、大模型相关竞赛中取得优异成绩,或有开源项目、GitHub、个人作品或技术博客等展示材料。