岗位职责
- 负责端到端音频大模型的预训练、SFT监督微调、RL对齐全流程研发,优化语音音频生成、理解,指令遵循等核心能力。
- 音频大模型基建迭代,负责ASR、TTS、语音降噪、说话人日志、语音情感分析等传统语音算法与大模型的融合升级。
- 数据构建与迭代:负责语音音频类专属数据集的采集、清洗、筛选、标准、质检,构建音频预训练语料、偏好对齐数据集、场景专项微调数据集,持续迭代数据体系提升模型泛化能力。
- 技术调研与创新:跟进国内外音视频大模型、全模态理解大模型等前沿技术,实现新技术、新方案,推动团队算法体系升级。
职位要求
- 熟悉pytorch/megatron/deepspeed/verl 等大模型训练框架,掌握大模型训练、微调、推理的完整工程流程。
- 熟悉大模型基础范式,掌握pertaining,sft, on-policy learning, reinforcement learning等训练范式,熟悉Diffusion, Flow Matching, GAN等生成模型的原理。
- 有较强的coding及vibe coding能力,面对各项变化中的任务能快速交付。
- 具备良好的逻辑思维、问题拆解能力,能独立攻克算法难点,具备团队协作和沟通能力。
- 很强的求知欲和好奇心,持续学习的能力和动力。 加分项:
- 在语音/大模型领域发表过有影响力的代表作。
- 有顶会成果:在NeurIPS、ICLR、ICML、ICASSP、INTERSPEECH、ACL等会议一第一作者身份发表语音/大模型相关论文。
- 有影响力的开源项目。