岗位职责
- 音频相关大模型研发,包括音频理解(语音识别/翻译等),对话模型,音频生成(语音合成/音色克隆/音乐生成)等技术;
- 前沿语音技术跟进、行业动态和主流模型框架的调研,学术研究及相关论文发表;
- 数据生成,对话数据开源调研,数据链路清洗,数据管理
- 语音模型的后训练优化,sft,rl等后训练方法的具体实践和优化。
- 在B站视频理解、字幕、搜索及创作场景落地。
职位要求
- 计算机科学、人工智能等相关领域研究经验;
- 有语音大模型相关前沿技术研究及发表论文经验,理解多模态/生成式模型的原理,熟悉大模型底层技术,敢于挑战技术边界;
- 有各类竞赛获奖经历、有过ACM等编程竞赛经历,或代码开源在github上并有较大影响,在InterSpeech/ICASSP/ACL/WMT等顶会发表论文者优先。