岗位职责
- 负责音频/音视频Agentic能力,包括原生音视频Agentic/Long-horizen, 全模态Agentic/Coding不降智等。
- 负责音视频理解基础能力:包括Caption, Grouding, 音视频Alignment, General QA,长视频,多音视频理解等。
- 负责音频/语音理解基础能力: 包括ASR, MultiSpkASR, 语音/音频Grouding/Counting/QA,音乐理解,长音频,多音频理解等。
- 负责全模态包括音频/音视频Postrain/RL/OPD。
- 负责音视频通话与交互:包括全音视频双工,音频query不降智/体感优化等。
- 负责语音生成基础能力: 包括音色克隆,可控性,长语音生成稳定性等。
- 全模态模型自主优化与Self-evolving。
职位要求
- 硕士及以上学历,计算机科学、人工智能、语音信号处理、自然语言处理或相关专业。
- 具备扎实的计算机与机器学习理论基础,熟练掌握至少一种编程语言(如 Python/C++),工程实现能力强。
- 熟悉视频理解,音频理解,Agentic,实时交互等核心技术,具备以下一项或多项经验: - 音频/音视频/视频的建模经验; - Agent算法经验 (不限于多模态); - 大语言模型(LLM)相关研发,包括预训练、SFT、强化学习; - 实时交互模型开发,包括打断/判停/主动交互/GPT-Live。
- 对前沿技术有强烈探索欲,具备优秀的自驱力、独立思考能力和团队协作精神。