岗位职责
你将参与下一代音视频生成MOE大模型的研发,包括 text-to-audio+video、image-to-audio+video、multi-reference generation、video-to-video、long video generation等多模态多任务的统一生成模型研发。你会和数据、评测、平台、内容团队一起,以模型全面能力提升为核心目标。
职位要求
- 掌握生成式模型技术(扩散模型,自回归模型等)
- 了解视频生成基座模型的基本研发流程,了解针对视频生成的数据清洗链路和构建。
- 在计算机视觉一个或多个领域的研究和实践经验,包括但不限于以下方向: a)图片/视频生成扩散模型; b)视觉自监督学习/表示学习/生成理解统一; c)大规模视频生成训练经验、SFT或RLHF经验; d)视频生成的数据清洗和构建。
- 具备扎实的算法功底与落地工程能力,实操动手能力突出者优先;
- 工作积极主动,思路有条理,能够独立完成具有挑战性的前沿研发工作;同时擅长跨协作配合,推动团队成果落地;
- 加分项:具有顶会论文,或产出具备行业影响力的研究项目、技术成果。