岗位职责
你将建设视频和音频理解能力,包括 video caption、tagging、PE 模型训练和推理优化,包括基础模型和框架搭建以及优化,根据不同模型研发周期来持续优化理解模型的精度和效率。你的工作会直接支撑生成大规模数据筛选、自动标注、评测、agent 决策和内容分发。
职位要求
- 熟悉 PyTorch以及分布式训练框架,理解并有实际经验Diffusion model、MOE、VAE、SFT、RLHF、Distillation 中至少两部分
- 有多条件参考/图像/视频/音频生成、编辑、超分、插帧、人物一致性、多镜头、音画同步等相关经验
- 能主动设计实验、分析失败案例,并优化实验结果。 加分项 大规模生成模型训练经验;熟悉 CUDA/Triton、DeepSpeed、FSDP、Megatron、Ray、Slurm;有高质量开源项目、论文、demo 或工业落地经验