岗位职责
- 负责文生图、文生视频等自研大模型核心算子的开发与性能优化,基于CUDA、OpenAI Triton等工具实现高性能计算加速;
- 针对MaaS平台AI Infra大模型推理场景,研发性能领先业界的推理引擎,通过研发框架优化、量化、算子优化等技术,大幅降低机器成本;
- 深入训练、微调、RL场景,研发前沿的优化技术,提升模型训练吞吐与资源利用率;
- 搭建端到端模型推理流水线,探索多模态生成任务下的算子融合、多种KVCache优化等创新优化手段。
职位要求
必备条件:
- 计算机科学、电子工程或相关专业硕士及以上学历,2年以上CUDA/GPU高性能计算开发经验;
- 精通PyTorch/Sglang/vLLM等框架底层实现,熟悉大模型部署与推理优化原理;
- 熟练掌握OpenAI Triton编程,具备算子内核开发经验(如矩阵乘、Attention、Conv等模块优化);
- 熟悉模型量化技术(INT8/FP8/INT4混合精度)优先;
- 对GPU硬件架构(如Hopper/Blackwell)有深入理解,能结合硬件特性设计高性能算子。 加分项:
- 在ASPLOS/NeurIPS等顶会发表过模型优化加速相关论文或开源项目贡献者;
- 有文生视频、3D生成等长序列生成模型的并行化优化经验;
- 熟悉分布式训练框架(DeepSpeed/Megatron)开发经验;
- 具备多模态大模型(如Diffusion Model)端到端部署落地经验。