岗位职责
聚焦文本、图像、音频、视频等全模态模型的推理与服务化场景,开展从数据预处理、特征提取、模型前向到后处理的全链路性能优化;核心任务是持续提升推理吞吐、降低时延与成本,定位并解决计算、显存、通信、IO、调度、动态 shape 等系统瓶颈,通过系统级与算子级协同优化最大化整体效能。 与业务团队紧密协作,建立并完善全模态模型上线的标准化交付流程,推动统一推理能力、统一预处理/后处理能力以及通用服务组件的规模化沉淀与复用,实现技术到业务价值的高效转化。 参与构建并持续演进集团内部全模态离线推理平台Omega,为集团各业务线提供稳定、高性能、可扩展的推理服务基石,并完善多租户、资源隔离、容量治理、成本优化、异构任务调度等平台能力。 跟踪并引入业界前沿的全模态推理与系统优化方案,参与开源社区建设与合作,推动先进技术在集团内部落地并形成可复用的最佳实践。
职位要求
- 计算机相关专业本科及以上学历;熟练使用 C++/Python,具备扎实的数据结构与算法基础;有高性能计算/分布式系统经验者优先;
- 熟悉 PyTorch、Ray,以及 vLLM / SGLang 等主流推理框架(特别是其对多模态/全模态模型的支持与扩展),了解 Triton / TVM 等编译与算子生态;具备全模态模型部署、性能调优、问题定位及必要的源码阅读/修改能力,能针对多编码器、跨模态融合等环节进行算子级优化;
- 熟悉主流全模态生成式模型及其推理特性;深入理解多模态融合架构(如 ViT/Audio encoder + LLM 的早期融合、交叉注意力、多模态 MoE 等)、多分辨率/动态帧率特性、流式语音/视频交互等对推理管线的挑战与优化要点;
- 了解 GPU 硬件与软件栈,具备 CUDA 并行编程基础,熟悉常见 Kernel 优化及卡间通信优化手段;能针对图像/视频/音频数据流的异构计算和内存访问模式进行定制调优;
- 加分项对国产卡(如昇腾、寒武纪等)、TPU 等硬件有深度使用与全模态模型优化经验;有音频/视频编解码流水线优化、多模态数据预处理加速、端到端实时全模态交互优化经验者优先。