岗位职责
负责主流大模型在多种 AI 加速芯片和推理后端上的适配、优化与工程落地,覆盖 Qwen、DeepSeek、GLM、Kimi等文本、多模态与图像生成模型,目标平台包括 TPU、NPU 等各类 AI 加速芯片。该岗位需要深入理解模型结构、推理框架、算子/kernel、编译栈与分布式推理机制,推动模型在不同硬件平台上稳定、高效、可规模化运行。
职位要求
- 负责 Qwen、DeepSeek、GLM、Kimi等主流模型在 TPU、NPU 等各类AI 加速芯片上的适配、验证和性能优化。
- 分析模型结构与硬件特性,完成 attention、KV cache、MoE、多模态模块、DiT/扩散模型等关键链路的推理打通与优化。
- 基于 vLLM、SGLang 或自研推理框架,推进模型部署、算子替换、图编译、kernel 调优和端到端性能优化。
- 建立模型适配流程,包括精度对齐、性能 benchmark、长上下文验证、并发压测、稳定性回归和版本发布。
- 与上下游团队紧密协作,定位并解决动态 shape、通信瓶颈、内存布局、算子缺失、图编译失败、精度漂移等跨层问题。
- 沉淀通用适配能力和工具链,提升新模型、新硬件平台的接入效率,推动多硬件后端的标准化和平台化。