岗位职责
- 分析并优化NV/国产芯片大规模部署下主流模型(Deepseek、GLM、Kimi)性能,研究和优化关键算子性能,降低latency,提高MFU;
- 对LLM推理全链路效率有深入认知,探索并利用AI dsl能力推动关键链路的op fusion、meag kernel、auto-tuning&codegen、compute overlap,并能够独立在infra上验证or完成上线。
职位要求
- 精通c++/python,熟悉llm推理框架(sglang/vllm)kernel开发&优化经验;
- 熟悉GPU架构,具备cuda/triton kernel开发&调优能力;
- 熟悉算子融合、量化等技术,对MOE, FlashAttention有比较深入了解和实际经验。 加分项:
- 有LLVM、Triton、tilelang相关经验,有编译优化、codegen相关经验;
- 有强烈技术热情和好奇心,自驱力和学习力强;具备良好的分析与解决问题的能力、沟通以及团队合作能力;喜欢挑战性的技术研发工作,善于攻坚克难,有创新热情,积极乐观,坚韧抗压,结果导向,能够持续推动问题的解决和突破。