岗位职责
- 参与行业领先的算法模型在嵌入式硬件平台的落地,构建统一的端侧异构推理引擎,适配算法到GPU/NPU/DSP等异构加速核,向上提供统一的调用接口,内部完成高效稳定的算法实现;
- 端侧异构算法调度引擎的开发,利用多核异构芯片的加速器,从图像处理、视频编解码、集合通信、模型推理等全局视角,充分发挥GPU/DSP/CPU/PVA等异构平台的算力,并且结合算法逻辑持续优化调度框架的静态编译能力、动态调度能力;
- 采用Profiling工具(如Nsys/Perf/火焰图等),对AI系统进行软硬综合调优、系统级性能分析和瓶颈定位,并基于硬件特性和算法演进方向进行软件适配和优化;
- 洞察大模型的发展趋势和技术演进,结合业务发展,为下一代机器人OS提供架构改进方案。
职位要求
- 计算机相关专业本科以上学历,在NPU、GPU等异构计算方面有5年以上工作经验;
- 扎实的编程功底,熟悉C++、Python等编程语言,具备良好的数据结构、算法基础和规范的工程化能力;
- 掌握深度学习/计算机视觉基本原理,熟悉至少一种机器学习推理框架如TensorRT、ONNXRuntime、vLLM、SGLang或者其他自研框架,熟悉常用的图像处理算法及其硬件加速技巧;
- 熟悉性能建模、性能分析与优化,深度参与过端侧模型的异构计算优化工作,具备出色的问题分析与解决能力;
- 具备良好的团队合作能力,能够跨团队协作推动项目进展。 加分项:
- 熟悉NVIDIA编译优化技术栈底层原理,如cutlass、cute、triton等工具;
- 掌握大模型相关计算优化技术,如FlashAttention、FlashDecoding、计算通信Overlap等;
- 有大模型推理引擎优化经验,包括并行计算、图优化、内存管理及低比特计算等技术;
- 扎实的计算优化理论基础和高性能计算系统优化实践经验。