岗位职责
- 参与公司自研或开源(如MNN, TNN, NCNN, TVM, MLIR等)移动端推理引擎的开发,针对ARM CPU、GPU (Adreno/Mali)、NPU (Hexagon/Neural Engine) 进行算子性能优化;
- 负责深度学习模型的量化策略研究(PTQ/QAT),实现INT8/INT4甚至更低精度的推理加速,同时保证模型精度损失最小化;
- 参与LLM(大语言模型)或多模态模型在移动端的部署优化,包括KV Cache管理、显存优化、流式生成加速及低功耗推理策略;
- 研究和实现基于不同硬件后端的自动调度策略,提升模型在复杂场景下的推理效率和能效比;
- 参与模型转换工具、性能分析Profiler、调试工具的开发,提升算法工程师的端侧部署效率。
职位要求
- 本科及以上学历,计算机、电子工程、数学、人工智能等相关专业;
- 精通 C/C++,熟悉现代C++标准(C++17/20),具备良好的代码风格和内存管理能力;熟悉Python脚本编写;
- 深入理解计算机体系结构,熟悉ARM架构特性(NEON指令集、缓存机制、内存对齐等),有汇编优化经验者优先;
- 熟悉主流深度学习框架(PyTorch, TensorFlow, ONNX),理解常见神经网络结构及算子原理;
- 了解多线程编程(pthread, std::thread)及并行计算技术(OpenCL, Vulkan, CUDA)。 【加分项】
- 有实际的移动端AI部署经验,或在GitHub上有相关开源项目贡献(如MNN, TNN, ncnn, llama.cpp等);
- 熟悉模型量化原理,有处理过量化敏感模型或自定义量化算子的经验;
- 熟悉Transformer架构,有在移动端部署Llama, Qwen, ChatGLM等大模型的经验,了解Speculative Decoding等技术;
- 熟悉MLIR、TVM、XLA等编译器基础设施,有算子融合(Operator Fusion)或自动代码生成经验;
- 在ACM/ICPC、Kaggle或各类AI系统优化竞赛中获得过优异成绩。