岗位职责
- 负责大模型的移动端部署与优化工作;
- 面向端侧算力与内存受限场景,探索高效的大模型结构与推理策略,如端侧友好的 MoE 方案、稀疏与线性注意力、长上下文推理优化等,实现模型在性能、效果与资源消耗之间的最优权衡。
- 参与大模型与芯片协同设计(Model–Chip Co-design),不断挖掘移动芯片算力潜能,实现业界领先的大模型执行效能;
- 撰写相关论文,专利。
职位要求
- 信号处理/模式识别/人工智能等相关专业毕业,熟练使用C/C++;
- 对深度学习有深刻认识,熟悉各种神经网络及背后数学原理,熟悉各类神经网络模型的量化/压缩/性能优化方案;
- 对大模型加速优化方案有深入了解,对投机采样,GQA,MOE,Lora量化等技术有开发与优化经验者优先。
- 有vllm,sglang,Genie等云端/移动端大模型推理框架开发经验者优先;
- 有相关领域高质量会议/期刊论文,或深度参与过开源深度学习框架的开发并有相应贡献者优先。