岗位职责
- 负责算法服务的性能优化加速,提升服务并发能力、降低时延,提升算法服务的部署效率与稳定性。
- 负责算法服务部署架构的设计与开发,面向多模态(图像、音频、文本、视频)、大模型及Agent工作流等核心场景,制定场景化的部署方案并持续进行性能调优,确保推理服务的高效、稳定与可扩展。
- 参与算法服务国产化芯片适配,完成模型适配、精度对齐、效果验证以及性能优化。
- 参与算法服务移动端部署,封装移动端SDK、测试端上模型的效果与性能,保证稳定性。
- 持续跟进算法模型部署的技术演进,关注大模型推理优化、Agent工作流编排与调度、端上部署(移动端、边缘端)、模型轻量化技术(量化、剪枝、蒸馏)及端云协同推理等前沿方向,持续提升多场景部署效能。
职位要求
- 计算机科学、人工智能、电子信息等相关专业,本科及以上学历。
- 熟悉tensorrt、triton server、vLLM、TensorRT-LLM、RTP-LLM、SGLang等模型推理部署框架,并在至少一个框架上有深度实践经验。
- 熟悉剪枝、量化、蒸馏、KV Cache、PagedAttention等模型部署与性能优化相关技术。能针对具体场景的数据与业务特点,优化模型部署性能。有大模型线上部署与性能优化相关经验优先。
- 熟悉昇腾、寒武纪、海光等国产AI芯片的模型适配,同时熟悉端侧模型部署技术,掌握主流推理引擎与轻量化技术。
- 熟悉大模型推理部署流程与工程化方案,同时了解Agent服务化部署,能够完成大模型Agent工作流的工程落地。
- 熟练掌握Python/C++编程,具备良好的编码习惯与工程能力。
- 对算法工程领域发展趋势有独立思考和深入理解,持续关注大模型部署、agent部署与可观测、端上部署、模型轻量化、端云协同等核心领域。