岗位职责
- 设计和实现面向大模型推理的多层级存储系统,综合利用多种硬件进行数据的存储和迁移管理,优化大模型缓存利用率,提升推理性能;
- 设计负载感知的推理框架自调优能力,设计高效的指标采集模块,能够根据对不同负载自动调优推理框架的参数;
- 优化模型量化以及模型卸载技术,进一步提升单机场景下支持的模型规模;
- 设计高效微调框架,集成并优化微调算法,实现动态策略调度模块,基于任务特征挑选最合适的微调方案。
职位要求
- 计算机科学、人工智能、软件工程或相关专业在读博士,硕士;
- 有相关领域顶会论文(包括但不限于ICML,ICLR,AAAI,NeuralPS,VLDB,SIGMOD等)发表经验;
- 熟练掌握Linux环境下的C++/Go/Python/Shell等1至2种以上语言,具备复杂系统的设计开发与调试能力;
- 熟悉至少一种大模型推理或微调框架,包括但不限于:DeepSpeed、LLaMA-Factory、vLLM、SGLang等;
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速的响应和行动。 加分项:
- 理解GPU硬件架构,理解GPU软件栈(CUDA,cuDNN),具备GPU性能分析的经验;
- 有大模型推理或微调相关的技术落地经验,比如:KVCache相关优化的实现。