岗位职责
- 研发并落地低比特量化技术,包括FP
- FP
- INT
- INT
- KV Cache量化、MoE量化、混合精度量化、QAT/PTQ等方向,解决大规模模型低比特部署下的精度、稳定性和性能问题;
- 参与投机解码、稀疏化、剪枝、蒸馏、Token剪枝、Prompt压缩、CoT压缩、KV Cache压缩等推理加速技术探索与落地,持续提升Decode效率并降低显存与计算开销;
- 建立和完善模型压缩效果评估与回归机制,协同模型、算子、框架和业务团队完成算法方案到线上部署的闭环,对模型效果、推理成本和吞吐收益负责。
职位要求
- 在量化、稀疏、蒸馏、投机解码、KV Cache压缩、Token压缩等至少一个方向有深入研究或大规模工程落地经验;
- 具备扎实的Python/PyTorch开发能力和严谨的实验分析能力,能够设计评测集、消融实验和回归机制,平衡模型效果、推理延迟、吞吐和成本收益;
- 在NeurIPS、ICML、ICLR、ACL、EMNLP、MLSys等会议发表相关论文或有高质量开源贡献者优先。