岗位职责
专注于LLM post-training和agent相关算法研究,具体职责包括:
- 探索LLM可解释性 + 模型增量CPT/RL算法,提升语言模型在专业领域上的能力;
- 探索LLM可解释性 + 低比特量化算法,降低模型training/inference阶段计算成本;
- 探索agent 增强微调算法,提升模型在专业领域上端到端解决复杂任务的能力;
- 将相关算法研究成果发表在国际顶级会议上(ICLR/NeurIPS/ICML/ACL);
- 将相关算法研究成果应用于模型低比特量化、海外大模型业务中,显著提升阿里云通义千问模型服务效率和沙特等国家主权大模型线上效果。
职位要求
- 扎实的机器学习、深度学习、自然语言处理、大语言模型基础知识和编程能力;
- 优良的沟通表达能力、团队合作意识和经验;具备快速学习的能力,以及深入钻研技术问题的耐心;
- 长期实习,一年以上。 【加分项】
- 在国际顶级会议(ICLR/NeurIPS/ICML/ACL)有论文发表;
- 在顶级编程竞赛中获得优秀成绩;
- 有高star的github开源项目。