岗位职责
岗位核心目标是研发面向超大规模模型的强化学习训练系统,提升大模型在工具调用、多模态交互及复杂环境中的推理与决策能力,实现多轮“感知—推理—行动—反馈”闭环,推动 Agent 与 AGI 前沿技术落地。 你将参与:
- 参与大规模分布式强化学习框架的设计、开发与优化,提升训练吞吐、资源利用率、稳定性和可扩展性;
- 研究并实现 PPO、GRPO 等强化学习算法,探索奖励建模、采样策略及训练稳定性等关键问题;
- 支持大模型与搜索、代码执行、外部工具及多模态环境的高效交互,建设复杂任务下的训练与评测闭环;
- 跟进并复现大模型强化学习、Agent、推理增强等领域的前沿工作,推动有效方案落地。
职位要求
- 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位;
- 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go;
- 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究。 优先录用:
- 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色;
- 在国际会议上或核心期刊发表一份或多份出版物或论文;
- 至少3个月的全职工作。