岗位职责
你将加入 Qwen 团队,深度参与大模型在 Agent 与 Coding 场景下的前沿算法研究。核心方向是构建支撑大规模 Agentic RL 训练的奖励信号体系,提升模型的对齐质量与 RL 训练上限。具体包括:
- Coding Reward System:参与面向 Code Agent 的 Reward System 研发,探索 Outcome 与 Process Level 的自动化 Rewarding 机制,助力解决长程 Coding Trajectory 下的 Credit Assignment 与 Reward 稀疏性问题。
- Agentic User Experience Reward:参与 Agent 任务的用户体验建模与 Reward 优化研究,协助探索 User Reward Modeling,为弥合 Benchmark 指标与用户实际体验之间的鸿沟提供数据与算法支持。
- Reward 评估与数据迭代:以 Reward 信号为核心,参与数据筛选、难例挖掘与合成迭代实验。 你将获得:
- 顶级算力资源与工程基础设施,直接参与 Qwen 基座模型核心训练流程。
- 资深算法工程师带教,深入 Agentic RL 与 Reward System 最前沿方向。
- 实习期间的工作成果有机会落地到 Qwen 正式版本。
职位要求
- 学历:计算机、人工智能、数学等相关专业本科及以上在读。
- 编程基础:精通 Python,熟练使用 PyTorch;具备扎实的机器学习与深度学习基础。
- LLM 认知:对大语言模型的基本原理有一定了解,使用过或关注过主流 LLM。
- RL 兴趣:对强化学习与大模型对齐有浓厚兴趣,了解 PPO / GRPO 等基本流程。 加分项(非硬性要求,有以下任一经历优先):
- 有 Agent 框架使用经验(如 LangChain、LangGraph 等)或 Coding Agent 相关项目经验。
- 做过 RL 相关课程项目、论文复现,或参与过 Reward Shaping / Credit Assignment 方向的探索。
- 有 Kaggle 等竞赛经历,或在顶会发表过相关论文。
- 有开源项目贡献经历。