岗位职责
我们致力于打造淘宝直播场景下“高智商、高情商”的下一代智能数字人主播,通过大模型 + 智能体(Agent) + 强化学习(RL) 的深度融合,构建具备自主决策、实时互动与高转化能力的直播AI系统。你将参与以下前沿探索:
- 大模型与Agentic RL的协同训练范式研究:探索高效Agentic RL算法(样本效率、奖励函数设计、多智能体协作等);
- 多模态Agent研究:融合视觉(商品/表情/动作)、语音、文本等多源信号,通过多模态强化学习优化Agent行为策略;
- 构建基于Agentic RL的数字人决策引擎:设计可自主调用商品工具、垂域多模态知识库查询工具、控制话术、响应观众意图的智能体架构,实现动态控场、个性化互动与高效转化;
- 研究基于RL等算法的自主进化Agent;
- 产出高质量学术论文和专利。
职位要求
- 计算机、人工智能、自动化、电子工程等相关专业硕士或博士在读;
- 扎实的大模型算法理论基础,熟悉SFT、DPO、GRPO等算法,有智能体(Agent)或LLM+RL项目经验者优先;
- 熟练掌握PyTorch,具备分布式训练经验,熟悉DeepSpeed/Megatron等框架者加分;
- 对大模型、AIGC、数字人、多模态交互有强烈兴趣,有CCF-A类顶会顶刊论文、开源项目或竞赛获奖者优先;
- 具备独立科研能力,善于提出问题、设计实验并复现前沿工作。