岗位职责
参与阿里妈妈全站推连续时间强化学习(Continuous-Time RL)算法研发,面向真实广告投放中的不等间隔决策问题,推动自动出价从固定步长MDP向连续时间建模演进。 研发连续时间环境模型CT-Env,探索Neural ODE/SDE、世界模型等技术,刻画不同时间间隔下的状态转移,提升非均匀采样数据的建模精度与稳定性。 研发连续时间出价策略CT-Policy,支持定时与事件驱动混合决策,在预算和目标ROI约束下优化成交金额及长期收益。 建设离在线一致的评估验证体系,研究离线策略评估、反事实评估及仿真方法,衡量策略在流量突增、广告主操作和预算、目标ROI变化等非平稳场景下的效果与鲁棒性。 推动算法在公开数据集和阿里妈妈内部平台落地,参与在线A/B实验,并围绕相关成果投稿NeurIPS、ICML、ICLR、KDD、WWW等顶级会议或期刊。
职位要求
计算机、人工智能、自动化、数学、统计学或运筹学等相关专业硕士及以上学历。 熟练掌握Python及PyTorch等深度学习框架,具备良好的AIAgent应用、算法实现、实验分析和工程实践能力。 对强化学习有扎实理解,熟悉MDP、价值函数、策略梯度、Actor-Critic等基本方法;具备以下至少一个方向的研究经验:a. 连续时间强化学习、随机控制或最优控制;b. Model-Based RL、世界模型或Neural ODE/SDE;c. Offline RL、离线策略评估或因果推断;d. 不规则时间序列、事件驱动建模或非平稳决策;e. 广告、推荐、资源分配等工业决策问题。 具备良好的数学基础,熟悉概率统计、随机过程、微分方程、数值优化或控制理论者优先。 具备独立研究和解决开放问题的能力,能够完成问题建模、算法设计、实验验证和论文撰写;在ICML、NeurIPS、ICLR、KDD、WWW、AAAI、IJCAI等会议或相关期刊发表过成果者优先。 对工业级强化学习研究有热情,具备较强的主动性、责任心和沟通协作能力,能够持续推进长期研究课题。