岗位职责
T-Star计划是阿里巴巴淘天集团顶尖人才招聘和培养项目,继承“阿里星”的使命与愿景,面向全球招募顶尖技术人才。期待你们在淘天,通过极具挑战的前沿课题与亿级规模的海量数据、应用场景,探索和实践最前沿的AI技术,在有价值的业务场景落地技术成果。
- 理论研究:负责本体约束的在线强化学习框架建模,并进行理论证明、自进化的收敛性分析
- 算法开发:设计并实现本体增强的安全在线RL算法族、LLM-RL协同决策算法、跨大促Meta-RL与经验固化算法
- 场景落地:在双11/618等真实大促中验证系统效果;与SRE/研发团队协作确保决策可信赖;量化评估业务价值 我们提供:
- 丰富的数据:淘天历次大促全链路运维/研发/业务数据,全球独一无二
- 顶级的场景:双11/618,全球最大规模在线决策试验场
- 充足的算力:GPU/CPU集群支持大规模RL训练与模拟
- 成熟的基础设施:成熟的监控/追踪/日志/变更管控平台作为感知与执行底座
- 密切的协作:与平台SRE、研发、业务团队的直接协作通道
- 导师:配备顶级业务+技术双导师,定期进行学术交流 加入我们一起构建面向下一个十年的智能决策范式!
职位要求
● 计算机科学、人工智能、运筹学、自动化等相关方向博士 ● 扎实的强化学习理论功底,精通主流RL算法(Policy Gradient/PPO/GRPO及其变体),有实际实现与调优经验 ● 熟练Python + PyTorch,具备生产级代码交付能力 ● 在ICML/NeurIPS/ICLR/AAAI/ACL/WWW等顶会有一作或共同一作论文发表,或有等价的突出研究成果 ● 第一性原理思维: 能从问题本质出发设计方案,而非套用现有方法 ● 理论与实践并重: 既能推公式证定理,也能写出高质量生产代码 ● 大促体感: 对"安全红线"有敬畏心,理解生产环境不允许trial-and-error ● 跨域学习能力: 愿意深入理解业务/运维/研发领域知识,而非将其视为黑箱 ● 长期主义: 认同"自进化"的愿景,愿意用3年时间构建有壁垒的系统 【优先条件】 ● 包括安全强化学习、在线学习、元学习、多智能体,了解本体工程、神经符号推理,有LLM与决策系统结合的研究经验,了解大规模分布式系统、AIOps、SRE相关背景知识,有扎实的数学功底,包括优化理论、概率论、随机过程功底扎实,能独立完成定理证明