岗位职责
- 构建端到端的算力感知与流量分发模型:告别传统的“静态规则分配与固定截断”模式,利用深度学习模型精准预估每一次请求的算力边际收益(ROI),让全链路(召回、粗排、精排、出价)的算力分配像顶尖交易员一样实现毫秒级最优决策;
- 探索运筹优化与机器学习的深度融合:将庞大且复杂的系统资源调度与流量漏斗问题,转化为基于海量历史数据的动态序列决策任务;借鉴Decision Transformer、PPO等前沿强化学习算法,在严苛的全局成本约束下追求商业收益最大化;
- 攻克大规模决策模型的核心难题:面对网盟场景下高度稀疏的价值反馈、数据分布漂移(OOD)以及探索与利用(EE)的平衡等挑战,设计创新的奖励函数、价值预估网络与鲁棒性学习机制,大幅提升调度模型的泛化能力与业务上限;
- 推动大模型在复杂决策链路的落地:探索基于LLM的自适应算力调优与智能流量路由策略,甚至利用多智能体协作(Multi-Agent)重塑传统的分层推荐漏斗,实现从算力供给到广告分发的全链路生成式调优;
- 探索下一代AI调度形态:与团队一起研究泛化能力更强的底层基座模型,探索Agentic Workflow在超大规模在线推荐系统博弈中的极致应用,站在算法演进的最前沿。
职位要求
- 本科及以上学历,计算机科学、人工智能、机器学习、运筹学、统计学或数学等相关专业优先;
- 具备扎实的机器学习、深度学习或运筹优化理论基础;熟悉至少一种深度学习框架(如PyTorch、TensorFlow),具备优秀的Python/C++编码能力与海量数据分析挖掘能力;
- 对强化学习(如DQN,PPO,Offline RL)、大模型架构(Transformer)及其在复杂系统决策中的应用充满热情;有推荐系统、计算广告、价值预估(LTV/ROI)模型或智能调度算法实战经验者优先;
- 优秀的基于数据抽丝剥茧分析问题和建立复杂数学模型的能力,对解决多目标优化与全局博弈问题具有好奇心和征服欲。