岗位职责
课题1:Action-to-Rewards(行为即奖励):利用淘宝海量用户真实行为构建可无限扩展的奖励信号,解决传统奖励模型无法规模化难题。通过将行为数据融入强化学习链路,驱动模型从“做对”进化至“做好”,开辟全新的Scaling维度。 课题2:Duet快-慢脑协同架构:构建统一音频前端与快慢双脑协同机制,实现感知、即时应答与深度推理的并行处理。通过“边说边想”消除对话延迟与阻塞,打造低延迟、主动介入的实时多模态智能交互体验。"
职位要求
- 计算机科学/人工智能/机器学习等相关领域的硕士或博士,具备扎实的编程基础(Python/C++),熟悉常用算法与数据结构。
- 深入理解强化学习(RLHF/RLAIF)理论或大模型推理加速机制,在NLP、多模态交互、搜推广系统中至少一个领域有深厚积累。
- 熟练掌握PyTorch/TensorFlow等深度学习框架,有大规模分布式训练、模型微调或高性能推理引擎开发经验者优先。
- 对AI Agent前沿技术充满好奇心,重点关注大模型Scaling Law、实时多模态交互、端云协同及强化学习在推荐/导购场景的应用。
- 在顶级会议(如NeurIPS, ICML, ACL, CVPR等)发表过相关论文,或有复现SOTA模型及开源项目贡献者优先。
- 具备极强的工程落地与问题拆解能力,能从海量用户行为数据中挖掘价值,并通过数据分析优化模型奖励机制或降低交互延迟。
- 良好的跨团队协作能力,能与后端工程师、产品经理高效配合,将“行为即奖励”或“快慢脑”技术方案转化为真实的业务增长指标。
- 对电商导购场景有敏锐洞察,愿意深入探索用户意图识别、多轮对话管理及商业转化逻辑。 【加分项】
- 针对课题1:有基于真实用户反馈构建Reward Model的经验,或在大规模RLHF/在线强化学习链路中有实际落地成果。
- 针对课题2:有流式音频处理、低延迟LLM推理优化(如Speculative Decoding)、或多模态端到端模型(Audio-Text)研发经验。
- 拥有海量时序行为数据处理经验,或在Kaggle/天池等竞赛中针对推荐系统、对话智能体赛道获得优异成绩。"