招聘中 校招

基于行为奖励与快慢脑协同的实时AI导购研究-阿里星/T-Star

阿里巴巴

  • 北京、杭州
  • 技术类

收录时间

岗位职责

课题1:Action-to-Rewards(行为即奖励):利用淘宝海量用户真实行为构建可无限扩展的奖励信号,解决传统奖励模型无法规模化难题。通过将行为数据融入强化学习链路,驱动模型从“做对”进化至“做好”,开辟全新的Scaling维度。 课题2:Duet快-慢脑协同架构:构建统一音频前端与快慢双脑协同机制,实现感知、即时应答与深度推理的并行处理。通过“边说边想”消除对话延迟与阻塞,打造低延迟、主动介入的实时多模态智能交互体验。"

职位要求

  1. 计算机科学/人工智能/机器学习等相关领域的硕士或博士,具备扎实的编程基础(Python/C++),熟悉常用算法与数据结构。
  2. 深入理解强化学习(RLHF/RLAIF)理论或大模型推理加速机制,在NLP、多模态交互、搜推广系统中至少一个领域有深厚积累。
  3. 熟练掌握PyTorch/TensorFlow等深度学习框架,有大规模分布式训练、模型微调或高性能推理引擎开发经验者优先。
  4. 对AI Agent前沿技术充满好奇心,重点关注大模型Scaling Law、实时多模态交互、端云协同及强化学习在推荐/导购场景的应用。
  5. 在顶级会议(如NeurIPS, ICML, ACL, CVPR等)发表过相关论文,或有复现SOTA模型及开源项目贡献者优先。
  6. 具备极强的工程落地与问题拆解能力,能从海量用户行为数据中挖掘价值,并通过数据分析优化模型奖励机制或降低交互延迟。
  7. 良好的跨团队协作能力,能与后端工程师、产品经理高效配合,将“行为即奖励”或“快慢脑”技术方案转化为真实的业务增长指标。
  8. 对电商导购场景有敏锐洞察,愿意深入探索用户意图识别、多轮对话管理及商业转化逻辑。 【加分项】
  9. 针对课题1:有基于真实用户反馈构建Reward Model的经验,或在大规模RLHF/在线强化学习链路中有实际落地成果。
  10. 针对课题2:有流式音频处理、低延迟LLM推理优化(如Speculative Decoding)、或多模态端到端模型(Audio-Text)研发经验。
  11. 拥有海量时序行为数据处理经验,或在Kaggle/天池等竞赛中针对推荐系统、对话智能体赛道获得优异成绩。"

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

阿里巴巴基于行为奖励与快慢脑协同的实时AI导购研究-阿里星/T-Star

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看基于行为奖励与快慢脑协同的实时AI导购研究-阿里星/T-Star正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位基于行为奖励与快慢脑协同的实时AI导购研究-阿里星/T-Star阿里巴巴 · 北京、杭州

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏基于行为奖励与快慢脑协同的实时AI导购研究-阿里星/T-Star正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

阿里巴巴基于行为奖励与快慢脑协同的实时AI导购研究-阿里星/T-Star校招 · 北京、杭州

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入基于行为奖励与快慢脑协同的实时AI导购研究-阿里星/T-Star内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。