招聘中 校招

千问Qwen训练算法-系统协同前沿技术研究-阿里星

阿里巴巴

  • 北京、杭州、上海
  • 技术类

收录时间

岗位职责

加入我们,你将以算法-系统协同设计(Algorithm-System Codesign) 为核心方法论,深度参与千问Qwen系列大模型预训练的核心算法与架构设计。当前千问Qwen正加速向极度稀疏Fine-Grained MoE与超长上下文高效训练方向演进,你将参与训练/推理效率友好的模型结构设计,定义训练稳定性与量化友好方案,参与Self-Evolving训练闭环的Infra设计建设,与Infra团队协同落地,在万卡规模下推动Scaling Efficiency的持续突破。

  1. 万卡训练稳定性保障 (1)训练任务稳定性:深度参与万卡集群训练的系统级稳定性保障,从算法与框架层面设计容错策略,包括Checkpoint一致性保障、故障恢复后的训练状态对齐、并行拓扑变更下的梯度一致性维护。 (2)Loss稳定性:研究并干预训练过程中的Loss异常现象,包括Loss Spike归因与干预、梯度爆炸/消失的算法级预防、数值溢出检测与自动修复、高稀疏MoE下Activation Explosion的抑制方案。 (3)量化友好设计:从模型架构与训练策略层面设计Quantization-Friendly的方案,包括量化感知训练(QAT)策略、激活值分布约束、FP8/低精度训练的数值稳定性设计,确保模型在训练阶段即考虑部署时的量化兼容性。 (4)与Infra团队协同,建立训练异常的自动化检测、诊断与告警机制,实现Loss/梯度/激活的实时监控与根因分析。
  2. 效率友好的模型结构设计 (1)从训练效率与推理成本视角深度参与模型结构设计,为架构决策提供量化依据: ·极度稀疏Fine-Grained MoE:评估不同潜空间维度、Expert池规模、激活数、负载均衡策略对训练吞吐、通信开销、显存占用的综合影响,选型效率最优的稀疏MoE方案与全局均衡算法。 ·高效长上下文Attention:评估混合注意力架构、线性注意力变体、KV压缩方案在百万Token上下文下的训练FLOPs效率与推理KV Cache开销,选型对Context Parallel与Kernel效率最友好的方案。 ·与Infra团队协同,将效率评估结论转化为通信模式需求与Kernel需求,推动算法-系统联合设计。
  3. Self-Evolving训练闭环的Infra建设 (1)评估Self-Evolving在Qwen场景下的Infra可行性与ROI,从数据规模、训练成本、迭代效率三个维度进行量化判断。 (2)深度参与大模型Self-Evolving机制的训练基础设施建设,构建支持模型自我演进的规模化训练闭环: ·设计自生成-评估-回灌的数据流水线,搭建支持Self-Play/自蒸馏/迭代式自训练的多阶段训练编排与调度,平衡Rollout/Training/Evaluation三阶段的资源分配与流水线Overlap,确保自演进过程可控可观测。
  4. 前沿技术追踪与选型判断 (1)持续追踪SOTA预训练技术,从算法收益、系统开销、工程风险三个维度进行量化评估与选型决策。 (2)推动前沿技术从论文复现到万卡规模验证的全流程落地。 (3)鼓励在NeurIPS/ICLR/MLSys等顶会发表算法与系统交叉方向的研究成果。

职位要求

  1. 学历与理论基础 (1)全球Top高校计算机科学、人工智能等相关领域博士/顶尖硕士。 (2)扎实的深度学习理论基础,对Transformer架构有原理级理解。 (3)在MoE(路由策略、负载均衡、Fine-Grained稀疏、Expert Collapse)和/或Attention(混合注意力、MLA、线性Attention、长上下文训练)方向有深入研究。
  2. 算法-系统协同能力(核心门槛) (1)精通PyTorch,熟悉Megatron-LM等训练框架的工作机制。 (2)具备算法-系统联合思考能力:评估MoE路由策略时能建模通信开销与负载均衡效率;评估Attention变体时能判断对并行策略与Kernel效率的影响。 (3)有向Megatron-LM/DeepSpeed/vLLM/PyTorch等开源框架贡献核心代码的经历者优先。
  3. 分布式训练经验 (1)具备千卡/万卡级分布式训练的实际操作经验。 (2)有MoE训练优化、长上下文预训练、或大规模模型稳定性保障中至少一项实战经验。
  4. 编程与工程素养 (1)精通Python,具备CUDA/Triton Kernel开发能力或强烈意愿。 (2)极强的代码功底与工程实践能力,ACM/ICPC等编程竞赛获奖者优先。 (3)优秀的跨团队技术沟通能力,能在算法与Infra团队之间建立高效技术对话。
  5. 研究志向 (1)持续关注大模型预训练前沿(新型架构、新型优化器、新型并行范式),不满足于"跟随开源",有志于定义下一代大模型预训练算法与架构。 加分项
  6. 万卡级MoE/长文本预训练实操与稳定性保障经验。
  7. NeurIPS/ICLR/MLSys/ASPLOS等发表MoE架构优化、高效Attention、Self-Evolving相关论文。
  8. Megatron-LM/DeepSpeed/vLLM等框架的可追溯核心代码贡献。
  9. 极度稀疏MoE负载均衡、线性注意力长上下文训练、Self-Play/自蒸馏Infra建设等方向的研究背景。
  10. 算法-系统交叉研究。

相似岗位

有些机会,只在官网短暂出现

真正值得关注的岗位,常常只在企业官网短暂开放,可能两三天后就下线,也未必会同步到综合招聘平台。没有持续关注,你甚至不会知道它曾经出现。职先机持续聚合并核验官网岗位,帮你抓住职场先机,快人一步。

微信小程序 / 当前岗位

在微信里继续看这个岗位

阿里巴巴千问Qwen训练算法-系统协同前沿技术研究-阿里星

扫码直达当前岗位收藏、浏览记录和下线提醒留在微信里
电脑端可直接微信扫码;手机端可保存小程序码后在微信中识别。
微信扫码在职先机小程序查看千问Qwen训练算法-系统协同前沿技术研究-阿里星正在准备岗位码
职先机微信小程序一岗一码 · 正式版直达保存小程序码

岗位提醒 · 01

收藏当前岗位,下线及时通知

当前岗位千问Qwen训练算法-系统协同前沿技术研究-阿里星阿里巴巴 · 北京、杭州、上海

01

扫码进入当前岗位无需重新搜索,直接打开当前岗位详情。

02

收藏并开启提醒在小程序内收藏后,岗位下线或变化时及时通知。

03

继续查看相似机会原岗位变化时,可继续浏览相关在招岗位。

职先机会持续核验公开岗位;岗位状态与最终招聘结果仍以企业招聘官网为准。

微信小程序扫码打开当前岗位

扫码打开当前岗位,完成收藏并开启下线提醒。

微信扫码在职先机小程序收藏千问Qwen训练算法-系统协同前沿技术研究-阿里星正在准备岗位码

微信小程序 · 当前岗位

请前往微信小程序提交内推申请

阿里巴巴千问Qwen训练算法-系统协同前沿技术研究-阿里星校招 · 北京、杭州、上海

01进入当前岗位扫码或打开后直达本岗位内推申请页。

02提交 PDF 简历简历替换、处理进度和消息提醒在小程序内同步。

手机端将尝试直接打开微信;电脑端请使用微信扫码。

微信扫码进入千问Qwen训练算法-系统协同前沿技术研究-阿里星内推申请页正在准备岗位码
当前岗位专属码扫码后无需重新搜索岗位保存小程序码

内推提示

暂不支持该岗位内推

如需投递,建议前往官网进行投递。