岗位职责
我们正在寻找对大模型在各种场景智能下的效能优化或智能体应用充满热情的优秀在读学生,参与大模型关键系统架构和场景化应用的前沿研究。你将深度参与千亿级大模型在复杂工业场景落地的“不可能三角”:高性能、低延迟、高自主性。 你将从以下四个核心应用方向中选择一个深入参与,开展系统性研究与工程实现:
- 面向自动驾驶/具身智能的端到端自动驾驶大模型训练优化:参与大规模分布式训练系统的性能分析与优化,包括数据并行、模型并行、流水线并行等策略的调优;参与自动驾驶核心模型(BEV、Transformer、Diffusion 等)中关键算子的性能 Profiling 与优化;基于 Transformer 架构的自动驾驶端到端模型(如 VLA,UniAD, VAD 等)的大规模预训练与微调,优化长序列感知与预测的对齐;
- 面向MoE大模型的训练推理优化:针对千亿级超大规模参数模型,深度参与类QWen/DeepSeek等MoE大模型的性能调优,研究 并行策略(张量、流水线、数据并行)下的通信重叠与显存优化;基于开源大模型推理引擎结合各类大模型和GPU/NPU等硬件,应用PD分离/DeepEP架构,探索高性能算子实现,结合编译优化,量化等手段提升模型推理性能;
- 图像视频与世界模型生成: 参与图像/视频生成模型(Diffusion Transformer、UNet、VAE、文本编码器等)的推理性能分析与端到端优化,提升生成速度与吞吐量;针对多步采样推理流程(DDPM / DDIM / Flow Matching 等)进行调度优化,探索步数压缩、缓存复用、投机采样等加速策略;协助构建推理性能基准测试体系,持续追踪优化效果;参与生成模型推理服务的工程化落地,包括多卡并行推理、动态 Batching、流式输出等方案的设计与实现;
- 大模型与推荐系统的融合创新,聚焦生成式算法或者推荐场景推理优化的研发:研究面向基于LLM的生成式召回技术,通过用户意图生成、Item ID/Title生成等方式,解决传统方法在语义鸿沟与长尾挖掘上的痛点,探索利用大模型直接生成召回和排序;针对生成式模型推理延迟高、资源消耗大的问题,研究算子优化能力、低精度计算、流式推理、投机采样等技术并应用模型推理技术。
职位要求
- 计算机科学、人工智能、电子工程等相关专业在读博士;
- 有 AI 算法/系统、高性能计算方向的顶会/顶刊论文发表;
- 扎实的 C/C++ 和 Python 编程能力,具备良好的代码工程素养;
- 熟悉 PyTorch,有实际模型训练或推理的项目经验;
- 每周至少实习 4 天,持续 3 个月以上。 加分项(满足任一即可)
- 有自动驾驶/图像/视频生成/推荐等领域相关项目经验者优先;
- 熟悉训练推理优化工具链(DeepSpeed / Megatron / TensorRT / ONNX Runtime / torch.compile),有实际加速经验;
- 有模型量化实践经验(GPTQ / AWQ / SmoothQuant / FP8 等),了解量化对生成质量的影响评估;
- 有推理引擎开发或大规模在线推理服务经验;
- 有 CUDA / Triton 算子开发经验,理解 GPU 架构(SM、Warp、共享内存、指令流水线等)。