岗位职责
要解决的问题:
- 基于 LLM 的高性能算子生成系统开发 面向阿里核心模型的训推场景,设计并开发 LLM-Driven 的异构GPU 高性能Kernel 的自动生成优化系统,结合目标芯片架构特性(如计算单元、存储层次、指令集、通信机制等),生成高性能的算子,并驱动Agent持续优化代码的性能(手段包括但不限于调度优化、编译优化,内存管理、并行计算,遗传算法,组合优化等等)。
- 模型后训练与 Agent 能力增强 构建面向高性能算子生成的数据闭环,设计并沉淀 SFT 数据集、偏好数据与 reward 机制;基于 SFT、RL 等后训练方法对模型进行微调,增强 Agent 对芯片约束、性能瓶颈和优化策略的理解,使其能够更稳定地生成高性能算子代码。
- 多智能体协同系统构建 搭建多智能体协作框架,实现需求理解、代码生成、错误修复、版本对比等任务的自动化闭环;研究智能体分工、通信、反思与决策机制,提升系统在复杂场景下的鲁棒性、生成效率与优化质量。
- 技术落地与前沿探索 与芯片、编译器和算子团队协作,结合具体硬件特性和业务场景推动技术落地;持续跟踪 LLM 代码生成、模型后训练、多智能体系统与 AI 编译优化等方向的前沿进展,并输出技术文档、专利或论文。
职位要求
我们期望你是:
- 计算机科学、电子工程、人工智能或相关领域博士研究生。
- 具备大语言模型及 Agent 系统开发经验,熟悉 Prompt Engineering、模型评测、RAG/向量检索及常见 Agent 框架;有代码生成相关项目经验者优先。
- 熟悉模型后训练方法,具备 SFT、RLHF/RLAIF、DPO/PPO/GRPO 等一种或多种方法的实践经验,能够围绕业务目标构建训练数据、奖励机制与评测体系。
- 熟悉 AI 芯片架构(如 GPU/NPU/TPU),掌握 CUDA、Triton、Cute、TilieLang 等至少一种算子编程技术,熟悉GPU常用优化方法。
- 具备多智能体系统开发经验,熟悉任务规划、工具调用、反思优化、分布式协作等机制;有 AutoGen、LangGraph、MetaGPT 等框架经验者优先。
- 扎实的编程能力,熟练使用 Python/C++,具备良好的系统设计与工程落地能力。
- 具备LLVM/MLIR/TVM等编译技术栈、高性能计算(HPC)、算子开发、自动代码优化或 AI 编译器相关经验者优先。
- 有训练数据构建、自动评测、模型迭代闭环建设经验者优先;有芯片软件栈、编译器或算子库实际落地经验者优先。