岗位职责
- 建设AI算力池数据层,构建各类资源算力管理模型,研发Agent生产系统,与AI算力池的训推平台SRE各系统Agent联动,实现端到端自动化的TPM智能容量规划、弹性交付、需求应答、智能流量管控调度、自适应限流、资源高效流转腾挪,实现全局TPM利用率、单位算力Token成本的优化
- 建设单机和中心的管控Agent,实现模型的TPM运行时算力质量与性能自适应优化与SLA保障,解决模型部署运行时GPU/CPU/kv显存内存/PCIe互联/网络通信在通用与Scalup机型架构下的各类竞争与干扰,Agent具备端到端的问题识别发现、根因诊断、算力与性能优化、后训练Agentic RL反馈微调垂类模型等自动化闭环,增强Agent对模型运行时算力问题、性能瓶颈和优化策略的理解,自动识别并完成差异化硬件芯片架构、集群/网络/互联架构、系统软件栈如内核/编译下的软硬件结合优化、全局卡型模型最优匹配。
- 构建引擎架构与性能优化Agent,通过各类系统架构与性能优化,实现TPM性能与计算效率、各类模型与Agent能力体验大幅优化。典型如Agent自动优化推理引擎架构代码、训练系统架构代码、模型结构、AIData管线架构代码、Agent Infra架构代码、Agentic RL训推联动系统架构代码等
- 搭建多智能体协作框架,研究数十万智能体Agent的分工、协同、通信机制、后训练、反思与决策机制,提升各Agent系统在复杂场景下的鲁棒性、稳定性、执行效率与优化效果。
职位要求
- 计算机系统、人工智能、运筹统计与最优化理论、控制学相关领域博士研究生,或特别突出的硕士研究生,可连续实习6个月以上
- 前沿技术研究:跟进AI/Agent基础设施与系统架构、模型算法领域的最新SOTA研究成果,在资源管理与调度、系统/引擎架构与性能优化、模型结构等领域有突出成果,并在国际高水平的系统、算法顶会有学术论文发表
- 领域背景:深入理解 MaaS推理平台、Agent系统、推理引擎、模型训练(至少精通其一),对资源算力管理、AI Infra集群管理与调度、AI系统架构优化、AI模型训练与结构优化有较突出工作经验(至少其一)。
- 推理与Agent优化方向:具备推理引擎与Agent多智能体系统研发背景,具备强系统架构与工程能力,熟悉Harness工程如任务规划、工具调用、反思优化、分布式协、RAG/向量检索,及常见Agent框架如LangChain/LangGraph/AutoGen/CrewAI/Codex CLI,训练推理引擎框架如vLLM/SGLang/Megatron/OpenRLHF/Pytorch/TensorRT等;有开源项目代码贡献和相关项目经验者优先。
- 模型训练优化方向:具备LLM、多模态、世界模型等模型研发背景,熟悉业界大模型结构、后训练方法,精通算法研发、训练数据管线构建、模型自动评测。具备SFT、后训练RLHF/RLAIF/RLVF、RL DPO/PPO/GRPO 等一种或多种方法或算法实践经验,围绕业务目标构建训练数据集、奖励机制与评测体系。
- 优化方向:擅长利用数智驱动方式进行算力资源管理优化、全局最优匹配、模型运行时优化、各类引擎架构系统优化、软硬结合的优化等
- 加分技术领域背景:AI for System for AI背景,在超算、分布式系统、资源管理与调度、大模型训推研发、模型结构与模型网络架构设计(文本/多模态/世界模型)。熟悉CUDA、PTX等编译优化技术、GPU/TPU/NPU/各类CPU芯片软硬件架构栈等优先