岗位职责
- 负责集团 AI 模型平台核心能力建设,支撑文本或多模态大模型的预训练、后训练、线上推理服务和自动化实验迭代等关键场景。
- 面向自动化模型研发、推理和 AutoResearch 类场景,建设模型前后训练、推理、实验编排、结果分析、经验沉淀、策略推荐和下一轮实验规划能力,将模型研发和推理部署流程抽象为高效、稳定、可复用的平台能力。
- 参与后训练平台能力建设,支持 SFT、PPO、DPO、GRPO、OPD 等常见后训练算法和实验流程的工程化、平台化和自动化。
- 面向重点业务的大模型推理平台建设,打造统一的在线推理服务能力,覆盖文本、多模态等模型类型;建设统一推理网关,支持模型版本管理、灰度发布、流量调度与多租户隔离;持续优化推理吞吐(TPS)和首 token 延迟(TTFT),保障线上服务 SLA。
- 负责训练和推理基础设施的架构设计与核心技术攻坚,持续提升任务成功率、资源利用率、训练吞吐、推理性能和平台稳定性。
- 与算法、业务团队深度协作,围绕 AutoResearch、模型前后训练和文本/多模态大规模推理等方向,将前沿模型算法、低延迟推理链路和研发流程沉淀为标准化平台能力,推动能力在多业务、多模型场景中复用。
职位要求
- 计算机基础扎实,熟悉 Linux、分布式系统、网络、存储、数据库、并发编程和常用算法,具备复杂系统设计和问题排查能力。
- 精通 Python/Java/Golang/C++ 至少一门语言,具备良好的工程化实践,能够独立负责平台核心模块设计和落地。
- 熟悉 LLM、VLM、Diffusion/Flow Matching 等模型的基本结构、训练范式、数据组织方式、前后训练和评测流程,能够理解算法目标并转化为平台能力。
- 熟悉 SFT、PPO、DPO、GRPO、OPD 等常见后训练算法或训练策略,有实际训练、调参、数据构造或平台化落地经验。
- 熟悉 PyTorch、SGLang、vLLM 等模型训练与推理生态,具备分布式训练、推理服务部署、吞吐/时延优化、稳定性治理和 GPU 资源效率优化等模型工程经验。
- 熟悉 LLM 推理系统核心技术,包括 KV Cache 管理、PagedAttention、量化(INT4/INT8/FP8)、Continuous Batching、Speculative Decoding、Tensor/Pipeline Parallelism 等,有推理服务性能优化和线上稳定性治理经验者优先。
- 有多模态模型(VLM/图生视频/语音大模型等)推理服务落地经验,了解多模态输入的预处理 pipeline、异构计算调度与端到端延迟优化;或有大规模推理集群的容量规划、成本优化和 SLA 治理经验。
- 具备平台产品意识、技术判断力和跨团队协作能力,能够面向算法研发用户抽象通用能力,建设稳定、易用、可扩展的模型研发平台,并在算法快速演进和工程复杂度之间做出合理架构取舍。