岗位职责
在这里,你将成为大模型技术落地的“幕后推手”。你将参与构建支撑千卡/万卡规模的 AI 计算基础设施,通过软硬件协同优化,解决大模型在训练、推理、调度全链路中的工程挑战。你的代码将直接决定大模型训练的效率、推理的响应速度以及集群资源的利用率,为 AI 时代的算力底座注入核心动力。 具体的职责包括以下相关方向的一项或多项: 训练基础设施与分布式框架
- 参与大模型预训练和后训练基础设施建设,优化分布式训练框架、并行策略、通信机制与底层算子性能,提升训练吞吐、稳定性与资源效率;
- 围绕数据加载、参数同步、容错恢复、任务编排与性能瓶颈进行系统优化,支撑千卡/万卡级集群上的高效训练。 RL 与数据链路系统
- 建设面向强化学习与后训练场景的 rollout、采样、反馈、偏好数据处理等关键链路,打通训练、推理、数据回流与评估闭环;
- 支持 RLHF、RLAIF 等训练范式在工程侧落地,提升实验迭代效率、链路稳定性与系统可观测性。 推理基础设施与服务优化
- 面向大规模推理场景研发高性能推理服务与推理引擎,围绕 kernel、算子、调度、缓存与服务架构进行优化,实现低延迟、高吞吐与高稳定性;
- 支撑多模型、多任务、多租户场景下的推理部署与性能调优,提升线上资源利用率与服务质量。 资源调度与集群系统
- 构建和优化面向 AI 计算场景的资源调度与任务编排系统,实现 GPU、CPU、网络、存储等资源的统一管理、弹性分配与自动化调度;
- 参与大规模 AI 集群运行体系建设,提升任务排布效率、资源利用率、隔离性与稳定性。 网络、存储与软硬件协同优化
- 设计与优化面向大模型训练和推理的高性能通信、存储与数据访问链路,解决大规模集群下的网络与 I/O 瓶颈;
- 结合 GPU、互联网络、存储介质与系统软件栈开展软硬件协同优化,持续提升整体系统性能。 大数据计算引擎与平台:
- 深入业务场景,帮助解决问题并发现通用需求,驱动计算平台研发,打造高效的分布式计算引擎;
- 从功能、稳定性、性能和易用性等多方面对计算引擎进行完善和优化。
职位要求
基础条件
- 计算机、软件工程、电子信息、自动化等相关专业优先;
- 有高性能系统、分布式系统、训练/推理框架或开源项目经验者优先。 专业能力
- 扎实的软件工程与系统能力,熟悉 Linux 开发环境,掌握 Python、C++、Go、Java 等至少一门语言;
- 熟悉分布式系统基本原理,理解一致性、容错、扩展性、任务调度等核心机制;
- 理解大模型训练、后训练或 RL 基本流程,了解 rollout、采样、反馈数据链路等机制;
- 熟悉主流训练或推理框架,如 PyTorch、DeepSpeed、Megatron-LM、vLLM、sglang 等;
- 有 GPU 优化、高性能网络、分布式存储、资源管理或软硬件协同经验者优先;
- 有大规模训练集群、推理服务或高性能系统工程经验者优先;
- 对大数据引擎和分布式技术有浓厚兴趣,熟悉Spark/Flink/Hadoop大数据体系,或者有OLAP引擎、湖仓表格式、列式存储、SQL查询优化、分布式系统Ray、向量化引擎Velox等任一开源项目源码经验者优先。 能力特质
- 乐于挑战复杂系统性能极限,具备良好的分析、定位与调优能力;
- 对 AI 基础设施和大模型系统有持续兴趣,能快速学习并推动落地;
- 具备跨团队协作能力,能够与算法、平台、产品等角色高效配合。