岗位职责
- 参与大模型训练、推理、部署、调度、监控等基础设施建设。
- 优化模型推理性能、资源利用率、服务稳定性和成本效率。
- 参与GPU/NPU资源管理、分布式任务调度、模型服务化、缓存和并发优化。
- 支撑大模型应用、Agent平台、训练平台和评测平台的基础能力。
- 跟踪推理框架、训练框架、云原生和高性能计算方向的技术演进。
职位要求
- 本科及以上学历,计算机、软件工程、人工智能、自动化、电子信息等相关专业。
- 编程基础扎实,熟悉 C++、Python、Go、Rust 、Java中至少一门语言。
- 理解操作系统、计算机网络、分布式系统、数据库等基础知识。
- 对性能优化、系统稳定性、云原生、GPU计算或大模型部署有兴趣。
- 具备较强的问题定位和工程实现能力。 具有以下经验者优先
- 熟悉 Kubernetes、Docker、Ray、Slurm、Triton、vLLM、TensorRT等工具。
- 有CUDA、GPU编程、模型量化、推理加速经验。
- 参与过大模型部署、训练平台、推理服务或高并发系统项目。
- 了解MoE模型推理优化、KV Cache管理、Speculative Decoding等前沿方向者优先